Contattataci

Struttura del corso

Introduzione all’Apprendimento per Rinforzo a Partire da Feedback Umano (RLHF)

  • Cosa si intende per RLHF e perché è così rilevante
  • Confronto con i metodi di ottimizzazione supervisionata
  • Applicazioni del RLHF nei sistemi di intelligenza artificiale moderni

Modellazione della ricompensa tramite feedback umano

  • Raccolta e organizzazione dei feedback forniti da persone
  • Sviluppo ed addestramento di modelli di ricompensa
  • Valutazione dell’efficacia dei modelli di ricompensa creati

Addestramento tramite l’Algoritmo Proximal Policy Optimization (PPO)

  • Panoramica sugli algoritmi PPO utilizzati nell’ambito del RLHF
  • Implementazione pratica di PPO in abbinamento ai modelli di ricompensa
  • Ottimizzazione iterativa e sicura dei modelli attraverso il metodo PPO

Ottimizzazione pratica dei modelli linguistici<\/p>

  • Preparazione di set di dati adatti ai flussi di lavoro RLHF
  • Esercitazioni dirette sull’ottimizzazione di un piccolo modello linguistico tramite il RLHF
  • Analisi delle problematiche ricorrenti e strategie per risolverle

Scalabilità del RLHF in sistemi di produzione

  • Aspetti infrastrutturali e computazionali da considerare
  • Controllo della qualità e meccanismi di feedback continuo
  • Linee guida per un corretto deployment e la manutenzione dei sistemi AI

Aspetti etici e gestione dei bias

  • Rischi etici legati all’utilizzo di feedback umani
  • Strumenti per rilevare e correggere eventuali distorsioni nei modelli
  • Modi per garantire l’allineamento dei risultati con i principi di sicurezza e responsabilità<\/li>

Casi studio ed esempi reali

  • Caso studio: Ottimizzazione di ChatGPT tramite RLHF
  • Altre applicazioni di successo del RLHF nel settore AI
  • Insegnamenti e osservazioni derivanti da esperienze pratiche nel campo

Sintesi finale e prospettive future

Requisiti

  • Conoscenza dei concetti fondamentali dell’apprendimento supervisionato e per rinforzo
  • Esperienza nella ottimizzazione di modelli e nelle architetture di reti neurali
  • Buona padronanza della programmazione in Python e dei framework per il deep learning (ad esempio TensorFlow, PyTorch)

Destinatari del corso

  • Ingegneri del machine learning
  • Ricercatori di intelligenza artificiale
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative