Struttura del corso
1. Introduzione al Deep Reinforcement Learning
- Cos'è il Reinforcement Learning?
- Differenza tra apprendimento supervisionato, non supervisionato e reinforcement learning
- Applicazioni del DRL nel 2025 (robotica, sanità, finanza, logistica)
- Comprensione del ciclo di interazione agente-ambiente
2. Fondamenti del Reinforcement Learning
- Processi di Decisione di Markov (MDP)
- Stato, Azione, Ricompensa, Politica e funzioni di Valore
- Compromesso tra Esplorazione e Sfruttamento (Exploration vs. Exploitation)
- Metodi Monte Carlo e apprendimento Temporal-Difference (TD)
3. Implementazione di algoritmi RL di base
- Metodi tabulari: Programmazione Dinamica, Valutazione della Politica e Iterazione
- Q-Learning e SARSA
- Esplorazione epsilon-greedy e strategie di decadimento
- Implementazione di ambienti RL con OpenAI Gymnasium
4. Passaggio al Deep Reinforcement Learning
- Limitazioni dei metodi tabulari
- Utilizzo delle reti neurali per l'approssimazione delle funzioni
- Architettura e flusso di lavoro di Deep Q-Network (DQN)
- Experience replay e reti target
5. Algoritmi DRL avanzati
- Double DQN, Dueling DQN e Prioritized Experience Replay
- Metodi di Policy Gradient: algoritmo REINFORCE
- Architetture Actor-Critic (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Gestione degli spazi di azioni continue
- Sfide nel controllo continuo
- Utilizzo di DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Strumenti e framework pratici
- Utilizzo di Stable-Baselines3 e Ray RLlib
- Registrazione e monitoraggio con TensorBoard
- Tuning degli iperparametri per i modelli DRL
8. Progettazione delle ricompense e degli ambienti
- Reward shaping e bilanciamento delle penalità
- Concetti di trasferimento dall'apprendimento simulato al reale (sim-to-real)
- Creazione di ambienti custom in Gymnasium
9. Ambienti parzialmente osservabili e generalizzazione
- Gestione di informazioni di stato incomplete (POMDP)
- Approcci basati sulla memoria utilizzando LSTMs e RNNs
- Miglioramento della robustezza e della capacità di generalizzazione degli agenti
10. Teoria dei giochi e Reinforcement Learning multi-agente
- Introduzione agli ambienti multi-agente
- Cooperazione vs. competizione
- Applicazioni nell'addestramento avversariale e nell'ottimizzazione delle strategie
11. Studi di caso e applicazioni nel mondo reale
- Simulazioni di guida autonoma
- Prezzi dinamici e strategie di trading finanziario
- Robotica e automazione industriale
12. Risoluzione dei problemi e ottimizzazione
- Diagnosi di addestramenti instabili
- Gestione della scarsità delle ricompense e dell'overfitting
- Scaling dei modelli DRL su GPU e sistemi distribuiti
13. Riepilogo e prossimi passi
- Ripasso dell'architettura DRL e degli algoritmi chiave
- Tendenze del settore e direzioni di ricerca (ad es., RLHF, modelli ibridi)
- Ulteriori risorse e materiale di lettura
Requisiti
- Padronanza della programmazione in Python
- Conoscenza del Calcolo e dell'Algebra Lineare
- Conoscenze di base della Probabilità e della Statistica
- Esperienza nella costruzione di modelli di machine learning utilizzando Python e NumPy o TensorFlow/PyTorch
Pubblico Target
- Sviluppatori interessati all'IA e ai sistemi intelligenti
- Data Scientist che esplorano i framework di reinforcement learning
- Ingegneri del Machine Learning che lavorano con sistemi autonomi
Recensioni (3)
Mi è davvero piaciuta la parte finale in cui abbiamo avuto il tempo di esplorare CHAT GPT. La sala non era impostata nel modo migliore per questo - sarebbe stato utile avere alcune piccole tavole invece di una grande, così da poter formare gruppi più piccoli e fare brainstorming.
Nola - Laramie County Community College
Corso - Artificial Intelligence (AI) Overview
Traduzione automatica
Lavorare partendo dai principi fondamentali in modo concentrato, e passare all'applicazione di casi pratici nello stesso giorno
Maggie Webb - Department of Jobs, Regions, and Precincts
Corso - Artificial Neural Networks, Machine Learning, Deep Thinking
Traduzione automatica
Stava utilizzando dati reali di una società. Il formatore aveva un approccio molto efficace, coinvolgendo i partecipanti e incentivando la competizione
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Corso - Applied AI from Scratch in Python
Traduzione automatica