Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Introduzione all’IA multimodale
- Cos’è l’IA multimodale?
- Principali sfide e applicazioni possibili
- Presentazione dei principali modelli multimodali esistenti
Elaborazione del testo e comprensione del linguaggio naturale
- Utilizzo degli LLM per la creazione di agenti IA basati su testo
- Nozioni fondamentali sull’ingegneria dei prompt per compiti multimodali
- Tecniche di ottimizzazione dei modelli testuali per contesti specifici
Riconoscimento e generazione di immagini
- Elaborazione delle immagini tramite l’IA: classificazione, descrizione automatica e rilevamento degli oggetti
- Generazione di immagini mediante modelli basati su diffusione (ad esempio Stable Diffusion, DALL-E)
- Integrazione dei dati visivi nei sistemi basati sul testo
Elaborazione del suono e della voce
- Riconoscimento vocale tramite Whisper ASR
- Tecniche di sintesi del parlato da testo (TTS)
- Miglioramento dell’interazione utente grazie all’utilizzo di agenti vocali
Integrazione delle informazioni multimodali
- Costruzione di pipeline IA in grado di elaborare diversi tipi di input simultaneamente
- Metodi per la fusione di dati testuali, visivi e sonori
- Esempi pratici di applicazioni reali degli agenti IA multimodali
Distribuzione degli agenti IA multimodali
- Creazione di soluzioni basate su API per l’utilizzo di agenti IA multimodali
- Ottimizzazione dei modelli in termini di prestazioni e scalabilità
- Best practice per la messa in produzione degli agenti IA multimodali
Considerazioni etiche e prospettive future
- Bias e equità nell’utilizzo dell’IA multimodale
- Questioni legate alla privacy nei sistemi che elaborano dati multimodali
- Sviluppi futuri nell’ambito dell’IA multimodale
Riassunto e prossimi passi da intraprendere
Requisiti
- Conoscenza di base dei concetti fondamentali del machine learning
- Esperienza nella programmazione in Python
- Familiarità con i framework di deep learning (ad esempio TensorFlow, PyTorch)
Destinatari del corso
- Sviluppatori IA
- Ricercatori
- Ingegneri multimediali
21 ore