Contattataci

Struttura del corso

Introduzione alla multimodalità di Gemini 3

  • Capacità del modello in relazione a testo, immagini, audio e video
  • Scelta del modello e panoramica sugli endpoint disponibili
  • Concetti fondamentali dell’elaborazione multimodale

Lavorare con testo e input strutturati

  • Strategie di impostazione dei prompt per la generazione di testo
  • Utilizzo di metadati, finestre contestuali ed embedding
  • Coordinamento di operazioni multimodali basate su testo

Comprensione delle immagini e flussi di lavoro visivi

  • Analisi e interpretazione di immagini tramite Gemini 3
  • Realizzazione di strumenti per la ricerca e l’etichettatura visiva
  • Creazione di interazioni tra testo e immagini, sia in entrata che in uscita

Elaborazione degli input audio

  • Workflow di riconoscimento vocale e trascrizione
  • Rilevamento e interpretazione di eventi sonori
  • Integrazione dell’audio con input testuali e visivi

Intelligenza video e analisi delle scene

  • Analisi sequenziale dei frame e interpretazione continua di video
  • Realizzazione di strumenti per la sintesi di contenuti video e l’estrazione di momenti significativi
  • Automazione basata su video e gestione dei flussi di lavoro multimediali

Progettazione di architetture applicative multimodali

  • Integrazione di più tipologie di input in un’unica pipeline
  • Considerazioni riguardanti latenza, costi e risorse computazionali
  • Linee guida per la realizzazione di sistemi multimodali scalabili

Prototipazione di applicazioni multimodali

  • Creazione pratica di prototipi basati su più modalità di input
  • Iterazione rapida tramite ottimizzazione dei prompt
  • Verifica e perfezionamento della user experience generata dai sistemi sviluppati

Implementazione di soluzioni multimodali in produzione

  • Strategie e configurazioni per il deployment
  • Monitoraggio delle performance nell’ambiente reale
  • Aspetti legati alla sicurezza e al rispetto delle normative applicabili

Conclusioni e prossimi passi

Requisiti

  • Conoscenza dei principali concetti legati all’intelligenza artificiale moderna
  • Esperienza nell’utilizzo di Python o JavaScript
  • Familiarità con le API REST

Destinatari

  • Progettisti
  • Creatori di contenuti
  • Team tecnici impegnati nello sviluppo di prodotti
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Recensioni (1)

Corsi in Arrivo

Categorie relative