Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Durata 14 ore
Struttura del corso
Introduzione alla multimodalità di Gemini 3
- Capacità nel testo, nelle immagini, nell'audio e nel video
- Selezione del modello e panoramica degli endpoint
- Concetti chiave nel ragionamento multimodale
Lavorare con testo e input strutturati
- Strategie di prompting per la generazione di testo
- Metadati, finestre di contesto e embedding
- Orchestrazione di attività multimodali basata su testo
Comprensione delle immagini e flussi di lavoro visivi
- Analisi e interpretazione delle immagini con Gemini 3
- Creazione di strumenti di ricerca visiva e tagging
- Interazioni da immagine a testo e da testo a immagine
Elaborazione di input audio
- Flussi di lavoro di riconoscimento vocale e trascrizione
- Rilevamento e interpretazione di eventi audio
- Integrazione dell'audio con input testuali e visivi
Intelligenza del video e analisi delle scene
- Ragionamento sul video frame per frame e continuo
- Creazione di strumenti per la sintesi e l'estrazione degli highlights
- Automazione basata su video e flussi di contenuti
Progettazione di architetture per applicazioni multimodali
- Combinazione di più tipi di input in un'unica pipeline
- Considerazioni su latenza, costi e risorse computazionali
- Best practice per sistemi multimodali scalabili
Prototipazione di applicazioni multimodali
- Creazione pratica di prototipi multimodali
- Iterazione rapida con prompt engineering
- Testing e raffinamento dei flussi di esperienza utente
Implementazione di soluzioni multimodali
- Strategie di deployment e configurazione dell'ambiente
- Monitoraggio delle prestazioni in ambienti reali
- Considerazioni su sicurezza e conformità
Riepilogo e Prossimi Passi
Requisiti
- Comprensione dei concetti di AI moderna
- Esperienza con Python o JavaScript
- Conoscenza delle API REST
Pubblico di Riferimento
- Designer
- Creativi di contenuti
- Team di prodotto tecnici
Recensioni (1)
Flusso, atmosfera e argomento della presentazione
Lukasz Kowalczyk - Allegro Sp. z o.o.
Corso - Google Gemini AI for Data Analysis
Traduzione automatica