Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Introduzione ai modelli multimodali Mistral
- Panoramica di Mistral Medium e capacità multimodali
- Modelli OCR/documenti e casi d'uso
- Integrazione con ecosistemi open source
Pipeline di OCR e Vision
- Fondamenti dell'OCR con i modelli Mistral
- Preprocessing di immagini e documenti scansionati
- Estrazione di testo strutturato dalle immagini
Comprensione dei documenti
- Progettazione di pipeline NLP per documenti
- Riconoscimento delle entità, riassunti e classificazione
- Collegamento cross-modale di dati testuali e visivi
Applicazioni di ricerca e conoscenza
- Sistemi di ricerca vision-testo
- Creazione di ricerche semantiche con output OCR
- Repository di documenti enterprise
Applicazioni assistive e interattive
- Progettazione di UI per assistenti multimodali
- Applicazioni per l'accessibilità (es. da visione a testo)
- Strumenti di produttività per il mondo reale
Prestazioni e ottimizzazione
- Scalabilità delle pipeline multimodali
- Ottimizzazione delle prestazioni di inferenza
- Valutazione dei compromessi tra accuratezza ed efficienza
Studi di caso e direzioni future
- Applicazioni industriali dell'IA multimodale
- Tendenze di ricerca in OCR e document AI
- Considerazioni sulla IA responsabile nei task vision-testo
Riepilogo e prossimi passi
Requisiti
- Una comprensione dei concetti di elaborazione del linguaggio naturale
- Esperienza con Python e framework ML
- Familiarità con le basi della computer vision
Pubblico
- Team di prodotto
- Ricercatori ML
- Ingegneri ML applicativi
14 ore