Contattataci

Struttura del corso

Introduzione ai modelli multimodali Mistral

  • Panoramica di Mistral Medium e capacità multimodali
  • Modelli OCR/documenti e casi d'uso
  • Integrazione con ecosistemi open source

Pipeline di OCR e Vision

  • Fondamenti dell'OCR con i modelli Mistral
  • Preprocessing di immagini e documenti scansionati
  • Estrazione di testo strutturato dalle immagini

Comprensione dei documenti

  • Progettazione di pipeline NLP per documenti
  • Riconoscimento delle entità, riassunti e classificazione
  • Collegamento cross-modale di dati testuali e visivi

Applicazioni di ricerca e conoscenza

  • Sistemi di ricerca vision-testo
  • Creazione di ricerche semantiche con output OCR
  • Repository di documenti enterprise

Applicazioni assistive e interattive

  • Progettazione di UI per assistenti multimodali
  • Applicazioni per l'accessibilità (es. da visione a testo)
  • Strumenti di produttività per il mondo reale

Prestazioni e ottimizzazione

  • Scalabilità delle pipeline multimodali
  • Ottimizzazione delle prestazioni di inferenza
  • Valutazione dei compromessi tra accuratezza ed efficienza

Studi di caso e direzioni future

  • Applicazioni industriali dell'IA multimodale
  • Tendenze di ricerca in OCR e document AI
  • Considerazioni sulla IA responsabile nei task vision-testo

Riepilogo e prossimi passi

Requisiti

  • Una comprensione dei concetti di elaborazione del linguaggio naturale
  • Esperienza con Python e framework ML
  • Familiarità con le basi della computer vision

Pubblico

  • Team di prodotto
  • Ricercatori ML
  • Ingegneri ML applicativi
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative