Contattataci

Struttura del corso

Introduzione ai Modelli Visione-Linguaggio

  • Cenni sui VLM e il loro ruolo nell’intelligenza artificiale multimodale.
  • Architetture più utilizzate: CLIP, Flamingo, BLIP, ecc.
  • Casi d’uso: ricerca, generazione di descrizioni, sistemi autonomi, analisi dei contenuti.

Preparazione dell’Ambiente di Ottimizzazione

  • Configurazione di OpenCLIP e altre librerie VLM.
  • Formati dei set di dati per coppie immagine-testo.
  • Pipelines di pre-elaborazione per input visivi e testuali.

Ottimizzazione di CLIP e Modelli Simili

  • Funzione di perdita contrastiva e spazi di embedding congiunti.
  • Esercitazioni pratiche: ottimizzazione di CLIP su set di dati personalizzati.
  • Gestione dei dati settoriali e multilingue.

Tecniche Avanzate di Ottimizzazione

  • Utilizzo di metodi come LoRA e adattatori per incrementare l’efficienza computativa.
  • Ottimizzazione tramite prompt e iniezione di prompt visivi.
  • Confronto tra prestazioni dei modelli addestrati da zero rispetto a quelli ottimizzati.

Valutazione e Benchmarking

  • Metriche per i VLM: precisione nel recupero, BLEU, CIDEr, capacità di richiamo.
  • Analisi dell’allineamento tra elementi visivi e testuali.
  • Visualizzazione degli spazi di embedding e analisi degli errori di classificazione.

Implementazione nei Sistemi Reali

  • Esportazione dei modelli per l’inferenza (TorchScript, ONNX).
  • Integrazione dei VLM in pipeline o API aziendali.
  • Considerazioni sui requisiti hardware e scalabilità dei modelli.

Casi di Studio ed Applicazioni Pratiche

  • Analisi mediatica e moderazione dei contenuti.
  • Ricerca e recupero in contesti di e-commerce e archivi digitali.
  • Interazione multimodale nell’ambito della robotica e dei sistemi autonomi.

Riepilogo e Passi Futuri

Requisiti

  • Conoscenze avanzate di apprendimento profondo applicato alla visione artificiale e all’elaborazione del linguaggio naturale.
  • Esperienza pratica nell’utilizzo di PyTorch e modelli basati su trasformatori.
  • Familiarità con le architetture dei modelli multimodali.

Destinatari

  • Ingegneri esperti in visione artificiale.
  • Sviluppatori di intelligenza artificiale.
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative