Contattataci
 Durata 14 ore (2 giorni)

Struttura del corso

Panoramica delle tecnologie di riconoscimento vocale

  • Storia ed evoluzione del riconoscimento vocale
  • Modelli acustici, modelli linguistici e decodifica
  • Architetture moderne: RNN, transformer e Whisper

Pre-elaborazione audio e basi della trascrizione

  • Gestione dei formati audio e dei tassi di campionamento
  • Pulizia, ritaglio e segmentazione dell'audio
  • Generazione di testo dall'audio: tempo reale vs batch

Approccio pratico con Whisper e altre API

  • Installazione e utilizzo di OpenAI Whisper
  • Chiamata di API cloud (Google, Azure) per la trascrizione
  • Confronto di prestazioni, latenza e costi

Lingue, accenti e adattamento di dominio

  • Lavorare con più lingue e accenti
  • Vocabolari personalizzati e tolleranza al rumore
  • Gestione del linguaggio legale, medico o tecnico

Formattazione dell'output e integrazione

  • Aggiunta di timestamp, punteggiatura e etichette dei relatori
  • Esportazione in formati testo, SRT o JSON
  • Integrazione delle trascrizioni in app o database

Laboratori per l'implementazione di casi d'uso

  • Trascrizione di riunioni, interviste o podcast
  • Sistemi di comandi da voce a testo
  • Sottotitoli in tempo reale per flussi video/audio

Valutazione, limiti ed etica

  • Metriche di accuratezza e benchmark dei modelli
  • Bias ed equità nei modelli vocali
  • Considerazioni su privacy e conformità

Riepilogo e prossimi passi

Requisiti

  • Comprensione dei concetti generali di AI e machine learning
  • Familiarità con i formati di file audio o multimediali e con gli strumenti correlati

Pubblico target

  • Data scientist e ingegneri AI che lavorano con dati vocali
  • Sviluppatori software che creano applicazioni basate sulla trascrizione
  • Organizzazioni che esplorano il riconoscimento vocale per l'automazione

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative