Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Durata 14 ore (2 giorni)
Struttura del corso
Panoramica delle tecnologie di riconoscimento vocale
- Storia ed evoluzione del riconoscimento vocale
- Modelli acustici, modelli linguistici e decodifica
- Architetture moderne: RNN, transformer e Whisper
Pre-elaborazione audio e basi della trascrizione
- Gestione dei formati audio e dei tassi di campionamento
- Pulizia, ritaglio e segmentazione dell'audio
- Generazione di testo dall'audio: tempo reale vs batch
Approccio pratico con Whisper e altre API
- Installazione e utilizzo di OpenAI Whisper
- Chiamata di API cloud (Google, Azure) per la trascrizione
- Confronto di prestazioni, latenza e costi
Lingue, accenti e adattamento di dominio
- Lavorare con più lingue e accenti
- Vocabolari personalizzati e tolleranza al rumore
- Gestione del linguaggio legale, medico o tecnico
Formattazione dell'output e integrazione
- Aggiunta di timestamp, punteggiatura e etichette dei relatori
- Esportazione in formati testo, SRT o JSON
- Integrazione delle trascrizioni in app o database
Laboratori per l'implementazione di casi d'uso
- Trascrizione di riunioni, interviste o podcast
- Sistemi di comandi da voce a testo
- Sottotitoli in tempo reale per flussi video/audio
Valutazione, limiti ed etica
- Metriche di accuratezza e benchmark dei modelli
- Bias ed equità nei modelli vocali
- Considerazioni su privacy e conformità
Riepilogo e prossimi passi
Requisiti
- Comprensione dei concetti generali di AI e machine learning
- Familiarità con i formati di file audio o multimediali e con gli strumenti correlati
Pubblico target
- Data scientist e ingegneri AI che lavorano con dati vocali
- Sviluppatori software che creano applicazioni basate sulla trascrizione
- Organizzazioni che esplorano il riconoscimento vocale per l'automazione