Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Panoramica sulle tecnologie di riconoscimento vocale
- Storia e sviluppo storico del riconoscimento vocale
- Modelli acustici, modelli linguistici e processi di decodifica
- Architetture moderne: RNN, transformer e Whisper
Pre-elaborazione audio e fondamenti della trascrizione
- Gestione dei formati audio e delle frequenze di campionamento
- Pulizia, ritaglio e suddivisione del materiale audio
- Generazione del testo a partire dall’audio: analisi in tempo reale e elaborazione batch
Esercitazioni pratiche con Whisper e altre API
- Installazione e utilizzo di OpenAI Whisper
- Utilizzo delle API cloud (Google, Azure) per la trascrizione vocale
- Confronto tra prestazioni, latenza e costi dei vari servizi
Gestione di più lingue, accenti e settori tematici specifici
- Lavorare con contenuti in svariate lingue e caratterizzati da diversi accenti
- Implementazione di vocabolari personalizzati e miglioramento della tolleranza al rumore
- Trattamento dei testi appartenenti a ambiti legali, medici o tecnici
Formattazione dei risultati e integrazione nei sistemi
- Aggiunta di timestamp, punteggiatura ed etichette identificative dei parlanti
- Esportazione dei dati in formato testuale, SRT o JSON
- Integrazione delle trascrizioni all’interno di applicazioni software e database
Laboratori per l’applicazione pratica dei concetti appresi
- Trascrizione di riunioni, interviste o podcast
- Sistemi di comando vocale trasformato in testo scritto
- Creazione di sottotitoli in tempo reale per flussi video e audio
Valutazione delle prestazioni, limiti tecnici ed aspetti etici
- Metriche di accuratezza e comparazione dei modelli utilizzati
- Distorsioni e discriminazioni presenti nei modelli vocali
- Temi legati alla privacy, sicurezza e conformità normativa
Riepilogo conclusivo e prospettive future
Requisiti
- Conoscenza di base dei concetti fondamentali relativi all’intelligenza artificiale e al machine learning
- Familiarità con i formati e gli strumenti utilizzati per l’elaborazione di file audio o multimediali
Destinatari del corso
- Data scientist ed ingegneri AI specializzati nella gestione di dati vocali
- Sviluppatori software impegnati nella creazione di applicazioni basate sulla trascrizione vocale
- Aziende e organizzazioni interessate all’adozione del riconoscimento vocale per finalità automatizzative
14 ore