Contattataci

Struttura del corso

Panoramica sulle tecnologie di riconoscimento vocale

  • Storia e sviluppo storico del riconoscimento vocale
  • Modelli acustici, modelli linguistici e processi di decodifica
  • Architetture moderne: RNN, transformer e Whisper

Pre-elaborazione audio e fondamenti della trascrizione

  • Gestione dei formati audio e delle frequenze di campionamento
  • Pulizia, ritaglio e suddivisione del materiale audio
  • Generazione del testo a partire dall’audio: analisi in tempo reale e elaborazione batch

Esercitazioni pratiche con Whisper e altre API

  • Installazione e utilizzo di OpenAI Whisper
  • Utilizzo delle API cloud (Google, Azure) per la trascrizione vocale
  • Confronto tra prestazioni, latenza e costi dei vari servizi

Gestione di più lingue, accenti e settori tematici specifici

  • Lavorare con contenuti in svariate lingue e caratterizzati da diversi accenti
  • Implementazione di vocabolari personalizzati e miglioramento della tolleranza al rumore
  • Trattamento dei testi appartenenti a ambiti legali, medici o tecnici

Formattazione dei risultati e integrazione nei sistemi

  • Aggiunta di timestamp, punteggiatura ed etichette identificative dei parlanti
  • Esportazione dei dati in formato testuale, SRT o JSON
  • Integrazione delle trascrizioni all’interno di applicazioni software e database

Laboratori per l’applicazione pratica dei concetti appresi

  • Trascrizione di riunioni, interviste o podcast
  • Sistemi di comando vocale trasformato in testo scritto
  • Creazione di sottotitoli in tempo reale per flussi video e audio

Valutazione delle prestazioni, limiti tecnici ed aspetti etici

  • Metriche di accuratezza e comparazione dei modelli utilizzati
  • Distorsioni e discriminazioni presenti nei modelli vocali
  • Temi legati alla privacy, sicurezza e conformità normativa

Riepilogo conclusivo e prospettive future

Requisiti

  • Conoscenza di base dei concetti fondamentali relativi all’intelligenza artificiale e al machine learning
  • Familiarità con i formati e gli strumenti utilizzati per l’elaborazione di file audio o multimediali

Destinatari del corso

  • Data scientist ed ingegneri AI specializzati nella gestione di dati vocali
  • Sviluppatori software impegnati nella creazione di applicazioni basate sulla trascrizione vocale
  • Aziende e organizzazioni interessate all’adozione del riconoscimento vocale per finalità automatizzative
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative