Contattataci

Struttura del corso

Introduzione alla sintesi vocale e alla clonazione di voci

  • Panoramica sulla sintesi testo-voce e sui modelli di generazione vocale basati su reti neurali.
  • Differenze tra clonazione vocale e generazione autonoma del discorso: casi d’uso e ambiti applicativi.
  • I principali modelli utilizzati: Tacotron, WaveNet, FastSpeech, VITS.

Utilizzo delle piattaforme commerciali

  • Come impiegare ElevenLabs e Resemble AI per la creazione e modifica di voci artificiali.
  • Configurazione degli strumenti per ottenere il miglior risultato possibile.
  • Gestione delle API e flussi operativi legati alla sintesi testo-voce.

Sviluppo con strumenti open source

  • Installazione e configurazione di Coqui TTS per sviluppare soluzioni personalizzate.
  • Addestramento di modelli vocali su dati propri e gestione adeguata dei dataset.
  • Generazione di discorsi con controllo granulare riguardo al tono, alla velocità e alle emozioni espresse.

Preparazione dati e gestione dei dataset vocali

  • Raccolta ed elaborazione iniziale di campioni vocali per il training dei modelli.
  • Segmentazione, etichettatura e allineamento delle trascrizioni relative ai suoni.
  • Rispetto degli obblighi etici e legali in materia di autorizzazioni e consensi vocali.

Integrazione nei sistemi applicativi

  • Incorporazione della sintesi vocale nei siti web e nelle applicazioni software.
  • Realizzazione di sistemi IVR o bot interattivi dotati di voce artificiale.
  • Creazione di dialoghi sintetici per video, giochi o contenuti multimediali dinamici.

Valutazione della qualità e del realismo dei risultati

  • Test basati su MOS (Mean Opinion Score) per analizzare chiarezza e intelligibilità del discorso.
  • Regolazione di aspetti espressivi e prosodici durante la generazione vocale.
  • Confronto tra diverse soluzioni in termini di velocità, fedeltà sonora e naturalità.

Aspetti etici, legali e di governance

  • Rischi legati ai deepfake vocali e comportamenti responsabili da adottare nell’utilizzo.
  • Considerazioni riguardanti consenso, attribuzione dei meriti e diritti d’autore.
  • Normative vigenti a livello locale ed esigenze organizzative per un uso sicuro delle tecnologie.

Conclusioni e prossimi passi

Requisiti

  • Conoscenza di base dei principi fondamentali del machine learning
  • Familiarità con i formati di file audio e gli strumenti di modifica audio
  • Competenze di base nella programmazione in Python

Destinatari del corso

  • Sviluppatori e ingegneri AI interessati alla sintesi vocale.
  • Creatori di contenuti e specialisti multimediali che desiderano sperimentare nuove tecniche di generazione vocale.
  • Team di ricerca e sviluppo impegnati nella creazione di sistemi audio personalizzati o dinamici.
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative