Contattataci

Struttura del corso

Introduzione alla sintesi vocale e alla clonazione della voce

  • Panoramica su text-to-speech (TTS) e sintesi vocale neurale
  • Clonazione vocale vs generazione del parlato: casi d'uso e limiti
  • Principali modelli: Tacotron, WaveNet, FastSpeech, VITS

Lavorare con piattaforme commerciali

  • Utilizzo di ElevenLabs e Resemble AI
  • Creazione, clonazione e editing della voce
  • Accesso alle API e flussi di lavoro text-to-speech

Sviluppo con strumenti open-source

  • Installazione e configurazione di Coqui TTS
  • Addestramento di voci personalizzate e gestione dei dataset
  • Generazione del parlato con controllo fine (altezza, velocità, emozione)

Preparazione dei dati e gestione dei dataset vocali

  • Raccolta e pulizia dei campioni vocali
  • Segmentazione, etichettatura e allineamento dei trascritti
  • Raccolta etica dei dati e consenso vocale

Integrazione nelle applicazioni

  • Incorporazione di TTS in siti web e applicazioni
  • Creazione di sistemi IVR e bot interattivi
  • Generazione di dialoghi sintetici per video e giochi

Valutazione della qualità e del realismo

  • MOS (Mean Opinion Score) e test di intelligibilità
  • Controllo di espressività e prosodia
  • Confronto di latenza, fedeltà e realismo

Considerazioni etiche, legali e di governance

  • Rischi legati ai deepfake e uso responsabile
  • Conseguenze legate al consenso, all'attribuzione e al diritto d'autore
  • Normative e politiche aziendali

Riepilogo e prossimi passi

Requisiti

  • Conoscenza dei fondamenti del machine learning
  • Familiarità con i formati di file audio e gli strumenti di editing
  • Competenze base nella programmazione Python

Target

  • Sviluppatori e ingegneri AI interessati alla sintesi vocale
  • Creator di contenuti e tecnologhi media che esplorano la generazione vocale
  • Team di R&D che sviluppano sistemi audio personalizzati o dinamici
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative