Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Introduzione alla sintesi vocale e alla clonazione di voci
- Panoramica sulla sintesi testo-voce e sui modelli di generazione vocale basati su reti neurali.
- Differenze tra clonazione vocale e generazione autonoma del discorso: casi d’uso e ambiti applicativi.
- I principali modelli utilizzati: Tacotron, WaveNet, FastSpeech, VITS.
Utilizzo delle piattaforme commerciali
- Come impiegare ElevenLabs e Resemble AI per la creazione e modifica di voci artificiali.
- Configurazione degli strumenti per ottenere il miglior risultato possibile.
- Gestione delle API e flussi operativi legati alla sintesi testo-voce.
Sviluppo con strumenti open source
- Installazione e configurazione di Coqui TTS per sviluppare soluzioni personalizzate.
- Addestramento di modelli vocali su dati propri e gestione adeguata dei dataset.
- Generazione di discorsi con controllo granulare riguardo al tono, alla velocità e alle emozioni espresse.
Preparazione dati e gestione dei dataset vocali
- Raccolta ed elaborazione iniziale di campioni vocali per il training dei modelli.
- Segmentazione, etichettatura e allineamento delle trascrizioni relative ai suoni.
- Rispetto degli obblighi etici e legali in materia di autorizzazioni e consensi vocali.
Integrazione nei sistemi applicativi
- Incorporazione della sintesi vocale nei siti web e nelle applicazioni software.
- Realizzazione di sistemi IVR o bot interattivi dotati di voce artificiale.
- Creazione di dialoghi sintetici per video, giochi o contenuti multimediali dinamici.
Valutazione della qualità e del realismo dei risultati
- Test basati su MOS (Mean Opinion Score) per analizzare chiarezza e intelligibilità del discorso.
- Regolazione di aspetti espressivi e prosodici durante la generazione vocale.
- Confronto tra diverse soluzioni in termini di velocità, fedeltà sonora e naturalità.
Aspetti etici, legali e di governance
- Rischi legati ai deepfake vocali e comportamenti responsabili da adottare nell’utilizzo.
- Considerazioni riguardanti consenso, attribuzione dei meriti e diritti d’autore.
- Normative vigenti a livello locale ed esigenze organizzative per un uso sicuro delle tecnologie.
Conclusioni e prossimi passi
Requisiti
- Conoscenza di base dei principi fondamentali del machine learning
- Familiarità con i formati di file audio e gli strumenti di modifica audio
- Competenze di base nella programmazione in Python
Destinatari del corso
- Sviluppatori e ingegneri AI interessati alla sintesi vocale.
- Creatori di contenuti e specialisti multimediali che desiderano sperimentare nuove tecniche di generazione vocale.
- Team di ricerca e sviluppo impegnati nella creazione di sistemi audio personalizzati o dinamici.
14 ore