Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Durata 21 ore
Struttura del corso
Fondamenti della classificazione audio
- Tipi di eventi sonori: ambientali, meccanici, generati dall'uomo
- Panoramica dei casi d'uso: sorveglianza, monitoraggio, automazione
- Classificazione audio vs rilevamento vs segmentazione
Dati audio ed estrazione delle caratteristiche
- Tipi e formati di file audio
- Tasso di campionamento, windowing, considerazione della dimensione del frame
- Estrazione di MFCC, caratteristiche cromatiche, mel-spettrograms
Preparazione dei dati e annotazione
- Dataset UrbanSound8K, ESC-50 e personalizzati
- Etichettatura degli eventi sonori e dei confini temporali
- Bilanciamento dei dataset e aumento dei dati audio (data augmentation)
Costruzione di modelli di classificazione audio
- Utilizzo di reti neurali convolutive (CNN) per l'audio
- Input del modello: forma d'onda grezza vs caratteristiche estratte
- Funzioni di perdita, metriche di valutazione e overfitting
Rilevamento degli eventi e localizzazione temporale
- Strategie di rilevamento basate su frame e segmenti
- Post-elaborazione dei rilevamenti utilizzando soglie e smoothing
- Visualizzazione delle previsioni su timeline audio
Argomenti avanzati ed elaborazione in tempo reale
- Transfer learning per scenari con pochi dati
- Distribuzione dei modelli con TensorFlow Lite o ONNX
- Elaborazione audio in streaming e considerazione della latenza
Sviluppo del progetto e scenari applicativi
- Progettazione di una pipeline completa: dall'ingestione alla classificazione
- Sviluppo di un proof-of-concept per sorveglianza, controllo qualità o monitoraggio
- Logging, allerte e integrazione con dashboard o API
Riepilogo e prossimi passi
Requisiti
- Conoscenza dei concetti di machine learning e dell'addestramento dei modelli
- Esperienza nella programmazione Python e nella preelaborazione dei dati
- Familiarità con le basi dell'audio digitale
Pubblico target
- Data scientist
- Ingegneri del machine learning
- Ricercatori e sviluppatori di elaborazione dei segnali audio