Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Introduzione all’AIOps predittivo
- Panoramica sull’utilizzo dell’analisi predittiva nelle operazioni IT
- Fonti di dati utilizzabili per le previsioni (log, metriche, eventi)
- Concetti chiave relativi alla previsione temporale e al rilevamento di pattern anomali
Progettazione di modelli predittivi per gli incidenti
- Etichettatura dei dati storici relativi a incidenti e al comportamento dei sistemi
- Scelta e addestramento dei modelli (ad esempio LSTM, Random Forest, AutoML)
- Valutazione delle prestazioni del modello e gestione dei falsi positivi
Raccolta dati ed elaborazione delle feature
- Inserimento e allineamento di dati da log e metriche affinché possano essere utilizzati nei modelli
- Estrazione di feature da dati sia strutturati che non strutturati
- Gestione del rumore e dei dati mancanti nei flussi operativi
Automazione dell’analisi delle cause alla base (RCA)
- Correlazione grafica tra servizi e infrastrutture
- Utilizzo del machine learning per identificare le probabili cause partendo dalle catene di eventi
- Visualizzazione dei risultati dell’analisi tramite dashboard che tengono conto della topologia del sistema
Correzione e automazione dei flussi di lavoro
- Integrazione con piattaforme di automazione (ad esempio Ansible, Rundeck)
- Avvio automatico di operazioni come rollback, riavvii o reindirizzamento del traffico
- Registrazione e documentazione delle azioni automatizzate eseguite
Scalabilità delle pipeline AIOps intelligenti
- MLOps per la gestione dell’osservabilità: aggiornamento e versionamento dei modelli
- Esecuzione di previsioni in tempo reale su nodi distribuiti all’interno della rete
- Best practice per l’implementazione efficace di soluzioni AIOps in ambiente produttivo
Case study e applicazioni pratiche
- Analisi reale di dati relativi a incidenti tramite modelli AIOps predittivi
- Implementazione di pipeline RCA utilizzando sia dati sintetici che reali provenienti dalla produzione
- Analisi di esempi concreti tratti dal settore: interruzioni nei servizi cloud, instabilità dei microservizi e degradazioni delle reti
Sintesi e prossimi passi
Requisiti
- Esperienza nell’utilizzo di sistemi di monitoraggio come Prometheus o ELK
- Conoscenza pratica di Python e delle nozioni di base del machine learning
- Familiarità con i flussi di lavoro legati alla gestione degli incidenti
Pubblico destinatario
- Ingegneri Senior di affidabilità dei sistemi (SRE)
- Architetti dell’automazione IT
- Responsabili DevOps e piattaforme di osservabilità
14 ore