Contattataci

Struttura del corso

Introduzione all’AIOps predittivo

  • Panoramica sull’utilizzo dell’analisi predittiva nelle operazioni IT
  • Fonti di dati utilizzabili per le previsioni (log, metriche, eventi)
  • Concetti chiave relativi alla previsione temporale e al rilevamento di pattern anomali

Progettazione di modelli predittivi per gli incidenti

  • Etichettatura dei dati storici relativi a incidenti e al comportamento dei sistemi
  • Scelta e addestramento dei modelli (ad esempio LSTM, Random Forest, AutoML)
  • Valutazione delle prestazioni del modello e gestione dei falsi positivi

Raccolta dati ed elaborazione delle feature

  • Inserimento e allineamento di dati da log e metriche affinché possano essere utilizzati nei modelli
  • Estrazione di feature da dati sia strutturati che non strutturati
  • Gestione del rumore e dei dati mancanti nei flussi operativi

Automazione dell’analisi delle cause alla base (RCA)

  • Correlazione grafica tra servizi e infrastrutture
  • Utilizzo del machine learning per identificare le probabili cause partendo dalle catene di eventi
  • Visualizzazione dei risultati dell’analisi tramite dashboard che tengono conto della topologia del sistema

Correzione e automazione dei flussi di lavoro

  • Integrazione con piattaforme di automazione (ad esempio Ansible, Rundeck)
  • Avvio automatico di operazioni come rollback, riavvii o reindirizzamento del traffico
  • Registrazione e documentazione delle azioni automatizzate eseguite

Scalabilità delle pipeline AIOps intelligenti

  • MLOps per la gestione dell’osservabilità: aggiornamento e versionamento dei modelli
  • Esecuzione di previsioni in tempo reale su nodi distribuiti all’interno della rete
  • Best practice per l’implementazione efficace di soluzioni AIOps in ambiente produttivo

Case study e applicazioni pratiche

  • Analisi reale di dati relativi a incidenti tramite modelli AIOps predittivi
  • Implementazione di pipeline RCA utilizzando sia dati sintetici che reali provenienti dalla produzione
  • Analisi di esempi concreti tratti dal settore: interruzioni nei servizi cloud, instabilità dei microservizi e degradazioni delle reti

Sintesi e prossimi passi

Requisiti

  • Esperienza nell’utilizzo di sistemi di monitoraggio come Prometheus o ELK
  • Conoscenza pratica di Python e delle nozioni di base del machine learning
  • Familiarità con i flussi di lavoro legati alla gestione degli incidenti

Pubblico destinatario

  • Ingegneri Senior di affidabilità dei sistemi (SRE)
  • Architetti dell’automazione IT
  • Responsabili DevOps e piattaforme di osservabilità
 14 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative