Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Durata 14 ore
Struttura del corso
Progettare un'architettura AIOps aperta
- Panoramica dei componenti chiave nei pipeline AIOps open source
- Flusso dei dati dall'ingestione all'allerta
- Confronto degli strumenti e strategia di integrazione
Raccolta e aggregazione dei dati
- Ingestione di dati in serie temporali con Prometheus
- Acquisizione dei log con Logstash e Beats
- Normalizzazione dei dati per la correlazione tra diverse fonti
Creare dashboard di osservabilità
- Visualizzazione delle metriche con Grafana
- Creazione di dashboard Kibana per l'analisi dei log
- Utilizzo delle query Elasticsearch per estrarre insight operativi
Rilevamento delle anomalie e previsione degli incidenti
- Esportazione dei dati di osservabilità nei pipeline Python
- Addestramento di modelli ML per il rilevamento degli outlier e le previsioni
- Deploy dei modelli per l'inferenza live nel pipeline di osservabilità
Allerta e automazione con strumenti open source
- Creazione di regole di allerta Prometheus e routing di Alertmanager
- Attivazione di script o flussi di lavoro API per la risposta automatica
- Utilizzo di strumenti di orchestrazione open source (ad es., Ansible, Rundeck)
Integrazione e considerazioni su scalabilità
- Gestione dell'ingestione ad alto volume e della conservazione a lungo termine
- Sicurezza e controllo degli accessi negli stack open source
- Scalabilità indipendente di ogni livello: ingestione, elaborazione, allerta
Applicazioni nel mondo reale ed estensioni
- Studi di caso: ottimizzazione delle prestazioni, prevenzione dei tempi di inattività e ottimizzazione dei costi
- Estensione dei pipeline con strumenti di tracciamento o grafici di servizio
- Buone pratiche per l'esecuzione e la manutenzione di AIOps in produzione
Riepilogo e prossimi passi
Requisiti
- Esperienza con strumenti di osservabilità come Prometheus o ELK
- Conoscenza operativa di Python e delle basi del machine learning
- Comprensione delle operazioni IT e dei flussi di lavoro per l'allerta
Pubblico target
- Ingegneri Site Reliability (SRE) avanzati
- Ingegneri dati operanti nel settore delle operazioni
- Responsabili di piattaforme DevOps e architetti infrastrutturali