Contattataci

Struttura del corso

Introduzione ad Apache Airflow

  • Cos'è l'orchestrazione dei flussi di lavoro
  • Funzionalità principali e vantaggi di Apache Airflow
  • Miglioramenti di Airflow 2.x e panoramica dell'ecosistema

Architettura e concetti fondamentali

  • Processi di schedulatore, server web e worker
  • DAG, task e operatori
  • Esecutori e backend (Local, Celery, Kubernetes)

Installazione e configurazione

  • Installazione di Airflow in ambienti locali e cloud
  • Configurazione di Airflow con diversi esecutori
  • Configurazione di database di metadati e connessioni

Navigazione nell'interfaccia UI e CLI di Airflow

  • Esplorazione dell'interfaccia web di Airflow
  • Monitoraggio di run di DAG, task e log
  • Utilizzo della CLI di Airflow per l'amministrazione

Creazione e gestione di DAG

  • Creazione di DAG con la TaskFlow API
  • Utilizzo di operatori, sensori e hook
  • Gestione delle dipendenze e degli intervalli di pianificazione

Integrazione di Airflow con servizi di dati e cloud

  • Connessione a database, API e code di messaggi
  • Esecuzione di pipeline ETL con Airflow
  • Integrazioni cloud: operatori per AWS, GCP, Azure

Monitoraggio e osservabilità

  • Log dei task e monitoraggio in tempo reale
  • Metriche con Prometheus e Grafana
  • Allerte e notifiche tramite email o Slack

Sicurezza di Apache Airflow

  • Controllo degli accessi basato sui ruoli (RBAC)
  • Autenticazione con LDAP, OAuth e SSO
  • Gestione dei segreti con Vault e archivi segreti cloud

Scalabilità di Apache Airflow

  • Parallelismo, concorrenza e code dei task
  • Utilizzo di CeleryExecutor e KubernetesExecutor
  • Implementazione di Airflow su Kubernetes con Helm

Best practice per la produzione

  • Controllo delle versioni e CI/CD per DAG
  • Test e debug di DAG
  • Mantenimento di affidabilità e prestazioni su larga scala

Troubleshooting e ottimizzazione

  • Debug di DAG e task non riusciti
  • Ottimizzazione delle prestazioni di DAG
  • Errori comuni e come evitarli

Riepilogo e passi successivi

Requisiti

  • Esperienza nella programmazione Python
  • Familiarità con i concetti di data engineering o DevOps
  • Comprensione di ETL o orchestrazione dei flussi di lavoro

Pubblico target

  • Data scientist
  • Data engineer
  • Ingegneri DevOps e di infrastruttura
  • Sviluppatori software
 21 ore

Numero di Partecipanti


Prezzo per partecipante

Recensioni (7)

Corsi in Arrivo

Categorie relative