Contattataci

Struttura del corso

Fondamenti della piattaforma Databricks e del Lakehouse

  • Architettura e componenti del Databricks Lakehouse.
  • Organizzazione degli spazi di lavoro e dei cataloghi.

Spazio di lavoro e notebook di Databricks

  • Navigazione nello spazio di lavoro e sviluppo basato sui notebook.
  • Strutturazione del codice in notebook riutilizzabili.

Architettura ed esecuzione di Apache Spark

  • Architettura del runtime Spark e modello di esecuzione.
  • Valutazione pigra (lazy evaluation) e DAG dei job.

DataFrame di PySpark e API DataFrame

  • Astrazioni DataFrame e schemi.
  • Operazioni core DataFrame ed espressioni sulle colonne.

Traduzione da SQL a DataFrame PySpark

  • Traduzione delle clausole SQL core in operazioni DataFrame.
  • Funzioni finestra e aggregazioni in PySpark.

Lettura e scrittura dei dati in Databricks

  • Lettura da fonti di file e database comuni.
  • Scrittura e partizionamento dei dati nel Lakehouse.

Delta Lake e gestione delle tabelle

  • Tabelle Delta e transazioni ACID.
  • Time travel ed evoluzione dello schema.

Pattern di pulizia e trasformazione dei dati

  • Pulizia dei dati e conversione dei tipi.
  • Costruzione di logica di trasformazione riutilizzabile.

Funzioni definite dall'utente (UDF) e codice modulare

  • UDF Python e pandas UDF.
  • Modularizzazione della logica procedurale in funzioni.

Ottimizzazione delle prestazioni

  • Strategie di partizionamento e caching.
  • Diagnostica dei colli di bottiglia con l'interfaccia utente Spark (Spark UI).

Fondamenti dellaStructured Streaming

  • Modelli di elaborazione batch rispetto a streaming.
  • DataFrame in streaming e aggregazioni base.

Job Databricks e orchestrazione dei workflow

  • Pianificazione di notebook come job e attività.
  • Creazione di workflow multi-step con dipendenze.

Unity Catalog e governance dei dati

  • Architettura e namespace di Unity Catalog.
  • Controllo degli accessi e lineage dei dati.

Testing, debugging e pratiche di produzione

  • Unit testing della logica PySpark.
  • Debugging e standard di qualità del codice.

Casi d'uso end-to-end nei servizi finanziari

  • Costruzione di un pipeline ETL bancario end-to-end.
  • Traduzione di processi SQL legacy in PySpark.

Migrazione dei carichi di lavoro SQL a PySpark

  • Pattern di pianificazione e strategia di migrazione.
  • Conversione incrementale dei workflow SQL in PySpark.

Requisiti

  • Esperienza con la programmazione Python, incluse funzioni e tipi di dati.
  • Conoscenza di SQL, inclusi join, aggregazioni e sottopreparazioni.
  • Non è richiesta alcuna esperienza precedente con Databricks o PySpark.

Destinatari

  • Ingegneri dei dati, analisti dati e professionisti del settore.
  • Squadre che stanno migrando workflow basati su SQL verso Databricks e PySpark.
 35 ore

Numero di Partecipanti


Prezzo per partecipante

Recensioni (1)

Corsi in Arrivo

Categorie relative