Struttura del corso
Fondamenti della piattaforma Databricks e del Lakehouse
- Architettura e componenti del Databricks Lakehouse.
- Organizzazione degli spazi di lavoro e dei cataloghi.
Spazio di lavoro e notebook di Databricks
- Navigazione nello spazio di lavoro e sviluppo basato sui notebook.
- Strutturazione del codice in notebook riutilizzabili.
Architettura ed esecuzione di Apache Spark
- Architettura del runtime Spark e modello di esecuzione.
- Valutazione pigra (lazy evaluation) e DAG dei job.
DataFrame di PySpark e API DataFrame
- Astrazioni DataFrame e schemi.
- Operazioni core DataFrame ed espressioni sulle colonne.
Traduzione da SQL a DataFrame PySpark
- Traduzione delle clausole SQL core in operazioni DataFrame.
- Funzioni finestra e aggregazioni in PySpark.
Lettura e scrittura dei dati in Databricks
- Lettura da fonti di file e database comuni.
- Scrittura e partizionamento dei dati nel Lakehouse.
Delta Lake e gestione delle tabelle
- Tabelle Delta e transazioni ACID.
- Time travel ed evoluzione dello schema.
Pattern di pulizia e trasformazione dei dati
- Pulizia dei dati e conversione dei tipi.
- Costruzione di logica di trasformazione riutilizzabile.
Funzioni definite dall'utente (UDF) e codice modulare
- UDF Python e pandas UDF.
- Modularizzazione della logica procedurale in funzioni.
Ottimizzazione delle prestazioni
- Strategie di partizionamento e caching.
- Diagnostica dei colli di bottiglia con l'interfaccia utente Spark (Spark UI).
Fondamenti dellaStructured Streaming
- Modelli di elaborazione batch rispetto a streaming.
- DataFrame in streaming e aggregazioni base.
Job Databricks e orchestrazione dei workflow
- Pianificazione di notebook come job e attività.
- Creazione di workflow multi-step con dipendenze.
Unity Catalog e governance dei dati
- Architettura e namespace di Unity Catalog.
- Controllo degli accessi e lineage dei dati.
Testing, debugging e pratiche di produzione
- Unit testing della logica PySpark.
- Debugging e standard di qualità del codice.
Casi d'uso end-to-end nei servizi finanziari
- Costruzione di un pipeline ETL bancario end-to-end.
- Traduzione di processi SQL legacy in PySpark.
Migrazione dei carichi di lavoro SQL a PySpark
- Pattern di pianificazione e strategia di migrazione.
- Conversione incrementale dei workflow SQL in PySpark.
Requisiti
- Esperienza con la programmazione Python, incluse funzioni e tipi di dati.
- Conoscenza di SQL, inclusi join, aggregazioni e sottopreparazioni.
- Non è richiesta alcuna esperienza precedente con Databricks o PySpark.
Destinatari
- Ingegneri dei dati, analisti dati e professionisti del settore.
- Squadre che stanno migrando workflow basati su SQL verso Databricks e PySpark.
Recensioni (1)
Mi è piaciuto che fosse pratico. Ho adorato applicare le conoscenze teoriche con esempi pratici.
Aurelia-Adriana - Allianz Services Romania
Corso - Python and Spark for Big Data (PySpark)
Traduzione automatica