Contattataci

Struttura del corso

Introduzione:

  • Apache Spark nell'ecosistema Hadoop
  • Breve introduzione a Python e Scala

Fondamenti (teoria):

  • Architettura
  • RDD
  • Trasformazioni e Azioni
  • Stage, Task, Dipendenze

Utilizzo dell'ambiente Databricks per comprendere le basi (workshop pratico):

  • Esercitazioni con l'API RDD
  • Funzioni base per azioni e trasformazioni
  • PairRDD
  • Join
  • Strategie di caching
  • Esercitazioni con l'API DataFrame
  • SparkSQL
  • DataFrame: select, filter, group, sort
  • UDF (Funzione Definibile dall'Utente)
  • Approfondimento dell'API DataSet
  • Streaming

Utilizzo dell'ambiente AWS per comprendere il deployment (workshop pratico):

  • Fondamenti di AWS Glue
  • Comprensione delle differenze tra AWS EMR e AWS Glue
  • Esempi di job in entrambi gli ambienti
  • Analisi dei pro e dei contro

Extra:

  • Introduzione all'orchestrazione con Apache Airflow

Requisiti

Competenze di programmazione (preferibilmente Python e Scala)

Basi di SQL

 21 ore

Numero di Partecipanti


Prezzo per partecipante

Recensioni (3)

Corsi in Arrivo

Categorie relative