Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Introduzione:
- Apache Spark nell'ecosistema Hadoop
- Breve introduzione a Python e Scala
Fondamenti (teoria):
- Architettura
- RDD
- Trasformazioni e Azioni
- Stage, Task, Dipendenze
Utilizzo dell'ambiente Databricks per comprendere le basi (workshop pratico):
- Esercitazioni con l'API RDD
- Funzioni base per azioni e trasformazioni
- PairRDD
- Join
- Strategie di caching
- Esercitazioni con l'API DataFrame
- SparkSQL
- DataFrame: select, filter, group, sort
- UDF (Funzione Definibile dall'Utente)
- Approfondimento dell'API DataSet
- Streaming
Utilizzo dell'ambiente AWS per comprendere il deployment (workshop pratico):
- Fondamenti di AWS Glue
- Comprensione delle differenze tra AWS EMR e AWS Glue
- Esempi di job in entrambi gli ambienti
- Analisi dei pro e dei contro
Extra:
- Introduzione all'orchestrazione con Apache Airflow
Requisiti
Competenze di programmazione (preferibilmente Python e Scala)
Basi di SQL
21 ore
Recensioni (3)
Avere sessioni pratiche/compiti
Poornima Chenthamarakshan - Intelligent Medical Objects
Corso - Apache Spark in the Cloud
Traduzione automatica
1. Bilanciamento equilibrato tra concetti di alto livello e dettagli tecnici. 2. Andras è molto competente nella sua insegnanza. 3. Esercizio
Steven Wu - Intelligent Medical Objects
Corso - Apache Spark in the Cloud
Traduzione automatica
Iscriviti per imparare Spark Streaming, Databricks e AWS Redshift
Lim Meng Tee - Jobstreet.com Shared Services Sdn. Bhd.
Corso - Apache Spark in the Cloud
Traduzione automatica