Struttura del corso
Introduzione
Comprendere i Big Data
Panoramica di Spark
Panoramica di Python
Panoramica di PySpark
- Distribuzione dei dati utilizzando il framework Resilient Distributed Datasets
- Distribuzione del calcolo utilizzando gli operatori dell'API di Spark
Configurazione di Python con Spark
Configurazione di PySpark
Utilizzo delle istanze Amazon Web Services (AWS) EC2 per Spark
Configurazione di Databricks
Configurazione del cluster AWS EMR
Apprendere le basi della programmazione in Python
- Iniziare con Python
- Utilizzo di Jupyter Notebook
- Utilizzo di variabili e semplici tipi di dati
- Lavorare con liste
- Utilizzo di istruzioni if
- Utilizzo di input dell'utente
- Lavorare con cicli while
- Implementazione di funzioni
- Lavorare con classi
- Lavorare con file ed eccezioni
- Lavorare con progetti, dati e API
Apprendere le basi di Spark DataFrame
- Iniziare con Spark DataFrames
- Implementazione di operazioni di base con Spark
- Utilizzo di operazioni Groupby e di aggregazione
- Lavorare con timestamp e date
Lavorare su un esercizio di progetto con Spark DataFrame
Comprendere il Machine Learning con MLlib
Lavorare con MLlib, Spark e Python per il Machine Learning
Comprendere le regressioni
- Apprendimento della teoria della regressione lineare
- Implementazione di un codice per la valutazione della regressione
- Lavoro su un esercizio di regressione lineare di esempio
- Apprendimento della teoria della regressione logistica
- Implementazione di un codice per la regressione logistica
- Lavoro su un esercizio di regressione logistica di esempio
Comprendere Random Forest e alberi decisionali
- Apprendimento della teoria dei metodi degli alberi
- Implementazione di codici per alberi decisionali e Random Forest
- Lavoro su un esercizio di classificazione Random Forest di esempio
Lavorare con il clustering K-means
- Comprendere la teoria del clustering K-means
- Implementazione di un codice per il clustering K-means
- Lavoro su un esercizio di clustering di esempio
Lavorare con sistemi di raccomandazione
Implementazione del Natural Language Processing
- Comprendere il Natural Language Processing (NLP)
- Panoramica degli strumenti NLP
- Lavoro su un esercizio NLP di esempio
Streaming con Spark su Python
- Panoramica dello streaming con Spark
- Esercizio di streaming Spark di esempio
Requisiti
- Competenze generali nella programmazione
Pubblico
- Sviluppatori
- Professionisti IT
- Data Scientist
Recensioni (6)
Mi è piaciuto che fosse pratico. Ho adorato applicare le conoscenze teoriche con esempi pratici.
Aurelia-Adriana - Allianz Services Romania
Corso - Python and Spark for Big Data (PySpark)
Traduzione automatica
Il corso ha affrontato una serie di argomenti molto complessi e interconnessi, e Pablo possiede un'ampia competenza su ognuno di essi. A volte le sfumature andavano perdute nella comunicazione e/o a causa delle pressioni temporali, il che potrebbe aver portato a una non completa soddisfacione delle aspettative. Inoltre ci sono state alcune problematiche con la configurazione di UHG/Azure Databricks, ma Pablo e UHG le hanno risolte rapidamente non appena sono emerse - questo per me ha dimostrato un alto livello di comprensione e professionalità tra UHG e Pablo,
Michael Monks - Tech NorthWest Skillnet
Corso - Python and Spark for Big Data (PySpark)
Traduzione automatica
Attenzione individuale.
ARCHANA ANILKUMAR - PPL
Corso - Python and Spark for Big Data (PySpark)
Traduzione automatica
Formazione pratica..
Abraham Thomas - PPL
Corso - Python and Spark for Big Data (PySpark)
Traduzione automatica
Le lezioni sono state tenute in un notebook Jupyter. Gli argomenti erano strutturati con una sequenza logica e naturalmente hanno aiutato a sviluppare la sessione dalle parti più semplici a quelle più complesse. Essendo già un utente avanzato di Python con una formazione in Machine Learning, ho trovato il corso più facile da seguire rispetto a alcuni miei compagni di classe che hanno frequentato il corso di formazione. Apprezzo il fatto che alcuni dei concetti più elementari siano stati saltati e che si sia concentrato sui punti più sostanziali.
Angela DeLaMora - ADT, LLC
Corso - Python and Spark for Big Data (PySpark)
Traduzione automatica
compiti di esercitazione
Pawel Kozikowski - GE Medical Systems Polska Sp. Zoo
Corso - Python and Spark for Big Data (PySpark)
Traduzione automatica