Corso di formazione Streaming di dati e elaborazione in tempo reale
Panoramica del corso
Questo corso offre una introduzione pratica e strutturata alla creazione di sistemi di streaming di dati in tempo reale. Vengono trattati i concetti fondamentali, gli schemi architetturali e gli strumenti utilizzati a livello industriale per gestire grandi quantità di dati in continuo flusso. I partecipanti impareranno a progettare, implementare e ottimizzare pipeline di streaming tramite framework moderni. Il corso si sviluppa partendo da nozioni di base fino ad arrivare ad applicazioni concrete, consentendo agli studenti di realizzare in modo autonomo soluzioni operative e affidabili per l’elaborazione in tempo reale.
Modalità formativa
• Lezioni guidate dall’istruttore con spiegazioni chiare
• Approfondimenti teorici accompagnati da esempi concreti tratti dalla realtà lavorativa
• Dimostrazioni pratiche ed esercizi di programmazione
• Laboratori progressivi in linea con gli argomenti affrontati ogni giorno
• Discussioni interattive e sessioni di domande e risposte
Obiettivi del corso
• Comprendere i concetti fondamentali dello streaming di dati in tempo reale e la relativa architettura dei sistemi
• Distinguere tra modelli di elaborazione batch e di streaming
• Progettare pipeline scalabili e resilienti agli errori
• Utilizzare correttamente strumenti e framework distribuiti per lo streaming
• Applicare tecniche di elaborazione basate sull’ora di evento, finestre temporali e operazioni con stato persistente
Realizzare e ottimizzare soluzioni di elaborazione dati in tempo reale adatte alle esigenze aziendali
Struttura del corso
Svolgimento del corso – Giorno 1
• Introduzione ai concetti chiave dello streaming di dati
• Nozioni base sull’elaborazione batch e in tempo reale
• Fondamenti dell’architettura event-driven
• Applicazioni pratiche dello streaming nel settore industriale
• Presentazione generale dell’ecosistema di streaming
Giorno 2
• Schemi architetturali per la progettazione dei sistemi di streaming
• Concetti base sui sistemi di messaggistica distribuita
• Produttori e consumatori di dati
• Argomenti, partizionamento e flusso dei dati
• Strategie per l’ingestione dei dati
Giorno 3
• Concetti e framework di elaborazione dello streaming
• Differenze tra ora dell’evento e tempo di elaborazione
• Tecniche e casi d’uso legati alle finestre temporali
• Elaborazione di flussi con stato persistente
• Nozioni base su tolleranza agli errori e checkpointing
Giorno 4
• Trasformazioni dei dati all’interno delle pipeline di streaming
• ETL ed ELT nei sistemi operativi in tempo reale
• Gestione e aggiornamento degli schemi dati
• Unioni tra flussi di dati e arricchimento delle informazioni
• Introduzione ai servizi cloud dedicati allo streaming
Giorno 5
• Monitoraggio e tracciabilità dei sistemi di streaming
• Principi di base sulla sicurezza e sui controlli di accesso
• Ottimizzazione delle prestazioni e regolazione dei parametri
• Revisione della progettazione end-to-end di una pipeline
• Esempi pratici tratti da contesti reali, tra cui il rilevamento delle frodi e l’elaborazione dei dati provenienti da dispositivi IoT
I corsi di formazione interaziendali richiedono più di 5 partecipanti.
Corso di formazione Streaming di dati e elaborazione in tempo reale - Prenotazione
Corso di formazione Streaming di dati e elaborazione in tempo reale - Richiesta
Streaming di dati e elaborazione in tempo reale - Richiesta di consulenza
Recensioni (2)
Un viaggio attraverso il mondo di Spark: un corso molto intenso. DSL, Spark SQL, partizionamento rispetto al bucketing per me.
Georgiana Elisabeta
Corso - Apache Spark Fundamentals
Traduzione automatica
Esercizi pratici. La classe sarebbe dovuta durare 5 giorni, ma i 3 giorni sono stati sufficienti per chiarire molte delle domande che avevo lavorando con NiFi.
James - BHG Financial
Corso - Apache NiFi for Administrators
Traduzione automatica
Corsi in Arrivo
Corsi relativi
Apache Iceberg avanzato
21 oreQuesto corso dal vivo tenuto da istruttori in Italia (online o in sede) è rivolto a professionisti dei dati con competenze avanzate, che desiderano ottimizzare i processi di elaborazione e garantire la qualità e integrità dei dati implementando soluzioni affidabili per l’analisi su larga scala.
Alla fine del corso, i partecipanti saranno in grado di:
- Comprendere a fondo l’architettura di Iceberg, inclusa la gestione dei metadati e la struttura dei file.
- Configurare Iceberg per ottimizzare le prestazioni in diversi ambienti ed integrarlo con molteplici motori di elaborazione dati.
- Gestire tabelle Iceberg su larga scala, applicare modifiche complesse agli schemi e gestire l’evoluzione delle partizioni.
- Padroneggiare tecniche utili a migliorare le prestazioni delle query e l’efficienza nella lettura di enormi volumi di dati.
- Implementare misure per assicurare la coerenza dei dati, gestire correttamente le transazioni e superare eventuali problemi negli ambienti distribuiti.
Fondamenti di Apache Iceberg
14 oreQuesto corso formativo, tenuto da un istruttore ed erogato in modalità live Italia (in presenza o online), si rivolge a professionisti del settore a livello principiante che desiderano acquisire le conoscenze e le competenze necessarie per utilizzare efficacemente Apache Iceberg nella gestione di dataset su larga scala, nel mantenimento dell’integrità dei dati e nell’ottimizzazione dei flussi di elaborazione.
Al termine del corso, i partecipanti saranno in grado di:
- Comprendere a fondo l’architettura, le caratteristiche e i vantaggi offerti da Apache Iceberg.
- Conoscere i formati tabellari, la partizionamento, l’evoluzione degli schemi e le funzionalità di “time travel”.
- Installare e configurare Apache Iceberg in diversi ambienti.
- Creare, gestire e manipolare tabelle Iceberg.
- Comprendere i processi di migrazione dei dati da altri formati tabellari ad Apache Iceberg.
Analisi dei Big Data con Google Colab e Apache Spark
14 oreQuesto corso pratico, tenuto da un istruttore <in loc> (online o in presenza), si rivolge a data scientist ed ingegneri di livello intermedio che desiderano utilizzare Google Colab e Apache Spark per l’elaborazione e l’analisi dei big data.
Al termine del corso, i partecipanti saranno in grado di:
- Configurare un ambiente per l’elaborazione dei big data tramite Google Colab e Spark.
- Elaborare e analizzare in modo efficiente grandi quantità di dati con Apache Spark.
- Visualizzare i dati di grandi dimensioni all’interno di un ambiente collaborativo.
- Integrare Apache Spark con strumenti basati sul cloud.
Intelligenza aziendale basata sui big data per le agenzie governative
35 oreI progressi tecnologici e l’aumento costante della quantità di informazioni stanno trasformando i modelli operativi in numerosi settori, incluso quello pubblico. La produzione di dati governativi e la digitalizzazione degli archivi sono in forte crescita grazie alla diffusione capillare di dispositivi mobili, applicazioni, sensori intelligenti, soluzioni di cloud computing e portali accessibili ai cittadini. Con l’espansione e la crescente complessità delle informazioni digitali, anche le attività legate alla gestione, all’elaborazione, allo storage, alla sicurezza e alla conservazione dei dati si fanno più complesse. Nuovi strumenti per la raccolta, la ricerca, la scoperta e l’analisi permettono ora alle organizzazioni di estrarre informazioni significative anche da dati non strutturati. Il settore pubblico si trova oggi a una svolta: le istituzioni stanno comprendendo che i dati costituiscono un asset strategico e che devono proteggerli, utilizzarli al meglio ed analizzarli sia nella forma strutturata sia non strutturata per servire efficacemente la collettività e raggiungere gli obiettivi istituzionali. Mentre i dirigenti governativi si impegnano a trasformare le proprie organizzazioni in entità basate sui dati, stanno gettando le basi per individuare relazioni complesse tra eventi, persone, processi e informazioni.
Soluzioni di alto valore per la Pubblica Amministrazione potranno nascere dall’integrazione delle tecnologie più innovative:
- Dispositivi mobili e applicazioni
- Servizi cloud
- Tecnologie aziendali sociali e reti di collaborazione
- Big Data e analisi dati
I big data rappresentano una delle soluzioni strategiche per il settore pubblico, consentendo di adottare decisioni più informate grazie all’analisi di enormi quantità di dati – correlati o meno, strutturati o non strutturati.
Tuttavia, per raggiungere tali risultati non basta semplicemente accumulare grandi volumi di dati. "Per comprendere a fondo queste enormi quantità di big data sono necessari strumenti e tecnologie all’avanguardia in grado di analizzare e estrarre conoscenze utili da flussi informativi eterogenei", hanno scritto Tom Kalil e Fen Zhao dell’Ufficio per la Scienza e la Tecnologia della Casa Bianca nel loro blog.
La Casa Bianca ha dato un contributo significativo in questo senso nel 2012, istituendo l’Iniziativa Nazionale di Ricerca e Sviluppo sui Big Data; tale iniziativa ha stanziato oltre 200 milioni di dollari per valorizzare le potenzialità dei big data e sviluppare strumenti idonei alla loro analisi.
Le sfide legate ai big data sono pari, in difficoltà, alle opportunità che offrono. Una di queste è lo storage efficiente: considerando i bilanci governativi solitamente limitati, le agenzie devono contenere il costo per megabyte e garantire un accesso immediato ai dati da parte degli utenti. L’operazione di backup su larga scala rende ulteriormente complesso questo processo.
Un’altra grande sfida è l’analisi dei dati: molte agenzie utilizzano strumenti commerciali per gestire e analizzare montagne di informazioni, individuando trend che consentono un funzionamento più efficiente. Secondo uno studio recente realizzato da MeriTalk, i dirigenti IT federali ritengono che l’impiego dei big data possa permettere alle agenzie di risparmiare oltre 500 miliardi di dollari e allo stesso tempo raggiungere con successo i propri obiettivi istituzionali.
Alcune agenzie hanno sviluppato internamente strumenti specifici per l’analisi dei dati: ad esempio, il Gruppo di Analisi Dati Computazionali del Laboratorio Nazionale di Oak Ridge ha messo a disposizione di altre istituzioni il sistema Piranha; esso ha aiutato i ricercatori medici a identificare un indicatore predittivo per gli aneurismi dell’aorta, e viene impiegato anche in attività più ordinarie come la selezione dei candidati lavorativi mediante l’esame dei curricula.
Introduzione pratica all'analisi dei dati e al Big Data - 3 giorni
21 oreI partecipanti che completano questo corso formativo in diretta tenuto da un istruttore Italia otterranno una comprensione concreta e applicabile del Big Data, nonché delle tecnologie, metodologie e strumenti ad esso correlati.
Avranno l’opportunità di applicare tali nozioni attraverso esercizi pratici; inoltre, l’interazione tra i partecipanti e il feedback dell’istruttore sono componenti essenziali del percorso formativo.
Il corso si apre con una introduzione ai concetti di base del Big Data, proseguendo poi con i linguaggi di programmazione e le metodologie impiegate nell’analisi dei dati. Si tratteranno infine gli strumenti e le infrastrutture che consentono l’archiviazione, l’elaborazione distribuita e la scalabilità del Big Data.
Big Data e Analisi Avanzata
42 oreIl Big Data e l’Analisi Avanzata consistono nell’applicazione di tecniche e strumenti sofisticati per analizzare insiemi di dati estesi e complessi, al fine di ottenere informazioni utili e supportare le decisioni strategiche.
Questo corso formativo, tenuto da istruttori ed erogato in modalità online o in presenza, si rivolge a professionisti del settore dati di livello avanzato che desiderano sfruttare metodologie analitiche all’avanguardia e tecnologie legate al Big Data per eseguire analisi predittive, prescrittive e in tempo reale.
Al termine del corso, i partecipanti saranno in grado di:
- Progettare e implementare pipeline di elaborazione dati su larga scala, sia per dati strutturati che non strutturati.
- Applicare tecniche avanzate di machine learning e deep learning a insiemi di dati di grandi dimensioni.
- Sfruttare framework di calcolo distribuito per analisi in tempo reale e flussi di dati continui.
- Integrare le tecnologie di Big Data Analytics nei sistemi di business intelligence e presa delle decisioni.
Struttura del corso
- Lezioni interattive e discussioni guidate.
- Numerosi esercizi pratici per consolidare le conoscenze.
- Implementazione diretta in un ambiente di laboratorio reale.
Opzioni di personalizzazione del corso
- Per richiedere una formazione su misura, vi invitiamo a contattarci per concordare i dettagli.
Apache NiFi per amministratori
21 oreApache NiFi è una piattaforma open source basata su flussi per l’integrazione dei dati e l’elaborazione degli eventi. Consente il instradamento automatico e in tempo reale dei dati, la loro trasformazione nonché la mediazione tra sistemi eterogenei, tutto grazie a un’interfaccia utente web altamente configurabile.
Questo corso pratico e guidato da istruttore (in sede o a distanza) è rivolto ad amministratori ed ingegneri di livello intermedio che desiderano implementare, gestire, proteggere e ottimizzare i flussi di dati in ambienti di produzione tramite NiFi.
Alla fine del corso i partecipanti saranno in grado di:
- Installare, configurare e mantenere cluster di Apache NiFi.
- Progettare e gestire flussi dati provenienti da fonti diverse e indirizzati verso destinazioni varie.
- Implementare logiche di automazione, instradamento e trasformazione dei dati nei flussi.
- Ottimizzare le prestazioni, monitorare l’operatività e risolvere eventuali problemi.
Formato del corso
- Lezioni interattive con analisi di architetture reali.
- Esercitazioni pratiche: creazione, distribuzione e gestione dei flussi.
- Attività basate su scenari concreti in un ambiente di laboratorio live.
Opzioni di personalizzazione del corso
- Per richiedere un corso su misura, non esitate a contattarci per concordare i dettagli.
PySpark e Apprendimento Automatico
21 oreQuesto corso offre un’introduzione pratica alla creazione di flussi di lavoro per l'elaborazione dei dati e l'apprendimento automatico in modo scalabile, sfruttando PySpark. I partecipanti acquisiranno conoscenze su come Apache Spark si inserisca negli attuali ecosistemi di Big Data e sulle modalità più efficaci per elaborare set di dati di grandi dimensioni grazie ai principi del calcolo distribuito.
Fondamenti di Apache Spark
21 oreQuesto corso formativo dal vivo, condotto da istruttori in Italia (online o in presenza), è pensato per ingegneri che intendono impostare e utilizzare il sistema Apache Spark al fine di gestire grandi quantità di dati.
Al termine del corso i partecipanti saranno in grado di:
- Installare e configurare Apache Spark.
- Elaborare e analizzare rapidamente insiemi di dati molto voluminosi.
- Capire le differenze tra Apache Spark e Hadoop MapReduce, nonché quando impiegarli.
- Integrare Apache Spark con altri strumenti di machine learning.
Amministrazione di Apache Spark
35 oreQuesto corso formativo dal vivo, tenuto da istruttori in Italia (online o in sede), si rivolge ad amministratori di sistema con competenze di livello principiante-intermedio che desiderano distribuire, gestire e ottimizzare cluster Spark.
Al termine del corso i partecipanti saranno in grado di:
- Installare e configurare Apache Spark in diversi ambienti.
- Gestione delle risorse del cluster e monitoraggio delle applicazioni Spark.
- Ottimizzazione delle prestazioni dei cluster Spark.
- Implementazione di misure di sicurezza e garanzia dell’alta disponibilità.
- Risoluzione dei problemi più comuni legati a Spark.
Apache Spark nel cloud
21 oreInizialmente, la curva di apprendimento di Apache Spark risulta piuttosto ripida: è necessario un notevole impegno per ottenere i primi risultati. Questo corso ha proprio lo scopo di aiutare gli studenti a superare questa fase difficile. Al termine del percorso, i partecipanti conosceranno le nozioni fondamentali di Apache Spark; sapranno distinguere correttamente tra RDD e DataFrame, impareranno ad utilizzare le API in Python e Scala, comprenderanno il ruolo degli executor e delle task. Inoltre, seguendo le best practice del settore, il corso si concentra in modo particolare sul deployment nel cloud, con attenzione a Databricks e AWS. Gli studenti acquisiranno anche familiarità con le differenze tra AWS EMR e AWS Glue, l’ultimo servizio Spark messo a disposizione da Amazon Web Services.
DESTINATARI:
Ingegneri dei dati, professionisti DevOps, Data Scientist
Python e Spark per il trattamento dei Big Data (PySpark)
21 oreIn questo corso pratico tenuto da istruttori in Italia, i partecipanti apprenderanno come combinare Python e Spark per analizzare i Big Data, impegnandosi in esercizi concreti.
Al termine del percorso formativo, saranno in grado di:
- Utilizzare Spark con Python nell’ambito dell’analisi dei Big Data.
- Eseguire esercizi che rispecchiano scenari reali.
- Adottare svariate tecniche e strumenti per l’elaborazione dei dati grazie a PySpark.
Python, Spark e Hadoop per l'elaborazione dei big data
21 oreQuesto corso pratico tenuto da istruttori in Italia (online o in sede) si rivolge agli sviluppatori che desiderano utilizzare e integrare Spark, Hadoop e Python al fine di elaborare, analizzare e trasformare insiemi di dati complessi e di grandi dimensioni.
Al termine del corso i partecipanti saranno in grado di:
- Configurare l’ambiente necessario per iniziare l’elaborazione dei big data con Spark, Hadoop e Python.
- Comprendere le caratteristiche, i componenti principali e l’architettura di Spark e Hadoop.
- Imparare a integrare Spark, Hadoop e Python nell’ambito dell’elaborazione dei big data.
- Esplorare gli strumenti presenti nell’ecosistema Spark (Spark MlLib, Spark Streaming, Kafka, Sqoop, Flume).
- Sviluppare sistemi di raccomandazione basati su filtraggio collaborativo simili a quelli adottati da Netflix, YouTube, Amazon, Spotify e Google.
- Utilizzare Apache Mahout per scalare gli algoritmi di machine learning.
Stratio: Moduli Rocket e Intelligence con PySpark
14 oreStratio è una piattaforma incentrata sui dati che integra big data, intelligenza artificiale e governance in un’unica soluzione. I suoi moduli Rocket e Intelligence consentono un’esplorazione rapida dei dati, la loro trasformazione e l’analisi avanzata negli ambienti aziendali.
Questo corso di formazione dal vivo, tenuto da istruttori (online o in presenza), si rivolge a professionisti del settore dati di livello intermedio desiderosi di utilizzare efficacemente i moduli Rocket e Intelligence in Stratio tramite PySpark. Si approfondiranno strutture cicliche, funzioni definite dall’utente e logiche di elaborazione dei dati.
Al termine del corso, i partecipanti saranno in grado di:
- Navigare e operare all’interno della piattaforma Stratio utilizzando i moduli Rocket e Intelligence.
- Impiegare PySpark nell’ambito dell’inserimento, trasformazione e analisi dei dati.
- Utilizzare cicli logici e istruzioni condizionali per gestire flussi di lavoro sui dati e compiti di ingegneria delle feature.
- Creare e gestire funzioni definite dall’utente (UDF) da riutilizzare nei processi di analisi con PySpark.
Formato del corso
- Lezioni interattive e dibattiti guidati.
- Numerosi esercizi pratici e attività di applicazione.
- Implementazioni pratiche in un ambiente laboratoriale live.
Opzioni di personalizzazione del corso
- Per richiedere un programma formativo su misura, contattateci per concordare i dettagli.