Struttura del corso
Introduzione ad Apache Iceberg
- Panoramica generale su Apache Iceberg
- Approfondimento sui concetti di base
Analisi approfondita dell’architettura di Iceberg
- Esame dettagliato del formato tabella proposto da Iceberg
- Descrizione completa dell’architettura, con particolare attenzione ai metadati e alla struttura dei file.
- Dinamiche interne relative all’evoluzione degli schemi e delle partizioni
Installazione e configurazione avanzate
- Configurazione di Iceberg per ottenere prestazioni ottimali in ambienti diversificati
- Integrazione con svariati motori di elaborazione dati
- Configurazioni avanzate: sicurezza, crittografia e controllo degli accessi
- Installazione di Iceberg in ambienti distribuiti
Operazioni e manutenzione avanzate
- Gestione pratica di tabelle Iceberg di grandi dimensioni
- Implementazione e gestione di modifiche complesse agli schemi dati
- Gestione dell’evoluzione delle partizioni, inclusa la cosiddetta “partizionamento nascosto”
- Esecuzione di operazioni CRUD avanzate riguardanti schemi e partizioni
Tecniche per l’ottimizzazione delle query
- Metodi utili a ridurre la latenza delle operazioni di interrogazione
- Strategie quali la selezione mirata delle partizioni e l’eliminazione di file non necessari
- Tecniche di memorizzazione dei metadati e strategie volte a ottimizzare le prestazioni
- Implementazione e collaudo pratico di tali tecniche
Ottimizzazione delle performance su dataset di grandi dimensioni
- Strategie per aumentare le prestazioni quando si lavora con moli enormi di dati
- Utilizzo delle funzionalità native di Iceberg finalizzate al miglioramento delle performance
- Analisi di casi concreti legati all’ottimizzazione in contesti reali
- Procedimenti per affinare le prestazioni su dataset di grandi dimensioni
Migrazione e integrazione avanzate dei dati
- Trasferimento di strutture dati complesse da altri sistemi verso Iceberg
- Integrazione di flussi di dati in tempo reale con Iceberg
- Processi integrati per migrare dataset complessi e collegare flussi real-time
Affidabilità e coerenza dei dati
- Modalità per mantenere la coerenza e l’integrità dei dati negli ambienti distribuiti
- Implementazione di garanzie transazionali affidabili
- Procedimenti per gestire malfunzionamenti e ripristinare il corretto stato dei dati
- Implementazione pratica di soluzioni volte a garantire affidabilità e consistenza
Funzionalità avanzate ed estensione personalizzata
- Sviluppo di cataloghi dati su misura per Iceberg
- Creazione di funzionalità aggiuntive e modifiche personalizzate a Iceberg
- Sviluppo e integrazione di nuove feature, nonché realizzazione di cataloghi specifici per il progetto
Governance dei dati e conformità normativa
- Definizione e attuazione di linee guida per la gestione responsabile dei dati
- Adempimento alle normative vigenti in materia di protezione dei dati
- Tenuta di log per tracciare le attività e descrivere la provenienza dei dati
- Creazione e manutenzione di sistemi volti a garantire governance e conformità normativa
Sintesi finale e prospettive future
Requisiti
- Conoscenza dei concetti fondamentali, delle operazioni di base e della gestione delle tabelle Iceberg
Destinatari
- Ingegneri dei dati
- Architetti dei dati
- Analisti dei dati
- Sviluppatori software
Recensioni (2)
Un viaggio attraverso il mondo di Spark: un corso molto intenso. DSL, Spark SQL, partizionamento rispetto al bucketing per me.
Georgiana Elisabeta
Corso - Apache Spark Fundamentals
Traduzione automatica
Esercizi pratici. La classe sarebbe dovuta durare 5 giorni, ma i 3 giorni sono stati sufficienti per chiarire molte delle domande che avevo lavorando con NiFi.
James - BHG Financial
Corso - Apache NiFi for Administrators
Traduzione automatica