Contattataci

Struttura del corso

Architettura di Greenplum

  • Elaborazione parallela e multiprocessamento simmetrico
  • Ruoli dei segmenti e configurazione del cluster
  • Scalabilità del sistema e meccanismi di spostamento dei dati
  • Architettura complessiva del data warehouse di Greenplum

Strutture delle tabelle in Greenplum

  • Differenze tra tabelle distribuite e quelle assegnate casualmente
  • Tipologie di tabelle: heap e a scrittura unica (append-only)
  • Formati di archiviazione dati: a righe vs a colonne
  • Strategie di partizionamento e raggruppamento delle tabelle

Distribuzione dei dati e algoritmi di hashing

  • Logica di hashing e scelta delle chiavi di distribuzione
  • Gestione dello squilibrio nella distribuzione dei dati e suo impatto sulle prestazioni
  • Mappature hash e modalità di allocazione delle righe tra i vari segmenti

Indicizzazione e ottimizzazione prestazionale

  • Indici clusterizzati e non clusterizzati
  • Applicazioni tipiche degli indici B-tree e a bitmap
  • Comportamento dei motori di ricerca rispetto agli indici e alle strutture fisiche

Progettazione fisica del database

  • Principi di normalizzazione e progettazione dei modelli logici
  • Strategie di accesso degli utenti e analisi della distribuzione dati
  • Valutazione delle caratteristiche statistiche dei dati per decidere l’ottimale impostazione indicizzata

Tecniche di denormalizzazione

  • Creazione di dati derivati, tabelle di riepilogo e join preventivi
  • Impiego delle tabelle a colonne come metodo di partizionamento verticale
  • Realizzazione di data mart e viste materializzate per accelerare le analisi

SQL avanzato ed esecuzione delle query

  • Modalità di esecuzione dei join e meccanismi di ridistribuzione dei dati
  • Utilizzo di funzioni OLAP e window functions in contesti distribuiti
  • Gestione delle tabelle temporanee, dei sottoquery e delle strutture derivate

Piani di esecuzione (EXPLAIN) e ottimizzazione delle query

  • Lettura e analisi approfondita dell’output generato da EXPLAIN
  • Valutazione dei costi e implementazione di miglioramenti strutturali nei piani di esecuzione
  • Ottimizzazione degli spostamenti tra i segmenti e delle operazioni eseguite localmente su ciascuno di essi

Utilità integrate in Greenplum e best practice operative

  • Strumenti fondamentali come ANALYZE e VACUUM per la manutenzione dei dati
  • Importazione, esportazione e spostamento sicuro dei dati tramite Nexus
  • Linee guida sulla gestione della sicurezza, permessi utente ed elementi critici per le prestazioni complessive

Conclusioni e prossimi passi

Requisiti

  • Conoscenza di base dei database relazionali e della sintassi SQL
  • Esperienza nell’utilizzo di sistemi di data warehouse o in ambienti analitici
  • Familiarità con l’uso della riga di comando Linux

Destinatari del corso

  • Architetti e ingegneri dei dati
  • Amministratori di database e responsabili tecnici
  • Sviluppatori BI e specialisti dell’analisi dati che operano con Greenplum
 21 ore

Numero di Partecipanti


Prezzo per partecipante

Recensioni (1)

Corsi in Arrivo

Categorie relative