Contattataci

Struttura del corso

Ogni sessione dura 2 ore

Giorno 1: Sessione 1: Panoramica Aziendale sul Perché della Business Intelligence su Big Data nel Governo

  • Studi di Caso da NIH, DoE
  • Tasso di adozione dei Big Data nelle Agenzie Governative e come stanno allineando il loro futuro operativo all'Analitica Predittiva sui Big Data
  • Aree di Applicazione su Ampia Scala nel DoD, NSA, IRS, USDA ecc.
  • Interfacciamento dei Big Data con i dati Legacy
  • Comprensione di base delle tecnologie abilitanti nell'analitica predittiva
  • Integrazione dei Dati & Visualizzazione Dashboard
  • Gestione delle Frodi
  • Generazione di Regole Aziendali / Rilevazione delle Frodi
  • Rilevazione e profilazione delle Minacce
  • Analisi dei benefici e dei costi per l'implementazione dei Big Data

Giorno 1: Sessione 2: Introduzione ai Big Data-1

  • Caratteristiche principali dei Big Data: volume, varietà, velocità e veridicità. Architettura MPP per il volume.
  • Data Warehouses – schema statico, dataset che evolve lentamente
  • Database MPP come Greenplum, Exadata, Teradata, Netezza, Vertica ecc.
  • Soluzioni Basate su Hadoop – nessuna condizione sulla struttura del dataset.
  • Pattern tipico: HDFS, MapReduce (crunch), recupero da HDFS
  • Batch- adatto per analitica/non-interattivo
  • Volume: dati in streaming CEP
  • Scelte tipiche – prodotti CEP (es. Infostreams, Apama, MarkLogic ecc)
  • Meno pronto per la produzione – Storm/S4
  • Database NoSQL – (a colonne e chiave-valore): Più adatto come complemento analitico al data warehouse/database

Giorno 1: Sessione 3: Introduzione ai Big Data-2

Soluzioni NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Gerarchico) - GT.m, Cache
  • KV Store (Ordinato) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Database Oggetto - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Tipologie di Dati: Introduzione ai problemi di Data Cleaning nei Big Data

  • RDBMS – struttura/schema statica, non promuove un ambiente agile ed esplorativo.
  • NoSQL – semi-strutturato, abbastanza struttura per memorizzare dati senza schema esatto prima del salvataggio
  • Problemi di Data Cleaning

Giorno 1: Sessione 4: Introduzione ai Big Data-3: Hadoop

  • Quando selezionare Hadoop?
  • STRUTTURATO - I data warehouse/database aziendali possono memorizzare dati massivi (a un costo) ma impongono struttura (non buono per l'esplorazione attiva)
  • Dati SEMI-STRUTTURATI – difficile da gestire con soluzioni tradizionali (DW/DB)
  • Warehousing dei dati = enorme sforzo e statico anche dopo l'implementazione
  • Per varietà & volume di dati, elaborati su hardware commodity – HADOOP
  • Hardware Commodity necessario per creare un Cluster Hadoop

Introduzione a Map Reduce /HDFS

  • MapReduce – distribuzione del calcolo su più server
  • HDFS – rendere i dati disponibili localmente per il processo di calcolo (con ridondanza)
  • Dati – possono essere non strutturati/senza schema (a differenza di RDBMS)
  • Responsabilità dello sviluppatore di dare un senso ai dati
  • Programmazione MapReduce = lavorare con Java (pro/contro), caricamento manuale dei dati in HDFS

Giorno 2: Sessione 1: Ecosistema Big Data-Creare l'ETL dei Big Data: universo degli strumenti Big Data-quale usare e quando?

  • Hadoop vs. Altre soluzioni NoSQL
  • Per accesso interattivo e casuale ai dati
  • Hbase (database orientato a colonne) sopra Hadoop
  • Accesso casuale ai dati ma con restrizioni imposte (max 1 PB)
  • Non adatto per analitica ad-hoc, buono per logging, conteggio, serie temporali
  • Sqoop - Importazione da database a Hive o HDFS (accesso JDBC/ODBC)
  • Flume – Streaming dati (es. dati di log) in HDFS

Giorno 2: Sessione 2: Sistema di Gestione dei Big Data

  • Parti mobili, avvio/guasto nodi di calcolo :ZooKeeper - Per servizi di configurazione/coordinamento/naming
  • Pipeline/workflow complessi: Oozie – gestire workflow, dipendenze, catena dipendente
  • Deploy, configurazione, gestione cluster, upgrade ecc (sys admin) :Ambari
  • In Cloud : Whirr

Giorno 2: Sessione 3: Analitica predittiva nella Business Intelligence -1: Tecniche Fondamentali & BI basata su Machine learning :

  • Introduzione al Machine learning
  • Tecniche di classificazione per l'apprendimento
  • Predizione Bayesiana-preparazione del file di training
  • Support Vector Machine
  • KNN p-Tree Algebra & vertical mining
  • Rete Neurale
  • Problema delle variabili grandi nei Big Data -Random forest (RF)
  • Problema di Automazione nei Big Data – Multi-model ensemble RF
  • Automazione attraverso Soft10-M
  • Strumento di analisi testuale-Treeminer
  • Apprendimento agile
  • Apprendimento basato su agenti
  • Apprendimento distribuito
  • Introduzione agli Strumenti Open source per l'analitica predittiva : R, Rapidminer, Mahut

Giorno 2: Sessione 4 Ecosistema di analitica predittiva-2: Problemi comuni di analitica predittiva nel Govt.

  • Analitica Insight
  • Analitica Visualizzativa
  • Analitica predittiva strutturata
  • Analitica predittiva non strutturata
  • Profilazione di Minaccia/frodestar/fornitore
  • Motore di Raccomandazione
  • Rilevazione pattern
  • Scoperta di Regole/Scenario –fallimento, frode, ottimizzazione
  • Scoperta della causa radice
  • Analisi del Sentiment
  • Analitica CRM
  • Analitica di Rete
  • Analisi Testuale
  • Rassegna assistita dalla tecnologia
  • Analitica delle Frodi
  • Analitica in Tempo Reale

Giorno 3: Sessione 1: Analitica in Tempo Reale e Scalabile su Hadoop

  • Perché gli algoritmi analitici comuni falliscono in Hadoop/HDFS
  • Apache Hama- per il calcolo distribuito in Bulk Synchronous
  • Apache SPARK- per il calcolo di cluster per l'analitica in tempo reale
  • CMU Graphics Lab2- Approccio asincrono basato su grafi per il calcolo distribuito
  • Approccio basato su KNN p-Algebra da Treeminer per ridurre i costi hardware operativi

Giorno 3: Sessione 2: Strumenti per eDiscovery e Forensics

  • eDiscovery su Big Data vs. dati Legacy – un confronto di costo e prestazioni
  • Codifica predittiva e rassegna assistita dalla tecnologia (TAR)
  • Demo live di un prodotto Tar (vMiner) per capire come funziona la TAR per una scoperta più rapida
  • Indicizzazione più rapida attraverso HDFS –velocità dei dati
  • NLP o Natural Language processing –varie tecniche e prodotti open source
  • eDiscovery in lingue straniere-tecnologia per l'elaborazione delle lingue straniere

Giorno 3: Sessione 3: BI su Big Data per la Cyber Security – Comprendere la visione a 360 gradi dalla raccolta rapida dei dati all'identificazione delle minacce

  • Comprensione delle basi dell'analitica della sicurezza-superficie di attacco, configurazione errata della sicurezza, difese host
  • Infrastruttura di rete/ Grande datapipe / Response ETL per l'analitica in tempo reale
  • Prescrittivo vs predittivo – Regole fisse basate vs auto-scoperta delle regole di minaccia dai Meta dati

Giorno 3: Sessione 4: Big Data in USDA: Applicazione in Agricoltura

  • Introduzione a IoT (Internet of Things) per l'agricoltura-Big Data basato su sensori e controllo
  • Introduzione all'imaging satellitare e la sua applicazione in agricoltura
  • Integrazione di dati di sensori e immagini per la fertilità del suolo, raccomandazioni di coltivazione e previsioni
  • Assicurazione agricola e Big Data
  • Previsione delle perdite del raccolto

Giorno 4: Sessione 1: BI per la prevenzione delle frodi da Big Data nel Govt- Analitica delle Frodi:

  • Classificazione base dell'analitica delle Frodi- basata su regole vs analitica predittiva
  • Machine learning supervisionato vs non supervisionato per la rilevazione dei pattern di frode
  • Frode del fornitore/sovraccarico per progetti
  • Frodi Medicare e Medicaid- tecniche di rilevazione delle frodi per l'elaborazione delle richieste
  • Frodi di rimborso viaggio
  • Frodi di rimborso IRS
  • Saranno forniti studi di caso e demo live ovunque i dati siano disponibili.

Giorno 4: Sessione 2: Analitica dei Social Media- Raccoglimento e analisi dell'intelligence

  • API ETL Big Data per l'estrazione di dati dai social media
  • Testo, immagine, meta dati e video
  • Analisi del sentiment dai feed dei social media
  • Filtraggio contestuale e non contestuale dei feed dei social media
  • Dashboard dei Social Media per integrare diversi social media
  • Profilazione automatica dei profili social media
  • Sarà fornita una demo live di ogni analitica tramite lo strumento Treeminer.

Giorno 4: Sessione 3: Analitica Big Data nell'elaborazione di immagini e flussi video

  • Tecniche di archiviazione delle immagini nei Big Data- Soluzione di storage per dati che superano i petabyte
  • LTFS e LTO
  • GPFS-LTFS (Soluzione di storage a livelli per dati di immagine Big)
  • Fondamenti dell'analisi delle immagini
  • Riconoscimento degli oggetti
  • Segmentazione delle immagini
  • Tracciamento del movimento
  • Ricostruzione di immagini 3-D

Giorno 4: Sessione 4: Applicazioni Big Data in NIH:

  • Aree emergenti della Bio-informatica
  • Meta-genomica e problemi di mining dei Big Data
  • Analitica Predittiva su Big Data per Farmacogenomica, Metabolomica e Proteomica
  • Big Data nel processo di Genomica a valle
  • Applicazione dell'analitica predittiva dei Big data in Sanità pubblica

Dashboard Big Data per l'accesso rapido a dati diversificati e display :

  • Integrazione della piattaforma di applicazione esistente con Dashboard Big Data
  • Gestione dei Big Data
  • Studio di Caso di Dashboard Big Data: Tableau e Pentaho
  • Utilizzare app Big Data per spingere i servizi basati sulla posizione nel Govt.
  • Sistema di tracciamento e gestione

Giorno 5: Sessione 1: Come giustificare l'implementazione di BI su Big Data all'interno di un'organizzazione:

  • Definire il ROI per l'implementazione dei Big Data
  • Studi di caso per il risparmio del Tempo dell'Analista per la raccolta e la preparazione dei Dati –aumento del guadagno di produttività
  • Studi di caso di guadagno di ricavi dal risparmio del costo del database licenziato
  • Guadagno di ricavi dai servizi basati sulla posizione
  • Risparmio dalla prevenzione delle frodi
  • Un approccio integrato di foglio di calcolo per calcolare le approssimative spese vs. guadagno/risparmio di ricavi dall'implementazione dei Big Data.

Giorno 5: Sessione 2: Procedura passo-passo per sostituire il sistema dati legacy con un Sistema Big Data:

  • Comprensione della Roadmap pratica per la Migrazione Big Data
  • Quali sono le informazioni importanti necessarie prima di progettare un'implementazione Big Data
  • Quali sono i diversi modi per calcolare volume, velocità, varietà e veridicità dei dati
  • Come stimare la crescita dei dati
  • Studi di caso

Giorno 5: Sessione 4: Revisione dei Vendor Big Data e revisione dei loro prodotti. Sessione Q/A:

  • Accenture
  • APTEAN (Ex CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Ex 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Parte di EMC)

Requisiti

  • Conoscenze di base del funzionamento aziendale e dei sistemi di dati nel proprio dominio governativo
  • Comprensione di base di SQL/Oracle o dei database relazionali
  • Comprensione di base della Statistica (a livello di fogli di calcolo)
 35 ore

Numero di Partecipanti


Prezzo per partecipante

Recensioni (1)

Corsi in Arrivo

Categorie relative