Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Ogni sessione dura 2 ore
Giorno 1: Sessione 1: Panoramica Aziendale sul Perché della Business Intelligence su Big Data nel Governo
- Studi di Caso da NIH, DoE
- Tasso di adozione dei Big Data nelle Agenzie Governative e come stanno allineando il loro futuro operativo all'Analitica Predittiva sui Big Data
- Aree di Applicazione su Ampia Scala nel DoD, NSA, IRS, USDA ecc.
- Interfacciamento dei Big Data con i dati Legacy
- Comprensione di base delle tecnologie abilitanti nell'analitica predittiva
- Integrazione dei Dati & Visualizzazione Dashboard
- Gestione delle Frodi
- Generazione di Regole Aziendali / Rilevazione delle Frodi
- Rilevazione e profilazione delle Minacce
- Analisi dei benefici e dei costi per l'implementazione dei Big Data
Giorno 1: Sessione 2: Introduzione ai Big Data-1
- Caratteristiche principali dei Big Data: volume, varietà, velocità e veridicità. Architettura MPP per il volume.
- Data Warehouses – schema statico, dataset che evolve lentamente
- Database MPP come Greenplum, Exadata, Teradata, Netezza, Vertica ecc.
- Soluzioni Basate su Hadoop – nessuna condizione sulla struttura del dataset.
- Pattern tipico: HDFS, MapReduce (crunch), recupero da HDFS
- Batch- adatto per analitica/non-interattivo
- Volume: dati in streaming CEP
- Scelte tipiche – prodotti CEP (es. Infostreams, Apama, MarkLogic ecc)
- Meno pronto per la produzione – Storm/S4
- Database NoSQL – (a colonne e chiave-valore): Più adatto come complemento analitico al data warehouse/database
Giorno 1: Sessione 3: Introduzione ai Big Data-2
Soluzioni NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Gerarchico) - GT.m, Cache
- KV Store (Ordinato) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Database Oggetto - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Tipologie di Dati: Introduzione ai problemi di Data Cleaning nei Big Data
- RDBMS – struttura/schema statica, non promuove un ambiente agile ed esplorativo.
- NoSQL – semi-strutturato, abbastanza struttura per memorizzare dati senza schema esatto prima del salvataggio
- Problemi di Data Cleaning
Giorno 1: Sessione 4: Introduzione ai Big Data-3: Hadoop
- Quando selezionare Hadoop?
- STRUTTURATO - I data warehouse/database aziendali possono memorizzare dati massivi (a un costo) ma impongono struttura (non buono per l'esplorazione attiva)
- Dati SEMI-STRUTTURATI – difficile da gestire con soluzioni tradizionali (DW/DB)
- Warehousing dei dati = enorme sforzo e statico anche dopo l'implementazione
- Per varietà & volume di dati, elaborati su hardware commodity – HADOOP
- Hardware Commodity necessario per creare un Cluster Hadoop
Introduzione a Map Reduce /HDFS
- MapReduce – distribuzione del calcolo su più server
- HDFS – rendere i dati disponibili localmente per il processo di calcolo (con ridondanza)
- Dati – possono essere non strutturati/senza schema (a differenza di RDBMS)
- Responsabilità dello sviluppatore di dare un senso ai dati
- Programmazione MapReduce = lavorare con Java (pro/contro), caricamento manuale dei dati in HDFS
Giorno 2: Sessione 1: Ecosistema Big Data-Creare l'ETL dei Big Data: universo degli strumenti Big Data-quale usare e quando?
- Hadoop vs. Altre soluzioni NoSQL
- Per accesso interattivo e casuale ai dati
- Hbase (database orientato a colonne) sopra Hadoop
- Accesso casuale ai dati ma con restrizioni imposte (max 1 PB)
- Non adatto per analitica ad-hoc, buono per logging, conteggio, serie temporali
- Sqoop - Importazione da database a Hive o HDFS (accesso JDBC/ODBC)
- Flume – Streaming dati (es. dati di log) in HDFS
Giorno 2: Sessione 2: Sistema di Gestione dei Big Data
- Parti mobili, avvio/guasto nodi di calcolo :ZooKeeper - Per servizi di configurazione/coordinamento/naming
- Pipeline/workflow complessi: Oozie – gestire workflow, dipendenze, catena dipendente
- Deploy, configurazione, gestione cluster, upgrade ecc (sys admin) :Ambari
- In Cloud : Whirr
Giorno 2: Sessione 3: Analitica predittiva nella Business Intelligence -1: Tecniche Fondamentali & BI basata su Machine learning :
- Introduzione al Machine learning
- Tecniche di classificazione per l'apprendimento
- Predizione Bayesiana-preparazione del file di training
- Support Vector Machine
- KNN p-Tree Algebra & vertical mining
- Rete Neurale
- Problema delle variabili grandi nei Big Data -Random forest (RF)
- Problema di Automazione nei Big Data – Multi-model ensemble RF
- Automazione attraverso Soft10-M
- Strumento di analisi testuale-Treeminer
- Apprendimento agile
- Apprendimento basato su agenti
- Apprendimento distribuito
- Introduzione agli Strumenti Open source per l'analitica predittiva : R, Rapidminer, Mahut
Giorno 2: Sessione 4 Ecosistema di analitica predittiva-2: Problemi comuni di analitica predittiva nel Govt.
- Analitica Insight
- Analitica Visualizzativa
- Analitica predittiva strutturata
- Analitica predittiva non strutturata
- Profilazione di Minaccia/frodestar/fornitore
- Motore di Raccomandazione
- Rilevazione pattern
- Scoperta di Regole/Scenario –fallimento, frode, ottimizzazione
- Scoperta della causa radice
- Analisi del Sentiment
- Analitica CRM
- Analitica di Rete
- Analisi Testuale
- Rassegna assistita dalla tecnologia
- Analitica delle Frodi
- Analitica in Tempo Reale
Giorno 3: Sessione 1: Analitica in Tempo Reale e Scalabile su Hadoop
- Perché gli algoritmi analitici comuni falliscono in Hadoop/HDFS
- Apache Hama- per il calcolo distribuito in Bulk Synchronous
- Apache SPARK- per il calcolo di cluster per l'analitica in tempo reale
- CMU Graphics Lab2- Approccio asincrono basato su grafi per il calcolo distribuito
- Approccio basato su KNN p-Algebra da Treeminer per ridurre i costi hardware operativi
Giorno 3: Sessione 2: Strumenti per eDiscovery e Forensics
- eDiscovery su Big Data vs. dati Legacy – un confronto di costo e prestazioni
- Codifica predittiva e rassegna assistita dalla tecnologia (TAR)
- Demo live di un prodotto Tar (vMiner) per capire come funziona la TAR per una scoperta più rapida
- Indicizzazione più rapida attraverso HDFS –velocità dei dati
- NLP o Natural Language processing –varie tecniche e prodotti open source
- eDiscovery in lingue straniere-tecnologia per l'elaborazione delle lingue straniere
Giorno 3: Sessione 3: BI su Big Data per la Cyber Security – Comprendere la visione a 360 gradi dalla raccolta rapida dei dati all'identificazione delle minacce
- Comprensione delle basi dell'analitica della sicurezza-superficie di attacco, configurazione errata della sicurezza, difese host
- Infrastruttura di rete/ Grande datapipe / Response ETL per l'analitica in tempo reale
- Prescrittivo vs predittivo – Regole fisse basate vs auto-scoperta delle regole di minaccia dai Meta dati
Giorno 3: Sessione 4: Big Data in USDA: Applicazione in Agricoltura
- Introduzione a IoT (Internet of Things) per l'agricoltura-Big Data basato su sensori e controllo
- Introduzione all'imaging satellitare e la sua applicazione in agricoltura
- Integrazione di dati di sensori e immagini per la fertilità del suolo, raccomandazioni di coltivazione e previsioni
- Assicurazione agricola e Big Data
- Previsione delle perdite del raccolto
Giorno 4: Sessione 1: BI per la prevenzione delle frodi da Big Data nel Govt- Analitica delle Frodi:
- Classificazione base dell'analitica delle Frodi- basata su regole vs analitica predittiva
- Machine learning supervisionato vs non supervisionato per la rilevazione dei pattern di frode
- Frode del fornitore/sovraccarico per progetti
- Frodi Medicare e Medicaid- tecniche di rilevazione delle frodi per l'elaborazione delle richieste
- Frodi di rimborso viaggio
- Frodi di rimborso IRS
- Saranno forniti studi di caso e demo live ovunque i dati siano disponibili.
Giorno 4: Sessione 2: Analitica dei Social Media- Raccoglimento e analisi dell'intelligence
- API ETL Big Data per l'estrazione di dati dai social media
- Testo, immagine, meta dati e video
- Analisi del sentiment dai feed dei social media
- Filtraggio contestuale e non contestuale dei feed dei social media
- Dashboard dei Social Media per integrare diversi social media
- Profilazione automatica dei profili social media
- Sarà fornita una demo live di ogni analitica tramite lo strumento Treeminer.
Giorno 4: Sessione 3: Analitica Big Data nell'elaborazione di immagini e flussi video
- Tecniche di archiviazione delle immagini nei Big Data- Soluzione di storage per dati che superano i petabyte
- LTFS e LTO
- GPFS-LTFS (Soluzione di storage a livelli per dati di immagine Big)
- Fondamenti dell'analisi delle immagini
- Riconoscimento degli oggetti
- Segmentazione delle immagini
- Tracciamento del movimento
- Ricostruzione di immagini 3-D
Giorno 4: Sessione 4: Applicazioni Big Data in NIH:
- Aree emergenti della Bio-informatica
- Meta-genomica e problemi di mining dei Big Data
- Analitica Predittiva su Big Data per Farmacogenomica, Metabolomica e Proteomica
- Big Data nel processo di Genomica a valle
- Applicazione dell'analitica predittiva dei Big data in Sanità pubblica
Dashboard Big Data per l'accesso rapido a dati diversificati e display :
- Integrazione della piattaforma di applicazione esistente con Dashboard Big Data
- Gestione dei Big Data
- Studio di Caso di Dashboard Big Data: Tableau e Pentaho
- Utilizzare app Big Data per spingere i servizi basati sulla posizione nel Govt.
- Sistema di tracciamento e gestione
Giorno 5: Sessione 1: Come giustificare l'implementazione di BI su Big Data all'interno di un'organizzazione:
- Definire il ROI per l'implementazione dei Big Data
- Studi di caso per il risparmio del Tempo dell'Analista per la raccolta e la preparazione dei Dati –aumento del guadagno di produttività
- Studi di caso di guadagno di ricavi dal risparmio del costo del database licenziato
- Guadagno di ricavi dai servizi basati sulla posizione
- Risparmio dalla prevenzione delle frodi
- Un approccio integrato di foglio di calcolo per calcolare le approssimative spese vs. guadagno/risparmio di ricavi dall'implementazione dei Big Data.
Giorno 5: Sessione 2: Procedura passo-passo per sostituire il sistema dati legacy con un Sistema Big Data:
- Comprensione della Roadmap pratica per la Migrazione Big Data
- Quali sono le informazioni importanti necessarie prima di progettare un'implementazione Big Data
- Quali sono i diversi modi per calcolare volume, velocità, varietà e veridicità dei dati
- Come stimare la crescita dei dati
- Studi di caso
Giorno 5: Sessione 4: Revisione dei Vendor Big Data e revisione dei loro prodotti. Sessione Q/A:
- Accenture
- APTEAN (Ex CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Ex 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Parte di EMC)
Requisiti
- Conoscenze di base del funzionamento aziendale e dei sistemi di dati nel proprio dominio governativo
- Comprensione di base di SQL/Oracle o dei database relazionali
- Comprensione di base della Statistica (a livello di fogli di calcolo)
35 ore
Recensioni (1)
La capacità del formatore di allineare il corso ai requisiti dell'organizzazione, piuttosto che limitarsi a erogarlo solo per motivi formali.
Masilonyane - Revenue Services Lesotho
Corso - Big Data Business Intelligence for Govt. Agencies
Traduzione automatica