Intrati in legatura
 Durata 35 ore

Schița de curs

Fiecare sesiune durează 2 ore

Ziua 1: Sesiunea 1: Prezentare generală de business a motivelor pentru Big Data Business Intelligence în sectorul guvernamental

  • Studii de caz de la NIH, DoE
  • Rata de adoptare a Big Data în agențiile guvernamentale și modul în care își aliniază operațiunile viitoare în jurul Big Data Predictive Analytics
  • Arii de aplicare la scară largă în DoD, NSA, IRS, USDA etc.
  • Interfațarea Big Data cu datele legacy
  • Înțelegerea de bază a tehnologiilor de facilitare pentru predictive analytics
  • Integrarea datelor și vizualizarea în dashboard
  • Managementul fraudelor
  • Generarea regulilor de business/detecția fraudelor
  • Detectarea și profilarea amenințărilor
  • Analiza cost-beneficiu pentru implementarea Big Data

Ziua 1: Sesiunea 2: Introducere în Big Data – 1

  • Caracteristicile principale ale Big Data – volum, varietate, viteză și veridicitate. Arhitectura MPP pentru volum.
  • Data warehouse – schemă statică, set de date cu evoluție lentă
  • Baze de date MPP precum Greenplum, Exadata, Teradata, Netezza, Vertica etc.
  • Soluții bazate pe Hadoop – fără condiții privind structura setului de date.
  • Tipar tipic: HDFS, MapReduce (procesare), extragere din HDFS
  • Batch – potrivit pentru analitic/non-interactiv
  • Volum: streaming de date CEP
  • Opțiuni tipice – produse CEP (de ex. Infostreams, Apama, MarkLogic etc.)
  • Mai puțin pregătite pentru producție – Storm/S4
  • Baze de date NoSQL – (columnare și cheie-valoare): cele mai potrivite ca adjuvanți analitici pentru data warehouse/baze de date

Ziua 1: Sesiunea 3: Introducere în Big Data – 2

Soluții NoSQL

  • KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (ierarhic) - GT.m, Cache
  • KV Store (ordonat) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store - Gigaspaces, Coord, Apache River
  • Object Database - ZopeDB, DB40, Shoal
  • Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Varietăți de date: Introducere în problema curățării datelor în Big Data

  • RDBMS – structură/schemă statică, nu încurajează un mediu agil, exploratoriu.
  • NoSQL – semi-structurat, suficientă structură pentru a stoca date fără o schemă exactă înainte de stocare
  • Probleme de curățare a datelor

Ziua 1: Sesiunea 4: Introducere în Big Data – 3: Hadoop

  • Când alegi Hadoop?
  • STRUCTURAT - Data warehouse/databases enterprise pot stoca date masive (la un cost), dar impun structură (nu sunt bune pentru explorare activă)
  • Date SEMI-STRUCTURATE – dificil de gestionat cu soluții tradiționale (DW/DB)
  • Depozitarea datelor = efort URIAȘ și static chiar și după implementare
  • Pentru varietatea și volumul de date, procesate pe hardware commodity – HADOOP
  • Hardware commodity necesar pentru a crea un cluster Hadoop

Introducere în MapReduce/HDFS

  • MapReduce – calcul distribuit pe mai multe servere
  • HDFS – face datele disponibile local pentru procesul de calcul (cu redundanță)
  • Datele – pot fi nestructurate/fără schemă (spre deosebire de RDBMS)
  • Responsabilitatea dezvoltatorului de a da sens datelor
  • Programarea MapReduce = lucrul cu Java (pro/contra), încărcarea manuală a datelor în HDFS

Ziua 2: Sesiunea 1: Ecosistemul Big Data – Construirea ETL Big Data: universul instrumentelor Big Data – pe care îl folosești și când?

  • Hadoop vs. alte soluții NoSQL
  • Pentru acces interactiv, aleatoriu la date
  • HBase (bază de date orientată pe coloane) peste Hadoop
  • Acces aleatoriu la date, dar cu restricții impuse (maxim 1 PB)
  • Nu este potrivit pentru analytics ad-hoc, este bun pentru logging, numărare, serii de timp
  • Sqoop - Import din baze de date în Hive sau HDFS (acces JDBC/ODBC)
  • Flume – Streaming de date (de ex. log data) în HDFS

Ziua 2: Sesiunea 2: Sistemul de management Big Data

  • Piese în mișcare, nodurile de calcul pornesc/eșuează: ZooKeeper - Pentru servicii de configurare/coordonare/denumire
  • Pipeline/workflow complex: Oozie – gestionează workflow-ul, dependențele, lanțurile secvențiale
  • Deploy, configurare, managementul clusterului, upgrade etc. (administrare de sistem): Ambari
  • În cloud: Whirr

Ziua 2: Sesiunea 3: Predictive analytics în Business Intelligence – 1: Tehnici fundamentale și BI bazat pe machine learning:

  • Introducere în machine learning
  • Învățarea tehnicilor de clasificare
  • Predicție bayesiană – pregătirea fișierului de training
  • Support Vector Machine
  • KNN p-Tree Algebra și vertical mining
  • Rețele neuronale
  • Problema variabilelor mari în Big Data – Random forest (RF)
  • Problema automatizării Big Data – RF multi-model ensemble
  • Automatizare prin Soft10-M
  • Instrument de analiză text – Treeminer
  • Agile learning
  • Agent based learning
  • Distributed learning
  • Introducere în instrumentele open source pentru predictive analytics: R, Rapidminer, Mahut

Ziua 2: Sesiunea 4: Ecosistemul de predictive analytics – 2: Probleme comune de predictive analytics în sectorul guvernamental

  • Insight analytics
  • Analytics de vizualizare
  • Predictive analytics structurat
  • Predictive analytics nestructurat
  • Profilarea amenințărilor/fraudstar/furnizorilor
  • Motor de recomandare
  • Detectarea tiparelor
  • Descoperirea regulilor/scenariilor – eșec, fraudă, optimizare
  • Descoperirea cauzelor profunde
  • Analiza sentimentelor
  • Analytics CRM
  • Analytics de rețea
  • Analytics de text
  • Revizuire asistată de tehnologie
  • Analytics antifraudă
  • Analytics în timp real

Ziua 3: Sesiunea 1: Analytics în timp real și scalabil peste Hadoop

  • De ce eșuează algoritmii analitici comuni în Hadoop/HDFS
  • Apache Hama – pentru calcul distribuit Bulk Synchronous
  • Apache SPARK – pentru cluster computing pentru analytics în timp real
  • CMU Graphics Lab2 – abordare asincronă bazată pe grafuri pentru calculul distribuit
  • Abordarea KNN p-Algebra de la Treeminer pentru costuri hardware reduse de operare

Ziua 3: Sesiunea 2: Instrumente pentru eDiscovery și Forensics

  • eDiscovery peste Big Data vs. date legacy – o comparație a costurilor și performanței
  • Predictive coding și revizuirea asistată de tehnologie (TAR)
  • Demo live al unui produs TAR (vMiner) pentru a înțelege cum funcționează TAR pentru o descoperire mai rapidă
  • Indexare mai rapidă prin HDFS – viteza datelor
  • NLP sau procesarea limbajului natural – diverse tehnici și produse open source
  • eDiscovery în limbi străine – tehnologie pentru procesarea limbilor străine

Ziua 3: Sesiunea 3: Big Data BI pentru securitate cibernetică – Înțelegerea vederii complete la 360 de grade, de la colectarea rapidă a datelor la identificarea amenințărilor

  • Înțelegerea noțiunilor de bază ale security analytics – suprafața de atac, configurarea greșită a securității, apărările gazdei
  • Infrastructura de rețea/datapipe de mari dimensiuni/ETL de răspuns pentru analytics în timp real
  • Prescriptiv vs. predictiv – bazat pe reguli fixe vs. descoperirea automată a regulilor de amenințare din metadate

Ziua 3: Sesiunea 4: Big Data în USDA: Aplicații în agricultură

  • Introducere în IoT (Internet of Things) pentru agricultură – Big Data bazat pe senzori și control
  • Introducere în imagistica prin satelit și aplicarea sa în agricultură
  • Integrarea datelor de la senzori și imagini pentru fertilitatea solului, recomandări de cultivare și prognoze
  • Asigurările agricole și Big Data
  • Prognoza pierderilor de recolte

Ziua 4: Sesiunea 1: BI de prevenire a fraudelor din Big Data în sectorul guvernamental – Analytics antifraudă:

  • Clasificarea de bază a analytics antifraudă – bazat pe reguli vs. predictive analytics
  • Machine learning supervizat vs. nesupervizat pentru detectarea tiparelor de fraudă
  • Frauda furnizorilor/suprataxarea proiectelor
  • Frauda Medicare și Medicaid – tehnici de detectare a fraudelor pentru procesarea cererilor de despăgubire
  • Fraude la rambursarea cheltuielilor de călătorie
  • Fraude la rambursările IRS
  • Studii de caz și demo live vor fi oferite acolo unde datele sunt disponibile.

Ziua 4: Sesiunea 2: Social Media Analytics – Colectarea și analiza informațiilor

  • API ETL Big Data pentru extragerea datelor din social media
  • Text, imagini, metadate și video
  • Analiza sentimentelor din fluxurile de social media
  • Filtrarea contextuală și non-contextuală a fluxurilor de social media
  • Social Media Dashboard pentru integrarea diverselor platforme de social media
  • Profilarea automată a profilurilor de social media
  • Demo live al fiecărui tip de analytics va fi oferit prin instrumentul Treeminer.

Ziua 4: Sesiunea 3: Big Data Analytics în procesarea imaginilor și fluxurilor video

  • Tehnici de stocare a imaginilor în Big Data – soluții de stocare pentru date care depășesc petabytes
  • LTFS și LTO
  • GPFS-LTFS (soluție de stocare pe niveluri pentru date mari de imagini)
  • Fundamentele analytics pentru imagini
  • Recunoașterea obiectelor
  • Segmentarea imaginilor
  • Urmărirea mișcării
  • Reconstrucția imaginilor 3D

Ziua 4: Sesiunea 4: Aplicații Big Data în NIH:

  • Arii emergente ale bioinformaticii
  • Metagenomica și problemele de Big Data mining
  • Big Data Predictive Analytics pentru farmacogenomică, metabolomică și proteomică
  • Big Data în procesele genomice downstream
  • Aplicarea Big Data Predictive Analytics în sănătatea publică

Big Data Dashboard pentru accesibilitatea rapidă și afișarea datelor diverse:

  • Integrarea platformei de aplicații existente cu Big Data Dashboard
  • Managementul Big Data
  • Studiu de caz al Big Data Dashboard: Tableau și Pentaho
  • Folosirea aplicațiilor Big Data pentru a oferi servicii bazate pe locație în sectorul guvernamental
  • Sistem de urmărire și management

Ziua 5: Sesiunea 1: Cum justifici implementarea Big Data BI în cadrul unei organizații:

  • Definirea ROI-ului pentru implementarea Big Data
  • Studii de caz pentru economisirea timpului analiștilor în colectarea și pregătirea datelor – creșterea productivității
  • Studii de caz privind câștigurile din economisirea costurilor bazelor de date licențiate
  • Câștiguri din serviciile bazate pe locație
  • Economii din prevenirea fraudelor
  • O abordare integrată cu foi de calcul pentru a calcula aproximativ cheltuielile vs. câștigurile/economiile din implementarea Big Data.

Ziua 5: Sesiunea 2: Procedura pas cu pas pentru înlocuirea sistemului de date legacy cu un sistem Big Data:

  • Înțelegerea practică a foii de parcurs pentru migrarea Big Data
  • Care sunt informațiile importante necesare înainte de a proiecta o implementare Big Data
  • Care sunt diferitele modalități de calculare a volumului, vitezei, varietății și veridicității datelor
  • Cum estimezi creșterea datelor
  • Studii de caz

Ziua 5: Sesiunea 4: Revizuirea furnizorilor Big Data și analiza produselor lor. Sesiune de Q/A:

  • Accenture
  • APTEAN (fostul CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (fostul 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (parte a EMC)

Cerințe

  • Cunoștințe de bază despre operațiunile de business și sistemele de date guvernamentale din domeniul lor
  • Înțelegerea de bază a SQL/Oracle sau a bazelor de date relaționale
  • Înțelegerea de bază a statisticii (la nivel de foaie de calcul)

Numărul de participanți


Pret per participant

Mărturii (1)

Cursuri viitoare

Categorii înrudite