Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Durata 35 ore
Schița de curs
Fiecare sesiune durează 2 ore
Ziua 1: Sesiunea 1: Prezentare generală de business a motivelor pentru Big Data Business Intelligence în sectorul guvernamental
- Studii de caz de la NIH, DoE
- Rata de adoptare a Big Data în agențiile guvernamentale și modul în care își aliniază operațiunile viitoare în jurul Big Data Predictive Analytics
- Arii de aplicare la scară largă în DoD, NSA, IRS, USDA etc.
- Interfațarea Big Data cu datele legacy
- Înțelegerea de bază a tehnologiilor de facilitare pentru predictive analytics
- Integrarea datelor și vizualizarea în dashboard
- Managementul fraudelor
- Generarea regulilor de business/detecția fraudelor
- Detectarea și profilarea amenințărilor
- Analiza cost-beneficiu pentru implementarea Big Data
Ziua 1: Sesiunea 2: Introducere în Big Data – 1
- Caracteristicile principale ale Big Data – volum, varietate, viteză și veridicitate. Arhitectura MPP pentru volum.
- Data warehouse – schemă statică, set de date cu evoluție lentă
- Baze de date MPP precum Greenplum, Exadata, Teradata, Netezza, Vertica etc.
- Soluții bazate pe Hadoop – fără condiții privind structura setului de date.
- Tipar tipic: HDFS, MapReduce (procesare), extragere din HDFS
- Batch – potrivit pentru analitic/non-interactiv
- Volum: streaming de date CEP
- Opțiuni tipice – produse CEP (de ex. Infostreams, Apama, MarkLogic etc.)
- Mai puțin pregătite pentru producție – Storm/S4
- Baze de date NoSQL – (columnare și cheie-valoare): cele mai potrivite ca adjuvanți analitici pentru data warehouse/baze de date
Ziua 1: Sesiunea 3: Introducere în Big Data – 2
Soluții NoSQL
- KV Store - Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store - Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (ierarhic) - GT.m, Cache
- KV Store (ordonat) - TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache - Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store - Gigaspaces, Coord, Apache River
- Object Database - ZopeDB, DB40, Shoal
- Document Store - CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Databases, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Wide Columnar Store - BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Varietăți de date: Introducere în problema curățării datelor în Big Data
- RDBMS – structură/schemă statică, nu încurajează un mediu agil, exploratoriu.
- NoSQL – semi-structurat, suficientă structură pentru a stoca date fără o schemă exactă înainte de stocare
- Probleme de curățare a datelor
Ziua 1: Sesiunea 4: Introducere în Big Data – 3: Hadoop
- Când alegi Hadoop?
- STRUCTURAT - Data warehouse/databases enterprise pot stoca date masive (la un cost), dar impun structură (nu sunt bune pentru explorare activă)
- Date SEMI-STRUCTURATE – dificil de gestionat cu soluții tradiționale (DW/DB)
- Depozitarea datelor = efort URIAȘ și static chiar și după implementare
- Pentru varietatea și volumul de date, procesate pe hardware commodity – HADOOP
- Hardware commodity necesar pentru a crea un cluster Hadoop
Introducere în MapReduce/HDFS
- MapReduce – calcul distribuit pe mai multe servere
- HDFS – face datele disponibile local pentru procesul de calcul (cu redundanță)
- Datele – pot fi nestructurate/fără schemă (spre deosebire de RDBMS)
- Responsabilitatea dezvoltatorului de a da sens datelor
- Programarea MapReduce = lucrul cu Java (pro/contra), încărcarea manuală a datelor în HDFS
Ziua 2: Sesiunea 1: Ecosistemul Big Data – Construirea ETL Big Data: universul instrumentelor Big Data – pe care îl folosești și când?
- Hadoop vs. alte soluții NoSQL
- Pentru acces interactiv, aleatoriu la date
- HBase (bază de date orientată pe coloane) peste Hadoop
- Acces aleatoriu la date, dar cu restricții impuse (maxim 1 PB)
- Nu este potrivit pentru analytics ad-hoc, este bun pentru logging, numărare, serii de timp
- Sqoop - Import din baze de date în Hive sau HDFS (acces JDBC/ODBC)
- Flume – Streaming de date (de ex. log data) în HDFS
Ziua 2: Sesiunea 2: Sistemul de management Big Data
- Piese în mișcare, nodurile de calcul pornesc/eșuează: ZooKeeper - Pentru servicii de configurare/coordonare/denumire
- Pipeline/workflow complex: Oozie – gestionează workflow-ul, dependențele, lanțurile secvențiale
- Deploy, configurare, managementul clusterului, upgrade etc. (administrare de sistem): Ambari
- În cloud: Whirr
Ziua 2: Sesiunea 3: Predictive analytics în Business Intelligence – 1: Tehnici fundamentale și BI bazat pe machine learning:
- Introducere în machine learning
- Învățarea tehnicilor de clasificare
- Predicție bayesiană – pregătirea fișierului de training
- Support Vector Machine
- KNN p-Tree Algebra și vertical mining
- Rețele neuronale
- Problema variabilelor mari în Big Data – Random forest (RF)
- Problema automatizării Big Data – RF multi-model ensemble
- Automatizare prin Soft10-M
- Instrument de analiză text – Treeminer
- Agile learning
- Agent based learning
- Distributed learning
- Introducere în instrumentele open source pentru predictive analytics: R, Rapidminer, Mahut
Ziua 2: Sesiunea 4: Ecosistemul de predictive analytics – 2: Probleme comune de predictive analytics în sectorul guvernamental
- Insight analytics
- Analytics de vizualizare
- Predictive analytics structurat
- Predictive analytics nestructurat
- Profilarea amenințărilor/fraudstar/furnizorilor
- Motor de recomandare
- Detectarea tiparelor
- Descoperirea regulilor/scenariilor – eșec, fraudă, optimizare
- Descoperirea cauzelor profunde
- Analiza sentimentelor
- Analytics CRM
- Analytics de rețea
- Analytics de text
- Revizuire asistată de tehnologie
- Analytics antifraudă
- Analytics în timp real
Ziua 3: Sesiunea 1: Analytics în timp real și scalabil peste Hadoop
- De ce eșuează algoritmii analitici comuni în Hadoop/HDFS
- Apache Hama – pentru calcul distribuit Bulk Synchronous
- Apache SPARK – pentru cluster computing pentru analytics în timp real
- CMU Graphics Lab2 – abordare asincronă bazată pe grafuri pentru calculul distribuit
- Abordarea KNN p-Algebra de la Treeminer pentru costuri hardware reduse de operare
Ziua 3: Sesiunea 2: Instrumente pentru eDiscovery și Forensics
- eDiscovery peste Big Data vs. date legacy – o comparație a costurilor și performanței
- Predictive coding și revizuirea asistată de tehnologie (TAR)
- Demo live al unui produs TAR (vMiner) pentru a înțelege cum funcționează TAR pentru o descoperire mai rapidă
- Indexare mai rapidă prin HDFS – viteza datelor
- NLP sau procesarea limbajului natural – diverse tehnici și produse open source
- eDiscovery în limbi străine – tehnologie pentru procesarea limbilor străine
Ziua 3: Sesiunea 3: Big Data BI pentru securitate cibernetică – Înțelegerea vederii complete la 360 de grade, de la colectarea rapidă a datelor la identificarea amenințărilor
- Înțelegerea noțiunilor de bază ale security analytics – suprafața de atac, configurarea greșită a securității, apărările gazdei
- Infrastructura de rețea/datapipe de mari dimensiuni/ETL de răspuns pentru analytics în timp real
- Prescriptiv vs. predictiv – bazat pe reguli fixe vs. descoperirea automată a regulilor de amenințare din metadate
Ziua 3: Sesiunea 4: Big Data în USDA: Aplicații în agricultură
- Introducere în IoT (Internet of Things) pentru agricultură – Big Data bazat pe senzori și control
- Introducere în imagistica prin satelit și aplicarea sa în agricultură
- Integrarea datelor de la senzori și imagini pentru fertilitatea solului, recomandări de cultivare și prognoze
- Asigurările agricole și Big Data
- Prognoza pierderilor de recolte
Ziua 4: Sesiunea 1: BI de prevenire a fraudelor din Big Data în sectorul guvernamental – Analytics antifraudă:
- Clasificarea de bază a analytics antifraudă – bazat pe reguli vs. predictive analytics
- Machine learning supervizat vs. nesupervizat pentru detectarea tiparelor de fraudă
- Frauda furnizorilor/suprataxarea proiectelor
- Frauda Medicare și Medicaid – tehnici de detectare a fraudelor pentru procesarea cererilor de despăgubire
- Fraude la rambursarea cheltuielilor de călătorie
- Fraude la rambursările IRS
- Studii de caz și demo live vor fi oferite acolo unde datele sunt disponibile.
Ziua 4: Sesiunea 2: Social Media Analytics – Colectarea și analiza informațiilor
- API ETL Big Data pentru extragerea datelor din social media
- Text, imagini, metadate și video
- Analiza sentimentelor din fluxurile de social media
- Filtrarea contextuală și non-contextuală a fluxurilor de social media
- Social Media Dashboard pentru integrarea diverselor platforme de social media
- Profilarea automată a profilurilor de social media
- Demo live al fiecărui tip de analytics va fi oferit prin instrumentul Treeminer.
Ziua 4: Sesiunea 3: Big Data Analytics în procesarea imaginilor și fluxurilor video
- Tehnici de stocare a imaginilor în Big Data – soluții de stocare pentru date care depășesc petabytes
- LTFS și LTO
- GPFS-LTFS (soluție de stocare pe niveluri pentru date mari de imagini)
- Fundamentele analytics pentru imagini
- Recunoașterea obiectelor
- Segmentarea imaginilor
- Urmărirea mișcării
- Reconstrucția imaginilor 3D
Ziua 4: Sesiunea 4: Aplicații Big Data în NIH:
- Arii emergente ale bioinformaticii
- Metagenomica și problemele de Big Data mining
- Big Data Predictive Analytics pentru farmacogenomică, metabolomică și proteomică
- Big Data în procesele genomice downstream
- Aplicarea Big Data Predictive Analytics în sănătatea publică
Big Data Dashboard pentru accesibilitatea rapidă și afișarea datelor diverse:
- Integrarea platformei de aplicații existente cu Big Data Dashboard
- Managementul Big Data
- Studiu de caz al Big Data Dashboard: Tableau și Pentaho
- Folosirea aplicațiilor Big Data pentru a oferi servicii bazate pe locație în sectorul guvernamental
- Sistem de urmărire și management
Ziua 5: Sesiunea 1: Cum justifici implementarea Big Data BI în cadrul unei organizații:
- Definirea ROI-ului pentru implementarea Big Data
- Studii de caz pentru economisirea timpului analiștilor în colectarea și pregătirea datelor – creșterea productivității
- Studii de caz privind câștigurile din economisirea costurilor bazelor de date licențiate
- Câștiguri din serviciile bazate pe locație
- Economii din prevenirea fraudelor
- O abordare integrată cu foi de calcul pentru a calcula aproximativ cheltuielile vs. câștigurile/economiile din implementarea Big Data.
Ziua 5: Sesiunea 2: Procedura pas cu pas pentru înlocuirea sistemului de date legacy cu un sistem Big Data:
- Înțelegerea practică a foii de parcurs pentru migrarea Big Data
- Care sunt informațiile importante necesare înainte de a proiecta o implementare Big Data
- Care sunt diferitele modalități de calculare a volumului, vitezei, varietății și veridicității datelor
- Cum estimezi creșterea datelor
- Studii de caz
Ziua 5: Sesiunea 4: Revizuirea furnizorilor Big Data și analiza produselor lor. Sesiune de Q/A:
- Accenture
- APTEAN (fostul CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (fostul 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (parte a EMC)
Cerințe
- Cunoștințe de bază despre operațiunile de business și sistemele de date guvernamentale din domeniul lor
- Înțelegerea de bază a SQL/Oracle sau a bazelor de date relaționale
- Înțelegerea de bază a statisticii (la nivel de foaie de calcul)
Mărturii (1)
Abilitatea formatorului de a alinia cursul cu cerințele organizației, mai presus de a-l oferi doar pentru a îl prelua.
Masilonyane - Revenue Services Lesotho
Curs - Big Data Business Intelligence for Govt. Agencies
Tradus de catre o masina