Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 35 Stunden
Schulungsübersicht
Jede Sitzung dauert 2 Stunden
Tag 1: Sitzung 1: Geschäftlicher Überblick: Warum Big Data Business Intelligence in der öffentlichen Verwaltung
- Fallstudien aus dem NIH, DoE
- Anpassungstempo von Big Data in Behörden und wie sie ihre zukünftigen Operationen an Big-Data-Prädiktive-Analytik ausrichten
- Breitflächige Anwendungsbereiche in DoD, NSA, IRS, USDA usw.
- Anbindung von Big Data an Legacy-Daten
- Grundlegendes Verständnis der Enabling-Technologien in der prädiktiven Analytik
- Datenintegration und Dashboard-Visualisierung
- Betrugsmanagement
- Erstellung von Business Rules / Betrugserkennung
- Drohenerkennung und -profilierung
- Kosten-Nutzen-Analyse für die Implementierung von Big Data
Tag 1: Sitzung 2: Einführung in Big Data-1
- Hauptmerkmale von Big Data: Volumen, Vielfalt, Geschwindigkeit und Wahrheit. MPP-Architektur für das Volumen.
- Datenwarenhäuser – statisches Schema, langsam evolvierender Datensatz
- MPP-Datenbanken wie Greenplum, Exadata, Teradata, Netezza, Vertica usw.
- Hadoop-basierte Lösungen – keine Einschränkungen an der Struktur des Datensatzes.
- Typisches Muster: HDFS, MapReduce (Crunch), Abruf aus HDFS
- Batch – geeignet für analytische/nicht-interaktive Vorgänge
- Volumen: CEP-Streaming-Daten
- Typische Auswahl – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic usw.)
- Weniger produktionsreif – Storm/S4
- NoSQL-Datenbanken – (spaltenorientiert und Key-Value): Am besten geeignet als analytischer Zusatz zur Datenware/Datenbank
Tag 1: Sitzung 3: Einführung in Big Data-2
NoSQL-Lösungen
- KV Store – Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
- KV Store – Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
- KV Store (Hierarchisch) – GT.m, Cache
- KV Store (Ordnungsgemäß) – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
- KV Cache – Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
- Tuple Store – Gigaspaces, Coord, Apache River
- Objektdatenbank – ZopeDB, DB40, Shoal
- Dokumentenspeicher – CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
- Weite Spaltenspeicher – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI
Varietäten von Daten: Einführung in die Herausforderung der Datenbereinigung in Big Data
- RDBMS – statische Struktur/Schema, fördert keine agilen, explorativen Umgebungen.
- NoSQL – semistrukturiert, genug Struktur, um Daten ohne exaktes Schema vor der Speicherung zu speichern
- Herausforderungen der Datenbereinigung
Tag 1: Sitzung 4: Einführung in Big Data-3: Hadoop
- Wann Hadoop auswählen?
- STRUKTURIERT – Enterprise-Datenwarenhäuser/-Datenbanken können massive Daten speichern (zu Kosten), erzwängen aber Struktur (nicht gut für aktive Exploration)
- SEMISTRAKTURIERTEN Daten – schwer mit traditionellen Lösungen (DW/DB) zu bewältigen
- Ablagung von Daten = GROßE Anstrengung und statisch auch nach Implementierung
- Für Vielfalt & Volumen von Daten, verarbeitet auf Commodity-Hardware – HADOOP
- Commodity-H/W erforderlich zum Aufbau eines Hadoop-Clusters
Einführung in MapReduce/HDFS
- MapReduce – Verteiltes Rechnen über mehrere Server
- HDFS – Daten lokal für den Rechenprozess verfügbar machen (mit Redundanz)
- Daten – können unstrukturiert/ohne Schema sein (im Gegensatz zu RDBMS)
- Entwicklerverantwortung, Sinn aus Daten zu machen
- Programmierung von MapReduce = Arbeiten mit Java (Vorteile/Nachteile), manuelles Laden von Daten in HDFS
Tag 2: Sitzung 1: Big-Data-Ökosystem – Aufbau von Big-Data-ETL: Das Universum der Big-Data-Tools – welches benutzen und wann?
- Hadoop vs. Andere NoSQL-Lösungen
- Für interaktiven, zufälligen Zugriff auf Daten
- Hbase (spaltenorientierte Datenbank) auf Basis von Hadoop
- Zufälliger Zugriff auf Daten, aber mit Einschränkungen (max. 1 PB)
- Nicht gut für Ad-hoc-Analytik, gut für Logging, Zählung, Zeitreihen
- Sqoop – Import aus Datenbanken in Hive oder HDFS (JDBC/ODBC-Zugriff)
- Flume – Streaming von Daten (z. B. Log-Daten) in HDFS
Tag 2: Sitzung 2: Big-Data-Management-System
- Bewegliche Teile, Start/Ausfall von Compute-Nodes: ZooKeeper – für Konfiguration/Koordination/Namensdienste
- Komplexe Pipeline/Workflow: Oozie – Verwaltung von Workflows, Abhängigkeiten, Kettenbildung
- Bereitstellung, Konfiguration, Cluster-Management, Upgrades usw. (Systemadministration): Ambari
- In der Cloud: Whirr
Tag 2: Sitzung 3: Prädiktive Analytik in Business Intelligence-1: Grundlegende Techniken & Machine-Learning-basierte BI:
- Einführung in Machine Learning
- Lernen von Klassifikationstechniken
- Bayesche Vorhersage – Vorbereiten der Trainingsdatei
- Support Vector Machine
- KNN p-Tree Algebra & vertikales Mining
- Neuronales Netz
- Big Data Problem mit vielen Variablen – Random Forest (RF)
- Big Data Automatisierungsproblem – Multi-Modell-Ensemble RF
- Automatisierung durch Soft10-M
- Textanalytik-Tool – Treeminer
- Agiles Lernen
- Agentenbasiertes Lernen
- Verteiltes Lernen
- Einführung in Open-Source-Tools für prädiktive Analytik: R, Rapidminer, Mahut
Tag 2: Sitzung 4 Prädiktive Analytik-Ökosystem-2: Gemeinsame prädiktive Analytik-Probleme in der öffentlichen Verwaltung.
- Insights-Analytik
- Visualisierungs-Analytik
- Strukturierte prädiktive Analytik
- Unstrukturierte prädiktive Analytik
- Drohnen/Betrüger/Zulieferer-Profiling
- Empfehlungs-Engine
- Mustererkennung
- Regel-/Szenario-Entdeckung – Fehlschlag, Betrug, Optimierung
- Ursachenerkennung
- Sentiment-Analyse
- CRM-Analytik
- Netzwerk-Analytik
- Text-Analytik
- Technologie-gestützte Überprüfung
- Betrugsanalytik
- Echtzeit-Analytik
Tag 3: Sitzung 1: Echtzeit- und skalierbare Analytik über Hadoop
- Warum gängige analytische Algorithmen in Hadoop/HDFS fehlschlagen
- Apache Hama – für Bulk-Synchronous verteiltes Rechnen
- Apache SPARK – für Cluster-Rechnen für Echtzeit-Analytik
- CMU Graphics Lab2 – Graphenbasierte asynchrone Herangehensweise an verteiltes Rechnen
- KNN p-Algebra-basierte Herangehensweise von Treeminer für reduzierte Hardwarekosten im Betrieb
Tag 3: Sitzung 2: Tools für eDiscovery und Forensik
- eDiscovery über Big Data vs. Legacy-Daten – ein Vergleich von Kosten und Leistung
- Prädiktive Codierung und technologie-gestützte Überprüfung (TAR)
- Live-Demo eines TAR-Produkts (vMiner), um zu verstehen, wie TAR für schnellere Entdeckung funktioniert
- Schnellere Indizierung durch HDFS – Geschwindigkeit der Daten
- NLP oder Natural Language Processing – verschiedene Techniken und Open-Source-Produkte
- eDiscovery in Fremdsprachen – Technologie für die Verarbeitung von Fremdsprachen
Tag 3: Sitzung 3: Big-Data-BI für Cybersicherheit – Verständnis der ganzen 360-Grad-Ansicht von schneller Datenerfassung bis zur Drohenerkennung
- Verständnis der Grundlagen der Sicherheitsanalytik – Angriffsfläche, Sicherheitskonfigurationsfehler, Host-Abwehr
- Netzwerkinfrastruktur/ Large Data Pipeline/ Response-ETL für Echtzeit-Analytik
- Präskriptiv vs. Prädiktiv – Feste regelbasierte vs. automatische Entdeckung von Drohnenregeln aus Metadaten
Tag 3: Sitzung 4: Big Data im USDA: Anwendung in der Landwirtschaft
- Einführung in IoT (Internet of Things) für die Landwirtschaft – sensorbasiertes Big Data und Steuerung
- Einführung in Satellitenbildgebung und ihre Anwendung in der Landwirtschaft
- Integration von Sensor- und Bilddaten für Bodenfruchtbarkeit, Kulturempfehlung und Prognose
- Landwirtschaftsversicherung und Big Data
- Entwurfsverlust-Prognose
Tag 4: Sitzung 1: Betrugsvorbeugung BI aus Big Data in der öffentlichen Verwaltung – Betrugsanalytik:
- Grundlegende Klassifizierung der Betrugsanalytik – regelbasiert vs. prädiktive Analytik
- Überwachte vs. unüberwachte Machine Learning für die Erkennung von Betrugs Mustern
- Zuliefererbetrug/Überladung für Projekte
- Medicare- und Medicaid-Betrug – Betrugs-Entdeckungstechniken für die Abrechnungsverarbeitung
- Reisenebenkosten-Betrug
- IRS-Erstattungsbetrug
- Fallstudien und Live-Demos werden gegeben, wo Daten verfügbar sind.
Tag 4: Sitzung 2: Social-Media-Analytik – Informationsgewinnung und -analyse
- Big-Data-ETL-API für die Extraktion von Social-Media-Daten
- Text, Bild, Metadaten und Video
- Sentiment-Analyse aus Social-Media-Feeds
- Kontextuelle und nicht-kontextuelle Filterung von Social-Media-Feeds
- Social-Media-Dashboard zur Integration vielfältiger Social-Media
- Automatisierte Profilierung von Social-Media-Profilen
- Live-Demo jeder Analytik wird durch das Treeminer-Tool gegeben.
Tag 4: Sitzung 3: Big-Data-Analytik in Bildverarbeitung und Video-Feeds
- Bildspeichertechniken in Big Data – Speicherlösung für Daten über Petabytes
- LTFS und LTO
- GPFS-LTFS (Schichtbasierte Speicherlösung für große Bilddaten)
- Grundlagen der Bildanalytik
- Objekterkennung
- Bildsegmentierung
- Bewegungserfassung
- 3-D-Bildrekonstruktion
Tag 4: Sitzung 4: Big-Data-Anwendungen im NIH:
- Aufstrebende Bereiche der Bioinformatik
- Metagenomik und Big-Data-Mining-Herausforderungen
- Big-Data-prädiktive Analytik für Pharmakogenomik, Metabolomik und Proteomik
- Big Data im downstream Genomics-Prozess
- Anwendung der Big-Data-prädiktiven Analytik in der öffentlichen Gesundheit
Big-Data-Dashboard für schnellen Zugang zu vielfältigen Daten und Anzeige:
- Integration der bestehenden Anwendungsumgebung mit dem Big-Data-Dashboard
- Big-Data-Management
- Fallstudie eines Big-Data-Dashboards: Tableau und Pentaho
- Nutzung der Big-Data-App, um ortsbezogene Dienste in der öffentlichen Verwaltung zu fördern.
- Tracking-System und Verwaltung
Tag 5: Sitzung 1: Wie rechtfertigt man die Implementierung von Big Data BI innerhalb einer Organisation:
- Definition des ROI für die Big-Data-Implementierung
- Fallstudien zur Einsparung von Analytiker-Zeit für die Datensammlung und -vorbereitung – Produktivitätssteigerung
- Fallstudien zur Umsatzsteigerung durch Einsparung der lizenzierten Datenbankkosten
- Umsatzsteigerung aus ortsbezogenen Diensten
- Einsparungen durch Betrugsvorbeugung
- Ein integrierter Kalkulationsblatt-Ansatz zur Berechnung der approx. Ausgaben vs. Umsatzsteigerung/Einsparungen aus der Big-Data-Implementierung.
Tag 5: Sitzung 2: Schritt-für-Schritt-Anleitung, um das Legacy-Dateisystem durch ein Big-Data-System zu ersetzen:
- Verständnis eines praktischen Big-Data-Migrations-Roadmaps
- Welche wichtigen Informationen vor der Architektur einer Big-Data-Implementierung benötigt werden
- Welche verschiedenen Wege der Berechnung von Volumen, Geschwindigkeit, Vielfalt und Wahrheit von Daten existieren
- Wie Datenwachstum geschätzt wird
- Fallstudien
Tag 5: Sitzung 4: Übersicht über Big-Data-Vendor und deren Produkte. Q&A-Sitzung:
- Accenture
- APTEAN (Ehemals CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (Ehemals 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (Teil von EMC)
Voraussetzungen
- Grundlegende Kenntnisse der Geschäftsabläufe und Datenysteme in der öffentlichen Verwaltung in ihrem Fachbereich
- Grundlegendes Verständnis von SQL/Oracle oder relationalen Datenbanken
- Grundlegendes Verständnis der Statistik (auf Kalkulationsblatt-Ebene)
Erfahrungsberichte (1)
Die Fähigkeit des Trainers, den Kurs den Anforderungen der Organisation anzupassen, anstatt ihn nur zur Erbringung zu geben.
Masilonyane - Revenue Services Lesotho
Kurs - Big Data Business Intelligence for Govt. Agencies
Maschinelle Übersetzung