Kontakt aufnehmen
 Dauer 35 Stunden

Schulungsübersicht

Jede Sitzung dauert 2 Stunden

Tag 1: Sitzung 1: Geschäftlicher Überblick: Warum Big Data Business Intelligence in der öffentlichen Verwaltung

  • Fallstudien aus dem NIH, DoE
  • Anpassungstempo von Big Data in Behörden und wie sie ihre zukünftigen Operationen an Big-Data-Prädiktive-Analytik ausrichten
  • Breitflächige Anwendungsbereiche in DoD, NSA, IRS, USDA usw.
  • Anbindung von Big Data an Legacy-Daten
  • Grundlegendes Verständnis der Enabling-Technologien in der prädiktiven Analytik
  • Datenintegration und Dashboard-Visualisierung
  • Betrugsmanagement
  • Erstellung von Business Rules / Betrugserkennung
  • Drohenerkennung und -profilierung
  • Kosten-Nutzen-Analyse für die Implementierung von Big Data

Tag 1: Sitzung 2: Einführung in Big Data-1

  • Hauptmerkmale von Big Data: Volumen, Vielfalt, Geschwindigkeit und Wahrheit. MPP-Architektur für das Volumen.
  • Datenwarenhäuser – statisches Schema, langsam evolvierender Datensatz
  • MPP-Datenbanken wie Greenplum, Exadata, Teradata, Netezza, Vertica usw.
  • Hadoop-basierte Lösungen – keine Einschränkungen an der Struktur des Datensatzes.
  • Typisches Muster: HDFS, MapReduce (Crunch), Abruf aus HDFS
  • Batch – geeignet für analytische/nicht-interaktive Vorgänge
  • Volumen: CEP-Streaming-Daten
  • Typische Auswahl – CEP-Produkte (z. B. Infostreams, Apama, MarkLogic usw.)
  • Weniger produktionsreif – Storm/S4
  • NoSQL-Datenbanken – (spaltenorientiert und Key-Value): Am besten geeignet als analytischer Zusatz zur Datenware/Datenbank

Tag 1: Sitzung 3: Einführung in Big Data-2

NoSQL-Lösungen

  • KV Store – Keyspace, Flare, SchemaFree, RAMCloud, Oracle NoSQL Database (OnDB)
  • KV Store – Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb, DovetailDB
  • KV Store (Hierarchisch) – GT.m, Cache
  • KV Store (Ordnungsgemäß) – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB, Actord
  • KV Cache – Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity, Terracoqua
  • Tuple Store – Gigaspaces, Coord, Apache River
  • Objektdatenbank – ZopeDB, DB40, Shoal
  • Dokumentenspeicher – CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-Datenbanken, ThruDB, CloudKit, Prsevere, Riak-Basho, Scalaris
  • Weite Spaltenspeicher – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase, KDI

Varietäten von Daten: Einführung in die Herausforderung der Datenbereinigung in Big Data

  • RDBMS – statische Struktur/Schema, fördert keine agilen, explorativen Umgebungen.
  • NoSQL – semistrukturiert, genug Struktur, um Daten ohne exaktes Schema vor der Speicherung zu speichern
  • Herausforderungen der Datenbereinigung

Tag 1: Sitzung 4: Einführung in Big Data-3: Hadoop

  • Wann Hadoop auswählen?
  • STRUKTURIERT – Enterprise-Datenwarenhäuser/-Datenbanken können massive Daten speichern (zu Kosten), erzwängen aber Struktur (nicht gut für aktive Exploration)
  • SEMISTRAKTURIERTEN Daten – schwer mit traditionellen Lösungen (DW/DB) zu bewältigen
  • Ablagung von Daten = GROßE Anstrengung und statisch auch nach Implementierung
  • Für Vielfalt & Volumen von Daten, verarbeitet auf Commodity-Hardware – HADOOP
  • Commodity-H/W erforderlich zum Aufbau eines Hadoop-Clusters

Einführung in MapReduce/HDFS

  • MapReduce – Verteiltes Rechnen über mehrere Server
  • HDFS – Daten lokal für den Rechenprozess verfügbar machen (mit Redundanz)
  • Daten – können unstrukturiert/ohne Schema sein (im Gegensatz zu RDBMS)
  • Entwicklerverantwortung, Sinn aus Daten zu machen
  • Programmierung von MapReduce = Arbeiten mit Java (Vorteile/Nachteile), manuelles Laden von Daten in HDFS

Tag 2: Sitzung 1: Big-Data-Ökosystem – Aufbau von Big-Data-ETL: Das Universum der Big-Data-Tools – welches benutzen und wann?

  • Hadoop vs. Andere NoSQL-Lösungen
  • Für interaktiven, zufälligen Zugriff auf Daten
  • Hbase (spaltenorientierte Datenbank) auf Basis von Hadoop
  • Zufälliger Zugriff auf Daten, aber mit Einschränkungen (max. 1 PB)
  • Nicht gut für Ad-hoc-Analytik, gut für Logging, Zählung, Zeitreihen
  • Sqoop – Import aus Datenbanken in Hive oder HDFS (JDBC/ODBC-Zugriff)
  • Flume – Streaming von Daten (z. B. Log-Daten) in HDFS

Tag 2: Sitzung 2: Big-Data-Management-System

  • Bewegliche Teile, Start/Ausfall von Compute-Nodes: ZooKeeper – für Konfiguration/Koordination/Namensdienste
  • Komplexe Pipeline/Workflow: Oozie – Verwaltung von Workflows, Abhängigkeiten, Kettenbildung
  • Bereitstellung, Konfiguration, Cluster-Management, Upgrades usw. (Systemadministration): Ambari
  • In der Cloud: Whirr

Tag 2: Sitzung 3: Prädiktive Analytik in Business Intelligence-1: Grundlegende Techniken & Machine-Learning-basierte BI:

  • Einführung in Machine Learning
  • Lernen von Klassifikationstechniken
  • Bayesche Vorhersage – Vorbereiten der Trainingsdatei
  • Support Vector Machine
  • KNN p-Tree Algebra & vertikales Mining
  • Neuronales Netz
  • Big Data Problem mit vielen Variablen – Random Forest (RF)
  • Big Data Automatisierungsproblem – Multi-Modell-Ensemble RF
  • Automatisierung durch Soft10-M
  • Textanalytik-Tool – Treeminer
  • Agiles Lernen
  • Agentenbasiertes Lernen
  • Verteiltes Lernen
  • Einführung in Open-Source-Tools für prädiktive Analytik: R, Rapidminer, Mahut

Tag 2: Sitzung 4 Prädiktive Analytik-Ökosystem-2: Gemeinsame prädiktive Analytik-Probleme in der öffentlichen Verwaltung.

  • Insights-Analytik
  • Visualisierungs-Analytik
  • Strukturierte prädiktive Analytik
  • Unstrukturierte prädiktive Analytik
  • Drohnen/Betrüger/Zulieferer-Profiling
  • Empfehlungs-Engine
  • Mustererkennung
  • Regel-/Szenario-Entdeckung – Fehlschlag, Betrug, Optimierung
  • Ursachenerkennung
  • Sentiment-Analyse
  • CRM-Analytik
  • Netzwerk-Analytik
  • Text-Analytik
  • Technologie-gestützte Überprüfung
  • Betrugsanalytik
  • Echtzeit-Analytik

Tag 3: Sitzung 1: Echtzeit- und skalierbare Analytik über Hadoop

  • Warum gängige analytische Algorithmen in Hadoop/HDFS fehlschlagen
  • Apache Hama – für Bulk-Synchronous verteiltes Rechnen
  • Apache SPARK – für Cluster-Rechnen für Echtzeit-Analytik
  • CMU Graphics Lab2 – Graphenbasierte asynchrone Herangehensweise an verteiltes Rechnen
  • KNN p-Algebra-basierte Herangehensweise von Treeminer für reduzierte Hardwarekosten im Betrieb

Tag 3: Sitzung 2: Tools für eDiscovery und Forensik

  • eDiscovery über Big Data vs. Legacy-Daten – ein Vergleich von Kosten und Leistung
  • Prädiktive Codierung und technologie-gestützte Überprüfung (TAR)
  • Live-Demo eines TAR-Produkts (vMiner), um zu verstehen, wie TAR für schnellere Entdeckung funktioniert
  • Schnellere Indizierung durch HDFS – Geschwindigkeit der Daten
  • NLP oder Natural Language Processing – verschiedene Techniken und Open-Source-Produkte
  • eDiscovery in Fremdsprachen – Technologie für die Verarbeitung von Fremdsprachen

Tag 3: Sitzung 3: Big-Data-BI für Cybersicherheit – Verständnis der ganzen 360-Grad-Ansicht von schneller Datenerfassung bis zur Drohenerkennung

  • Verständnis der Grundlagen der Sicherheitsanalytik – Angriffsfläche, Sicherheitskonfigurationsfehler, Host-Abwehr
  • Netzwerkinfrastruktur/ Large Data Pipeline/ Response-ETL für Echtzeit-Analytik
  • Präskriptiv vs. Prädiktiv – Feste regelbasierte vs. automatische Entdeckung von Drohnenregeln aus Metadaten

Tag 3: Sitzung 4: Big Data im USDA: Anwendung in der Landwirtschaft

  • Einführung in IoT (Internet of Things) für die Landwirtschaft – sensorbasiertes Big Data und Steuerung
  • Einführung in Satellitenbildgebung und ihre Anwendung in der Landwirtschaft
  • Integration von Sensor- und Bilddaten für Bodenfruchtbarkeit, Kulturempfehlung und Prognose
  • Landwirtschaftsversicherung und Big Data
  • Entwurfsverlust-Prognose

Tag 4: Sitzung 1: Betrugsvorbeugung BI aus Big Data in der öffentlichen Verwaltung – Betrugsanalytik:

  • Grundlegende Klassifizierung der Betrugsanalytik – regelbasiert vs. prädiktive Analytik
  • Überwachte vs. unüberwachte Machine Learning für die Erkennung von Betrugs Mustern
  • Zuliefererbetrug/Überladung für Projekte
  • Medicare- und Medicaid-Betrug – Betrugs-Entdeckungstechniken für die Abrechnungsverarbeitung
  • Reisenebenkosten-Betrug
  • IRS-Erstattungsbetrug
  • Fallstudien und Live-Demos werden gegeben, wo Daten verfügbar sind.

Tag 4: Sitzung 2: Social-Media-Analytik – Informationsgewinnung und -analyse

  • Big-Data-ETL-API für die Extraktion von Social-Media-Daten
  • Text, Bild, Metadaten und Video
  • Sentiment-Analyse aus Social-Media-Feeds
  • Kontextuelle und nicht-kontextuelle Filterung von Social-Media-Feeds
  • Social-Media-Dashboard zur Integration vielfältiger Social-Media
  • Automatisierte Profilierung von Social-Media-Profilen
  • Live-Demo jeder Analytik wird durch das Treeminer-Tool gegeben.

Tag 4: Sitzung 3: Big-Data-Analytik in Bildverarbeitung und Video-Feeds

  • Bildspeichertechniken in Big Data – Speicherlösung für Daten über Petabytes
  • LTFS und LTO
  • GPFS-LTFS (Schichtbasierte Speicherlösung für große Bilddaten)
  • Grundlagen der Bildanalytik
  • Objekterkennung
  • Bildsegmentierung
  • Bewegungserfassung
  • 3-D-Bildrekonstruktion

Tag 4: Sitzung 4: Big-Data-Anwendungen im NIH:

  • Aufstrebende Bereiche der Bioinformatik
  • Metagenomik und Big-Data-Mining-Herausforderungen
  • Big-Data-prädiktive Analytik für Pharmakogenomik, Metabolomik und Proteomik
  • Big Data im downstream Genomics-Prozess
  • Anwendung der Big-Data-prädiktiven Analytik in der öffentlichen Gesundheit

Big-Data-Dashboard für schnellen Zugang zu vielfältigen Daten und Anzeige:

  • Integration der bestehenden Anwendungsumgebung mit dem Big-Data-Dashboard
  • Big-Data-Management
  • Fallstudie eines Big-Data-Dashboards: Tableau und Pentaho
  • Nutzung der Big-Data-App, um ortsbezogene Dienste in der öffentlichen Verwaltung zu fördern.
  • Tracking-System und Verwaltung

Tag 5: Sitzung 1: Wie rechtfertigt man die Implementierung von Big Data BI innerhalb einer Organisation:

  • Definition des ROI für die Big-Data-Implementierung
  • Fallstudien zur Einsparung von Analytiker-Zeit für die Datensammlung und -vorbereitung – Produktivitätssteigerung
  • Fallstudien zur Umsatzsteigerung durch Einsparung der lizenzierten Datenbankkosten
  • Umsatzsteigerung aus ortsbezogenen Diensten
  • Einsparungen durch Betrugsvorbeugung
  • Ein integrierter Kalkulationsblatt-Ansatz zur Berechnung der approx. Ausgaben vs. Umsatzsteigerung/Einsparungen aus der Big-Data-Implementierung.

Tag 5: Sitzung 2: Schritt-für-Schritt-Anleitung, um das Legacy-Dateisystem durch ein Big-Data-System zu ersetzen:

  • Verständnis eines praktischen Big-Data-Migrations-Roadmaps
  • Welche wichtigen Informationen vor der Architektur einer Big-Data-Implementierung benötigt werden
  • Welche verschiedenen Wege der Berechnung von Volumen, Geschwindigkeit, Vielfalt und Wahrheit von Daten existieren
  • Wie Datenwachstum geschätzt wird
  • Fallstudien

Tag 5: Sitzung 4: Übersicht über Big-Data-Vendor und deren Produkte. Q&A-Sitzung:

  • Accenture
  • APTEAN (Ehemals CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (Ehemals 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (Teil von EMC)

Voraussetzungen

  • Grundlegende Kenntnisse der Geschäftsabläufe und Datenysteme in der öffentlichen Verwaltung in ihrem Fachbereich
  • Grundlegendes Verständnis von SQL/Oracle oder relationalen Datenbanken
  • Grundlegendes Verständnis der Statistik (auf Kalkulationsblatt-Ebene)

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien