Kontakt aufnehmen

Schulungsübersicht

PySpark & Machine Learning 

Modul 1: Grundlagen von Big Data und Spark

  • Überblick über die Big-Data-Landschaft und die Rolle von Spark in modernen Datenplattformen
  • Verstehen der Spark-Architektur: Driver, Executors, Cluster-Manager, lazy evaluation, DAG und Execution Planning
  • Unterschiede zwischen RDD- und DataFrame-APIs sowie deren Einsatzgebiete
  • Erstellen und Konfigurieren von SparkSession sowie Verstehen der Grundlagen der Anwendungskonfiguration

Modul 2: PySpark DataFrames

  • Lesen und Schreiben von Daten aus Enterprise-Quellen und -Formaten (CSV, JSON, Parquet, Delta)
  • Arbeiten mit PySpark DataFrames: Transformationen, Aktionen, Spaltenausdrücke, Filterungen, Joins und Aggregationen
  • Implementierung fortgeschrittener Operationen wie Fensterfunktionen, Umgang mit Zeitstempeln und Arbeit mit verschachtelten Datenstrukturen
  • Durchführung von Data-Quality-Checks und Schreiben wiederverwendbaren, wartbaren PySpark-Codes

Modul 3: Effiziente Verarbeitung grosser Datensätze

  • Verstehen der Performance-Grundlagen: Partitionierungsstrategien, Shuffle-Verhalten, Caching und Persistenz
  • Anwendung von Optimierungstechniken wie Broadcast Joins und Analyse der Execution Plans
  • Effiziente Verarbeitung grosser Datensätze sowie Best Practices für skalierbare Datenworkflows
  • Verstehen von Schema-Evolution und modernen Speicherformaten in Enterprise-Umgebungen

Modul 4: Feature Engineering auf Scale

  • Feature Engineering mit Spark MLlib: Umgang mit fehlenden Werten, Codierung kategorialer Variablen und Featurescaling
  • Entwerfen wiederverwendbarer Preprocessing-Schritte und Vorbereiten von Datensätzen für Machine-Learning-Pipelines
  • Einführung in Feature Selection und Umgang mit unausgewogenen Datensätzen

Modul 5: Machine Learning mit Spark MLlib

  • Verstehen der MLlib-Architektur und des Estimator-Transformer-Musters
  • Training von Regressions- und Klassifikationsmodellen auf Scale (Lineare Regression, Logistische Regression, Entscheidungsbäume, Random Forest)
  • Vergleich von Modellen und Interpretation der Ergebnisse in verteilten Machine-Learning-Workflows

Modul 6: End-to-End-ML-Pipelines

  • Aufbau von End-to-End-Machine-Learning-Pipelines, die Preprocessing, Feature Engineering und Modellierung kombinieren
  • Anwendung von Strategien zur Aufteilung in Trainings-, Validierungs- und Testdaten
  • Durchführung der Kreuzvalidierung und Hyperparameter-Tuning mittels Grid Search und Random Search
  • Strukturierung reproduzierbarer Machine-Learning-Experimente

Modul 7: Modellbewertung & Praxisorientierte ML-Entscheidungen

  • Anwendung geeigneter Bewertungsmetriken für Regressions- und Klassifikationsprobleme
  • Erkennen von Overfitting und Underfitting sowie Treffen praxisorientierter Entscheidungen zur Modellauswahl
  • Interpretation der Feature-Wichtigkeit und Verständnis des Modellverhaltens

Modul 8: Produktion & Enterprise-Praktiken

  • Persistieren und Laden von Modellen in Spark
  • Implementierung von Batch-Inference-Workflows für grosse Datensätze
  • Verstehen des Machine-Learning-Lebenszyklus in Enterprise-Umgebungen
  • Einführung in Versionierung, Konzepte zur Experiment-Verfolgung und grundlegende Teststrategien

 

Praktische Ergebnisse

  • Fähigkeit zur autonomen Arbeit mit PySpark
  • Fähigkeit zur effizienten Verarbeitung grosser Datensätze
  • Fähigkeit zum Feature Engineering auf Scale
  • Fähigkeit zum Aufbau skalierbarer Machine-Learning-Pipelines

Voraussetzungen

Die Teilnehmenden sollten folgende Vorkenntnisse mitbringen:

Grundlegende Python-Programmierkenntnisse, einschliesslich der Arbeit mit Funktionen, Datenstrukturen und Bibliotheken
Grundlagenverständnis von Konzepten der Datenanalyse wie Datensätzen, Transformationen und Aggregationen
Grundkenntnisse in SQL und relationalen Datenkonzepten
Erste Vertrautheit mit ML-Konzepten wie Trainingsdatensätzen, Features und Bewertungsmetriken
Empfohlen wird die Erfahrung mit der Befehlszeile sowie Grundkenntnisse in Softwareentwicklungspraktiken

Erfahrungen mit Pandas, NumPy oder ähnlichen Datenverarbeitungsbibliotheken sind hilfreich, aber nicht zwingend erforderlich.

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien