Kontakt aufnehmen

Schulungsübersicht

Databricks Platform und Lakehouse-Grundlagen

  • Lakehouse-Architektur und Komponenten von Databricks
  • Organisation von Workspaces und Catalogs

Databricks Workspace und Notebooks

  • Navigation im Workspace und Entwicklung auf Notebook-Basis
  • Strukturierung des Codes in wiederverwendbaren Notebboks

Apache Spark-Architektur und Ausführung

  • Spark-Laufzeitarchitektur und Ausführungsmodell
  • Träge Auswertung (Lazy Evaluation) und der Job-DAG

PySpark DataFrames und die DataFrame-API

  • DataFrame-Abstraktionen und Schemata
  • Kernoperationen für DataFrames und Column-Ausdrücke

Übersetzung von SQL in PySpark DataFrames

  • Übersetzung der zentralen SQL-Klauseln in DataFrame-Operationen
  • Fensterfunktionen und Aggregationen in PySpark

Lesen und Schreiben von Daten in Databricks

  • Lesen aus gängigen Datei- und Datenbankquellen
  • Schreiben und Partitionieren von Daten im Lakehouse

Delta Lake und Tabellenverwaltung

  • Delta-Tabellen und ACID-Transaktionen
  • Time Travel und Schema Evolution

Muster zur Datenbereinigung und Transformation

  • Datenbereinigung und Typanpassung
  • Erstellung wiederverwendbarer Transformationslogik

Benutzerdefinierte Funktionen und modularer Code

  • Python UDFs und pandas UDFs
  • Auslagerung prozeduraler Logik in Funktionen zur Modularisierung

Performance-Tuning und Optimierung

  • Partitions- und Caching-Strategien
  • Diagnose von Engpässen mit der Spark UI

Grundlagen des Structured Streaming

  • Vergleich von Batch- und Streaming-Verarbeitungsmodellen
  • Streaming DataFrames und einfache Aggregationen

Databricks Jobs und Workflow-Orchestrierung

  • Planung von Notebboks als Jobs und Aufgaben
  • Erstellung von Multi-Schritt-Workflows mit Abhängigkeiten

Unity Catalog und Data Governance

  • Architektur und Namespaces von Unity Catalog
  • Zugriffskontrolle und Datenherkunft (Data Lineage)

Testing, Debugging und Produktionspraktiken

  • Unit-Tests für PySpark-Logik
  • Debugging und Code-Qualitätsstandards

End-to-End Use Cases in der Finanzbranche

  • Aufbau einer end-to-End-Banking-ETL-Pipeline
  • Übersetzung von Legacy-SQL-Prozessen in PySpark

Migrieren von SQL-Workloads zu PySpark

  • Migrationsstrategie und Planungsansätze
  • Inkrementelle Konvertierung von SQL-Workflows in PySpark

Voraussetzungen

  • Erfahrung mit Python-Programmierung, einschließlich Funktionen und Datentypen
  • Grundkenntnisse in SQL, insbesondere bei Joins, Aggregationen und Unterabfragen
  • Keine Vorerfahrung mit Databricks oder PySpark erforderlich

Zielgruppe

  • Data Engineers, Data Analysts und Data Professionals
  • Teams, die bestehende SQL-basierte Workflows zu Databricks und PySpark migrieren
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien