Kontakt aufnehmen

Schulungsübersicht

Einführung, Ziele und Migrationsstrategie

  • Kursziele, Ausrichtung des Teilnehmerprofils und Erfolgskriterien
  • Übergreifende Migrationsansätze und Risikobetrachtungen
  • Einrichtung von Workspaces, Repositories und Labordatensätzen

Tag 1 — Grundlagen der Migration und Architektur

  • Lakehouse-Konzepte, Überblick über Delta Lake und Databricks-Architektur
  • Unterschiede zwischen SMP und MPP sowie Auswirkungen auf die Migration
  • Medallion-Design (Bronze→Silver→Gold) und Überblick über Unity Catalog

Tag 1 Labor — Überführung einer gespeicherten Prozedur

  • Praktische Migration einer Beispiel-gespeicherten Prozedur in ein Notebook
  • Zuordnung von Temp-Tabellen und Cursoren zu DataFrame-Transformationen
  • Validierung und Vergleich mit der ursprünglichen Ausgabe

Tag 2 — Fortgeschrittenes Delta Lake & inkrementelle Laden

  • ACID-Transaktionen, Commit-Logs, Versionierung und Time Travel
  • Auto Loader, MERGE INTO-Muster, Upserts und Schema-Evolution
  • OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Storage-Tuning

Tag 2 Labor — Inkrementelle Ingestion & Optimierung

  • Implementierung der Ingestion mit Auto Loader und MERGE-Workflows
  • Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
  • Messung der Verbesserungen bei der Lese-/Schreibperformance

Tag 3 — SQL in Databricks, Performance & Fehlersuche

  • Analytische SQL-Funktionen: Window Functions, Higher-Order Functions, JSON-/Array-Behandlung
  • Lesen des Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
  • Muster zur Abfrageoptimierung: Broadcast Joins, Hints, Caching und Reduzierung von Spill

Tag 3 Labor — SQL-Refactoring & Performance-Tuning

  • Refactoring eines aufwendigen SQL-Prozesses in optimiertes Spark SQL
  • Nutzung von Spark UI-Trace zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
  • Benchmarking vor/nachher und Dokumentation der Tuning-Schritte

Tag 4 — Taktisches PySpark: Ersetzen prozeduraler Logik

  • Spark-Ausführungsmodell: Driver, Executors, lazy evaluation und Partitionierungsstrategien
  • Transformation von Schleifen und Cursoren in vektorisierte DataFrame-Operationen
  • Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken

Tag 4 Labor — Refactoring prozeduraler Skripte

  • Refactoring eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
  • Einführung von Parametrisierung, unit-stilisierten Tests und wiederverwendbaren Funktionen
  • Code-Review und Anwendung einer Best-Practice-Checkliste

Tag 5 — Orchestrierung, End-to-End-Pipeline & Best Practices

  • Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
  • Design inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schema-Validierung
  • Integration mit Git (GitHub/Azure DevOps), CI und Teststrategien für PySpark-Logik

Tag 5 Labor — Aufbau einer vollständigen End-to-End-Pipeline

  • Zusammenbau einer Bronze→Silver→Gold-Pipeline, orchestriert mit Workflows
  • Implementierung von Logging, Auditing, Retries und automatisierten Validierungen
  • Ausführen der gesamten Pipeline, Validierung der Ausgaben und Vorbereitung von Deployment-Notizen

Operationalisierung, Governance und Produktionsreife

  • Unity Catalog Governance, Lineage und Best Practices für Zugriffssteuerungen
  • Kosten, Clustervergrösserung, Autoscaling und Job-Konkurrenz-Muster
  • Deployment-Checklisten, Rollback-Strategien und Erstellung von Runbooks

Abschlussbesprechung, Wissensvermittlung und nächste Schritte

  • Präsentationen der Teilnehmer zu Migrationsarbeiten und gelernten Lektionen
  • Lückenanalyse, empfohlene Folgetätigkeiten und Übergabe von Schulungsmaterialien
  • Referenzen, weitere Lernpfade und Support-Optionen

Voraussetzungen

  • Grundverständnis von Data-Engineering-Konzepten
  • Erfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
  • Vertrautheit mit Konzepten der ETL-Orchestrierung (ADF oder ähnliches)

Zielgruppe

  • Technische Manager mit Data-Engineering-Hintergrund
  • Data Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
  • Platform Engineers, die für den Einsatz von Databricks verantwortlich sind
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien