Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung, Ziele und Migrationsstrategie
- Kursziele, Ausrichtung des Teilnehmerprofils und Erfolgskriterien
- Übergreifende Migrationsansätze und Risikobetrachtungen
- Einrichtung von Workspaces, Repositories und Labordatensätzen
Tag 1 — Grundlagen der Migration und Architektur
- Lakehouse-Konzepte, Überblick über Delta Lake und Databricks-Architektur
- Unterschiede zwischen SMP und MPP sowie Auswirkungen auf die Migration
- Medallion-Design (Bronze→Silver→Gold) und Überblick über Unity Catalog
Tag 1 Labor — Überführung einer gespeicherten Prozedur
- Praktische Migration einer Beispiel-gespeicherten Prozedur in ein Notebook
- Zuordnung von Temp-Tabellen und Cursoren zu DataFrame-Transformationen
- Validierung und Vergleich mit der ursprünglichen Ausgabe
Tag 2 — Fortgeschrittenes Delta Lake & inkrementelle Laden
- ACID-Transaktionen, Commit-Logs, Versionierung und Time Travel
- Auto Loader, MERGE INTO-Muster, Upserts und Schema-Evolution
- OPTIMIZE, VACUUM, Z-ORDER, Partitionierung und Storage-Tuning
Tag 2 Labor — Inkrementelle Ingestion & Optimierung
- Implementierung der Ingestion mit Auto Loader und MERGE-Workflows
- Anwendung von OPTIMIZE, Z-ORDER und VACUUM; Validierung der Ergebnisse
- Messung der Verbesserungen bei der Lese-/Schreibperformance
Tag 3 — SQL in Databricks, Performance & Fehlersuche
- Analytische SQL-Funktionen: Window Functions, Higher-Order Functions, JSON-/Array-Behandlung
- Lesen des Spark UI, DAGs, Shuffles, Stages, Tasks und Diagnose von Engpässen
- Muster zur Abfrageoptimierung: Broadcast Joins, Hints, Caching und Reduzierung von Spill
Tag 3 Labor — SQL-Refactoring & Performance-Tuning
- Refactoring eines aufwendigen SQL-Prozesses in optimiertes Spark SQL
- Nutzung von Spark UI-Trace zur Identifizierung und Behebung von Skew- und Shuffle-Problemen
- Benchmarking vor/nachher und Dokumentation der Tuning-Schritte
Tag 4 — Taktisches PySpark: Ersetzen prozeduraler Logik
- Spark-Ausführungsmodell: Driver, Executors, lazy evaluation und Partitionierungsstrategien
- Transformation von Schleifen und Cursoren in vektorisierte DataFrame-Operationen
- Modularisierung, UDFs/pandas UDFs, Widgets und wiederverwendbare Bibliotheken
Tag 4 Labor — Refactoring prozeduraler Skripte
- Refactoring eines prozeduralen ETL-Skripts in modulare PySpark-Notebooks
- Einführung von Parametrisierung, unit-stilisierten Tests und wiederverwendbaren Funktionen
- Code-Review und Anwendung einer Best-Practice-Checkliste
Tag 5 — Orchestrierung, End-to-End-Pipeline & Best Practices
- Databricks Workflows: Job-Design, Task-Abhängigkeiten, Trigger und Fehlerbehandlung
- Design inkrementeller Medallion-Pipelines mit Qualitätsregeln und Schema-Validierung
- Integration mit Git (GitHub/Azure DevOps), CI und Teststrategien für PySpark-Logik
Tag 5 Labor — Aufbau einer vollständigen End-to-End-Pipeline
- Zusammenbau einer Bronze→Silver→Gold-Pipeline, orchestriert mit Workflows
- Implementierung von Logging, Auditing, Retries und automatisierten Validierungen
- Ausführen der gesamten Pipeline, Validierung der Ausgaben und Vorbereitung von Deployment-Notizen
Operationalisierung, Governance und Produktionsreife
- Unity Catalog Governance, Lineage und Best Practices für Zugriffssteuerungen
- Kosten, Clustervergrösserung, Autoscaling und Job-Konkurrenz-Muster
- Deployment-Checklisten, Rollback-Strategien und Erstellung von Runbooks
Abschlussbesprechung, Wissensvermittlung und nächste Schritte
- Präsentationen der Teilnehmer zu Migrationsarbeiten und gelernten Lektionen
- Lückenanalyse, empfohlene Folgetätigkeiten und Übergabe von Schulungsmaterialien
- Referenzen, weitere Lernpfade und Support-Optionen
Voraussetzungen
- Grundverständnis von Data-Engineering-Konzepten
- Erfahrung mit SQL und gespeicherten Prozeduren (Synapse / SQL Server)
- Vertrautheit mit Konzepten der ETL-Orchestrierung (ADF oder ähnliches)
Zielgruppe
- Technische Manager mit Data-Engineering-Hintergrund
- Data Engineers, die prozedurale OLAP-Logik in Lakehouse-Muster überführen
- Platform Engineers, die für den Einsatz von Databricks verantwortlich sind
35 Stunden