Schulungsübersicht
Databricks Platform und Lakehouse-Grundlagen
- Lakehouse-Architektur und Komponenten von Databricks
- Organisation von Workspaces und Catalogs
Databricks Workspace und Notebooks
- Navigation im Workspace und Entwicklung auf Notebook-Basis
- Strukturierung des Codes in wiederverwendbaren Notebboks
Apache Spark-Architektur und Ausführung
- Spark-Laufzeitarchitektur und Ausführungsmodell
- Träge Auswertung (Lazy Evaluation) und der Job-DAG
PySpark DataFrames und die DataFrame-API
- DataFrame-Abstraktionen und Schemata
- Kernoperationen für DataFrames und Column-Ausdrücke
Übersetzung von SQL in PySpark DataFrames
- Übersetzung der zentralen SQL-Klauseln in DataFrame-Operationen
- Fensterfunktionen und Aggregationen in PySpark
Lesen und Schreiben von Daten in Databricks
- Lesen aus gängigen Datei- und Datenbankquellen
- Schreiben und Partitionieren von Daten im Lakehouse
Delta Lake und Tabellenverwaltung
- Delta-Tabellen und ACID-Transaktionen
- Time Travel und Schema Evolution
Muster zur Datenbereinigung und Transformation
- Datenbereinigung und Typanpassung
- Erstellung wiederverwendbarer Transformationslogik
Benutzerdefinierte Funktionen und modularer Code
- Python UDFs und pandas UDFs
- Auslagerung prozeduraler Logik in Funktionen zur Modularisierung
Performance-Tuning und Optimierung
- Partitions- und Caching-Strategien
- Diagnose von Engpässen mit der Spark UI
Grundlagen des Structured Streaming
- Vergleich von Batch- und Streaming-Verarbeitungsmodellen
- Streaming DataFrames und einfache Aggregationen
Databricks Jobs und Workflow-Orchestrierung
- Planung von Notebboks als Jobs und Aufgaben
- Erstellung von Multi-Schritt-Workflows mit Abhängigkeiten
Unity Catalog und Data Governance
- Architektur und Namespaces von Unity Catalog
- Zugriffskontrolle und Datenherkunft (Data Lineage)
Testing, Debugging und Produktionspraktiken
- Unit-Tests für PySpark-Logik
- Debugging und Code-Qualitätsstandards
End-to-End Use Cases in der Finanzbranche
- Aufbau einer end-to-End-Banking-ETL-Pipeline
- Übersetzung von Legacy-SQL-Prozessen in PySpark
Migrieren von SQL-Workloads zu PySpark
- Migrationsstrategie und Planungsansätze
- Inkrementelle Konvertierung von SQL-Workflows in PySpark
Voraussetzungen
- Erfahrung mit Python-Programmierung, einschließlich Funktionen und Datentypen
- Grundkenntnisse in SQL, insbesondere bei Joins, Aggregationen und Unterabfragen
- Keine Vorerfahrung mit Databricks oder PySpark erforderlich
Zielgruppe
- Data Engineers, Data Analysts und Data Professionals
- Teams, die bestehende SQL-basierte Workflows zu Databricks und PySpark migrieren
Erfahrungsberichte (1)
Ich mochte es, dass es praktisch war. Ich liebte es, die theoretischen Kenntnisse mit praktischen Beispielen anzuwenden.
Aurelia-Adriana - Allianz Services Romania
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung