Kontakt aufnehmen

Schulungsübersicht

Einführung in Apache Airflow

  • Was ist Workflow-Orchestrierung
  • Wichtige Funktionen und Vorteile von Apache Airflow
  • Verbesserungen in Airflow 2.x und Überblick über das Ökosystem

Architektur und Grundkonzepte

  • Scheduler, Webserver und Worker-Prozesse
  • DAGs, Tasks und Operatoren
  • Executors und Backends (Local, Celery, Kubernetes)

Installation und Einrichtung

  • Installation von Airflow in lokalen und Cloud-Umgebungen
  • Konfiguration von Airflow mit verschiedenen Executors
  • Einrichtung von Metadaten-Datenbanken und Verbindungen

Bedienung der Airflow-UI und CLI

  • Erforschung der Airflow-Weboberfläche
  • Überwachung von DAG-Executions, Tasks und Logs
  • Nutzung der Airflow-CLI für die Administration

Erstellung und Verwaltung von DAGs

  • Erstellen von DAGs mit der TaskFlow-API
  • Verwendung von Operatoren, Sensors und Hooks
  • Verwaltung von Abhängigkeiten und Planungintervallen

Integration von Airflow mit Daten- und Cloud-Diensten

  • Verbindung zu Datenbanken, APIs und Message Queues
  • Ausführung von ETL-Pipelines mit Airflow
  • Cloud-Integrationen: AWS-, GCP- und Azure-Operatoren

Überwachung und Beobachtbarkeit

  • Task-Logs und Echtzeit-Überwachung
  • Metriken mit Prometheus und Grafana
  • Benachrichtigungen und Alerts per E-Mail oder Slack

Absicherung von Apache Airflow

  • Rollenbasierte Zugriffssteuerung (RBAC)
  • Authentifizierung mit LDAP, OAuth und SSO
  • Verwaltung von Secrets mit Vault und Cloud Secret Stores

Skalierung von Apache Airflow

  • Parallelität, Concurrente und Task-Queues
  • Verwendung von CeleryExecutor und KubernetesExecutor
  • Deployment von Airflow auf Kubernetes mit Helm

Bewährte Praktiken für die Produktion

  • Versionskontrolle und CI/CD für DAGs
  • Testen und Debuggen von DAGs
  • Aufrechterhaltung von Zuverlässigkeit und Leistung im grossen Massstab

Fehlerbehebung und Optimierung

  • Debuggen von fehlgeschlagenen DAGs und Tasks
  • Optimierung der DAG-Leistung
  • Häufige Fehlerquellen und wie man sie vermeidet

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Erfahrung in Python-Programmierung
  • Vertrautheit mit Konzepten der Datenengineering oder DevOps
  • Verständnis von ETL oder Workflow-Orchestrierung

Zielgruppe

  • Data Scientists
  • Data Engineers
  • DevOps- und Infrastructure Engineers
  • Softwareentwickler
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (7)

Kommende Kurse

Verwandte Kategorien