Kontakt aufnehmen

Schulungsübersicht

Einführung in Apache Airflow

  • Was ist Workflow-Orchestratio?
  • Wichtige Funktionen und Vorteile von Apache Airflow
  • Verbesserungen und Ökosystemübersicht von Airflow 2.x

Architektur und Kernkonzepte

  • Scheduler, Webserver und Worker-Prozesse
  • DAGs, Tasks und Operatoren
  • Executoren und Backends (Local, Celery, Kubernetes)

Installation und Einrichtung

  • Installation von Airflow in lokalen und Cloud-Umgebungen
  • Konfiguration von Airflow mit verschiedenen Executoren
  • Einrichten von Metadaten-Datenbanken und Verbindungen

Navigieren in der Airflow-Benutzeroberfläche und CLI

  • Erkunden der Airflow-Weboberfläche
  • Überwachen von DAG-Läufen, Tasks und Logs
  • Verwenden der Airflow CLI für Administrationstätigkeiten

Erstellen und Verwalten von DAGs

  • Erstellen von DAGs mit der TaskFlow-API
  • Verwenden von Operatoren, Sensoren und Hooks
  • Verwalten von Abhängigkeiten und Planungsintervallen

Integration von Airflow mit Daten- und Cloud-Diensten

  • Verbinden mit Datenbanken, APIs und Message Queues
  • Ausführen von ETL-Pipelines mit Airflow
  • Cloud-Integrationen: AWS-, GCP- und Azure-Operatoren

Überwachung und Observability

  • Task-Logs und Echtzeitüberwachung
  • Metriken mit Prometheus und Grafana
  • Alarmierung und Benachrichtigungen via E-Mail oder Slack

Sicherheit von Apache Airflow

  • Rollenbasierte Zugriffskontrolle (RBAC)
  • Authentifizierung mit LDAP, OAuth und SSO
  • Secrets Management mit Vault und Cloud-Secret-Speichern

Skalierung von Apache Airflow

  • Parallelität, Konurrenz und Task-Queues
  • Einsatz von CeleryExecutor und KubernetesExecutor
  • Bereitstellung von Airflow auf Kubernetes mit Helm

Best Practices für die Produktion

  • Versionskontrolle und CI/CD für DAGs
  • Testen und Debuggen von DAGs
  • Aufrechterhaltung der Zuverlässigkeit und Leistung im grossen Massstab

Fehlersuche und Optimierung

  • Debuggen fehlgeschlagener DAGs und Tasks
  • Optimieren der DAG-Leistung
  • Häufige Fallstricke und deren Vermeidung

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Erfahrung in der Python-Programmierung
  • Vertrautheit mit Konzepten der Data Engineering oder DevOps
  • Verständnis von ETL-Prozessen oder Workflow-Orchestratio

Zielgruppe

  • Data Scientists
  • Data Engineers
  • DevOps- und Infrastruktur-Ingenieure
  • Softwareentwickler
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (7)

Kommende Kurse

Verwandte Kategorien