Kontakt aufnehmen

Schulungsübersicht

Einführung:

  • Apache Spark im Hadoop-Ökosystem
  • Kurzüberblick über Python und Scala

Grundlagen (Theorie):

  • Aufbau (Architektur)
  • RDD
  • Transformationen und Aktionen
  • Stage, Task, Abhängigkeiten

Verständnis der Grundlagen anhand der Databricks-Umgebung (Praxisworkshop):

  • Übungen mit der RDD-API
  • Grundlegende Funktionsweise von Aktionen und Transformationen
  • PairRDD
  • Join
  • Cache-Strategien
  • Übungen mit der DataFrame-API
  • SparkSQL
  • DataFrame: select, filter, group, sort
  • UDF (Benutzerdefinierte Funktion)
  • Einführung in die DataSet-API
  • Streaming

Verständnis des Deployments anhand der AWS-Umgebung (Praxisworkshop):

  • Grundlagen von AWS Glue
  • Verständnis der Unterschiede zwischen AWS EMR und AWS Glue
  • Beispieljobs in beiden Umgebungen
  • Verständnis von Vor- und Nachteilen

Zusätzliches:

  • Einführung in die Orchestrierung mit Apache Airflow

Voraussetzungen

Programmierkenntnisse (vorzugsweise Python, Scala)

SQL-Grundlagen

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien