Kontakt aufnehmen

Schulungsübersicht

Einführung:

  • Apache Spark im Hadoop-Ökosystem
  • Kurze Einführung in Python, Scala

Grundlagen (Theorie):

  • Architektur
  • RDD
  • Transformationen und Aktionen
  • Stage, Task, Abhängigkeiten

Einführung in die Grundlagen mit der Databricks-Umgebung (Praxisworkshop):

  • Übungen mit RDD-API
  • Einfache Aktions- und Transformationsfunktionen
  • PairRDD
  • Join
  • Caching-Strategien
  • Übungen mit DataFrame-API
  • SparkSQL
  • DataFrame: select, filter, group, sort
  • UDF (benutzerdefinierte Funktion)
  • Blick in die DataSet-API
  • Streaming

Einführung in Cloud-Bereitstellungen mit der AWS-Umgebung (Praxisworkshop):

  • Grundlagen von AWS Glue
  • Unterschiede zwischen AWS EMR und AWS Glue verstehen
  • Beispielaufträge in beiden Umgebungen
  • Vor- und Nachteile verstehen

Zusatzmaterial:

  • Einführung in die Orchestrierung mit Apache Airflow

Voraussetzungen

Programmierkenntnisse (vorzugsweise in Python, Scala)

SQl-Grundlagen

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (3)

Kommende Kurse

Verwandte Kategorien