Kontakt aufnehmen

Schulungsübersicht

Einführung

Dieser Abschnitt bietet eine allgemeine Einführung in die Frage, wann «Maschinelles Lernen» eingesetzt werden sollte, welche Überlegungen dabei anfallen und was alles damit gemeint ist – einschließlich der Vor- und Nachteile. Behandelt werden Datentypen (strukturiert/unstrukturiert/statisch/Streaming), Datenvalidität/-volumen, datengetriebene versus nutzergetriebene Analytik, statistische Modelle im Vergleich zu Modellen des Maschinellen Lernens, Herausforderungen im unüberwachten Lernen, der Bias-Variance-Kompromiss, Iteration/-evaluation, Ansätze der Kreuzvalidierung sowie überwachtes/unüberwachtes/Reward-basiertes Lernen.

WICHTIGE THEMEN

1. Verständnis des Naive Bayes

  • Grundlegende Konzepte der Bayesianischen Methoden
  • Wahrscheinlichkeit
  • Gemeinsame Wahrscheinlichkeit
  • Bedingte Wahrscheinlichkeit nach dem Satz von Bayes
  • Der Naive-Bayes-Algorithmus
  • Die Naive-Bayes-Klassifizierung
  • Der Laplace-Schätzer
  • Nutzung numerischer Merkmale mit Naive Bayes

2. Verständnis von Entscheidungsbäumen

  • Teile und herrsche (Divide and conquer)
  • Der C5.0-Entscheidungsbaum-Algorithmus
  • Wahl der besten Aufteilung
  • Pflegen/Verkleinern (Pruning) des Entscheidungsbauums

3. Verständnis von neuronalen Netzen

  • Von biologischen zu künstlichen Neuronen
  • Aktivierungsfunktionen
  • Netzwerktopologie
  • Die Anzahl der Schichten
  • Die Richtung des Informationsflusses
  • Die Anzahl der Knoten in jeder Schicht
  • Training neuronaler Netze mit Backpropagation
  • Deep Learning

4. Verständnis von Support-Vektor-Maschinen

  • Klassifizierung mit Hyperflächen
  • Finden des maximalen Randes (Maximum Margin)
  • Der Fall linear trennbarer Daten
  • Der Fall nicht linear trennbarer Daten
  • Nutzung von Kernen (Kernels) für nichtlineare Räume

5. Verständnis von Clustering

  • Clustering als Aufgabe im Maschinellen Lernen
  • Der k-means-Algorithmus für Clustering
  • Nutzung des Abstands zur Zuordnung und Aktualisierung von Clustern
  • Wahl der angemessenen Anzahl von Clustern

6. Messung der Leistung bei der Klassifizierung

  • Arbeit mit Klassifizierungsvorhersagedaten
  • Verstärkter Blick auf Verwechslungsmatrizen (Confusion Matrices)
  • Nutzung von Verwechslungsmatrizen zur Leistungsmessung
  • Jenseits der Genauigkeit – weitere Leistungsmetriken
  • Die Kappa-Statistik
  • Sensitivität und Spezifität
  • Präzision und Recall (Trefferquote)
  • Die F-Maßgrösse (F-measure)
  • Visualisierung von Leistungskompromissen
  • ROC-Kurven
  • Schätzung der zukünftigen Leistung
  • Die Holdout-Methode
  • Kreuzvalidierung
  • Bootstrap-Stichprobung

7. Anpassung vorgegebener Modelle für bessere Leistung

  • Nutzung von caret für automatisierte Parameteranpassung (Tuning)
  • Erstellung eines einfach abgestimmten Modells
  • Anpassung des Abstimmungsprozesses
  • Verbesserung der Modellleistung durch Meta-Lernen
  • Verständnis von Ensembles
  • Bagging
  • Boosting
  • Zufalls-Wälder (Random Forests)
  • Training von Zufalls-Wäldern
  • Bewertung der Leistung von Zufalls-Wäldern

WEITERE THEMEN

8. Verständnis der Klassifizierung anhand der nächsten Nachbarn

  • Der kNN-Algorithmus
  • Berechnung des Abstands
  • Wahl eines angemessenen k
  • Vorbereitung der Daten für die Verwendung mit kNN
  • Warum ist der kNN-Algorithmus «lazy» (faul)?

9. Verständnis von Klassifizierungsregeln

  • Trenne und herrsche (Separate and conquer)
  • Der One-Rule-Algorithmus
  • Der RIPPER-Algorithmus
  • Regeln aus Entscheidungsbäumen

10. Verständnis von Regression

  • Einfache lineare Regression
  • Schätzung der kleinsten Quadrate (Ordinary Least Squares)
  • Korrelationen
  • Mehrfache lineare Regression

11. Verständnis von Regressionsbäumen und Modellbäumen

  • Hinzufügen von Regression zu Bäumen

12. Verständnis von Assoziationsregeln

  • Der Apriori-Algorithmus für das Lernen von Assoziationsregeln
  • Messung des Regelinteresses – Support und Konfidenz
  • Aufbau eines Regelsatzes anhand des Apriori-Prinzips

Zusätzliches

  • Spark/PySpark/MLlib und Multi-Armed-Bandit-Probleme

Voraussetzungen

Kenntnisse in Python

 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (7)

Kommende Kurse

Verwandte Kategorien