Kontakt aufnehmen

Schulungsübersicht

Einführung in Reinforcement Learning aus menschlichem Feedback (RLHF)

  • Was ist RLHF und warum es wichtig ist
  • Vergleich mit Methoden der überwachten Feinabstimmung
  • Anwendungen von RLHF in modernen KI-Systemen

Reward-Modellierung mit menschlichem Feedback

  • Erhebung und Strukturierung menschlichen Feedbacks
  • Erstellung und Training von Reward-Modellen
  • Bewertung der Effektivität von Reward-Modellen

Training mit Proximal Policy Optimization (PPO)

  • Übersicht der PPO-Algorithmen für RLHF
  • Implementierung von PPO mit Reward-Modellen
  • Iteratives und sicheres Feinabstimmen von Modellen

Praktische Feinabstimmung von Sprachmodellen

  • Vorbereitung von Datensätzen für RLHF-Arbeitsabläufe
  • Kompetente Feinabstimmung eines kleinen LLMs mittels RLHF
  • Herausforderungen und Strategien zur Minderung derselben

Skalierung von RLHF auf Produktionssysteme

  • Aspekte der Infrastruktur und Rechenleistung
  • Qualitätssicherung und kontinuierliche Feedbackschleifen
  • Bewährte Praktiken für Betrieb und Wartung

Ethische Überlegungen und Bias-Minderung

  • Ansprechen ethischer Risiken im menschlichen Feedback
  • Strategien zur Erkennung und Korrektur von Verzerrungen
  • Sicherstellung der Ausrichtung und sicherer Ausgaben

Fallstudien und Praxisbeispiele

  • Fallstudie: Feinabstimmung von ChatGPT mit RLHF
  • Erfolgreiche RLHF-Implementierungen in der Praxis
  • Gewonnene Erkenntnisse und Brancheneinsichten

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Grundkenntnisse in überwachtem Lernen und Reinforcement Learning
  • Erfahrung mit der Feinabstimmung von Modellen und neuronalen Netzwerkarchitekturen
  • Vertrautheit mit der Python-Programmierung und Deep-Learning-Frameworks (z. B. TensorFlow, PyTorch)

Zielgruppe

  • Machine-Learning-Ingenieure
  • KI-Forschende
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien