Kontakt aufnehmen

Schulungsübersicht

Einführung in multimodale Modelle

  • Übersicht über multimodales maschinelles Lernen
  • Anwendungen multimodaler Modelle
  • Herausforderungen im Umgang mit mehreren Datentypen

Architekturen für multimodale Modelle

  • Erforschung von Modellen wie CLIP, Flamingo und BLIP
  • Verständnis von Cross-Modal-Aufmerksamkeitsmechanismen
  • Architektonische Überlegungen zur Skalierbarkeit und Effizienz

Vorbereitung multimodaler Datensätze

  • Datensammlung und Annotationstechniken
  • Vorverarbeitung von Text-, Bild- und Videoeingaben
  • Ausbalancieren von Datensätzen für multimodale Aufgaben

Feinabstimmungstechniken für multimodale Modelle

  • Einrichtung von Trainings-Pipelines für multimodale Modelle
  • Management von Speicher- und Rechenbeschränkungen
  • Bewältigung der Ausrichtung zwischen Modalitäten

Anwendungen feinabgestimmter multimodaler Modelle

  • Visuelle Fragebeantwortung
  • Bild- und Video-Beschriftung
  • Inhaltserzeugung mit multimodalen Eingaben

Leistungsoptimierung und Bewertung

  • Bewertungsmetriken für multimodale Aufgaben
  • Orientieren von Latenz und Durchsatz für die Produktion
  • Sicherstellung der Robustheit und Konsistenz über Modalitäten hinweg

Bereitstellung multimodaler Modelle

  • Packaging von Modellen zur Bereitstellung
  • Skalierbare Inferenz auf Cloud-Plattformen
  • Echtzeitanwendungen und Integrationen

Fallstudien und praktische Labs

  • Feinabstimmung von CLIP für inhaltsbasierte Bildersuche
  • Training eines multimodalen Chatbots mit Text und Video
  • Implementierung von Cross-Modal-Suchsystemen

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Kenntnisse in der Python-Programmierung
  • Verständnis von Konzepten des Deep Learning
  • Erfahrung mit der Feinabstimmung vortrainierter Modelle

Zielgruppe

  • KI-Forschende
  • Datenwissenschaftler
  • Praktiker im Bereich Machine Learning
 28 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien