Kontakt aufnehmen

Schulungsübersicht

Einführung in Visions- und Sprachmodelle

  • Übersicht über VLMs und ihre Rolle in der multimodalen KI
  • Bekannte Architekturen: CLIP, Flamingo, BLIP usw.
  • Anwendungsfälle: Suche, Captioning, autonome Systeme, Inhaltsanalyse

Vorbereitung der Feinabstimmungsumgebung

  • Einrichtung von OpenCLIP und anderen VLM-Bibliotheken
  • Datensatzformate für Bild-Text-Paare
  • Vorverarbeitungspipelines für visuell-sprachliche Eingaben

Feinabstimmung von CLIP und ähnlichen Modellen

  • Kontrastiver Verlust und gemeinsame Einbettungsräume
  • Praktisches Üben: Feinabstimmung von CLIP auf benutzerdefinierten Datensätzen
  • Umgang mit domänenspezifischen und mehrsprachigen Daten

Fortgeschrittene Techniken zur Feinabstimmung

  • Verwendung von LoRA und adapterbasierten Methoden für Effizienz
  • Prompt-Tuning und visuelles Prompt-Injection
  • Abwägungen bei der Evaluation: Zero-Shot versus feinabgestimmt

Evaluation und Benchmarking

  • Metriken für VLMs: Retrieval-Genauigkeit, BLEU, CIDEr, Recall
  • Diagnose der visuell-textuellen Ausrichtung
  • Visualisierung von Einbettungsräumen und Fehlklassifikationen

Bereitstellung und Einsatz in realen Anwendungen

  • Exportieren von Modellen für die Inferenz (TorchScript, ONNX)
  • Integration von VLMs in Pipelines oder APIs
  • Ressourcenüberlegungen und Skalierung der Modelle

Fallstudien und angewandte Szenarien

  • Medienanalyse und Inhaltsmoderation
  • Suche und Retrieval im E-Commerce und in digitalen Bibliotheken
  • Multimodale Interaktion in Robotik und autonomen Systemen

Zusammenfassung und weitere Schritte

Voraussetzungen

  • Verständnis von Deep Learning für Vision und NLP
  • Erfahrung mit PyTorch und transformer-basierten Modellen
  • Vertrautheit mit Multimodal-Modellarchitekturen

Zielgruppe

  • Ingenieurinnen und Ingenieure der Computer Vision
  • KI-Entwicklerinnen und -Entwickler
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien