Kontakt aufnehmen

Schulungsübersicht

Einführung in multimodale KI

  • Was ist multimodale KI?
  • Wichtige Herausforderungen und Anwendungsgebiete
  • Überblick über führende multimodale Modelle

Textverarbeitung und natürliches Sprachverständnis

  • Nutzung grosser Sprachmodelle (LLMs) für textbasierte KI-Agenten
  • Verständnis von Prompt Engineering für multimodale Aufgaben
  • Feinabstimmung von Textmodellen für domänenspezifische Anwendungen

Bilderkennung und -generierung

  • Verarbeitung von Bildern mit KI: Klassifizierung, Beschriftung und Objekterkennung
  • Generierung von Bildern mit Diffusion-Modellen (Stable Diffusion, DALL-E)
  • Integration von Bilddaten in textbasierte Modelle

Sprach- und Audiobearbeitung

  • Spracherkennung mit Whisper ASR
  • Techniken der Text-to-Speech (TTS)-Synthese
  • Verbesserung der Benutzerinteraktion durch sprachbasierte KI

Integration multi-modaler Eingaben

  • Aufbau von KI-Pipelines für die Verarbeitung verschiedener Eingabetypen
  • Fusionsverfahren zur Kombination von Text-, Bild- und Sprachdaten
  • Reale Anwendungen multimodaler KI-Agenten

Einsatz multimodaler KI-Agenten

  • Aufbau von API-gesteuerten multimodalen KI-Lösungen
  • Optimierung der Modelle hinsichtlich Leistung und Skalierbarkeit
  • Best Practices für den Produktiveinsatz multimodaler KI

Ethische Überlegungen und zukünftige Trends

  • Verzerrung und Fairness in multimodaler KI
  • Datenschutzbedenken bei multimodalen Daten
  • Zukunftsentwicklungen im Bereich der multimodalen KI

Zusammenfassung und weitere Schritte

Voraussetzungen

  • Grundlagenverständnis der maschinellen Lernverfahren
  • Erfahrung in der Python-Programmierung
  • Vertrautheit mit Deep-Learning-Frameworks (z. B. TensorFlow, PyTorch)

Zielgruppe

  • KI-Entwickler
  • Forscher
  • Multimedia-Ingenieure
 21 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien