Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in multimodale KI
- Was ist multimodale KI?
- Wichtige Herausforderungen und Anwendungsgebiete
- Überblick über führende multimodale Modelle
Textverarbeitung und natürliches Sprachverständnis
- Nutzung grosser Sprachmodelle (LLMs) für textbasierte KI-Agenten
- Verständnis von Prompt Engineering für multimodale Aufgaben
- Feinabstimmung von Textmodellen für domänenspezifische Anwendungen
Bilderkennung und -generierung
- Verarbeitung von Bildern mit KI: Klassifizierung, Beschriftung und Objekterkennung
- Generierung von Bildern mit Diffusion-Modellen (Stable Diffusion, DALL-E)
- Integration von Bilddaten in textbasierte Modelle
Sprach- und Audiobearbeitung
- Spracherkennung mit Whisper ASR
- Techniken der Text-to-Speech (TTS)-Synthese
- Verbesserung der Benutzerinteraktion durch sprachbasierte KI
Integration multi-modaler Eingaben
- Aufbau von KI-Pipelines für die Verarbeitung verschiedener Eingabetypen
- Fusionsverfahren zur Kombination von Text-, Bild- und Sprachdaten
- Reale Anwendungen multimodaler KI-Agenten
Einsatz multimodaler KI-Agenten
- Aufbau von API-gesteuerten multimodalen KI-Lösungen
- Optimierung der Modelle hinsichtlich Leistung und Skalierbarkeit
- Best Practices für den Produktiveinsatz multimodaler KI
Ethische Überlegungen und zukünftige Trends
- Verzerrung und Fairness in multimodaler KI
- Datenschutzbedenken bei multimodalen Daten
- Zukunftsentwicklungen im Bereich der multimodalen KI
Zusammenfassung und weitere Schritte
Voraussetzungen
- Grundlagenverständnis der maschinellen Lernverfahren
- Erfahrung in der Python-Programmierung
- Vertrautheit mit Deep-Learning-Frameworks (z. B. TensorFlow, PyTorch)
Zielgruppe
- KI-Entwickler
- Forscher
- Multimedia-Ingenieure
21 Stunden