Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 21 Stunden
Schulungsübersicht
Einführung in multimodale KI und Ollama
- Überblick über multimodales Lernen
- Hauptherausforderungen bei der Integration von Vision und Sprache
- Fähigkeiten und Architektur von Ollama
Einrichtung der Ollama-Umgebung
- Installation und Konfiguration von Ollama
- Arbeiten mit lokalem Modell-Deployment
- Integration von Ollama mit Python und Jupyter
Arbeiten mit multimodalen Eingaben
- Integration von Text und Bildern
- Einarbeitung von Audio und strukturierten Daten
- Gestaltung von Preprocessing-Pipelines
Anwendungen für das Dokumentenverständnis
- Extraktion strukturierter Informationen aus PDFs und Bildern
- Kombination von OCR mit Sprachmodellen
- Aufbau intelligenter Workflows für die Dokumentenanalyse
Visuelle Frage-Antwort (VQA)
- Einarbeitung von VQA-Datensätzen und Benchmarks
- Training und Auswertung multimodaler Modelle
- Entwicklung interaktiver VQA-Anwendungen
Gestaltung multimodaler Agenten
- Prinzipien des Agenten-Designs mit multimodaler Schlussfolgerung
- Kombination von Wahrnehmung, Sprache und Aktion
- Deployment von Agenten für reale Use Cases
Fortgeschrittene Integration und Optimierung
- Feinjustierung multimodaler Modelle mit Ollama
- Optimierung der Inferenzleistung
- Skalierbarkeit und Deployment-Aspekte
Zusammenfassung und nächste Schritte
Voraussetzungen
- Gutes Verständnis von Machine-Learning-Grundlagen
- Experience mit Deep-Learning-Frameworks wie PyTorch oder TensorFlow
- Vorkenntnisse in der natürlichen Sprachverarbeitung (NLP) und Computer Vision
Zielgruppe
- Machine-Learning-Engineere
- AI-Forscher
- Produktentwickler, die Vision- und Text-Workflows integrieren