Kontakt aufnehmen
 Dauer 21 Stunden

Schulungsübersicht

Einführung in multimodale KI und Ollama

  • Überblick über multimodales Lernen
  • Hauptherausforderungen bei der Integration von Vision und Sprache
  • Fähigkeiten und Architektur von Ollama

Einrichtung der Ollama-Umgebung

  • Installation und Konfiguration von Ollama
  • Arbeiten mit lokalem Modell-Deployment
  • Integration von Ollama mit Python und Jupyter

Arbeiten mit multimodalen Eingaben

  • Integration von Text und Bildern
  • Einarbeitung von Audio und strukturierten Daten
  • Gestaltung von Preprocessing-Pipelines

Anwendungen für das Dokumentenverständnis

  • Extraktion strukturierter Informationen aus PDFs und Bildern
  • Kombination von OCR mit Sprachmodellen
  • Aufbau intelligenter Workflows für die Dokumentenanalyse

Visuelle Frage-Antwort (VQA)

  • Einarbeitung von VQA-Datensätzen und Benchmarks
  • Training und Auswertung multimodaler Modelle
  • Entwicklung interaktiver VQA-Anwendungen

Gestaltung multimodaler Agenten

  • Prinzipien des Agenten-Designs mit multimodaler Schlussfolgerung
  • Kombination von Wahrnehmung, Sprache und Aktion
  • Deployment von Agenten für reale Use Cases

Fortgeschrittene Integration und Optimierung

  • Feinjustierung multimodaler Modelle mit Ollama
  • Optimierung der Inferenzleistung
  • Skalierbarkeit und Deployment-Aspekte

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Gutes Verständnis von Machine-Learning-Grundlagen
  • Experience mit Deep-Learning-Frameworks wie PyTorch oder TensorFlow
  • Vorkenntnisse in der natürlichen Sprachverarbeitung (NLP) und Computer Vision

Zielgruppe

  • Machine-Learning-Engineere
  • AI-Forscher
  • Produktentwickler, die Vision- und Text-Workflows integrieren

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien