Kontakt aufnehmen

Schulungsübersicht

Einführung in multimodale Mistral-Modelle

  • Übersicht über Mistral Medium und multimodale Fähigkeiten
  • OCR-/Dokumentenmodelle und Anwendungsfälle
  • Integration in Open-Source-Ökosysteme

OCR- und Vision-Pipelines

  • Grundlagen der OCR mit Mistral-Modellen
  • Vorverarbeitung von Bildern und gescannten Dokumenten
  • Extrahieren strukturierter Texte aus Bildern

Dokumentenverständnis

  • Entwurf von NLP-Pipelines für Dokumente
  • Erkennung von Entitäten, Zusammenfassung und Klassifizierung
  • Modellübergreifende Verknüpfung von Text- und Bilddaten

Such- und Wissensanwendungen

  • Vision-Text-Suchsysteme
  • Aufbau semantischer Suche mit OCR-Ausgaben
  • Unternehmens-Dokumentenarchiven

Assistive und interaktive Anwendungen

  • Schnittstellendesign für multimodale Assistenten
  • Barrierefreiheitsanwendungen (z.B. Bild-zu-Text)
  • Produktivitätstools aus der Praxis

Performance und Optimierung

  • Skalierung multimodaler Pipelines
  • Tuning der Inferenzleistung
  • Bewertung von Genauigkeits- und Effizienzabwägungen

Studienbeispiele und zukünftige Richtungen

  • Branchenspezifische Anwendungen multimodaler KI
  • Forschungstrends in OCR und Dokument-KI
  • Überlegungen zu verantwortungsvoller KI bei Vision-Text-Aufgaben

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Grundkenntnisse in Konzepten der natürlichen Sprachverarbeitung (NLP)
  • Erfahrung mit Python und ML-Frameworks
  • Vertrautheit mit Grundlagen der Computervisualisierung

Zielgruppe

  • Produktteams
  • ML-Forschende
  • Angewandte ML-Ingenieurinnen und -Ingenieure
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien