Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in multimodale Mistral-Modelle
- Übersicht über Mistral Medium und multimodale Fähigkeiten
- OCR-/Dokumentenmodelle und Anwendungsfälle
- Integration in Open-Source-Ökosysteme
OCR- und Vision-Pipelines
- Grundlagen der OCR mit Mistral-Modellen
- Vorverarbeitung von Bildern und gescannten Dokumenten
- Extrahieren strukturierter Texte aus Bildern
Dokumentenverständnis
- Entwurf von NLP-Pipelines für Dokumente
- Erkennung von Entitäten, Zusammenfassung und Klassifizierung
- Modellübergreifende Verknüpfung von Text- und Bilddaten
Such- und Wissensanwendungen
- Vision-Text-Suchsysteme
- Aufbau semantischer Suche mit OCR-Ausgaben
- Unternehmens-Dokumentenarchiven
Assistive und interaktive Anwendungen
- Schnittstellendesign für multimodale Assistenten
- Barrierefreiheitsanwendungen (z.B. Bild-zu-Text)
- Produktivitätstools aus der Praxis
Performance und Optimierung
- Skalierung multimodaler Pipelines
- Tuning der Inferenzleistung
- Bewertung von Genauigkeits- und Effizienzabwägungen
Studienbeispiele und zukünftige Richtungen
- Branchenspezifische Anwendungen multimodaler KI
- Forschungstrends in OCR und Dokument-KI
- Überlegungen zu verantwortungsvoller KI bei Vision-Text-Aufgaben
Zusammenfassung und nächste Schritte
Voraussetzungen
- Grundkenntnisse in Konzepten der natürlichen Sprachverarbeitung (NLP)
- Erfahrung mit Python und ML-Frameworks
- Vertrautheit mit Grundlagen der Computervisualisierung
Zielgruppe
- Produktteams
- ML-Forschende
- Angewandte ML-Ingenieurinnen und -Ingenieure
14 Stunden