Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Überblick über Technologien zur Spracherkennung
- Geschichte und Entwicklung der Spracherkennung
- Akustische Modelle, Sprachmodelle und Decoding
- Moderne Architekturen: RNNs, Transformer und Whisper
Audio-Preprocessing und Grundlagen der Transkription
- Umgang mit Audioformaten und Abtastraten
- Bereinigen, Beschneiden und Segmentieren von Audio
- Erzeugung von Text aus Audio: Echtzeit vs. Batch
Praxis mit Whisper und anderen APIs
- Installation und Nutzung von OpenAI Whisper
- Aufruf von Cloud-APIs (Google, Azure) zur Transkription
- Vergleich von Leistung, Latenz und Kosten
Sprache, Akzente und Domänenanpassung
- Arbeit mit mehreren Sprachen und Akzenten
- Benutzerdefinierte Vokabulare und Geräuschtoleranz
- Umgang mit juristischer, medizinischer oder technischer Sprache
Ausgabeformatierung und Integration
- Hinzufügen von Zeitstempeln, Satzzeichen und Sprecherkennzeichnungen
- Export in Text-, SRT- oder JSON-Formate
- Integration von Transkriptionen in Apps oder Datenbanken
Labs zur Implementierung von Use Cases
- Transkription von Meetings, Interviews oder Podcasts
- Voice-to-Text-Befehlssysteme
- Echtzeit-Untertitel für Video-/Audio-Streams
Bewertung, Grenzen und Ethik
- Genauigkeitsmetriken und Modell-Benchmarks
- Verzerrung und Fairness in Sprachmodellen
- Überlegungen zu Datenschutz und Compliance
Zusammenfassung und nächste Schritte
Voraussetzungen
- Grundverständnis von allgemeinen KI- und Machine-Learning-Konzepten
- Vertrautheit mit Audio- oder Mediendateiformaten und -tools
Zielgruppe
- Data Scientists und KI-Ingenieure, die mit Stimmendaten arbeiten
- Softwareentwickler, die transkriptionsbasierte Anwendungen erstellen
- Organisationen, die die Spracherkennung für die Automatisierung erkunden
14 Stunden