Kontakt aufnehmen

Schulungsübersicht

Überblick über Technologien zur Spracherkennung

  • Geschichte und Entwicklung der Spracherkennung
  • Akustische Modelle, Sprachmodelle und Decoding
  • Moderne Architekturen: RNNs, Transformer und Whisper

Audio-Preprocessing und Grundlagen der Transkription

  • Umgang mit Audioformaten und Abtastraten
  • Bereinigen, Beschneiden und Segmentieren von Audio
  • Erzeugung von Text aus Audio: Echtzeit vs. Batch

Praxis mit Whisper und anderen APIs

  • Installation und Nutzung von OpenAI Whisper
  • Aufruf von Cloud-APIs (Google, Azure) zur Transkription
  • Vergleich von Leistung, Latenz und Kosten

Sprache, Akzente und Domänenanpassung

  • Arbeit mit mehreren Sprachen und Akzenten
  • Benutzerdefinierte Vokabulare und Geräuschtoleranz
  • Umgang mit juristischer, medizinischer oder technischer Sprache

Ausgabeformatierung und Integration

  • Hinzufügen von Zeitstempeln, Satzzeichen und Sprecherkennzeichnungen
  • Export in Text-, SRT- oder JSON-Formate
  • Integration von Transkriptionen in Apps oder Datenbanken

Labs zur Implementierung von Use Cases

  • Transkription von Meetings, Interviews oder Podcasts
  • Voice-to-Text-Befehlssysteme
  • Echtzeit-Untertitel für Video-/Audio-Streams

Bewertung, Grenzen und Ethik

  • Genauigkeitsmetriken und Modell-Benchmarks
  • Verzerrung und Fairness in Sprachmodellen
  • Überlegungen zu Datenschutz und Compliance

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Grundverständnis von allgemeinen KI- und Machine-Learning-Konzepten
  • Vertrautheit mit Audio- oder Mediendateiformaten und -tools

Zielgruppe

  • Data Scientists und KI-Ingenieure, die mit Stimmendaten arbeiten
  • Softwareentwickler, die transkriptionsbasierte Anwendungen erstellen
  • Organisationen, die die Spracherkennung für die Automatisierung erkunden
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Kommende Kurse

Verwandte Kategorien