Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Dauer 14 Stunden (2 Tage)
Schulungsübersicht
Einführung in die Sprachsynthese und Stimmklonierung
- Überblick über Text-to-Speech (TTS) und neuronale Sprachsynthese
- Stimmklonierung vs. Sprachgenerierung: Anwendungsfälle und Grenzen
- Wichtige Modelle: Tacotron, WaveNet, FastSpeech, VITS
Arbeiten mit kommerziellen Plattformen
- Nutzung von ElevenLabs und Resemble AI
- Erstellung, Klonierung und Bearbeitung von Stimmen
- API-Zugang und Text-to-Speech-Workflows
Entwicklung mit Open-Source-Werkzeugen
- Installation und Konfiguration von Coqui TTS
- Training benutzerdefinierter Stimmen und Management von Datensätzen
- Sprachgenerierung mit feiner Steuerung (Tonhöhe, Geschwindigkeit, Emotion)
Datenaufbereitung und Management von Stimmensätzen
- Sammeln und Bereinigen von Stimmproben
- Segmentierung, Beschriftung und Ausrichtung von Transkripten
- Ethische Herkunft und Stimmeneinwilligung
Anwendungseintegration
- Einbettung von TTS in Websites und Anwendungen
- Erstellung von IVR-Systemen und interaktiven Bots
- Generierung synthetischer Dialoge für Videos und Spiele
Bewertung von Qualität und Realismus
- MOS (Mean Opinion Score) und Intelligenztests
- Steuerung von Expressivität und Prosodie
- Vergleich von Latenz, Fälschbarkeit und Realismus
Ethische, rechtliche und governancebezogene Überlegungen
- Deepfake-Risiken und verantwortungsvolle Nutzung
- Einwilligung, Namensnennung und Urheberrechtsimplikationen
- Vorschriften und organisatorische Richtlinien
Zusammenfassung und nächste Schritte
Voraussetzungen
- Grundverständnis der Machine-Learning-Grundlagen
- Vertrautheit mit Audio-Dateiformaten und Bearbeitungswerkzeugen
- Basiswissen in der Python-Programmierung
Zielgruppe
- KI-Entwickler und Ingenieure, die sich für Sprachsynthese interessieren
- Inhaltsersteller und Medientechnologen, die Sprachgenerierung erkunden
- F&E-Teams, die personalisierte oder dynamische Audiosysteme entwickeln