Voice-Cloning
Voice-Cloning bezeichnet die KI-gestützte Nachbildung einer menschlichen Stimme, bei der aus wenigen Sekunden Audiomaterial eine synthetische Stimmkopie erstellt wird, die beliebige Texte in Tonlage, Akzent und Sprechweise der Originalperson vortragen kann.
Ausführliche Erklärung
Voice-Cloning basiert auf neuronalen Netzen und maschinellem Lernen, die charakteristische Merkmale einer Stimme analysieren und nachbilden. Moderne Systeme können bereits aus drei Sekunden Audiomaterial eine nutzbare Stimmkopie erstellen, wobei die Qualität mit 30 bis 60 Sekunden sauberem Ausgangsmaterial deutlich steigt. Die Technologie nutzt typischerweise eine dreistufige Pipeline: Ein Speaker-Encoder extrahiert die individuellen Stimmmerkmale, ein Synthese-Modell erzeugt die akustischen Merkmale des gewünschten Texts, und ein Vocoder wandelt diese in hörbare Sprache um.
Für Unternehmen bietet Voice-Cloning konkrete Effizienzvorteile: Schulungsvideos, Telefonansagen oder mehrsprachige Inhalte lassen sich ohne wiederholte Studioaufnahmen produzieren und jederzeit aktualisieren. Kundenservice-Systeme können mit natürlich klingenden, konsistenten Markenstimmen ausgestattet werden. Die Technologie ermöglicht auch Barrierefreiheit, etwa wenn Personen nach Krankheit ihre Stimme verlieren.
Gleichzeitig birgt Voice-Cloning erhebliche Risiken. Kriminelle nutzen geklonte Stimmen für Betrugsmaschen wie CEO-Fraud, bei dem Mitarbeitende durch gefälschte Anrufe zu Überweisungen bewegt werden, oder moderne Varianten des Enkeltricks. Stimmaufnahmen sind personenbezogene Daten; werden sie mit speziellen technischen Verfahren zur eindeutigen Identifizierung einer Person verarbeitet, zählen sie nach der DSGVO zu den besonders geschützten biometrischen Daten, deren Verarbeitung in der Regel eine ausdrückliche Einwilligung erfordert. Ab dem 2. August 2026 greifen zudem die Transparenzpflichten der EU-KI-Verordnung: KI-generierte Audioinhalte müssen in sensiblen Kontexten klar gekennzeichnet werden.
Rechtlich bewegt sich der Einsatz von Voice-Cloning im Schnittfeld mehrerer Rechtsgebiete: Persönlichkeitsrecht, Datenschutz, Urheberrecht und KI-Regulierung. Unternehmen benötigen für die Nutzung fremder Stimmen explizite, informierte Einwilligungen, die den konkreten Verwendungszweck, die Dauer und Widerrufsrechte regeln. Empfehlenswert sind zudem organisatorische Maßnahmen wie Zwei-Kanal-Verifikation bei verdächtigen Anrufen und Mitarbeiterschulungen zur Erkennung von Audio-Deepfakes.
Praxisbeispiel
Eine oberösterreichische Steuerberatungskanzlei mit 18 Mitarbeitenden nutzt Voice-Cloning für interne Schulungsvideos: Die Partnerin hat ihre Stimme einmalig klonen lassen und kann nun Erklärvideos zu aktuellen Steuerrechtsänderungen per Texteingabe erstellen, ohne jedes Mal ins Studio zu müssen. Neue Mitarbeitende hören bei der Einarbeitung eine vertraute, konsistente Stimme. Die Kanzlei hat die Nutzung schriftlich dokumentiert, die geklonte Stimme wird ausschließlich intern verwendet und ist als KI-generiert gekennzeichnet.
Quellen
- Voice-Cloning und Recht: Leitfaden zu DSGVO, Urheberrecht und AI Act – Ratgeber Recht
- Audio-Deepfakes und Voice-Cloning: So schützen Sie sich vor Betrug – Onlinesicherheit.gv.at
- How AI Voice Cloning Works: 2026 Guide – DuckDuckGoose AI
- Gesetzentwurf zur Strafbarkeit von Deepfakes – Rechtsanwalt Ferner
Diese Definition verlinken
Sie dürfen diese Definition gern zitieren oder verlinken — mit Quellenangabe.
„Voice-Cloning“ — Definition im Strukturaflow IT Glossar: https://begriffe.strukturaflow.com/begriff/voice-cloning <a href="https://begriffe.strukturaflow.com/begriff/voice-cloning">Voice-Cloning</a> — Definition im Strukturaflow IT Glossar