Zum Inhalt springen
Strategie-Call buchen

Automatisierung · 8. Mai 2025 · aktualisiert am 9. September 2026

Von Text zu Stimme: Voice-Workflows mit Freigabe

Die Kette aus Text, Datenbank, Auslöser und Sprachdienst trägt weiter. Neu sind Kennzeichnungspflicht und die Frage, wie viel Automatik Sie wollen.
Ruhiges Profil einer grünen Keramikskulptur mit feiner gelber Linie

Automatisierung 4 Min. Lesezeit Von Alexander Otto

Voice AIAutomatisierungSprachmodelleGovernance

Im Mai 2025 haben wir beschrieben, wie sich mit GPT, ElevenLabs, Zapier und Notion eine automatisierte Markenstimme bauen lässt. Der Aufbau trägt weiterhin: Texte entstehen mit einem Sprachmodell, eine Datenbank hält Kontext und Tonalität, ein Auslöser startet die Umwandlung, ein Sprachdienst erzeugt die Audiodatei. Geändert haben sich die Werkzeuge, die Qualität und vor allem die Spielregeln.

Was die Technik heute leistet

ElevenLabs hat Eleven v3 am 3. Juni 2025 zunächst als Alpha vorgestellt und inzwischen für die allgemeine Nutzung freigegeben. Das Modell unterstützt über 70 Sprachen und erlaubt, Betonung und Stimmung direkt im Text zu markieren, etwa Flüstern oder Seufzen, außerdem Dialoge mit mehreren Sprechern in einem Durchgang. Der Anbieter weist aber selbst darauf hin, dass v3 mehr Aufwand beim Formulieren der Vorgaben verlangt und für Echtzeit-Gespräche nicht die erste Wahl ist. Dafür empfiehlt er schnellere Modelle. Für aufgezeichnete Inhalte wie Begrüßungen, Hörfassungen oder Messeansagen ist v3 die passende Wahl, für Telefonate eher nicht.

Auch OpenAI bietet seit August 2025 mit gpt-realtime ein Sprachmodell, das Sprache direkt versteht und erzeugt. Es richtet sich an Gespräche, nicht an die Vertonung fertiger Texte. Wer beides braucht, sollte die Aufgaben trennen: vorproduzierte Audioinhalte auf der einen Seite, Dialog in Echtzeit auf der anderen.

Notion als Steuerzentrale: was sich verschoben hat

Notion bleibt ein praktischer Ort, um Stimme, Anlass, Tonalität und Textvarianten zu hinterlegen. Seit Notion 3.0 vom 18. September 2025 gibt es dort außerdem KI-Agenten, die bis zu 20 Minuten selbstständig über viele Seiten arbeiten können. Die Custom Agents, die nach Zeitplan oder Auslöser laufen, sind seit dem 4. Mai 2026 allgemein verfügbar und werden über Credits abgerechnet. Für Ihren Voice-Workflow heißt das: Ein Teil dessen, was wir 2025 über Zapier verkettet haben, lässt sich inzwischen innerhalb von Notion lösen. Ob das sinnvoll ist, hängt von Ihren Kosten und Ihrem Wunsch nach Kontrolle ab. Zapier-Abläufe sind leichter zu prüfen, ein Agent in Notion ist bequemer.

Neu: Kennzeichnungspflicht für synthetische Stimmen

Die größte Änderung seit 2025 ist rechtlich. Seit dem 2. August 2026 gilt Artikel 50 der EU-KI-Verordnung. Er verlangt von Anbietern generativer KI, synthetische Audio-, Bild-, Video- und Textausgaben maschinenlesbar zu kennzeichnen. Für Systeme, die schon vor dem 2. August 2026 auf dem Markt waren, gilt dafür eine Übergangsfrist bis zum 2. Dezember 2026. Wer als Unternehmen ein solches Werkzeug einsetzt, ist zunächst Anwender, kein Anbieter, und sollte dennoch bei seinem Dienstleister nachfragen, wie die Kennzeichnung umgesetzt wird.

Für Anwender kommt eine zweite Pflicht hinzu: Wo Menschen direkt mit einer KI sprechen, muss das erkennbar sein, es sei denn, es ist aus dem Zusammenhang offensichtlich. Eine Begrüßungsansage auf der Website, die klar als automatisierte Stimme erkennbar ist, bleibt unproblematisch. Heikel wird es bei personalisierten Anrufen, die wie ein persönlicher Anruf klingen sollen. Dort lohnt sich ein Hinweis am Anfang. Zur Rechtslage bei geklonten Stimmen sollten Sie zusätzlich anwaltlichen Rat einholen. Als Mindeststandard gilt: schriftliche Einwilligung der Person, deren Stimme genutzt wird, mit klarem Verwendungszweck.

So setzen Sie es im Mittelstand um

  • Beginnen Sie mit einem Anwendungsfall, bei dem Sie die Audiodatei vor der Veröffentlichung anhören, zum Beispiel einem Begrüßungstext oder einer Hörfassung Ihrer wichtigsten Produktseite.
  • Legen Sie in Notion oder in einer Tabelle fest, welche Stimme für welchen Anlass gilt und wer Texte freigibt.
  • Lassen Sie Fachbegriffe, Produktnamen und Ortsnamen einmal einsprechen und prüfen. Die Aussprache deutscher Eigennamen bleibt eine Schwachstelle.
  • Kennzeichnen Sie die Stimme dort, wo sie wie ein menschlicher Sprecher wirken könnte.
  • Speichern Sie, welches Modell und welche Einstellung für eine Datei verwendet wurden. Das hilft bei Nachfragen.

Wo wir unsere Einschätzung von 2025 korrigieren

Damals hatten wir von „vollautomatischen“ Voice-Einheiten gesprochen. In der Praxis hat sich ein Modell mit menschlicher Freigabe bewährt. Der Automat erzeugt Varianten, eine Person wählt aus. Das kostet pro Datei wenige Minuten und verhindert, dass ein falsch betonter Produktname auf Ihrer Website landet.

Auch die Aussage, ElevenLabs liefere den natürlichsten Ausdruck am Markt, würden wir heute vorsichtiger formulieren. Mehrere Anbieter liegen qualitativ nah beieinander. Entscheidend ist, wie gut Sprache, Datenschutzbedingungen und Anbindung zu Ihrem Betrieb passen. Hören Sie vor der Entscheidung dieselben drei Beispieltexte bei zwei Anbietern an.

Quellen

Markenstimme sauber aufsetzen

Wir zeigen im Strategie-Call, wie ein Voice-Workflow mit Freigabe und Kennzeichnung in Ihren Betrieb passt.