Von Text zu Stimme: Voice-Workflows mit KI 2026
Markenstimme per KI: was Eleven v3, Notion-Agenten und die Kennzeichnungspflicht seit August 2026 für Ihre Audio-Workflows ändern.
Automatisierung · 27. März 2026

Google hat am 26. März 2026 Gemini 3.1 Flash Live vorgestellt, nach eigener Aussage das bislang beste Audio- und Sprachmodell des Unternehmens. Es soll Gespräche präziser und mit geringerer Verzögerung führen. Entwickler erhalten es als Vorschau über die Gemini Live API in Google AI Studio, Unternehmen über Gemini Enterprise for Customer Experience. Endnutzer treffen es in Search Live und Gemini Live.
Klassische Sprachassistenten arbeiten in Stufen: Sprache wird in Text umgewandelt, ein Sprachmodell antwortet, ein weiteres System spricht den Text. Jede Stufe kostet Zeit und verliert Nuancen. Flash Live verarbeitet Audio direkt. Google nennt als Vorteil, dass das Modell Tonlage und Tempo besser erkennt und etwa Frust oder Verwirrung im Gespräch berücksichtigen kann.
Auf dem Benchmark ComplexFuncBench Audio, der prüft, ob ein Sprachmodell aufgrund gesprochener Anweisungen die richtigen Funktionen aufruft, erreicht es 90,8 Prozent. Im Scale-AI-Test Audio MultiChallenge sind es 36,1 Prozent mit aktiviertem Denkmodus. Der zweite Wert zeigt: Bei längeren, komplizierten Gesprächen bleibt viel Luft nach oben. Beide Zahlen sind Herstellerangaben.
Für Voice-Projekte im Mittelstand sind zwei Punkte wichtig. Erstens kann ein Telefonassistent flüssiger wirken, wenn Antwortzeiten sinken. Zweitens kann ein Modell, das beim Sprechen Funktionen aufruft, direkt im Gespräch einen Termin prüfen oder einen Auftragsstatus abfragen. Der Assistent wird damit vom Auskunftsgeber zum Bearbeiter.
Das erhöht den Anspruch an die Absicherung. Eine falsch verstandene Zahl am Telefon landet sonst in einem Auftrag.
Bemerkenswert ist das Wasserzeichen SynthID: Google bettet es unhörbar in die erzeugte Sprache ein, damit sich KI-generiertes Audio zuverlässig erkennen lässt. Das passt zu den anstehenden Transparenzpflichten der KI-Verordnung. Sie gelten nach aktuellem Stand ab August 2026 und verlangen unter anderem, dass Nutzer erkennen, wenn sie mit einer KI sprechen. Planen Sie die Ansage am Gesprächsbeginn also von Anfang an ein.
Wer bereits mit Voice-Ansätzen arbeitet, sollte das neue Modell als weitere Option in den Vergleich aufnehmen. Ein Wechsel lohnt erst, wenn Tests mit Ihrer Sprache, Ihrem Dialekt und Ihren Fachbegriffen besser ausfallen.