Zum Inhalt springen
Strategie-Call buchen

Werkzeug

Voice-Pipeline: Latenz, Erkennung, Sprachausgabe

Wie Antwortzeit und Gesprächsfluss von Spracherkennung, Modell und Sprachausgabe abhängen.

Am Telefon wirken Pausen schnell unnatürlich. Schon Verzögerungen von etwa einer Sekunde fühlen sich zäh an. Die Gesamtlatenz setzt sich aus mehreren Stufen zusammen, die Sie einzeln betrachten sollten.

  • Spracherkennung: Streaming-Erkennung liefert Text, während die Person noch spricht. Wichtig ist eine gute Erkennung von Dialekten, Eigennamen und Zahlen.
  • Sprechende erkennen: Eine Sprachaktivitätserkennung entscheidet, wann die Person fertig ist. Zu früh heißt Unterbrechung, zu spät heißt Pause.
  • Sprachmodell: Kleinere Modelle antworten schneller. Streaming der Ausgabe erlaubt, mit dem Sprechen zu beginnen, bevor die Antwort komplett ist.
  • Sprachausgabe: Natürliche Betonung und Aussprache deutscher Namen sind entscheidend für die Akzeptanz.
  • Netzwerk und Telefonanbindung: Standort der Server und Art der Anbindung wirken sich messbar aus.

Unterbrechbarkeit (Barge-in) ist ein eigener Punkt: Der Agent sollte aufhören zu reden, wenn die Person ihn unterbricht. Testen Sie mit realen Geräuschen, Mobilfunk und unterschiedlichen Stimmen, nicht nur im ruhigen Büro. Messen Sie die Zeit vom Ende der Äußerung bis zum ersten gesprochenen Wort und legen Sie ein Ziel fest.

Zur Übersicht

Verwandt

Mehr zu Voice AI, Sprachmodelle