Zum Inhalt springen

AI News · industry

Full-Duplex-Sprach-KI: Die Modelle, die zuhören, während sie sprechen

OpenAI, Google, Alibaba und StepFun haben im September 2026 Sprachmodelle veröffentlicht, denen man mitten im Satz ins Wort fallen kann. Was sich geändert hat, wer bei welchem Test vorne liegt und was das für geschäftliche Telefonate bedeutet.

Entagl Team9 Min. Lesezeit
Full-Duplex-Sprach-KI: Die Modelle, die zuhören, während sie sprechen

Full-Duplex-Sprach-KI ist ein einzelnes Modell, das gleichzeitig zuhört und spricht. Anrufer können also unterbrechen, eine Pause machen oder „aha“ sagen, ohne dass das Gespräch abreißt. Stand 7. Oktober 2026 führt OpenAIs GPT-Live-1 den Speech to Speech Index von Artificial Analysis mit 83,2 an, knapp vor Googles Gemini 3.8 Live Extended Thinking mit 82,6. Beim Test, wie natürlich sich ein Gespräch anfühlt, liegt dagegen StepFun aus China mit 98,9 % vorne. Alle drei sind in den letzten drei Monaten erschienen oder wurden aktualisiert.

Wenn in Ihrem Unternehmen Anrufe entgegengenommen werden: Im September 2026 hat sich die Technik unter KI-Telefonaten grundlegend verändert.

Was bedeutet „Full-Duplex“, und warum zählt das am Telefon?

Die meisten KI-Telefonagenten, die vor 2026 gebaut wurden, funktionierten wie eine Staffel. Spracherkennung wandelte die Worte des Anrufers in Text um, ein Sprachmodell schrieb eine Antwort, und eine Sprachsynthese las sie vor. Jede Übergabe kostet Zeit, und das System muss raten, wann der Anrufer fertig ist. Rät es zu früh, redet es ihm dazwischen. Rät es zu spät, entsteht eine unangenehme Stille.

Ein Full-Duplex-Modell erledigt Zuhören und Sprechen in einem einzigen Netz, und zwar ununterbrochen. Es hört „Entschuldigung, lieber doch Donnerstag“, während es selbst noch mitten im Satz ist, und ändert die Richtung. Es erkennt den Unterschied zwischen einem Anrufer, der zu Ende gesprochen hat, und einem, der gerade nachdenkt.

In der Praxis macht das einen spürbaren Unterschied. OpenAI berichtet, dass die Sprachlern-App Speak Unterbrechungen in den Denkpausen der Lernenden im Vergleich zu früheren rundenbasierten Systemen um fast 80 % reduziert hat. Ein weiterer Kunde, der in derselben Ankündigung zitiert wird und Gespräche mit Patienten entwickelt, gab an, dass der Umstieg von seinem verketteten Aufbau 23.000 Zeilen Code überflüssig gemacht hat.

Vielleicht haben Sie selbst schon einmal bei einem Sprachbot aufgelegt, weil er Ihnen ständig ins Wort fiel.

Was ist zwischen Juli und Oktober 2026 erschienen?

Modell Labor Region Gewichte Veröffentlicht Was auffällt
GPT-Live-1 OpenAI USA Geschlossen (API) 10. Sep. 2026 Gibt schwieriges Schlussfolgern und Tool-Aufrufe an ein separates Backend-Modell ab; Telefonie-Unterstützung
Gemini 3.8 Live / 3.8 Live Extended Thinking Google DeepMind USA Geschlossen (API) 15. Sep. 2026 Führt Tool-Aufrufe im Hintergrund aus, während es weiterspricht; 97+ Sprachen
StepAudio 3 Realtime StepFun China Geschlossen (API, Vorschau) 15. Sep. 2026 Höchster Wert für Gesprächsdynamik bei Artificial Analysis
Qwen-Audio-3.1-Realtime Alibaba Qwen China Geschlossen (API) Sep. 2026 Preissenkung um rund 85 % beim Echtzeitmodell
Grok Voice Think Fast 2.0 xAI USA Geschlossen (API) 29. Juli 2026 Höchste Aufgabenerfolgsquote bei Artificial Analysis
NemotronLabs VoiceChat 11B NVIDIA USA Offene Gewichte Aug. 2026 Erstes offenes Full-Duplex-Modell mit Tool-Aufrufen
Raon-SpeechChat-9B Krafton Südkorea Offene Gewichte Apr. 2026 Schnellste Zeit bis zum ersten Audio auf der Rangliste (nur Englisch)
Step-Audio R1.1 (Realtime) StepFun China Offene Gewichte Anfang 2026 Offenes Echtzeit-Sprachmodell mit starken Werten beim Schlussfolgern

Quellen: OpenAI, Google, StepFun-Dokumentation, The Decoder zu Qwen-Audio-3.1, xAI, NVIDIA auf Hugging Face, Krafton auf Hugging Face, StepFun auf Hugging Face.

Zwei Muster ziehen sich durch die Liste. Erstens trennt inzwischen jedes Spitzenmodell „weiterreden“ von „die eigentliche Arbeit erledigen“. GPT-Live-1 delegiert das Schlussfolgern an ein Text-Modell im Backend, Gemini 3.8 Live ruft Tools asynchron auf, und StepFun beschreibt sein Modell als eines, das beim Sprechen denkt. Zweitens gibt es bei den offenen Gewichten jetzt ein Full-Duplex-Modell, das mitten im Gespräch Tools aufrufen kann. Bis zu diesem Sommer boten das nur die gehosteten APIs.

Welches Sprach-KI-Modell ist derzeit das beste?

Einen eindeutigen Sieger gibt es nicht, und wer einen nennt, ohne „bei welchem Test“ dazuzusagen, will Ihnen etwas verkaufen. Artificial Analysis fasst vier Tests in seinem Index zusammen: Schlussfolgern in gesprochener Sprache, agentische Leistung bei τ-Voice-Kundenservice-Aufgaben, Präferenz in der Arena und Aufgabenerfolg. Die Gesprächsdynamik wird separat ausgewiesen. Stand 7. Oktober 2026:

Test (Artificial Analysis) Spitzenreiter Wert Dicht dahinter
Gesamter Speech to Speech Index GPT-Live-1 (Astra-Backend, medium) 83,2 Gemini 3.8 Live Extended Thinking (High) 82,6; Grok Voice Think Fast 2.0 High 81,3
Schlussfolgern in gesprochener Sprache (Big Bench Audio) StepAudio 3 Realtime (StepFun) 99,7 % Qwen Audio 3.0 Realtime Plus 99,2 %; Qwen3.5 Omni Plus Realtime 98,7 %
Agentische Leistung (τ-Voice-Kundenservice-Aufgaben) GPT-Live-1 (Astra-Backend, medium), ein Durchlauf 74,5 % Gemini 3.8 Live Extended Thinking (High) 68,6 %
Gesprächsdynamik (Pausen, Sprecherwechsel, Unterbrechungen) StepAudio 3 Realtime (StepFun) 98,9 % Qwen Audio 3.0 Realtime Plus 98,4 %; GPT-Live-1 (Sol, low) 97,3 %
Aufgabenerfolg in der Speech Agent Arena Grok Voice Think Fast 2.0 High 94,6 % Gemini 3.8 Live 93,2 %

So lesen Sie die Tabelle: Im Gesamtindex liegen OpenAI, Google und xAI weniger als zwei Punkte auseinander. Praktisch ist das ein Gleichstand. Beim Schlussfolgern in gesprochener Sprache und dabei, wie natürlich sich das Gespräch anfühlt, führen chinesische Modelle: StepFun und Alibaba schlagen in beiden Disziplinen jedes US-Modell. OpenAIs Vorsprung beim Kundenservice-Test beruht auf einem einzigen Durchlauf, sehen Sie ihn also als vorläufig an. Und der Preisunterschied ist real: Artificial Analysis führt Alibabas Qwen Audio 3.0 Realtime Plus als günstigstes erfasstes Modell pro Stunde Eingangsaudio.

Beachten Sie, dass Alibabas neueres Qwen-Audio-3.1-Realtime zum Zeitpunkt unserer Prüfung noch nicht auf der Rangliste bewertet war. Die Alibaba-Zeilen oben beziehen sich daher auf Version 3.0.

Wo hapert es bei den neuen Modellen noch?

Die Ankündigungen klingen optimistisch. Die Benchmark-Tabellen sind ehrlicher.

  • Natürlich klingen und die Aufgabe erledigen sind zwei verschiedene Fähigkeiten. NVIDIAs offenes PersonaPlex erreicht 91,0 % bei der Gesprächsdynamik, aber nur 19 % beim Schlussfolgern in gesprochener Sprache, und zwar in derselben Tabelle von Artificial Analysis. Ein Modell kann flüssig klingen und die Buchung trotzdem falsch eintragen.
  • Besseres Zuhören kann langsameres Aufhören bedeuten. Alibabas eigene technische Ergebnisse, zusammengefasst von MarkTechPost, zeigen: Das Modell ignoriert Sprache, die nicht an es gerichtet ist, deutlich besser. Doch seine Rate an ungewolltem Weitersprechen nach Unterbrechungen stieg von 0,035 auf 0,130, und es braucht 1,116 Sekunden, um bei einer Unterbrechung zu verstummen, gegenüber 0,383 Sekunden bei GPT-Realtime-2.
  • Kundenservice-Aufgaben sind noch nicht gelöst. Selbst das beste Modell bei τ-Voice schafft etwa drei von vier nachgebildeten Aufgaben aus Airline, Handel und Telekommunikation. Das restliche Viertel scheitert.
  • Offene Gewichte sind uneinheitlich. StepFuns offenes Step-Audio R1.1 erreicht 97,6 % beim Schlussfolgern in gesprochener Sprache, ein Zehntelpunkt hinter Googles bestem Modell (Gemini 3.8 Live Extended Thinking, 97,7 %) und vor jedem Modell von OpenAI und xAI. Für kein offenes Modell gibt es bisher allerdings einen τ-Voice-Kundenservice-Wert. Und die Analyse von AI Weekly zur Model Card von NVIDIA hält fest, dass das Modell in 82,5 % der Fälle das richtige Tool wählt, die Details aber nur in 44,2 % der Fälle korrekt ausfüllt. Prüfen Sie die Lizenz jedes Modells, bevor Sie darauf aufbauen.

Was bedeutet das für ein Unternehmen, das Anrufe entgegennimmt?

Unterm Strich ist der Telefonkanal für echte Arbeit tauglicher geworden und verzeiht langsame Setups weniger. Im Text entscheidet die Geschwindigkeit schon heute über Verkäufe. In Entagls Response Velocity Study konvertierten Gespräche, die innerhalb von 60 Sekunden beantwortet wurden, zu 35,1 %, gegenüber 12,2 % bei 5 bis 60 Minuten, über 32.581 Gespräche hinweg. Und kein Kanal ist ungeduldiger als ein Telefonanruf.

Drei Dinge, die Sie aus diesen Neuigkeiten mitnehmen sollten:

  1. Testen Sie Unterbrechungen, keine Demos. Rufen Sie Ihren KI-Agenten an und fallen Sie ihm mitten im Satz ins Wort, ändern Sie das Datum auf halber Strecke, schweigen Sie vier Sekunden lang. Unser Leitfaden zur Bewertung eines KI-Telefonagenten listet die Szenarien auf, die sich lohnen.
  2. Bewerten Sie die Aktion, nicht die Stimme. Eine angenehme Stimme, die den falschen Termin bucht, ist schlechter als eine schlichte, die den richtigen bucht. Prüfen Sie, ob der Termin, die Bestellung oder der Rückruf tatsächlich in Ihrem System ankommt.
  3. Binden Sie sich nicht an ein einziges Sprachmodell. Am 15. September erklärte Google, Gemini 3.8 Live Extended Thinking sei die Nummer 1 im Index von Artificial Analysis. Drei Wochen später liegt GPT-Live-1 0,6 Punkte darüber. Die grundsätzlichen Argumente haben wir in Warum Sie Ihr Geschäft nicht auf ein einziges KI-Modell bauen sollten dargelegt, und bei Sprache trifft es am härtesten.

Wie passt Entagls Coordinator hier hinein?

Entagls Coordinator übernimmt eingehende und ausgehende Anrufe über Telefonnummern und WhatsApp-Anrufe (auf unterstützten Nummern und, wo WhatsApp es verlangt, mit Zustimmung des Kunden). Dabei nutzt er native Speech-to-Speech-Modelle statt einer verketteten Staffel. Seine Sprachschicht ist so gebaut, dass sich das zugrunde liegende Modell austauschen lässt, ohne den Agenten neu aufzubauen: Standardmäßig läuft Gemini Live, und die Echtzeitmodelle von OpenAI werden gerade als zweite Option eingeführt. Bevor er wählt, liest er Zusammenfassungen der letzten Gespräche des Kunden, seine Termine und frühere Anrufe. Ein Bestätigungsanruf oder ein gewünschter Rückruf beginnt also mit Kontext statt mit „Wie kann ich Ihnen helfen?“. Jeder Anruf hinterlässt ein Transkript im Kundendatensatz.

Wo Anrufe in die gesamte Customer Journey passen, lesen Sie in KI-Sprache für Kundenservice und Vertrieb. Für den häufigsten Einsatzzweck zeigt unser Überblick zur Forschung über Terminausfälle, was Bestätigungsanrufe tatsächlich verändern.

Sie möchten hören, wie ein KI-Anruf mit vollem Kontext in Ihrem eigenen Anwendungsfall klingt? Buchen Sie eine 30-minütige Demo.

FAQ

Was ist der Unterschied zwischen Full-Duplex- und Half-Duplex-Sprach-KI?

Half-Duplex-Sprach-KI (rundenbasiert) wechselt sich ab: Sie wartet, bis Sie aufhören, und antwortet dann. Full-Duplex-Sprach-KI hört zu und spricht gleichzeitig. So kann sie auf Unterbrechungen, Rückmeldesignale wie „mhm“ und Pausen reagieren, während sie selbst noch spricht.

Welches ist im Oktober 2026 das beste KI-Sprachmodell?

Das hängt vom Test ab. Bei Artificial Analysis führt Stand 7. Oktober 2026 GPT-Live-1 den gesamten Speech to Speech Index mit 83,2 an, knapp vor Gemini 3.8 Live Extended Thinking (82,6) und Grok Voice Think Fast 2.0 (81,3). StepFuns StepAudio 3 Realtime führt bei der Gesprächsdynamik mit 98,9 %.

Gibt es Open-Source-Sprachmodelle mit Full-Duplex?

Ja. NVIDIA bezeichnet sein NemotronLabs VoiceChat 11B als erstes offenes Full-Duplex-Modell mit Tool-Aufrufen, Kraftons Raon-SpeechChat-9B ist offen und nur auf Englisch verfügbar, und StepFun veröffentlicht die Gewichte von Step-Audio R1.1. Beim Schlussfolgern können sie stark sein, doch keines wurde bisher im τ-Voice-Kundenservice-Benchmark bewertet, und die Lizenzen unterscheiden sich. Prüfen Sie also die Bedingungen, bevor Sie darauf aufbauen.

Sind KI-Telefonagenten mit Full-Duplex-Modellen für jeden Anruf bereit?

Nein. Das beste Modell im τ-Voice-Kundenservice-Benchmark erledigt 74,5 % der Aufgaben, basierend auf einem einzigen Durchlauf. Sorgen Sie für einen klaren Weg zu einem Menschen, und testen Sie die Aktionen, die der Agent ausführt, nicht nur, wie er klingt.

Muss sich ein Unternehmen für eines dieser Modelle entscheiden?

Meist nicht direkt. Die Spitze der Rangliste hat innerhalb von drei Wochen nach Googles Launch am 15. September den Besitzer gewechselt. Sicherer ist daher eine Plattform, deren Sprachschicht auf ein anderes Modell wechseln kann, ohne dass der Agent neu aufgebaut werden muss, und deren unterstützte Optionen Sie prüfen, bevor Sie sich festlegen.

Quellen: Produktseiten und Model Cards von OpenAI, Google DeepMind, StepFun, xAI, NVIDIA und Krafton; Speech to Speech Leaderboard von Artificial Analysis (abgerufen am 7. Oktober 2026); The Decoder (23. September 2026); MarkTechPost (28. September 2026); AI Weekly (August 2026); Entagl Response Velocity Study (2026).

Veröffentlicht von Entagl Team on