Passer au contenu

AI News · industry

IA vocale full-duplex : les modèles qui écoutent pendant qu'ils parlent

OpenAI, Google, Alibaba et StepFun ont lancé en septembre 2026 des modèles vocaux que l'on peut interrompre en pleine phrase. Ce qui a changé, qui mène sur quel test, et ce que cela signifie pour les appels téléphoniques des entreprises.

Entagl Team9 min de lecture
IA vocale full-duplex : les modèles qui écoutent pendant qu'ils parlent

L'IA vocale full-duplex, c'est un modèle unique qui écoute et parle en même temps : l'appelant peut l'interrompre, marquer une pause ou dire « mm-hmm » sans casser la conversation. Au 7 octobre 2026, GPT-Live-1 d'OpenAI est en tête du Speech to Speech Index d'Artificial Analysis avec 83.2, juste devant Gemini 3.8 Live Extended Thinking de Google à 82.6, tandis que le chinois StepFun domine le test qui mesure le naturel d'une conversation avec 98.9%. Les trois ont été lancés ou mis à jour au cours des trois derniers mois.

Si votre entreprise répond au téléphone, c'est en septembre 2026 que la technologie derrière les appels IA a changé.

Que signifie « full-duplex », et pourquoi est-ce important au téléphone ?

La plupart des agents téléphoniques IA conçus avant 2026 fonctionnaient comme un relais. La reconnaissance vocale transformait les paroles de l'appelant en texte, un modèle de langage rédigeait une réponse, puis la synthèse vocale la lisait. Chaque passage de relais ajoute du délai, et le système doit deviner quand l'appelant a terminé. S'il devine trop tôt, il lui coupe la parole. Trop tard, et un silence gênant s'installe.

Un modèle full-duplex écoute et parle au sein d'un seul réseau, en continu. Il peut entendre « pardon, mettez plutôt jeudi » alors qu'il est encore au milieu de sa phrase, et changer de cap. Il sait faire la différence entre un appelant qui a fini de parler et un appelant qui réfléchit.

La différence se voit sur le terrain. OpenAI rapporte que l'application d'apprentissage des langues Speak a réduit de près de 80% les interruptions pendant les pauses de réflexion des apprenants, par rapport aux anciens systèmes au tour par tour. Un autre client cité dans la même annonce, qui conçoit des conversations avec des patients, affirme que l'abandon de son architecture en chaîne a supprimé 23,000 lignes de code.

Vous avez peut-être déjà raccroché au nez d'un robot vocal parce qu'il ne cessait de vous couper la parole.

Qu'est-ce qui est sorti entre juillet et octobre 2026 ?

Modèle Laboratoire Région Poids Sortie Ce qui le distingue
GPT-Live-1 OpenAI États-Unis Fermés (API) 10 sept. 2026 Confie le raisonnement difficile et les appels d'outils à un modèle backend distinct ; prise en charge de la téléphonie
Gemini 3.8 Live / 3.8 Live Extended Thinking Google DeepMind États-Unis Fermés (API) 15 sept. 2026 Exécute les appels d'outils en arrière-plan tout en continuant à parler ; plus de 97 langues
StepAudio 3 Realtime StepFun Chine Fermés (API, préversion) 15 sept. 2026 Meilleur score de dynamique conversationnelle sur Artificial Analysis
Qwen-Audio-3.1-Realtime Alibaba Qwen Chine Fermés (API) Sept. 2026 Baisse de prix d'environ 85% sur le modèle temps réel
Grok Voice Think Fast 2.0 xAI États-Unis Fermés (API) 29 juil. 2026 Meilleur taux de réussite des tâches sur Artificial Analysis
NemotronLabs VoiceChat 11B NVIDIA États-Unis Poids ouverts Août 2026 Premier modèle full-duplex ouvert avec appel d'outils
Raon-SpeechChat-9B Krafton Corée du Sud Poids ouverts Avr. 2026 Délai avant le premier son le plus court du classement (anglais uniquement)
Step-Audio R1.1 (Realtime) StepFun Chine Poids ouverts Plus tôt en 2026 Modèle vocal temps réel ouvert, avec de solides scores de raisonnement

Sources : OpenAI, Google, documentation StepFun, The Decoder sur Qwen-Audio-3.1, xAI, NVIDIA sur Hugging Face, Krafton sur Hugging Face, StepFun sur Hugging Face.

Deux tendances traversent cette liste. D'abord, chaque modèle de pointe sépare désormais « continuer à parler » et « aller faire le travail ». GPT-Live-1 délègue le raisonnement à un modèle texte en backend, Gemini 3.8 Live appelle ses outils de manière asynchrone, et StepFun décrit son modèle comme capable de réfléchir tout en parlant. Ensuite, la catégorie des poids ouverts compte maintenant un modèle full-duplex capable d'appeler des outils en pleine conversation, ce que seules les API hébergées proposaient jusqu'à cet été.

Quel est le meilleur modèle d'IA vocale en ce moment ?

Il n'y a pas de vainqueur unique, et quiconque en désigne un sans préciser « sur quel test » cherche à vous vendre quelque chose. Artificial Analysis combine quatre tests dans son index : le raisonnement vocal, la performance agentique sur les tâches de service client τ-Voice, la préférence en arène et la réussite des tâches. La dynamique conversationnelle est publiée à part. Au 7 octobre 2026 :

Test (Artificial Analysis) En tête Score Juste derrière
Speech to Speech Index global GPT-Live-1 (backend Astra, medium) 83.2 Gemini 3.8 Live Extended Thinking (High) 82.6 ; Grok Voice Think Fast 2.0 High 81.3
Raisonnement vocal (Big Bench Audio) StepAudio 3 Realtime (StepFun) 99.7% Qwen Audio 3.0 Realtime Plus 99.2% ; Qwen3.5 Omni Plus Realtime 98.7%
Performance agentique (tâches de service client τ-Voice) GPT-Live-1 (backend Astra, medium), un seul essai 74.5% Gemini 3.8 Live Extended Thinking (High) 68.6%
Dynamique conversationnelle (pauses, tours de parole, interruptions) StepAudio 3 Realtime (StepFun) 98.9% Qwen Audio 3.0 Realtime Plus 98.4% ; GPT-Live-1 (Sol, low) 97.3%
Réussite des tâches dans la Speech Agent Arena Grok Voice Think Fast 2.0 High 94.6% Gemini 3.8 Live 93.2%

Voici comment lire ce tableau. Sur l'index global, OpenAI, Google et xAI se tiennent à moins de deux points, ce qui revient en pratique à une égalité. Sur le raisonnement vocal et sur le naturel de la conversation, les modèles chinois sont devant : StepFun et Alibaba battent tous les modèles américains sur ces deux tests. L'avance d'OpenAI sur le test de service client repose sur un seul essai, donc considérez-la comme provisoire. Et l'écart de prix est bien réel : Artificial Analysis classe Qwen Audio 3.0 Realtime Plus d'Alibaba comme le modèle le moins cher qu'il suit, à l'heure d'audio en entrée.

Précision : le plus récent Qwen-Audio-3.1-Realtime d'Alibaba n'était pas encore évalué dans le classement au moment de notre vérification, les lignes Alibaba ci-dessus concernent donc la version 3.0.

Où les nouveaux modèles restent-ils en deçà ?

Les annonces de lancement sont optimistes. Les tableaux de benchmarks sont plus honnêtes.

  • Paraître naturel et faire le travail sont deux compétences différentes. PersonaPlex, le modèle ouvert de NVIDIA, obtient 91.0% en dynamique conversationnelle mais 19% en raisonnement vocal dans le même tableau d'Artificial Analysis. Un modèle peut avoir l'air fluide et pourtant se tromper de réservation.
  • Mieux écouter peut vouloir dire s'arrêter moins vite. Les résultats techniques publiés par Alibaba, résumés par MarkTechPost, montrent que son modèle ignore bien mieux les paroles qui ne lui sont pas adressées, mais que son taux de reprise intempestive après une interruption est passé de 0.035 à 0.130, et qu'il lui faut 1.116 seconde pour s'arrêter quand on l'interrompt, contre 0.383 seconde pour GPT-Realtime-2.
  • Les tâches de service client ne sont toujours pas résolues. Même le meilleur modèle sur τ-Voice ne mène à bien qu'environ trois tâches sur quatre parmi des répliques de scénarios aériens, de commerce et de télécoms. Le quart restant échoue.
  • Les poids ouverts sont inégaux. Step-Audio R1.1, le modèle ouvert de StepFun, obtient 97.6% en raisonnement vocal, un dixième de point derrière le meilleur de Google (Gemini 3.8 Live Extended Thinking, 97.7%) et devant tous les modèles d'OpenAI et de xAI. Mais aucun modèle ouvert n'a encore de score de service client τ-Voice, et l'analyse d'AI Weekly de la fiche du modèle de NVIDIA relève qu'il choisit le bon outil dans 82.5% des cas, mais ne remplit correctement les détails que dans 44.2% des cas. Vérifiez la licence de chaque modèle avant de bâtir dessus.

Qu'est-ce que cela change pour une entreprise qui reçoit des appels ?

Concrètement, le téléphone devient un canal plus viable pour du vrai travail, et moins tolérant envers les configurations lentes. À l'écrit, la rapidité décide déjà des ventes. Dans l'étude Response Velocity d'Entagl, les conversations auxquelles on répondait en moins de 60 secondes convertissaient à 35.1%, contre 12.2% entre 5 et 60 minutes, sur 32,581 conversations. Et l'appel téléphonique est le canal le plus impatient qui soit.

Trois choses à faire de cette actualité :

  1. Testez les interruptions, pas les démos. Appelez votre agent IA et coupez-lui la parole en pleine phrase, changez la date à mi-parcours, restez silencieux quatre secondes. Notre guide pour évaluer un agent téléphonique IA liste les scénarios qui valent la peine d'être joués.
  2. Jugez l'action, pas la voix. Une voix agréable qui réserve le mauvais créneau vaut moins qu'une voix banale qui réserve le bon. Vérifiez que le rendez-vous, la commande ou le rappel arrive vraiment dans votre système.
  3. Ne vous mariez pas avec un seul modèle vocal. Le 15 septembre, Google annonçait que Gemini 3.8 Live Extended Thinking était n° 1 de l'index d'Artificial Analysis ; trois semaines plus tard, GPT-Live-1 le devance de 0.6 point. Nous avons développé l'argument général dans pourquoi il ne faut pas bâtir votre entreprise sur un seul modèle d'IA, et c'est dans la voix que cela fait le plus mal.

Quelle est la place du Coordinator d'Entagl ?

Le Coordinator d'Entagl gère les appels entrants et sortants sur des numéros de téléphone et via les appels WhatsApp (sur les numéros compatibles, et avec l'autorisation du client lorsque WhatsApp l'exige), en s'appuyant sur des modèles speech-to-speech natifs plutôt que sur un relais en chaîne. Sa couche vocale est conçue pour changer de modèle sous-jacent sans reconstruire l'agent : Gemini Live tourne par défaut, et les modèles temps réel d'OpenAI sont en cours de déploiement comme seconde option. Avant de composer le numéro, il lit les résumés des conversations récentes du client, ses rendez-vous et ses appels passés, si bien qu'un appel de confirmation ou un rappel demandé commence avec le contexte au lieu d'un « comment puis-je vous aider ? ». Chaque appel laisse une transcription dans la fiche du client.

Pour voir où les appels s'inscrivent dans le parcours client, lisez l'IA vocale pour le service client et la vente. Pour l'usage le plus courant, notre synthèse des recherches sur les rendez-vous manqués montre ce que les appels de confirmation changent vraiment.

Vous voulez entendre ce que donne un appel IA avec tout le contexte, sur votre propre cas d'usage ? Réservez une démo de 30 minutes.

FAQ

Quelle est la différence entre une IA vocale full-duplex et half-duplex ?

L'IA vocale half-duplex (au tour par tour) parle chacun son tour : elle attend que vous ayez fini, puis répond. L'IA vocale full-duplex écoute et parle en même temps, elle peut donc réagir aux interruptions, aux signaux d'écoute comme « mm-hmm » et aux pauses alors qu'elle est encore en train de parler.

Quel est le meilleur modèle d'IA vocale en octobre 2026 ?

Tout dépend du test. Sur Artificial Analysis, au 7 octobre 2026, GPT-Live-1 mène le Speech to Speech Index global avec 83.2, de peu devant Gemini 3.8 Live Extended Thinking (82.6) et Grok Voice Think Fast 2.0 (81.3). StepAudio 3 Realtime de StepFun est en tête en dynamique conversationnelle avec 98.9%.

Existe-t-il des modèles vocaux full-duplex open source ?

Oui. NVIDIA présente son NemotronLabs VoiceChat 11B comme le premier modèle full-duplex ouvert avec appel d'outils, Raon-SpeechChat-9B de Krafton est ouvert et uniquement en anglais, et StepFun publie les poids de Step-Audio R1.1. Leur raisonnement peut être solide, mais aucun n'a encore été évalué sur le benchmark de service client τ-Voice, et les licences diffèrent : vérifiez les conditions avant de construire.

Les modèles full-duplex rendent-ils les agents téléphoniques IA prêts pour tous les appels ?

Non. Le meilleur modèle sur le benchmark de service client τ-Voice mène à bien 74.5% des tâches, sur la base d'un seul essai. Gardez un chemin clair vers un humain, et testez les actions que l'agent effectue, pas seulement sa voix.

Une entreprise doit-elle choisir l'un de ces modèles ?

En général, pas directement. La tête du classement a changé de mains moins de trois semaines après le lancement de Google le 15 septembre. Le choix le plus sûr est donc une plateforme dont la couche vocale peut passer à un autre modèle sans reconstruire l'agent, et dont vous vérifiez les options prises en charge avant de vous engager.

Sources : pages produits et fiches de modèles d'OpenAI, Google DeepMind, StepFun, xAI, NVIDIA et Krafton ; classement Speech to Speech d'Artificial Analysis (consulté le 7 octobre 2026) ; The Decoder (23 septembre 2026) ; MarkTechPost (28 septembre 2026) ; AI Weekly (août 2026) ; étude Response Velocity d'Entagl (2026).

Publié par Entagl Team on