AI News · industry
IA de voz full-duplex: los modelos que escuchan mientras hablan
OpenAI, Google, Alibaba y StepFun lanzaron en septiembre de 2026 modelos de voz que puedes interrumpir a mitad de frase. Qué cambió, quién lidera cada prueba y qué significa para las llamadas telefónicas de un negocio.

La IA de voz full-duplex es un único modelo que escucha y habla a la vez, así que quien llama puede interrumpir, hacer una pausa o decir "ajá" sin romper la conversación. A 7 de octubre de 2026, GPT-Live-1 de OpenAI encabeza el Speech to Speech Index de Artificial Analysis con 83.2, apenas por delante de Gemini 3.8 Live Extended Thinking de Google, con 82.6, mientras que la china StepFun lidera la prueba que mide lo natural que resulta una conversación, con un 98.9%. Los tres se lanzaron o actualizaron en los últimos tres meses.
Si tu negocio atiende el teléfono, septiembre de 2026 es el mes en que cambió la tecnología que hay debajo de las llamadas con IA.
¿Qué significa "full-duplex" y por qué importa en una llamada?
La mayoría de los agentes telefónicos con IA creados antes de 2026 funcionaban como una cadena de relevos. Un sistema de voz a texto convertía las palabras de quien llamaba en texto, un modelo de lenguaje redactaba la respuesta y un sistema de texto a voz la leía en alto. Cada traspaso añade retraso, y el sistema tiene que adivinar cuándo ha terminado de hablar la otra persona. Si se adelanta, la pisa. Si se retrasa, queda un silencio incómodo.
Un modelo full-duplex escucha y habla dentro de una sola red, de forma continua. Puede oír "perdona, mejor el jueves" cuando todavía está a mitad de frase y cambiar de rumbo. Distingue entre alguien que ha dejado de hablar y alguien que se está pensando la respuesta.
La diferencia se nota en la práctica. Según OpenAI, la app de aprendizaje de idiomas Speak redujo casi un 80% las interrupciones durante las pausas en las que sus alumnos piensan, frente a sistemas anteriores por turnos. Otro cliente citado en el mismo anuncio, que crea conversaciones de cara al paciente, contó que abandonar su configuración encadenada le permitió eliminar 23,000 líneas de código.
Puede que tú mismo hayas colgado a un bot de voz porque no dejaba de cortarte.
¿Qué se lanzó entre julio y octubre de 2026?
| Modelo | Laboratorio | Región | Pesos | Lanzamiento | Lo que destaca |
|---|---|---|---|---|---|
| GPT-Live-1 | OpenAI | EE. UU. | Cerrados (API) | 10 sep 2026 | Delega el razonamiento difícil y las llamadas a herramientas en un modelo de backend aparte; compatible con telefonía |
| Gemini 3.8 Live / 3.8 Live Extended Thinking | Google DeepMind | EE. UU. | Cerrados (API) | 15 sep 2026 | Ejecuta llamadas a herramientas en segundo plano sin dejar de hablar; más de 97 idiomas |
| StepAudio 3 Realtime | StepFun | China | Cerrados (API, preview) | 15 sep 2026 | La puntuación más alta en dinámica conversacional de Artificial Analysis |
| Qwen-Audio-3.1-Realtime | Alibaba Qwen | China | Cerrados (API) | Sep 2026 | Rebaja de precio de alrededor del 85% en el modelo en tiempo real |
| Grok Voice Think Fast 2.0 | xAI | EE. UU. | Cerrados (API) | 29 jul 2026 | La mayor tasa de éxito en tareas de Artificial Analysis |
| NemotronLabs VoiceChat 11B | NVIDIA | EE. UU. | Pesos abiertos | Ago 2026 | Primer modelo full-duplex abierto con llamadas a herramientas |
| Raon-SpeechChat-9B | Krafton | Corea del Sur | Pesos abiertos | Abr 2026 | El menor tiempo hasta el primer audio de la clasificación (solo inglés) |
| Step-Audio R1.1 (Realtime) | StepFun | China | Pesos abiertos | A principios de 2026 | Modelo de voz abierto en tiempo real con buenas puntuaciones de razonamiento |
Fuentes: OpenAI, Google, documentación de StepFun, The Decoder sobre Qwen-Audio-3.1, xAI, NVIDIA en Hugging Face, Krafton en Hugging Face, StepFun en Hugging Face.
En la lista se repiten dos patrones. El primero: todos los modelos punteros separan ya "seguir hablando" de "ir a hacer el trabajo". GPT-Live-1 delega el razonamiento en un modelo de texto de backend, Gemini 3.8 Live llama a herramientas de forma asíncrona y StepFun describe su modelo como uno que piensa mientras habla. El segundo: el segmento de pesos abiertos incluye ahora un modelo full-duplex capaz de llamar a herramientas en plena conversación, algo que hasta este verano solo ofrecían las API alojadas.
¿Cuál es el mejor modelo de IA de voz ahora mismo?
No hay un ganador único, y quien te nombre uno sin aclarar "en qué prueba" te está vendiendo algo. Artificial Analysis combina cuatro pruebas en su índice: razonamiento hablado, rendimiento agéntico en tareas de atención al cliente de τ-Voice, preferencia en la arena y éxito en tareas. La dinámica conversacional la publica por separado. A 7 de octubre de 2026:
| Prueba (Artificial Analysis) | Líder | Puntuación | Le siguen de cerca |
|---|---|---|---|
| Speech to Speech Index general | GPT-Live-1 (backend Astra, medium) | 83.2 | Gemini 3.8 Live Extended Thinking (High) 82.6; Grok Voice Think Fast 2.0 High 81.3 |
| Razonamiento hablado (Big Bench Audio) | StepAudio 3 Realtime (StepFun) | 99.7% | Qwen Audio 3.0 Realtime Plus 99.2%; Qwen3.5 Omni Plus Realtime 98.7% |
| Rendimiento agéntico (tareas de atención al cliente de τ-Voice) | GPT-Live-1 (backend Astra, medium), un solo intento | 74.5% | Gemini 3.8 Live Extended Thinking (High) 68.6% |
| Dinámica conversacional (pausas, turnos de palabra, interrupciones) | StepAudio 3 Realtime (StepFun) | 98.9% | Qwen Audio 3.0 Realtime Plus 98.4%; GPT-Live-1 (Sol, low) 97.3% |
| Éxito en tareas en el Speech Agent Arena | Grok Voice Think Fast 2.0 High | 94.6% | Gemini 3.8 Live 93.2% |
Así se lee la tabla. En el índice general, OpenAI, Google y xAI están a menos de dos puntos entre sí, lo que en la práctica es un empate. En razonamiento hablado y en lo natural que resulta la conversación mandan los modelos chinos: StepFun y Alibaba superan a todos los modelos estadounidenses en ambas pruebas. La ventaja de OpenAI en la prueba de atención al cliente se apoya en un solo intento, así que tómala como provisional. Y la diferencia de precio es real: Artificial Analysis sitúa Qwen Audio 3.0 Realtime Plus de Alibaba como el modelo más barato de los que sigue por hora de audio de entrada.
Ten en cuenta que el nuevo Qwen-Audio-3.1-Realtime de Alibaba aún no tenía puntuación en la clasificación cuando lo consultamos, así que las filas de Alibaba de arriba corresponden a la versión 3.0.
¿En qué se quedan cortos todavía los nuevos modelos?
Los anuncios de lanzamiento son optimistas. Las tablas de benchmarks, más honestas.
- Sonar natural y hacer bien el trabajo son habilidades distintas. PersonaPlex, el modelo abierto de NVIDIA, saca un 91.0% en dinámica conversacional pero un 19% en razonamiento hablado en la misma tabla de Artificial Analysis. Un modelo puede sonar fluido y aun así equivocarse con la reserva.
- Escuchar mejor puede significar tardar más en callarse. Los resultados técnicos de la propia Alibaba, resumidos por MarkTechPost, muestran que su modelo mejoró mucho a la hora de ignorar lo que no iba dirigido a él, pero su tasa de reanudaciones no deseadas tras una interrupción subió de 0.035 a 0.130, y tarda 1.116 segundos en detenerse cuando lo interrumpen, frente a 0.383 segundos de GPT-Realtime-2.
- Las tareas de atención al cliente siguen sin estar resueltas. Incluso el mejor modelo en τ-Voice completa unas tres de cada cuatro tareas simuladas de aerolínea, comercio y telecomunicaciones. La cuarta parte restante falla.
- Los pesos abiertos son desiguales. Step-Audio R1.1, el modelo abierto de StepFun, saca un 97.6% en razonamiento hablado, una décima por detrás del mejor de Google (Gemini 3.8 Live Extended Thinking, 97.7%) y por delante de todos los modelos de OpenAI y xAI. Pero ningún modelo abierto tiene todavía puntuación de atención al cliente en τ-Voice, y la revisión de AI Weekly de la ficha del modelo de NVIDIA señala que elige la herramienta correcta el 82.5% de las veces, pero rellena bien los detalles solo el 44.2%. Revisa la licencia de cada modelo antes de construir sobre él.
¿Qué significa esto para un negocio que atiende llamadas?
En la práctica, el canal telefónico acaba de volverse más viable para trabajo real, y menos tolerante con las configuraciones lentas. La rapidez ya decide las ventas por texto. En el Response Velocity Study de Entagl, las conversaciones respondidas en menos de 60 segundos convirtieron un 35.1%, frente al 12.2% de las respondidas entre 5 y 60 minutos, sobre 32,581 conversaciones. Y una llamada es el canal más impaciente que existe.
Tres cosas que hacer con esta noticia:
- Prueba interrupciones, no demos. Llama a tu agente de IA y córtalo a mitad de frase, cambia la fecha a medio camino, quédate cuatro segundos en silencio. Nuestra guía para evaluar un agente telefónico con IA recoge los escenarios que merece la pena probar.
- Juzga la acción, no la voz. Una voz agradable que reserva la hora equivocada es peor que una voz normal que reserva la correcta. Comprueba que la cita, el pedido o la devolución de llamada llegan de verdad a tu sistema.
- No te cases con un solo modelo de voz. El 15 de septiembre, Google dijo que Gemini 3.8 Live Extended Thinking era el número 1 del índice de Artificial Analysis; tres semanas después, GPT-Live-1 está 0.6 puntos por encima. Ya defendimos la idea general en por qué no deberías construir tu negocio sobre un solo modelo de IA, y la voz es donde más duele.
¿Qué papel tiene el Coordinator de Entagl?
El Coordinator de Entagl gestiona llamadas entrantes y salientes por número de teléfono y por llamadas de WhatsApp (en los números compatibles y con el permiso del cliente cuando WhatsApp lo exige), con modelos nativos de voz a voz en lugar de una cadena de relevos. Su capa de voz está pensada para cambiar el modelo subyacente sin rehacer el agente: Gemini Live funciona por defecto, y los modelos en tiempo real de OpenAI se están incorporando como segunda opción. Antes de marcar, lee resúmenes de las conversaciones recientes del cliente, sus citas y sus llamadas anteriores, así que una llamada de confirmación o una devolución de llamada solicitada empieza con contexto en lugar de con un "¿en qué puedo ayudarle?". Cada llamada deja una transcripción en la ficha del cliente.
Para ver dónde encajan las llamadas a lo largo del recorrido del cliente, consulta IA de voz para atención al cliente y ventas. Para el uso más habitual, nuestro resumen de estudios sobre ausencias explica qué cambian realmente las llamadas de confirmación.
¿Quieres oír cómo suena una llamada con IA y contexto completo en tu propio caso? Reserva una demo de 30 minutos.
FAQ
¿Qué diferencia hay entre la IA de voz full-duplex y la half-duplex?
La IA de voz half-duplex (por turnos) habla por turnos: espera a que termines y luego responde. La IA de voz full-duplex escucha y habla a la vez, así que puede reaccionar a interrupciones, a señales como "ajá" y a pausas mientras todavía está hablando.
¿Cuál es el mejor modelo de IA de voz en octubre de 2026?
Depende de la prueba. En Artificial Analysis, a 7 de octubre de 2026, GPT-Live-1 encabeza el Speech to Speech Index general con 83.2, por poco delante de Gemini 3.8 Live Extended Thinking (82.6) y Grok Voice Think Fast 2.0 (81.3). StepAudio 3 Realtime de StepFun lidera en dinámica conversacional con un 98.9%.
¿Existen modelos de voz full-duplex de código abierto?
Sí. NVIDIA presenta su NemotronLabs VoiceChat 11B como el primer modelo full-duplex abierto con llamadas a herramientas, Raon-SpeechChat-9B de Krafton es abierto y solo funciona en inglés, y StepFun publica los pesos de Step-Audio R1.1. Su razonamiento puede ser sólido, pero ninguno tiene aún puntuación en el benchmark de atención al cliente τ-Voice, y las licencias varían, así que revisa las condiciones antes de construir.
¿Los modelos full-duplex dejan a los agentes telefónicos con IA listos para cualquier llamada?
No. El mejor modelo en el benchmark de atención al cliente τ-Voice completa el 74.5% de las tareas, según un solo intento. Mantén una vía clara para pasar con una persona, y prueba las acciones que realiza el agente, no solo cómo suena.
¿Un negocio tiene que elegir uno de estos modelos?
Normalmente no de forma directa. El primer puesto de la clasificación cambió de manos menos de tres semanas después del lanzamiento de Google del 15 de septiembre, así que lo más seguro es una plataforma cuya capa de voz pueda pasar a otro modelo sin rehacer el agente, y cuyas opciones compatibles compruebes antes de comprometerte.
Fuentes: páginas de producto y fichas de modelo de OpenAI, Google DeepMind, StepFun, xAI, NVIDIA y Krafton; clasificación Speech to Speech de Artificial Analysis (consultada el 7 de octubre de 2026); The Decoder (23 de septiembre de 2026); MarkTechPost (28 de septiembre de 2026); AI Weekly (agosto de 2026); Response Velocity Study de Entagl (2026).