AI News · industry
La voz con IA en 2026: el año en que las máquinas aprendieron a sostener una llamada
Los modelos de voz a voz en tiempo real convirtieron las llamadas telefónicas con IA de un IVR robótico en una conversación natural, y cambiaron la economía de la llamada de seguimiento.

Los agentes de voz con IA cruzaron un umbral real en 2026. Los modelos de voz a voz que escuchan y hablan en un solo paso —interrumpibles, multilingües y lo bastante rápidos como para parecer humanos— pasaron de la demo a la producción. La API Realtime de OpenAI se hizo de disponibilidad general con el modelo gpt-realtime el 28 de agosto de 2025, y la Gemini Live API de Google ahora ejecuta audio nativo en 24 idiomas con barge-in y diálogo sensible a las emociones. El resultado práctico: una máquina ya puede sostener una llamada telefónica lo bastante bien como para que valga la pena volver a hacerla, y para la mayoría de los negocios locales, el teléfono nunca llegó a morir. Casi el 80% de los consumidores sigue considerando importante el canal telefónico para comunicarse con un negocio, según una investigación de TransUnion.
Este es un artículo de "novedades en IA", pero la noticia no es otro benchmark: es que la voz en tiempo real por fin es lo bastante fiable para hacer un trabajo poco glamuroso y de alto valor: confirmar citas, recuperar ausencias y atender la llamada fuera de horario que de otro modo perderías. Esto es lo que cambió, por qué importa para los ingresos y dónde todavía se queda corto.
¿Qué cambió realmente en la voz con IA en 2026?
Durante años, "llamar con IA" significaba una cadena frágil: transcribir a quien llama (voz a texto) → ejecutar un modelo de lenguaje → sintetizar una respuesta (texto a voz). Tres saltos, tres fuentes de retardo y una voz que quedaba en algún punto entre un GPS y un mensaje de espera. La generación de 2026 colapsa esa cadena en un único modelo de voz a voz que procesa el audio en bruto de forma nativa, que es la razón principal por la que la latencia cayó y la conversación empezó a sentirse real.
| Avance (2025–2026) | Qué hay de nuevo | Por qué importa en una llamada telefónica |
|---|---|---|
| OpenAI gpt-realtime (Realtime API GA, 28 ago 2025) | Un único modelo de voz a voz; añade uso de herramientas MCP, entrada de imágenes y llamadas telefónicas por SIP | El modelo puede ejecutar una acción durante la llamada (consultar un calendario, buscar un pedido) en lugar de solo hablar |
| Google Gemini 2.5 Flash audio nativo (Live API) | 30 voces HD, 24 idiomas, barge-in y diálogo afectivo | Quien llama puede interrumpir con naturalidad; el agente adapta el tono a una persona frustrada o con prisa |
| ElevenLabs Flash v2.5 | TTS en tiempo real con ~75 ms de latencia de modelo (el modelo más nuevo, v3, es más expresivo pero de mayor latencia: pensado para audio pre-renderizado, no para llamadas en vivo) | La generación de voz deja de ser el cuello de botella en un intercambio en vivo |
Fuentes: OpenAI, Google y ElevenLabs. El hilo común entre los tres proveedores es el mismo: audio nativo, menor latencia e interrupción integrada, las tres cosas que separan una conversación de una grabación. OpenAI ha seguido lanzando actualizaciones de sus modelos de audio a un ritmo veloz, y la Gemini Live API ahora abarca hasta 70 idiomas admitidos para sesiones de voz y multimodales más amplias.
¿Por qué importa la voz en tiempo real para los ingresos, y no solo para las demos?
Porque la llamada que no ocurre es la que te cuesta dinero. La economía de la llamada de seguimiento es implacable, y se hace más evidente en dos lugares: las llamadas entrantes perdidas y las citas perdidas.
- Las llamadas perdidas drenan ingresos en silencio. Los análisis de call centers indican que las pequeñas empresas dejan sin atender una buena parte de las llamadas entrantes, y que alrededor del 85% de quienes caen en el buzón de voz nunca vuelve a llamar; muchos simplemente marcan a un competidor en su lugar. Una llamada perdida no es una venta aplazada; suele ser una venta perdida.
- Las ausencias son un impuesto sobre todo negocio basado en citas. La tasa media global de ausencias a citas ronda el 23,5%, y solo las citas médicas perdidas le cuestan al sistema sanitario de EE. UU. unos $150 billion al año (NIH/PMC; HCI Innovation Group). Una llamada de confirmación que de verdad se hace es una de las intervenciones más baratas frente a eso.
Es la misma lección que nuestros propios datos siguen confirmando. En el Entagl Response Velocity Study (2026) —un análisis de 32.581 conversaciones en nueve países— las respuestas en menos de 60 segundos convirtieron al 35,1%, y en consultas competitivas el 78,4% de los compradores compró a quien respondió primero. La velocidad y la constancia ganan. La voz en tiempo real extiende esa ventaja del hilo de chat a la línea telefónica: el canal al que los clientes todavía recurren cuando algo es urgente o complejo.
¿Qué puede hacer hoy realmente un agente de voz con IA?
Los casos de uso fiables, de calidad GA, son acotados y valiosos, y lo son a propósito. Las victorias están en las llamadas repetitivas y urgentes que las personas se saltan cuando están ocupadas:
- Llamadas de confirmación. Telefonear al cliente el día antes para confirmar la reserva y responder dudas de última hora: la jugada de mayor apalancamiento contra las ausencias.
- Recuperación de ausencias y reprogramación. Cuando alguien falta a una cita o la cancela, una llamada inmediata y con contexto para reprogramar recupera ingresos que de otro modo se esfuman.
- Captura fuera de horario y de desbordamiento. Atender la llamada entrante que perderías a las 9 de la noche o en plena hora punta, calificarla y agendarla, en lugar de mandarla a un buzón de voz que el 85% de la gente abandona.
- FAQs por voz. Responder preguntas comunes y de bajo riesgo (horarios, ubicación, qué llevar, modelo de precios) desde la misma base de conocimiento que usa tu agente de chat.
El agente de voz con IA de Entagl para llamadas de confirmación y recuperación de ausencias hace exactamente este trabajo tanto por líneas telefónicas normales como por la WhatsApp Business Calling API, construido sobre el stack Realtime de OpenAI y un servidor de medios WebRTC. Admite llamadas entrantes y salientes, automatizaciones de llamadas (reglas de activación más segmentación de audiencia), plantillas de llamada reutilizables, transcripciones completas y analíticas de llamadas de volumen, duración, resultados y coste.
Lo que la mayoría de las herramientas de "llamadas con IA" hace mal: el contexto
Una voz en tiempo real ya es lo mínimo indispensable. El problema más difícil —y donde caen la mayoría de los bots de llamadas independientes— es el contexto. Un bot que marca en frío, sin memoria del DM de Instagram que el cliente envió ayer ni del pedido por el que pregunta, obliga a quien llama a reexplicarlo todo. Ese es el momento en que se rompe la ilusión y se cuelga la llamada.
| Robollamador en frío | Agente de voz con contexto | |
|---|---|---|
| Conoce el historial de chat previo | No: empieza en blanco | Sí: lee toda la conversación antes de marcar |
| Puede ejecutar una acción durante la llamada | Normalmente solo lee un guion | Consulta calendario/pedido, agenda, reprograma |
| Maneja interrupciones | Habla por encima de quien llama | Barge-in: se detiene y escucha |
| Idiomas | Uno, por lo general | Más de 20, con cambio a mitad de conversación |
| Traspaso a un humano | Callejón sin salida | Escala con la transcripción completa adjunta |
Por eso Entagl ejecuta la voz como uno de cuatro agentes que comparten un único cerebro en lugar de como un marcador añadido. El agente de voz empieza cada llamada conociendo ya la conversación —sin arranques en frío— y cualquier persona que tome el relevo de la llamada hereda la transcripción completa. Como argumentamos en por qué los DMs generan ingresos y en la regla de los 5 minutos para los DMs de Instagram y Facebook, el canal importa menos que la velocidad y la memoria que hay detrás. La voz es ahora otro canal rápido y con contexto, no uno aparte y amnésico.
Dónde la voz con IA en tiempo real todavía se queda corta
Aquí importa el encuadre honesto, porque la tecnología es genuinamente mejor, pero no es magia:
- La latencia es buena, no invisible. Una respuesta de menos de un segundo es alcanzable, pero las redes telefónicas reales, las conexiones malas y las llamadas a herramientas a mitad de conversación todavía pueden introducir pausas que un humano no tendría.
- Los acentos y el ruido siguen siendo difíciles. Los modelos de audio nativo manejan mucho más que la generación anterior, pero el ruido de fondo intenso y algunos dialectos aún provocan errores. El barge-in ayuda; no elimina el problema.
- El consentimiento y la divulgación están regulados. Las llamadas salientes se rigen por normas de consentimiento y divulgación que varían según la región. Las llamadas automatizadas necesitan los opt-ins adecuados y, a menudo, una divulgación clara de que la persona habla con una IA.
- Algunas llamadas nunca deberían automatizarse por completo. Las conversaciones sensibles, de alto riesgo o emocionales corresponden a una persona. El diseño correcto es human-in-the-loop: la IA gestiona el volumen rutinario y repetitivo y traspasa de forma limpia cuando hace falta criterio, un principio que abordamos en la paradoja de la experiencia de cliente con IA.
Para los negocios regulados, la postura de cumplimiento es parte del producto, no una ocurrencia tardía: cifrado en reposo, registro de auditoría y un manejo listo para HIPAA para las clínicas que usan la voz para recordatorios de citas.
FAQ
¿Puede la IA hacer realmente llamadas telefónicas para mi negocio en 2026?
Sí, y la calidad es notablemente mejor que hace un año. Los modelos de voz a voz en producción (gpt-realtime de OpenAI, el audio nativo de Gemini de Google) escuchan y responden en tiempo real, manejan interrupciones y pueden ejecutar acciones durante la llamada, como consultar un calendario. Los casos de uso más sólidos y fiables son las llamadas de confirmación, la recuperación de ausencias y la captura de llamadas fuera de horario.
¿Cuál es la diferencia entre un agente de voz con IA y un viejo menú telefónico IVR?
Un IVR reproduce menús fijos y te enruta por el teclado. Un agente de voz con IA moderno sostiene una conversación hablada abierta: entiende el habla libre, responde preguntas desde tu base de conocimiento, agenda o reprograma citas y cambia de idioma a mitad de la llamada. Sustituye al menú, no solo a la música de espera.
¿Sabrán los clientes que están hablando con una IA?
Deberían. La buena práctica —y en muchas regiones, la ley— es divulgar que la persona habla con un asistente automatizado. Bien hecho, divulgarlo no perjudica: a los clientes les importa mucho más obtener una respuesta rápida y precisa que si la dio un humano o una IA.
¿Cómo ayuda un agente de voz con IA a reducir las ausencias?
Haciendo de forma fiable las llamadas que las personas se saltan cuando están ocupadas: una llamada de confirmación antes de la cita y una llamada de reprogramación inmediata tras una cancelación o una ausencia. Con tasas de ausencia que promedian alrededor del 23,5%, incluso una tasa de recuperación modesta se amortiza rápido.
¿Hay que construir el agente de voz por separado de mi automatización de chat?
No debería. La mayor debilidad de los bots de llamadas independientes es que marcan sin contexto. Un agente de voz que comparte el mismo cerebro que tu agente de chat empieza cada llamada conociendo ya el historial del cliente, que es la diferencia entre una llamada natural y una que el cliente te cuelga.
Vale la pena volver a contestar el teléfono. Si las llamadas de confirmación, la recuperación de ausencias y la captura fuera de horario están drenando ingresos, descubre lo que puede hacer un agente de voz con contexto. Reserva una demo de 30 minutos y la mapearemos a tus llamadas.
Fuentes: OpenAI — Introducing gpt-realtime; OpenAI — updates for developers building with voice; Google — Gemini 2.5 native audio updates; Google — Gemini Live API; ElevenLabs — Eleven v3; TransUnion — phone channel research; NIH/PMC — no-show prevalence and cost; HCI Innovation Group — $150B missed-appointment cost; Aira — missed-call statistics; y el Entagl Response Velocity Study (2026). Las capacidades de los modelos descritas reflejan los anuncios de los proveedores a junio de 2026.