industry · product
Cómo lanzar un agente de IA sin perder clientes
Un despliegue en cuatro fases: crea un set de pruebas con tus propias conversaciones, ejecútalo en modo sombra, sal en vivo con una sola tarea concreta y amplía solo cuando los números aguanten.

Lanza tu agente de IA por fases y condiciona cada fase a la evidencia, no a una fecha del calendario. Crea un set de pruebas a partir de conversaciones pasadas, ejecuta el agente en modo sombra, sal en vivo con una sola tarea concreta y amplía solo cuando los números aguanten. En una encuesta de Gartner a 3,566 clientes B2B y B2C realizada en febrero y marzo de 2026, el 87% dijo que poder llegar a un agente humano es imprescindible cuando una empresa usa IA generativa, mientras que solo el 50% dijo que la IA le facilitó la interacción. Nuestros propios datos apuntan en la otra dirección en cuanto a velocidad: en 32,581 conversaciones de 1,247 negocios en nueve países, las respuestas enviadas en menos de 60 segundos convirtieron al 35.1% frente al 7.1% de las que tardaron entre una y 24 horas. Un despliegue que se alarga tampoco sale gratis.
Ya explicamos por qué se atascan los proyectos de IA en Por qué la mayoría de los pilotos de IA nunca llegan a producción. Esta es la otra mitad: la secuencia que ejecutas de verdad una vez configurado el agente, cuando la pregunta pasa a ser cuándo dejarle hablar.
¿Qué sale mal cuando un agente de IA se lanza en frío?
Dos fallos, y los dos están documentados públicamente.
El primero es la responsabilidad legal. El 14 de febrero de 2024, el Civil Resolution Tribunal de Columbia Británica declaró a Air Canada responsable de una política de tarifas por duelo que el chatbot de su web había descrito de forma incorrecta. La aerolínea alegó que el chatbot era, en sus propias palabras, "una entidad legal independiente que responde por sus propios actos". El tribunal rechazó ese argumento y ordenó a la aerolínea pagar a Moffatt $812.02 en daños y costas. El análisis del caso de la American Bar Association resume la lección sin rodeos: las empresas siguen siendo responsables de lo que sus herramientas de IA les dicen a los clientes.
El segundo es una caída de calidad que solo se aprecia desde fuera. Klarna anunció en febrero de 2024 que su asistente de IA atendía dos tercios de los chats de atención al cliente. En mayo de 2025 volvía a contratar agentes humanos, y su CEO, Sebastian Siemiatkowski, dijo a Bloomberg que, como "por desgracia, el coste parece haber sido un factor de evaluación demasiado dominante al organizar esto, lo que acabas teniendo es menor calidad". Allí la IA sigue atendiendo dos tercios de las consultas. Lo que cambió fue el alcance que se le confió y lo fácil que resulta saltársela.
A ninguna de las dos empresas le faltaban ingenieros. Les faltaba una fase intermedia entre "funciona en pruebas" y "responde a todo el mundo".
Fase 1: ¿Con qué conversaciones deberías probar antes de lanzar?
Con las tuyas. Saca los últimos 90 días de tu bandeja de entrada y arma un set fijo de casos reales que el agente tiene que resolver bien, con el comportamiento esperado anotado en cada uno.
La guía de AgentOps de Teradata recomienda un set de referencia de 30 a 100 tareas realistas por flujo de trabajo, incluidos casos límite y escenarios negativos como tokens caducados o permisos insuficientes. Para un agente de reservas o de ventas, eso se traduce en algo más prosaico y más útil que un benchmark.
| Qué incluir | Por qué pertenece al set |
|---|---|
| Tus 20 preguntas más frecuentes, tal cual las escriben | Son la mayor parte de tu volumen; acertarlas es el mínimo |
| Tres preguntas que deliberadamente no respondes en público | Confirma que el agente se abstiene en vez de improvisar una política |
| Un mensaje de devolución o queja escrito con enfado | Comprueba el tono y si escala en lugar de discutir |
| Un cliente que cambia de idioma a mitad de mensaje | Pone a prueba la detección, no solo la traducción |
| Una foto o un documento en lugar de texto | Casi ninguna bandeja real es solo texto |
| Una petición que rompe tu política (una cita fuera del horario de apertura) | El agente debería negarse y ofrecer la alternativa real |
| Alguien que pide hablar con una persona en el primer mensaje | Este caso tiene una única respuesta correcta |
Puntúa cada caso frente al comportamiento que escribiste, no frente a la redacción que imaginaste. Un agente que lo formula de otra manera pero reserva la cita correcta ha aprobado. Un agente que suena perfecto e inventa una política ha suspendido, que es justo a lo que el tribunal de Air Canada le puso precio. Guarda el set: lo vuelves a pasar después de cada cambio en las instrucciones, y es en la segunda pasada donde se gana el sueldo.
Fase 2: ¿Qué enseña el modo sombra que una demo no puede?
Modo sombra significa que el agente lee los mensajes entrantes reales y redacta una respuesta que nadie envía. Tu equipo contesta como siempre. Al final de cada día comparas las dos.
Esto detecta lo que ningún set de pruebas alcanza, porque tu set lo escribió alguien que ya conoce el negocio. Los clientes reales llegan con medio nombre de producto, una captura de pantalla, una nota de voz a las 11 de la noche y una idea sobre tu política de devoluciones que no habías oído nunca. La guía de Teradata pone el modo sombra por delante de un lanzamiento canary por esta razón: funcionar en silencio junto al flujo de trabajo humano, luego exponerlo a un grupo pequeño y después ampliar.
Una advertencia honesta: el modo sombra no es gratis. Alguien tiene que leer los borradores y, si no lo hace nadie, lo único que has conseguido es una semana de retraso y ningún aprendizaje. Reserva una hora al día durante cinco días y dásela a la persona que más mensajes contesta. Detectará en dos segundos una respuesta equivocada que a un responsable leyendo esa misma transcripción se le pasaría.
El modo sombra tampoco te dice nada sobre los tiempos. Un borrador esperando en una cola no tiene velocidad de respuesta, así que el efecto de contestar en 40 segundos en lugar de en 40 minutos queda invisible hasta la Fase 3.
Fase 3: ¿Hasta qué punto debe ser acotado el primer lanzamiento en vivo?
Más acotado de lo que parece que merece la pena. Un canal, un tipo de pregunta, una franja horaria.
Empieza por las horas que nadie cubre. Los mensajes de madrugada y de fin de semana son el sitio más seguro para salir en vivo, porque la comparación honesta no es "la IA contra tu mejor agente" sino "la IA contra una respuesta el lunes". La diferencia de conversión en nuestro estudio sobre velocidad de respuesta es más amplia justo ahí, en el mensaje que de otro modo se quedaría parado hasta que alguien abra la bandeja. La franja fuera de horario es donde un lanzamiento por fases se paga solo desde el primer día y donde menos se arriesga.
Mantén tres cosas completamente abiertas durante esta fase:
- Escalado. Cualquier petición de hablar con una persona se transfiere de inmediato, sin preguntas de filtrado previas.
- Visibilidad. Cada conversación aterriza en la misma bandeja que tu equipo ya vigila, así un intercambio malo se detecta en minutos y no en una revisión mensual.
- El interruptor de apagado. Ten claro quién puede desactivar las respuestas de IA en ese canal, y comprueba que lo ha hecho una vez antes de necesitarlo.
Fase 4: ¿Qué evidencia debería permitirte ampliar el alcance?
Elige los criterios antes de lanzar, mientras todavía lo ves con calma. Después de una semana en vivo la tentación es ampliar porque no se ha roto nada evidente, y "no se ha roto nada evidente" no es una medición.
| Señal | Dónde mirar | Amplía cuando |
|---|---|---|
| Corrección | Vuelve a pasar el set de pruebas de la Fase 1 | Sigue aprobando, incluidos los casos de negativa |
| Calidad del escalado | Conversaciones que retomó una persona | Las transferencias ocurren en el momento adecuado, no tres mensajes tarde |
| Reacción del cliente | Respuestas posteriores a un mensaje de la IA | No aumentan los «¿esto es un bot?» ni las preguntas repetidas |
| Acción de negocio | Reservas, pedidos, leads capturados | La acción completada coincide con lo acordado en el chat |
| Quejas | Tu canal de quejas habitual | Planas, y has leído las que han entrado |
Amplía una variable cada vez: añade un canal, o añade una intención, o alarga el horario. Cambia dos y una caída de calidad no te dirá nada sobre su causa.
Lo único que nunca se despliega por fases: el camino hacia una persona
Todos los demás controles se pueden introducir poco a poco. Este sale el primer día y a plena potencia.
La brecha está bien documentada. La investigación de Zoom con Morning Consult, sobre 3,500 adultos de siete países, encontró que el 81% de los consumidores espera que los bots escalen a una persona cuando hace falta, y solo el 38% dice que eso ocurra de verdad. El mismo estudio halló que la principal frustración con chatbots y asistentes de voz, con un 43%, es sencillamente que no resuelven el problema, y que el 82% dejaría de comprar a una marca tras una resolución inexacta o insatisfactoria.
Eric Keller, analista de Gartner, formula la regla de diseño sin rodeos: "Los responsables de servicio no deberían usar la IA generativa como paso obligatorio inicial para cada incidencia". Cuando se empuja a los clientes a través de varios intentos fallidos de IA antes de llegar a una persona, es menos probable que vuelvan a usar esa herramienta.
Así que prueba la ruta de escalado como probarías una salida de emergencia. Pide hablar con una persona de cinco formas distintas, incluida una en otro idioma, y confirma que cada una llega a alguien que puede ver lo que ya se dijo.
Lo que un despliegue por fases no arregla
No va a salvar una base de conocimiento pobre. Si tu horario de apertura está mal en tres sitios y tu política de devoluciones solo existe en la cabeza del dueño, cada fase sacará a la luz fielmente el mismo hueco, y la solución es trabajo de contenido, no de despliegue. Cómo entrenar a un agente de IA con el conocimiento de tu propio negocio cubre ese lado.
También cuesta tiempo, y ese tiempo no es gratis. Un despliegue de cuatro semanas son cuatro semanas de respuestas tardías que ya sabes que salen caras. Acorta las fases en lugar de saltártelas: tres días de modo sombra en una bandeja con mucho tráfico enseñan más que tres semanas en una tranquila. Y nada de esto hace que una oferta floja convierta.
Dónde encaja Entagl
El Receptionist de Entagl responde en WhatsApp, DMs y comentarios de Instagram, Facebook Messenger, Telegram, el widget de chat de la web, el correo reenviado desde el buzón que el negocio ya usa y una API pública. Un despliegue por fases resulta práctico sobre él porque las respuestas de IA se programan y se activan canal por canal, y se pueden pausar en una sola conversación, así que "un canal, una intención" es un ajuste y no un apaño.
La transferencia llega a una bandeja de entrada compartida del equipo donde la persona ve la conversación completa, incluido lo que el agente ya prometió. Los guardarraíles de salida se aplican a las respuestas antes de enviarlas, y cada intercambio se guarda como una transcripción que puedes releer al decidir si amplías. El agente detecta el idioma del cliente y le responde en él, más de 100 idiomas, con cambio a mitad de conversación, y por eso un cambio de idioma pertenece a tu set de pruebas y no a producción.
Trae tus diez peores conversaciones pasadas a una demo de 30 minutos y mira qué hace el agente con ellas. Reserva una demo.
FAQ
¿Cuánto tiempo debería estar un agente de IA en modo sombra?
El suficiente para cubrir una semana representativa, con tu día más ocupado y el más tranquilo. En una bandeja de mucho volumen pueden ser tres días; en un negocio que recibe veinte mensajes por semana se acerca al mes, porque lo que importa es la muestra y no el calendario. Para cuando las transcripciones nuevas dejen de sorprenderte.
¿Puedo saltarme el set de pruebas si el proveedor ya probó la plataforma?
No, porque el proveedor probó el modelo y tú necesitas probar tu negocio. Los modos de fallo que cuestan dinero son específicos de tus políticas, tu horario y los productos que prefieres no tratar por chat. Un benchmark de proveedor no puede saber que hay un servicio concreto del que nunca das precio.
¿Qué debería hacer la IA cuando no está segura?
Preguntar para aclarar o transferir, y nunca rellenar el hueco con una suposición verosímil. Decidir esto antes de lanzar es la hora más valiosa de todo el despliegue. Escribimos sobre cómo funciona en Cómo evitar que tu agente de IA alucine.
¿El despliegue por fases se aplica también a los agentes de voz?
Sí, con un cambio: no puedes tener un agente telefónico en modo sombra silencioso, porque no hay borrador que revisar. Sustitúyelo por llamadas de prueba grabadas contra el mismo conjunto de escenarios y lanza después en una franja acotada, como el desbordamiento fuera de horario. Cómo evaluar y probar un agente telefónico de IA tiene los escenarios específicos de llamadas.
Empieza por las conversaciones que ya tienes
El set de pruebas es la parte que casi todos los equipos se saltan y la que hace que cada fase posterior se pueda decidir. Cuarenta conversaciones reales de tu propia bandeja, cada una con el comportamiento correcto anotado al lado, convierten el "¿parece bueno?" en un número que puedes volver a comprobar tras cada cambio. Sácalas antes de tocar un solo ajuste.
Fuentes: encuesta a clientes de Gartner, agosto de 2026 (3,566 clientes, realizada en febrero y marzo de 2026); Zoom y Morning Consult, "AI alone won't save CX. Resolution will.", julio de 2025 (3,500 adultos, siete países); Moffatt v. Air Canada, British Columbia Civil Resolution Tribunal, febrero de 2024; información de CX Dive sobre Klarna, mayo de 2025; guía de AgentOps de Teradata, noviembre de 2025; Entagl Response Velocity Study 2026.