industry · product
Cómo mantener preciso un agente de IA después del lanzamiento
Un estudio revisado por pares encontró deterioro de la calidad en el 91% de las 128 combinaciones de modelo y conjunto de datos que puso a prueba a lo largo del tiempo. Nada de tu configuración tiene que cambiar para que un agente en producción empeore, así que aquí tienes el ciclo de mantenimiento que lo detecta.

El mantenimiento de un agente de IA no es trabajo de limpieza. Es el trabajo. Un agente que aprobó todas las pruebas el día del lanzamiento puede empeorar de forma medible en producción sin que nadie toque un prompt, una barrera de seguridad ni una línea de código. Un estudio revisado por pares publicado en Scientific Reports, de Nature, emparejó cuatro modelos de machine learning con 32 conjuntos de datos reales procedentes de operaciones sanitarias, finanzas, transporte y meteorología, y después siguió cómo aguantaba cada combinación a medida que pasaba el tiempo desde su último entrenamiento. La calidad se deterioró en el 91% de las 128 combinaciones, un patrón que los autores bautizaron como envejecimiento de la IA. La solución no es un modelo mejor. Es un ciclo de revisión con un responsable.
Ya hemos escrito sobre cómo llevar un agente al lanzamiento de forma segura en cuatro etapas. Esta es la parte que viene después, la que recibe mucha menos atención y causa más daño silencioso: qué haces en la semana seis, y en la semana veinte.
¿Por qué empeora un agente de IA después del lanzamiento?
Hay cuatro cosas que se deterioran, y lo hacen de forma independiente. La mayoría de los equipos solo vigila una.
| Qué se deteriora | Qué aspecto tiene | Cómo lo detectas |
|---|---|---|
| El comportamiento del modelo | La misma pregunta, el mismo prompt, una respuesta peor que suena igual de segura que la correcta | Repite un conjunto de pruebas fijo de forma periódica y compara las puntuaciones |
| Tu conocimiento | El agente cita correctamente una política, un precio o un horario que cambiaste el mes pasado | Pon fecha a cada entrada de conocimiento y revísalas con una cadencia fija |
| Tu negocio | Un servicio nuevo, una sede nueva, horarios de temporada, una promoción que terminó | Vincula las actualizaciones de conocimiento al cambio operativo que las provocó |
| El alcance | Al agente le piden tareas más largas y complicadas de las que tenía asignadas | Vigila la tasa de traspaso y el tipo de tareas que van llegando |
La primera fila sorprende a mucha gente. La columna en HousingWire de Anwar Ali llama a esto deriva de comportamiento y la separa de la deriva de datos, de la que casi todos los equipos han oído hablar. Es la más difícil de detectar de las dos, porque una respuesta peor no tiene ningún aspecto de serlo.
¿Cómo se ve la deriva en un despliegue real?
Anwar Ali, vicepresidente sénior y responsable de gestión de producto en BSI Financial Services, publicó un relato de exactamente esto en septiembre de 2026. Su equipo tenía un agente de voz y chat respondiendo preguntas de prestatarios contra datos de cuenta en vivo, detrás de barreras de cumplimiento que les había costado mucho tiempo dejar bien. Funcionaba. La contención, es decir, el porcentaje de clientes cuyo problema se resolvía sin llegar a una persona, se mantuvo por encima de la media del sector durante meses.
Después cayó unos ocho puntos. Nadie se dio cuenta durante semanas.
La investigación descartó las barreras, el flujo de conversación y los cambios en el comportamiento de los clientes. La causa era el propio modelo, uno consolidado de un laboratorio puntero, que producía sin hacer ruido peores respuestas a las mismas categorías de pregunta. Su conclusión es la parte que merece la pena copiar: fue un fallo de medición, no un fallo de tecnología. La contención se revisaba una vez por semana, y un indicador rezagado semanal no puede detectar un descenso lento hasta que ya han pasado por él muchos clientes.
¿Qué números deberías vigilar, y con qué frecuencia?
Elige un conjunto pequeño, ponle una cadencia a cada uno y haz que esa cadencia sea más corta que la ventana de daño. Una métrica que revisas una vez al mes te da un mes malo antes de darte una señal. Son métricas operativas, no métricas de retorno; para la parte financiera, consulta cómo medir el ROI de la IA cuando la mayoría de los proyectos no muestra ninguno.
| Métrica | Cadencia | Qué significa un movimiento malo |
|---|---|---|
| Tasa de traspaso a una persona | Diaria | El agente rechaza o falla más a menudo, o las preguntas han cambiado |
| Tiempo hasta la primera respuesta | Diaria | Un problema de entrega o de cola, no un problema de calidad |
| Resolución sin traspaso | Diaria | El indicador clásico de deriva. Mira la tendencia, no el día |
| Tasa de "no me gusta" en las respuestas de la IA | Semanal | Tu equipo está viendo algo que los números agregados esconden |
| Tasa de reserva o conversión a partir de las conversaciones | Semanal | El agente responde, pero ya no cierra |
| Puntuación del conjunto de pruebas de regresión | Mensual, y en cada cambio de modelo | El modelo o la configuración se movieron bajo tus pies |
El tiempo hasta la primera respuesta merece un sitio en esa lista aunque rara vez se deteriore. Nuestro propio estudio de 32,581 conversaciones encontró que las respuestas dentro de los 60 segundos convertían al 35.1%, frente al 7.1% de las respuestas que tardaban entre una y veinticuatro horas. La velocidad es la métrica por la que se compra un agente, así que es la que merece la pena demostrar que sigue siendo cierta.
¿Cada cuánto deberías volver a probar un agente de IA?
Mantén un conjunto fijo de pruebas de regresión con conversaciones reales cuyo resultado correcto ya conoces, y vuelve a ejecutarlo ante tres disparadores:
- De forma periódica, como mínimo una vez al mes. Esto es lo que convierte la deriva en un número en lugar de una corazonada.
- Antes y después de cualquier cambio de modelo, incluido uno que tú no iniciaste. Si tu plataforma pasa a un modelo más nuevo, eso es un cambio en tu sistema.
- Después de cualquier edición relevante de conocimiento o de instrucciones. Un arreglo para una queja concreta rompe muchas veces una respuesta que estaba bien.
Constrúyelo con conversaciones que ya tienes. De veinte a cincuenta casos que cubran tus preguntas habituales, tus casos límite incómodos y el puñado que el agente nunca debe responder por su cuenta. Lo bastante grande para detectar una regresión real, lo bastante pequeño para que de verdad lo ejecutes.
Volver a comparar sobre qué modelo funcionas es un ciclo aparte, y más lento. Cada trimestre es un valor por defecto razonable, y resulta mucho más fácil si tu configuración nunca quedó soldada a un solo laboratorio, algo que defendimos en por qué no deberías construir tu negocio sobre un único modelo de IA.
¿Cómo es un ciclo de mantenimiento semanal?
De treinta a sesenta minutos, en la misma franja cada semana:
- Lee diez conversaciones reales de principio a fin. Resúmenes no. Coge unas cuantas marcadas y unas cuantas al azar, porque las que salen al azar te enseñan cómo es lo normal.
- Clasifica todos los "no me gusta" que haya registrado tu equipo. Coloca cada uno en uno de tres cajones: el conocimiento estaba mal o faltaba, las instrucciones estaban mal, o el agente debería haber traspasado la conversación.
- Arregla el cajón, no la conversación. Una corrección puntual en un solo chat no le enseña nada al sistema. Actualiza la entrada de conocimiento, la instrucción o la regla de traspaso.
- Vuelve a ejecutar el conjunto de regresión si cambiaste algo que sostiene el resto.
- Escribe qué cambiaste y por qué. Un registro de cambios con fechas es lo que te deja responder a "¿cuándo empezó esto?" seis semanas más tarde.
¿Por qué fallan las tareas largas aunque el modelo esté bien?
Esto es una restricción de diseño más que una tarea de mantenimiento, pero aparece con pinta de deterioro.
Un preprint de arXiv de agosto de 2026, How Fast Do Agents Rot?, midió la fiabilidad de los agentes en nueve modelos y 10,664 trayectorias analizadas. El éxito de la tarea sigue una ley geométrica gobernada por la fiabilidad por paso, que sube con la escala del modelo pero se satura muy por debajo de 1 incluso en los sistemas más potentes. En la tarea genuinamente agéntica de uso de herramientas, todos los modelos probados, incluidos algunos propietarios con mucho despliegue, pasaron de un éxito casi perfecto a casi cero en dieciséis pasos dependientes. El deterioro seguía al número de pasos, no a la longitud del contexto.
Es un preprint, y sus tareas no son conversaciones de atención al cliente. La lectura práctica se sostiene igual: la fiabilidad se compone a la baja con cada paso dependiente, así que un agente con el alcance de responder, cualificar y reservar pisa terreno mucho más firme que uno que ejecuta un proceso de quince pasos sin supervisión. Si el trabajo de tu agente ha ido creciendo sin que nadie lo dijera desde el lanzamiento, eso es un problema de alcance disfrazado de problema de calidad.
¿Quién se encarga de esto en realidad?
Normalmente nadie, y ese es el verdadero hallazgo del artículo de Ali. Los equipos de producto lanzan, ingeniería mantiene la infraestructura en pie, operaciones hace funcionar el negocio, y nadie tiene la responsabilidad de notar que las respuestas han empeorado.
Nombra a una persona, y no se lo encargues a un comité. Esa persona vigila los números diarios, ejecuta el ciclo semanal y tiene la autoridad para decir que el agente va mal y recortarle el alcance. Esa última parte es la que hace que el papel sea real. Ali es tajante sobre la alternativa: "un revisor que solo puede poner un sello no está aportando supervisión, solo su apariencia".
Dónde encaja Entagl
Cualquier persona de tu equipo puede marcar una respuesta mala de la IA directamente desde la bandeja de entrada unificada, con una nota sobre qué estuvo mal. Las respuestas marcadas caen en una cola de revisión con su estado, así que la clasificación semanal tiene una lista de trabajo en lugar de una prueba de memoria. El conocimiento vive en un solo sitio, así que arreglar una FAQ, un servicio o tu horario de apertura lo arregla para WhatsApp, Instagram, Messenger, Telegram, el chat web, el correo y la API a la vez. Como los cuatro agentes comparten un mismo cerebro, una corrección que haces para el chat también es cierta en la siguiente llamada.
Dos piezas estructurales importan más que cualquier función suelta. El enrutamiento de modelos no está atado a un solo laboratorio: el modelo que hay detrás de cada etapa es un ajuste, y se pueden configurar modelos de respaldo por detrás, así que un cambio de comportamiento de un proveedor es una decisión de enrutamiento y no una reconstrucción. Y el traspaso a una persona es un camino de primera clase en lugar de un estado de fallo, así que el número que te avisa de que algo se está desviando ya lo estás recogiendo.
Asentar bien al agente desde el principio abarata todo esto, algo que cubrimos en cómo entrenar a un agente de IA con el conocimiento de tu propio negocio.
Lo que el mantenimiento no arregla
No vuelve preciso a un agente que nunca se asentó bien. Monitorizar un agente mal delimitado te da una medición precisa de la cosa equivocada.
No elimina las alucinaciones. Los controles que las reducen son una capa aparte, que cubrimos en cómo evitar que tu agente de IA alucine.
Y que un número se mueva no es un diagnóstico. La tasa de traspaso puede subir porque el agente ha empeorado, o porque lanzaste una campaña de anuncios que trajo otro tipo de preguntas. Lee las conversaciones antes de cambiar nada. Por eso el primer paso del ciclo semanal es leer, no medir.
FAQ
¿Cada cuánto deberías revisar el rendimiento de un agente de IA?
Vigila a diario la tasa de traspaso, el tiempo hasta la primera respuesta y la tasa de resolución, porque son los indicadores adelantados de un descenso. Revisa cada semana las respuestas marcadas y la conversión. Vuelve a ejecutar un conjunto de pruebas de regresión cada mes y en cada cambio de modelo. Revisar solo una vez por semana es la razón por la que una caída de ocho puntos en un despliegue de servicios financieros pasó desapercibida durante semanas.
¿Puede empeorar un agente de IA si no ha cambiado nada?
Sí, por dos razones distintas, y conviene mantenerlas separadas. La deriva de comportamiento es la que más equipos pasan por alto: un modelo alojado puede empezar a producir peores respuestas a las mismas preguntas sin ningún cambio en tus prompts ni en tu configuración, que es lo que Anwar Ali documentó en BSI Financial Services cuando la contención cayó unos ocho puntos. La otra es el envejecimiento de la IA: un modelo fijo pierde precisión por el simple hecho de que ha pasado más tiempo desde que se entrenó, algo que Scientific Reports, de Nature, observó en el 91% de las 128 combinaciones de modelo y conjunto de datos que puso a prueba. Mecanismos distintos, mismo síntoma. Un conjunto fijo de pruebas de regresión detecta los dos.
¿Cómo sabes si es el modelo o tu base de conocimiento?
Vuelve a ejecutar tu conjunto fijo de pruebas de regresión. Si casos que antes pasaban ahora fallan mientras el conocimiento de fondo no ha cambiado, el que se movió es el modelo. Si el agente responde con seguridad a partir de información que sencillamente está desactualizada, lo que se movió es tu conocimiento. El conjunto de pruebas es lo que separa las dos cosas, y por eso tiene que ser fijo y reutilizarse en lugar de reescribirse cada vez.
¿Quién debería encargarse del mantenimiento del agente de IA en una pequeña empresa?
Una persona con nombre y apellidos, normalmente quien se ocupa de la experiencia de cliente y no quien más sabe de tecnología. El trabajo consiste en leer conversaciones, clasificar las respuestas marcadas y actualizar el conocimiento del negocio. Nada de eso requiere ingeniería, y todo requiere a alguien con la autoridad para recortar el alcance del agente cuando los números lo pidan.
¿Un modelo mejor elimina la necesidad de monitorizar?
No. La fiabilidad por paso mejora con la escala del modelo, pero no llega a 1, así que las cadenas de tareas largas siguen degradándose, y un modelo más potente puede cambiar de comportamiento bajo tus pies igualmente. Los modelos mejores suben el suelo. No quitan la necesidad de vigilar el suelo.
Empieza por el número que no estás recogiendo
Es casi seguro que ya haces una revisión semanal de números en alguna otra parte de este negocio, que llevas un registro de cambios de algún otro sistema y que sabes revisar trabajo por muestreo para comprobar su calidad. Ali llega a la misma conclusión al final de su columna: la capacidad suele estar ya ahí, y casi nadie la ha apuntado hacia la IA que habla con sus clientes.
Elige un indicador adelantado que no estés vigilando a diario, dale un responsable y reserva treinta minutos en el calendario para la lectura semanal. Solo con eso se habría detectado la deriva que se describe aquí.
Para ver cómo funcionan la cola de respuestas marcadas, el conocimiento compartido y los controles de traspaso en un espacio de trabajo real, reserva una demo de 30 minutos y recorreremos tus propias conversaciones con ellos.
Fuentes: Nature Scientific Reports, "Temporal quality degradation in AI models" (2022); HousingWire, Anwar Ali, "The silent failure mode: what happens when your AI model quietly gets worse" (septiembre de 2026); arXiv:2609.01660, "How Fast Do Agents Rot?" (agosto de 2026); Entagl Response Velocity Study (2026). Cifras verificadas a septiembre de 2026.