Saltar al contenido

AI News · industry

La memoria de los agentes de IA en 2026: qué muestran los nuevos benchmarks

Tres pruebas de septiembre de 2026 midieron qué recuerdan de verdad los agentes. La mejor puntuación fue 70.67%, las notas comprimidas se rompieron al cambiar de modelo y, a veces, la memoria costó más que el propio agente.

Entagl Team12 min de lectura
La memoria de los agentes de IA en 2026: qué muestran los nuevos benchmarks

La memoria de los agentes de IA es la capa que permite a un agente usar algo que un cliente le contó hace semanas y, a fecha de septiembre de 2026, está medible e inacabada. En DolphinBench, publicado el 22 de septiembre de 2026, la configuración con mejor puntuación completó el 70.67% de 600 tareas que dependen de la memoria. Casi un tercio falló. Un estudio controlado aparte, Does Your Agent's Memory Survive a Model Upgrade?, publicado el 4 de septiembre, encontró que, cuando un almacén de memoria creado por un modelo se entregaba a otro, la precisión se movía hasta 13.28 puntos porcentuales en la dirección equivocada, sin que nadie tocara los datos guardados.

En septiembre aterrizaron tres cosas que merecen tu atención si tienes IA hablando con clientes: un benchmark que califica la memoria por acciones en lugar de por respuestas de examen, un estudio sobre si la memoria sobrevive a una actualización de modelo y un desafío alojado en China que somete a todos los sistemas de memoria a un mismo reglamento. Esto es lo que midió cada uno y lo que cambia.

¿Qué es la memoria de un agente de IA y en qué se diferencia de una ventana de contexto?

Una ventana de contexto es el espacio de trabajo que tiene un modelo durante una ejecución. Se vacía cuando la ejecución termina. La memoria del agente es estado duradero: lo que se anota después de una conversación y se recupera antes de la siguiente.

La distinción importa porque el sector insiste en resolver la memoria agrandando la ventana. La evidencia dice que eso no funciona por sí solo. El artículo sobre CueMem (11 de septiembre de 2026), de Mashang Consumer Finance y el Instituto de Tecnología de Harbin en Shenzhen, encontró que dar al modelo todo el historial de diálogo degrada el rendimiento a medida que la entrada se acerca al límite de contexto, un efecto que los autores atribuyen en parte al contexto irrelevante y al problema de perderse en el medio. Su enfoque de recuperación usó alrededor del 10% de los tokens de entrada del escenario con historial completo en el benchmark LoCoMo y aun así puntuó más alto.

El artículo que OpenAI publicó el 21 de septiembre sobre V7, que construye contexto de agentes para equipos de finanzas y seguros, dice lo mismo desde producción: el grafo de V7 es "un orden de magnitud más barato y rápido de recorrer que los enfoques de contexto largo", con los intercambios recientes en contexto activo y el material más antiguo dejado en el grafo hasta que algo lo pide.

Así que la memoria no es una ventana más grande. Es una decisión sobre qué anotar y qué conservar.

¿Por qué cambiaron los benchmarks en septiembre de 2026?

Hasta ahora, la mayoría de los benchmarks de memoria hacían preguntas. Eso favorece a los sistemas evaluados.

El argumento de DolphinBench es directo. Pregunta a un agente "¿qué plataforma de mensajería usa el equipo?" y ya le has dicho que existe un dato sobre una plataforma y que lo quieres. El paso más difícil, darse cuenta de que hace falta recuperar algo, ya está hecho. Por eso DolphinBench elimina la pregunta. Le da al agente tres historiales simulados de trabajadores del conocimiento (unos 500,000 tokens cada uno, 13,539 mensajes que van de 2023 a 2027) y luego lanza 600 tareas contra aplicaciones simuladas como Notion, Gmail, GitHub y Discord, donde una acción equivocada deja un rastro que el evaluador puede ver.

Un ejemplo trabajado: un CEO enuncia una regla de canal una sola vez, en abril de 2023: las notas de versión van a #eng-releases hasta que un despliegue esté en verde. Nada la repite. Tres años y medio después, enterrada en un historial de 3,400 mensajes, llega una petición para publicar una actualización de lanzamiento y no se nombra ningún canal. Publica en el equivocado y fallas. Saber el dato no basta; el agente tiene que aplicarlo sin que se lo pidan.

Cada prueba está además certificada como resoluble: tiene que aprobarse cuando se aporta el historial relevante y fallar cuando se retira. Esa regla acaba con la queja habitual sobre los benchmarks sintéticos, que es que nadie sabe si una prueba fallada tenía respuesta posible.

¿Qué sistemas de memoria rindieron mejor y cuánto costaron?

Estos son los resultados publicados de DolphinBench para el harness Hermes ejecutando GPT-5.6 Luna, a 22 de septiembre de 2026. La precisión es el porcentaje de 600 tareas completadas. Las columnas de coste son los costes de ejecución que el propio benchmark publica para la suite completa, en dólares estadounidenses, útiles como proporción entre sistemas dentro de la misma prueba más que como un precio que fueras a pagar.

Sistema de memoria Precisión Coste de ejecución del agente Coste de ejecución de la memoria Latencia mediana
Mem0 70.67% 61.54 34.68 37.69s
Hindsight 69.50% 57.99 26.66 55.31s
Honcho 68.50% 96.56 46.30 44.66s
Memoria integrada del modelo 65.67% 61.48 0.00 44.35s
Supermemory 59.17% 63.86 281.79 52.68s

Hay dos hallazgos que merecen más atención que el ganador.

La capa de memoria puede costar más que el agente. El gasto en memoria de Supermemory en esta ejecución fue unas cuatro veces y media su gasto en agente, y terminó último en precisión. Cualquier proveedor que te dé una cifra de precisión sin una cifra de coste te está enseñando medio resultado. La postura de DolphinBench es que el coste y la latencia van en la misma línea que la precisión, y por eso lo llaman una frontera de Pareto y no una tabla de clasificación.

Cuánto ayuda la memoria depende mucho del modelo que hay debajo. Con GPT-5.6 Luna, una capa de memoria dedicada añadió unos cinco puntos sobre la memoria integrada del modelo (70.67% frente a 65.67%). Cambia a MiniMax M3, el modelo chino de pesos abiertos, y la memoria integrada se hundió al 26.50% mientras Mem0 llegaba al 47.83%, una diferencia de más de veinte puntos. Cuanto peor gestiona el modelo de forma nativa los historiales largos, más carga lleva la capa de memoria externa. Si estás usando un modelo de pesos abiertos para controlar el coste, ese es el hallazgo sobre el que actuar.

¿Sobrevive la memoria del agente a una actualización de modelo?

Normalmente no, y este es el hallazgo que la mayoría de los equipos no ha presupuestado.

El estudio de portabilidad citado arriba pasó 48 historiales sintéticos por cuatro diseños de memoria y después cambió el modelo que había escrito la memoria. Resultados por diseño:

  • Grafo de conocimiento con esquema fijo: la precisión cambió en +0.0004 puntos. Prácticamente inmune.
  • Notas comprimidas en lenguaje natural: la precisión se desplazó +9.91 o −13.28 puntos según la dirección de la migración. Las mismas notas, otro lector, otra respuesta.
  • RAG con un índice de embeddings migrado a medias: un índice mixto al 50/50 capturó solo 4.96 de los 11.90 puntos de mejora disponibles al reindexar todo. Media migración te compra bastante menos de la mitad del beneficio.

El resultado sobre la reparación es el que hay que recordar. Cuando las notas comprimidas salieron mal, arreglarlas solo desde el almacén no llegó al objetivo de recuperación del 90% en los 48 casos. Conservar el historial original en bruto recuperó 34 de 48. Si tiras las conversaciones originales y te quedas solo con el resumen, has tirado tu capacidad de arreglar el resumen.

Esto conecta directamente con algo que defendimos en por qué no deberías construir tu negocio sobre un solo modelo de IA: los modelos se retiran en relojes de 12 a 18 meses. Lo que añade este estudio es que ser agnóstico al modelo no va solo de cambiar una API. Tu memoria acumulada está acoplada al modelo que la escribió, y nadie te manda un aviso de migración.

¿Quién está construyendo memoria de agentes y dónde?

El campo está realmente dividido entre Estados Unidos y China, y entre abierto y cerrado, de una forma que la mayoría de la cobertura en inglés pasa por alto.

Sistema Origen Licencia Qué es
Mem0 EE. UU. Núcleo abierto + gestionado Capa de memoria lista para integrar; autora de DolphinBench
Letta (antes MemGPT) EE. UU. Apache 2.0 Servidor de agentes con estado con bloques de memoria explícitos
Honcho, Hindsight, Supermemory EE. UU. Comercial APIs de memoria gestionadas, puntuadas en la tabla de DolphinBench
ReMe China (Alibaba Tongyi Lab) Código abierto Kit de memoria en el stack de AgentScope, basado en archivos y vectores
MemoryOS China (Universidad de Correos y Telecomunicaciones de Pekín) Apache 2.0 Sistema operativo de memoria jerárquica; el equipo reporta un 49.11% de mejora media en F1 en LoCoMo
MemOS China Investigación Trata la memoria como un recurso del sistema planificable en los niveles de texto plano, activación y parámetros

La señal más clara de hacia dónde va esto es el segundo Agent Memory Challenge, que abrió el 20 de septiembre de 2026. Lo organiza la Sociedad China de Imagen y Gráficos junto con la Universidad de Nankín, la Universidad de Zhejiang y Datawhale. La escala es seria: más de 6,000 instancias de evaluación y unos 300 millones de tokens solo en la pista textual, además de pistas separadas de código y multimodal. La bolsa de premios es de ¥150,000 y está reservada a métodos de código abierto. Los productos comerciales pueden participar y ser puntuados, pero compiten en su propia tabla y no ganan nada.

Lee esa decisión de diseño con atención. Quienes ponen las reglas premian los sistemas abiertos y, aun así, exigen a los productos cerrados la misma evidencia en una tabla aparte. Las evaluaciones cierran el 4 de noviembre y los resultados llegan a mediados de noviembre.

Una de las dimensiones textuales del desafío es la que nadie promociona: la gobernanza de la memoria, es decir, actualizaciones, resolución de conflictos, borrado y olvido. Otra es la seguridad epistémica y la privacidad, puntuadas por abstención y divulgación mínima. Esas son las que más importan a un negocio regulado y, hasta este año, casi nada las medía.

¿Qué significa esto para un negocio que pone IA en sus conversaciones con clientes?

Cinco conclusiones, extraídas de los resultados anteriores y no de presentaciones de proveedores.

  1. Guarda las conversaciones en bruto, no solo el resumen. La reparación desde el almacén falló en los 48 casos; conservar el historial de origen recuperó 34. Un resumen es una caché, no un sistema de registro.
  2. Pide precisión y coste juntos. Una capa de memoria que multiplica tu coste y pierde precisión es un resultado medido, no una hipótesis.
  3. Prueba la memoria por acción, no por recuerdo. ¿Aplica el agente la preferencia que tu cliente expresó en marzo sin que se lo recuerden?
  4. Planifica la migración antes de necesitarla. Los índices de embeddings migrados a medias rinden muy por debajo. Decide desde el principio si un cambio de modelo implica reindexar todo.
  5. Comprueba que el borrado llega a la memoria derivada, no solo a la ficha de contacto, y pide a tu proveedor que lo demuestre en lugar de describirlo.

Dónde se sitúa Entagl en esto

Entagl ejecuta un único cerebro de agente en todos los canales en lugar de un bot por canal, y el agente de voz Coordinator lee un resumen de los chats previos del cliente antes de llamar, en vez de empezar en frío. El conocimiento del negocio (servicios, productos, preguntas frecuentes, horarios, políticas) vive en una base de conocimiento consultable que los agentes interrogan, algo más cercano al enfoque de esquema fijo que sobrevivió al cambio de modelo en el estudio de portabilidad que a las notas de texto libre.

Llevar contenido de una conversación de WhatsApp al hilo de Instagram de ese mismo cliente es una capa de memoria entre canales aparte, y está en despliegue por fases, no terminada. Escribe un resumen estructurado por conversación (qué se ha respondido, qué queda pendiente, qué se prometió) mientras conserva los mensajes originales. Permanece apagada hasta que el despliegue llega a un espacio de trabajo, el propietario puede desactivarla en cualquier momento, requiere un vínculo de identidad verificado antes de revelar nada (que un cliente diga que un usuario es suyo no basta), la memoria derivada se borra cuando se elimina un contacto y la memoria almacenada caduca en una ventana de retención fija.

En gobernanza, el principio es el que expusimos en novedades en agentes de IA en 2026: protocolos y salvaguardas: la IA actúa, las personas gobiernan. Para la lista de comprobación del comprador sobre fichas de cliente vinculadas entre canales, consulta conversaciones con clientes entre canales sin confusión.

Qué no demuestran estos resultados

Conviene ser claros sobre los límites.

DolphinBench usa personas sintéticas y aplicaciones simuladas, así que el techo del 70.67% es específico de ese conjunto de tareas y de esos harnesses. El estudio de portabilidad se ejecutó sobre dos modelos de pesos abiertos de menos de 10 mil millones de parámetros, así que sus variaciones exactas no se trasladarán a un modelo de frontera. El Agent Memory Challenge todavía no ha publicado los resultados del segundo ciclo; lo que tenemos es su protocolo. Y Mem0 es la autora del benchmark que encabeza, algo que se declara abiertamente y que aquí es normal, pero es una razón para querer una réplica independiente antes de dar el 70.67% por zanjado.

Nada de eso cambia la dirección. Por primera vez se está midiendo la memoria como es debido, y las mediciones son menos halagadoras que el marketing.

Preguntas frecuentes

¿Cuál es la diferencia entre la memoria de un agente de IA y RAG?

RAG recupera de un corpus de documentos para responder a una pregunta. La memoria del agente gestiona un estado en evolución sobre un usuario o una cuenta concretos a lo largo de las sesiones: qué cambió, qué quedó sustituido, qué se prometió, qué debería olvidarse. RAG suele ser un componente dentro de un sistema de memoria, pero un sistema de memoria también tiene que manejar actualizaciones, conflictos y borrados, cosa que un índice de documentos no hace.

¿Cuánta precisión tiene la memoria de los agentes de IA en 2026?

En DolphinBench, el benchmark basado en acciones publicado el 22 de septiembre de 2026, la mejor configuración completó el 70.67% de 600 tareas que dependen de la memoria. Los resultados variaron mucho según el modelo de base: con el MiniMax M3 de pesos abiertos, la memoria integrada del modelo obtuvo un 26.50% mientras que una capa de memoria dedicada llegó al 47.83%.

¿Un agente de IA olvida cuando cambias el modelo?

Puede hacerlo, sin que se borre ningún dato. El estudio de portabilidad de memoria de septiembre de 2026 encontró que las notas comprimidas en lenguaje natural desplazaron la precisión hasta 13.28 puntos porcentuales tras un cambio de modelo, mientras que un grafo de conocimiento con esquema fijo quedó prácticamente inalterado. Cómo guardas la memoria determina si sobrevive.

¿Puede un cliente pedir a un sistema de IA que borre lo que recuerda?

Puede y debería poder, pero el borrado tiene que llegar también a la memoria derivada, no solo a los mensajes originales. Esta es ya una dimensión puntuada de forma explícita en la pista textual del Agent Memory Challenge, junto a las actualizaciones, la resolución de conflictos y el olvido. Pide a cualquier proveedor que lo demuestre en lugar de describirlo.

¿Una ventana de contexto más grande sustituye a la memoria?

No. El artículo sobre CueMem encontró que los modelos de contexto largo se degradan a medida que la entrada se acerca al límite de la ventana, y su método de recuperación igualó o superó al historial completo con alrededor del 10% de los tokens de entrada. El artículo de OpenAI sobre V7 reporta la misma compensación en producción, donde recorrer un grafo es un orden de magnitud más barato que el contexto largo.

Lo único que te deberías llevar

Hazle a cualquier proveedor una pregunta: ¿qué pasa con todo lo que el agente sabe de mis clientes cuando cambiáis el modelo que tiene debajo? La investigación de septiembre de 2026 dice que las respuestas honestas son o bien "conservamos el historial en bruto y lo volvemos a derivar" o bien "parte se degrada y no podemos repararla del todo". No hay una tercera respuesta que sobreviva a los benchmarks.

Para ver cómo un montaje de cerebro compartido gestiona eso entre DMs, chat web y llamadas, reserva una demo de 30 minutos y trae tu pregunta más difícil sobre continuidad.


Fuentes, a 23 de septiembre de 2026: DolphinBench (Mem0, 22 sep 2026; artículo); Does Your Agent's Memory Survive a Model Upgrade? (Goyal y Ray, 4 sep 2026); CueMem (11 sep 2026); Agent Memory Challenge ciclo 2 (CSIG, abierto el 20 sep 2026); How V7 gives AI agents institutional memory (OpenAI, 21 sep 2026); MemoryOS; MemOS; ReMe. Las versiones de los modelos y las clasificaciones se mueven cada mes; por eso las cifras van fechadas.

Publicado por Entagl Team on