AI News · industry
La mémoire des agents IA en 2026 : ce que montrent les nouveaux benchmarks
Trois tests publiés en septembre 2026 ont mesuré ce que les agents retiennent vraiment. Le meilleur score atteint 70.67%, les notes compressées ont cédé lors d'un changement de modèle, et la mémoire a parfois coûté plus cher que l'agent lui-même.

La mémoire des agents IA est la couche qui permet à un agent d'utiliser ce qu'un client lui a dit il y a plusieurs semaines, et en septembre 2026 elle reste mesurablement inachevée. Sur DolphinBench, publié le 22 septembre 2026, la configuration la mieux notée a mené à bien 70.67% des 600 tâches dépendantes de la mémoire. Près d'un tiers ont échoué. Une étude contrôlée distincte, Does Your Agent's Memory Survive a Model Upgrade?, parue le 4 septembre, a constaté que lorsqu'une mémoire construite par un modèle était confiée à un autre, la précision se déplaçait jusqu'à 13.28 points de pourcentage dans le mauvais sens, sans que personne ne touche aux données stockées.
Trois choses sont arrivées en septembre et méritent votre attention si vous faites tourner une IA qui parle à vos clients : un benchmark qui note la mémoire sur des actions plutôt que sur des réponses de quiz, une étude sur la survie de la mémoire à une mise à niveau de modèle, et un concours hébergé en Chine qui soumet tous les systèmes de mémoire au même règlement. Voici ce que chacun a mesuré, et ce que cela change.
Qu'est-ce que la mémoire des agents IA, et en quoi diffère-t-elle d'une fenêtre de contexte ?
Une fenêtre de contexte est l'espace de travail dont dispose un modèle pendant une exécution. Elle se vide dès que l'exécution se termine. La mémoire d'un agent, elle, est un état durable : ce qui est consigné après une conversation, et récupéré avant la suivante.
La distinction compte, parce que le secteur continue d'essayer de résoudre la mémoire en agrandissant la fenêtre. Les faits disent que cela ne suffit pas. L'article CueMem (11 septembre 2026), signé par Mashang Consumer Finance et le Harbin Institute of Technology de Shenzhen, a constaté que donner tout l'historique d'un dialogue au modèle dégrade les résultats à mesure que l'entrée approche de la limite de contexte, un effet que les auteurs attribuent en partie au contexte non pertinent et au problème du « perdu au milieu ». Leur approche par récupération a utilisé environ 10% des tokens d'entrée du réglage « historique complet » sur le benchmark LoCoMo, et a tout de même obtenu un meilleur score.
La publication d'OpenAI du 21 septembre sur V7, qui construit le contexte des agents pour les équipes de la finance et de l'assurance, dit la même chose depuis la production : le graphe de V7 est « d'un ordre de grandeur moins cher et plus rapide à parcourir que les approches à contexte long », les échanges récents restant dans le contexte actif et les éléments plus anciens étant laissés dans le graphe jusqu'à ce que quelque chose les réclame.
La mémoire n'est donc pas une fenêtre plus grande. C'est une décision sur ce qu'il faut consigner, et sur ce qu'il faut garder.
Pourquoi les benchmarks ont-ils changé en septembre 2026 ?
Jusqu'ici, la plupart des benchmarks de mémoire posaient des questions. Cela flatte les systèmes testés.
L'argument de DolphinBench est direct. Demandez à un agent « quelle plateforme de messagerie l'équipe utilise-t-elle ? » et vous lui avez déjà dit qu'un fait existe sur ce sujet, et que vous le voulez. L'étape la plus difficile, remarquer qu'il faut aller chercher quelque chose, a été faite à sa place. DolphinBench supprime donc la question. Il donne à l'agent trois historiques simulés de travailleurs du savoir (environ 500,000 tokens chacun, 13,539 messages couvrant 2023 à 2027), puis lance 600 tâches sur des applications simulées dont Notion, Gmail, GitHub et Discord, où une mauvaise action laisse une trace que le correcteur peut voir.
Un exemple concret : un PDG énonce une règle de canal une seule fois, en avril 2023, selon laquelle les notes de version vont dans #eng-releases tant qu'un déploiement n'est pas au vert. Rien ne la répète. Trois ans et demi plus tard, enfouie dans un historique de 3,400 messages, une demande arrive : publier une mise à jour de déploiement, sans qu'aucun canal soit nommé. Publiez dans le mauvais et vous échouez. Connaître le fait ne suffit pas ; l'agent doit l'appliquer sans qu'on le lui rappelle.
Chaque test est aussi certifié résoluble : il doit réussir quand l'historique pertinent est fourni, et échouer quand il est retiré. Cette règle tue la critique habituelle des benchmarks synthétiques, à savoir que personne ne sait si un test échoué pouvait seulement recevoir une réponse.
Quels systèmes de mémoire ont obtenu les meilleurs résultats, et combien ont-ils coûté ?
Voici les résultats publiés par DolphinBench pour le harnais Hermes tournant sur GPT-5.6 Luna, au 22 septembre 2026. La précision est le pourcentage des 600 tâches menées à bien. Les colonnes de coût reprennent les coûts d'exécution publiés par le benchmark pour la suite complète, en dollars américains ; elles servent de rapport entre systèmes sur un même test, pas de prix que vous paieriez.
| Système de mémoire | Précision | Coût d'exécution de l'agent | Coût d'exécution de la mémoire | Latence médiane |
|---|---|---|---|---|
| Mem0 | 70.67% | 61.54 | 34.68 | 37.69s |
| Hindsight | 69.50% | 57.99 | 26.66 | 55.31s |
| Honcho | 68.50% | 96.56 | 46.30 | 44.66s |
| Mémoire intégrée du modèle | 65.67% | 61.48 | 0.00 | 44.35s |
| Supermemory | 59.17% | 63.86 | 281.79 | 52.68s |
Deux constats méritent plus d'attention que le vainqueur.
La couche mémoire peut coûter plus cher que l'agent. La dépense mémoire de Supermemory sur cette exécution représentait environ quatre fois et demie sa dépense agent, et il termine dernier en précision. Tout fournisseur qui vous annonce un chiffre de précision sans chiffre de coût ne vous montre que la moitié du résultat. La position de DolphinBench est que le coût et la latence appartiennent à la même ligne que la précision, ce qui explique pourquoi ils parlent de frontière de Pareto plutôt que de classement.
L'apport réel de la mémoire dépend beaucoup du modèle qui se trouve en dessous. Avec GPT-5.6 Luna, une couche mémoire dédiée ajoute environ cinq points par rapport à la mémoire intégrée du modèle (70.67% contre 65.67%). Remplacez-le par MiniMax M3, le modèle chinois à poids ouverts, et la mémoire intégrée s'effondre à 26.50% tandis que Mem0 atteint 47.83%, soit un écart de plus de vingt points. Moins le modèle gère nativement les longs historiques, plus la couche mémoire externe porte la charge. Si vous faites tourner un modèle à poids ouverts pour maîtriser vos coûts, c'est le constat sur lequel agir.
La mémoire d'un agent survit-elle à une mise à niveau de modèle ?
Le plus souvent non, et c'est le résultat que la plupart des équipes n'ont pas intégré à leurs calculs.
L'étude sur la portabilité citée plus haut a fait passer 48 historiques synthétiques dans quatre conceptions de mémoire, puis a changé le modèle qui avait écrit cette mémoire. Les résultats, conception par conception :
- Graphe de connaissances à schéma fixe : la précision a bougé de +0.0004 point. Pratiquement immunisé.
- Notes compressées en langage naturel : la précision s'est déplacée de +9.91 ou −13.28 points selon le sens de la migration. Mêmes notes, autre lecteur, autre réponse.
- RAG avec un index d'embeddings migré à moitié : un index mixte à 50/50 n'a capté que 4.96 des 11.90 points de gain qu'un réencodage complet rendait disponibles. Une demi-migration vous achète nettement moins que la moitié du bénéfice.
Le résultat sur la réparation est celui à retenir. Quand les notes compressées déraillaient, les corriger à partir du seul stockage n'a pas permis d'atteindre l'objectif de 90% de récupération dans les 48 cas. Conserver l'historique source brut en a récupéré 34 sur 48. Si vous jetez les conversations d'origine pour ne garder que le résumé, vous avez jeté votre capacité à corriger ce résumé.
Cela rejoint directement ce que nous défendions dans pourquoi vous ne devriez pas bâtir votre entreprise sur un seul modèle d'IA : les modèles sont retirés selon des cycles de 12 à 18 mois. Ce que cette étude ajoute, c'est qu'être agnostique aux modèles ne se résume pas à changer d'API. Votre mémoire accumulée est liée au modèle qui l'a écrite, et personne ne vous envoie d'avis de migration.
Qui construit la mémoire des agents, et où ?
Le domaine est réellement partagé entre les États-Unis et la Chine, et entre l'ouvert et le fermé, d'une façon que la plupart des articles anglophones manquent.
| Système | Origine | Licence | De quoi il s'agit |
|---|---|---|---|
| Mem0 | États-Unis | Open core + géré | Couche mémoire prête à l'emploi ; auteur de DolphinBench |
| Letta (anciennement MemGPT) | États-Unis | Apache 2.0 | Serveur d'agents à état avec des blocs de mémoire explicites |
| Honcho, Hindsight, Supermemory | États-Unis | Commercial | API de mémoire gérées, évaluées sur le classement DolphinBench |
| ReMe | Chine (Alibaba Tongyi Lab) | Open source | Kit de mémoire de la pile AgentScope, basé sur des fichiers et des vecteurs |
| MemoryOS | Chine (Beijing Univ. of Posts and Telecommunications) | Apache 2.0 | OS de mémoire hiérarchique ; l'équipe annonce un gain moyen de 49.11% en F1 sur LoCoMo |
| MemOS | Chine | Recherche | Traite la mémoire comme une ressource système ordonnançable aux niveaux texte brut, activation et paramètres |
Le signal le plus clair sur la direction prise est le deuxième Agent Memory Challenge, ouvert le 20 septembre 2026. Il est hébergé par la China Society of Image and Graphics et organisé avec l'université de Nanjing, l'université du Zhejiang et Datawhale. L'échelle est sérieuse : plus de 6,000 instances d'évaluation et environ 300 millions de tokens rien que pour la piste textuelle, plus des pistes distinctes pour le code et le multimodal. La dotation s'élève à ¥150,000, et elle est réservée aux méthodes open source. Les produits commerciaux peuvent participer et être notés, mais ils tournent sur leur propre classement et ne gagnent rien.
Lisez ce choix de conception attentivement. Ceux qui fixent les règles récompensent les systèmes ouverts, tout en tenant les produits fermés aux mêmes preuves sur un tableau séparé. Les évaluations ferment le 4 novembre, les résultats tombent à la mi-novembre.
L'une des dimensions textuelles du concours est celle dont personne ne fait la promotion : la gouvernance de la mémoire, c'est-à-dire les mises à jour, la résolution des conflits, la suppression et l'oubli. Une autre est la sécurité épistémique et la confidentialité, notées sur l'abstention et la divulgation minimale. Ce sont celles qui comptent le plus pour une entreprise réglementée, et jusqu'à cette année presque rien ne les mesurait.
Qu'est-ce que cela signifie pour une entreprise dont l'IA traite les conversations clients ?
Cinq conclusions, tirées des résultats ci-dessus plutôt que de plaquettes commerciales.
- Gardez les conversations brutes, pas seulement le résumé. La réparation à partir du seul stockage a échoué dans les 48 cas ; conserver l'historique source en a récupéré 34. Un résumé est un cache, pas un registre de référence.
- Demandez la précision et le coût ensemble. Une couche mémoire qui multiplie votre coût et perd en précision est un résultat mesuré, pas une hypothèse.
- Testez la mémoire par l'action, pas par le rappel. L'agent applique-t-il la préférence que votre client a exprimée en mars, sans qu'on la lui rappelle ?
- Préparez la migration avant d'en avoir besoin. Les index d'embeddings migrés à moitié sous-performent nettement. Décidez d'emblée si un changement de modèle implique un réencodage complet.
- Vérifiez que la suppression atteint la mémoire dérivée, pas seulement la fiche contact, et demandez à votre fournisseur de le démontrer plutôt que de le décrire.
La position d'Entagl sur le sujet
Entagl fait tourner un seul cerveau d'agent sur tous les canaux, plutôt qu'un bot séparé par canal, et l'agent vocal Coordinator lit un résumé des échanges précédents du client avant de composer le numéro, au lieu de partir de zéro. Les connaissances métier (services, produits, FAQ, horaires, politiques) vivent dans une base de connaissances interrogeable que les agents consultent, ce qui se rapproche davantage de l'approche à schéma fixe, celle qui a survécu au changement de modèle dans l'étude de portabilité, que des notes en texte libre.
Reporter le contenu d'un fil WhatsApp dans le fil Instagram de ce même client relève d'une couche de mémoire inter-canaux distincte, et celle-ci est en déploiement progressif, pas terminée. Elle écrit un résumé structuré par conversation (ce qui a été répondu, ce qui est en attente, ce qui a été promis) tout en conservant les messages d'origine. Elle reste désactivée jusqu'à ce que le déploiement atteigne un espace de travail, le propriétaire peut la couper à tout moment, elle exige un lien d'identité vérifié avant de divulguer quoi que ce soit (un client qui se contente de revendiquer un identifiant ne suffit pas), la mémoire dérivée est effacée quand un contact est supprimé, et la mémoire stockée expire selon une fenêtre de rétention fixe.
Sur la gouvernance, le principe est celui que nous posions dans les nouveautés des agents IA en 2026 : protocoles et garde-fous : l'IA agit, les humains gouvernent. Pour la liste de vérification côté acheteur sur les fiches clients liées entre canaux, voyez conversations clients entre canaux, sans confusion.
Ce que ces résultats ne prouvent pas
Autant être clair sur les limites.
DolphinBench utilise des personas synthétiques et des applications simulées : le plafond de 70.67% est donc propre à cet ensemble de tâches et à ces harnais. L'étude de portabilité a tourné sur deux modèles à poids ouverts de moins de 10 milliards de paramètres, donc ses écarts précis ne se transposeront pas à un modèle de pointe. L'Agent Memory Challenge n'a pas encore publié les résultats de son deuxième cycle ; ce dont nous disposons, c'est son protocole. Et Mem0 est l'auteur du benchmark qu'il domine, ce qui est déclaré ouvertement et reste courant dans ce domaine, mais c'est une raison de vouloir une réplication indépendante avant de tenir 70.67% pour acquis.
Rien de tout cela ne change la direction. La mémoire est mesurée sérieusement pour la première fois, et les mesures sont moins flatteuses que le marketing.
FAQ
Quelle est la différence entre la mémoire d'un agent IA et le RAG ?
Le RAG va chercher dans un corpus de documents pour répondre à une question. La mémoire d'un agent gère un état qui évolue à propos d'un utilisateur ou d'un compte précis, d'une session à l'autre : ce qui a changé, ce qui a été remplacé, ce qui a été promis, ce qu'il faut oublier. Le RAG est souvent un composant à l'intérieur d'un système de mémoire, mais un système de mémoire doit en plus gérer les mises à jour, les conflits et la suppression, ce qu'un index documentaire ne fait pas.
Quelle est la précision de la mémoire des agents IA en 2026 ?
Sur DolphinBench, le benchmark fondé sur l'action publié le 22 septembre 2026, la meilleure configuration a mené à bien 70.67% des 600 tâches dépendantes de la mémoire. Les résultats varient beaucoup selon le modèle sous-jacent : avec MiniMax M3, à poids ouverts, la mémoire intégrée du modèle obtient 26.50% tandis qu'une couche mémoire dédiée atteint 47.83%.
Un agent IA oublie-t-il quand on change de modèle ?
Cela peut arriver, sans qu'aucune donnée ne soit supprimée. L'étude de septembre 2026 sur la portabilité de la mémoire a constaté que des notes compressées en langage naturel déplaçaient la précision jusqu'à 13.28 points de pourcentage après un changement de modèle, alors qu'un graphe de connaissances à schéma fixe restait pour ainsi dire intact. La façon dont vous stockez la mémoire détermine si elle survit.
Un client peut-il demander à un système d'IA d'effacer ce qu'il retient ?
Il le peut, et il devrait pouvoir le faire, mais la suppression doit aussi atteindre la mémoire dérivée, pas seulement les messages d'origine. C'est désormais une dimension explicitement notée dans la piste textuelle de l'Agent Memory Challenge, aux côtés des mises à jour, de la résolution des conflits et de l'oubli. Demandez à tout fournisseur de le démontrer plutôt que de le décrire.
Une fenêtre de contexte plus grande remplace-t-elle la mémoire ?
Non. L'article CueMem a constaté que les modèles à contexte long se dégradent à mesure que l'entrée approche de la limite de la fenêtre, et que sa méthode de récupération égalait ou dépassait l'historique complet avec environ 10% des tokens d'entrée. La publication d'OpenAI sur V7 rapporte le même arbitrage en production, où un graphe est d'un ordre de grandeur moins coûteux à parcourir qu'un contexte long.
La seule chose à retenir
Posez une seule question à tout fournisseur : qu'advient-il de tout ce que l'agent sait de mes clients quand vous changez le modèle en dessous ? Les travaux de septembre 2026 disent que les réponses honnêtes sont soit « nous gardons l'historique brut et nous redérivons », soit « une partie se dégrade et nous ne pouvons pas la réparer entièrement ». Il n'existe pas de troisième réponse qui tienne face aux benchmarks.
Pour voir comment un dispositif à cerveau partagé gère cela entre les DM, le chat web et les appels, réservez une démo de 30 minutes et venez avec votre question de continuité la plus difficile.
Sources, au 23 septembre 2026 : DolphinBench (Mem0, 22 sept. 2026 ; article) ; Does Your Agent's Memory Survive a Model Upgrade? (Goyal et Ray, 4 sept. 2026) ; CueMem (11 sept. 2026) ; Agent Memory Challenge cycle 2 (CSIG, ouvert le 20 sept. 2026) ; How V7 gives AI agents institutional memory (OpenAI, 21 sept. 2026) ; MemoryOS ; MemOS ; ReMe. Les versions de modèles et les classements bougent tous les mois ; les chiffres sont datés pour cette raison.