AI News · industry
Das Gedächtnis von KI-Agenten 2026: Was die neuen Benchmarks zeigen
Drei Tests vom September 2026 haben gemessen, woran sich Agenten wirklich erinnern. Der beste Wert lag bei 70.67%, komprimierte Notizen brachen beim Modellwechsel ein, und das Gedächtnis kostete teils mehr als der Agent selbst.

Das Gedächtnis von KI-Agenten ist die Schicht, mit der ein Agent etwas nutzen kann, das ein Kunde ihm vor Wochen gesagt hat, und Stand September 2026 ist sie messbar unfertig. Bei DolphinBench, veröffentlicht am 22. September 2026, löste die bestbewertete Konfiguration 70.67% von 600 gedächtnisabhängigen Aufgaben. Fast ein Drittel scheiterte. Eine separate kontrollierte Studie, Does Your Agent's Memory Survive a Model Upgrade?, erschienen am 4. September, zeigte: Wurde ein Gedächtnisspeicher, den ein Modell aufgebaut hatte, an ein anderes Modell übergeben, verschob sich die Genauigkeit um bis zu 13.28 Prozentpunkte in die falsche Richtung, ohne dass jemand die gespeicherten Daten angefasst hätte.
Im September sind drei Dinge erschienen, die Ihre Aufmerksamkeit verdienen, wenn Sie KI im Kundenkontakt einsetzen: ein Benchmark, der Gedächtnis an Handlungen misst statt an Quizantworten, eine Studie dazu, ob Gedächtnis ein Modell-Upgrade übersteht, und ein in China ausgerichteter Wettbewerb, der alle Gedächtnissysteme demselben Regelwerk unterwirft. Hier steht, was jedes davon gemessen hat und was sich dadurch ändert.
Was ist das Gedächtnis von KI-Agenten, und worin unterscheidet es sich vom Kontextfenster?
Ein Kontextfenster ist der Arbeitsraum, den ein Modell während eines Durchlaufs hat. Es leert sich, wenn der Durchlauf endet. Agenten-Gedächtnis ist dauerhafter Zustand: das, was nach einem Gespräch festgehalten und vor dem nächsten wieder abgerufen wird.
Der Unterschied ist wichtig, weil die Branche das Gedächtnisproblem immer wieder mit einem größeren Fenster lösen will. Die Belege sagen: Für sich genommen funktioniert das nicht. Das CueMem-Paper (11. September 2026) von Mashang Consumer Finance und dem Harbin Institute of Technology in Shenzhen kommt zu dem Ergebnis, dass die Qualität nachlässt, wenn man dem Modell die gesamte Dialoghistorie übergibt und die Eingabe sich der Kontextgrenze nähert. Die Autoren führen das unter anderem auf irrelevanten Kontext und das Lost-in-the-Middle-Problem zurück. Ihr Retrieval-Ansatz kam im LoCoMo-Benchmark mit rund 10% der Eingabe-Token der Variante mit voller Historie aus und schnitt trotzdem besser ab.
OpenAIs Beitrag vom 21. September über V7, das Agentenkontext für Finanz- und Versicherungsteams aufbaut, sagt dasselbe aus der Produktion heraus: V7s Graph sei „um eine Größenordnung günstiger und schneller zu durchlaufen als Long-Context-Ansätze“, wobei aktuelle Austausche im aktiven Kontext bleiben und ältere Inhalte im Graphen liegen, bis etwas danach fragt.
Gedächtnis ist also kein größeres Fenster. Es ist eine Entscheidung darüber, was festgehalten wird und was bleibt.
Warum haben sich die Benchmarks im September 2026 verändert?
Bisher stellten die meisten Gedächtnis-Benchmarks Fragen. Das schmeichelt den getesteten Systemen.
Das Argument von DolphinBench ist unverblümt. Fragen Sie einen Agenten „welche Messaging-Plattform nutzt das Team?“, dann haben Sie ihm schon verraten, dass es eine solche Information gibt und dass Sie sie hören wollen. Der schwerste Schritt, überhaupt zu bemerken, dass etwas abgerufen werden muss, ist ihm damit abgenommen. Also streicht DolphinBench die Frage. Der Agent bekommt drei simulierte Verläufe von Wissensarbeitern (je rund 500,000 Token, 13,539 Nachrichten aus den Jahren 2023 bis 2027) und dann 600 Aufgaben in simulierten Apps wie Notion, Gmail, GitHub und Discord, in denen eine falsche Handlung eine Spur hinterlässt, die die Bewertung sieht.
Ein durchgespieltes Beispiel: Ein CEO formuliert im April 2023 ein einziges Mal eine Kanalregel, nämlich dass Release Notes so lange in #eng-releases gehören, bis ein Deploy grün ist. Niemand wiederholt das je. Dreieinhalb Jahre später, vergraben in einer Historie mit 3,400 Nachrichten, kommt die Bitte, ein Rollout-Update zu posten, und es wird kein Kanal genannt. Wer in den falschen postet, fällt durch. Die Tatsache zu kennen reicht nicht; der Agent muss sie ungefragt anwenden.
Jede Aufgabe ist außerdem als lösbar zertifiziert: Sie muss bestehen, wenn die relevante Historie vorliegt, und scheitern, wenn sie vorenthalten wird. Diese Regel räumt den üblichen Einwand gegen synthetische Benchmarks aus, nämlich dass niemand weiß, ob eine gescheiterte Aufgabe überhaupt lösbar war.
Welche Gedächtnissysteme schnitten am besten ab, und was kosteten sie?
Hier sind die von DolphinBench veröffentlichten Ergebnisse für das Hermes-Harness mit GPT-5.6 Luna, Stand 22. September 2026. Genauigkeit ist der Anteil der 600 gelösten Aufgaben. Die Kostenspalten sind die vom Benchmark selbst veröffentlichten Laufkosten für die gesamte Suite in US-Dollar. Sie taugen als Verhältnis zwischen Systemen im selben Test, nicht als Preis, den Sie zahlen würden.
| Gedächtnissystem | Genauigkeit | Kosten Agentenlauf | Kosten Gedächtnislauf | Median-Latenz |
|---|---|---|---|---|
| Mem0 | 70.67% | 61.54 | 34.68 | 37.69s |
| Hindsight | 69.50% | 57.99 | 26.66 | 55.31s |
| Honcho | 68.50% | 96.56 | 46.30 | 44.66s |
| Eingebautes Gedächtnis des Modells | 65.67% | 61.48 | 0.00 | 44.35s |
| Supermemory | 59.17% | 63.86 | 281.79 | 52.68s |
Zwei Befunde verdienen mehr Aufmerksamkeit als der Sieger.
Die Gedächtnisebene kann mehr kosten als der Agent. Supermemory gab in diesem Lauf für das Gedächtnis rund viereinhalbmal so viel aus wie für den Agenten und landete bei der Genauigkeit auf dem letzten Platz. Jeder Anbieter, der Ihnen eine Genauigkeitszahl ohne Kostenzahl nennt, zeigt Ihnen das halbe Ergebnis. DolphinBench vertritt die Position, dass Kosten und Latenz in dieselbe Zeile gehören wie die Genauigkeit. Deshalb sprechen sie von einer Pareto-Front und nicht von einem Leaderboard.
Wie viel das Gedächtnis bringt, hängt stark vom Modell darunter ab. Mit GPT-5.6 Luna brachte eine eigene Gedächtnisebene rund fünf Punkte mehr als das eingebaute Gedächtnis des Modells (70.67% gegenüber 65.67%). Setzen Sie stattdessen MiniMax M3 ein, das chinesische Open-Weights-Modell, bricht das eingebaute Gedächtnis auf 26.50% ein, während Mem0 47.83% erreicht, ein Abstand von über zwanzig Punkten. Je schwächer ein Modell von Haus aus mit langer Historie umgeht, desto mehr trägt die externe Gedächtnisebene. Wenn Sie aus Kostengründen ein Open-Weights-Modell betreiben, ist das der Befund, auf den Sie reagieren sollten.
Übersteht das Gedächtnis eines Agenten ein Modell-Upgrade?
Meistens nicht, und das ist der Befund, den die wenigsten Teams eingepreist haben.
Die oben zitierte Portabilitätsstudie schickte 48 synthetische Verläufe durch vier Gedächtnis-Designs und tauschte anschließend das Modell aus, das das Gedächtnis geschrieben hatte. Die Ergebnisse je Design:
- Wissensgraph mit festem Schema: Die Genauigkeit veränderte sich um +0.0004 Punkte. Praktisch immun.
- Komprimierte Notizen in natürlicher Sprache: Die Genauigkeit verschob sich um +9.91 oder −13.28 Punkte, je nach Migrationsrichtung. Gleiche Notizen, anderer Leser, andere Antwort.
- RAG mit halb migriertem Embedding-Index: Ein zur Hälfte gemischter Index (50/50) holte nur 4.96 der 11.90 Punkte heraus, die eine komplette Neuberechnung der Embeddings gebracht hätte. Eine halbe Migration bringt Ihnen deutlich weniger als den halben Nutzen.
Das Reparaturergebnis ist das, was Sie sich merken sollten. Als die komprimierten Notizen daneben lagen, verfehlte eine Korrektur allein aus dem Speicher heraus das Erholungsziel von 90% in allen 48 Fällen. Mit der erhaltenen Rohhistorie gelang die Erholung in 34 von 48 Fällen. Wer die ursprünglichen Gespräche wegwirft und nur die Zusammenfassung behält, hat damit auch die Möglichkeit weggeworfen, die Zusammenfassung zu reparieren.
Das hängt direkt mit dem zusammen, was wir in Warum Sie Ihr Unternehmen nicht auf ein einziges KI-Modell aufbauen sollten beschrieben haben: Modelle werden im Takt von 12 bis 18 Monaten abgeschaltet. Neu an dieser Studie ist, dass Modellunabhängigkeit nicht nur heißt, eine API zu tauschen. Ihr angesammeltes Gedächtnis ist an das Modell gekoppelt, das es geschrieben hat, und eine Migrationsmitteilung schickt Ihnen dafür niemand.
Wer baut Agenten-Gedächtnis, und wo?
Das Feld ist tatsächlich zwischen den USA und China geteilt, und zwischen offen und geschlossen, auf eine Weise, die die meiste englischsprachige Berichterstattung übersieht.
| System | Herkunft | Lizenz | Was es ist |
|---|---|---|---|
| Mem0 | US | Open Core + Managed | Einsteckbare Gedächtnisebene; hat DolphinBench verfasst |
| Letta (früher MemGPT) | US | Apache 2.0 | Zustandsbehafteter Agenten-Server mit expliziten Memory-Blöcken |
| Honcho, Hindsight, Supermemory | US | Kommerziell | Managed Memory APIs, bewertet auf dem DolphinBench-Leaderboard |
| ReMe | China (Alibaba Tongyi Lab) | Open Source | Memory-Kit im AgentScope-Stack, datei- und vektorbasiert |
| MemoryOS | China (Beijing Univ. of Posts and Telecommunications) | Apache 2.0 | Hierarchisches Gedächtnis-OS; das Team berichtet 49.11% durchschnittlichen F1-Gewinn auf LoCoMo |
| MemOS | China | Forschung | Behandelt Gedächtnis als planbare Systemressource über Klartext-, Aktivierungs- und Parameterebene hinweg |
Das deutlichste Signal für die Richtung ist die zweite Agent Memory Challenge, die am 20. September 2026 gestartet ist. Ausrichter ist die China Society of Image and Graphics, organisiert zusammen mit der Nanjing University, der Zhejiang University und Datawhale. Der Umfang ist ernst gemeint: über 6,000 Evaluationsinstanzen und rund 300 Millionen Token allein im Text-Track, dazu getrennte Tracks für Code und Multimodalität. Der Preistopf liegt bei ¥150,000 und ist Open-Source-Methoden vorbehalten. Kommerzielle Produkte dürfen antreten und werden bewertet, laufen aber auf einem eigenen Leaderboard und gewinnen nichts.
Lesen Sie diese Entscheidung genau. Wer hier die Regeln setzt, belohnt offene Systeme und hält geschlossene Produkte trotzdem auf einer eigenen Tafel an dieselben Belege. Die Evaluationen enden am 4. November, die Ergebnisse kommen Mitte November.
Eine der Textdimensionen des Wettbewerbs ist genau die, mit der niemand wirbt: Memory-Governance, also Aktualisierungen, Konfliktauflösung, Löschung und Vergessen. Eine weitere ist epistemische Sicherheit und Datenschutz, bewertet an Enthaltung und minimaler Offenlegung. Für ein reguliertes Unternehmen zählen genau diese Punkte am meisten, und bis zu diesem Jahr hat sie fast nichts gemessen.
Was bedeutet das für ein Unternehmen, das KI auf Kundengespräche ansetzt?
Fünf Schlussfolgerungen, gezogen aus den Ergebnissen oben und nicht aus Anbieterpräsentationen.
- Bewahren Sie die Rohgespräche auf, nicht nur die Zusammenfassung. Die Reparatur allein aus dem Speicher scheiterte in allen 48 Fällen; mit erhaltener Quellhistorie gelang sie in 34. Eine Zusammenfassung ist ein Cache, kein führendes System.
- Fragen Sie Genauigkeit und Kosten immer zusammen ab. Eine Gedächtnisebene, die Ihre Kosten vervielfacht und dabei an Genauigkeit verliert, ist ein gemessenes Ergebnis, kein Gedankenspiel.
- Testen Sie Gedächtnis an Handlungen, nicht am Abruf. Wendet der Agent die Präferenz an, die Ihr Kunde im März genannt hat, ohne dass ihn jemand daran erinnert?
- Planen Sie die Migration, bevor Sie sie brauchen. Halb migrierte Embedding-Indizes schneiden deutlich schlechter ab. Entscheiden Sie vorab, ob ein Modellwechsel eine komplette Neuberechnung der Embeddings bedeutet.
- Prüfen Sie, ob das Löschen auch das abgeleitete Gedächtnis erreicht, nicht nur den Kontakteintrag, und lassen Sie es sich von Ihrem Anbieter vorführen statt beschreiben.
Wo Entagl hier steht
Entagl betreibt ein Agentengehirn über alle Kanäle hinweg statt eines eigenen Bots pro Kanal, und der Coordinator Voice Agent liest vor dem Anruf eine Zusammenfassung der bisherigen Chats des Kunden, statt kalt zu starten. Geschäftswissen (Leistungen, Produkte, FAQs, Öffnungszeiten, Richtlinien) liegt in einer durchsuchbaren Wissensdatenbank, die die Agenten abfragen. Das liegt näher am Ansatz mit festem Schema, der den Modellwechsel in der Portabilitätsstudie überstanden hat, als an freien Textnotizen.
Inhalte aus einem WhatsApp-Verlauf in den Instagram-Verlauf desselben Kunden zu übernehmen, ist eine separate kanalübergreifende Gedächtnisebene, und die steckt im gestaffelten Rollout statt fertig zu sein. Sie schreibt pro Gespräch eine strukturierte Zusammenfassung (was beantwortet wurde, was offen ist, was zugesagt wurde) und behält dabei die ursprünglichen Nachrichten. Sie bleibt aus, bis der Rollout einen Workspace erreicht, der Inhaber kann sie jederzeit abschalten, sie verlangt eine verifizierte Identitätsverknüpfung, bevor sie etwas offenlegt (dass ein Kunde einfach ein Handle für sich beansprucht, reicht nicht), abgeleitetes Gedächtnis wird beim Löschen eines Kontakts mitgelöscht, und gespeichertes Gedächtnis verfällt nach einer festen Aufbewahrungsfrist.
Bei der Governance gilt das Prinzip, das wir in Was ist neu bei KI-Agenten 2026: Protokolle und Leitplanken formuliert haben: Die KI handelt, Menschen steuern. Die Checkliste für Käufer zu verknüpften Kundeneinträgen über Kanäle hinweg finden Sie in Kundengespräche über mehrere Kanäle ohne Verwirrung.
Was diese Ergebnisse nicht beweisen
Bei den Grenzen lohnt sich Offenheit.
DolphinBench arbeitet mit synthetischen Personas und simulierten Apps, die Obergrenze von 70.67% gilt also für genau diesen Aufgabensatz und diese Harnesses. Die Portabilitätsstudie lief auf zwei Open-Weight-Modellen mit unter 10 Milliarden Parametern, ihre exakten Punkteausschläge lassen sich deshalb nicht auf ein Frontier-Modell übertragen. Die Agent Memory Challenge hat die Ergebnisse des zweiten Zyklus noch nicht veröffentlicht; vorliegen tut bisher nur das Protokoll. Und Mem0 hat den Benchmark verfasst, den das eigene System anführt. Das wird offen ausgewiesen und ist in diesem Feld üblich, aber es ist ein Grund, sich eine unabhängige Replikation zu wünschen, bevor man 70.67% als gesichert behandelt.
An der Richtung ändert das nichts. Gedächtnis wird zum ersten Mal ordentlich gemessen, und die Messungen fallen weniger schmeichelhaft aus als das Marketing.
FAQ
Was ist der Unterschied zwischen dem Gedächtnis von KI-Agenten und RAG?
RAG ruft aus einem Dokumentenkorpus ab, um eine Frage zu beantworten. Agenten-Gedächtnis verwaltet einen sich verändernden Zustand zu einem bestimmten Nutzer oder Konto über Sitzungen hinweg: was sich geändert hat, was überholt ist, was zugesagt wurde, was vergessen werden soll. RAG ist oft ein Baustein innerhalb eines Gedächtnissystems, aber ein Gedächtnissystem muss zusätzlich Aktualisierungen, Konflikte und Löschungen beherrschen, und das leistet ein Dokumentenindex nicht.
Wie genau ist das Gedächtnis von KI-Agenten im Jahr 2026?
Bei DolphinBench, dem am 22. September 2026 veröffentlichten handlungsbasierten Benchmark, löste die beste Konfiguration 70.67% von 600 gedächtnisabhängigen Aufgaben. Die Ergebnisse schwankten stark je nach zugrunde liegendem Modell: Mit dem Open-Weights-Modell MiniMax M3 kam das eingebaute Modellgedächtnis auf 26.50%, eine eigene Gedächtnisebene auf 47.83%.
Vergisst ein KI-Agent etwas, wenn man das Modell wechselt?
Das kann passieren, ohne dass irgendwelche Daten gelöscht werden. Die Studie zur Gedächtnisportabilität vom September 2026 fand, dass komprimierte Notizen in natürlicher Sprache die Genauigkeit nach einem Modellwechsel um bis zu 13.28 Prozentpunkte verschoben, während ein Wissensgraph mit festem Schema praktisch unberührt blieb. Wie Sie Gedächtnis speichern, entscheidet darüber, ob es überlebt.
Kann ein Kunde verlangen, dass ein KI-System löscht, was es sich gemerkt hat?
Kann er, und er sollte es auch können. Das Löschen muss aber auch das abgeleitete Gedächtnis erreichen, nicht nur die ursprünglichen Nachrichten. Im Text-Track der Agent Memory Challenge ist das inzwischen eine ausdrücklich bewertete Dimension, neben Aktualisierungen, Konfliktauflösung und Vergessen. Lassen Sie sich das von jedem Anbieter vorführen statt beschreiben.
Ersetzt ein größeres Kontextfenster das Gedächtnis?
Nein. Das CueMem-Paper kam zu dem Ergebnis, dass Long-Context-Modelle nachlassen, je näher die Eingabe an die Fenstergrenze rückt, und dass sein Retrieval-Verfahren die volle Historie mit rund 10% der Eingabe-Token erreichte oder schlug. OpenAIs Beitrag zu V7 berichtet denselben Zielkonflikt aus der Produktion: Ein Graph ist um eine Größenordnung günstiger zu durchlaufen als langer Kontext.
Das Wichtigste zum Mitnehmen
Stellen Sie jedem Anbieter eine Frage: Was passiert mit allem, was der Agent über meine Kunden weiß, wenn Sie das Modell darunter austauschen? Die Forschung vom September 2026 sagt, die ehrlichen Antworten lauten entweder „wir behalten die Rohhistorie und leiten neu ab“ oder „ein Teil davon verschlechtert sich, und wir können ihn nicht vollständig reparieren“. Eine dritte Antwort, die die Benchmarks übersteht, gibt es nicht.
Wenn Sie sehen wollen, wie ein Setup mit gemeinsamem Gehirn das über DMs, Web-Chat und Anrufe hinweg löst, buchen Sie eine 30-minütige Demo und bringen Sie Ihre schwierigste Frage zur Gesprächskontinuität mit.
Quellen, Stand 23. September 2026: DolphinBench (Mem0, 22. Sep. 2026; Paper); Does Your Agent's Memory Survive a Model Upgrade? (Goyal und Ray, 4. Sep. 2026); CueMem (11. Sep. 2026); Agent Memory Challenge Zyklus 2 (CSIG, gestartet am 20. Sep. 2026); How V7 gives AI agents institutional memory (OpenAI, 21. Sep. 2026); MemoryOS; MemOS; ReMe. Modellversionen und Rankings verändern sich monatlich; deshalb sind die Zahlen datiert.