AI News · industry
La memoria degli AI agent nel 2026: cosa dicono i nuovi benchmark
Tre test di settembre 2026 hanno misurato cosa ricordano davvero gli agenti. Il punteggio migliore è stato 70.67%, le note compresse si sono rotte al cambio di modello e a volte la memoria è costata più dell'agente stesso.

La memoria degli AI agent è il livello che permette a un agente di usare qualcosa che un cliente gli ha detto settimane prima, e a settembre 2026 è misurabilmente incompiuta. Su DolphinBench, pubblicato il 22 settembre 2026, la configurazione con il punteggio più alto ha completato il 70.67% di 600 compiti che dipendono dalla memoria. Quasi un terzo è fallito. Uno studio controllato separato, Does Your Agent's Memory Survive a Model Upgrade?, pubblicato il 4 settembre, ha rilevato che, quando un archivio di memoria costruito da un modello veniva passato a un altro, l'accuratezza si spostava fino a 13.28 punti percentuali nella direzione sbagliata, senza che nessuno toccasse i dati memorizzati.
A settembre sono arrivate tre cose che meritano la tua attenzione se gestisci un'AI che parla con i clienti: un benchmark che valuta la memoria in base alle azioni invece che alle risposte di un quiz, uno studio su quanto la memoria sopravvive a un aggiornamento del modello e una sfida ospitata in Cina che mette ogni sistema di memoria sotto un unico regolamento. Ecco cosa ha misurato ciascuna, e cosa cambia.
Che cos'è la memoria degli AI agent, e in cosa è diversa da una finestra di contesto?
Una finestra di contesto è lo spazio di lavoro che un modello ha durante una singola esecuzione. Si svuota quando l'esecuzione finisce. La memoria dell'agente è stato durevole: quello che viene annotato dopo una conversazione, e recuperato prima di quella successiva.
La distinzione conta perché il settore continua a provare a risolvere la memoria ingrandendo la finestra. Le prove dicono che da solo non basta. Il paper su CueMem (11 settembre 2026), di Mashang Consumer Finance e dell'Harbin Institute of Technology di Shenzhen, ha rilevato che dare in pasto al modello un'intera cronologia di dialogo peggiora le prestazioni man mano che l'input si avvicina al limite di contesto, un effetto che gli autori attribuiscono in parte al contesto irrilevante e al problema del lost-in-the-middle. Il loro approccio basato sul recupero ha usato circa il 10% dei token di input rispetto all'impostazione con cronologia completa sul benchmark LoCoMo, e ha comunque ottenuto un punteggio più alto.
Il resoconto di OpenAI del 21 settembre su V7, che costruisce il contesto degli agenti per i team di finanza e assicurazioni, dice la stessa cosa partendo dalla produzione: il grafo di V7 è "di un ordine di grandezza più economico e veloce da attraversare rispetto agli approcci long-context", con gli scambi recenti tenuti nel contesto attivo e il materiale più vecchio lasciato nel grafo finché qualcosa non lo richiede.
Quindi la memoria non è una finestra più grande. È una decisione su cosa annotare, e su cosa conservare.
Perché i benchmark sono cambiati a settembre 2026?
Fino a oggi, quasi tutti i benchmark sulla memoria facevano domande. Questo mette i sistemi testati in una luce troppo favorevole.
L'argomento di DolphinBench è diretto. Chiedi a un agente "quale piattaforma di messaggistica usa il team?" e gli hai già detto che esiste un fatto su una piattaforma e che lo vuoi. Il passaggio più difficile, accorgersi che serve un recupero, è già stato fatto al posto suo. Così DolphinBench elimina la domanda. Dà all'agente tre cronologie simulate di knowledge worker (circa 500,000 token ciascuna, 13,539 messaggi dal 2023 al 2027), poi lancia 600 compiti contro app simulate tra cui Notion, Gmail, GitHub e Discord, dove un'azione sbagliata lascia una traccia che chi valuta può vedere.
Un esempio concreto: un CEO enuncia una regola di canale una volta sola, nell'aprile 2023: le note di rilascio vanno in #eng-releases finché un deploy non è verde. Nessuno la ripete. Tre anni e mezzo dopo, sepolta in una cronologia di 3,400 messaggi, arriva la richiesta di pubblicare un aggiornamento di rollout, e nessun canale viene nominato. Pubblica in quello sbagliato e hai fallito. Conoscere il fatto non basta: l'agente deve applicarlo senza che glielo si chieda.
Ogni test è anche certificato risolvibile: deve passare quando la cronologia rilevante viene fornita e fallire quando viene tolta. Quella regola elimina la solita obiezione ai benchmark sintetici, cioè che nessuno sa se un test fallito fosse mai risolvibile.
Quali sistemi di memoria hanno reso meglio, e quanto sono costati?
Ecco i risultati pubblicati da DolphinBench per l'harness Hermes con GPT-5.6 Luna, al 22 settembre 2026. L'accuratezza è la percentuale dei 600 compiti completati. Le colonne dei costi sono i costi di esecuzione pubblicati dal benchmark stesso per l'intera suite, in dollari USA: servono come rapporto tra sistemi sullo stesso test, più che come prezzo che pagheresti davvero.
| Sistema di memoria | Accuratezza | Costo di esecuzione dell'agente | Costo di esecuzione della memoria | Latenza mediana |
|---|---|---|---|---|
| Mem0 | 70.67% | 61.54 | 34.68 | 37.69s |
| Hindsight | 69.50% | 57.99 | 26.66 | 55.31s |
| Honcho | 68.50% | 96.56 | 46.30 | 44.66s |
| Memoria integrata del modello | 65.67% | 61.48 | 0.00 | 44.35s |
| Supermemory | 59.17% | 63.86 | 281.79 | 52.68s |
Due risultati meritano più attenzione del vincitore.
Il livello di memoria può costare più dell'agente. In questa esecuzione la spesa di memoria di Supermemory è stata circa quattro volte e mezzo la sua spesa per l'agente, ed è arrivata ultima per accuratezza. Qualsiasi fornitore che ti presenta un numero di accuratezza senza un numero di costo ti sta mostrando metà del risultato. La posizione di DolphinBench è che costo e latenza vanno sulla stessa riga dell'accuratezza, ed è per questo che la chiamano frontiera di Pareto e non classifica.
Quanto aiuta la memoria dipende molto dal modello sottostante. Con GPT-5.6 Luna, un livello di memoria dedicato ha aggiunto circa cinque punti rispetto alla memoria integrata del modello (70.67% contro 65.67%). Metti al suo posto MiniMax M3, il modello cinese open-weights, e la memoria integrata è crollata al 26.50% mentre Mem0 ha raggiunto il 47.83%, un divario di oltre venti punti. Più debole è la gestione nativa delle cronologie lunghe da parte del modello, più peso si carica il livello di memoria esterno. Se stai usando un modello open-weights per contenere i costi, è su questo risultato che devi agire.
La memoria di un agente sopravvive a un aggiornamento del modello?
Di solito no, ed è il risultato che la maggior parte dei team non ha messo in conto.
Lo studio sulla portabilità citato sopra ha fatto passare 48 cronologie sintetiche attraverso quattro architetture di memoria, poi ha cambiato il modello che aveva scritto la memoria. Risultati per architettura:
- Knowledge graph a schema fisso: l'accuratezza è cambiata di +0.0004 punti. Di fatto immune.
- Note compresse in linguaggio naturale: l'accuratezza si è spostata di +9.91 o −13.28 punti a seconda della direzione in cui si migrava. Stesse note, lettore diverso, risposta diversa.
- RAG con un indice di embedding migrato a metà: un indice misto 50/50 ha catturato solo 4.96 degli 11.90 punti di guadagno ottenibili rifacendo gli embedding di tutto. Mezza migrazione ti porta ben meno di metà del beneficio.
Il risultato sulla riparazione è quello da ricordare. Quando le note compresse andavano storte, ripararle a partire dal solo archivio non ha raggiunto l'obiettivo di recupero del 90% in tutti e 48 i casi. Conservare la cronologia grezza di origine ne ha recuperati 34 su 48. Se butti via le conversazioni originali e tieni solo il riassunto, hai buttato via anche la possibilità di correggere il riassunto.
Questo si collega direttamente a una cosa che abbiamo sostenuto in perché non dovresti costruire la tua azienda su un solo modello AI: i modelli vengono ritirati su cicli da 12 a 18 mesi. Quello che questo studio aggiunge è che essere model-agnostic non riguarda solo il cambio di un'API. La memoria che hai accumulato è legata al modello che l'ha scritta, e nessuno ti manda un avviso di migrazione.
Chi sta costruendo la memoria degli agenti, e dove?
Il campo è davvero spaccato tra Stati Uniti e Cina, e tra aperto e chiuso, in un modo che gran parte della copertura in lingua inglese si perde.
| Sistema | Origine | Licenza | Che cos'è |
|---|---|---|---|
| Mem0 | Stati Uniti | Open core + gestito | Livello di memoria drop-in; ha scritto DolphinBench |
| Letta (ex MemGPT) | Stati Uniti | Apache 2.0 | Server di agenti con stato con blocchi di memoria espliciti |
| Honcho, Hindsight, Supermemory | Stati Uniti | Commerciale | API di memoria gestite, valutate sulla classifica DolphinBench |
| ReMe | Cina (Alibaba Tongyi Lab) | Open source | Kit di memoria nello stack AgentScope, basato su file e vettori |
| MemoryOS | Cina (Beijing Univ. of Posts and Telecommunications) | Apache 2.0 | Sistema operativo di memoria gerarchico; il team riporta un guadagno medio di F1 del 49.11% su LoCoMo |
| MemOS | Cina | Ricerca | Tratta la memoria come una risorsa di sistema schedulabile sui livelli di testo semplice, attivazione e parametri |
Il segnale più chiaro della direzione è la seconda Agent Memory Challenge, aperta il 20 settembre 2026. È ospitata dalla China Society of Image and Graphics e organizzata con Nanjing University, Zhejiang University e Datawhale. La scala è seria: oltre 6,000 istanze di valutazione e circa 300 milioni di token nel solo track testuale, più track separati per il codice e il multimodale. Il montepremi è di ¥150,000 ed è riservato ai metodi open source. I prodotti commerciali possono partecipare e farsi valutare, ma corrono su una classifica a parte e non vincono nulla.
Leggi bene questa scelta. Chi scrive le regole premia i sistemi aperti, e allo stesso tempo tiene i prodotti chiusi davanti alle stesse prove, su una classifica separata. Le valutazioni chiudono il 4 novembre, i risultati arrivano a metà novembre.
Una delle dimensioni testuali della sfida è quella che nessuno mette nel marketing: la governance della memoria, cioè aggiornamenti, risoluzione dei conflitti, cancellazione e oblio. Un'altra è la sicurezza epistemica e la privacy, valutate su astensione e divulgazione minima. Sono le cose che contano di più per un'azienda regolamentata, e fino a quest'anno quasi nulla le misurava.
Che cosa significa per un'azienda che fa girare l'AI sulle conversazioni con i clienti?
Cinque conclusioni, tratte dai risultati qui sopra e non dalle presentazioni dei fornitori.
- Conserva le conversazioni grezze, non solo il riassunto. La riparazione a partire dal solo archivio è fallita in tutti e 48 i casi; mantenere la cronologia di origine ne ha recuperati 34. Un riassunto è una cache, non un sistema di registrazione.
- Chiedi accuratezza e costo insieme. Un livello di memoria che ti moltiplica i costi e perde accuratezza è un esito misurato, non un'ipotesi.
- Testa la memoria con le azioni, non con il ricordo. L'agente applica la preferenza che il tuo cliente ha espresso a marzo, senza che nessuno gliela ricordi?
- Pianifica la migrazione prima di averne bisogno. Gli indici di embedding migrati a metà rendono molto male. Decidi in anticipo se un cambio di modello comporta un re-embedding completo.
- Verifica che la cancellazione arrivi alla memoria derivata, non solo alla scheda del contatto, e chiedi al tuo fornitore di dimostrarlo invece di descriverlo.
Dove si colloca Entagl su questo
Entagl fa girare un solo cervello dell'agente su tutti i canali, invece di un bot separato per ogni canale, e l'agente vocale Coordinator legge un riassunto delle chat precedenti del cliente prima di comporre il numero, invece di partire da zero. Le informazioni aziendali (servizi, prodotti, FAQ, orari, policy) vivono in una knowledge base ricercabile che gli agenti interrogano, ed è un approccio più vicino allo schema fisso che è sopravvissuto al cambio di modello nello studio sulla portabilità che alle note in testo libero.
Portare i contenuti di una conversazione WhatsApp nella conversazione Instagram dello stesso cliente è un livello di memoria cross-channel a parte, ed è in rollout graduale, non finito. Scrive un riassunto strutturato per ogni conversazione (a cosa è stato risposto, cosa è in sospeso, cosa è stato promesso) mantenendo i messaggi originali. Resta spento finché il rollout non raggiunge un workspace, il titolare può disattivarlo in qualsiasi momento, richiede un collegamento d'identità verificato prima di rivelare qualsiasi cosa (un cliente che si limita a dichiarare un handle non basta), la memoria derivata viene cancellata quando si elimina un contatto e la memoria conservata scade su una finestra di retention fissa.
Sulla governance, il principio è quello che abbiamo esposto in cosa c'è di nuovo negli AI agent nel 2026: protocolli e guardrail: l'AI agisce, le persone governano. Per la checklist lato acquirente sui record cliente collegati tra i canali, vedi conversazioni cross-channel con i clienti senza confusione.
Cosa questi risultati non dimostrano
Vale la pena essere chiari sui limiti.
DolphinBench usa personas sintetiche e app simulate, quindi il tetto del 70.67% vale per quell'insieme di compiti e per quegli harness. Lo studio sulla portabilità ha girato su due modelli open-weight sotto i 10 miliardi di parametri, quindi i suoi scarti esatti non si trasferiranno a un modello di frontiera. L'Agent Memory Challenge non ha ancora pubblicato i risultati del secondo ciclo: per ora abbiamo il protocollo. E Mem0 ha scritto il benchmark in cui è in testa, cosa dichiarata apertamente e normale in questo campo, ma è un motivo per volere una replica indipendente prima di dare il 70.67% per acquisito.
Niente di tutto questo cambia la direzione. La memoria viene misurata seriamente per la prima volta, e le misurazioni sono meno lusinghiere del marketing.
FAQ
Qual è la differenza tra la memoria degli AI agent e RAG?
RAG recupera da un corpus di documenti per rispondere a una domanda. La memoria dell'agente gestisce uno stato in evoluzione su un utente o un account specifico attraverso le sessioni: cosa è cambiato, cosa è stato superato, cosa è stato promesso, cosa va dimenticato. Spesso RAG è un componente dentro un sistema di memoria, ma un sistema di memoria deve anche gestire aggiornamenti, conflitti e cancellazioni, cosa che un indice di documenti non fa.
Quanto è accurata la memoria degli AI agent nel 2026?
Su DolphinBench, il benchmark basato sulle azioni pubblicato il 22 settembre 2026, la configurazione migliore ha completato il 70.67% di 600 compiti che dipendono dalla memoria. I risultati variavano molto in base al modello sottostante: con MiniMax M3, open-weights, la memoria integrata del modello ha ottenuto il 26.50% mentre un livello di memoria dedicato ha raggiunto il 47.83%.
Un AI agent dimentica quando cambi il modello?
Può succedere, senza che venga cancellato alcun dato. Lo studio di settembre 2026 sulla portabilità della memoria ha rilevato che le note compresse in linguaggio naturale hanno spostato l'accuratezza fino a 13.28 punti percentuali dopo un cambio di modello, mentre un knowledge graph a schema fisso è rimasto sostanzialmente inalterato. Il modo in cui conservi la memoria decide se sopravvive.
Un cliente può chiedere a un sistema AI di cancellare quello che ricorda?
Può farlo, e deve poterlo fare, ma la cancellazione deve arrivare anche alla memoria derivata, non solo ai messaggi originali. Oggi è una dimensione valutata esplicitamente nel track testuale dell'Agent Memory Challenge, insieme ad aggiornamenti, risoluzione dei conflitti e oblio. Chiedi a qualsiasi fornitore di dimostrarlo, invece di descriverlo.
Una finestra di contesto più grande sostituisce la memoria?
No. Il paper su CueMem ha rilevato che i modelli long-context peggiorano man mano che l'input si avvicina al limite della finestra, e il suo metodo di recupero ha eguagliato o battuto la cronologia completa usando circa il 10% dei token di input. Il resoconto di OpenAI su V7 riporta lo stesso compromesso in produzione, dove un grafo è di un ordine di grandezza più economico da attraversare rispetto al long context.
L'unica cosa da portarsi a casa
Fai a qualsiasi fornitore una sola domanda: che cosa succede a tutto quello che l'agente sa dei miei clienti quando cambi il modello che ci sta sotto? La ricerca di settembre 2026 dice che le risposte oneste sono due: "manteniamo la cronologia grezza e ri-deriviamo" oppure "una parte si degrada e non possiamo ripararla del tutto". Non c'è una terza risposta che regga davanti ai benchmark.
Per vedere come una configurazione a cervello condiviso gestisce tutto questo tra DM, chat sul sito e chiamate, prenota una demo di 30 minuti e porta la tua domanda più difficile sulla continuità.
Fonti, aggiornate al 23 settembre 2026: DolphinBench (Mem0, 22 set 2026; paper); Does Your Agent's Memory Survive a Model Upgrade? (Goyal e Ray, 4 set 2026); CueMem (11 set 2026); Agent Memory Challenge ciclo 2 (CSIG, aperta il 20 set 2026); How V7 gives AI agents institutional memory (OpenAI, 21 set 2026); MemoryOS; MemOS; ReMe. Le versioni dei modelli e le classifiche si muovono ogni mese: per questo le cifre sono datate.