AI News · industry
Η μνήμη των AI agents το 2026: τι δείχνουν τα νέα benchmarks
Τρεις δοκιμές του Σεπτεμβρίου 2026 μέτρησαν τι θυμούνται πραγματικά οι agents. Το καλύτερο σκορ ήταν 70.67%, οι συμπιεσμένες σημειώσεις κατέρρευσαν σε μια αλλαγή μοντέλου, και η μνήμη κόστισε κάποιες φορές περισσότερο από τον ίδιο τον agent.

Η μνήμη των AI agents είναι το επίπεδο που επιτρέπει σε έναν agent να χρησιμοποιήσει κάτι που του είπε ένας πελάτης πριν από εβδομάδες, και από τον Σεπτέμβριο του 2026 είναι μετρήσιμα ημιτελής. Στο DolphinBench, που κυκλοφόρησε στις 22 Σεπτεμβρίου 2026, η διαμόρφωση με την υψηλότερη βαθμολογία ολοκλήρωσε το 70.67% των 600 εργασιών που εξαρτώνται από τη μνήμη. Σχεδόν το ένα τρίτο απέτυχε. Μια ξεχωριστή ελεγχόμενη μελέτη, Does Your Agent's Memory Survive a Model Upgrade?, που δημοσιεύτηκε στις 4 Σεπτεμβρίου, διαπίστωσε ότι όταν μια αποθήκη μνήμης φτιαγμένη από ένα μοντέλο δόθηκε σε ένα άλλο, η ακρίβεια μετακινήθηκε έως και 13.28 ποσοστιαίες μονάδες προς τη λάθος κατεύθυνση, χωρίς να αγγίξει κανείς τα αποθηκευμένα δεδομένα.
Τρία πράγματα έπεσαν στο τραπέζι τον Σεπτέμβριο και αξίζουν την προσοχή σας αν τρέχετε AI που μιλά σε πελάτες: ένα benchmark που βαθμολογεί τη μνήμη με βάση τις ενέργειες αντί για απαντήσεις σε κουίζ, μια μελέτη για το αν η μνήμη επιβιώνει μιας αναβάθμισης μοντέλου, και ένας διαγωνισμός με έδρα την Κίνα που βάζει κάθε σύστημα μνήμης κάτω από τους ίδιους κανόνες. Δείτε τι μέτρησε το καθένα, και τι αλλάζει.
Τι είναι η μνήμη των AI agents, και σε τι διαφέρει από ένα παράθυρο συμφραζομένων;
Το παράθυρο συμφραζομένων είναι ο χώρος εργασίας που έχει ένα μοντέλο κατά τη διάρκεια μιας εκτέλεσης. Αδειάζει όταν η εκτέλεση τελειώνει. Η μνήμη του agent είναι διαρκής κατάσταση: τι καταγράφεται μετά από μια συνομιλία, και τι ανακτάται πριν από την επόμενη.
Η διάκριση έχει σημασία επειδή ο κλάδος επιμένει να λύνει τη μνήμη μεγαλώνοντας το παράθυρο. Τα στοιχεία λένε ότι αυτό από μόνο του δεν δουλεύει. Η εργασία CueMem (11 Σεπτεμβρίου 2026), από τη Mashang Consumer Finance και το Harbin Institute of Technology στο Shenzhen, διαπίστωσε ότι η τροφοδότηση ολόκληρου του ιστορικού διαλόγου στο μοντέλο υποβαθμίζεται καθώς η είσοδος πλησιάζει το όριο των συμφραζομένων, ένα φαινόμενο που οι συγγραφείς αποδίδουν εν μέρει στα άσχετα συμφραζόμενα και στο πρόβλημα lost-in-the-middle. Η προσέγγιση ανάκτησης που χρησιμοποίησαν κατανάλωσε περίπου το 10% των tokens εισόδου σε σχέση με τη ρύθμιση πλήρους ιστορικού στο benchmark LoCoMo, και παρ' όλα αυτά σημείωσε υψηλότερη βαθμολογία.
Η ανάλυση της OpenAI στις 21 Σεπτεμβρίου για το V7, που χτίζει συμφραζόμενα για agents σε ομάδες χρηματοοικονομικών και ασφαλίσεων, λέει το ίδιο πράγμα από την παραγωγή: ο γράφος του V7 είναι «κατά μία τάξη μεγέθους φθηνότερος και ταχύτερος στη διάσχιση από τις προσεγγίσεις μεγάλων συμφραζομένων», με τις πρόσφατες ανταλλαγές να μένουν στα ενεργά συμφραζόμενα και το παλαιότερο υλικό να παραμένει στον γράφο μέχρι κάτι να το ζητήσει.
Άρα η μνήμη δεν είναι ένα μεγαλύτερο παράθυρο. Είναι μια απόφαση για το τι θα καταγραφεί, και τι θα κρατηθεί.
Γιατί άλλαξαν τα benchmarks τον Σεπτέμβριο του 2026;
Μέχρι τώρα, τα περισσότερα benchmarks μνήμης έκαναν ερωτήσεις. Αυτό κολακεύει τα συστήματα που δοκιμάζονται.
Το επιχείρημα του DolphinBench είναι ωμό. Ρωτήστε έναν agent «ποια πλατφόρμα μηνυμάτων χρησιμοποιεί η ομάδα;» και του έχετε ήδη πει ότι υπάρχει κάπου ένα δεδομένο για πλατφόρμα και ότι το θέλετε. Το πιο δύσκολο βήμα, το να καταλάβει ότι χρειάζεται καν ανάκτηση, έχει γίνει στη θέση του. Έτσι το DolphinBench αφαιρεί την ερώτηση. Δίνει στον agent τρία προσομοιωμένα ιστορικά εργαζομένων γνώσης (περίπου 500,000 tokens το καθένα, 13,539 μηνύματα που καλύπτουν το διάστημα από το 2023 ως το 2027), και μετά ρίχνει 600 εργασίες πάνω σε προσομοιωμένες εφαρμογές όπως Notion, Gmail, GitHub και Discord, όπου μια λάθος ενέργεια αφήνει ίχνος που ο βαθμολογητής μπορεί να δει.
Ένα παράδειγμα από την πράξη: ένας CEO διατυπώνει έναν κανόνα για τα κανάλια μία μόνο φορά, τον Απρίλιο του 2023, ότι οι σημειώσεις έκδοσης πάνε στο #eng-releases μέχρι ένα deploy να βγει πράσινο. Τίποτα δεν τον επαναλαμβάνει. Τρεισήμισι χρόνια αργότερα, θαμμένο μέσα σε ένα ιστορικό 3,400 μηνυμάτων, φτάνει ένα αίτημα να δημοσιευτεί μια ενημέρωση κυκλοφορίας, και δεν κατονομάζεται κανάλι. Δημοσιεύεις στο λάθος κανάλι, αποτυγχάνεις. Δεν αρκεί να ξέρει το δεδομένο: ο agent πρέπει να το εφαρμόσει χωρίς να του το ζητήσει κανείς.
Κάθε δοκιμή πιστοποιείται επίσης ως επιλύσιμη: πρέπει να περνά όταν δίνεται το σχετικό ιστορικό και να αποτυγχάνει όταν αυτό αποκρύπτεται. Αυτός ο κανόνας εξουδετερώνει τη συνηθισμένη ένσταση για τα συνθετικά benchmarks, δηλαδή ότι κανείς δεν ξέρει αν μια δοκιμή που απέτυχε ήταν ποτέ απαντήσιμη.
Ποια συστήματα μνήμης απέδωσαν καλύτερα, και τι κόστισαν;
Ακολουθούν τα δημοσιευμένα αποτελέσματα του DolphinBench για το harness Hermes με GPT-5.6 Luna, όπως ίσχυαν στις 22 Σεπτεμβρίου 2026. Η ακρίβεια είναι το ποσοστό των 600 εργασιών που ολοκληρώθηκαν. Οι στήλες κόστους είναι τα δημοσιευμένα κόστη εκτέλεσης του ίδιου του benchmark για όλη τη σουίτα, σε δολάρια ΗΠΑ, χρήσιμα ως αναλογία μεταξύ συστημάτων στην ίδια δοκιμή και όχι ως τιμή που θα πληρώνατε εσείς.
| Σύστημα μνήμης | Ακρίβεια | Κόστος εκτέλεσης agent | Κόστος εκτέλεσης μνήμης | Διάμεση καθυστέρηση |
|---|---|---|---|---|
| Mem0 | 70.67% | 61.54 | 34.68 | 37.69s |
| Hindsight | 69.50% | 57.99 | 26.66 | 55.31s |
| Honcho | 68.50% | 96.56 | 46.30 | 44.66s |
| Ενσωματωμένη μνήμη του μοντέλου | 65.67% | 61.48 | 0.00 | 44.35s |
| Supermemory | 59.17% | 63.86 | 281.79 | 52.68s |
Δύο ευρήματα αξίζουν περισσότερη προσοχή από τον νικητή.
Το επίπεδο μνήμης μπορεί να κοστίζει περισσότερο από τον agent. Η δαπάνη μνήμης της Supermemory σε αυτή την εκτέλεση ήταν περίπου τεσσεράμισι φορές η δαπάνη του agent της, και τερμάτισε τελευταία στην ακρίβεια. Όποιος προμηθευτής σας δίνει νούμερο ακρίβειας χωρίς νούμερο κόστους, σας δείχνει το μισό αποτέλεσμα. Η θέση του DolphinBench είναι ότι το κόστος και η καθυστέρηση ανήκουν στην ίδια γραμμή με την ακρίβεια, γι' αυτό και το ονομάζουν μέτωπο Pareto αντί για κατάταξη.
Το πόσο βοηθά η μνήμη εξαρτάται πολύ από το μοντέλο που βρίσκεται από κάτω. Με το GPT-5.6 Luna, ένα αποκλειστικό επίπεδο μνήμης πρόσθεσε περίπου πέντε μονάδες πάνω από την ενσωματωμένη μνήμη του μοντέλου (70.67% έναντι 65.67%). Βάλτε στη θέση του το MiniMax M3, το κινεζικό μοντέλο ανοιχτών βαρών, και η ενσωματωμένη μνήμη κατέρρευσε στο 26.50% ενώ το Mem0 έφτασε το 47.83%, διαφορά πάνω από είκοσι μονάδες. Όσο πιο αδύναμος είναι ο εγγενής χειρισμός μακρού ιστορικού από το μοντέλο, τόσο περισσότερο σηκώνει το εξωτερικό επίπεδο μνήμης. Αν τρέχετε μοντέλο ανοιχτών βαρών για να συγκρατήσετε το κόστος, αυτό είναι το εύρημα πάνω στο οποίο πρέπει να δράσετε.
Επιβιώνει η μνήμη ενός agent μετά από αναβάθμιση μοντέλου;
Συνήθως όχι, και αυτό είναι το εύρημα που οι περισσότερες ομάδες δεν έχουν υπολογίσει.
Η μελέτη φορητότητας που αναφέρθηκε παραπάνω πέρασε 48 συνθετικά ιστορικά μέσα από τέσσερις σχεδιασμούς μνήμης, και μετά άλλαξε το μοντέλο που είχε γράψει τη μνήμη. Αποτελέσματα ανά σχεδιασμό:
- Γράφος γνώσης με σταθερό σχήμα: η ακρίβεια άλλαξε κατά +0.0004 μονάδες. Ουσιαστικά άτρωτος.
- Συμπιεσμένες σημειώσεις σε φυσική γλώσσα: η ακρίβεια μετατοπίστηκε κατά +9.91 ή −13.28 μονάδες ανάλογα με την κατεύθυνση της μετάβασης. Ίδιες σημειώσεις, άλλος αναγνώστης, άλλη απάντηση.
- RAG με μισοτελειωμένη μετάβαση του ευρετηρίου ενσωματώσεων: ένα μεικτό ευρετήριο 50/50 συγκράτησε μόνο 4.96 από τις 11.90 μονάδες κέρδους που ήταν διαθέσιμες αν ενσωματώνατε ξανά τα πάντα. Η μισή μετάβαση σας αγοράζει αρκετά λιγότερο από το μισό όφελος.
Το αποτέλεσμα της επιδιόρθωσης είναι αυτό που πρέπει να θυμάστε. Όταν οι συμπιεσμένες σημειώσεις πήγαν στραβά, η διόρθωσή τους μόνο από την αποθήκη απέτυχε να πιάσει τον στόχο ανάκτησης 90% και στις 48 περιπτώσεις. Η διατήρηση του ακατέργαστου ιστορικού πηγής ανέκτησε 34 από τις 48. Αν πετάξετε τις αρχικές συνομιλίες και κρατήσετε μόνο την περίληψη, έχετε πετάξει και τη δυνατότητα να διορθώσετε την περίληψη.
Αυτό συνδέεται απευθείας με κάτι που υποστηρίξαμε στο γιατί δεν πρέπει να χτίσετε την επιχείρησή σας πάνω σε ένα μόνο μοντέλο AI: τα μοντέλα αποσύρονται σε ρολόι 12 έως 18 μηνών. Αυτό που προσθέτει η συγκεκριμένη μελέτη είναι ότι το να είσαι ανεξάρτητος από μοντέλο δεν αφορά μόνο την αλλαγή ενός API. Η συσσωρευμένη μνήμη σας είναι δεμένη με το μοντέλο που την έγραψε, και κανείς δεν σας στέλνει ειδοποίηση μετάβασης.
Ποιος χτίζει μνήμη για agents, και πού;
Το πεδίο είναι πραγματικά μοιρασμένο ανάμεσα σε ΗΠΑ και Κίνα, και ανάμεσα σε ανοιχτό και κλειστό, με τρόπο που η περισσότερη αγγλόφωνη κάλυψη προσπερνά.
| Σύστημα | Προέλευση | Άδεια | Τι είναι |
|---|---|---|---|
| Mem0 | ΗΠΑ | Ανοιχτός πυρήνας + διαχειριζόμενη υπηρεσία | Επίπεδο μνήμης άμεσης ενσωμάτωσης· δημιούργησε το DolphinBench |
| Letta (πρώην MemGPT) | ΗΠΑ | Apache 2.0 | Διακομιστής agent με κατάσταση και ρητά μπλοκ μνήμης |
| Honcho, Hindsight, Supermemory | ΗΠΑ | Εμπορικά | Διαχειριζόμενα API μνήμης, βαθμολογημένα στην κατάταξη του DolphinBench |
| ReMe | Κίνα (Alibaba Tongyi Lab) | Ανοιχτού κώδικα | Κιτ μνήμης στο stack του AgentScope, με βάση αρχεία και διανύσματα |
| MemoryOS | Κίνα (Beijing Univ. of Posts and Telecommunications) | Apache 2.0 | Ιεραρχικό λειτουργικό σύστημα μνήμης· η ομάδα αναφέρει μέση βελτίωση F1 κατά 49.11% στο LoCoMo |
| MemOS | Κίνα | Ερευνητικό | Αντιμετωπίζει τη μνήμη ως πόρο συστήματος που μπορεί να δρομολογηθεί σε επίπεδο απλού κειμένου, ενεργοποιήσεων και παραμέτρων |
Το καθαρότερο σημάδι για το πού οδεύει αυτό είναι ο δεύτερος κύκλος του Agent Memory Challenge, που άνοιξε στις 20 Σεπτεμβρίου 2026. Τον φιλοξενεί η China Society of Image and Graphics και τον διοργανώνει μαζί με το Πανεπιστήμιο του Nanjing, το Πανεπιστήμιο Zhejiang και τη Datawhale. Η κλίμακα είναι σοβαρή: πάνω από 6,000 περιπτώσεις αξιολόγησης και περίπου 300 εκατομμύρια tokens μόνο στο κειμενικό σκέλος, συν ξεχωριστά σκέλη για κώδικα και πολυτροπικά δεδομένα. Το έπαθλο είναι ¥150,000, και προορίζεται αποκλειστικά για μεθόδους ανοιχτού κώδικα. Τα εμπορικά προϊόντα μπορούν να συμμετάσχουν και να βαθμολογηθούν, αλλά τρέχουν σε δική τους κατάταξη και δεν κερδίζουν τίποτα.
Διαβάστε προσεκτικά αυτή τη σχεδιαστική επιλογή. Όσοι θέτουν τους κανόνες επιβραβεύουν τα ανοιχτά συστήματα, κρατώντας ταυτόχρονα τα κλειστά προϊόντα στα ίδια στοιχεία σε ξεχωριστό πίνακα. Οι αξιολογήσεις κλείνουν στις 4 Νοεμβρίου, τα αποτελέσματα βγαίνουν στα μέσα Νοεμβρίου.
Μία από τις κειμενικές διαστάσεις του διαγωνισμού είναι αυτή που κανείς δεν διαφημίζει: η διακυβέρνηση της μνήμης, δηλαδή ενημερώσεις, επίλυση συγκρούσεων, διαγραφή και λήθη. Μια άλλη είναι η γνωσιακή ασφάλεια και η ιδιωτικότητα, που βαθμολογείται στην αποχή και στην ελάχιστη αποκάλυψη. Αυτά μετράνε περισσότερο από όλα για μια ρυθμιζόμενη επιχείρηση, και μέχρι φέτος σχεδόν τίποτα δεν τα μετρούσε.
Τι σημαίνουν όλα αυτά για μια επιχείρηση που τρέχει AI πάνω σε συνομιλίες πελατών;
Πέντε συμπεράσματα, βγαλμένα από τα παραπάνω αποτελέσματα και όχι από παρουσιάσεις προμηθευτών.
- Κρατήστε τις ακατέργαστες συνομιλίες, όχι μόνο την περίληψη. Η επιδιόρθωση μόνο από την αποθήκη απέτυχε και στις 48 περιπτώσεις· η διατήρηση του ιστορικού πηγής ανέκτησε 34. Μια περίληψη είναι cache, όχι σύστημα καταγραφής.
- Ζητήστε ακρίβεια και κόστος μαζί. Ένα επίπεδο μνήμης που πολλαπλασιάζει το κόστος σας και χάνει σε ακρίβεια είναι μετρημένο αποτέλεσμα, όχι υπόθεση.
- Δοκιμάστε τη μνήμη με ενέργειες, όχι με ανάκληση. Εφαρμόζει ο agent την προτίμηση που δήλωσε ο πελάτης σας τον Μάρτιο, χωρίς να του τη θυμίσει κανείς;
- Σχεδιάστε τη μετάβαση πριν τη χρειαστείτε. Τα μισοτελειωμένα ευρετήρια ενσωματώσεων υποαποδίδουν άσχημα. Αποφασίστε από την αρχή αν μια αλλαγή μοντέλου σημαίνει πλήρη εκ νέου ενσωμάτωση.
- Ελέγξτε ότι η διαγραφή φτάνει και στην παραγόμενη μνήμη, όχι μόνο στην εγγραφή της επαφής, και ζητήστε από τον προμηθευτή σας να σας το επιδείξει αντί να σας το περιγράψει.
Πού στέκεται η Entagl σε όλο αυτό
Η Entagl τρέχει έναν εγκέφαλο agent για όλα τα κανάλια αντί για ξεχωριστό bot ανά κανάλι, και ο φωνητικός agent Coordinator διαβάζει μια περίληψη των προηγούμενων συνομιλιών του πελάτη πριν καλέσει, αντί να ξεκινά από το μηδέν. Η επιχειρηματική γνώση (υπηρεσίες, προϊόντα, συχνές ερωτήσεις, ωράρια, πολιτικές) βρίσκεται σε μια αναζητήσιμη βάση γνώσης που ρωτούν οι agents, κάτι που μοιάζει πιο πολύ με την προσέγγιση σταθερού σχήματος η οποία επιβίωσε της αλλαγής μοντέλου στη μελέτη φορητότητας, παρά με σημειώσεις ελεύθερου κειμένου.
Η μεταφορά περιεχομένου από ένα νήμα WhatsApp στο νήμα Instagram του ίδιου πελάτη είναι ξεχωριστό επίπεδο διακαναλικής μνήμης, και βρίσκεται σε σταδιακή κυκλοφορία, δεν είναι ολοκληρωμένο. Γράφει μια δομημένη περίληψη ανά συνομιλία (τι έχει απαντηθεί, τι εκκρεμεί, τι υποσχέθηκε) κρατώντας παράλληλα τα αρχικά μηνύματα. Παραμένει ανενεργό μέχρι η κυκλοφορία να φτάσει σε έναν χώρο εργασίας, ο ιδιοκτήτης μπορεί να το απενεργοποιήσει όποτε θέλει, απαιτεί επαληθευμένη σύνδεση ταυτότητας πριν αποκαλύψει οτιδήποτε (δεν αρκεί ένας πελάτης να ισχυριστεί απλώς ότι του ανήκει κάποιο handle), η παραγόμενη μνήμη σβήνεται όταν διαγράφεται μια επαφή, και η αποθηκευμένη μνήμη λήγει σε σταθερό παράθυρο διατήρησης.
Στη διακυβέρνηση, η αρχή είναι αυτή που θέσαμε στο τι νέο υπάρχει στους AI agents το 2026: πρωτόκολλα και μηχανισμοί ασφαλείας: το AI ενεργεί, οι άνθρωποι κυβερνούν. Για τη λίστα ελέγχου από την πλευρά του αγοραστή σχετικά με συνδεδεμένες εγγραφές πελατών σε όλα τα κανάλια, δείτε διακαναλικές συνομιλίες πελατών χωρίς τη σύγχυση.
Τι δεν αποδεικνύουν αυτά τα αποτελέσματα
Αξίζει να μιλήσουμε ανοιχτά για τα όρια.
Το DolphinBench χρησιμοποιεί συνθετικά προφίλ και προσομοιωμένες εφαρμογές, οπότε η οροφή του 70.67% αφορά συγκεκριμένα εκείνο το σύνολο εργασιών και εκείνα τα harnesses. Η μελέτη φορητότητας έτρεξε σε δύο μοντέλα ανοιχτών βαρών κάτω από 10 δισεκατομμύρια παραμέτρους, οπότε οι ακριβείς διακυμάνσεις της δεν θα μεταφερθούν σε ένα μοντέλο αιχμής. Το Agent Memory Challenge δεν έχει δημοσιεύσει ακόμα αποτελέσματα δεύτερου κύκλου· αυτό που έχουμε είναι το πρωτόκολλό του. Και η Mem0 δημιούργησε το benchmark στο οποίο βρίσκεται πρώτη, κάτι που δηλώνεται ανοιχτά και είναι σύνηθες εδώ, αλλά αποτελεί λόγο να θέλουμε ανεξάρτητη επαλήθευση πριν θεωρήσουμε το 70.67% δεδομένο.
Τίποτα από αυτά δεν αλλάζει την κατεύθυνση. Η μνήμη μετριέται σωστά για πρώτη φορά, και οι μετρήσεις είναι λιγότερο κολακευτικές από το μάρκετινγκ.
FAQ
Ποια είναι η διαφορά ανάμεσα στη μνήμη AI agent και στο RAG;
Το RAG ανακτά από ένα σώμα εγγράφων για να απαντήσει σε μια ερώτηση. Η μνήμη agent διαχειρίζεται εξελισσόμενη κατάσταση για έναν συγκεκριμένο χρήστη ή λογαριασμό σε όλες τις συνεδρίες: τι άλλαξε, τι αντικαταστάθηκε, τι υποσχέθηκε, τι πρέπει να ξεχαστεί. Το RAG είναι συχνά ένα συστατικό μέσα σε ένα σύστημα μνήμης, αλλά ένα σύστημα μνήμης πρέπει επίσης να χειρίζεται ενημερώσεις, συγκρούσεις και διαγραφές, κάτι που ένα ευρετήριο εγγράφων δεν κάνει.
Πόσο ακριβής είναι η μνήμη των AI agents το 2026;
Στο DolphinBench, το benchmark με βάση τις ενέργειες που δημοσιεύτηκε στις 22 Σεπτεμβρίου 2026, η κορυφαία διαμόρφωση ολοκλήρωσε το 70.67% των 600 εργασιών που εξαρτώνται από τη μνήμη. Τα αποτελέσματα διέφεραν πολύ ανάλογα με το υποκείμενο μοντέλο: με το MiniMax M3 ανοιχτών βαρών, η ενσωματωμένη μνήμη του μοντέλου σημείωσε 26.50% ενώ ένα αποκλειστικό επίπεδο μνήμης έφτασε το 47.83%.
Ξεχνά ένας AI agent όταν αλλάζετε το μοντέλο;
Μπορεί, χωρίς να διαγραφεί κανένα δεδομένο. Η μελέτη φορητότητας μνήμης του Σεπτεμβρίου 2026 διαπίστωσε ότι οι συμπιεσμένες σημειώσεις σε φυσική γλώσσα μετατόπισαν την ακρίβεια έως και 13.28 ποσοστιαίες μονάδες μετά από μια αλλαγή μοντέλου, ενώ ένας γράφος γνώσης με σταθερό σχήμα έμεινε ουσιαστικά ανεπηρέαστος. Ο τρόπος με τον οποίο αποθηκεύετε τη μνήμη καθορίζει αν αυτή επιβιώνει.
Μπορεί ένας πελάτης να ζητήσει από ένα σύστημα AI να διαγράψει όσα θυμάται;
Μπορεί, και πρέπει να μπορεί, αλλά η διαγραφή πρέπει να φτάνει και στην παραγόμενη μνήμη, όχι μόνο στα αρχικά μηνύματα. Αυτό είναι πλέον ρητά βαθμολογούμενη διάσταση στο κειμενικό σκέλος του Agent Memory Challenge, μαζί με τις ενημερώσεις, την επίλυση συγκρούσεων και τη λήθη. Ζητήστε από κάθε προμηθευτή να σας το επιδείξει αντί να σας το περιγράψει.
Υποκαθιστά ένα μεγαλύτερο παράθυρο συμφραζομένων τη μνήμη;
Όχι. Η εργασία CueMem διαπίστωσε ότι τα μοντέλα μεγάλων συμφραζομένων υποβαθμίζονται καθώς η είσοδος πλησιάζει το όριο του παραθύρου, και η μέθοδος ανάκτησής της έπιασε ή ξεπέρασε το πλήρες ιστορικό με περίπου το 10% των tokens εισόδου. Η ανάλυση της OpenAI για το V7 αναφέρει τον ίδιο συμβιβασμό στην παραγωγή, όπου ένας γράφος είναι κατά μία τάξη μεγέθους φθηνότερος στη διάσχιση από τα μεγάλα συμφραζόμενα.
Το ένα πράγμα που πρέπει να κρατήσετε
Κάντε σε κάθε προμηθευτή μία ερώτηση: τι γίνεται με όλα όσα ξέρει ο agent για τους πελάτες μου όταν αλλάζετε το μοντέλο από κάτω; Η έρευνα του Σεπτεμβρίου 2026 λέει ότι οι ειλικρινείς απαντήσεις είναι είτε «κρατάμε το ακατέργαστο ιστορικό και το παράγουμε ξανά» είτε «ένα μέρος του υποβαθμίζεται και δεν μπορούμε να το επιδιορθώσουμε πλήρως». Δεν υπάρχει τρίτη απάντηση που να αντέχει στα benchmarks.
Για να δείτε πώς μια διάταξη με κοινό εγκέφαλο τα καταφέρνει σε DMs, web chat και κλήσεις, κλείστε ένα demo 30 λεπτών και φέρτε την πιο δύσκολη ερώτησή σας για τη συνέχεια.
Πηγές, όπως ίσχυαν στις 23 Σεπτεμβρίου 2026: DolphinBench (Mem0, 22 Σεπ 2026· εργασία)· Does Your Agent's Memory Survive a Model Upgrade? (Goyal και Ray, 4 Σεπ 2026)· CueMem (11 Σεπ 2026)· Agent Memory Challenge κύκλος 2 (CSIG, άνοιξε 20 Σεπ 2026)· How V7 gives AI agents institutional memory (OpenAI, 21 Σεπ 2026)· MemoryOS· MemOS· ReMe. Οι εκδόσεις των μοντέλων και οι κατατάξεις αλλάζουν κάθε μήνα· γι' αυτό τα νούμερα φέρουν ημερομηνία.