İçeriğe atla

AI News · industry

2026'da Yapay Zekâ Ajan Belleği: Yeni Kıyaslamalar Ne Gösteriyor

Eylül 2026'daki üç test, ajanların gerçekte neyi hatırladığını ölçtü. En iyi skor %70,67 oldu, sıkıştırılmış notlar bir model değişiminde bozuldu ve bellek bazen ajanın kendisinden pahalıya mal oldu.

Entagl Team12 dk okuma
2026'da Yapay Zekâ Ajan Belleği: Yeni Kıyaslamalar Ne Gösteriyor

Yapay zekâ ajan belleği, bir ajanın müşterinin haftalar önce söylediği bir şeyi kullanabilmesini sağlayan katmandır ve Eylül 2026 itibarıyla ölçülebilir biçimde yarım kalmış durumda. 22 Eylül 2026'da yayımlanan DolphinBench testinde, en yüksek skoru alan yapılandırma belleğe bağlı 600 görevin %70,67'sini tamamladı. Neredeyse üçte biri başarısız oldu. 4 Eylül'de yayımlanan ayrı bir kontrollü çalışma, Does Your Agent's Memory Survive a Model Upgrade?, bir model tarafından oluşturulan bellek deposu başka bir modele devredildiğinde, kayıtlı veriye kimse dokunmadan doğruluğun 13,28 yüzde puanına varan ölçüde yanlış yöne gittiğini buldu.

Müşterilerle konuşan bir yapay zekâ işletiyorsanız, Eylül ayında dikkatinizi hak eden üç gelişme oldu: belleği test sorularına verilen yanıtlarla değil eylemlerle notlandıran bir kıyaslama, belleğin bir model yükseltmesinden sağ çıkıp çıkmadığını inceleyen bir çalışma ve bütün bellek sistemlerini tek bir kural kitabı altında toplayan, Çin'de düzenlenen bir yarışma. Her birinin neyi ölçtüğü ve neyi değiştirdiği aşağıda.

Yapay zekâ ajan belleği nedir ve bağlam penceresinden farkı ne?

Bağlam penceresi, bir modelin tek bir çalıştırma boyunca sahip olduğu çalışma alanıdır. Çalıştırma bitince boşalır. Ajan belleği ise kalıcı durumdur: bir görüşmeden sonra neyin yazıldığı ve bir sonrakinden önce neyin geri çağrıldığı.

Bu ayrım önemli, çünkü sektör belleği pencereyi büyüterek çözmeye çalışmayı sürdürüyor. Kanıtlar bunun tek başına işe yaramadığını söylüyor. Mashang Consumer Finance ile Shenzhen'deki Harbin Institute of Technology imzalı CueMem makalesi (11 Eylül 2026), diyalog geçmişinin tamamını modele vermenin, girdi bağlam sınırına yaklaştıkça performansı düşürdüğünü buldu; yazarlar bu etkiyi kısmen alakasız bağlama ve "ortada kaybolma" sorununa bağlıyor. Kullandıkları getirme yaklaşımı, LoCoMo kıyaslamasında tam geçmiş kurgusunun girdi token'larının kabaca %10'unu kullandı ve yine de daha yüksek puan aldı.

OpenAI'ın finans ve sigorta ekipleri için ajan bağlamı kuran V7 hakkındaki 21 Eylül tarihli yazısı, aynı şeyi üretim tarafından söylüyor: V7'nin grafiği "uzun bağlam yaklaşımlarına kıyasla bir büyüklük mertebesi daha ucuz ve daha hızlı taranıyor"; yakın tarihli yazışmalar aktif bağlamda tutuluyor, daha eski malzeme ise bir şey onu isteyene kadar grafikte bırakılıyor.

Yani bellek daha büyük bir pencere değil. Neyin yazılacağına ve neyin saklanacağına dair bir karar.

Kıyaslamalar Eylül 2026'da neden değişti?

Şimdiye kadar bellek kıyaslamalarının çoğu soru soruyordu. Bu da test edilen sistemleri olduğundan iyi gösteriyor.

DolphinBench'in iddiası dobra. Bir ajana "ekip hangi mesajlaşma platformunu kullanıyor?" diye sorduğunuzda, ona hem platformla ilgili bir bilginin var olduğunu hem de bunu istediğinizi çoktan söylemiş olursunuz. En zor adım, yani belleğe başvurmak gerektiğini fark etmek, onun yerine yapılmıştır. Bu yüzden DolphinBench soruyu ortadan kaldırıyor. Ajana, simüle edilmiş üç bilgi çalışanı geçmişi veriyor (her biri yaklaşık 500.000 token, 2023'ten 2027'ye uzanan 13.539 mesaj), ardından Notion, Gmail, GitHub ve Discord'un da aralarında olduğu simüle edilmiş uygulamalar üzerinde 600 görev açıyor; burada yanlış bir eylem, değerlendiricinin görebileceği bir iz bırakıyor.

İşlenmiş bir örnek: bir CEO, Nisan 2023'te bir kez, sürüm notlarının dağıtım yeşile dönene kadar #eng-releases kanalına gireceği kuralını söylüyor. Bunu tekrarlayan olmuyor. Üç buçuk yıl sonra, 3.400 mesajlık bir geçmişin içine gömülü hâlde, bir dağıtım güncellemesi paylaşma isteği geliyor ve hiçbir kanal adı verilmiyor. Yanlış kanala yazarsanız kalırsınız. Bilgiyi bilmek yetmiyor; ajanın onu kendiliğinden uygulaması gerekiyor.

Her testin ayrıca çözülebilir olduğu onaylanıyor: ilgili geçmiş verildiğinde geçmeli, esirgendiğinde kalmalı. Bu kural, sentetik kıyaslamalara yöneltilen klasik itirazı, yani başarısız olan bir testin en baştan yanıtlanabilir olup olmadığını kimsenin bilmemesi itirazını ortadan kaldırıyor.

Hangi bellek sistemleri en iyi sonucu verdi ve maliyetleri neydi?

Aşağıda, 22 Eylül 2026 itibarıyla GPT-5.6 Luna üzerinde çalışan Hermes çalıştırma ortamı için DolphinBench'in yayımladığı sonuçlar var. Doğruluk, tamamlanan 600 görevin yüzdesi. Maliyet sütunları, kıyaslamanın paketin tamamı için kendi yayımladığı çalıştırma maliyetleri (ABD doları cinsinden); ödeyeceğiniz bir fiyat olarak değil, aynı testteki sistemler arasında bir oran olarak işe yarıyorlar.

Bellek sistemi Doğruluk Ajan çalıştırma maliyeti Bellek çalıştırma maliyeti Medyan gecikme
Mem0 %70,67 61.54 34.68 37.69 sn
Hindsight %69,50 57.99 26.66 55.31 sn
Honcho %68,50 96.56 46.30 44.66 sn
Modelin yerleşik belleği %65,67 61.48 0.00 44.35 sn
Supermemory %59,17 63.86 281.79 52.68 sn

Kazanandan daha fazla ilgiyi hak eden iki bulgu var.

Bellek katmanı ajandan pahalıya gelebilir. Supermemory'nin bu çalıştırmadaki bellek harcaması, ajan harcamasının kabaca dört buçuk katıydı ve doğrulukta sonuncu oldu. Size maliyet rakamı vermeden doğruluk rakamı sunan bir tedarikçi, sonucun yarısını gösteriyor demektir. DolphinBench'in duruşu, maliyet ve gecikmenin doğrulukla aynı satırda durması gerektiği yönünde; buna liderlik tablosu değil de Pareto sınırı demelerinin nedeni bu.

Belleğin ne kadar fayda sağladığı, altındaki modele fazlasıyla bağlı. GPT-5.6 Luna ile özel bir bellek katmanı, modelin yerleşik belleğinin üzerine yaklaşık beş puan ekledi (%70,67'ye karşı %65,67). Yerine açık ağırlıklı Çin modeli MiniMax M3'ü koyun, yerleşik bellek %26,50'ye çöküyor, Mem0 ise %47,83'e ulaşıyor, yani yirmi puanı aşan bir fark. Model uzun geçmişi kendi başına ne kadar kötü idare ediyorsa, dış bellek katmanı o kadar çok yükü taşıyor. Maliyeti kontrol etmek için açık ağırlıklı bir model çalıştırıyorsanız, harekete geçmeniz gereken bulgu bu.

Ajan belleği bir model yükseltmesinden sağ çıkar mı?

Genelde çıkmıyor ve bu, ekiplerin çoğunun hesabına katmadığı bulgu.

Yukarıda anılan taşınabilirlik çalışması, 48 sentetik geçmişi dört bellek tasarımından geçirdi, ardından belleği yazan modeli değiştirdi. Tasarıma göre sonuçlar:

  • Sabit şemalı bilgi grafiği: doğruluk +0,0004 puan değişti. Fiilen bağışık.
  • Sıkıştırılmış doğal dil notları: doğruluk, geçişi hangi yöne yaptığınıza bağlı olarak +9,91 ya da −13,28 puan kaydı. Aynı notlar, farklı okuyucu, farklı yanıt.
  • Yarı taşınmış embedding indeksiyle RAG: 50/50 karışık bir indeks, her şeyi yeniden embedding'lemenin sunduğu 11,90 puanlık kazancın yalnızca 4,96'sını yakaladı. Yarım bir geçiş, size faydanın yarısından epey azını getiriyor.

Akılda tutulması gereken, onarım sonucu. Sıkıştırılmış notlar bozulduğunda, yalnızca depodan yola çıkarak onarmak 48 vakanın hepsinde %90'lık kurtarma hedefine ulaşamadı. Ham kaynak geçmişini saklamak 48 vakanın 34'ünü kurtardı. Orijinal görüşmeleri atıp yalnızca özeti saklarsanız, özeti düzeltme yeteneğinizi de atmış olursunuz.

Bu doğrudan, işletmenizi neden tek bir yapay zekâ modeli üzerine kurmamalısınız yazısında savunduğumuz şeye bağlanıyor: modeller 12 ila 18 aylık takvimlerle emekliye ayrılıyor. Bu çalışmanın eklediği şey ise, modelden bağımsız olmanın yalnızca bir API'yi değiştirmekten ibaret olmadığı. Biriktirdiğiniz bellek, onu yazan modele bağlıdır ve kimse size bir geçiş bildirimi göndermez.

Ajan belleğini kim, nerede inşa ediyor?

Alan, İngilizce yayınların çoğunun gözden kaçırdığı bir biçimde, gerçekten ABD ile Çin arasında ve açık ile kapalı arasında bölünmüş durumda.

Sistem Köken Lisans Ne olduğu
Mem0 ABD Açık çekirdek + yönetilen Yerine takılabilir bellek katmanı; DolphinBench'in yazarı
Letta (eski adıyla MemGPT) ABD Apache 2.0 Açık bellek bloklarına sahip durum tutan ajan sunucusu
Honcho, Hindsight, Supermemory ABD Ticari Yönetilen bellek API'leri, DolphinBench liderlik tablosunda puanlandı
ReMe Çin (Alibaba Tongyi Lab) Açık kaynak AgentScope yığınında yer alan, dosya ve vektör tabanlı bellek kiti
MemoryOS Çin (Beijing Univ. of Posts and Telecommunications) Apache 2.0 Hiyerarşik bellek işletim sistemi; ekip LoCoMo'da ortalama %49,11 F1 kazancı bildiriyor
MemOS Çin Araştırma Düz metin, aktivasyon ve parametre düzeylerinde belleği zamanlanabilir bir sistem kaynağı olarak ele alıyor

Bunun nereye gittiğine dair en net işaret, 20 Eylül 2026'da açılan ikinci Agent Memory Challenge. Yarışmaya China Society of Image and Graphics ev sahipliği yapıyor; Nanjing University, Zhejiang University ve Datawhale ile birlikte düzenleniyor. Ölçek ciddi: yalnızca metin kategorisinde 6.000'den fazla değerlendirme örneği ve kabaca 300 milyon token, ayrıca ayrı kodlama ve çok kipli kategoriler. Ödül havuzu ¥150.000 ve açık kaynak yöntemlere ayrılmış. Ticari ürünler katılıp puan alabiliyor, ama kendi liderlik tablolarında yarışıyorlar ve hiçbir ödül kazanmıyorlar.

Bu tasarım tercihini dikkatle okuyun. Kuralları koyanlar açık sistemleri ödüllendirirken, kapalı ürünleri de ayrı bir tabloda aynı kanıt standardına tabi tutuyor. Değerlendirmeler 4 Kasım'da kapanıyor, sonuçlar Kasım ortasında geliyor.

Yarışmanın metin boyutlarından biri, kimsenin pazarlamasını yapmadığı boyut: bellek yönetişimi, yani güncellemeler, çakışma çözümü, silme ve unutma. Bir diğeri, çekimserlik ve asgari ifşa üzerinden puanlanan epistemik güvenlik ve gizlilik. Bunlar, düzenlemeye tabi bir işletme için en çok önem taşıyan başlıklar ve bu yıla kadar bunları ölçen neredeyse hiçbir şey yoktu.

Müşteri görüşmelerinde yapay zekâ çalıştıran bir işletme için bunun anlamı ne?

Tedarikçi sunumlarından değil, yukarıdaki sonuçlardan çıkan beş çıkarım.

  1. Yalnızca özeti değil, ham görüşmeleri saklayın. Yalnızca depodan onarım 48 vakanın hepsinde başarısız oldu; kaynak geçmişini tutmak 34'ünü kurtardı. Özet bir önbellektir, kayıt sistemi değil.
  2. Doğruluğu ve maliyeti birlikte isteyin. Maliyetinizi katlayıp doğruluğu düşüren bir bellek katmanı varsayım değil, kıyaslamayla ölçülmüş bir sonuç.
  3. Belleği hatırlamayla değil, eylemle test edin. Ajan, müşterinizin mart ayında belirttiği tercihi hatırlatılmadan uyguluyor mu?
  4. Geçişi ihtiyacınız olmadan önce planlayın. Yarı taşınmış embedding indeksleri fena hâlde düşük performans gösteriyor. Bir model değişikliğinin tam bir yeniden embedding anlamına gelip gelmediğine baştan karar verin.
  5. Silmenin yalnızca kişi kaydına değil, türetilmiş belleğe de ulaştığını kontrol edin ve tedarikçinizden bunu anlatmasını değil, göstermesini isteyin.

Entagl bu tabloda nerede duruyor

Entagl, her kanal için ayrı bir bot yerine kanallar arasında tek bir ajan beyni çalıştırıyor ve Coordinator sesli ajanı, aramayı sıfırdan açmak yerine müşterinin önceki sohbetlerinin bir özetini okuyup öyle arıyor. İşletme bilgisi (hizmetler, ürünler, SSS'ler, çalışma saatleri, politikalar), ajanların sorguladığı aranabilir bir bilgi tabanında duruyor; bu da taşınabilirlik çalışmasında model değişiminden sağ çıkan sabit şemalı yaklaşıma, serbest metin notlarından daha yakın.

Bir WhatsApp yazışmasındaki içeriği aynı müşterinin Instagram yazışmasına taşımak ise ayrı bir kanallar arası bellek katmanı ve tamamlanmış değil, kademeli yayılım aşamasında. Orijinal mesajları saklarken her görüşme için yapılandırılmış bir özet yazıyor (neyin yanıtlandığı, neyin beklemede olduğu, neyin vaat edildiği). Yayılım bir çalışma alanına ulaşana kadar kapalı kalıyor, sahibi istediği anda kapatabiliyor, herhangi bir şeyi açıklamadan önce doğrulanmış bir kimlik bağlantısı arıyor (bir müşterinin bir kullanıcı adını sahiplendiğini söylemesi yeterli değil), bir kişi silindiğinde türetilmiş bellek de siliniyor ve saklanan bellek sabit bir saklama süresinde zaman aşımına uğruyor.

Yönetişim tarafında ilke, 2026'da yapay zekâ ajanlarında yenilikler: protokoller ve denetim mekanizmaları yazısında ortaya koyduğumuz ilke: yapay zekâ eyler, insanlar yönetir. Kanallar arasında birbirine bağlanan müşteri kayıtlarına dair alıcı tarafı kontrol listesi için karışıklık olmadan kanallar arası müşteri görüşmeleri yazısına bakın.

Bu sonuçların kanıtlamadıkları

Sınırlar konusunda açık konuşmakta fayda var.

DolphinBench sentetik kişilikler ve simüle edilmiş uygulamalar kullanıyor; dolayısıyla %70,67'lik tavan, o görev kümesine ve o çalıştırma ortamlarına özgü. Taşınabilirlik çalışması, 10 milyar parametrenin altındaki iki açık ağırlıklı model üzerinde yürütüldü; bu yüzden ölçtüğü tam puan salınımları bir sınır modele aktarılmayacak. Agent Memory Challenge ikinci dönemin sonuçlarını henüz yayımlamadı; elimizde olan yalnızca protokolü. Ve Mem0, zirvesinde yer aldığı kıyaslamayı kendisi yazdı; bu açıkça beyan ediliyor ve bu alanda olağan, ama %70,67'yi kesinleşmiş saymadan önce bağımsız bir yineleme istemek için yine de bir neden.

Bunların hiçbiri yönü değiştirmiyor. Bellek ilk kez doğru düzgün ölçülüyor ve ölçümler, pazarlamanın anlattığı kadar parlak değil.

SSS

Yapay zekâ ajan belleği ile RAG arasındaki fark nedir?

RAG, bir soruyu yanıtlamak için bir belge derleminden getirme yapar. Ajan belleği ise belirli bir kullanıcı ya da hesapla ilgili, oturumlar boyunca değişen durumu yönetir: neyin değiştiği, neyin geçersiz kaldığı, neyin vaat edildiği, neyin unutulması gerektiği. RAG çoğu zaman bir bellek sisteminin içindeki bir bileşendir, ancak bir bellek sisteminin ayrıca güncellemeleri, çakışmaları ve silmeyi de idare etmesi gerekir; bir belge indeksi bunu yapmaz.

2026'da yapay zekâ ajan belleği ne kadar doğru?

22 Eylül 2026'da yayımlanan eylem tabanlı kıyaslama DolphinBench'te, en iyi yapılandırma belleğe bağlı 600 görevin %70,67'sini tamamladı. Sonuçlar, altta yatan modele göre büyük ölçüde değişti: açık ağırlıklı MiniMax M3 ile modelin yerleşik belleği %26,50 alırken, özel bir bellek katmanı %47,83'e ulaştı.

Modeli değiştirdiğinizde bir yapay zekâ ajanı unutur mu?

Unutabilir, üstelik hiçbir veri silinmeden. Eylül 2026 tarihli bellek taşınabilirliği çalışması, sıkıştırılmış doğal dil notlarının bir model değişiminden sonra doğruluğu 13,28 yüzde puanına varan ölçüde kaydırdığını, sabit şemalı bir bilgi grafiğinin ise esasen etkilenmediğini buldu. Belleği nasıl sakladığınız, onun sağ çıkıp çıkmayacağını belirliyor.

Bir müşteri, yapay zekâ sisteminden hatırladıklarını silmesini isteyebilir mi?

İsteyebilir ve isteyebilmeli de, ancak silmenin yalnızca orijinal mesajlara değil, türetilmiş belleğe de ulaşması gerekir. Bu, artık Agent Memory Challenge'ın metin kategorisinde açıkça puanlanan bir boyut; güncellemeler, çakışma çözümü ve unutmayla birlikte. Hangi tedarikçi olursa olsun, bunu anlatmasını değil göstermesini isteyin.

Daha büyük bir bağlam penceresi belleğin yerini tutar mı?

Hayır. CueMem makalesi, uzun bağlamlı modellerin girdi pencere sınırına yaklaştıkça performanslarının düştüğünü buldu; makalenin getirme yöntemi ise girdi token'larının kabaca %10'uyla tam geçmişe denk geldi ya da onu geçti. OpenAI'ın V7 yazısı aynı ödünleşimi üretim tarafında raporluyor: bir grafiğin taranması, uzun bağlama kıyasla bir büyüklük mertebesi daha ucuz.

Akılda kalması gereken tek şey

Hangi tedarikçiyle konuşursanız konuşun tek bir soru sorun: altındaki modeli değiştirdiğinizde, ajanın müşterilerim hakkında bildiği her şeye ne olacak? Eylül 2026 araştırmaları, dürüst yanıtların ya "ham geçmişi saklıyor ve yeniden türetiyoruz" ya da "bir kısmı bozuluyor ve tamamını onaramıyoruz" olduğunu söylüyor. Kıyaslamalardan sağ çıkan üçüncü bir yanıt yok.

Paylaşılan beyinli bir kurulumun bunu DM'ler, web sohbeti ve aramalar arasında nasıl idare ettiğini görmek için 30 dakikalık bir demo ayarlayın ve en zorlu süreklilik sorunuzu getirin.


Kaynaklar, 23 Eylül 2026 itibarıyla: DolphinBench (Mem0, 22 Eyl 2026; makale); Does Your Agent's Memory Survive a Model Upgrade? (Goyal ve Ray, 4 Eyl 2026); CueMem (11 Eyl 2026); Agent Memory Challenge 2. dönem (CSIG, 20 Eyl 2026'da açıldı); How V7 gives AI agents institutional memory (OpenAI, 21 Eyl 2026); MemoryOS; MemOS; ReMe. Model sürümleri ve sıralamalar her ay değişiyor; rakamların tarihlendirilme nedeni bu.

Yayınlayan Entagl Team on