AI News · industry
ذاكرة وكلاء الذكاء الاصطناعي في 2026: ما تكشفه الاختبارات الجديدة
ثلاثة اختبارات في سبتمبر 2026 قاست ما يتذكره الوكلاء فعلًا. أفضل نتيجة كانت 70.67%، والملاحظات المضغوطة انهارت عند تبديل النموذج، وكلّفت الذاكرة أحيانًا أكثر من الوكيل نفسه.

ذاكرة وكلاء الذكاء الاصطناعي هي الطبقة التي تتيح للوكيل أن يستخدم شيئًا قاله له عميل قبل أسابيع، وحتى سبتمبر 2026 فهي غير مكتملة بشكل قابل للقياس. في DolphinBench، الصادر في 22 سبتمبر 2026، أنجز التكوين صاحب أعلى نتيجة 70.67% من 600 مهمة تعتمد على الذاكرة. أي أن قرابة الثلث فشل. ووجدت دراسة منضبطة منفصلة، هل تنجو ذاكرة وكيلك من ترقية النموذج؟، نُشرت في 4 سبتمبر، أنه عند تسليم مخزن ذاكرة بناه نموذج إلى نموذج آخر، تتحرك الدقة بما يصل إلى 13.28 نقطة مئوية في الاتجاه الخاطئ، دون أن يمسّ أحد البيانات المخزنة.
ثلاثة أمور ظهرت في سبتمبر تستحق انتباهك إن كنت تشغّل ذكاءً اصطناعيًا يتحدث إلى عملائك: اختبار مرجعي يقيّم الذاكرة بالأفعال بدل إجابات الأسئلة، ودراسة عمّا إذا كانت الذاكرة تنجو من ترقية النموذج، وتحدٍّ مستضاف في الصين يضع كل أنظمة الذاكرة تحت دفتر قواعد واحد. إليك ما قاسه كل منها، وما الذي يغيّره.
ما ذاكرة وكيل الذكاء الاصطناعي، وكيف تختلف عن نافذة السياق؟
نافذة السياق هي مساحة العمل المتاحة للنموذج أثناء تشغيلة واحدة. تفرغ حين تنتهي التشغيلة. أما ذاكرة الوكيل فحالة دائمة: ما يُدوَّن بعد المحادثة، ويُسترجع قبل التي تليها.
الفارق مهم لأن الصناعة تواصل محاولة حل الذاكرة بتكبير النافذة. والأدلة تقول إن ذلك لا ينجح وحده. وجدت ورقة CueMem (11 سبتمبر 2026)، الصادرة عن Mashang Consumer Finance ومعهد هاربين للتكنولوجيا في شنتشن، أن تغذية النموذج بتاريخ الحوار كاملًا تتدهور كلما اقترب المدخل من حد السياق، وهو أثر يعزوه المؤلفون جزئيًا إلى السياق غير ذي الصلة ومشكلة الضياع في المنتصف. واستخدم نهجهم في الاسترجاع نحو 10% من رموز المدخل مقارنةً بإعداد التاريخ الكامل على اختبار LoCoMo، وسجّل نتيجة أعلى رغم ذلك.
ويقول تقرير OpenAI الصادر في 21 سبتمبر عن V7، الذي يبني سياق الوكلاء لفرق التمويل والتأمين، الشيء نفسه انطلاقًا من بيئة الإنتاج: الرسم البياني لدى V7 "أرخص وأسرع في الاجتياز بمقدار رتبة كاملة من مقاربات السياق الطويل"، مع إبقاء التبادلات الحديثة في السياق النشط وترك المواد الأقدم في الرسم البياني حتى يطلبها شيء ما.
إذن الذاكرة ليست نافذة أكبر. إنها قرار بشأن ما يُدوَّن، وما يُحتفظ به.
لماذا تغيّرت الاختبارات المرجعية في سبتمبر 2026؟
حتى الآن، كانت معظم اختبارات الذاكرة تطرح أسئلة. وهذا يجامل الأنظمة الخاضعة للاختبار.
حجة DolphinBench صريحة. اسأل وكيلًا "ما منصة المراسلة التي يستخدمها الفريق؟" وتكون قد أخبرته سلفًا أن هناك معلومة عن منصة، وأنك تريدها. الخطوة الأصعب، وهي ملاحظة أن الاسترجاع مطلوب أصلًا، أُنجزت نيابةً عنه. لذلك يحذف DolphinBench السؤال. يعطي الوكيل ثلاثة سجلات محاكاة لعاملين في المعرفة (نحو 500,000 رمز لكل سجل، و13,539 رسالة تمتد من 2023 إلى 2027)، ثم يصدر 600 مهمة ضد تطبيقات محاكاة تشمل Notion وGmail وGitHub وDiscord، حيث يترك الفعل الخاطئ أثرًا يستطيع المصحح رؤيته.
مثال عملي واحد: يذكر رئيس تنفيذي قاعدة قناة مرة واحدة، في أبريل 2023، مفادها أن ملاحظات الإصدار تُنشر في #eng-releases إلى أن ينجح النشر. ولا شيء يكرر ذلك. وبعد ثلاث سنوات ونصف، ومدفونًا في سجل من 3,400 رسالة، يصل طلب بنشر تحديث عن طرح جديد، دون ذكر أي قناة. انشر في القناة الخطأ وتفشل. معرفة المعلومة لا تكفي؛ على الوكيل أن يطبّقها دون أن يُطلب منه.
وكل اختبار مُعتمَد أيضًا بوصفه قابلًا للحل: يجب أن ينجح حين يُتاح السجل ذو الصلة، وأن يفشل حين يُحجب. هذه القاعدة تقضي على الشكوى المعتادة من الاختبارات الاصطناعية، وهي أن لا أحد يعرف إن كان الاختبار الفاشل قابلًا للإجابة أصلًا.
أي أنظمة الذاكرة كان أداؤها الأفضل، وكم كلّفت؟
إليك النتائج المنشورة من DolphinBench لمنصة Hermes وهي تشغّل GPT-5.6 Luna، حتى 22 سبتمبر 2026. الدقة هي نسبة المهام المنجزة من أصل 600. أما أعمدة التكلفة فهي تكاليف التشغيل التي نشرها الاختبار نفسه للمجموعة الكاملة، بالدولار الأمريكي، وهي مفيدة كنسبة بين الأنظمة على الاختبار ذاته أكثر من كونها سعرًا ستدفعه.
| نظام الذاكرة | الدقة | تكلفة تشغيل الوكيل | تكلفة تشغيل الذاكرة | وسيط زمن الاستجابة |
|---|---|---|---|---|
| Mem0 | 70.67% | 61.54 | 34.68 | 37.69 ثانية |
| Hindsight | 69.50% | 57.99 | 26.66 | 55.31 ثانية |
| Honcho | 68.50% | 96.56 | 46.30 | 44.66 ثانية |
| الذاكرة المدمجة في النموذج | 65.67% | 61.48 | 0.00 | 44.35 ثانية |
| Supermemory | 59.17% | 63.86 | 281.79 | 52.68 ثانية |
نتيجتان تستحقان انتباهًا أكبر من الفائز.
قد تكلّف طبقة الذاكرة أكثر من الوكيل نفسه. بلغ إنفاق Supermemory على الذاكرة في هذه التشغيلة نحو أربعة أضعاف ونصف إنفاقها على الوكيل، وجاءت الأخيرة في الدقة. وأي مورّد يقتبس لك رقم دقة دون رقم تكلفة يعرض عليك نصف النتيجة. موقف DolphinBench أن التكلفة وزمن الاستجابة ينتميان إلى السطر نفسه مع الدقة، ولهذا يسمّونه حدود باريتو لا لوحة صدارة.
مقدار ما تساعد به الذاكرة يعتمد بشدة على النموذج تحتها. مع GPT-5.6 Luna، أضافت طبقة ذاكرة مخصصة نحو خمس نقاط فوق الذاكرة المدمجة في النموذج (70.67% مقابل 65.67%). بدّل إلى MiniMax M3، النموذج الصيني مفتوح الأوزان، فتنهار الذاكرة المدمجة إلى 26.50% بينما تبلغ Mem0 نسبة 47.83%، أي فجوة تتجاوز عشرين نقطة. وكلما ضعفت معالجة النموذج الأصلية للسجلات الطويلة، زاد العبء الذي تحمله طبقة الذاكرة الخارجية. إن كنت تشغّل نموذجًا مفتوح الأوزان لضبط التكلفة، فهذه هي النتيجة التي ينبغي أن تتصرف بناءً عليها.
هل تنجو ذاكرة الوكيل من ترقية النموذج؟
غالبًا لا، وهذه هي النتيجة التي لم تحسب معظم الفرق حسابها.
شغّلت دراسة قابلية النقل المذكورة أعلاه 48 سجلًا اصطناعيًا عبر أربعة تصاميم للذاكرة، ثم بدّلت النموذج الذي كتب الذاكرة. النتائج بحسب التصميم:
- رسم معرفي بمخطط ثابت: تغيّرت الدقة بمقدار +0.0004 نقطة. محصّن عمليًا.
- ملاحظات مضغوطة بلغة طبيعية: تحركت الدقة بمقدار +9.91 أو −13.28 نقطة حسب اتجاه الترحيل. الملاحظات نفسها، قارئ مختلف، إجابة مختلفة.
- RAG مع فهرس تضمين مُرحَّل نصفيًا: التقط فهرس مختلط بنسبة 50/50 نحو 4.96 فقط من مكسب الـ11.90 نقطة المتاح من إعادة تضمين كل شيء. نصف الترحيل يشتري لك أقل بكثير من نصف الفائدة.
نتيجة الإصلاح هي التي تستحق التذكّر. حين اختلّت الملاحظات المضغوطة، فشل إصلاحها من المخزن وحده في بلوغ هدف تعافٍ بنسبة 90% في الحالات الـ48 كلها. أما الاحتفاظ بالسجل المصدري الخام فاستعاد 34 من 48. إن تخلصت من المحادثات الأصلية واحتفظت بالملخص وحده، فقد تخلصت من قدرتك على إصلاح الملخص.
وهذا يتصل مباشرةً بما جادلنا به في لماذا لا ينبغي أن تبني عملك على نموذج ذكاء اصطناعي واحد: تُسحب النماذج من الخدمة على دورات تتراوح بين 12 و18 شهرًا. وما تضيفه هذه الدراسة أن الحياد تجاه النموذج ليس مسألة تبديل واجهة برمجية فحسب. ذاكرتك المتراكمة مرتبطة بالنموذج الذي كتبها، ولا أحد يرسل لك إشعار ترحيل.
من يبني ذاكرة الوكلاء، وأين؟
المجال منقسم فعلًا بين الولايات المتحدة والصين، وبين المفتوح والمغلق، بطريقة تفوت معظم التغطية باللغة الإنجليزية.
| النظام | المنشأ | الترخيص | ما هو |
|---|---|---|---|
| Mem0 | الولايات المتحدة | نواة مفتوحة + خدمة مُدارة | طبقة ذاكرة جاهزة للدمج؛ وهي من ألّف DolphinBench |
| Letta (سابقًا MemGPT) | الولايات المتحدة | Apache 2.0 | خادم وكلاء ذو حالة بكتل ذاكرة صريحة |
| Honcho وHindsight وSupermemory | الولايات المتحدة | تجاري | واجهات ذاكرة مُدارة، مُقيَّمة على لوحة صدارة DolphinBench |
| ReMe | الصين (مختبر Tongyi التابع لـ Alibaba) | مفتوح المصدر | عدة ذاكرة ضمن حزمة AgentScope، قائمة على الملفات والمتجهات |
| MemoryOS | الصين (جامعة بكين للبريد والاتصالات) | Apache 2.0 | نظام تشغيل هرمي للذاكرة؛ ويفيد الفريق بتحسن متوسط قدره 49.11% في درجة F1 على LoCoMo |
| MemOS | الصين | بحثي | يعامل الذاكرة كمورد نظام قابل للجدولة عبر مستويات النص الصريح والتنشيط والبارامترات |
وأوضح إشارة إلى وجهة هذا المسار هي تحدي ذاكرة الوكلاء الثاني، الذي انطلق في 20 سبتمبر 2026. تستضيفه الجمعية الصينية للصورة والرسومات ويُنظَّم بالتعاون مع جامعة نانجينغ وجامعة تشجيانغ وDatawhale. والحجم جاد: أكثر من 6,000 حالة تقييم ونحو 300 مليون رمز في المسار النصي وحده، إضافة إلى مساري البرمجة والوسائط المتعددة المنفصلين. ومجموع الجوائز ¥150,000، وهو محجوز للطرق مفتوحة المصدر. يمكن للمنتجات التجارية أن تشارك وأن تحصل على تقييم، لكنها تُدرج على لوحة صدارة خاصة بها ولا تفوز بشيء.
اقرأ هذا الخيار التصميمي بعناية. فمن يضعون القواعد يكافئون الأنظمة المفتوحة، ويظلون في الوقت نفسه يُخضعون المنتجات المغلقة للأدلة ذاتها على لوحة منفصلة. يُغلق التقييم في 4 نوفمبر، والنتائج في منتصف نوفمبر.
وأحد أبعاد المسار النصي في التحدي هو البعد الذي لا يسوّقه أحد: حوكمة الذاكرة، أي التحديثات وحل التعارضات والحذف والنسيان. وبعد آخر هو السلامة المعرفية والخصوصية، ويُقيَّم على الامتناع عن الإجابة وعلى أقل قدر من الإفصاح. وهذه أهم ما يكون لعمل خاضع للتنظيم، وحتى هذا العام لم يكن شيء تقريبًا يقيسها.
ماذا يعني هذا لعمل يشغّل ذكاءً اصطناعيًا على محادثات عملائه؟
خمس خلاصات، مستخلصة من النتائج أعلاه لا من عروض المورّدين.
- احتفظ بالمحادثات الخام، لا بالملخص وحده. فشل الإصلاح من المخزن وحده في الحالات الـ48 كلها؛ والاحتفاظ بالسجل المصدري استعاد 34. الملخص ذاكرة مؤقتة، لا سجل رسمي.
- اطلب الدقة والتكلفة معًا. طبقة ذاكرة تضاعف تكلفتك وتخسر دقة هي نتيجة مقيسة، لا احتمال نظري.
- اختبر الذاكرة بالفعل، لا بالاستذكار. هل يطبّق الوكيل التفضيل الذي ذكره عميلك في مارس دون تذكير؟
- خطّط للترحيل قبل أن تحتاج إليه. فهارس التضمين المُرحَّلة نصفيًا أداؤها سيئ. احسم مبكرًا ما إذا كان تغيير النموذج يعني إعادة تضمين كاملة.
- تأكد أن الحذف يصل إلى الذاكرة المشتقة، لا إلى سجل جهة الاتصال فقط، واطلب من مورّدك أن يعرض ذلك عمليًا بدل أن يصفه.
أين تقف Entagl من هذا
تشغّل Entagl دماغ وكيل واحدًا عبر القنوات بدل روبوت منفصل لكل قناة، ويقرأ وكيل المكالمات Coordinator ملخصًا لمحادثات العميل السابقة قبل أن يتصل، بدل أن يبدأ من الصفر. وتعيش معرفة العمل (الخدمات والمنتجات والأسئلة الشائعة وساعات العمل والسياسات) في قاعدة معرفة قابلة للبحث يستعلم منها الوكلاء، وهي أقرب إلى نهج المخطط الثابت الذي نجا من تبديل النموذج في دراسة قابلية النقل منها إلى الملاحظات الحرة.
أما نقل المحتوى من محادثة WhatsApp إلى محادثة Instagram للعميل نفسه فهو طبقة ذاكرة منفصلة عبر القنوات، وهي في طرح تدريجي لا في صورة نهائية. تكتب ملخصًا منظمًا لكل محادثة (ما أُجيب عنه، وما لا يزال معلقًا، وما وُعد به) مع الاحتفاظ بالرسائل الأصلية. وتبقى معطلة إلى أن يصل الطرح إلى مساحة العمل، ويستطيع صاحبها إيقافها في أي وقت، وتتطلب ربط هوية موثقًا قبل أن تفصح عن أي شيء (مجرد ادّعاء العميل امتلاك حساب لا يكفي)، وتُمحى الذاكرة المشتقة عند حذف جهة الاتصال، وتنتهي صلاحية الذاكرة المخزنة ضمن نافذة احتفاظ محددة.
وفي الحوكمة، المبدأ هو الذي طرحناه في ما الجديد في وكلاء الذكاء الاصطناعي في 2026: البروتوكولات وحواجز الأمان: الذكاء الاصطناعي ينفّذ، والبشر يحكمون. وللاطلاع على قائمة التحقق من جانب المشتري بشأن ربط سجلات العملاء عبر القنوات، راجع محادثات العملاء عبر القنوات دون ارتباك.
ما لا تثبته هذه النتائج
من الأنصف التصريح بالحدود.
يستخدم DolphinBench شخصيات اصطناعية وتطبيقات محاكاة، لذا فسقف الـ70.67% خاص بمجموعة المهام تلك وتلك المنصات. وجرت دراسة قابلية النقل على نموذجين مفتوحي الأوزان بأقل من 10 مليارات معامل، لذا لن تنتقل تحركاتها الرقمية الدقيقة إلى نموذج متقدم. ولم ينشر تحدي ذاكرة الوكلاء نتائج دورته الثانية بعد؛ وما لدينا هو بروتوكوله. كما أن Mem0 هي من ألّف الاختبار الذي تتصدره، وهو أمر مُفصح عنه علنًا ومعتاد هنا، لكنه سبب يدعو إلى طلب تكرار مستقل قبل اعتبار الـ70.67% أمرًا محسومًا.
لا شيء من ذلك يغيّر الاتجاه. الذاكرة تُقاس قياسًا صحيحًا لأول مرة، والقياسات أقل مجاملةً من التسويق.
الأسئلة الشائعة
ما الفرق بين ذاكرة وكيل الذكاء الاصطناعي وRAG؟
يسترجع RAG من مجموعة مستندات للإجابة عن سؤال. أما ذاكرة الوكيل فتدير حالة متطورة عن مستخدم أو حساب بعينه عبر الجلسات: ما تغيّر، وما نُسخ، وما وُعد به، وما ينبغي نسيانه. وكثيرًا ما يكون RAG مكوّنًا داخل نظام ذاكرة، لكن نظام الذاكرة عليه أيضًا أن يتعامل مع التحديثات والتعارضات والحذف، وهو ما لا يفعله فهرس المستندات.
ما مدى دقة ذاكرة وكلاء الذكاء الاصطناعي في 2026؟
على DolphinBench، الاختبار القائم على الأفعال والمنشور في 22 سبتمبر 2026، أنجز التكوين الأعلى 70.67% من 600 مهمة تعتمد على الذاكرة. وتباينت النتائج كثيرًا بحسب النموذج الأساسي: فمع MiniMax M3 مفتوح الأوزان، سجّلت ذاكرة النموذج المدمجة 26.50% بينما بلغت طبقة ذاكرة مخصصة 47.83%.
هل ينسى وكيل الذكاء الاصطناعي عند تغيير النموذج؟
قد يحدث ذلك دون حذف أي بيانات. وجدت دراسة قابلية نقل الذاكرة في سبتمبر 2026 أن الملاحظات المضغوطة بلغة طبيعية حرّكت الدقة بما يصل إلى 13.28 نقطة مئوية بعد تبديل النموذج، بينما لم يتأثر الرسم المعرفي ذو المخطط الثابت عمليًا. وطريقة تخزينك للذاكرة هي ما يحدد نجاتها.
هل يمكن للعميل أن يطلب من نظام ذكاء اصطناعي حذف ما يتذكره؟
يستطيع، ويجب أن يكون قادرًا على ذلك، لكن الحذف يجب أن يصل إلى الذاكرة المشتقة أيضًا، لا إلى الرسائل الأصلية فقط. وهذا الآن بُعد مُقيَّم صراحةً في المسار النصي لتحدي ذاكرة الوكلاء، إلى جانب التحديثات وحل التعارضات والنسيان. اطلب من أي مورّد أن يعرض ذلك عمليًا بدل أن يصفه.
هل نافذة السياق الأكبر بديل عن الذاكرة؟
لا. وجدت ورقة CueMem أن نماذج السياق الطويل تتدهور كلما اقترب المدخل من حد النافذة، وأن طريقتها في الاسترجاع ساوت التاريخ الكامل أو تفوقت عليه بنحو 10% من رموز المدخل. ويفيد تقرير OpenAI عن V7 بالمقايضة نفسها في بيئة الإنتاج، حيث يكون اجتياز الرسم البياني أرخص بمقدار رتبة كاملة من السياق الطويل.
الخلاصة الوحيدة التي تأخذها معك
اسأل أي مورّد سؤالًا واحدًا: ماذا يحدث لكل ما يعرفه الوكيل عن عملائي حين تغيّر النموذج تحته؟ تقول أبحاث سبتمبر 2026 إن الإجابتين الصادقتين هما إما "نحتفظ بالسجل الخام ونعيد الاشتقاق" أو "يتدهور جزء منه ولا نستطيع إصلاحه بالكامل". ولا توجد إجابة ثالثة تصمد أمام الاختبارات.
ولترى كيف يتعامل إعداد بدماغ مشترك مع ذلك عبر الرسائل المباشرة والدردشة على الموقع والمكالمات، احجز عرضًا توضيحيًا لمدة 30 دقيقة وأحضر معك أصعب سؤال لديك عن الاستمرارية.
المصادر، حتى 23 سبتمبر 2026: DolphinBench (Mem0، 22 سبتمبر 2026؛ الورقة البحثية)؛ هل تنجو ذاكرة وكيلك من ترقية النموذج؟ (Goyal وRay، 4 سبتمبر 2026)؛ CueMem (11 سبتمبر 2026)؛ تحدي ذاكرة الوكلاء، الدورة 2 (CSIG، انطلق في 20 سبتمبر 2026)؛ كيف يمنح V7 وكلاء الذكاء الاصطناعي ذاكرة مؤسسية (OpenAI، 21 سبتمبر 2026)؛ MemoryOS؛ MemOS؛ ReMe. إصدارات النماذج والترتيبات تتغير شهريًا؛ ولهذا السبب أُرّخت الأرقام.