تخطي إلى المحتوى

AI News · industry

مليون رمز صارت المعيار. ومعظمها لا يعمل.

كل مختبر جاد أطلق هذا العام نافذة سياق بمليون رمز، بما في ذلك مختبرات الأوزان المفتوحة. والاختبارات المرجعية تقول إن النماذج تستخدم جزءًا صغيرًا منها باعتمادية، وما تقدّمه للنموذج ما زال أهم مما يتّسع له.

Entagl Teamقراءة لمدة 8 دقيقة
مليون رمز صارت المعيار. ومعظمها لا يعمل.

حتى سبتمبر 2026، صارت نافذة السياق بمليون رمز مواصفة أساسية. Anthropic وOpenAI وGoogle ومختبرات الأوزان المفتوحة في الصين، جميعها تطلق واحدة. ووجد اختبار RULER من NVIDIA أن نصف النماذج فقط، من بين تلك التي تدّعي 32K رمزًا أو أكثر، صمد عند 32K. النافذة كبرت. أما الجزء الموثوق منها فكبر ببطء أكبر.

من يطلق فعلًا نافذة بمليون رمز؟

الانتشار أهم من أي رقم مفرد، لأنه يخبرك أن هذه القدرة لم تعد حصنًا تنافسيًا. صارت الحد الأدنى للمشاركة، واثنان منها يمكنك تنزيل أوزانهما.

النموذج المختبر (الدولة) نافذة السياق الأوزان
Claude Opus 5.5 Anthropic (الولايات المتحدة) 1M، وحد أقصى للمخرجات 128K مغلقة
GPT-6.1 Sol OpenAI (الولايات المتحدة) 1,050,000، وحد أقصى للمخرجات 128K مغلقة
Gemini 3.8 Flash Google (الولايات المتحدة) 1M، وحد أقصى للمخرجات 64K مغلقة
DeepSeek-V4.1-Flash DeepSeek (الصين) حتى 1M مفتوحة
Kimi K3 Moonshot AI (الصين) 1M مفتوحة
Mistral Large 3 Mistral (فرنسا) 256K مفتوحة

أمران يلفتان النظر في هذا الجدول. أولهما أن المختبرات الصينية بلغت التعادل في هذه المواصفة، وهي تطلق الأوزان. بطاقة نموذج DeepSeek تصف بنية أساسية من نوع خليط الخبراء بـ552B معلمة، دُرّبت بانتباه متفرق عند 64K ثم مُدّدت إلى مليون رمز في مرحلة لاحقة من التدريب. ووصل Kimi K3 إلى Amazon Bedrock في 18 سبتمبر 2026 برؤية أصلية وتخزين مؤقت صريح للمطالبات. وإن أردت صورة الترتيب الأوسع بدل زاوية نافذة السياق، تناولناها في أفضل نماذج اللغة الكبيرة لعام 2026: المفتوحة والمغلقة والعالمية.

وثانيهما أن Mistral تخطّت السباق. فحدودها المنشورة تضع Mistral Large 3 عند 256K رمز، وبقية تشكيلتها تقف عند 128K أو 256K. هذا اختيار متعمّد، ويستحق الانتباه حين يكون في سباق المواصفات ممتنع ذو مصداقية.

ماذا يتّسع له مليون رمز فعلًا؟

توثيق Google نفسه يعطي أوضح إجابة ملموسة. مليون رمز يعادل تقريبًا 50,000 سطر برمجي، أو ثماني روايات إنجليزية متوسطة الطول، أو نصوص أكثر من 200 حلقة بودكاست.

أما بالنسبة إلى نشاط تجاري فالترجمة المفيدة مختلفة: مليون رمز أكبر بكثير مما ستحتاجه أي محادثة عميل واحدة. سنة كاملة من محادثات WhatsApp مع عميل واحد لا تقترب من ذلك. فإن كنت تشغّل ذكاءً اصطناعيًا على رسائل عملائك، فالنافذة توقفت عن كونها قيدك منذ وقت. قيدك هو الانتقاء، وقد كان كذلك دائمًا.

هل تستخدم النماذج النافذة كاملة فعلًا؟

ليس بالتساوي، والمزوّدون أنفسهم يقولون ذلك.

ورقة RULER من NVIDIA (COLM 2024) هي أوضح صياغة للمشكلة. تجاوزت اختبار الإبرة في كومة القش البسيط إلى التتبع متعدد القفزات والتجميع، وقيّمت 17 نموذجًا للسياق الطويل، ووجدت أنه رغم النتائج شبه المثالية في اختبار الاسترجاع السهل، فإن "جميع النماذج تقريبًا تُظهر انخفاضات كبيرة في الأداء مع زيادة طول السياق". ونصف النماذج التي تدّعي 32K لم تستطع الحفاظ على الجودة عند 32K.

أما تقرير Context Rot من Chroma (Hong وTroynikov وHuber، يوليو 2025) فاختبر 18 نموذجًا على مهام بسيطة عن قصد، ووجد أن الأداء يتدهور مع نمو المدخل، "غالبًا بطرق مفاجئة وغير منتظمة". التراجع غير متساوٍ، ويصير التنبؤ به أصعب كلما قلّ تشابه الإبرة حرفيًا مع السؤال.

وتذكر Google هذا القيد في دليلها للسياق الطويل. فنتائج الإبرة في كومة القش، كما تشير، تغطي الإعداد الأساسي بإبرة واحدة: "في الحالات التي قد تكون لديك فيها إبر متعددة أو أجزاء محددة من المعلومات تبحث عنها، لا يؤدي النموذج بالدقة نفسها". وأسئلة العملاء الحقيقية متعددة الإبر في الغالب الأعم. فالعميل الذي يسأل إن كان لديك متسع له يوم الخميس، وإن كان العربون قابلًا للاسترداد، وإن كانت معالِجته المعتادة تداوم، قد دفن ثلاث إبر في رسالة واحدة.

ويقدّم الدليل نفسه قاعدة عملية لا يكلّف تطبيقها شيئًا: ضع سؤالك في نهاية المطالبة، بعد السياق. النماذج تؤدي أفضل بهذه الطريقة حين يكون المدخل طويلًا.

لماذا وصل كل مختبر إلى هنا في الوقت نفسه

الهندسة المثيرة للاهتمام في 2026 كانت جعل النافذة الطويلة رخيصة بما يكفي لقراءتها مرارًا. وDeepSeek-V4.1-Flash صريح في هذا، إذ يقدّم نفسه حول ضغط ذاكرة KV المؤقتة.

والاقتصاديات تحركت في الاتجاه نفسه على الجانب المغلق. فحين أطلقت OpenAI نموذجي GPT-6 Sol وLuna في 22 سبتمبر خفّضت أسعار الواجهة البرمجية بنسبة 50% ورفعت معدلات الإصابة الافتراضية للذاكرة المؤقتة، مع خصم 90% على قراءات رموز المدخل المخزّنة مؤقتًا. وفي الإعلان نفسه، أفادت GitHub بأن تحسينات التخزين المؤقت خفّضت على مدى عدة أشهر حصة رموز المطالبات التي تحتاج معالجة جديدة بأكثر من 50%، عبر مليارات الطلبات. وبعد أسبوع، في 29 سبتمبر، استبدلت OpenAI ذلك الإصدار بـGPT-6.1 Sol وخفّضت سعر المدخل المخزّن مؤقتًا إلى النصف مرة أخرى. هذا هو الإيقاع الذي تبني في مواجهته.

صار السياق الطويل أمرًا عاديًا لأن التخزين المؤقت جعل إعادة قراءة مطالبة كبيرة رخيصة، لا لأن النماذج تحسّنت في الانتباه عبر مليون رمز. هاتان مشكلتان مختلفتان، وواحدة منهما فقط حُلّت.

الفاتورة لم تختفِ، بل انتقلت

ثلاث تكاليف تنجو من النافذة الأكبر، وإن كنت تضع ميزانية لنشر ذكاء اصطناعي فعليك تسعيرها جميعًا.

  1. الرموز ما زالت تُحتسب، والعدّاد قد يقفز درجة. قراءة الذاكرة المؤقتة ما زالت تكلّف مالًا، لكن أقل من قراءة جديدة. وصفحة النموذج لدى OpenAI تقولها بوضوح: المطالبات التي تتجاوز 272K رمز مدخل تُسعَّر بـ2x لأسعار المدخل والذاكرة المؤقتة و1.5x للمخرجات على الطلب كله. املأ ربع النافذة وتتغير اقتصاديات الوحدة لديك.
  2. زمن الاستجابة يتناسب مع حجم المدخل. إرشادات Google صريحة: الاستعلامات الأطول تعني عمومًا زمنًا أطول حتى الرمز الأول. وفي مراسلة العملاء هذا يكلّفك مالًا مباشرة. دراسة سرعة الاستجابة التي أجريناها على 32,581 محادثة وجدت أن الردود خلال 60 ثانية حققت تحويلًا بنسبة 35.1%، مقابل 12.2% للردود بين 5 و60 دقيقة.
  3. الدقة هي آخر ما تلاحظه. الإجابة الخاطئة الناتجة عن مطالبة منتفخة تبدو تمامًا كالإجابة الصحيحة، إلى أن يتصرف عميل بناءً عليها.

ما الذي يغيّره هذا إن كنت تشغّل ذكاءً اصطناعيًا على محادثات العملاء

أقل مما توحي به أوراق المواصفات.

نافذة المليون رمز تزيل عذرًا. أما قرار التصميم فيبقى. ما زلت أنت من يختار ما يراه النموذج في كل دور، والأدلة أعلاه تقول إن مطالبة أضيق وأفضل انتقاءً تتفوق على مطالبة أكبر. Receptionist من Entagl يسترجع الحقائق المحددة التي يحتاجها السؤال عبر بحث دلالي في الأسئلة الشائعة والخدمات وكتالوج النشاط التجاري، بدل تحميل النشاط بأكمله في كل دور. واختيار النموذج متدرج حسب عبء العمل، فلا يُحاسَب سؤال بسيط بأسعار النموذج الرائد. وحين يجري Coordinator مكالمة تأكيد، يكون بحوزته أصلًا سجل المحادثة من بطاقة العميل نفسها، فلا يحتاج شيء إلى إعادة بناء من جدار نص خام.

إنه الانضباط نفسه الذي تطلّبه الاسترجاع الجيد دائمًا، والاختبارات المرجعية تواصل تأكيده. وتعمّقنا في جانب الذاكرة من هذا في ذاكرة وكلاء الذكاء الاصطناعي في 2026، وهو يغطي الاختبارات التي تفصل التذكّر عن الاسترجاع. أما الجانب السعري من الاتجاه نفسه، حيث صارت النماذج الصغيرة رخيصة بما يكفي لأداء معظم أعمال الشركات، ففي نماذج اللغة الصغيرة في 2026. وإن كنت تقرر على أي مختبر تبني بينما تتقارب هذه المواصفات، فمقال لماذا لا ينبغي أن تبني عملك على نموذج ذكاء اصطناعي واحد يطرح حجة البقاء قابلًا للانتقال.

إن أردت أن ترى كيف يبدو انتقاء السياق المنضبط على محادثاتك أنت، احجز عرضًا توضيحيًا مدته 30 دقيقة وسنستعرض معك سجل رسائلك الحقيقي.

الأسئلة الشائعة

هل تُغني النافذة الأكبر عن الاسترجاع؟

لا. إنها تغيّر متى يستحق الاسترجاع الجهد الهندسي. أما سببه فقائم. فالتكلفة ما زالت تتناسب مع عدد الرموز المعالَجة، وزمن الاستجابة يرتفع مع طول المدخل، وكل من RULER وChroma يُظهر تدهور الدقة مع نمو المدخلات. والاسترجاع يضيّق المشكلات الثلاث دفعة واحدة.

ما أكبر نافذة سياق متاحة في 2026؟

عدة نماذج تقبل مليون رمز أو أكثر، منها Claude Opus 5.5 وGPT-6.1 Sol عند 1,050,000 وGemini 3.8 Flash وDeepSeek-V4.1-Flash وKimi K3. وقلة تعلن عن أكثر من ذلك. السؤال الأنفع هو كم من النافذة يستخدم النموذج باعتمادية، وهو ما تحاول اختبارات مثل RULER قياسه، وهذا الرقم أدنى باستمرار من الرقم المعلن.

هل نوافذ السياق أصغر في نماذج الأوزان المفتوحة؟

لم تعد كذلك. فكل من DeepSeek-V4.1-Flash وKimi K3 من Moonshot يقبل مليون رمز بأوزان منشورة، فالاستضافة الذاتية لم تعد تعني القبول بنافذة قصيرة. أما Mistral Large 3 فيتوقف عند 256K بقرار تصميمي، وهذا لا يقول شيئًا عن النماذج المفتوحة عمومًا.

كم من السياق تحتاج محادثة خدمة العملاء فعلًا؟

أقل بكثير من مليون رمز. حتى المحادثة الطويلة الممتدة أشهرًا مع عميل واحد تمثّل جزءًا صغيرًا من نافذة حديثة. العمل الحقيقي هو تحديد أي حقائق النشاط التجاري والطلبات السابقة والرسائل السابقة تنتمي إلى هذا الدور بالذات.

هل يجعل السياق الطويل الذكاء الاصطناعي أبطأ في الرد؟

عمومًا نعم. فإرشادات Google للسياق الطويل تشير إلى أن الاستعلامات الأطول لها زمن أطول حتى الرمز الأول. وفي مراسلة العملاء، حيث ترتبط سرعة الرد بالتحويل، تستحق هذه المقايضة القياس على حركة رسائلك أنت.

المصادر: RULER (NVIDIA، arXiv:2404.06654، COLM 2024)؛ Context Rot (Chroma، يوليو 2025)؛ توثيق السياق الطويل لواجهة Gemini البرمجية وملاحظات نموذج Gemini 3.8 Flash؛ توثيق نموذج Claude Opus 5.5؛ مرجع نموذج OpenAI GPT-6.1 Sol وإعلانا GPT-6 Sol وLuna (22 سبتمبر 2026) وGPT-6.1 Sol (29 سبتمبر 2026)؛ بطاقة نموذج DeepSeek-V4.1-Flash؛ Kimi K3 على Amazon Bedrock (18 سبتمبر 2026)؛ Mistral Large 3 والقيود المعروفة؛ دراسة سرعة الاستجابة من Entagl (2026). جرى التحقق من مواصفات النماذج في 30 سبتمبر 2026 وهي تتغير باستمرار.

نشر بواسطة Entagl Team on