industry · product
كيف تحافظ على دقة وكيل الذكاء الاصطناعي بعد إطلاقه
وجدت دراسة محكَّمة تدهورًا في الجودة لدى 91% من 128 اقترانًا بين نموذج ومجموعة بيانات اختبرتها عبر الزمن. لا شيء في إعدادك مضطر إلى التغير حتى يسوء وكيل يعمل فعليًا، وهذه هي حلقة الصيانة التي تكشف ذلك.

صيانة وكيل الذكاء الاصطناعي ليست عملًا تنظيفيًا. هي العمل نفسه. الوكيل الذي اجتاز كل اختبار عند الإطلاق قد يصبح أسوأ بشكل قابل للقياس في الإنتاج دون أن يمسّ أحد موجّهًا أو حاجزًا وقائيًا أو سطرًا من الشيفرة. دراسة محكَّمة في مجلة Scientific Reports التابعة لـ Nature أقرنت أربعة نماذج تعلّم آلي بـ 32 مجموعة بيانات واقعية من عمليات الرعاية الصحية والتمويل والنقل والطقس، ثم تتبّعت صمود كل اقتران مع مرور الوقت منذ آخر تدريب له. تدهورت الجودة في 91% من الاقترانات الـ 128، وهو نمط سمّاه الباحثون تقادم الذكاء الاصطناعي. الحل ليس نموذجًا أفضل. الحل حلقة مراجعة يملكها شخص بعينه.
سبق أن كتبنا عن الوصول بالوكيل إلى الإطلاق بأمان على أربع مراحل. وهذا هو ما يأتي بعد ذلك، وهو الجزء الذي ينال اهتمامًا أقل بكثير ويُحدث ضررًا صامتًا أكبر: ما تفعله في الأسبوع السادس، وفي الأسبوع العشرين.
لماذا يسوء وكيل الذكاء الاصطناعي بعد الإطلاق؟
أربعة أشياء تتدهور، وتتدهور بشكل مستقل عن بعضها. ومعظم الفرق تراقب واحدًا منها فقط.
| ما الذي يتدهور | كيف يبدو | كيف تكتشفه |
|---|---|---|
| سلوك النموذج | السؤال نفسه، والموجّه نفسه، وإجابة أسوأ تُقرأ بالثقة نفسها التي تُقرأ بها الإجابة الصحيحة | أعد تشغيل مجموعة اختبار ثابتة وفق جدول زمني وقارن الدرجات |
| معرفتك | الوكيل يقتبس بدقة سياسة أو سعرًا أو ساعة عمل غيّرتها الشهر الماضي | ضع تاريخًا على مدخلات المعرفة، وراجعها بوتيرة منتظمة |
| نشاطك التجاري | خدمة جديدة، موقع جديد، ساعات موسمية، عرض ترويجي انتهى | اربط تحديثات المعرفة بالتغيير التشغيلي الذي تسبّب فيها |
| النطاق | يُطلب من الوكيل مهام أطول وأكثر تعقيدًا مما حُدِّد له | راقب معدل التحويل إلى إنسان وأنواع المهام الواردة |
الصف الأول يفاجئ الناس. عمود Anwar Ali في HousingWire يسمي هذا انحرافًا سلوكيًا ويفصله عن انحراف البيانات الذي سمعت به معظم الفرق. وهو الأصعب في الاكتشاف بين الاثنين، لأن لا شيء في الإجابة الأسوأ يبدو أسوأ.
كيف يبدو الانحراف فعليًا في نشر حقيقي؟
Anwar Ali، نائب الرئيس الأول ورئيس إدارة المنتجات في BSI Financial Services، نشر رواية عن هذا بالضبط في سبتمبر 2026. شغّل فريقه وكيلًا صوتيًا ونصيًا يجيب عن أسئلة المقترضين استنادًا إلى بيانات حسابات حيّة، خلف حواجز امتثال استغرق ضبطها وقتًا طويلًا. ونجح الأمر. فظلّت نسبة الاحتواء، أي حصة العملاء الذين حُلّت مشكلتهم دون الوصول إلى إنسان، أعلى من متوسط القطاع لأشهر.
ثم انخفضت بنحو ثماني نقاط. ولم يلاحظ أحد ذلك لأسابيع.
برّأ التحقيق الحواجز الوقائية وتدفق المحادثة والتغيرات في سلوك العملاء. كان السبب هو النموذج نفسه، وهو نموذج راسخ من مختبر رائد، ينتج بهدوء إجابات أسوأ على الفئات نفسها من الأسئلة. وخلاصته هي الجزء الجدير بالاقتباس: كان فشلًا في القياس، لا فشلًا في التقنية. فنسبة الاحتواء كانت تُراجَع أسبوعيًا، والمؤشر المتأخر الأسبوعي لا يلتقط انزلاقًا بطيئًا إلا بعد أن يكون عدد كبير من العملاء قد مرّ به.
ما الأرقام التي ينبغي أن تراقبها، وبأي وتيرة؟
اختر مجموعة صغيرة، وحدّد وتيرة لكل رقم، واجعل الوتيرة أقصر من نافذة الضرر. المقياس الذي يُراجَع شهريًا يمنحك شهرًا سيئًا قبل أن يمنحك إشارة. وهذه مقاييس تشغيلية لا مقاييس عائد؛ أما الجانب المالي فتجده في كيف تقيس عائد الذكاء الاصطناعي حين لا تُظهر معظم المشاريع أي عائد.
| المقياس | الوتيرة | ماذا تعني الحركة السيئة |
|---|---|---|
| معدل التحويل إلى إنسان | يوميًا | الوكيل يرفض أو يفشل بوتيرة أعلى، أو أن الأسئلة تغيّرت |
| زمن أول رد | يوميًا | مشكلة تسليم أو طابور، لا مشكلة جودة |
| الحل دون تحويل | يوميًا | المؤشر الكلاسيكي للانحراف. راقب الاتجاه، لا اليوم الواحد |
| معدل "لا يعجبني" على ردود الذكاء الاصطناعي | أسبوعيًا | فريقك يرى شيئًا تخفيه الأرقام الإجمالية |
| معدل الحجز أو التحوّل من المحادثات | أسبوعيًا | الوكيل يجيب لكنه لم يعد يُتمّ الصفقة |
| درجة مجموعة اختبار الانحدار | شهريًا، ومع كل تغيير في النموذج | النموذج أو الإعداد تحرّك من تحتك |
زمن أول رد يستحق مكانًا في تلك القائمة رغم أنه نادرًا ما ينحرف. فقد وجدت دراستنا لـ 32,581 محادثة أن الردود خلال 60 ثانية حققت تحوّلًا بنسبة 35.1%، مقابل 7.1% للردود التي استغرقت من ساعة إلى أربع وعشرين ساعة. السرعة هي المقياس الذي يُشترى الوكيل من أجله، ولذلك فهي الأجدر بأن تُثبت أنها ما زالت قائمة.
كم مرة ينبغي أن تعيد اختبار وكيل الذكاء الاصطناعي؟
احتفظ بمجموعة اختبار انحدار ثابتة من محادثات حقيقية ذات نتائج صحيحة معروفة، وأعد تشغيلها عند ثلاثة محفزات:
- وفق جدول زمني، شهريًا كحد أدنى. هذا ما يحوّل الانحراف إلى رقم بدل أن يبقى حدسًا.
- قبل أي تغيير في النموذج وبعده، بما في ذلك تغيير لم تبدأه أنت. فإذا انتقلت منصتك إلى نموذج أحدث، فهذا تغيير في نظامك.
- بعد أي تعديل جوهري في المعرفة أو التعليمات. إصلاح شكوى واحدة كثيرًا ما يكسر إجابة كانت سليمة.
ابنِها من محادثات لديك بالفعل. عشرون إلى خمسون حالة تغطي أسئلتك الشائعة، وحالاتك الحدّية المحرجة، والحفنة التي يجب ألا يجيب عنها الوكيل وحده. كبيرة بما يكفي لالتقاط انحدار حقيقي، وصغيرة بما يكفي لتشغّلها فعلًا.
أما إعادة قياس النموذج الذي تعمل عليه فدورة منفصلة وأبطأ. كل ربع سنة خيار افتراضي معقول، وهو أسهل بكثير إذا لم يكن إعدادك ملحومًا بمختبر واحد، وهو ما دافعنا عنه في لماذا لا ينبغي أن تبني عملك على نموذج ذكاء اصطناعي واحد.
كيف تبدو حلقة الصيانة الأسبوعية؟
من ثلاثين إلى ستين دقيقة، في الموعد نفسه كل أسبوع:
- اقرأ عشر محادثات حقيقية من أولها إلى آخرها. ليست ملخصات. اختر بعض المحادثات المُعلَّمة وبعضها عشوائيًا، لأن العشوائية هي التي تريك كيف يبدو الوضع الطبيعي.
- افرز كل "لا يعجبني" سجّله فريقك. صنّف كلًا منها في واحدة من ثلاث سلال: المعرفة كانت خاطئة أو ناقصة، أو التعليمات كانت خاطئة، أو كان على الوكيل أن يحوّل المحادثة.
- أصلح السلّة، لا المحادثة. التصحيح الفردي داخل دردشة واحدة لا يعلّم النظام شيئًا. حدّث مدخل المعرفة أو التعليمة أو قاعدة التحويل.
- أعد تشغيل مجموعة الانحدار إذا غيّرت شيئًا محوريًا.
- دوّن ما غيّرته ولماذا. سجل تغييرات مؤرَّخ هو ما يتيح لك الإجابة عن سؤال "متى بدأ هذا؟" بعد ستة أسابيع.
لماذا تفشل المهام الأطول حتى حين يكون النموذج سليمًا؟
هذا قيد تصميمي أكثر منه مهمة صيانة، لكنه يظهر بمظهر التدهور.
قاست مسودة بحثية على arXiv في أغسطس 2026 بعنوان How Fast Do Agents Rot? موثوقية الوكلاء عبر تسعة نماذج و10,664 مسارًا جرى تحليلها. نجاح المهمة يتبع قانونًا هندسيًا تحكمه الموثوقية لكل خطوة، وهي ترتفع مع حجم النموذج لكنها تتشبّع عند مستوى أدنى بكثير من 1 حتى في أقوى الأنظمة. وفي مهمة استخدام الأدوات الوكيلية بمعناها الحقيقي، هبط كل نموذج خضع للاختبار، بما في ذلك نماذج مملوكة واسعة الانتشار، من نجاح شبه تام إلى ما يقارب الصفر خلال ست عشرة خطوة متتابعة. وتتبّع التدهورُ عددَ الخطوات، لا طول السياق.
إنها مسودة بحثية، ومهامها ليست محادثات خدمة عملاء. لكن القراءة العملية تبقى صحيحة: الموثوقية تتراكم نزولًا مع كل خطوة متتابعة، لذا فإن وكيلًا محدَّد النطاق ليجيب ويؤهّل ويحجز يقف على أرض أثبت بكثير من وكيل يدير عملية من خمس عشرة خطوة دون إشراف. وإذا كانت مهمة وكيلك قد اتسعت بهدوء منذ الإطلاق، فتلك مشكلة نطاق ترتدي ثوب مشكلة جودة.
من يملك هذا فعلًا؟
عادةً لا أحد، وهذا هو الاكتشاف الحقيقي في مقال Ali. فرق المنتج تطلق، والهندسة تُبقي البنية التحتية قائمة، والعمليات تدير النشاط، ولا أحد مسؤول عن ملاحظة أن الإجابات صارت أسوأ.
سمِّ شخصًا واحدًا، ولا تسلّم المهمة إلى لجنة. هو من يراقب الأرقام اليومية، ويشغّل الحلقة الأسبوعية، ويملك الصلاحية ليقول إن الوكيل خرج عن مساره وليقلّص نطاقه. وهذا الجزء الأخير هو ما يجعل الدور حقيقيًا. ويقول Ali بصراحة عن البديل: «المراجع الذي لا يملك إلا الختم بالموافقة لا يقدّم رقابة، بل مظهرها فحسب».
أين يقع Entagl من هذا
يستطيع أي شخص في فريقك الإبلاغ عن رد سيئ من الذكاء الاصطناعي مباشرةً من صندوق الوارد الموحّد، مع ملاحظة عمّا كان خطأ. وتصل الردود المُبلَّغ عنها إلى طابور مراجعة، لكل منها حالة، فيصبح للفرز الأسبوعي قائمة عمل بدل اختبار للذاكرة. والمعرفة تعيش في مكان واحد، فإصلاح سؤال شائع أو خدمة أو ساعات عملك يصلحه لـ WhatsApp وInstagram وMessenger وTelegram والدردشة على الويب والبريد الإلكتروني وواجهة البرمجة دفعة واحدة. ولأن الوكلاء الأربعة يتشاركون عقلًا واحدًا، فإن تصحيحًا تجريه للدردشة يصبح صحيحًا أيضًا في المكالمة التالية.
وهناك قطعتان بنيويتان أهم من أي ميزة منفردة. توجيه النماذج غير مرتبط بمختبر واحد: النموذج خلف كل مرحلة إعدادٌ قابل للتغيير، ويمكن ضبط نماذج احتياطية خلفه، فيصبح التغير السلوكي لدى مزوّد ما قرارَ توجيه لا إعادة بناء. والتحويل إلى إنسان مسار أصيل لا حالة فشل، فيكون الرقم الذي يخبرك بوجود انحراف رقمًا تجمعه أصلًا.
وتأسيس الوكيل على نحو صحيح من البداية يجعل كل هذا أرخص، وهو ما نتناوله في كيف تدرّب وكيل ذكاء اصطناعي على معرفة عملك.
ما الذي لا تصلحه الصيانة
هي لا تجعل دقيقًا وكيلًا لم يُؤسَّس جيدًا قط. ومراقبة وكيل سيّئ التحديد تمنحك قياسًا دقيقًا للشيء الخطأ.
وهي لا تلغي الهلوسة. فالضوابط التي تقلّلها منظومة منفصلة، نغطيها في كيف توقف وكيل الذكاء الاصطناعي عن الهلوسة.
وتحرّكُ رقمٍ ما ليس تشخيصًا. فقد يرتفع معدل التحويل إلى إنسان لأن الوكيل صار أسوأ، أو لأنك أطلقت حملة إعلانية جلبت نوعًا مختلفًا من الأسئلة. اقرأ المحادثات قبل أن تغيّر أي شيء. ولهذا فإن الخطوة الأولى في الحلقة الأسبوعية هي القراءة، لا القياس.
الأسئلة الشائعة
كم مرة ينبغي أن تفحص أداء وكيل الذكاء الاصطناعي؟
راقب معدل التحويل إلى إنسان وزمن أول رد ومعدل الحل يوميًا، فهذه هي المؤشرات المبكرة للانزلاق. وراجع الردود المُبلَّغ عنها ومعدل التحوّل أسبوعيًا. وأعد تشغيل مجموعة اختبار الانحدار شهريًا ومع كل تغيير في النموذج. الاكتفاء بمراجعة أسبوعية هو ما جعل انخفاضًا بثماني نقاط في إحدى عمليات النشر بقطاع الخدمات المالية يمر دون ملاحظة لأسابيع.
هل يمكن أن يسوء وكيل الذكاء الاصطناعي دون أن يتغير شيء؟
نعم، لسببين منفصلين يستحقان الفصل بينهما. الانحراف السلوكي هو ما تغفل عنه معظم الفرق: يمكن لنموذج مستضاف أن يبدأ بإنتاج إجابات أسوأ على الأسئلة نفسها دون أي تغيير في موجّهاتك أو إعداداتك، وهو ما وثّقه Anwar Ali في BSI Financial Services حين انخفضت نسبة الاحتواء بنحو ثماني نقاط. والسبب الآخر هو تقادم الذكاء الاصطناعي: نموذج ثابت يصبح أقل دقة لمجرد مرور مزيد من الوقت منذ تدريبه، وهو ما رصدته Scientific Reports التابعة لـ Nature في 91% من الـ 128 اقترانًا بين نموذج ومجموعة بيانات اختبرتها. آليتان مختلفتان، والعَرَض نفسه. ومجموعة اختبار انحدار ثابتة تلتقط الاثنتين.
كيف تعرف إن كانت المشكلة في النموذج أم في قاعدة معرفتك؟
أعد تشغيل مجموعة اختبار الانحدار الثابتة. فإذا فشلت الآن حالات كانت تنجح من قبل بينما المعرفة الأساسية لم تتغير، فالنموذج هو الذي تحرّك. وإذا كان الوكيل يجيب بثقة انطلاقًا من معلومات قديمة ببساطة، فمعرفتك هي التي تحرّكت. مجموعة الاختبار هي ما يفصل بين الاثنين، ولهذا يجب أن تكون ثابتة وأن يُعاد استخدامها بدل إعادة كتابتها في كل مرة.
من ينبغي أن يملك صيانة وكيل الذكاء الاصطناعي في شركة صغيرة؟
شخص واحد باسمه، وعادةً من يملك تجربة العميل لا من هو الأكثر تقنية. فالعمل هو قراءة المحادثات، وفرز الردود المُبلَّغ عنها، وتحديث معرفة العمل. لا شيء من ذلك يتطلب هندسة، وكله يتطلب شخصًا يملك الصلاحية لتقليص نطاق الوكيل حين تقول الأرقام ذلك.
هل يغني النموذج الأفضل عن الحاجة إلى المراقبة؟
لا. الموثوقية لكل خطوة تتحسن مع حجم النموذج لكنها لا تبلغ 1، لذا تظل سلاسل المهام الأطول تتدهور، ولا يزال بإمكان نموذج أقوى أن يغيّر سلوكه من تحتك. النماذج الأفضل ترفع الأرضية. وهي لا تلغي الحاجة إلى مراقبة الأرضية.
ابدأ بالرقم الذي لا تجمعه
أنت شبه مؤكد تدير مراجعة أرقام أسبوعية في مكان آخر من هذا العمل، وتحتفظ بسجل تغييرات لنظام آخر، وتعرف كيف تفحص العمل فحصًا عشوائيًا للتأكد من جودته. ويصل Ali إلى الخلاصة نفسها في نهاية عموده: القدرة موجودة عادةً بالفعل، ولا يكاد أحد يوجّهها نحو الذكاء الاصطناعي الذي يتحدث إلى عملائه.
اختر مؤشرًا مبكرًا واحدًا لا تراقبه يوميًا، وعيّن له مالكًا، وضع ثلاثين دقيقة في التقويم للقراءة الأسبوعية. هذا وحده كان كفيلًا بالتقاط الانحراف الموصوف هنا.
ولترى كيف يعمل طابور الردود المُبلَّغ عنها والمعرفة المشتركة وضوابط التحويل على مساحة عمل حقيقية، احجز عرضًا توضيحيًا مدته 30 دقيقة وسنمرّ بمحادثاتك أنت خلاله.
المصادر: Nature Scientific Reports، "Temporal quality degradation in AI models" (2022)؛ HousingWire، Anwar Ali، "The silent failure mode: what happens when your AI model quietly gets worse" (سبتمبر 2026)؛ arXiv:2609.01660، "How Fast Do Agents Rot?" (أغسطس 2026)؛ دراسة Entagl لسرعة الاستجابة (2026). جرى التحقق من الأرقام حتى سبتمبر 2026.