AI News · industry
ذكاء اصطناعي يقرأ الصور والمستندات: ما الذي تغيّر في 2026
في عام 2026، تعلّمت نماذج الرؤية واللغة قراءة الصورة والإيصال وملف الـPDF الذي يرسله العميل، لتحوّل فهم المستندات إلى شيء يمكن للأعمال التصرّف بناءً عليه.

قطع الذكاء الاصطناعي الذي يقرأ الصور والمستندات عتبة حقيقية في عام 2026. لم تعد أحدث النماذج متعددة الوسائط (نماذج الرؤية واللغة) تكتفي بوصف صورة. فهي تحلّل إيصالًا، وتقرأ ملاحظة مكتوبة بخط اليد، وتستخرج الحقول من ملف PDF، وتفهم لقطة الشاشة التي يلصقها العميل داخل محادثة. ومن المتوقّع الآن أن ينمو سوق المعالجة الذكية للمستندات من 14.16 مليار دولار في عام 2026 إلى 91.02 مليار دولار بحلول عام 2034 (Fortune Business Insights)، كما أن المتصدّرين في النماذج مفتوحة الأوزان على أصعب معايير قياس المستندات صاروا صينيين بشكل متزايد لا أمريكيين. وبالنسبة لأي عمل يبيع عبر المحادثات، فإن هذا التحوّل مهمّ، لأن المزيد من العملاء صاروا يبدؤون بصورة بدلًا من جملة.
هذا هو جانب الفهم من قصة الذكاء الاصطناعي والوسائط. لقد تناولنا جانب التوليد في كيف بلغ توليد الصور بالذكاء الاصطناعي مستوى الإنتاج للمنتجات والإبداع الإعلاني؛ وهنا نسلك الاتجاه المعاكس: لا صناعة صورة، بل قراءتها.
ما الذي تغيّر فعليًا في 2026؟
قراءة مستند مشكلة أصعب مما تبدو، وقد ظلّت لسنوات تُحلّ بواسطة تقنيات التعرّف الضوئي على الحروف (OCR) الهشّة أحادية الغرض، التي كانت تعيد جدارًا من النصّ دون أي فكرة عن معنى أيّ منه. ثلاثة أمور تغيّرت في عام 2026:
- التخطيط، لا الحروف فحسب. تعيد نماذج المستندات الحديثة بنية، لا مجرد كتلة نصّية. فنموذج OCR 4 من Mistral، الذي صدر في 23 يونيو 2026، يعيد مربّعات إحاطة، وكتلًا مصنّفة (عناوين، جداول، معادلات، تواقيع)، ودرجات ثقة لكل كلمة إلى جانب النصّ، ويغطّي 170 لغة في نموذج صغير بما يكفي لاستضافته ذاتيًا في حاوية واحدة (Mistral AI). هذه البنية هي ما يتيح للبرمجيات أن تتصرّف بناءً على المستند بدل مجرد نسخه حرفيًا.
- نماذج متعددة الوسائط العامة صارت بارعة فعلًا مع المستندات. النماذج الرائدة نفسها التي يستخدمها الناس للنصّ صارت الآن تقرأ صورة هاتف لفاتورة أو استمارة وتجيب عن أسئلة حولها، بحيث يستطيع نموذج واحد التعامل مع رسالة العميل سواء وصلت ككلمات أو صورة أو صفحة ممسوحة ضوئيًا.
- النماذج المفتوحة الصغيرة لحقت بالرَّكب. كان فهم المستندات يتطلّب في السابق أكبر النماذج المغلقة. أما في عام 2026، فقد بدأت نماذج الرؤية واللغة مفتوحة الأوزان والمدمجة تتصدّر معايير القياس العامة للمستندات، وهذا يغيّر معادلة التكلفة والتحكّم في البيانات للجميع.
من يتصدّر فهم المستندات والصور بالذكاء الاصطناعي الآن؟
لا يوجد فائز وحيد، والإجابة الصادقة أنها تنقسم بحسب الفئة. حتى يوليو 2026، على لوحة صدارة OmniDocBench 1.5 العامة لتحليل المستندات وفهمها، تتصدّر القمة نماذج صينية ومفتوحة الأوزان: يتصدّر MiniMax M3 بنتيجة 0.916، يليه مباشرةً Qwen3.7-Plus وQwen3.6 Plus من Alibaba بنتيجتَي 0.914 و0.912، متقدّمَين على GPT-5.4 من OpenAI بنتيجة 0.891. أما بالنسبة للاستدلال العام متعدد الوسائط (قراءة مشهد، أو مخطّط، أو واجهة مستخدم)، فما زالت النماذج الأمريكية المغلقة الرائدة تحدّد الوتيرة: حتى يوليو 2026، تتصدّر أحدث النماذج الرائدة من OpenAI (GPT-5.5) وGoogle (Gemini 3.1 Pro) وAnthropic (Claude Fable 5، الذي أُعيد نشره بوصفه نموذجها الأكثر قدرة المتاح عمومًا في 1 يوليو 2026، وفق MarkTechPost) قمة مؤشر الذكاء المستقلّ من Artificial Analysis.
وفي ما يلي الميدان العالمي، مرتّبًا بحسب النقطة التي يبرع فيها كل نموذج. هذا الترتيب يتغيّر كثيرًا، لذا تعامَل معه كلقطة من يوليو 2026، لا كترتيب دائم.
| النموذج | المختبر (الدولة) | الأوزان | الأقوى في |
|---|---|---|---|
| MiniMax M3 | MiniMax (الصين) | مفتوح | تحليل المستندات، متصدّر OmniDocBench 1.5 |
| Qwen3-VL / Qwen3.x | Alibaba (الصين) | مفتوح | التعرّف الضوئي متعدد اللغات وأسئلة المستندات |
| PaddleOCR-VL / Unlimited-OCR | Baidu (الصين) | مفتوح | التعرّف الضوئي المدمج للمستندات الطويلة |
| DeepSeek-OCR | DeepSeek (الصين) | مفتوح | استخراج النصّ الضوئي الكفء |
| Mistral OCR 4 | Mistral (فرنسا) | واجهة برمجية + استضافة ذاتية | الاستخراج المهيكل للمستندات، 170 لغة |
| GPT-5.5 | OpenAI (الولايات المتحدة) | مغلق | الاستدلال العام متعدد الوسائط |
| Gemini 3.1 Pro | Google (الولايات المتحدة) | مغلق | المدخلات متعددة الوسائط والمخطّطات والمهام العلمية |
| Claude Fable 5 | Anthropic (الولايات المتحدة) | مغلق | الاستدلال الرائد عبر النصّ والصور المختلطة |
هناك نمطان يصمدان حتى مع تبدّل أرقام الإصدارات. أولًا، تتركّز الريادة مفتوحة الأوزان في فهم المستندات بشكل غير متناسب لدى الصين، بما يردّد ما وجدناه عبر نماذج النصّ في نظرتنا إلى ميدان النماذج اللغوية المفتوحة والمغلقة والعالمية. ثانيًا، تتقارب النماذج المتخصّصة في المستندات (Mistral OCR 4، وعائلة OCR-VL المدمجة) والنماذج العامة متعددة الوسائط نحو المهام نفسها من طرفين متقابلين، فتعتمد الأداة المناسبة على ما إذا كنت تحتاج إلى استخراج مهيكل بكمية كبيرة أو استدلال مفتوح حول ما تُظهره صورة.
لماذا تكون "قراءة" مستند أصعب من توليد صورة؟
توليد صورة يكافئ المعقولية. أما قراءتها فتتطلّب الدقّة، لأن رقمًا خاطئًا واحدًا في فاتورة أو جرعة قُرئت خطأً يُعدّ خطأً حقيقيًا، لا خيارًا أسلوبيًا. وقد كانت Mistral صريحة بشكل غير معتاد في هذا الشأن حين أطلقت OCR 4: فقد أشارت إلى أن معايير القياس الآلية الشائعة تعاقب المخرجات الصحيحة بسبب أمور مثل الترميز الرياضي المكافئ، وترتيب القراءة متعدد الأعمدة، وأخطاء التوصيف في البيانات المرجعية، ولذلك أجرت تقييمًا أعمى لتفضيلات البشر على أكثر من 600 مستند حقيقي عبر أكثر من 12 لغة، حيث فضّل المقيّمون مخرجات OCR 4 في أغلب الأحيان (Mistral AI).
الدرس المستفاد لأي عمل ليس أيّ نموذج يتصدّر جدولًا هذا الشهر. بل إن ذكاء المستندات يحتاج إلى ضوابط وإلى تدخّل بشري في أي أمر عالي المخاطر، وهو الموقف نفسه الذي ندافع عنه في لماذا التدخّل البشري هو نمط التصميم الذي يُثمر. فدرجات الثقة والكتل المصنّفة موجودة كي يتمكّن شخص من مراجعة الـ5% التي لا يكون النموذج متأكّدًا منها، بدلًا من إعادة إدخال 100% منها يدويًا.
ماذا يعني هذا للأعمال التي تبيع عبر المحادثات؟
معظم هذه الأخبار موجَّه إلى خطوط معالجة المستندات في المؤسسات: الفواتير والعقود والسجلّات الطبية. لكن القدرة نفسها تغيّر بهدوء المحادثات اليومية مع العملاء، لأن العملاء نادرًا ما يصفون الأشياء بنصّ نظيف. فهم يرسلون صورة للمنتج الذي يريدونه، أو لقطة شاشة لخطأ، أو صورة إيصال لاسترجاع، أو قائمة طعام، أو قياسًا مكتوبًا بخط اليد. السرعة ما زالت تحسم البيعة (وجدت دراسة سرعة الاستجابة لدينا القائمة على 32,581 محادثة أن الردود التي تقلّ عن 60 ثانية حقّقت تحويلًا بنسبة 35.1%، أي بزيادة تتراوح بين 2.9 و4.9 أضعاف مقارنة بالردود الأبطأ)، لكن السرعة لا تنفع إلا إذا كان الردّ يفهم فعلًا ما أرسله العميل.
وهنا تتفوّق القراءة على التوليد بالنسبة لأي عمل خدمي. فـوكيل المحادثة من Entagl لرسائل Instagram وWhatsApp المباشرة يقرأ الصور والملاحظات الصوتية وملفات PDF التي يرسلها العميل داخل المحادثة، ثم يتصرّف بناءً عليها: فيجيب عن سؤال المنتج، ويلتقط العميل المحتمل، ويحجز الموعد، عبر WhatsApp وInstagram وFacebook Messenger وTelegram والدردشة على الويب والبريد الإلكتروني وواجهة برمجة التطبيقات، ويردّ بلغة العميل نفسها ويبدّلها في منتصف المحادثة عند الحاجة. ولأن Entagl تنسّق بين النماذج بدلًا من أن تكون نموذجًا واحدًا، فإن بإمكانها التوجيه إلى أي نموذج متعدد الوسائط يكون الأنسب للمهمة كلما أُعيد ترتيب الميدان، بحيث لا يراهن أي عمل بعملياته على مختبر واحد. المقصود ليس الصورة. المقصود أن العميل الذي يرسل صورة في الساعة 11 مساءً يحصل على إجابة صحيحة وموعد محجوز بدلًا من "يُرجى وصف مشكلتك"، وهو نمط نفصّله في لماذا تقود الرسائل المباشرة الإيرادات في التجارة القائمة على المحادثة.
القراءة متعددة اللغات مهمة هنا أيضًا. فتغطية OCR 4 من Mistral لـ170 لغة وقوة Qwen في الأنظمة الكتابية غير اللاتينية هي القدرة نفسها التي تتيح لوكيل قراءة إيصال بالعربية أو قائمة طعام باليونانية، وهي القرين على جانب القراءة لـتحويل العملاء المحتملين الناطقين بلغات أجنبية عبر الدعم متعدد اللغات بالذكاء الاصطناعي.
كيف تفكّر في تبنّي الذكاء الاصطناعي متعدد الوسائط
- طابِق الأداة مع المهمة. أتحتاج إلى استخراج حقول مهيكلة من آلاف الفواتير؟ إذًا يتفوّق نموذج مستندات متخصّص من حيث التكلفة والزمن. أتحتاج إلى الإجابة عن سؤال مفتوح حول صورة في منتصف محادثة؟ إذًا نموذج عام متعدد الوسائط هو الأنسب.
- وازِن بين المفتوح والمغلق على أساس التحكّم في البيانات، لا الدرجات فقط. النماذج القابلة للاستضافة الذاتية ومفتوحة الأوزان تُبقي المستندات الحسّاسة داخل بيئتك، وهو أمر حاسم لسير العمل الخاضع للتنظيم. وكثيرًا ما تتصدّر النماذج المغلقة الرائدة في الاستدلال في أصعب الحالات.
- أبقِ إنسانًا على الـ5% عالية المخاطر. استخدم درجات الثقة لتوجيه القراءات غير المؤكّدة إلى شخص. أتمِت الأغلبية السهلة؛ واحكُم على الباقي.
- لا تراهن على مختبر واحد. لوحة الصدارة يُعاد ترتيبها شهريًا. والأنظمة المستقلّة عن النموذج تتبنّى أفضل نموذج جديد دون إعادة بناء.
شاهده يقرأ محادثة حقيقية. أرسِل صورة أو ملاحظة صوتية أو ملف PDF إلى وكيل Entagl وراقبه وهو يجيب ويحجز. احجز عرضًا توضيحيًا مدّته 30 دقيقة.
الأسئلة الشائعة
ما هو نموذج الرؤية واللغة؟
نموذج الرؤية واللغة (VLM)، ويُسمّى أيضًا النموذج متعدد الوسائط، هو نظام ذكاء اصطناعي يأخذ الصور والنصّ معًا كمدخلات ويستدلّ على كليهما. وخلافًا لتقنية OCR القديمة التي كانت تحوّل البكسلات إلى حروف فحسب، يستطيع نموذج الرؤية واللغة قراءة مستند وفهم تخطيطه والإجابة عن أسئلة حول ما يُظهره، على سبيل المثال "أي بند تمّ استرجاعه؟" من صورة إيصال.
أي نموذج ذكاء اصطناعي هو الأفضل في قراءة المستندات في 2026؟
لا يوجد أفضل وحيد. حتى يوليو 2026، يتصدّر MiniMax M3 (الصين، مفتوح الأوزان) معيار قياس المستندات العام OmniDocBench 1.5، مع نماذج Qwen من Alibaba خلفه بقليل، بينما يُبلّغ Mistral OCR 4 (فرنسا) عن أعلى نتيجة على OlmOCRBench للاستخراج المهيكل والاستضافة الذاتية. أما بالنسبة للاستدلال العام حول الصور، فتتصدّر النماذج الأمريكية المغلقة (GPT-5.5، وGemini 3.1 Pro، وClaude Fable 5) مؤشّرات الذكاء الإجمالية. ويعتمد الاختيار الصحيح على ما إذا كنت تحتاج إلى استخراج مهيكل بكمية كبيرة أو استدلال بصري مفتوح.
هل نماذج الذكاء الاصطناعي مفتوحة المصدر جيّدة بما يكفي لقراءة المستندات؟
نعم. في عام 2026، بدأت نماذج الرؤية واللغة المدمجة ومفتوحة الأوزان تتصدّر معايير القياس العامة للمستندات، ويمكن لنماذج مثل Mistral OCR 4 أن تعمل باستضافة ذاتية في حاوية واحدة. وكثيرًا ما تكون النماذج المفتوحة هي الخيار الأفضل حين يجب أن تبقى البيانات داخل بنيتك التحتية الخاصة لأسباب تتعلّق بالخصوصية أو الامتثال.
هل يستطيع وكيل ذكاء اصطناعي فهم صورة يرسلها العميل في محادثة؟
نعم. تقرأ الوكلاء الحديثة متعددة الوسائط الصور والملاحظات الصوتية وملفات PDF داخل المحادثة وتتصرّف بناءً عليها. فوكيل المحادثة من Entagl، على سبيل المثال، يقرأ ما يرسله العميل عبر WhatsApp وInstagram وقنوات أخرى، ثم يجيب عن السؤال، ويلتقط العميل المحتمل، ويحجز الموعد، بدلًا من مطالبة العميل بإعادة كتابة كل شيء كنصّ.
هل يحلّ ذكاء المستندات محلّ المراجعة البشرية؟
لا، ولا ينبغي له ذلك في أي أمر عالي المخاطر. فجيل 2026 يعيد درجات الثقة والكتل المصنّفة تحديدًا كي يتمكّن شخص من مراجعة الحصّة الصغيرة التي لا يكون النموذج متأكّدًا منها. والنمط الموثوق هو أتمتة الأغلبية السهلة والإبقاء على تدخّل بشري في الباقي.
المصادر: Fortune Business Insights: سوق المعالجة الذكية للمستندات؛ Mistral AI: تقديم OCR 4 (23 يونيو 2026)؛ LLM Stats: لوحة صدارة OmniDocBench 1.5 (محدّثة يوليو 2026)؛ مؤشر الذكاء من Artificial Analysis؛ MarkTechPost: Anthropic تعيد نشر Claude Fable 5 (1 يوليو 2026). إصدارات النماذج وترتيباتها لقطة من يوليو 2026 ويُعاد ترتيبها بشكل متكرّر. بيانات Entagl المباشرة مأخوذة من دراسة سرعة الاستجابة من Entagl (2026).