AI News · industry
الذكاء الاصطناعي الصوتي ثنائي الاتجاه: نماذج تستمع وهي تتحدث
أطلقت OpenAI وGoogle وAlibaba وStepFun في سبتمبر 2026 نماذج صوتية يمكنك مقاطعتها في منتصف الجملة. ما الذي تغيّر، ومن يتصدّر كل اختبار، وماذا يعني ذلك للمكالمات الهاتفية في الأعمال.

الذكاء الاصطناعي الصوتي ثنائي الاتجاه (full-duplex) هو نموذج واحد يستمع ويتكلم في الوقت نفسه، فيستطيع المتصل أن يقاطع أو يتوقف أو يقول "آه، صحيح" من دون أن تنقطع المحادثة. حتى 7 أكتوبر 2026، يتصدّر نموذج GPT-Live-1 من OpenAI مؤشر Speech to Speech لدى Artificial Analysis بـ83.2 نقطة، متقدماً بفارق ضئيل على Gemini 3.8 Live Extended Thinking من Google بـ82.6، في حين تتصدّر StepFun الصينية اختبار مدى طبيعية المحادثة بنسبة 98.9%. وقد صدرت النماذج الثلاثة أو حُدّثت خلال الأشهر الثلاثة الماضية.
إذا كانت أعمالك تعتمد على الرد على الهاتف، فسبتمبر 2026 هو الشهر الذي تغيّرت فيه التقنية التي تقوم عليها مكالمات الذكاء الاصطناعي.
ما معنى "ثنائي الاتجاه"، ولماذا يهمّ في المكالمة الهاتفية؟
كانت معظم وكلاء الهاتف بالذكاء الاصطناعي المبنية قبل 2026 تعمل كسلسلة تتابع. يحوّل نظام تحويل الكلام إلى نص كلمات المتصل إلى نص، ثم يكتب نموذج لغوي ردّاً، ثم يقرؤه نظام تحويل النص إلى كلام. كل انتقال يضيف تأخيراً، والنظام مضطر إلى تخمين اللحظة التي أنهى فيها المتصل كلامه. إن خمّن مبكراً تكلّم فوقه، وإن خمّن متأخراً ساد صمت محرج.
أما النموذج ثنائي الاتجاه فيؤدي الاستماع والكلام داخل شبكة واحدة وبشكل متواصل. يمكنه أن يسمع "عذراً، اجعلها يوم الخميس بدلاً من ذلك" وهو لا يزال في منتصف جملته، فيغيّر مساره. ويمكنه أن يميّز بين متصل توقف عن الكلام ومتصل يفكّر.
ويظهر الفرق على أرض الواقع. تفيد OpenAI بأن تطبيق تعلّم اللغات Speak خفّض المقاطعات أثناء توقفات المتعلمين للتفكير بنحو 80% مقارنة بالأنظمة السابقة القائمة على تبادل الأدوار. وقال عميل آخر ورد في الإعلان نفسه، وهو يبني محادثات موجّهة للمرضى، إن الانتقال من إعداده المتسلسل أزال 23,000 سطر من الشيفرة البرمجية.
ربما أغلقت أنت نفسك الخط يوماً في وجه روبوت صوتي لأنه ظل يقاطعك.
ما الذي صدر بين يوليو وأكتوبر 2026؟
| النموذج | المختبر | المنطقة | الأوزان | تاريخ الإصدار | أبرز ما يميّزه |
|---|---|---|---|---|---|
| GPT-Live-1 | OpenAI | الولايات المتحدة | مغلقة (API) | 10 سبتمبر 2026 | يحيل الاستدلال الصعب واستدعاءات الأدوات إلى نموذج خلفي منفصل؛ يدعم الاتصالات الهاتفية |
| Gemini 3.8 Live / 3.8 Live Extended Thinking | Google DeepMind | الولايات المتحدة | مغلقة (API) | 15 سبتمبر 2026 | ينفّذ استدعاءات الأدوات في الخلفية بينما يواصل الحديث؛ أكثر من 97 لغة |
| StepAudio 3 Realtime | StepFun | الصين | مغلقة (API، نسخة تجريبية) | 15 سبتمبر 2026 | أعلى درجة في ديناميكيات المحادثة على Artificial Analysis |
| Qwen-Audio-3.1-Realtime | Alibaba Qwen | الصين | مغلقة (API) | سبتمبر 2026 | خفض في سعر النموذج الفوري بنحو 85% |
| Grok Voice Think Fast 2.0 | xAI | الولايات المتحدة | مغلقة (API) | 29 يوليو 2026 | أعلى معدل لإنجاز المهام على Artificial Analysis |
| NemotronLabs VoiceChat 11B | NVIDIA | الولايات المتحدة | أوزان مفتوحة | أغسطس 2026 | أول نموذج مفتوح ثنائي الاتجاه يدعم استدعاء الأدوات |
| Raon-SpeechChat-9B | Krafton | كوريا الجنوبية | أوزان مفتوحة | أبريل 2026 | أسرع زمن حتى أول صوت في لوحة الترتيب (الإنجليزية فقط) |
| Step-Audio R1.1 (Realtime) | StepFun | الصين | أوزان مفتوحة | في وقت سابق من 2026 | نموذج كلام فوري مفتوح بدرجات استدلال قوية |
المصادر: OpenAI، Google، وثائق StepFun، The Decoder عن Qwen-Audio-3.1، xAI، NVIDIA على Hugging Face، Krafton على Hugging Face، StepFun على Hugging Face.
يتكرر نمطان في هذه القائمة. الأول أن كل نموذج متقدم بات يفصل بين "مواصلة الحديث" و"إنجاز العمل". فـGPT-Live-1 يفوّض الاستدلال إلى نموذج نصي خلفي، وGemini 3.8 Live يستدعي الأدوات بشكل غير متزامن، وStepFun تصف نموذجها بأنه يفكّر وهو يتكلم. والثاني أن فئة الأوزان المفتوحة تضم الآن نموذجاً ثنائي الاتجاه قادراً على استدعاء الأدوات في منتصف المحادثة، وهي قدرة لم تكن متاحة حتى هذا الصيف إلا في واجهات API المستضافة.
أي نموذج صوتي هو الأفضل حالياً؟
لا يوجد فائز واحد، ومن يسمّي نموذجاً بعينه من دون أن يحدد "في أي اختبار" فهو يحاول أن يبيعك شيئاً. تجمع Artificial Analysis أربعة اختبارات في مؤشرها: الاستدلال الكلامي، والأداء الوكيلي في مهام خدمة العملاء ضمن τ-Voice، وتفضيلات الساحة، وإنجاز المهام. وتنشر ديناميكيات المحادثة بشكل منفصل. حتى 7 أكتوبر 2026:
| الاختبار (Artificial Analysis) | المتصدّر | الدرجة | يليه عن قرب |
|---|---|---|---|
| مؤشر Speech to Speech العام | GPT-Live-1 (خلفية Astra، متوسط) | 83.2 | Gemini 3.8 Live Extended Thinking (High) بـ82.6؛ Grok Voice Think Fast 2.0 High بـ81.3 |
| الاستدلال الكلامي (Big Bench Audio) | StepAudio 3 Realtime (StepFun) | 99.7% | Qwen Audio 3.0 Realtime Plus بـ99.2%؛ Qwen3.5 Omni Plus Realtime بـ98.7% |
| الأداء الوكيلي (مهام خدمة العملاء في τ-Voice) | GPT-Live-1 (خلفية Astra، متوسط)، تجربة واحدة | 74.5% | Gemini 3.8 Live Extended Thinking (High) بـ68.6% |
| ديناميكيات المحادثة (التوقفات، تبادل الأدوار، المقاطعات) | StepAudio 3 Realtime (StepFun) | 98.9% | Qwen Audio 3.0 Realtime Plus بـ98.4%؛ GPT-Live-1 (Sol، منخفض) بـ97.3% |
| إنجاز المهام في Speech Agent Arena | Grok Voice Think Fast 2.0 High | 94.6% | Gemini 3.8 Live بـ93.2% |
إليك كيف تقرأ هذا الجدول. في المؤشر العام، تقف OpenAI وGoogle وxAI على مسافة نقطتين من بعضها، وهذا تعادل من الناحية العملية. أما في الاستدلال الكلامي وفي مدى طبيعية المحادثة، فالصدارة للنماذج الصينية: StepFun وAlibaba تتفوقان على كل نموذج أمريكي في الاختبارين. وتقدّم OpenAI في اختبار خدمة العملاء قائم على تجربة واحدة فقط، لذا تعامل معه على أنه مؤقت. وفجوة السعر حقيقية: تصنّف Artificial Analysis نموذج Qwen Audio 3.0 Realtime Plus من Alibaba بوصفه الأرخص بين النماذج التي تتابعها لكل ساعة من الصوت المُدخل.
لاحظ أن نموذج Qwen-Audio-3.1-Realtime الأحدث من Alibaba لم يكن قد حصل على درجة في لوحة الترتيب عند مراجعتنا، لذا تشير صفوف Alibaba أعلاه إلى الإصدار 3.0.
أين لا تزال النماذج الجديدة مقصّرة؟
منشورات الإطلاق متفائلة. جداول المقاييس أكثر صدقاً.
- أن تكون طبيعياً وأن تنجز المهمة مهارتان مختلفتان. يحصل نموذج PersonaPlex المفتوح من NVIDIA على 91.0% في ديناميكيات المحادثة، لكنه يحصل على 19% في الاستدلال الكلامي ضمن جدول Artificial Analysis نفسه. قد يبدو النموذج سلساً ومع ذلك يخطئ في الحجز.
- الاستماع الأفضل قد يعني توقفاً أبطأ. تُظهر النتائج التقنية لـAlibaba نفسها، كما لخّصتها MarkTechPost، أن نموذجها تحسّن كثيراً في تجاهل الكلام غير الموجّه إليه، لكن معدل استئنافه غير المرغوب بعد المقاطعات ارتفع من 0.035 إلى 0.130، ويحتاج إلى 1.116 ثانية ليتوقف عند مقاطعته مقابل 0.383 ثانية لـGPT-Realtime-2.
- مهام خدمة العملاء لم تُحلّ بعد. حتى أفضل نموذج على τ-Voice ينجز نحو ثلاث من كل أربع مهام محاكاة في قطاعات الطيران والتجزئة والاتصالات. أما الربع الباقي فيفشل.
- الأوزان المفتوحة متفاوتة. يحصل نموذج Step-Audio R1.1 المفتوح من StepFun على 97.6% في الاستدلال الكلامي، أي بفارق عُشر نقطة خلف أفضل نماذج Google (Gemini 3.8 Live Extended Thinking بـ97.7%) ومتقدماً على كل نماذج OpenAI وxAI. لكن لا يملك أي نموذج مفتوح درجة في خدمة العملاء على τ-Voice حتى الآن، وتشير مراجعة AI Weekly لبطاقة نموذج NVIDIA إلى أنه يختار الأداة الصحيحة في 82.5% من الحالات، لكنه يملأ التفاصيل بشكل صحيح في 44.2% فقط. راجع ترخيص كل نموذج قبل أن تبني عليه.
ماذا يعني هذا لأعمال تستقبل المكالمات؟
الخلاصة العملية أن قناة الهاتف أصبحت أكثر جدوى للعمل الحقيقي، وأقل تسامحاً مع الأنظمة البطيئة. فالسرعة تحسم المبيعات أصلاً في الرسائل النصية. في دراسة سرعة الاستجابة من Entagl، تحوّلت المحادثات التي رُدّ عليها خلال 60 ثانية بنسبة 35.1%، مقابل 12.2% عند الرد خلال 5 إلى 60 دقيقة، وذلك عبر 32,581 محادثة. والمكالمة الهاتفية هي أقل القنوات صبراً على الإطلاق.
ثلاثة أمور تفعلها في ضوء هذه الأخبار:
- اختبر المقاطعات، لا العروض التجريبية. اتصل بوكيلك الذكي وقاطعه في منتصف الجملة، وغيّر الموعد في منتصف الطريق، والزم الصمت أربع ثوانٍ. يسرد دليلنا لتقييم وكيل الهاتف بالذكاء الاصطناعي السيناريوهات التي تستحق التجربة.
- احكم على الفعل، لا على الصوت. الصوت اللطيف الذي يحجز الموعد الخطأ أسوأ من صوت عادي يحجز الموعد الصحيح. تأكد من أن الموعد أو الطلب أو معاودة الاتصال تصل فعلاً إلى نظامك.
- لا ترتبط بنموذج صوتي واحد. في 15 سبتمبر قالت Google إن Gemini 3.8 Live Extended Thinking احتل المرتبة الأولى في مؤشر Artificial Analysis؛ وبعد ثلاثة أسابيع يقف GPT-Live-1 فوقه بـ0.6 نقطة. عرضنا الحجة العامة في لماذا لا ينبغي أن تبني أعمالك على نموذج ذكاء اصطناعي واحد، والصوت هو المجال الذي يكون فيه الأثر أشدّ.
أين يأتي دور Coordinator من Entagl؟
يتولى Coordinator من Entagl المكالمات الواردة والصادرة عبر أرقام الهاتف ومكالمات WhatsApp (على الأرقام المدعومة، وبإذن العميل حيث يشترط WhatsApp ذلك)، مستخدماً نماذج أصلية تحوّل الكلام إلى كلام مباشرة بدلاً من سلسلة تتابع. وطبقته الصوتية مصممة لتبديل النموذج الأساسي من دون إعادة بناء الوكيل: يعمل Gemini Live افتراضياً، ويجري طرح النماذج الفورية من OpenAI كخيار ثانٍ. وقبل أن يتصل، يقرأ ملخصات محادثات العميل الأخيرة ومواعيده ومكالماته السابقة، فتبدأ مكالمة التأكيد أو معاودة الاتصال المطلوبة وهي تحمل السياق بدلاً من "كيف يمكنني مساعدتك؟". وتترك كل مكالمة نصاً مكتوباً في سجل العميل.
لمعرفة موقع المكالمات عبر رحلة العميل، اطّلع على الصوت بالذكاء الاصطناعي لخدمة العملاء والمبيعات. وللاستخدام الأكثر شيوعاً، تستعرض حصيلة أبحاثنا حول التغيّب عن المواعيد ما تغيّره مكالمات التأكيد فعلاً.
هل تريد أن تسمع كيف تبدو مكالمة ذكاء اصطناعي تعرف السياق كاملاً في حالة الاستخدام الخاصة بك؟ احجز عرضاً توضيحياً مدته 30 دقيقة.
FAQ
ما الفرق بين الذكاء الاصطناعي الصوتي ثنائي الاتجاه وأحادي الاتجاه؟
الذكاء الاصطناعي الصوتي أحادي الاتجاه (القائم على تبادل الأدوار) يتناوب على الكلام: ينتظر حتى تتوقف ثم يجيب. أما ثنائي الاتجاه فيستمع ويتكلم في آن واحد، فيستطيع التفاعل مع المقاطعات، والإشارات القصيرة مثل "امم"، والتوقفات وهو لا يزال يتحدث.
ما أفضل نموذج صوتي بالذكاء الاصطناعي في أكتوبر 2026؟
يتوقف ذلك على الاختبار. على Artificial Analysis حتى 7 أكتوبر 2026، يتصدّر GPT-Live-1 مؤشر Speech to Speech العام بـ83.2، متقدماً بفارق ضئيل على Gemini 3.8 Live Extended Thinking (82.6) وGrok Voice Think Fast 2.0 (81.3). ويتصدّر StepAudio 3 Realtime من StepFun ديناميكيات المحادثة بنسبة 98.9%.
هل توجد نماذج صوتية مفتوحة المصدر ثنائية الاتجاه؟
نعم. تصف NVIDIA نموذجها NemotronLabs VoiceChat 11B بأنه أول نموذج مفتوح ثنائي الاتجاه يدعم استدعاء الأدوات، ونموذج Raon-SpeechChat-9B من Krafton مفتوح ويدعم الإنجليزية فقط، وتنشر StepFun أوزان Step-Audio R1.1. قد يكون استدلالها قوياً، لكن لم يحصل أي منها بعد على درجة في مقياس خدمة العملاء τ-Voice، كما تختلف التراخيص، لذا راجع الشروط قبل أن تبني عليها.
هل تجعل النماذج ثنائية الاتجاه وكلاء الهاتف بالذكاء الاصطناعي جاهزين لكل مكالمة؟
لا. أفضل نموذج على مقياس خدمة العملاء τ-Voice ينجز 74.5% من المهام، استناداً إلى تجربة واحدة. احتفظ بمسار واضح للتحويل إلى موظف بشري، واختبر الأفعال التي ينفّذها الوكيل، لا طريقة كلامه فقط.
هل تحتاج الأعمال إلى اختيار أحد هذه النماذج؟
عادةً ليس بشكل مباشر. فقد انتقلت صدارة لوحة الترتيب إلى نموذج آخر خلال ثلاثة أسابيع من إطلاق Google في 15 سبتمبر، لذا فالإعداد الأكثر أماناً هو منصة يمكن لطبقتها الصوتية الانتقال إلى نموذج مختلف من دون إعادة بناء الوكيل، مع التحقق من الخيارات التي تدعمها قبل أن تلتزم بها.
المصادر: صفحات المنتجات وبطاقات النماذج من OpenAI وGoogle DeepMind وStepFun وxAI وNVIDIA وKrafton؛ لوحة ترتيب Speech to Speech لدى Artificial Analysis (تمت مراجعتها في 7 أكتوبر 2026)؛ The Decoder (23 سبتمبر 2026)؛ MarkTechPost (28 سبتمبر 2026)؛ AI Weekly (أغسطس 2026)؛ دراسة سرعة الاستجابة من Entagl (2026).