Qwen-AgentWorld يضع سبع بيئات داخل نموذج عالمي لغوي واحد

أطلقت علي بابا Qwen-AgentWorld، الذي تصفه الشركة بأنه أول نموذج عالمي لغوي أصلي لديها. ويتوفر بحجمين: 35B-A3B و397B-A17B. وتقول إن نموذجًا واحدًا يغطي سبعة أنواع من البيئات، بما في ذلك MCP وSearch وTerminal وSWE وWeb وOS وAndroid.
لماذا تُعد عبارة "نموذج عالمي" الكلمة المثيرة للاهتمام
النموذج العالمي، بالمعنى المعتاد، يتنبأ بما سيحدث لاحقًا في بيئة ما. وبالنسبة لتدريب الوكلاء، فإن النسخة العملية من هذه الفكرة هي المحاكي. وإذا كان بإمكان نموذج أن يحل محل البيئة التي سيعمل فيها الوكيل، فيمكن تدريب الوكيل مقابل المحاكي بدلًا من الشيء الحقيقي.
عنق الزجاجة الذي يخلقه ذلك مكلف ومحدد. فتدريب وكيل على تشغيل طرفية أو متصفح أو نظام تشغيل يعني عادةً تشغيله في تلك البيئات، وهو أمر بطيء وصعب التوازي ومحفوف بالمخاطر عندما يتخذ الوكيل إجراءً خاطئًا. أما نموذج يمكنه محاكاة طرفية أو متصفح فيزيل الحاجة إلى تشغيل النسخة الحقيقية عند كل خطوة تدريب.
رهان Qwen-AgentWorld هو أن نموذجًا لغويًا واحدًا يمكن أن يعمل كمحاكٍ لعدة أنواع من البيئات في وقت واحد، بدلًا من أن تحتاج كل بيئة إلى محاكٍ مخصص لها.
نتيجة المعيار، وكيفية قراءتها
تستحق مقارنة المعيار نظرة ثانية. فجودة المحاكاة في نسخة 397B تتجاوز GPT-5.4 وClaude Opus 4.8 وGemini 3.1 Pro في تقييم AgentWorldBench من علي بابا. تلك أنظمة مغلقة كبيرة يتم تقييمها وفق معيار صممه المختبر المُصدِر، وهو ما لا يجعل النتيجة بلا معنى، لكنه يعني أن الرقم ينبغي أن يُعامل كنقطة انطلاق. أما الادعاء الثاني، أي الانتقال عبر المجالات، فهو تحديدًا النوع الذي لا يظهر في الممارسة إلا عندما يدرّب فريق وكيلًا في بيئة وينشره في أخرى.
بيئة الوكيل أصبحت وحدة المنافسة
يأتي Qwen-AgentWorld في خضم تحول أوسع. وعلى مدى الشهر الماضي، كانت الإصدارات المثيرة للاهتمام تدور حول البيئات التي يعمل فيها الوكلاء بقدر ما تدور حول النماذج التي تعمل بداخلها.
صدر OpenCoWork 1.0 كمنصة مفتوحة لتعاون وكلاء متعددين على سطح المكتب، ما يتيح للوكلاء دخول مساحة عمل محلية لقراءة ملفات المشروع، وتنفيذ أوامر الصدفة، ومراجعة تغييرات Git، والاتصال بأدوات MCP. وركّز Grok Build 0.2.60 على استعادة الجلسات، وضغط السياق، ومخرجات أدوات MCP، وهي ثلاث من نقاط الألم المتكررة في الحفاظ على استقرار منظومة تشغيل الوكيل.
الخيط المشترك هو أن قدرة الوكيل تزداد محدودية بالبيئة المحيطة بالنموذج، لا بدرجة الاستدلال الخام للنموذج. فنموذج يستطيع التخطيط جيدًا لكنه لا يستطيع تشغيل طرفية بشكل موثوق ينتج القليل. أما نموذج يستطيع تشغيل طرفية بشكل موثوق، حتى إن كان استدلاله أقل إبهارًا، فينتج عملًا.
لماذا تهم الأحجام
يتوفر Qwen-AgentWorld بحجمي 35B-A3B و397B-A17B، وكلاهما تكوينات متفرقة لمزيج الخبراء. ويعكس نهج المستويين تقسيمًا حقيقيًا للعمل. فنسخة 35B، بمعاملات نشطة تبلغ 3B، موجهة لأحمال العمل الأخف والنشر المحلي، بينما تستهدف نسخة 397B محاكاة أعلى جودة حيث تتوفر القدرة الحاسوبية.
أصبح هذا الانقسام معياريًا الآن في الإصدارات الصينية المفتوحة، وهو يخاطب جمهورًا محددًا. فيمكن لفريق صغير تنزيل نموذج 35B وتشغيل محاكٍ محليًا دون تكاليف لكل رمز. ويمكن لمختبر أكبر تشغيل نسخة 397B حيث تكون دقة المحاكاة أهم من الإنتاجية.
ما الذي سيثبت الفرضية
الادعاء الأهم هو الأصعب اختبارًا من الخارج. فإذا كان نموذج واحد قادرًا فعلًا على محاكاة MCP وSearch وTerminal وSWE وWeb وOS وAndroid بما يكفي لتدريب الوكلاء عبرها جميعًا، فسيغيّر ذلك طريقة توزيع فرق الوكلاء لجهدها. فبدلًا من بناء محاكٍ أو استئجاره لكل بيئة، سيحتفظ الفريق بنموذج واحد ومجموعة من توجيهات البيئات.
الإشارات التي ينبغي مراقبتها هي تقييمات مستقلة لجودة المحاكاة مقابل بيئات حقيقية، وتبنّيها في خطوط تدريب الوكلاء حيث تكون النتائج قابلة للقياس، وما إذا كان الانتقال عبر المجالات سيظهر عندما يُنشر وكيل دُرّب في بيئة ما في بيئة أخرى. وإلى أن تظهر تلك الإشارات، فإن ترتيب المعيار هو ادعاء حول معيار، والجزء المفيد من الإصدار هو الاتجاه الذي يشير إليه: المحاكي، وليس النموذج وحده، هو مصدر الجولة التالية من قدرات الوكلاء.
لماذا اختيرت هذه البيئات
لا تمثل أنواع البيئات السبعة قائمة عشوائية. فهي تتطابق عن كثب مع المهام التي تلاقت عندها معايير الوكلاء وإطلاقات المنتجات الأخيرة.
تغطي Terminal وSWE وWeb عمل وكيل البرمجيات: تشغيل الأوامر، وتحرير قاعدة شيفرة، والتنقل بين الصفحات. ويوسّع OS وAndroid ذلك ليشمل تشغيل نظام عبر واجهته، وهو المجال الذي تعيش فيه فئة الوكلاء الخاصة باستخدام الحاسوب. ويغطي MCP استدعاء الأدوات عبر البروتوكول الذي أصبح الطريقة المعيارية التي يصل بها الوكلاء إلى الخدمات الخارجية. ويغطي Search الاسترجاع، وهو الخطوة التي تستند فيها الإجابة إلى مصادر حالية بدلًا من الذاكرة البارامترية.
ومجمّعة معًا، تصف القائمة وكيلًا يستطيع التصرف على حاسوب، والوصول إلى الأدوات، والبحث عن المعلومات. وهذا تعريف عملي لما تعنيه الصناعة بالوكيل عام الأغراض، ومحاكٍ يغطي السبعة جميعًا سيتيح لفريق التدريب مقابل السطح كله بدلًا من شريحة واحدة في كل مرة.

ادعاء الانتقال، تحت الفحص
الانتقال عبر المجالات هو الجزء الأكثر إثارة للاهتمام والأكثر هشاشة في الطرح. والفكرة هي أن الكفاءة في بيئة ما تساعد في بيئة أخرى، لأن المهارة الأساسية المتمثلة في تشغيل نظام، وقراءة حالته، واختيار إجراء، قابلة للتعميم.
هذا معقول في الحالات التي تتشارك فيها البيئات البنية. فالطرفية واستدعاء أداة قائم على الصدفة كلاهما يتضمن قراءة مخرجات وإصدار أمر. والمتصفح وتطبيق الهاتف المحمول كلاهما يتضمن التنقل في واجهة مرئية.
وهو أقل وضوحًا حيث تتباعد البيئات. فمهمة تحرير الشيفرة تكافئ الاستدلال بعيد المدى على أثر مستقر، بينما تكافئ مهمة البحث الحكم السريع على جودة المصدر. وما إذا كان نموذج واحد يستطيع الاحتفاظ بكلتا المهارتين دون أن تُضعف إحداهما الأخرى هو سؤال تجريبي، وهو تحديدًا النوع الذي يمكن لمعيار صممه المختبر المُصدِر أن يجيب عنه بطريقة مواتية بينما لا يفعل اختبار محايد.
لماذا تغيّر الأوزان المفتوحة من يستطيع البناء
الإصدار المفتوح لا يقل أهمية عن الادعاءات التقنية، ولسبب يتجاوز التكلفة.
المحاكي قطعة من بنية التدريب التحتية، والبنية التحتية للتدريب شيء تخصصه الفرق. فالفريق الذي يشغّل محاكيًا محليًا يمكنه تعديله، وتوسيعه ليشمل بيئة داخلية، وضبطه على الأدوات التي تستخدمها وكلاؤه فعليًا. أما المحاكي المستضاف، في المقابل، فهو ثابت بحسب مزوّده.
وهذا يجعل الأوزان المفتوحة الجزء التمكيني في الإصدار لأي جهة لا تكون بيئتها ضمن القائمة السبعة. فخدمة المحاكاة الاحتكارية لا يمكن أن تكون عامة إلا بالقدر الذي يختاره مزوّدها. أما النموذج المفتوح فيمكن ضبطه بدقة نحو بيئة خاصة بقطاع معين، وهو ما تعمل فيه فرق كثيرة فعليًا. وما إذا كان هذا المسار مجديًا يعتمد على مدى تقبّل النموذج للتخصص، وهذا سؤال آخر تحسمه نتائج مستقلة.
مقالات ذات صلة
ميتا ترخّص تقنية الصور والفيديو من ميدجورني، والسبب ذو دلالة
تتحرك معايير القياس كل ربع سنة. أما حكم مجتمع على ما يبدو جيدًا فلا.
AssemblyAI تخفض زمن استجابة الكلام في الوقت الفعلي إلى 91 مللي ثانية. إليك لماذا يهم هذا الرقم
القيد على الصوت لم يكن أبدًا معدل خطأ الكلمات. بل كان تبادل الأدوار.
نانو بنانا 2.1 من جوجل إصدار ميزات وليس نموذجاً رائداً
إصدار الطبقة المتوسطة يخبرك بما يعتقد مختبر أن معظم مستخدميه يحتاجونه فعلاً، وهو إشارة أكثر فائدة من إصدار رائد.
طبقة إعلانات الفيديو انقسمت إلى متخصصين، وBoreal-H3 يوضح السبب
الجودة السينمائية وسرعة التكرار منتجان مختلفان، ولا يمكن لطبقة توليد واحدة أن تتصدر في كليهما.