سبع جامعات تتعاون لإطلاق OpenWAM مفتوح المصدر: الروبوتات لا تحتاج إلى «الرؤية» فقط، بل إلى «توقّع الثانية التالية»

في مطلع أكتوبر، نشر فريق من الباحثين من سبع جامعات، من بينها جامعة سنغافورة الوطنية، وجامعة تسينغهوا، وجامعة بكين، مشروع OpenWAM على GitHub وHugging Face. تحديد المشروع واضح: حزمة بحثية مفتوحة المصدر متكاملة الأركان (full-stack) موجهة إلى نماذج أفعال العالم (World Action Model، WAM)، إضافة إلى نموذج أساسي. وقد نُشرت الورقة على arXiv برقم 2609.07398، وبلغ عدد النجوم في المستودع نحو 940 نجمة حتى الأول من أكتوبر.
لم ينتشر هذا الخبر ببطء داخل الصين، لكن الجدير بالتأمل أكثر هو المشكلة القديمة التي يحاول حلّها: مجرد تعرّف الروبوت على ما أمامه لا يكفي.
المحاكيات التقليدية تحسب الفيزياء والرؤية بشكل منفصل
في السابق، كانت هناك طريقتان شائعتان لبناء سياسات الروبوتات. الأولى تتعلم قواعد الرؤية وإشارات التحكم في الوقت نفسه مباشرة من عروض الروبوت، والثانية تبدأ بالتدريب المسبق على الصور والنصوص لإدخال المعرفة الدلالية واللغوية، وهذا هو مسار VLA.
أما نماذج أفعال العالم فسلكت طريقًا ثالثًا: ترث أولًا من التدريب المسبق على توليد الفيديو معرفة مسبقة بـ«كيف سيتغير العالم»، ثم تتعلم عبر الخبرة الجسدية «ما الذي ينبغي فعله في هذا العالم». قد يبدو هذا طريقًا غير مباشر، لكنه يتجنب ذلك الصدع القديم بين المحاكاة والآلة الحقيقية. ففي المحاكيات التقليدية غالبًا ما تُحسب الفيزياء والرؤية كلٌّ على حدة، فلا يتطابق أثر الفعل مع المظهر البصري؛ أما OpenWAM فيجعل النموذج يتعلم مباشرة من البيانات «كيف يغيّر الفعل العالم»، ثم يتوقع بناءً على ذلك موضع الأجسام ودلالات المشهد وحالة المهمة.
ثلاث طبقات لجعل التجارب قابلة للتكرار
قسّم الفريق المسألة إلى ثلاث طبقات، تقابل كل طبقة مكوّنًا واحدًا.
OpenWAM-Infra هي بنية تحتية معيارية تفصل أربع طبقات: النماذج القابلة للتركيب، وبيئة التشغيل للتدريب، وبيئة التشغيل للنشر، وبروتوكولات التقييم. وتكمن وظيفة هذه الطبقة في تحويل نماذج أفعال العالم من تطبيق واحد مترابط بإحكام إلى منصة تجارب يمكن استبدال مكوّناتها.
يتولى OpenWAM-Study استخلاص قواعد التصميم. فهو لا يبني نماذج، بل يجري تجارب مضبوطة، ويحوّل عبر مجموعات من المقارنات «أي تصميم فعّال» إلى استنتاجات قابلة للتكرار.
أما OpenWAM-α فهو النموذج الأساسي نفسه، ويتحقق من المنظومة كاملة على نطاق واسع من فيديوهات المنظور الأول البشري وبيانات الروبوتات.
ثلاثة مبادئ تصميم، ولكل منها أرقام مقارنة
أكبر خطر يهدد هذا النوع من الأوراق أن تكون كلها شعارات. لكن الاستنتاجات الثلاثة التي قدّمها OpenWAM جاءت جميعها مدعومة بتجارب مقارنة.
الأول: الحاجة إلى معرفة مسبقة توليدية قوية بما يكفي عن العالم. حقق العمود الفقري للفيديو بحجم 14B نسبة 93.79%، بينما لم يحقق 1.3B سوى 90.14%؛ واختير في الإعداد الافتراضي حجم 5B، وهو أدنى من 14B بـ1.4 نقطة مئوية فقط. ومع الفضاء الكامن البصري المضغوط الناتج عن DINOv3 وS-VAE، يقترب الأداء من VAE المرفق مع Wan2.2.
الثاني: يجب أثناء التدريب إنشاء تدفق معلومات واضح من العالم إلى الفعل. فعندما «يرى تدفق الفعل تدفق العالم»، بلغت الدقة 92.39%؛ أما عند تغييره إلى قناع معزول فلم تبلغ سوى 87.41%، أي فارق 5 نقاط مئوية كاملة. وأفضل النتائج تأتي عند إزالة الضوضاء المشتركة المتزامنة أثناء الاستدلال.
الثالث: ينبغي استخدام البيانات حسب مصدرها. فبيانات الروبوتات مسؤولة عن الحفاظ على تأسيس الفعل (grounding)، وفيديوهات المنظور الأول البشري مسؤولة عن توسيع تغطية العالم، ويجمع التدريب التعاوني أحادي المرحلة بينهما. والمثير للاهتمام أن التحسن داخل نطاق التدريب المسبق كان محدودًا، لكن معدل النجاح خارج التوزيع (OOD) ارتفع من 14.50% إلى 26.62%.
المواصفات الفعلية للنموذج الأساسي
يتكوّن OpenWAM-α من جزأين: Wan2.2-TI2V-5B كتدفق فيديو، مع ربط DiT للأفعال بحجم 1B. وتم توحيد فضاء الأفعال إلى 80 بُعدًا، بما يتوافق مع 17 منصة فيزيائية. وتتألف بيانات التدريب المسبق من 14300 ساعة، يشكل المنظور الأول البشري 30% منها، والبيانات الاصطناعية 30%، والبيانات الحقيقية 40%.

من حيث سرعة الاستدلال، تستغرق كتلة الفعل الواحدة 170 مللي ثانية على RTX 5090. ويغطي التقييم 8 معايير محاكاة من بينها LIBERO وRoboTwin2.0 وRoboDojo، بأشكال تتراوح من الذراع الواحدة والذراعين إلى التلاعب المتنقل والأيدي البارعة. وفي مسار الذراعين المتحركة ضمن EBench، يحتل حاليًا المركز الأول، متقدمًا على صاحب المركز الثاني بنحو 4 نقاط مئوية. وفي التحقق على الآلة الحقيقية، شُغّلت ست مهام بذراع Franka الواحدة، بمتوسط معدل نجاح 82.5%، وهو أعلى من 77.5% لـ LingBot-VA و55.0% لـ π0.5، وحققت مهمتان منها نسبة 100%. وعند استبداله بيد بارعة لم تُشاهد أثناء التدريب، تجاوز π0.5 بالكامل بعد الضبط الدقيق.
لم يعلن خروج VLA من السباق
هناك استنتاج في الورقة يستحق الإبراز منفصلًا: يعتمد WAM على المتغيرات الكامنة لفيديو المستقبل للإشراف، فيكون أكثر ملاءمة داخل التوزيع؛ بينما يكون VLA أكثر ثباتًا تحت الاضطرابات خارج التوزيع. ولم يُحسم بعد أيهما يتفوق.
هذه العبارة أكثر صدقًا بكثير من «مات نموذج معيّن». فمن يقرأ الورقة يسهل عليه أن يتذكر الأرقام فقط، لكن الأجدر بالتذكر هو هذه العبارة: لكل من المسارين مزاياه الآن، ولم نبلغ بعد مرحلة الحكم النهائي.
انخفضت العتبة درجة
وفي سياق أوسع، على خط نماذج العالم، أطلق Gemini Robotics 2 من جوجل شعار «عقل واحد يصلح لأي روبوت»، وطرح Jim Fan من إنفيديا مقولة «مات VLA، وعاشت نماذج أفعال العالم». وفي الثالث من أكتوبر، وسّعت إنفيديا حزمة الفيزياء المفتوحة للذكاء الاصطناعي، فأصدرت معًا نموذج العالم Cosmos، وIsaac Lab Arena، وAlpamayo للقيادة الذاتية، وأداة التنسيق OSMO، ومكتبة OpenUSD، وكانت Caterpillar وLEM Surgical وNeura Robotics من أوائل المستخدمين. وفي الرابع من أكتوبر، خرجت عدة روبوتات بشرية الشكل من شركة Deep Robotics في هانغتشو بمقاطعة تشجيانغ إلى الشوارع، لاختبار توجيه حركة المرور عند التقاطعات والرد على استفسارات الزوار، وظلت تعمل حتى في الجو الممطر.
وبهذه الكثافة، فإن فتح الجامعات لقاعدة كاملة الأركان كمصدر مفتوح يعني خفض عتبة هذا الاتجاه درجة، ويجعل «تعلّم العالم من الفيديو وتعلّم الفعل من المسارات» مسارًا أكثر انفتاحًا.
ليس جاهزًا للنشر المباشر
من المهم التوضيح أن OpenWAM مخصص ليكون بنية تحتية بحثية، وليس منتجًا جاهزًا للاستخدام الفوري. ويوصي ملف README الرسمي بتجهيز نحو 640GB من بيانات التدريب، وحجم البيئة نحو 6.5GB، كما أن المستودع لا يزال يشهد تعديلات نشطة. وهو مناسب للفرق التي تملك بالفعل وحدات GPU وبيانات وتريد إجراء أبحاث على نماذج أفعال العالم انطلاقًا منه، ولا يصلح لحالات التطبيق محدودة النطاق.
ونقاط المتابعة اللاحقة محددة أيضًا: ما مدى ارتفاع معدل إعادة إنتاج هذه الدفعة؟ وكم شخصًا سيظل يقدّم تحسينات عليه بعد نصف عام؟ وهل سيقوم فريق فعلًا بضبطه الدقيق وإدخاله في خط إنتاجه؟ ستتلاشى حماسة يوم الإطلاق، وما سيبقى هو الشيفرة التي لا تزال قيد الاستخدام.
مقالات ذات صلة
قاض فيدرالي يصف شبكة قراءة لوحات المركبات التابعة لـ Flock بأنها «مراقبة جماعية عشوائية»
رصد واحد لسيارة لا يكشف سوى القليل. أما شهر من الرصدات المجمعة من وكالات عديدة فيكشف حياة.
المدعون الفيدراليون: خوادم إنفيديا بقيمة 300 مليون دولار وصلت إلى الصين عبر ماليزيا
قضايا الإنفاذ تقيس التدفق بدلاً من أن توقفه، وطريق العبور هو الجزء الذي لم تحله السياسات.
استحوذت Supabase على Turso لأن الوكلاء بحاجة إلى قاعدة بيانات لكل مهمة
لا تصبح فكرة قاعدة بيانات واحدة لكل وكيل منطقية إلا عندما تصبح أصغر وحدة تخزين رخيصة بما يكفي لتُمنح مثل رمز جلسة.
حصل الممثلون على عقد ينظم نسخهم الرقمية. الجزء الصعب هو الإنفاذ.
يمكن للعقد أن يعرّف ما هي النسخة الرقمية. لكن إثبات أن إحداها صُنعت دون موافقة مشكلة مختلفة.