يونيتري وZDTaichu تتصارعان على أن تكونا الدماغ المكاني للروبوت

منذ فترة والروبوتات بارعة في الجسد. يستطيع الروبوت الشبيه بالبشر أن يسير ويتوازن ويقبض. أما ما كان ضعيفًا فيه فهو الجزء الذي يقرر ما الخطوة التالية، خصوصًا عندما لا تكون الغرفة هي الغرفة التي دُرّب فيها. حرّك كوبًا، أو غيّر طاولة العمل، أو سلّم الروبوت مهمة في منتصف الطريق، ينهار العرض التوضيحي.
إصداران صينيان في سبتمبر استهدفا ذلك الجزء. عرضت يونيتري نموذج UnifoLM-WLA-1.0، وهو نموذج أساس للروبوتات الشبيهة بالبشر بستة مليارات معامل، دُرّب على نحو 2500 ساعة من بيانات روبوتات حقيقية، وتزعم تحقيق سبع نتائج مفتوحة المصدر هي الأفضل في فئتها في الاستدلال المجسّد. أما ZDTaichu، المنبثقة عن الأكاديمية الصينية للعلوم ومعهد ووهان لأبحاث الذكاء الاصطناعي، فقد أتاحت في 15 سبتمبر نموذج ZDTaichu5.0-9B مفتوح المصدر، وهو نموذج متعدد الوسائط بتسعة مليارات معامل حلّ أولًا في ثمانية من تسعة معايير دولية لفهم الفضاء ضمن فئة معاملاته.
لا يُعد أي منهما روبوتًا. كلاهما محاولة لبناء الدماغ الذي يعمل عليه الروبوت، وقد أُتيح كلاهما للعموم بدلًا من عرضه خلف جدار من العروض التوضيحية.
رهان يونيتري على العمومية
الرقم البارز في إصدار يونيتري هو 64. يزعم نموذج واحد أنه ينسّق 64 مهمة مختلفة، من طي المناشف وترتيب الأطباق إلى ترتيب السرير وإخراج القمامة وتحميل غسالة الملابس. والمقصود من تلك القائمة ليس أي مهمة بعينها، بل أن الأوزان نفسها تتولى جميعها.
ظلّت تلك هي المشكلة المركزية في الروبوتات لسنوات. فمعظم العروض التوضيحية أحادية المهمة وأحاديّة المشهد ومضبوطة بدقة شديدة. تبدو مبهرة لكنها لا تنتقل إلى غيرها. وسياسة تطوي منشفة في ظرف إضاءة معين لا تطوي منشفة بلون مختلف على طاولة مختلفة. وتوسيع القوى العاملة من الروبوتات وفق ذلك النموذج يعني تعليمه كل تباين، وهذا ليس توسعًا.
يعتمد نهج يونيتري على قاعدة استدلال مجسّد تُدعى UnifoLM-ER-1-4B، مبنية فوق Qwen3-VL-4B ومدرّبة على أكثر من خمسة ملايين عيّنة استدلال مجسّد. وفي 16 معيارًا للإدراك والفهم متعدد الوسائط، يتصدر سبعة منها. وفي اختبارين مكانيين، Where2Place وEmbSpatial، يسجّل 82.0 و88.9 مقابل 69.0 و83.3 لـ GPT-6 Astra. وهذه مقارنات محددة بنموذج مغلق، ما يجعل الجدال حولها أسهل من ادعاء عام بالتفوق.
تقول يونيتري إنها ستتيح النموذج والشيفرة ومجموعة البيانات. وهذا الأخير هو الأهم. فسياسة روبوت بأوزان مفتوحة لكن بمجموعة بيانات مغلقة لا يمكن إعادة إنتاجها، بل استخدامها فقط. أما إتاحة البيانات فهي ما يتيح لمختبر آخر التحقق من الادعاء أو البناء عليه.
رهان ZDTaichu على الاستدلال المكاني
يهاجم ZDTaichu5.0-9B المشكلة من جهة الإدراك. يتعامل النموذج مع النص والصورة الواحدة والصور المتعددة والفيديو الطويل والدقات الاعتباطية، ونقطة قوته هي الاستدلال المكاني: فهم أين تقع الأجسام، وكيف تترابط، وكيف يتغير المشهد عندما تتحرك زاوية النظر.
الفجوة التي يبرزها في المعايير تظهر في MindCube-tiny، حيث يسجّل 78.27، متقدمًا على Qwen3.5-9B بأكثر من 20 نقطة وعلى STEP3-VL-10B بأكثر من 15 نقطة. وفي أحد العروض، حين طُلب منه إيجاد الصندوق الفضي الثاني من اليسار، أخرج الإحداثيات الصحيحة بينما أشارت نماذج مفتوحة أخرى مماثلة الحجم جميعها إلى المكان الخطأ. وفي اختبار بتغيير زاوية النظر، يظل هذا النموذج وحده محافظًا على استقامة الإطار المرجعي عند تغيّر زاوية الكاميرا.
هذه هي الإخفاقات التي تعطّل الروبوتات الحقيقية. نموذج يتعرّف على كوب قد أجاب عن ماهية الجسم. أما نموذج يعرف إلى أي جهة يتجه المقبض، وهل هناك متسع لإنزاله إلى جانبه، فقد بدأ يجيب عمّا يمكن فعله به. وعندما تطول المهمة، يجب أن تتسلسل هذه الأحكام: التقاط الجسم، وتذكّر هويته، وفتح الحاوية، وتحديث الحالة. وخطوة واحدة مفقودة تجعل بقية المهمة تنحرف.
الحيلة الهندسية في ZDTaichu هي الاستدلال الحلقي التكيّفي. الأسئلة السهلة تحصل على حساب أقل. أما الصعبة، مثل التحويلات المكانية وعلاقات الأجسام، فتحصل على عدة دورات استدلال داخلية دون الاستعانة بأداة خارجية، ما يمنع تضخم كلفة الرموز في الأغلبية السهلة من المدخلات.
قد يكون الجزء الأهم في هذا الإصدار هو ما لا تحتكره. فإلى جانب الأوزان، نشرت ZDTaichu خط إنتاجها الكامل للبيانات المكانية متعددة الوسائط، بما يغطي التدريب المسبق والضبط الدقيق الموجّه والتعلّم المعزّز. ويمكن للمؤسسات والشركات إعادة استخدامه لتحويل بيانات مصانعها أو مختبراتها إلى عيّنات تدريب. وهذا يجيب عن شكوى لازمت إصدارات النماذج المفتوحة لعامين: تحصل على الأوزان، لكنك لا تستطيع تكييفها على بياناتك لأن الوصفة تبقى سرية. وقد كان النموذج يعمل في ميادين تدريب مجسّدة في بكين وفوشان وتشينغداو.
طريقان إلى الفجوة نفسها
ضع الإصدارين جنبًا إلى جنب، فيكون الفرق مفيدًا. تعمل يونيتري من جهة الفعل إلى الخارج: تأخذ سياسة عليها أداء المهام، وتدرّبها على 2500 ساعة من حركة روبوت حقيقية، وتقيس ما إذا كانت تعمّم عبر 64 مهمة. أما ZDTaichu فتعمل من جهة الإدراك إلى الداخل: تأخذ نموذجًا متعدد الوسائط عليه فهم المشهد، وتدرّبه على معايير مكانية، وتقيس ما إذا كان يحافظ على استقامة الهندسة عند تغيّر زاوية النظر.
يحتاج الروبوت إلى الأمرين معًا. عليه أن يعرف أين الكوب، وعليه أن يعرف كيف يلتقطه. يهاجم المختبران الفجوة ذاتها من طرفين متقابلين، وتزامن نشر الإصدارين في الشهر نفسه يشير إلى أن المجال قد اتفق على ماهية الفجوة: الطبقة الوسطى حيث يتحول الإدراك إلى فعل، وحيث تتحول مهمة استغرقت ثماني ثوانٍ إلى مهمة تستغرق ثماني دقائق.
ويفصل بينهما سؤال البيانات مجددًا. دُرّبت يونيتري على حركة روبوت حقيقية، وهي مكلفة الجمع ونادرة. واعتمدت ZDTaichu على خط إنتاج بياناتها ومهام مكانية اصطناعية، وهي تتوسع بشكل مختلف وتحمل خطرًا مختلفًا: أن يبرع النموذج في مشاهد الاختبار ويبقى فيها. وأي الطريقين ينتج سياسة تصمد عند التلامس مع مستودع حقيقي سيحسم أي مصدر بيانات كان الرهان الصائب.
سياق القطاع
يصدر الإصداران في مجال أعاد تنظيم مسلماته مؤخرًا. يطرح Gemini Robotics 2 من غوغل شعار «دماغ واحد لأي روبوت». ورأى جيم فان من إنفيديا أن نماذج الرؤية واللغة والفعل قد ماتت وأن نماذج الفعل العالمي هي الخليفة. وصنّف تقرير غارتنر في سبتمبر عن اتجاهات الذكاء الاصطناعي في الصين الذكاء الاصطناعي الفيزيائي والنماذج العالمية ضمن المسارات التي صارت متطلبات هيكلية لا تجارب.
هذه إعادة التأطير هي سبب كون معيار مكاني أهم من نتيجة محادثة. فقد انتقلت المنافسة في الذكاء الاصطناعي المجسّد من مدى جودة حديث النموذج عن العالم الفيزيائي إلى ما إذا كان قادرًا على الفعل فيه، وتبعت المقاييس ذلك. دقة الإحداثيات واتساق زاوية النظر وإتمام المهام عبر المشاهد هي لوحة النتائج الجديدة.
ما يجب متابعته
التحفظ الصادق على الإصدارين هو أن تصدّر المعايير في الاستدلال المكاني ليس مثل روبوت يعمل في مستودع. قد يضع النموذج الأجسام في مواضعها الصحيحة في مجموعة اختبار ويخفق مع ذلك على ذراع حقيقية بماسك عالق أو إضاءة سيئة. والفجوة بين الاستدلال والفعل هي حيث ماتت معظم وعود الروبوتات.
ما يجعل هذين الإصدارين جديرين بالمتابعة هو الجمع بين أوزان مفتوحة وخطوط بيانات مفتوحة. فإذا استطاع مختبر خارج يونيتري أو ZDTaichu أن يأخذ أيًا من النموذجين ويعيد تدريبه على عتاده الخاص وينشر النتيجة، فسيُختبر الادعاء علنًا. أما إذا بقيت الإصدارات معايير وعروضًا توضيحية بينما يبقي المنافسون بياناتهم مغلقة، فسيبقى المجال حيث كان: كثير من الفيديو المبهر وقليل جدًا من الروبوتات التي تؤدي عملًا مفيدًا يوم ثلاثاء.
مقالات ذات صلة
Agility Digit 5 يأتي مع ملف سلامة، لا مجرد ورقة مواصفات
أرضية المستودع ليست مختبرًا. الاعتماد هو البوابة، وليس العرض التوضيحي.
أنهى الوكلاء المتقدمون 30 بالمئة من مسار عمل بحثي. هذا هو الرقم.
يستطيع الوكلاء تشغيل البحث. لكن اختراع الإجراء لا يزال بعيد المنال.
Figure AI تحجز 3.5 مليار دولار من القدرة الحاسوبية قبل أن يكون لديها منتج للبيع
الرهان هو أن التعميم مشكلة حوسبة. والمجال لم يحسم ذلك بعد.
أخيرًا، أضافت OpenAI خلفيات شفافة إلى واجهة برمجة تطبيقات الصور
ميزة صغيرة تحذف خطوة كاملة من خط المعالجة.