← العودة إلى المدونة
Newsحوالي 1 دقيقة قراءة

يونيتري تتيح المصدر المفتوح لقاعدة روبوتات بشرية بحجم 6B: نموذج واحد يدير اليدين والقدمين، والذكاء المتجسد يبدأ الحساب حسب الوظيفة

نُشر في 6 أكتوبر 2026
يونيتري تتيح المصدر المفتوح لقاعدة روبوتات بشرية بحجم 6B: نموذج واحد يدير اليدين والقدمين، والذكاء المتجسد يبدأ الحساب حسب الوظيفة

في الثالث من أكتوبر، أطلقت شركة يونيتري على GitHub وHugging Face نموذجها الأساسي الجديد للروبوتات البشرية العامة UnifoLM-WLA-1.0، بحجم 6 مليارات معلمة، ومضبوطًا بدقة على نحو 2500 ساعة من بيانات روبوتات حقيقية. لم ينتشر الخبر ببطء داخل أوساط الروبوتات المحلية، لكن النقطة الأسهل في التغاضي عنها هي أنه حشر «الحركة اليدوية» و«المشي» داخل النموذج نفسه.

على مدى العام الماضي، توقفت أبرز لحظات الروبوتات البشرية في الغالب عند مقاطع عرضية قصيرة: القدرة على أداء الشقلبات، والرقص، وحمل كوب ماء. لكن حين يتعلق الأمر بدخول المصانع والمتاجر والمنازل، يتغير السؤال. كون حركة مفردة مذهلة بما يكفي أمر، وكون نموذج واحد قادرًا على التعامل في الوقت نفسه مع عمليات الطاولة الدقيقة ومهام التنقل لكامل الجسد أمر آخر. الأرقام التي قدمتها يونيتري هذه المرة هي 64 مهمة، منها 10 مهام لكامل الجسد و54 مهمة على مستوى الطاولة، مع توافقها في الوقت نفسه مع ملاقط متوازية ويدين ماهرتين بتكوينين مختلفين.

المسار التقني للحزمة يستحق أيضًا نظرة. يبدأ من مُستنتِج متجسد قائم على Qwen3-VL، ثم يضيف التنبؤ بالمناطق الديناميكية المستقبلية عبر التدفق البصري وVQ-VAE، وتقطيع الحركات المتبقية عبر VQ، وأخيرًا يربطه بخبير حركة MMDiT. وبعبارة غير متعثرة: دع النموذج أولًا يفهم ما سيحدث تاليًا في الصورة، ثم فكّك «الحركات المطلوبة» إلى قطع قابلة لإعادة الاستخدام، وأخيرًا سلّمها إلى وحدة التنفيذ لتجميعها.

وحدات مفاصل معدنية متناثرة على طاولة عمل مع ورقة ملاحظات فارغة، إضاءة جانبية ناعمة

لماذا يُعد «نموذج واحد يدير اليدين والقدمين» نقطة تحول

في الممارسة الهندسية للذكاء المتجسد، كانت اليدان والقدمان لفترة طويلة فريقين منفصلين. فالإمساك والتركيب وربط البراغي حركات عالية التكرار وصغيرة المدى، تتطلب دقة عالية وتحكمًا في القوة؛ أما المشي والاستدارة والصعود والهبوط فهي حركات منخفضة التكرار وواسعة المدى، وعليها التعامل مع التوازن والتضاريس. إن تقسيم الاثنين على نموذجين مختلفين يمنح كل مسار ميزة التحسين إلى أقصى حد، لكن الثمن هو الحاجة إلى نقل الحالة عند التبديل، وكل عملية نقل قد تفقد معلومات وتضيف تأخيرًا.

إن ضغط يونيتري 64 مهمة داخل نموذج واحد بحجم 6B هو في جوهره رهان على أن عائد «التمثيل الموحد» أكبر من عائد التحسين المنفصل. هذا الرهان ليس رخيصًا على وحدات GPU العامة، لكنه ذو معنى على الروبوتات: عند النشر على أجهزة حقيقية، تكون الذاكرة وحوسبة الطاقة والاستهلاك كلها مقيّدة بحدود صارمة، وكل نموذج أقل يعني كلفة أقل.

ليس يونيتري وحدها من تدفع هذا الاتجاه

إذا ربطنا عدة أحداث وقعت حول أكتوبر، نجد أن هذا ليس إصدارًا معزولًا.

في التاسع والعشرين من سبتمبر، أتاح معهد بحوث تشي يوان (BAAI) المصدر المفتوح لـ RoboBrain-X0، ليمدّ قدرات النماذج الكبيرة إلى إدراك الروبوت والتحكم في حركته. كانت مشاريع الذكاء المتجسد مفتوحة المصدر تتوقف سابقًا في الغالب عند مستوى بيئات المحاكاة ومجموعات البيانات، وظهور نموذج يستهدف سياسات الحركة مباشرة يدل على أن هذا المسار ينتقل من الأوراق البحثية إلى أصول هندسية قابلة لإعادة الإنتاج.

في الرابع من أكتوبر، خرجت عدة روبوتات بشرية من شركة يونشن تشو للتكنولوجيا في هانغتشو بمقاطعة تشجيانغ إلى الشوارع، لاختبار تنظيم المرور عند التقاطعات وحفظ النظام والإجابة عن استفسارات الزوار. اختيرت مواقع الاختبار عند تقاطعات حقيقية لا على منصات عرض، وكانت تعمل حتى في الأيام الممطرة. قيمة هذا النوع من الاختبارات ليست في سلاسة الحركة، بل في إدخال الروبوت البشري إلى بيئة حقيقية لا تفسح له الطريق.

وبالعودة قليلًا إلى الوراء، أتاحت سبع جامعات من بينها جامعة سنغافورة الوطنية وجامعة تسينغهوا وجامعة بكين المصدر المفتوح لقاعدة نموذج العالم-الحركة OpenWAM. وهي تهدف إلى معالجة الشق القديم بين المحاكاة والأجهزة الحقيقية: فالمحاكيات التقليدية غالبًا ما تحسب الفيزياء والرؤية كل على حدة، بينما يتيح OpenWAM للنموذج أن يتعلم مباشرة من البيانات «كيف تغيّر الحركة العالم»، ثم يتنبأ بناءً على ذلك بموضع الأجسام ودلالات المشهد وحالة المهمة. يقدم الـREADME الرسمي توصية بنحو 640GB من بيانات التدريب، وموقعها هو بنية بحثية تحتية، وليست منتجًا جاهزًا للاستخدام فور إخراجه من العلبة.

من «هل يستطيع الحركة» إلى «هل يستطيع الالتحاق بالعمل»

سرد الذكاء المتجسد يغيّر مساره. في العامين الماضيين كان الجميع يقارن ما إذا كان الجسم قادرًا على المشي، وما إذا كانت الحركات رائعة بما يكفي؛ أما الآن فالمقارنة تدور حول ما إذا كان الروبوت يستطيع العمل لساعات متواصلة دون أخطاء.

لهذا التحول مؤشر عملي جدًا: متوسط المدة بين تدخلين بشريين. نشرت إحدى الشركات ما يشبه «حساب الموثوقية»: دورة غسيل واحدة تربط نحو 79 مهمة فرعية، وإذا احتسبنا نجاحًا بنسبة 95% لكل خطوة، فإن احتمال إكمال الدورة كاملة دون تدخل بشري لا يتجاوز نحو 1.7%. نسبة 95% لكل مهمة فرعية تبدو عالية جدًا بمفردها، لكنها تنهار عند ضربها. لذلك بدأ القطاع بتغيير هدف التحسين من معدل نجاح المهمة الواحدة إلى قدرة سير العمل الكامل على الصمود.

تكمن القيمة هنا أيضًا في قاعدة 6B التي أتاحتها يونيتري هذه المرة. فأهميتها أنها توفر نقطة انطلاق مشتركة قابلة لإعادة الإنتاج. يمكن للمطورين لاحقًا ضبطها بدقة، أو تغيير العتاد، أو إضافة مهام، دون الحاجة إلى جمع البيانات من الصفر. إن المنافسة في الذكاء المتجسد تنتقل من «بناء جسم قادر على الحركة» إلى «هل يستطيع الدماغ أن يُعاد استخدامه عبر عتاد ومهام مختلفة».

في الختام

إتاحة قاعدة روبوتات بشرية بحجم 6 مليارات معلمة كمصدر مفتوح لا تُظهر عائدًا تجاريًا على المدى القصير، وكلفة البيانات أيضًا ثقيلة. لكنها تحل أمرًا أكثر أساسية: أن يمتلك الباحثون والمطورون نقطة يمكنهم جميعًا معايرتها ومقارنتها.

في قضية الروبوتات، الاختبار الحاسم في النهاية هو تلك الآلاف من الساعات داخل المصانع والمتاجر؛ أما اختبار يوم الإطلاق فليس سوى البداية. ومن ينجح في جعل «الاستمرارية في العمل» حقيقة ملموسة، هو وحده من يدخل الملعب فعليًا.

نقاط المراقبة التي تتركها للقطاع محددة جدًا: ما مدى ارتفاع معدل إعادة إنتاج هذه الدفعة؟ وما سرعة التكرار في المشاريع الحقيقية؟ وكم شخصًا سيظلون يقدمون تحسينات عليها بعد نصف عام؟ ستنصرف ضوضاء يوم الإطلاق، ولن يبقى سوى الكود الذي لا يزال قيد الاستخدام.

مقالات ذات صلة