← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

Reka Rho-1 تضع الفهم والتوليد في ذاكرة KV نفسها

نُشر في 6 أكتوبر 2026
Reka Rho-1 تضع الفهم والتوليد في ذاكرة KV نفسها

معظم الأنظمة متعددة الوسائط عبارة عن خطوط أنابيب. يخطط نموذج لغوي، ويُنتج نموذج انتشار، ويكتشف كاشف مواقع، وتقود شبكة سياسة الروبوت. لكل عملية تسليم كلفة. يجب تسلسل الحالة، ونقلها بين الخدمات، وإعادة ترميزها إلى الصيغة التي يتوقعها المكوّن التالي.

يسلك Rho-1 من Reka AI طريقًا مختلفًا. النموذج البالغ 19 مليار معامل، الذي صدر في 5 أكتوبر كمعاينة بحثية، يتعامل مع النصوص والصور والفيديو وحركات الروبوت داخل شبكة واحدة، مع تمثيل كل شيء كرموز (tokens) في نافذة سياق واحدة. لا توجد استدعاءات أدوات ولا نموذج ثانٍ.

يوضّح العرض التوضيحي الفرق بشكل ملموس. يطلب مستخدم لقطة جوية منخفضة لمنارة حمراء وبيضاء على رأس صخري. يقوم Rho-1 بتوليدها. يطلب المستخدم رسم مربع حول المنارة؛ فيرسمه. يطلب المستخدم تحريكها كلقطة اقتراب بطائرة مسيّرة؛ فيولّد فيديو من إطار الصورة التي أنشأها للتو. يطلب المستخدم عاصفة ثلجية مع الحفاظ على حركة الكاميرا نفسها؛ فيعدّل الفيديو. أخيرًا، يسأل المستخدم عما تغيّر بين المقطعين، فيجيب النموذج نصيًا.

كل خطوة في هذا التسلسل تعتمد على أن النموذج لا يزال قادرًا على الوصول إلى ما أنتجه سابقًا. كان خط الأنابيب التقليدي سيتعين عليه تمرير الصورة والفيديو بين الخدمات وإعادة بناء السياق عند كل حد. يحتفظ Rho-1 بذلك في سياق الانتباه نفسه، ولهذا يبقى التسلسل متماسكًا.

تياران، ذاكرة واحدة

تقسم البنية كل كتلة محوّل بين تياري أوزان خبيرين يشتركان في عملية انتباه. يعالج تيار الفهم اللغة، ورموز الاستدلال الداخلية، والمدخلات البصرية، ويُصدر رأس التنبؤ بالرمز التالي مخرجات منفصلة. ويستخدم تيار التوليد رأس مطابقة التدفق لإزالة الضوضاء من تمثيلات كامنة متصلة وتحويلها إلى صور وفيديو.

يقرأ التياران من ذاكرة KV نفسها. تبقى التعليمات والمحتوى البصري المولّد سابقًا ورموز الاستدلال وأوامر الحركة كلها متاحة. تشير رمزية خاصة عندما تحتاج الاستجابة إلى توليد بصري، ما يسمح لتيار التوليد بالاستمرار من الحالة المتراكمة بدلًا من البدء من جديد.

كرة زجاجية شفافة واحدة تحتوي على غرفتين متوهجتين منفصلتين، إحداهما كهرمانية دافئة والأخرى زرقاء باردة

يحمل النموذج المعلومات بصيغتين عن قصد. تتعامل الرموز المنفصلة مع النص والاستدلال الرمزي. أما التمثيلات المتصلة فتحمل الكامنات الصورية وإطارات الفيديو وحركات الروبوت والحس العميق. الحفاظ على الإشارات الفيزيائية متصلة يتجنب فقدان الدقة الناتج عن إجبار مواضع المفاصل وسرعاتها على الدخول في مفردات منفصلة.

هذه التفصيلة الأخيرة هي ما يجعل ادعاء التحكم الروبوتي أكثر من عبارة تسويقية. الأوزان نفسها التي تتنبأ بصورة كاميرا تقود أيضًا حركة الروبوت، لأن كليهما يعيش في الفضاء التمثيلي نفسه.

مقاربة التوليد من الاتجاه الآخر

تذكر Reka نسختين. يستخدم النموذج الأساسي 99 خطوة إزالة ضوضاء ويولّد بمعدل وسيط يبلغ 0.79 من الزمن الحقيقي، مع بدء الإخراج المتدفق بعد نحو ست ثوانٍ. وتستخدم نسخة مُقطّرة تُسمى Rho-1 Flash ثماني خطوات وتعيد مقطعًا مدته 5.3 ثوانٍ في نحو ثانية واحدة. وتعيد تعديلات Flash توليد مقاطع مدتها نحو ثانية في حوالي 1.1 ثانية.

يمكن لواجهة التدفق تمديد مقطع من حالته الكامنة السابقة وقبول تعليمات جديدة أثناء التوليد. في أحد العروض الجوية، تصل أوامر الانعطاف يسارًا والانعطاف يمينًا بعد نصف ثانية من بدء التشغيل. تتشارك الفروع الناتجة الإطارات الافتتاحية نفسها قبل أن تتفرع. هذه قدرة حقيقية إن صحّت خارج عرض خاضع للتحكم، لأنها تعني أن مخرجًا يمكنه توجيه اللقطة أثناء تنفيذها بدلًا من إعادة توليدها من الصفر.

للالتفاف حول نقص بيانات تدريب الروبوتات، بنت Reka نموذج ديناميكات عكسي يستخرج إشارات التحكم من فيديوهات الإنترنت العادية. درّبت العمود الفقري المشترك على 320 من وحدات H100 GPU خلال نحو ثلاثة أشهر، وهو قدر متواضع مقارنة بعمليات الحدود التقنية.

تستحق حكاية الحوسبة التركيز. تدريب نموذج بحجم 19B على 320 من H100 لمدة ثلاثة أشهر هو تشغيل صغير بمعايير الحدود التقنية، حيث تُدرَّب الأنظمة على عشرات الآلاف من المسرّعات. إذا قدّم Rho-1 حتى جزءًا من وعده المعماري عند هذا النطاق، فهذا يشير إلى أن الموجة التالية من القدرات متعددة الوسائط لن تتطلب رأس مال هائل، وأن المختبرات الأصغر يمكنها مع ذلك تقديم إسهامات بنيوية بدلًا من التنافس على الحوسبة وحدها.

أين يندرج هذا في سباق نماذج العالم

يأتي Rho-1 في أسبوع مزدحم للنماذج التي تحاول تمثيل كيفية تطور مشهد ما. أصدرت InSpatio نموذج InSpatio-World 1.5، الذي يحوّل صورة واحدة أو بانوراما أو فيديو إلى عالم رباعي الأبعاد قابل للتنقل، وتصدّر أحد معايير المشاهد الديناميكية بين الطرق التفاعلية الفورية. وجعلت Nvidia نموذج Lyra 2.0 مفتوح المصدر، وهو يحوّل صورة إلى بيئة ثلاثية الأبعاد قابلة للاستكشاف. تعمل Google ومجموعة من المختبرات الصينية جميعًا على المسار نفسه.

تختلف زاوية Reka عن حشد إعادة البناء. تبني تلك المشاريع مشهدًا يمكنك التحرك خلاله. يحاول Rho-1 بناء نموذج يستطيع وصف مشهد وتغييره عند الطلب، مع إخراج أوامر الحركة أيضًا للتصرف بناءً عليه. إذا نجح ذلك، فقد تقود نقطة التفتيش نفسها روبوتًا وتروي ما يراه الروبوت، دون شبكة سياسة منفصلة أو نموذج رؤية-لغة منفصل.

ادعاء الروبوتات هو الأكثر أهمية والأقل تحققًا. قالت Reka إن الأوزان نفسها التي تتنبأ بصور الكاميرا تقود أيضًا حركة الروبوت، وإنها بنت نموذج ديناميكات عكسي لاستخراج إشارات التحكم من فيديوهات الإنترنت العادية لأن بيانات الروبوتات نادرة. إذا صمد النهج، فإنه يشير إلى طريقة للالتفاف حول أكبر عقبة في الذكاء الاصطناعي المُجسَّد، وهي أن مسارات الروبوتات الحقيقية مكلفة الجمع ومحدودة التنوع. وإذا لم يصمد، فميزة التحكم الروبوتي مجرد مقطع عرضي.

يُهمّ الإصدار أيضًا لكيفية تسعير هذه الأنظمة. تفرض معظم المنتجات متعددة الوسائط رسومًا منفصلة على التخطيط وتوليد الصور وتوليد الفيديو، لأن كلًا منها خدمة مختلفة. نموذج واحد ينفذ الثلاثة في نافذة سياق واحدة يغيّر اقتصاديات الوحدة لأي منتج مبني فوقه. وما إذا كان ذلك سيظهر في صورة أسعار أقل يعتمد على مدى كفاءة خدمة النموذج الموحّد للطلبات المتزامنة، وهو بالضبط ما يكشفه الاختبار المستقل.

الادعاءات التي لا تزال مفتوحة

تأتي أرقام أداء Rho-1 من معاينة Reka ولا يمكن إعادة إنتاجها بعد، لأنه لا توجد أوزان عامة أو واجهة برمجة تطبيقات. يمكن أن تغيّر إعدادات العتاد والدفعات وإعدادات الإخراج وخيارات الترجمة زمن استجابة الفيديو بعوامل كبيرة، لذا تحتاج أرقام الكفاءة إلى تكرار مستقل قبل أن تعني الكثير.

للنموذج حدود معترف بها. الفيديو الأصلي محدود بدقة 672x384. ويوصف الانحراف البنيوي طويل المدى، والتأريض بالفيديو، واستقرار التعديل بأنها نقاط ضعف من قبل الشركة نفسها. هذه هي المشكلات ذاتها التي تعاني منها كل نماذج العالم، ومن غير المرجح أن شبكة بحجم 19B قد حلّتها تمامًا.

يتلاءم الإصدار مع تحول أوسع نحو نماذج العالم، حيث الهدف هو نظام يستطيع التنبؤ بكيفية تطور مشهد والتصرف بناءً على ذلك التنبؤ. إسهام Rho-1 معماري: فهو يجادل بأن الفهم والتوليد ينبغي أن يتشاركا الأوزان والسياق بدلًا من حياكتهما معًا. وما إذا كان هذا الجدل سينتصر يعتمد على شكل المعاينات البحثية القليلة التالية من مختبرات أخرى، وعلى ما إذا كانت Reka ستطلق شيئًا يمكن لطرف ثالث اختباره.

مقالات ذات صلة