← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

إطار واحد للغة والرؤية: نموذج هورايزن المفتوح بحجم 1.6 مليار

نُشر في 4 أكتوبر 2026
إطار واحد للغة والرؤية: نموذج هورايزن المفتوح بحجم 1.6 مليار

تقترح ورقة بحثية من جامعة هواتشونغ للعلوم والتكنولوجيا، وجامعة بكين جياوتونغ، وشركة هورايزن روبوتيكس شيئًا يبدو أساسيًا لدرجة تكاد تجعله غير جديد: نموذج واحد يتعامل مع اللغة والصور باعتبارهما الشيء نفسه.

يُسمى الإطار Multimodal Flow، أو MF-1، وهو مفتوح بالكامل. أكبر نسخة منه تضم 1.6 مليار معامل، دُرّبت على 150 مليار رمز تدريب مسبق. يسجل 82.8 في GenEval و75.3 في DPG-Bench، ما يضع نموذجًا متواضع الحجم إلى جانب أنظمة متعددة الوسائط أكبر بكثير.

الفكرة في جملة واحدة

معظم النماذج متعددة الوسائط تجميعات. نموذج نصي ونموذج صور، أو عمود لغوي فقري مع مكونات رؤية منفصلة تُربط به، تتبادل التمثيلات ذهابًا وإيابًا عبر رموز منفصلة أو مُرمِّزات منفصلة. لا يفعل MF-1 ذلك. إنه يمثل النص والصور معًا في فضاء تضمين مشترك، ويستخدم Flow Matching كهدف توليدي واحد وإجراء أخذ عينات لكليهما.

شريط واحد من زجاج صافٍ ينحني عبر الظلام، مضاء بدرجات دافئة وباردة

هذا هو الادعاء المثير للاهتمام. فبدلًا من الترجمة بين الوسائط عند حدود معينة، يعمل النموذج على تمثيل مستمر واحد حيث لا تكون اللغة والرؤية كائنين مختلفين جوهريًا. ويرى المؤلفون أن هذا يتجنب نقاط ضعف المقاربات المنفصلة والهجينة التي تهيمن على الممارسة الحالية.

إذا صمد هذا، فالمكسب هو العمومية. إطار واحد يتعامل مع نمذجة اللغة، والفهم البصري، وتوليد الصور، والتحرير، وتتابعات الفيديو هو شيء أبسط بكثير في التدريب والتوسيع والاستدلال من سلسلة من المتخصصين. كما يشير إلى مستقبل يمكن فيه لوسائط أخرى، أي مدخل يمكن التعبير عنه ككتلة مستمرة مرتبة، أن تندرج في البنية نفسها دون إعادة تصميم.

ثمة سبب عملي لرغبة في ذلك يتجاوز الأناقة. ففي كل مرة تضيف وسيطًا جديدًا إلى نظام، تُدخل واجهة جديدة يجب صيانتها وموضعًا جديدًا تتراكم فيه الأخطاء. ربط مُرمِّز رؤية بنموذج لغوي يعني أنه يجب اختصار الصورة إلى رموز يفهمها النموذج اللغوي، وهذا الاختصار يفقد معلومات. التمثيل المشترك يتخطى خطوة الترجمة، وهناك يتسرب الكثير من الجودة الدقيقة من الأنظمة متعددة الوسائط.

الاسم في قائمة الإسهامات

ثمة تفصيل في قائمة المؤلفين يستحق نظرة ثانية. من بين المؤلفين يو كاي، مؤسس هورايزن روبوتيكس والمهندس المعماري سابقًا لجهود بايدو في التعلم العميق، والمؤسس المشارك هوانغ تشانغ. المؤلف المراسل هو وانغ شينغغانغ من مختبر الرؤية في جامعة هواتشونغ.

وجود اسم يو على ورقة بحثية ليس أمرًا روتينيًا. فقد نشر نادرًا في السنوات منذ 2016، حين كان جزءًا من محاولة سابقة لتوحيد كشف النص في المشاهد الطبيعية. وظهوره الآن، في ورقة عن توحيد اللغة والرؤية، يُقرأ كعودة متعمدة إلى مشكلة عمل عليها قبل عقد، في لحظة تملك فيها الصناعة الحوسبة والبيانات لجعلها ذات شأن.

ثمة عبارة دالة تُنسب إليه من حديث سابق: أن الكلمات الرنانة، VLA وVLM ومن طرف إلى طرف ونموذج العالم، غالبًا ما تكون ذات معنى تجاري أكثر من كونها ذات معنى تقني، وأن الفرق الجادة تفعل أشياء متشابهة إلى حد كبير. وورقة بحثية تدمج عدة من هذه الفئات في إطار توليدي واحد تنسجم مع هذا الرأي. إنها حجة بأن التسميات أقل أهمية من الآلية الكامنة.

لماذا الصغر والانفتاح هما المقصد

نموذج بـ1.6 مليار معامل يسجل نتائج تنافسية جدير بالملاحظة للسبب نفسه الذي يجعل النماذج الصغيرة الصادرة من مختبرات أخرى جديرة بالملاحظة. القدرة لكل معامل هي المقياس الذي يحدد ما يعمل محليًا، وما يعمل على هاتف، وما يمكن لفريق صغير تحمل تكلفة ضبطه الدقيق.

كما أن 150 مليار رمز تدريب متواضعة بمعايير الطليعة، ما يوحي بأن المقاربة فعّالة بدلًا من كونها قائمة على القوة الغاشمة. وما إذا كانت هذه الفعالية تصمد عند نطاق أكبر هو السؤال المفتوح. النموذج الصغير الذي يتصرف جيدًا يقول شيئًا عن طريقة ما، لكن ليس كل شيء.

الأوزان المفتوحة مهمة هنا لسبب محدد. فالإطار التوليدي الموحّد يكون أكثر فائدة إذا استطاع آخرون توسيعه، واختباره على وسائط لم يجربها المؤلفون، والبناء على التمثيل المشترك. النسخة المغلقة ستكون ورقة مثيرة للاهتمام. أما المفتوحة فهي أداة.

ما لا تغطيه المعايير القياسية

يقيس GenEval وDPG-Bench مدى أمانة تحويل النموذج للموجّه إلى صورة. لكنهما لا يقولان شيئًا عن ما إذا كان التمثيل الموحّد يحسّن قدرة النموذج على الاستدلال حول النص والصور معًا، وهو الادعاء الفعلي. فقد يحصل نموذج على نتيجة جيدة في أمانة الصورة بينما يعامل الوسيطين كنظامين فرعيين منفصلين يتشاركان صيغة أرقام فحسب. والمؤلفون واعون بهذه الفجوة، والحجة الحقيقية للورقة تكمن في البنية، لا في النتائج. وبالنسبة لأي شخص يقيّم العمل، السؤال الصحيح هو ما إذا كان التمثيل المشترك يغيّر السلوك في المهام التي تتطلب الوسيطين معًا، وهذا بالضبط ما تتركه المعايير دون قياس.

المجهولات الصادقة

توحيد الوسائط في فضاء واحد ادعاء قوي، والادعاءات القوية تستدعي التدقيق. نتائج المعايير حقيقية، لكنها تقيس أمانة توليد الصور، لا ما إذا كان التمثيل المشترك يساعد النموذج فعليًا على الاستدلال عبر الوسائط بالطريقة التي يوحي بها التأطير. من الممكن الحصول على رقم GenEval جيد ومع ذلك يكون لديك نموذج يتعامل مع النص والصور كجيران في تضمين بدلًا من كونهما المادة نفسها حقًا.

المجهول الآخر هو الحجم. كانت التمثيلات الموحّدة المستمرة تاريخيًا جذابة نظريًا وعنيدة عمليًا، لأن إشارة التدريب قد تكون أصعب في التثبيت مما هي عليه في إعداد منفصل. ونجاح بحجم 1.6 مليار مشجّع وليس حاسمًا بعد.

إلى أين يشير بعد ذلك

الامتداد الواضح هو الفيديو والصوت، وكلاهما إشارات مستمرة، وبالتالي ملائمان طبيعيًا لإطار مبني على تمثيلات مستمرة. ويشير المؤلفون إلى هذا، معتبرين أي وسيط يمكن التعبير عنه ككتلة مستمرة مرتبة مجالًا مشروعًا. وإذا صمدت المقاربة، فالمكسب هو خط أنابيب واحد يمكن لفريق توسيعه إلى وسيط لم يمسّه المؤلفون الأصليون قط. هذا هو الوعد الذي تحمله الأوزان المفتوحة هنا: ليس منتجًا منتهيًا، بل أساس يمكن للآخرين تطويعه وفق مشكلتهم.

الصورة الأكبر

ما يجعل هذا جديرًا بالمتابعة هو الاتجاه أكثر من النموذج نفسه. لقد أمضى المجال سنوات في بناء جسور متزايدة الإتقان بين أنظمة نصية وبصرية منفصلة. وMF-1 رهان على أن الجسور غير ضرورية، وأن الخطوة الصحيحة هي التوقف عن معاملة اللغة والصور كغريبة بعضها عن بعض ونمذجتها على أساس واحد.

إذا كان هذا الرهان صحيحًا، فالنتيجة العملية مملة بأفضل معنى. إطار واحد، هدف تدريب واحد، مجموعة أدوات واحدة، تُطبق على أي وسيط تحتاجه تاليًا. وإذا كان خاطئًا، فسيظل تجربة جيدة التنفيذ من فريق له تاريخ طويل في المجال، صدرت في العلن حيث يمكن التحقق منها.

في كلتا الحالتين، الجزء المثير للاهتمام هو أن الأشخاص الذين راقبوا هذه المشكلة لعقد كامل اختاروا الآن مهاجمتها مجددًا، واختاروا فعل ذلك بنموذج مفتوح وصغير بدلًا من نموذج عملاق. وهذا المزيج عادة إشارة إلى أن أحدهم يعتقد أن الطريقة، وليس الحجم، هي ما كان ناقصًا.

مقالات ذات صلة