← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

شاومي تطرح نموذجًا متعدد الوسائط يضاهي الحدود القصوى، بالإضافة إلى وصفة التدريب

نُشر في 4 أكتوبر 2026
شاومي تطرح نموذجًا متعدد الوسائط يضاهي الحدود القصوى، بالإضافة إلى وصفة التدريب

أطلقت شركة هواتف نموذج ذكاء اصطناعي في 22 سبتمبر وكان الرقم الرئيسي هو 46. هذا هو تقييم شاومي لـ MiMo-V2.6 Pro على مؤشر Artificial Analysis للذكاء، والذي تقول الشركة إنه الأعلى الذي سجله نموذج مفتوح المصدر وقت الإصدار.

يأتي MiMo-V2.6 في نسختين. Pro هي النسخة الكبيرة، وFlash هي السريعة. تقول شاومي إن Pro يؤدي على قدم المساواة مع Claude Opus 5 و GPT-5.6 Sol في معظم اختبارات الوكلاء، وتشير إلى تحسينات في البرمجة، واستخدام الكمبيوتر، والاستدلال ثلاثي الأبعاد، والمهام الإبداعية. النماذج متعددة الوسائط، مما يعني أنها تقبل النصوص والصور والمدخلات الأخرى من خلال مجموعة واحدة من الأوزان، وقد تم تدريبها باستخدام التعلم المعزز الموسع، وهو الجزء الذي يفسر كل من القدرات وتنسيق الإصدار.

ما الذي جاء فعلاً في التنزيل

معظم إصدارات الأوزان المفتوحة تسلم الأوزان وتتوقف عند هذا الحد. يشحن MiMo-V2.6 الأوزان، وتقريرًا فنيًا، وبيئات التعلم المعزز، وكود التدريب. نشرت شاومي الأربعة جميعًا على موقعها الخاص بدلاً من توجيه المطورين عبر مركز نموذج بصفحة ترخيص وقائمة انتظار.

إدراج بيئات التعلم المعزز هو الفرق الجوهري. الأوزان تتيح لك تشغيل النموذج. البيئات تتيح لك إعادة تدريبه. عندما يطلق مختبر البيئات التي تدرب عليها، فإنه يخبرك كيف حصل على السلوك وليس فقط ما هو السلوك. بالنسبة لأي شخص يريد إعادة إنتاج النتيجة، أو ضبط النموذج وفقًا لإشارة المكافأة الخاصة به، فإن البيئات هي المنتج الفعلي.

كما أنه يرفع تكلفة الإصدار للشركة التي صنعته. نشر البيئات يكشف شكل إشارة التدريب، وهو أقرب إلى وصفة من كونه نقطة تفتيش. يمكن لمنافس قراءته وتخطي عام من التجربة والخطأ. يبدو أن شاومي قررت أن فوائد التوظيف والمصداقية تفوق ذلك.

لماذا تقوم شركة أجهزة بأبحاث متقدمة

شاومي ليست مختبرًا بحثيًا يبيع الهواتف بالمناسبة. بل العكس هو الصحيح، وهذا التوجه يظهر في ما يكون النموذج متعدد الوسائط جيدًا فيه.

الهاتف هو الموطن الطبيعي لمساعد يمكنه قراءة الشاشة، وفهم صورة فوتوغرافية، وتشغيل واجهة، والإجابة في محادثة منطوقة. استخدام الكمبيوتر، والاستدلال ثلاثي الأبعاد، والتوليد الإبداعي ليست اختبارات مجردة من وجهة النظر هذه. إنها مكونات نظام يجب أن يعمل على جهاز يحمله شخص ما، غالبًا مع اتصال بطيء وبطارية يجب حمايتها. عائلة نموذج مقسمة إلى فئة Pro للقدرات وفئة Flash لزمن الاستجابة هي قرار خارطة طريق للجهاز بقدر ما هو قرار بحثي.

إطلاق الأوزان يخدم غرضين. فهو يجذب باحثين سيعملون على تحسين النموذج علنًا، ويضع حدًا أدنى لموقع الشركة في سوق تُؤخذ فيه ادعاءات القدرات على الثقة لولا ذلك. النموذج الذي يمكنك تنزيله وتقييمه بنفسك يحتاج إلى تسويق أقل، وتتنافس شاومي على اهتمام المطورين ضد مختبرات تقوم سمعتها بأكملها على النتائج المنشورة.

ماذا يعني متعدد الوسائط في الممارسة العملية

يغطي المصطلح ادعاءً هندسيًا محددًا: نموذج واحد يتعامل مع عدة أنواع من المدخلات من خلال تمثيل مشترك بدلاً من توجيه كل نوع إدخال إلى متخصص منفصل. بالنسبة للهاتف، هذا مهم لأن البديل هو تشغيل عدة نماذج ودمج مخرجاتها، والذاكرة وزمن الاستجابة كلاهما نادر على الهاتف المحمول. توجد فئة Flash من شاومي لنفس السبب. النموذج الذي يجيب في ثانية على جهاز رائد يمكن أن يكون غير قابل للاستخدام على جهاز متوسط المدى أو في سيارة، لذا فإن العائلة هي في الواقع نقطتان على منحنى القدرات وزمن الاستجابة بدلاً من إصدار واحد.

عدسة زجاجية شفافة مع انكسار قوس قزح تستقر على حلقة داكنة

طريقة التدريب تشرح الباقي. التعلم المعزز الموسع يعني أن النموذج يتم تحسينه وفقًا لإشارة مكافأة بدلاً من تدريبه فقط للتنبؤ بالرمز التالي، وهو النهج وراء القفزة الأخيرة في أداء الوكلاء عبر الصناعة. وهو أيضًا سبب أهمية البيئات بقدر أهمية الأوزان. إشارة المكافأة لا تكون أفضل من البيئة التي تنتجها، لذا فإن نشر البيئة أقرب إلى نشر طريقة من نشر نتيجة.

الجهاز هو قناة التوزيع

ميزة شاومي هي أنها لا تحتاج إلى نظام بيئي للمطورين للوصول إلى المستخدمين. فهي تشحن الأجهزة إلى عشرات الملايين من الناس، والنموذج الذي يعمل داخل مساعد الهاتف يصل إلى عدد أكبر من الناس في ربع سنة مما يصل إليه مركز نموذج في عام. لهذا السبب فإن تنسيق الإصدار سخي. الأوزان والوصفة تكلف الشركة القليل نسبيًا من عائدات الترخيص المفقودة، وتشتري المصداقية مع المجتمع البحثي الذي لولا ذلك سيحكم على النموذج من لقطة شاشة لاختبار.

المخاطرة هي نفسها الميزة. يتم الحكم على مساعد الهاتف بما إذا كان يعمل في كل مرة، والوكيل الذي يفشل في مهمة واحدة من كل عشرين هو مصدر إزعاج في نافذة دردشة ومسؤولية داخل جهاز يتعامل أيضًا مع المدفوعات والصور والرسائل. لا تقيس اختبارات القدرات هذه الفجوة، ولا تقيسها درجة مركبة من 46.

في نفس الثلاثاء، ثلاثة إصدارات أخرى

التوقيت معبر. في 22 سبتمبر، ظهر نموذج شاومي جنبًا إلى جنب مع Qwen-Image-2.1 من علي بابا، والذي جعلته علي بابا مفتوح الأوزان في 20 سبتمبر وقدمته في مؤتمر يونكي في نفس اليوم، ومعاينة Hy Image 3.5 من تينسنت، وهو نموذج صور احترافي بسعر 0.15 يوان لكل صورة 2K على واجهة برمجة تطبيقات Tencent Cloud. استخدمت Unitree نفس النافذة للإعلان عن Dex5-S، وهي يد روبوتية بارعة بدرجات حرية 22 تبدأ من 6,500 دولار.

استخدمت علي بابا أيضًا المؤتمر للمطالبة بالمركز الأول على لوحة صدارة الوكلاء الخاصة بـ Artificial Analysis لـ Qwen3.8-Max والمركز الأول على CodeArena لبرمجة الواجهات الأمامية، وللإعلان أن Qwen4 قيد التدريب مع نماذج خلف مخطط لها بخمسة إلى عشرة تريليون معامل. وأشار رئيس Qwen-Image إلى أن هدف الفريق هو تقليل تكلفة إكمال المهمة بدلاً من تعظيم عدد المعاملات، وهو نفس المقايضة التي تقوم بها بنية MiMo ذات الطبقتين.

لم يكن أي من هذه الإعلانات منسقًا وكلها أشارت في نفس الاتجاه. السؤال التنافسي في الذكاء الاصطناعي الصيني هذا الخريف ليس ما إذا كان هناك نموذج من فئة الحدود القصوى. بل هو مقدار ما يُسمح لك بامتلاكه منه.

تحذير الاختبار المعياري

رقم مثل 46 يعتمد كليًا على المؤشر الذي يقف خلفه، ومؤشر الذكاء الخاص بـ Artificial Analysis هو أحد المركبات من بين عدة. المقارنة مع Claude Opus 5 و GPT-5.6 Sol تمت بواسطة شاومي، على اختيار شاومي للاختبارات المعيارية، وعبارة «معظم اختبارات الوكلاء» تقوم بعمل كان من الأفضل أن يقوم به جدول نتائج. اختبارات الوكلاء على وجه الخصوص حساسة للسقالات: يمكن أن يحصل نفس النموذج على درجات مختلفة جدًا اعتمادًا على ما يحيط به.

ما يجعل الادعاء أكثر من تسويق هو التنزيل. يمكن لأي شخص يشك في 46 تشغيل النموذج، وقراءة التقرير، وإعادة تدريبه في البيئات التي شحنتها شاومي. هذا اختبار أصعب من لقطة شاشة للوحة الصدارة، وهو متاح فقط لأن الشركة اختارت نشر الوصفة مع النتيجة.

مقالات ذات صلة