نماذج صينية كبيرة تتسابق إلى المصادر المفتوحة في سبتمبر: هذه المرة، المنافسة على «القدرة على تحمل التكلفة»

لم يمرّ نصف شهر سبتمبر بعد، حتى بدأ القائمون على التقييم يجدون صعوبة في ملاحقة وتيرة تحديثات النماذج الصينية الكبيرة. فالجديد لدى Zhipu، وMeituan، وMianbi، وTencent، وAnt، جاء تقريبًا في النافذة الزمنية نفسها، وامتدّت الأنواع من النماذج العامة الكبيرة إلى النماذج الصغيرة على الأجهزة الطرفية، ثم إلى توليد الصور والذكاء الاصطناعي المجسّد. وراء هذا النشاط، ما يستحق التأمل فعلًا هو الطريق الذي اختارته هذه الشركات من دون اتفاق مسبق: لم تكتفِ بزيادة المعاملات إلى الأعلى، بل ركّزت على «كيف نجعل النموذج في متناول الاستخدام والاستيعاب في النشر».
نبدأ مع Zhipu. أطلق في سبتمبر نموذج GLM-5.3-Flash بإجمالي 320 مليار معامل، لكن المعاملات النشطة التي تشارك فعليًا في الحساب في كل مرة لا تتجاوز 18 مليارًا. فكرة التنشيط المتناثر مباشرة: كبّر النموذج، ثم أيقظ في الاستدلال الواحد جزءًا صغيرًا فقط، فتنخفض التكلفة وزمن الاستجابة معًا. وهو مفتوح المصدر بترخيص MIT، ويدعم الوسائط المتعددة أصلًا، ويكلّف كل مليون رمز (Token) ناتج نحو 0.25 دولار. لكن الجملة الأثقل في ملاحظات الإصدار هي: خدمة الاستدلال تعمل بالكامل على شرائح ذكاء اصطناعي صينية، وقد تحسّن الأداء من الطرف إلى الطرف نحو ثلاثة أضعاف مقارنة بالمعيار الأولي، كما بلغت حصة الرموز المجانية 100 تريليون Token يوميًا. وبالنسبة للمطورين، وزن هذه الجملة يتجاوز أي رقم في جدول المعاملات.
وعلى الجانب الآخر، كشفت Meituan عن LongCat-2.0 بإجمالي 1.6 تريليون معامل، ويدعم أصلًا سياقًا يصل إلى مليون Token. ولا تكمن جاذبيته في الحجم، بل في التربة التي دُرّب فيها: تقول الشركة إنه أول نموذج كبير مفتوح المصدر بتريليون معامل يُكمل دورة تدريب واستدلال كاملة على عنقود حوسبة صيني بمستوى عشرة آلاف بطاقة. وترافقه أيضًا منصة العمل التشغيلية بالذكاء الاصطناعي CatPaw، والوكيل الذكي للخدمات المحلية «شياوتوان»، الذي استجاب لأكثر من 700 مليون طلب مستخدم حتى الآن. شركة بدأت من الخدمات المحلية وتضع نموذجًا بتريليون معامل على الطاولة، ما يعني أن بنية التكلفة في هذا المضمار بدأت تتفكك.
أما MiniCPM5-2B من Mianbi فسلك الاتجاه المعاكس، وضغط المعاملات إلى مستوى 2 مليار وانطلق نحو الأجهزة الطرفية. وهو يواصل نهج MiniCPM المعتاد: معاملات صغيرة وقابلية للتطبيق، إذ يمكن تثبيته في هاتف أو جهاز حوسبة طرفية ويؤدي المهمة. وفي التوقيت نفسه تقريبًا، جعلت MiniMax أداة Code CLI مفتوحة المصدر بترخيص MIT، وأضافت Zhipu نموذج GLM-5.3-FlashX الموجّه للإنتاجية العالية، بسرعة استدلال تبلغ نحو 200 Token في الثانية. وهكذا تكاملت ثلاثة مسارات: الأجهزة الطرفية، وتسريع الاستدلال، وأدوات البرمجة. هذه التركيبة تقول عن نضج المنظومة أكثر مما يقوله أي «نموذج رائد» منفرد.
عند جمع هذه الخطوات معًا، يبدأ اتجاه بالوضوح: المصادر المفتوحة تتحوّل إلى وسيلة تنافس، لا إلى شعار عاطفي. فترخيص MIT، والأوزان المفتوحة، والحصص المجانية، كلها تحركات عملية التوجه: من يجذب المطورين والشركات الصغيرة والمتوسطة إلى منظومته أولًا، يحصل أولًا على حجم الاستدعاءات في الجولة التالية. التفوق في المعاملات قد يملأ مؤتمر إطلاق، لكنه لا يملأ بيئة إنتاج يومية.
ولم يغب خط الصور أيضًا. في 4 سبتمبر، أطلق مختبر بايلينغ التابع لمجموعة Ant ونشر مفتوح المصدر سلسلة LLaDA-Image، وتضم نسختي Base وTurbo بنحو 7 مليارات معامل، مع دعم نقطة تفتيش واحدة لتوليد الصور من النص، وتحرير الصور المرجعية، وتصيير النصين الصيني والإنجليزي، من دون فروع تحرير إضافية. وتكمن الميزة في نسخة Turbo، إذ تستخدم تقطير Twin-DMD لتقليص خطوات أخذ العينات إلى 2-4 خطوات، مع الحفاظ على الجودة والسرعة معًا، والاستدلال لا يعتمد على وحدات GPU متقدمة. على Qwen-Image-Bench، حصلت على 53.53 نقطة في المشاهد الإنجليزية و53.38 في المشاهد الصينية، وتقول الشركة إنها الأفضل حاليًا في الحالتين. وانتقال الخطوات من 50 خطوة المعتادة إلى رقم من خانة واحدة لا يعني السرعة فحسب، بل يجعل التوليد اللحظي ممكنًا على عتاد استهلاكي.
وفي مجال الذكاء المجسّد، أصدر Zidong Taichu نموذج ZDTaichu5.0-9B مفتوح المصدر في 15 سبتمبر. وقد حقّق هذا النموذج ذو الـ 9 مليارات معامل ثمانية مراكز أولى عالميًا ضمن فئة المعاملات نفسها في فهم الفضاء والمهام المجسّدة، وحصل على 78.27 نقطة في MindCube-tiny، متقدمًا على Qwen3.5-9B بـ 20.67 نقطة مئوية. إنه يسدّ الجزء الخاص بسؤال الروبوت «ماذا أفعل بعد أن أرى؟»: فالتعرف على الكوب يجيب فقط عن «ما هذا»، أما تقدير اتجاه مقبضه وما إذا كان يمكن وضع شيء بجانبه، فيقترب من «ما الذي يمكن فعله».
وهناك أيضًا Tencent، الذي لا يمكن تجاهله. في 22 سبتمبر، أصدر Hunyuan نسخة معاينة من نموذج الصور 3.5، مع تحسينات تركز على توليد النصوص وتخطيط الصورة والواقعية والتحرير المتواصل، ويمكن رفع ما يصل إلى 5 صور مرجعية في المرة الواحدة، بحد أقصى 2K للإخراج. وجاء السعر عند 0.15 يوان للصورة بدقة 2K، مع تحصيل مقابل الإخراج النهائي فقط. كما أن اختيار تاريخ الإصدار مدروس، إذ تزامن مع يوم افتتاح مؤتمر Apsara التابع لـ Alibaba Cloud. أصبحت هذه «الإصدارات المتزامنة مع اللحظة» مألوفة في الصين، لكنها في نماذج الصور تنقل المنافسة من المستوى التقني مباشرة إلى مستوى الانتباه ومداخل المنظومة.
بربط هذه التحركات ببعضها، يمكن اختصار خط سبتمبر الرئيسي في ثلاثة أمور: تسريع المصادر المفتوحة، وانخفاض أسعار الاستدلال، واستقلالية الحوسبة. والثلاثة في الواقع متشابكة. فالمصادر المفتوحة تخفض حاجز الاستخدام، والاستدلال منخفض السعر يحوّل الحاجز إلى حجم استدعاءات حقيقي، أما إحلال الحوسبة الصينية فيحدد ما إذا كان هذا السعر المنخفض قابلًا للاستمرار. حين يجرؤ GLM-5.3-Flash على الجمع بين MIT والحصة المجانية، ويجرؤ LongCat-2.0 على تشغيل تريليون معامل على عنقود صيني بعشرة آلاف بطاقة، فالحكم واحد في الحالتين: التكلفة تحت السيطرة، ولهذا يمكن تسليم النموذج للآخرين.
وبالنسبة للمبدعين العاديين والشركات الصغيرة والمتوسطة، فالتأثير المباشر لهذه الجولة هو أن الحسابات أصبحت مجدية. في الماضي، من أراد استخدام نموذج متقدم كان عليه إما تحمّل فاتورة API غير رخيصة، أو جمع وحدات GPU بنفسه، وهذان الحاجزان استبعدا الأغلبية. أما الآن، فصورة 2K بـ 0.15 يوان، وتوليد صور لحظي بـ 2 إلى 4 خطوات، ونموذج طرفي يعمل بمعاملات تبلغ 2 مليار فقط، كلها تضغط هذه التكاليف إلى نطاق سيجرّبه كثيرون فعلًا. وعندما ترخص الأدوات، يزداد عدد المحاولات والخطأ، وغالبًا ما تُصقل جودة الأعمال في هذا التكرار من التجريب والخطأ.

وهناك أيضًا ما يستدعي البقاء متيقظين. فتراخي تراخيص المصادر المفتوحة أكثر لا يعني أن الاستخدام التجاري بلا ثمن؛ فالشروط غير التجارية، والامتثال للبيانات، وقابلية التحكم في سلوك النموذج، كلها لا تزال بحاجة إلى تحقق واحدًا واحدًا في الأعمال الحقيقية. كما أن تحسّن أداء الاستدلال ثلاثة أضعاف على شرائح صينية مبني على مقارنات بمعايير خاصة بكل جهة، ولم يلحق به بعد إعادة إنتاج من طرف ثالث؛ ولا تزال هناك حالات يكون فيها النموذج «مفتوح المصدر» لكن كود التدريب غير منشور، ما يقيّد إعادة الإنتاج والتطوير الثانوي. الأرقام الجميلة شيء، والقدرة على التسليم المستقر شيء آخر.
في هذه الموجة الكثيفة من تحديثات سبتمبر، الإشارة الحقيقية ليست «كم مركز أول جديدًا حققت النماذج الصينية»، بل أن منطق التكلفة على مستوى العرض كله يعاد ترتيبه. فعندما يصبح النموذج نفسه أشبه بالبنية التحتية، تنتقل المنافسة إلى المصب: من يكون سير عمله أكثر سلاسة، ومن يلتقط السيناريو بدقة أكبر، ومن يستطيع تحويل الحوسبة الرخيصة إلى أعمال مستقرة. المصادر المفتوحة لم تفعل سوى إطلاق رصاصة البداية، وما زال أمام الجميع طريق طويل للركض.
مقالات ذات صلة
إطار واحد للغة والرؤية: نموذج هورايزن المفتوح بحجم 1.6 مليار
رهان على أن الجسور بين اللغة والرؤية لم تكن مطلوبة قط.
جدار الذاكرة الفوتوني هو رهان الـ88 مليون دولار الذي أقدمت عليه فولانتيس للتو
المقايضة التي اعتاد الجميع التعايش معها هي الشيء الذي تحاول إلغاءه.
علي بابا تفتح المصدر لنموذج متعدد الوسائط بحجم 30B: 3 مليارات معامل نشط، تتحدى GPT-5-Mini وجهاً لوجه
3 مليارات معامل نشط، تمنح قدرات متعددة الوسائط تقارب الطراز الرائد.
صور المنتجات بالذكاء الاصطناعي تصطدم بجدار امتثال لم يحسبه أحد في التكلفة
كانت التكلفة تُقتبس دائمًا لكل عملية توليد. أما التكلفة الحقيقية فمسعّرة لكل أصل ينجو من المراجعة.