Ling 3.1 Flash من Ant Group يفعّل 25 مليار من 560 مليار معامل ويسجل 41

--- title: Ling 3.1 Flash من Ant Group يفعّل 25 مليار من 560 مليار معامل ويسجل 41 meta_title: Ling 3.1 Flash يضع 560 مليار معامل خلف فاتورة 25 مليار meta_description: يسجل Ling 3.1 Flash من Ant Group 41 على مؤشر الذكاء مع 25 مليار معامل نشط من إجمالي 560 مليار، مما يظهر مدى امتداد MoE المتناثر. ---
أصدرت AntLingAGI التابعة لـ Ant Group إصدار Ling 3.1 Flash في 6 أكتوبر. الرقم الذي يبرز هو 25 مليار معامل التي تُفعَّل فعليًا عند تشغيل النموذج، من إجمالي 560 مليار.
سجل النموذج 41 على مؤشر الذكاء من Artificial Analysis، وهي قفزة واضحة عن سابقه. أبرز التقييم القدرات الوكيلية كمجال التحسن الأكثر حدة، وهي الفئة التي بدأ مشترو المؤسسات يمنحونها أكبر وزن.
المعمارية هي الحجة
Ling 3.1 Flash هو نموذج خليط الخبراء. يحمل 560 مليار معامل إجمالاً لكنه يفعّل نحو 25 مليار لكل رمز، ويدعم نافذة سياق تصل إلى مليون رمز.
هذه النسبة هي كل العرض. النموذج الكثيف بقدرة مماثلة سيحتاج إلى تحريك كل معامل لكل رمز يُولَّد. عبر توجيه كل رمز عبر مجموعة فرعية صغيرة من الخبراء، يقدم النموذج المتناثر مخرجات مماثلة بينما يلمس قدرة حسابية أقل بكثير. المقايضة هي الذاكرة: لا يزال على جميع الـ 560 مليار معامل أن تكون مقيمة في مكان ما، رغم أن معظمها يظل خاملاً في أي تمرير أمامي معين.

النتيجة العملية هي نموذج يمكن تقديمه بجزء بسيط من تكلفة نظير كثيف عند نفس مستوى الجودة، بشرط أن يمتلك الفريق العتاد اللازم لاستيعاب الأوزان. إنها نفس القصة الهندسية التي دفعت معظم إصدارات الأوزان المفتوحة الرائدة هذا العام، وهي السبب في أن المقياس المثير انتقل من إجمالي المعاملات إلى المعاملات النشطة.
ما تغطيه المعايير
نشرت Ant Group نتائج عبر مجموعة من التقييمات: GDPVal-AA v2.1 عند 1673 Elo، وFrontierSWE عند 75.16، وHealthBench عند 65.35، وDesign Arena، حيث يحتل مرتبة قريبة من القمة في تطبيقات الجوال وتوليد SVG.
درجة مؤشر الذكاء البالغة 41 هي العنوان الرئيسي، وهي تضع النموذج في صحبة إصدارات من مختبرات أكبر بكثير. تقول Ant Group إن النموذج الكامل سيُفتح مصدره، مع نشر الوثائق بالفعل. وتجري في الوقت نفسه تجربة مجانية لمدة أسبوعين.
العروض الهندسية أكثر دلالة من الدرجات
كما وصفت Ant Group ثلاثة أمثلة عملية، وهذه تقول عن الاستخدام المقصود أكثر مما تقوله لوحة الصدارة.
الأول: بناء مترجم Lua إلى x86 من الصفر، واجتياز 178 من 182 اختبارًا. تلك مهمة يجب أن يبقي فيها النموذج مواصفة كبيرة في ذهنه، وينتج كودًا متسقًا داخليًا عبر ملفات كثيرة، ويتتبع الحالات الحدية طوال الوقت. العمل يعاقب النماذج الضعيفة في التعامل مع السياق الطويل.
الثاني: تسريع فحص الأنواع على قاعدة كود Python كبيرة. هذه مهمة صيانة وليست مهمة بناء من الصفر، وهنا يذهب معظم وقت الهندسة الحقيقي فعلاً. النموذج القادر على التفكير في علاقات الأنواع لمستودع موجود مفيد بطريقة لا يكون فيها النموذج الذي يكتب دوالاً جديدة مفيدًا.
الثالث: بناء وكيل سطح مكتب ينسق بين متصفح وملفات محلية وأدوات طرفية. تنسيق الأدوات المتعددة هو الحدود الحالية للعمل الوكيلي، وهي القدرة التي تشير إليها قفزة المعايير.
جميع الثلاثة مُبلَّغ عنها من الشركة ولم يُعَد إنتاجها بشكل مستقل. ادعاء المترجم ذي الـ 182 اختبارًا على وجه الخصوص سيحتاج إلى تحقق خارجي، لأن اجتياز الاختبارات لا يكون ذا معنى إلا إذا كانت الاختبارات ممثلة. المترجم الذي يتعامل مع الصياغة الشائعة ويفشل في الحالات غير المعتادة يمكنه مع ذلك أن يسجل جيدًا في مجموعة كُتبت في نفس أسبوع النموذج.
هناك نمط أوسع يستحق الملاحظة هنا أيضًا. أصبحت المختبرات الصينية تستخدم بشكل متزايد العروض الهندسية بدلاً من درجات المعايير كتسويق أساسي، لأن المعايير أصبحت غامضة والعروض ملموسة. المقايضة هي أن العرض يظهر مسارًا واحدًا عبر فضاء المشكلة، ولا شيء عن توزيع النتائج.
المدى الأطول: ما الذي تستمر الأوزان المفتوحة الصينية في فعله
يندرج Ling 3.1 Flash ضمن نمط ظل قائمًا طوال العام. تطلق المختبرات الصينية أوزانًا مفتوحة بحجم الحدود بتراخيص متساهلة بوتيرة لم يضاهها أي مختبر غربي، وتنافس على الكفاءة بدلًا من الحجم الخام.
السياق يستحق أن يُذكر بوضوح. المطور الذي يشغّل أحد هذه النماذج يملك حزمة الاستدلال، مما يعني لا تكلفة API لكل رمز، ولا خروج بيانات من المنشأة، ولا طرف ثالث يقرر متى يتغير النموذج. للفرق التي لديها قيود خصوصية أو أحمال عمل كثيفة لكن يمكن التنبؤ بها، هذا يستحق مالًا حقيقيًا.
أشار Victor Taelin هذا الشهر إلى أنه لم يبق أي نموذج مفتوح في أفضل 25 في تصنيفات Artificial Analysis، وأفضل نموذج، MiMo من شاومي، يحل في المرتبة 26. درجة Ling 3.1 Flash البالغة 41 على مؤشر الذكاء هي درجة ذكاء وليست ترتيبًا، لذا فإن الرقمين يقيسان شيئين مختلفين، والفجوة بين أفضل نموذج مفتوح وأفضل نموذج مغلق لا تزال حقيقية. ما تغير هو أن الفجوة تُقاس الآن بالنقاط بدلًا من كون النموذج المفتوح قادرًا على أداء المهمة أصلًا.
إلى أين يصل هذا بالنسبة لأي شخص يختار نموذجًا
ثلاثة اعتبارات تهم أكثر من نسبة المعاملات.
شروط الترخيص والنشر. تقول Ant Group إن النموذج سيكون مفتوحًا، لكن الترخيص المحدد يحكم ما إذا كان الاستخدام التجاري غير مقيد. نظرًا لتكرار استخدام «الأوزان المفتوحة» و«الترخيص المتساهل» بالتبادل رغم أنهما ليسا الشيء نفسه، تستحق الشروط قراءة متأنية قبل أي اعتماد إنتاجي. ينطبق التحذير نفسه على الوثائق المنشورة قبل الإصدار، والتي تصف قدرات لا التزامات.
ادعاء نافذة السياق. مليون رمز رقم كبير، لكن السياق القابل للاستخدام عادة أقصر مما يُعلن. ما إذا كان النموذج يحافظ على الجودة عبر النافذة الكاملة، أو يتدهور قبلها بكثير، هو السؤال الذي يحدد الفائدة في العمل على المستندات الطويلة والمستودعات الكبيرة. تشير عروض Ant Group الخاصة بالسياق الطويل إلى أن النموذج يتعامل مع المدخلات الكبيرة، لكنها مجددًا اختبارات بائع.
متطلب الذاكرة. نموذج متناثر بحجم 560 مليار ليس نشرًا على حاسوب محمول. قصة المعاملات النشطة تقلل الحوسبة لكل رمز، وليس بصمة الأوزان، ومن يخطط للاستضافة الذاتية يجب أن يحجم العتاد وفق الإجمالي، لا وفق العدد النشط. هذا التمييز يربك الناس بانتظام. النموذج الموصوف بأنه يفعّل 25 مليار معامل يبدو صغيرًا حتى تحاول تحميله، وعندها يجب أن يتسع مكان ما لكامل الـ 560 مليار.
هناك أيضًا سؤال دعم عملي. النموذج من مختبر يشحن بوتيرة متكررة سيُستبدل، ويجب على الفرق التخطيط لمسار ترحيل. تشير وتيرة إصدارات Ant Group إلى أن Ling 3.2 أو Ling 4 مسألة أشهر، وهذا جيد للقدرات ومربك لأي شخص بنى ضبطًا دقيقًا أو سكربت نشر حول إصدار واحد.
Ling 3.1 Flash إصدار قادر من مختبر ظل يشحن بثبات. الخبر الحقيقي بنيوي: نموذج نشط بـ 25 مليار يمكن الآن أن يجلس بجدارة في نفس المحادثة مع أنظمة كثيفة أكبر بكثير. هذه هي الحجة التي كان خط العمل بأكمله الخاص بـ MoE المتناثر يطرحها، وبدأت المعايير أخيرًا تدعمها.
مقالات ذات صلة
جوجل Flow وAdobe Firefly ينقلان فيديو الذكاء الاصطناعي خارج نافذة الدردشة
تقاربت جودة النماذج الأساسية بما يكفي لدرجة أن عامل التميّز انتقل إلى ما يحيط بالنموذج.
فيدا تريد الفوترة لوكلاء الذكاء الاصطناعي بالنتائج بدلاً من الاستخدام
تُوائم الفوترة القائمة على الاستخدام إيرادات المورّد مع استغراق الوكيل وقتاً أطول. أما التسعير القائم على النتائج فيعكس ذلك.
Voice 3 وPACT من Decagon يهيّئان دعم العملاء لاستقبال وكلاء على الطرف الآخر
أمضت أنظمة الدعم عقوداً في نمذجة السلوك البشري. والآن جزء من الطلبات الواردة آلات تعمل نيابة عن الناس.
Creatify تدرّب MiniMax H3 تدريباً لاحقاً للإعلانات وتخفض التكلفة إلى أربعة سنتات في الثانية
لا يحتاج المعلن إلى نموذج ينتج فيلماً وثائقياً. بل يحتاج إلى نموذج يظهر فيه المنتج بشكل صحيح ولا يتحوّل فيه الشخص في منتصف الجملة.