النماذج الصينية المفتوحة الجديدة تُدرَّب لتكون ركائز للوكلاء

ثلاثة إصدارات نماذج من مختبرات صينية خلال الأسبوع الماضي تشترك في حسّ تصميمي يسهل إغفاله إذا قرأتها كقائمة بأعداد المعاملات. لم يُبنَ أي منها ليكون جيدًا في المحادثة.
بل بُنيت لتكون الشيء الذي يعمل عليه الوكيل. هذا هدف مختلف، والخيارات التدريبية التي تتبع منه تبدو غريبة إذا افترضت أن الهدف هو روبوت دردشة أفضل.
تدريب المهمة والعالم المحيط بها
أوضح مثال هو IQuest-Q1، الذي أصدره معهد تشيتشي للابتكار البحثي في 29 سبتمبر. إنه نموذج خليط خبراء متناثر بإجمالي 320 مليار معامل، و15 مليارًا نشطة، ونافذة سياق من 524,288 رمزًا. المعمارية عادية بالمقارنة مع طريقة تدريبه.
بدلاً من الضبط الدقيق على نصوص محادثات بشرية أو على مجموعات تعليمات ثابتة، أنتج الفريق مهامًا والبيئات التي تحدث فيها معًا. ثم دُرِّب النموذج عبر عدة سقالات وكلاء مختلفة. أبقى الأدوات الأصلية وإدارة السياق الخاصة بكل سقالة سليمة، وتعامل فقط مع أخطاء النموذج نفسه كإشارة تعلّم. لم يُسمح للإطار أن يصبح هو الدرس. بعد ذلك، دُمجت أربعة نماذج متخصصة في واحد عبر تقطير متعدد المعلمين وفق السياسة.
هذا مهم بسبب مشكلة صادفها أي شخص يبني وكلاء. يمكن لنموذج يحقق نتيجة جيدة في معيار أن ينهار عندما تغلفه بأدواتك الخاصة، لأنه تعلّم خصوصيات إطار شخص آخر. التدريب عبر سقالات مع إبقاء الإطار ثابتًا يهاجم ذلك الفشل تحديدًا. النتيجة المعلنة نموذج يحلّ مباشرة خلف Claude Opus 5 في مهام الانتقال من اللغة الطبيعية إلى المستودعات البرمجية، وهذا شيء غريب أن تكون جيدًا فيه، وهو بالضبط ما يحتاجه وكيل برمجي.
الرؤية واتخاذ القرار في الخطوة نفسها
الإصدار الثاني يسلك طريقًا مختلفًا نحو الهدف نفسه. في اليوم نفسه، قدّم مختبر شنغهاي للذكاء الاصطناعي نموذج قرار يُدعى Shusheng Mingjue، بثلاثة أحجام: 0.8B و2B و4B. وهو صغير عن قصد.
مبدأ التصميم هو أن الإدراك واتخاذ القرار لا ينبغي أن يكونا مرحلتين منفصلتين. معظم حزم الوكلاء تأخذ لقطة شاشة، وتمررها إلى نموذج رؤية، وتحصل على وصف، ثم تمرر الوصف إلى مخطط، وتتحرك. كل انتقال يضيف زمن استجابة ويفقد تفاصيل. تدمج Mingjue الإدراك البصري الأصلي مع اتباع التعليمات، فينظر النموذج إلى شاشة ويتخذ قرارًا في تمريرة واحدة. ويُبلّغ المختبر عن تفوقه على Jev والنماذج المفتوحة المماثلة في جودة القرار. وبالنسبة لوكيل يجب أن يعمل داخل بيئة ديناميكية، فالحجم هو المقصد: نموذج بـ4B يمكن تشغيله قريبًا من الحلقة، بينما نموذج بـ320B لا يستطيع.
حذف طبقة الانتباه للوصول إلى مليون رمز
الإصدار الثالث هو الأكثر جرأة معمارياً. Naive N0.5 Flash، من مختبر NaiveAI في بكين، هو نموذج خليط خبراء بـ309 مليارات معامل، منها 15.5 مليار معامل نشطة، مبني على MiMo-V2.5 من شاومي. يدعم أصلاً سياقًا بمليون رمز، ويصدر بموجب رخصة MIT.
الجزء المثير هو ما حذفه. يستخدم النموذج مزيجًا من انتباه النافذة المنزلقة والانتباه المتناثر من DeepSeek، وليس لديه طبقات انتباه كامل على الإطلاق. يتدرج انتباه المحوّل القياسي تربيعيًا مع طول التسلسل، ولهذا كان السياق الطويل مكلفًا تاريخيًا. حذف الانتباه الكامل رهان على أن المعلومات المفيدة في تسلسل طويل يمكن الوصول إليها عبر تناثر مُهيكل، وإذا صمد ذلك فإنه يغيّر ما يمكن للوكيل أن يبقيه في مجال رؤيته دفعة واحدة. مليون رمز تقريبًا مستودع كبير، أو قدر جلسة عمل طويلة من السجل، محفوظة دون قطع.
الإصدارات الأصغر تشير في الاتجاه نفسه
يظهر النمط خارج هذه الثلاثة. دُرِّب Puro-2B من تسينغهوا بنحو 4,400 دولار ويتفوق على نموذج Qwen أكبر في خمس عشرة مهمة في المتوسط. أطلق مختبر اتصالات TeleOCR، وهو نموذج تحليل مستندات بـ1.2 مليار معامل تصدّر معيارًا لفهم المستندات. أصدرت ستانفورد وNVIDIA مُتحققًا تقابليًا يختار أفضل إجراء مرشح عبر محاذاة التضمينات بدلاً من الاستدلال، ويُبلّغ عن تسريعات كبيرة مقارنة بنموذج حكم مماثل.
كل واحد من هؤلاء مكوّن داخل وكيل، وليس وجهة للمستخدم. مُتحقق يرتب الإجراءات المرشحة بتكلفة زهيدة، ونموذج صغير يحلل المستندات، ونموذج ضئيل يقرر ما يجب النقر عليه. تتخصص الأجزاء وتصغر، بينما النموذج الوحيد الذي يحمل سياق الجلسة كاملة يصبح ضخمًا جدًا.
مشكلة التقييم التي لم يحلها أحد
ثمة ثغرة تسري في كل هذا. ما تزال معايير تقييم نماذج الوكلاء الأساسية مستعارة في معظمها من تقييم روبوتات الدردشة، الذي يقيس الأشياء الخطأ. يمكن لنموذج أن يحقق نتيجة جيدة في اختبار استدلال ويظل ركيزة سيئة لوكيل، لأن الخصائص المهمة لا تظهر إلا عبر جلسة: كم جولة تمر قبل أن يتدهور السياق، وهل تُعاد محاولة استدعاء أداة فاشل بشكل معقول، وهل يلاحظ النموذج أنه فقد مسار الهدف الأصلي.
معظم الأرقام المذكورة هنا تأتي من المختبرات نفسها، على معايير ساعدت في تعريفها. «خلف Claude Opus 5 مباشرة» في مهام اللغة الطبيعية إلى المستودعات هو مقارنة تجارية. «يتفوق على Jev» ادعاء بائع. غياب الانتباه الكامل في Naive N0.5 Flash حقيقة معمارية يسهل التحقق منها ولم تُقَس بعد نتائجها العملية على نطاق واسع. لا شيء من ذلك يجعل الاتجاه خاطئًا. بل يعني أن الحالة الصادقة للأمور هي أن لدينا ثلاثة تصاميم مثيرة جدًا وقليل جدًا من الأدلة المستقلة حول أيها يصمد عندما يعمل وكيل لمدة ست ساعات.
بدأ الاعتراف بالفجوة. كانت مجموعات مستقلة تبني معايير تستهدف الخدمة الإنتاجية بدل توليد الكود، واختطاف الوكلاء بدل سلامة النماذج، ما يشير إلى أن المجال يعرف أنه كان يقيس الطبقة الخطأ. إلى أن تنضج هذه، فإن الإشارة المفيدة من إصدار كهذا ليست النتيجة. بل طريقة التدريب، لأن طريقة تعالج نمط فشل معروفًا للوكلاء أرجح أن تكون حقيقية من رقم يستهدف لوحة صدارة.
ثمة نتيجة أخرى لهذا التحول يسهل إغفالها. إذا أصبحت النماذج المهمة مكونات صغيرة بدل وجهات كبيرة، فإن ميزة المختبر تتوقف عن كونها امتلاك أكبر نموذج وتبدأ بمعرفة كيف تتلاءم الأجزاء معًا. الفريق القادر على تدريب نموذج قرار سريع، ومحلل مستندات رخيص، ومُتحقق، وربطهم في حلقة تعمل على عتاد متواضع، يملك شيئًا لا تستطيع نقطة تحقق عملاقة واحدة مضاهاته. هذا نوع مختلف من المنافسة، أقرب إلى هندسة الأنظمة من التوسيع، والإصدارات الصادرة هذا الشهر تشير إلى أن بضعة فرق صينية على الأقل أعادت توجيهها نحوه.
لعامين، كان سباق الأوزان المفتوحة يُقاس بمدى اقتراب نموذج مجاني من روبوت دردشة متقدم. هذا التأطير يفقد قبضته. أصبحت جودة الدردشة خط أساس، وانتقلت الأسئلة التي تحدد ما إذا كان البرنامج يعمل إلى أرض مختلفة: كم جولة قبل تدهور السياق، وكم سرعة عمل النموذج داخل حلقة، ومدى تحمله لإدخاله في أدوات شخص آخر.
النماذج التي تجيب عن تلك الأسئلة لن تفوز بالكثير من لوحات الصدارة. ستفوز بالمسابقة الأقل ظهورًا: أيها يلجأ إليه المطور عندما يكون روبوت الدردشة قد أنجز مهمته ويحتاج العمل إلى أن يحدث فعلاً. جرت تلك المسابقة بهدوء هذا الأسبوع، في ثلاثة إصدارات لم تكن تحاول إبهار أحد بالمحادثة.
مقالات ذات صلة
صور المنتجات بالذكاء الاصطناعي تصطدم بجدار امتثال لم يحسبه أحد في التكلفة
كانت التكلفة تُقتبس دائمًا لكل عملية توليد. أما التكلفة الحقيقية فمسعّرة لكل أصل ينجو من المراجعة.
الروبوتات قادرة على أداء 74 بالمئة من العمل الجسدي، ولا يكاد أيّ منه يكون مجديًا اقتصاديًا
القدرة موجودة إلى حد كبير. أما الجدوى الاقتصادية فليست كذلك. أربعون عامًا للوصول إلى عشرة بالمئة ليست توقعًا يبرر الذعر.
نموذج وكيلي مفتوح الأوزان بحجم 744 مليار يظهر تحت ترخيص MIT
الترخيص هو التسويق. نموذج بـ744 مليار يمكن لأي شخص تنزيله يعيد ضبط حسابات الشراء مقابل البناء.
نماذج الفيديو الصينية بالذكاء الاصطناعي تدخل هوليوود: 73 لقطة من المؤثرات البصرية في مسلسل أمازون
ما يعبر الحدود ليست المسلسلات، بل الأدوات التي تُصنع بها.