نماذج القرار تحل بهدوء محل نموذج اللغة الكبير في حلقة الوكيل

أطلقت Cloudflare نموذجين في الأيام الأولى من أكتوبر لا يكتبان أي شيء. يقرأ Clef وClef-flash مدخلات إلى جانب مجموعة من الأسئلة ذات الأنواع المحددة، ويعيدان احتمالًا لكل إجابة مسموح بها. لا نثر، ولا سلسلة تفكير، ولا رموز تُولَّد واحدًا تلو الآخر. مجرد اختيار مُهيكل.
قد يبدو ذلك كخطوة إلى الوراء حتى تنظر إلى الأرقام. في BANKING77، وهو معيار قياسي لتصنيف النوايا، يسجل Clef درجة macro-F1 تبلغ 94.20 مقابل 79.74 لـ Jev، النموذج الذي قدّم فئة نماذج القرار. أما Clef-flash، النسخة الأصغر بحجم 9B، فيحقق 90.93. والفجوة في زمن الاستجابة أوسع. يعيد Clef-flash إجابة وسيطة في 38.8 مللي ثانية؛ بينما يستغرق Jev 524.1 مللي ثانية. وتقول Cloudflare إن Clef يتفوق على Jev في سبعة من عشرة معايير لتقييم القرارات.
يُطرح كلا النموذجين تحت رخصة Apache 2.0 على Hugging Face، وكلاهما متوافق مع Jev-API، لذا يمكن للفرق المبنية بالفعل حول Jev التبديل دون إعادة كتابة تكاملاتها. وصل موضوع Hacker News إلى 602 نقطة وأكثر من 200 تعليق خلال يوم واحد.
لماذا يمكن لنموذج أصغر أن يتفوق في مهمة أضيق
نماذج القرار ذات شكل مختلف عن روبوتات الدردشة التي يلجأ إليها معظم المطورين. يولّد نموذج اللغة الكبير نصًا مفتوح النهاية. أما نموذج القرار فيقرأ حالة وقائمة بالإجابات المسموح بها، ثم يمنح كل واحدة درجة. وقد أرسى هذه الفئة Typesafe AI عبر Jev، الذي أظهر أن مهام توجيه الوكلاء أو التصنيف لا تحتاج إلى نموذج عام بحجم 400B. إنها تحتاج إلى مخرجات محدودة، رخيصة وسريعة.
بُني Clef من Cloudflare على Qwen3.8-27B ويستخدم بنية prefill-only تمنح درجات لخيارات المخطط بالتوازي بدلًا من توليد الرموز تسلسليًا. هنا يأتي زمن الاستجابة. على النموذج العام أن يصدر الإجابة رمزًا تلو الآخر؛ أما نموذج القرار فعليه فقط أن يقرأ السؤال ويتخذ قراره.
هناك أيضًا فرق في السياق يستحق الملاحظة. يقبل Clef مدخلات متعددة الوسائط ضمن نافذة بحجم 64k رمزًا، تغطي النص وJSON والصور والفيديو. أما Jev فيتعامل مع النص فقط، عند 32k. وبالنسبة لوكيل يوجّه بناءً على لقطة شاشة أو ملف PDF، فليست هذه ميزة صغيرة.
كان أول اعتراض من المجتمع هو الصحيح
لم يكن الاعتراض الأكثر فائدة في نقاش Hacker News حول المعايير. بل كان حول التسمية. كتب أحد المعلّقين: “أوزان مفتوحة، وليست مفتوحة المصدر”. فالأوزان تحمل رخصة متساهلة، لكن بيانات التدريب وخط الأنابيب لم يُنشرا، لذا لا يمكن إعادة إنتاج النموذج من الصفر.
هذا التمييز مهم لأي شخص يقرر أين يشغّل هذا. دُرّب Clef على نقطة انطلاق Qwen مملوكة. الأوزان مجانية للتنزيل والاستضافة، وهذا يمثل توفيرًا حقيقيًا في التكلفة، لكنها ليست قابلة للتدقيق بالطريقة التي تكون بها البرمجيات مفتوحة المصدر. على الفرق ذات سياسات المراجعة الصارمة لسلسلة التوريد قراءة الرخصة وبطاقة النموذج قبل افتراض أن شارة Apache 2.0 تحسم السؤال.
في الأسبوع نفسه، وضعت أمازون واحدًا في حاسوبك المحمول
لم تكن Cloudflare وحدها. نشرت Strands Labs التابعة لـ AWS نموذج Strands Decider 2B، وهو نموذج قرار مفتوح مع الأوزان ونصوص التدريب، مصمم ليعمل محليًا ويعيد خيارات مُقيّمة بدرجات ثقة خلال عشرات إلى بضع مئات من المللي ثانية. كما أضافت Cloudflare خدمة ضبط دقيق بالتعلم المعزز (RL) لنماذج القرار الخاصة بها على Workers AI.
النمط هو نموذج صغير يؤدي مهمة واحدة جيدًا ويعمل قريبًا من البيانات. إذا كان بإمكانك وضع بوابة لاستدعاء أداة، أو التحقق من أن طلبًا ما مستند إلى أساس، أو تقرير ما إذا كان يجب التصعيد، باستخدام نموذج 2B في 40 مللي ثانية، فإن اقتصاديات تمرير الوكيل عبر نموذج حدودي في كل خطوة تبدأ تبدو مهدرة.

النموذج الذي قدّمه Jev، ولماذا استغرق عامًا لينتشر
قدّم Jev من Typesafe AI ادعاءً كان من السهل تجاهله عند إطلاقه: معظم ما تطلب الوكلاء من النموذج فعله ليس توليدًا، بل تصنيف. وجّه هذه التذكرة، اختر هذه الأداة، قرر ما إذا كان هذا الإجراء يحتاج موافقة. في تلك المهام، النموذج الذي يكتب فقرات يقوم بعمل أكثر بكثير مما تتطلبه المهمة.
أثبت Jev أن النهج الضيق يمكن أن يتفوق على نموذج عام في معاييره الخاصة. ما لم يستطع فعله هو جعل الفئة تبدو ملحة. بائع واحد يبيع نموذج قرار واحد هو مجرد فضول. أما طرح Cloudflare لنسخة Apache 2.0 متوافقة مع واجهة Jev فهو وضع مختلف، لأنه الآن يمكن لأي شخص استضافتها وفحص الرخصة وتبديلها دون إعادة كتابة. ووصول أمازون في الأسبوع نفسه بنموذج قرار مفتوح خاص بها يحوّل الفضول إلى فئة.
يتوافق التوقيت مع الطريقة التي يُبنى بها الوكلاء فعليًا. أنشأ الجيل الأول من أطر عمل الوكلاء كل خطوة عبر نموذج كبير واحد لأنه كان الأبسط. ومع انتقال تلك الأنظمة إلى الإنتاج، تصبح تكاليف التوجيه هي الشيء الذي تلاحظه الفرق. تقسيم الحلقة إلى نموذج لغوي للأجزاء التي تحتاج إلى لغة، ونموذج قرار للأجزاء التي لا تحتاج، هو الإصلاح الواضح، وقد تطلب إطلاقًا مفتوحًا لنموذج قرار جيد لجعله عمليًا.
زاوية الضبط الدقيق
أضافت Cloudflare أيضًا خدمة ضبط دقيق بالتعلم المعزز (RL) لنماذج القرار الخاصة بها على Workers AI، ما يشير إلى الاتجاه التالي للفئة. نموذج قرار عام مفيد. لكن نموذج قرار مضبوط بدقة على سجل التوجيه الخاص بك، وقواعد التصعيد الخاصة بك، ومفهومك الخاص للنطاق، أكثر فائدة، لأنه يتعلم الحدود المهمة لأعمالك.
وهذا أيضًا الجزء الذي ينبغي أن يجعل الفرق حذرة. نموذج القرار المضبوط بدقة يشفّر قراراتك السابقة، بما فيها السيئة. إذا اعتاد فريقك الموافقة على استردادات كان ينبغي تصعيدها، فسيتعلم النموذج ذلك النمط ويطبقه أسرع مما يستطيع أي إنسان. المعايرة سلاح ذو حدين.
أين يتناسب هذا في مسار الوكيل
تخيل وكيل دعم يتعامل مع طلب استرداد. قبل أن يتمكن من استدعاء أداة الاسترداد، يجب أن يجيب شيء عن أسئلة مثل: هل هذا الطلب ضمن النطاق، هل يسمح حساب العميل بذلك، هل يحتاج هذا إلى تدخل بشري. هذه أسئلة قرار بمجموعة ثابتة من الإجابات. يمكن لنموذج القرار أن يعيد الاحتمالات، ويتصرف الوكيل بناءً على عتبة.
ملف التكلفة هو المقصد. تمرير كل واحد من تلك الفحوص عبر نموذج بحجم 400B يكلف مالًا في كل استدعاء ويضيف مئات المللي ثانية من زمن الاستجابة. نقلها إلى نموذج قرار محلي بحجم 2B أو 9B يبقي النموذج الحدودي للأجزاء التي تحتاج إلى اللغة فعلاً: كتابة الرد، وتلخيص سلسلة طويلة، والتعامل مع حالة غامضة. وتتقلص الميزانيات وميزانيات زمن الاستجابة معًا.
هناك عقبة. يعيد نموذج القرار احتمالًا، والاحتمالات يمكن أن تكون خاطئة بثقة. إذا أتمتت الموافقة على استرداد بناءً على درجة 0.92، فقد نقلت الخطر من صياغة النموذج إلى العتبة الخاصة بك. تصبح المعايرة، وليس الدقة الخام، هي الرقم الذي يجب مراقبته. زمن الاستجابة والتكلفة يسهل قياسهما؛ أما 0.9 جيد المعايرة فأصعب.
ما الذي يجب متابعته لاحقًا
الأدوات تتبع النماذج بالفعل. أضاف llama.cpp دعمًا لنماذج القرار، ويضع كل من Perplexity وHugging Face رهانات في الاتجاه نفسه. إذا صمدت الفئة، يتوقف السؤال المثير عن كونه أي نموذج قرار يفوز بمعيار، ويصبح أي القرارات أنت مستعد لتسليمها إلى احتمال.
بالنسبة لبناة الوكلاء، الخطوة العملية هي تدقيق الحلقة والعثور على الخطوات التي لم تكن بحاجة إلى نص طليق. التصنيف، والتوجيه، واختيار الأدوات، وفحوص ما قبل الإجراء هي المرشحات المعتادة. تلك هي الخطوات التي يمكن فيها لإجابة في 40 مللي ثانية فوق مجموعة ثابتة من الخيارات أن تحل محل توليد بطيء ومكلف. ويمكن لبقية الوكيل أن تبقى على النموذج الذي يستخدمه بالفعل.
مقالات ذات صلة
صور المنتجات بالذكاء الاصطناعي تصطدم بجدار امتثال لم يحسبه أحد في التكلفة
كانت التكلفة تُقتبس دائمًا لكل عملية توليد. أما التكلفة الحقيقية فمسعّرة لكل أصل ينجو من المراجعة.
الروبوتات قادرة على أداء 74 بالمئة من العمل الجسدي، ولا يكاد أيّ منه يكون مجديًا اقتصاديًا
القدرة موجودة إلى حد كبير. أما الجدوى الاقتصادية فليست كذلك. أربعون عامًا للوصول إلى عشرة بالمئة ليست توقعًا يبرر الذعر.
نموذج وكيلي مفتوح الأوزان بحجم 744 مليار يظهر تحت ترخيص MIT
الترخيص هو التسويق. نموذج بـ744 مليار يمكن لأي شخص تنزيله يعيد ضبط حسابات الشراء مقابل البناء.
نماذج الفيديو الصينية بالذكاء الاصطناعي تدخل هوليوود: 73 لقطة من المؤثرات البصرية في مسلسل أمازون
ما يعبر الحدود ليست المسلسلات، بل الأدوات التي تُصنع بها.