← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

أنهى الوكلاء المتقدمون 30 بالمئة من مسار عمل بحثي. هذا هو الرقم.

نُشر في 4 أكتوبر 2026
أنهى الوكلاء المتقدمون 30 بالمئة من مسار عمل بحثي. هذا هو الرقم.

أصدرت ستانفورد معيارًا جديدًا يُسمى Terminal-Bench-Science 0.1، والنتيجة الرئيسية أقل إثارة بكثير من التسويق الذي يحيط عادةً بالوكلاء. وضع المعيار 70 مسار عمل بحثيًا كتبها خبراء أمام وكلاء متقدمين. أنهى أفضلهم 30 بالمئة منها.

ثلاثون بالمئة هو الرقم الذي ينبغي التمسك به. لا يُقرأ كفشل ولا كانتصار. إنه قياس صادق لموقع التقنية، نشره أشخاص كتبوا المهام يدويًا.

ما الذي يختبره المعيار فعليًا

المهام عبارة عن مسارات عمل علمية، كتبها خبراء في المجال، ويعمل الوكلاء في طرفية. هذا الخيار مهم. الطرفية بيئة عمل تكون فيها المهمة حقيقية: عليك فعليًا تثبيت التبعية، وكتابة الملف، وتشغيل التحليل، وفحص الناتج. لا توجد درجات جزئية لوصف النهج الصحيح. الأمر إما يعمل أو لا يعمل.

مسارات العمل مستمدة من الممارسة البحثية، وهي هدف أكثر فوضوية بكثير من مهمة برمجية ذات مجموعة اختبارات مرتبة. عادةً ما يكون لمعيار البرمجة إجابة صحيحة محددة، لذا يمكن تقييمه آليًا. أما العمل البحثي فغالبًا لا يكون كذلك، ولهذا تطلب بناء معيار كهذا أن يكتب خبراء المهام بدلًا من سحبها من مستودع.

لماذا يُعدّ 30 بالمئة الإطار الصحيح

تُقرأ المعايير عادةً على أنها نجاح أو فشل. النموذج الذي يحصل على 90 في معيار برمجي يُعتبر شبه محلول. والنموذج الذي ينهي 30 بالمئة من مسارات العمل البحثية يمكن، بالروح نفسها، أن يُقرأ على أنه يفشل معظم الوقت.

هذه القراءة تغفل الغرض من الرقم. إتمام 30 بالمئة في مهام خبراء مكتوبة يدويًا يعني أن الوكلاء يستطيعون التعامل مع الثلث الروتيني من العمل البحثي: تهيئة البيئات، وتشغيل خطوط المعالجة الراسخة، وتنظيف البيانات، وإنتاج مخرجات قياسية. أما الـ70 بالمئة الأخرى فهي حيث تتطلب المهمة حكمًا لم يوضحه مسار العمل، أو حيث تتعطل خطوة بطريقة تحتاج إلى إنسان ليقرر ما الخطوة التالية.

هذا تقسيم مفيد. يخبر المختبر أين يوجّه وكيلًا اليوم، ويخبر مطوّر أدوات أين تكمن الفجوة.

الطرفية هي الجزء المثير للاهتمام

تشغيل الوكلاء في طرفية خيار متعمد لاختبارهم حيث يحدث العمل. البرمجيات البحثية هي إلى حد كبير برمجيات سطر الأوامر. النموذج الذي لا يستطيع سوى تشغيل نافذة دردشة لا يساعد مختبرًا. أما النموذج الذي يستطيع الجلوس عند صدفة أوامر، وقراءة الوثائق، وتثبيت سلسلة أدوات، والتعافي عند فشل البناء، فهو فئة مختلفة من النفع.

وهي أيضًا المكان الذي تكون فيه أنماط الفشل أكثر وضوحًا. لا تخفي الطرفية خطأً. عندما يعيد أمر رسالة غامضة أو يكتمل نص برمجي جزئيًا، على الوكيل أن يقرر: هل يعيد المحاولة، أم يغيّر النهج، أم يتوقف. نقطة القرار هذه هي حيث يُفقد معظم الـ70 بالمئة، وهي بالضبط النوع الذي لن يكشفه أبدًا معيار برمجي بمجموعة اختبارات نظيفة.

أدوات زجاجية مخبرية على طاولة من الفولاذ المقاوم للصدأ مع شاشة داكنة ضبابية في الخلف

كيف يختلف هذا عن معايير البرمجة

المقارنة الواضحة هي بمعايير البرمجة، التي أصبحت الطريقة المعيارية للترويج لتقدم الوكلاء. عادةً ما يأتي معيار البرمجة مع مستودع ومجموعة اختبارات، لذا تكون الإجابة الصحيحة محددة والنتيجة آلية. وهذا يجعله رخيص التشغيل وسهل المقارنة، ولهذا تهيمن تلك الأرقام على النقاش.

مسارات العمل البحثية تقاوم هذه المعالجة. غالبًا لا يوجد ناتج صحيح واحد، وتعتمد جودة النتيجة على الحكم بشأن ما ينبغي قياسه وكيف. لهذا كُتبت المهام هنا بواسطة خبراء بدلًا من جمعها من مستودع، ولهذا يقدم المعيار نسبة الإتمام بدلًا من معدل النجاح في الاختبارات.

المقايضة هي التغطية مقابل الواقعية. يمكن تشغيل معيار برمجي آلاف المرات يوميًا وإنتاج رقم دقيق. أما معيار مسارات العمل فهو أبطأ وأكثر ضجيجًا، لكنه يختبر البيئة التي يحدث فيها قدر كبير من العمل التقني فعليًا. كلاهما مفيد، وواحد فقط منهما كان متاحًا على نطاق واسع من قبل.

لماذا يُقاس الرقم بهذه الطريقة

الإتمام مقياس خشن، وقد اختاره المؤلفون عن قصد. مسار العمل إما ينتهي أو لا ينتهي، وهذه حقيقة يمكن لمراقب خارجي التحقق منها دون الحكم على جودة النتيجة. لا تُقيَّم الأناقة. ولا يُجادل في الصحة. إما أن الوكيل أنتج الناتج الذي طلبه مسار العمل، أو توقف في مكان ما قبل النهاية.

هذه الخشونة هي المقصد. المعايير التي تحاول تقييم الجودة في مهام بحثية مفتوحة النهاية تنهار عادةً إلى ذوق مؤلف المعيار. ومن خلال تقييم الإتمام، يقايض هذا المعيار الفروق الدقيقة بقابلية التكرار. مختبران يشغّلان مسار العمل نفسه يحصلان على الإجابة نفسها، وهذا ما يجعل الرقم جديرًا بالاستشهاد.

الثمن أنه لا يستطيع التمييز بين وكيل أوشك على الانتهاء وآخر فشل فورًا. كلاهما يُحتسب فشلًا. هذا قيد، وقد تعالجه نسخة مستقبلية، لكن رقمًا خشنًا يتفق عليه الجميع أفضل من رقم دقيق لا يثق به أحد.

ماذا تقول النتيجة عن العمل العلمي

المعيار إجابة هادئة على ادعاء صاخب، وهو أن الوكلاء سيقومون بالبحث قريبًا. ما يظهره هو أن الوكلاء يستطيعون تشغيل البحث، بمعنى أنهم قادرون على تنفيذ إجراء وضعه إنسان بالفعل، عبر حصة متنامية من الخطوات الروتينية. لكنهم لا يستطيعون بعد القيام بالجزء الذي يكون فيه الإجراء مجهولًا ويتعين على شخص اختراعه.

هذه الفجوة ليست تفصيلًا هندسيًا صغيرًا. فالعمل الروتيني يستهلك حصة كبيرة من وقت العالم، وأتمتته توفر مالًا وساعات حقيقية. وهو أيضًا ليس الجزء الذي ينتج الاكتشافات. هذا التمييز مهم لأي شخص يتنبأ بما سيفعله الذكاء الاصطناعي بالعلم خلال السنوات القليلة المقبلة.

كيف تقرأ معايير مثل هذا

هناك تحذيران ينطبقان على أي معيار جديد. الأول هو رقم الإصدار. هذه نسخة 0.1، ما يعني أن مجموعة المهام ستتغير مع تعلّم المؤلفين أي المهام محكمة الصياغة وأيها غامضة. لا يمكن مقارنة النتائج من إصدارات مختلفة مباشرة.

والثاني أن المعيار يقيس مسارات العمل التي اختارها مؤلفوه. سبعون مهمة مستمدة من مجالات علمية هي عينة، لا إحصاء شامل. رقم 30 بالمئة إشارة جيدة إلى الشكل العام لقدرة الوكلاء على العمل البحثي. وهو ليس رقمًا دقيقًا سيصمد أمام المراجعة التالية.

ما الذي يجب مراقبته

التقدم الذي يجب مراقبته ليس ارتفاع النسبة الرئيسية. بل أي المهام تبدأ بالنجاح. إذا بدأ الوكلاء بإنجاز مسارات عمل تتطلب تعافيًا متعدد الخطوات، فهذا تقدم حقيقي. أما إذا جاء التحسن فقط من مهام التهيئة الأسهل وتنظيف البيانات، فالسقف أدنى مما توحي به النتيجة الرئيسية.

معيار يقدم رقمًا منخفضًا بصدق أكثر فائدة من معيار يقدم رقمًا مرتفعًا لا يستطيع الناس إعادة إنتاجه. هذا المعيار يفعل الأمر الأول، والمجال يحتاج المزيد منه.

مقالات ذات صلة