ServiceNow تحوّل إخفاقات الوكلاء إلى بيانات تدريب

كل فريق نشر وكيل ذكاء اصطناعي في نظام مؤسسي حقيقي يعرف الألم نفسه. يكون النموذج قادراً على نحو واسع، ثم يلتقي أدواتك المحددة، وسياساتك المحددة، وفوضاك المحددة في آلة حالات، فيتعثر.
أطلقت ذراع الأبحاث في ServiceNow، CoreAI، نظاماً يحاول تحويل تلك التعثرات إلى أصل. يُسمى AutoSynthData، وفرضيته أن إخفاقات النموذج هي أثمن مادة خام لديك لتدريبه.
الخطوة المحورية
تبدأ المنظومة بتشغيل نموذج مستهدف ونموذج معلّم أقوى على المهام التشخيصية نفسها في بيئة حقيقية. وحيث يفشل النموذج المستهدف وينجح المعلّم، توجد فجوة في القدرات. ويقطّر AutoSynthData تلك الفجوة إلى ما يسميه الفريق بطاقات مواصفات القدرات: أوصاف منظّفة للأدوات وسير العمل والحالات النهائية والاختلافات المسموح بها، مجرّدة من مطالبات التقييم الأصلية وتفاصيل الكيانات.
تلك البطاقات تبذر توليد مهام جديدة. والأهم أن المولّد لا يرى أبداً مسارات التقييم الأصلية، لذا تختبر البيانات الناتجة الكفاءة الكامنة بدلاً من التسلسلات المحفوظة. ويوسّع الإطار هذا على مرحلتين. مرحلة الاستهداف تُنشئ مهام أساسية على التوازي. ومرحلة المضاعفة تأخذ المهام المتحقق منها وتولّد متغيرات بصياغة جديدة وتهيئات كيانات جديدة وحالات أولية جديدة. وهناك قاعدة تمنع انحراف البيانات: لا يمكن لعينة مضاعفة أن تكون بذرة لمضاعفة أخرى.
ثلاثة شروط لمهمة تستحق التوليد
تؤكد ServiceNow بوضوح أن طلباً يبدو معقولاً ليس كافياً. يجب أن تحقق المهمة المولّدة ثلاثة أشياء في وقت واحد.
يجب أن تكون قابلة للتنفيذ، أي يوجد مسار قابل للتنفيذ واحد على الأقل عبر البيئة يُكمل الطلب مع احترام القواعد. ويجب أن تكون واقعية، أي تحاكي عملاً قد يطلبه مستخدم حقيقي فعلاً، لا إجراءً صحيحاً تقنياً لا يقوم به أحد. ويجب أن تكون صعبة، أي تستهدف ضعفاً حقيقياً. فالمهمة التافهة لا تعلّم شيئاً، والمهمة المستحيلة تعلّم الدرس الخاطئ.
تُشحن كل مهمة مع مُتحقِّق، وعلى المُتحقِّق أن يستوفي معياره الخاص. يجب أن يكون متسقاً مع المطالبة وحالة النظام، وسليماً بما يكفي لرفض انتهاكات القيود، وكاملاً بما يكفي لقبول أي حل يعمل بدلاً من الإصرار على مسار مرجعي واحد.
بوابات الجودة هي المنتج الحقيقي
الجزء الذي يستحق الانتباه هنا ليس توليد المهام. بل التحقق.
يمر كل مرشح عبر بوابتين. البوابة الإيجابية تشغّل الحل المرجعي داخل البيئة لتأكيد أن الإجابة المقصودة تُرضي المُتحقِّق فعلاً، ما يلتقط حالات عدم التطابق بين المطالبة والحالة الأولية ومعايير النجاح. ثم تُحدث البوابة السلبية تغييراً متعمداً في الحالة النهائية لتأكيد أن النتائج الخاطئة تُرفض فعلاً. وتلك البوابة الثانية هي التي تلتقط المُتحقِّقات غير المحددة بالقدر الكافي، من النوع الذي سيكافئ بسعادة مسار وكيل مشوّه.
عندما يفشل مرشح، يشخّص ناقد الخلل، فيرصد المراجع المعطوبة أو الحالات المتناقضة، ويوجّه إصلاحاً محدوداً بدلاً من التخلص من العمل كلياً. وفوق مستوى العينة، تراقب مراجعة الدفعة الإجمال: أي عناقيد المهام ممثلة تمثيلاً زائداً، وأي الأبعاد مفقودة، وأنماط التوليد التي تستمر في التعطل. ثم يوجّه المتحكم الدفعة التالية نحو الفجوات المتبقية.
لماذا يحتاج أي شخص إلى بيانات اصطناعية أصلاً
يستحق الأمر التوقف قليلاً للسؤال عن سبب أهمية هذا. البيانات المثالية لتدريب وكيل مؤسسي هي سجل لأشخاص حقيقيين يؤدون عملاً حقيقياً في النظام الحقيقي، موسوم بشكل صحيح. تلك البيانات نادرة وحساسة ومكلفة الجمع، وكثير منها لا يمكن أن يخرج من المبنى لأسباب تتعلق بالخصوصية أو الامتثال.
التوليد الاصطناعي هو منفذ الهروب، لكنه يأتي بنمط فشل معروف. إذا ولّدت مهام من نموذج، فإنك ترث النقاط العمياء لذلك النموذج، وقد تبدو البيانات الناتجة وفيرة بينما تعلّم القليل جداً. المساهمة الكاملة لـ AutoSynthData هي الآلية المحيطة بالتوليد التي تُبقي البيانات صادقة: بوابات ترفض المهام السيئة، وفحوص تنوع تمنع التكرار، ومنهج يستمر في التصويب على ما لم يتقنه الوكيل بعد. فالتوليد دون تحقق ضجيج. وهذا محاولة لتحويله إلى إشارة.
ما تقوله الأرقام، وما لا تقوله
في اختبارات على EnterpriseOps Gym، وهي بيئة مفتوحة المصدر لمهام الوكلاء المؤسسيين، ضُبط نموذج قائم على Gemma ضبطاً دقيقاً على 2000 عينة من AutoSynthData، فحسّن مقياس Pass@1 بنسبة 35 في المئة مقارنة بخط الأساس في نطاق هجين. وفي نطاق ITSM، رفع الضبط الدقيق الإشرافي الاصطناعي متوسط Pass@1 من 18.77 في المئة إلى 27.18 في المئة.
تلك مكاسب حقيقية على معيار قياس محدد، وهذا ليس نفس النتيجة العامة. الاعتماد المركزي للمنظومة صادق ويستحق ذكره بوضوح: إنها تحتاج نموذج معلّم أقوى بكثير لإظهار السلوك الصحيح، وبيئة محاكاة دقيقة للاختبار فيها. وفي شركة تفتقر إلى بيئة اختبار معزولة عالية الدقة ومُتحقِّقات حتمية موثوقة، فإن بناء طبقة التنفيذ هو بحد ذاته مشروع هندسي جاد. لا يزيل AutoSynthData ذلك العمل. بل يغيّر الغرض منه.
مأزق النموذج المعلّم
هناك اعتماد في هذا التصميم يستحق جملة خاصة به. المنظومة بأكملها تعمل على الفجوة بين نموذج ضعيف وآخر قوي. في التجارب، كان المعلّم نموذجاً أكبر بكثير من النموذج المستهدف. ينجح ذلك عندما يكون لديك نظام رائد تستعير منه. وينجح بدرجة أقل عندما تكون أنت في الطليعة، أو عندما تكون المهمة متخصصة لدرجة لا يوجد فيها نموذج أقوى يُظهرها. في تلك الحالة لا يكون لدى المنظومة ما تتعلم منه، وتكون فجوة القدرات التي تعتمد عليها مجرد جدار. تصطدم الأبحاث حول توليد بيانات التدريب بهذا دائماً في النهاية: تنجح الطريقة ما دام شخص ما، في مكان ما، قد حل المشكلة بالفعل.
لماذا هذا هو شكل الذكاء الاصطناعي المؤسسي
الشيء المثير في هذا الإصدار هو ما يعترف به بشأن أين يقف الذكاء الاصطناعي المؤسسي فعلاً. لم تعد العقبة هي الحصول على نموذج قادر. العقبة هي جعل نموذج قادر يعمل بشكل صحيح داخل مؤسسة معينة، بأدواتها وقواعدها الخاصة، حيث تكون الإخفاقات خفية وفضاء الحالات كبيراً.
لسنوات كانت الإجابة هي الوسم اليدوي، وهو بطيء ومكلف وصعب التوسيع. AutoSynthData حجة على أن الإخفاقات نفسها تحتوي على الإشارة، إذا أمكنك استخلاصها والتحقق منها وتنويعها دون تسريب مجموعة التقييم. المنظومة متاحة للبحث على Hugging Face، ويقول الفريق إن التعلم المعزز باستخدام المنهجية نفسها هو الخطوة التالية.
إذا نجح هذا على نطاق واسع، فالمغزى أن المهارة النادرة في الذكاء الاصطناعي المؤسسي تتغير. فلم تعد تتعلق بالحصول على البيانات، بل ببناء بيئات جيدة بما يكفي لتوليد بيانات موثوقة داخلها. وهذه مشكلة أصعب، وأكثر استدامة، لأن بيئة الشركة هي الشيء الذي لا يستطيع أي منافس نسخه.
مقالات ذات صلة
Agility Digit 5 يأتي مع ملف سلامة، لا مجرد ورقة مواصفات
أرضية المستودع ليست مختبرًا. الاعتماد هو البوابة، وليس العرض التوضيحي.
أنهى الوكلاء المتقدمون 30 بالمئة من مسار عمل بحثي. هذا هو الرقم.
يستطيع الوكلاء تشغيل البحث. لكن اختراع الإجراء لا يزال بعيد المنال.
Figure AI تحجز 3.5 مليار دولار من القدرة الحاسوبية قبل أن يكون لديها منتج للبيع
الرهان هو أن التعميم مشكلة حوسبة. والمجال لم يحسم ذلك بعد.
أخيرًا، أضافت OpenAI خلفيات شفافة إلى واجهة برمجة تطبيقات الصور
ميزة صغيرة تحذف خطوة كاملة من خط المعالجة.