Agora-2 تُقدّم الحجة على أن نموذج العالم آلة متعددة اللاعبين

أطلقت Odyssey نموذج Agora-2 في 25 سبتمبر ووصفته بعبارة تستحق التوقف عندها: محرك ألعاب مُتعلِّم. ليس مولّد فيديو يعمل بالصدفة على قبول المدخلات. بل محرك يتنبأ بكيفية تغيير أفعال كل من في الفضاء المشترك لحالة ذلك الفضاء.
المعاينة البحثية القابلة للعب صغيرة عن قصد. أربعة بشر ضد ستة عشر وكيلًا، في بيئة مشتركة تستوعب ما يصل إلى عشرين مشاركًا إجمالًا. هذا ليس حجم منتج. إنه الحد الأدنى من الإعدادات الذي تظهر فيه المشكلة المثيرة.
المقطع ليس عالمًا
معظم نماذج الفيديو تجيب عن سؤال واحد: كيف ينبغي أن تبدو الإطارات التالية؟ أدخل إليها وصفًا نصيًا أو إطارًا أولًا، وانتظر، لتحصل على نتيجة يمكنك مشاهدتها. لا توجد حالة يجب الحفاظ عليها، لأن شيئًا مما يفعله المشاهد لا يغيّر أي شيء.
على نموذج العالم أن يجيب عن سؤال أصعب. بالنظر إلى الحالة الحالية وأفعال كل من فيها، إلى ماذا تصبح الحالة؟ هذا يعني الاحتفاظ بتمثيل متسق للبيئة عبر الزمن، وتحديثه في الزمن الحقيقي مع وصول المدخلات. عندما يتحرك شخص واحد فقط في مشهد ما، يمكنك تزييف الكثير من هذا. تذهب الكاميرا حيث تذهب، وعلى النموذج فقط أن يُبقي العالم قابلًا للتصديق على مسار واحد.
إضافة أشخاص تكسر الوهم بطرق مفيدة. يمكن أن يريد مشاركان شيئين متعارضين. أحدهم يسدّ بابًا يحتاجه الآخر. أحدهم يرمي شيئًا يهبط في مكان يغيّر ما يستطيع ثالث فعله. لم تعد الحالة مسارًا عبر مشهد. إنها كائن مشترك يكتب فيه عدة فاعلين في الوقت نفسه، وعلى النموذج أن يحسم تلك الكتابات كما يفعل محرك فيزيائي، إلا أنه لا يوجد محرك. توجد شبكة عصبية تتنبأ بالحالة التالية.

لهذا كان اختبار ستة عشر وكيلًا مقابل أربعة بشر هو الاختبار المحدد الذي اختارته Odyssey. إنشاء الوكلاء رخيص، ويتصرفون باستمرار، وسيفعلون أشياء لن يفكر مختبِر بشري في تجربتها. إذا بدا النموذج معقولًا فقط من وجهة نظر واحدة تتحرك بوتيرة بشرية، سيجد سرب صغير نقطة الضعف في غضون دقائق.
المحركات القائمة على التعلّم هي الرهان المثير
حاكَت ألعاب الفيديو الحالة المشتركة لعقود. الفرق هو في كيفية إنتاج الحالة. المحرك التقليدي لديه شيفرة تحدد ما يحدث عند تصادم جسمين، وكيف ينتقل مقذوف، وكيف يتصرف السطح تحت الأقدام. القواعد مكتوبة، لذا تكون النتيجة حتمية ورخيصة الحساب. يذهب معظم العمل إلى المحتوى، لا إلى تقرير ما هو صحيح.
يستبدل المحرك المتعلّم القواعد بنموذج يتنبأ بالنتائج من الأمثلة. وهذا يقلب بنية التكلفة. لم تعد تكتب ما يحدث عندما يُسدّ باب، لأن النموذج رأى أبوابًا مسدودة بما يكفي ليستنتج ذلك. ما تتخلى عنه هو اليقين. المحرك المكتوب لا يهلوس جدارًا لم يكن موجودًا. أما المتعلّم فيمكنه ذلك، وفي جلسة مشتركة لا يبقى ذلك الخطأ على شاشة مشاهد واحد. الجميع يرى الجدار الخاطئ نفسه، وهذا إما عالم مشترك أو خلل مشترك حسب ما إذا كان النموذج قد خمّن ما أردته.
الحصول على سلوك في الزمن الحقيقي فوق ذلك هو الجزء الصعب الآخر. التنبؤ بالحالة التالية مرة واحدة مشكلة بحثية. أما التنبؤ بها بسرعة كافية بحيث لا يستطيع أربعة أشخاص يمسكون بوحدات تحكم أن يلاحظوا أنهم ينتظرون الاستدلال، فهي مشكلة أنظمة، وهي التي تقرر ما إذا كان شيء كهذا سيصبح منتجًا.
ما الغرض من المعاينة فعليًا
إطلاق معاينة قابلة للعب بدلًا من فيديو عرض هو خطوة متعمدة. العرض يُظهر النموذج في أفضل حالاته على مسار اختاره المبتكرون. أما المعاينة بمشاركين حقيقيين، بمن فيهم سرب من الوكلاء، فتولّد حالات الفشل التي يحتاجها الفريق ولا يستطيع تخيلها بسهولة.
كما تختبر الشيء الذي لا يستطيع معيار قياسه. عادةً يُحكم على نماذج العالم بناءً على مدى إقناع دقيقة مولّدة. هذا المقياس لا يقول تقريبًا شيئًا عن ما إذا كانت البيئة تبقى متماسكة عندما يفعل شخص شيئًا غير متوقع، أو ما إذا كان مشاركان يختلفان حول الحالة يحصلان على الإجابة نفسها.
الجانب الخاص بالوكلاء في التجربة هو الخيار الأكثر كشفًا. تحتاج المؤسسات التي تدرّب الروبوتات ووكلاء البرمجيات إلى بيئات يتفاعل فيها كثير من الفاعلين في وقت واحد، وهي في الغالب تبنيها يدويًا أو تعيد استخدام محركات ألعاب تأتي بمجموعة قواعد ثابتة. وعد نموذج العالم المتعلّم باستبدال ذلك، والوعد لا يُحتسب إلا إذا صمد تحت عشرين كاتبًا متزامنًا. أربعة بشر يوجّهون ستة عشر وكيلًا هو ضغط لتلك المشكلة إلى شيء يمكنك مشاهدته فعليًا.
إلى أين يستقر هذا
من السهل قراءة محرك ألعاب متعلّم كخطوة نحو ألعاب تولّد نفسها. أما الاستخدام الأقرب أجلًا فهو أقل بريقًا وأكثر ترجيحًا: بيئات لتدريب الوكلاء وتقييمهم. نموذج عالم يستطيع الاحتفاظ بحالة مشتركة والاستجابة لكثير من الفاعلين في وقت واحد هو بيئة يمكنك وضع مئة وكيل فيها ومشاهدة ما يفعلونه، وهذا بالضبط ما تحتاجه الفرق التي تبني برمجيات الوكلاء والتي تبنيها حاليًا في الغالب يدويًا.
ما إذا كان Agora-2 سيصبح بنية تحتية أم مجرد فضول بحثي يعتمد على الأرقام المملّة التي لا تحسمها المعاينة. اتساق الحالة عبر جلسات طويلة، والتكلفة لكل مشارك في الساعة، ومدى سلاسة تعامله مع حالة يفعل فيها مشارك شيئًا لم يره النموذج قط. انتقل مفهوم البيئة المشتركة المتعلّمة من ورقة بحثية إلى نسخة قابلة للعب هذا الشهر. وجعله يصمد تحت عشرين كاتبًا متزامنًا هو الجزء الذي سيستغرق العام القادم.
سبب متابعته عن كثب هو ما ستستبدله نسخة عاملة. اليوم، أي شخص يدرّب وكيلًا ضد بيئة غنية إما يبني محاكيًا يدويًا، وهو بطيء وضيق، أو يستعير محرك ألعاب يفرض مجموعة قواعد ثابتة لا يستطيع الوكيل مفاجأتها. يزيل المحرك المتعلّم هذين القيدين معًا: لا قواعد تُكتب، ولا سقف للمواقف التي يمكن أن تنشأ، لأن المواقف تُولَّد بدلًا من أن تُؤلَّف. معاينة أربعة مقابل ستة عشر هي أصغر اختبار لتلك الفكرة لا يزال ينتج صراعًا ذا معنى، وهو نقطة البداية الصحيحة.
هناك تكلفة تكشفها المعاينة أيضًا. التنبؤ في الزمن الحقيقي لعشرين مشاركًا يعني تشغيل الاستدلال باستمرار لكل واحد منهم، وهذا نقيض التوليد بالدفعات الذي يجعل نماذج الفيديو ميسورة اليوم. خدمة عالم تكلّف مالًا في كل ثانية يظل فيها حيًا، بينما خدمة فيديو تكلّف مالًا مرة واحدة. إذا كان ستُستخدم البيئات المتعلّمة في تدريبات تستمر أيامًا، فعلى الاقتصاديات أن تتحسن بمراتب عدة على الأقل، وهذه مشكلة عتاد وكفاءة بقدر ما هي مشكلة نمذجة.
مقالات ذات صلة
روبوت شبه بشري بعجلات أنهى ساعة من غسيل الملابس دون مساعدة
قد تنجح المهام الفردية بينما يفشل سير العمل ككل. غيّرت Dyna المقياس.
LTX 2.5 يريد تصيير مسودتك المتكتلة من Blender إلى لقطة نهائية
أنت لا تتحكم في ما يحدث في التوليد من النص إلى الفيديو. هذه الأداة تحاول إصلاح ذلك.
ServiceNow تحوّل إخفاقات الوكلاء إلى بيانات تدريب
التوليد دون تحقق ضجيج. والبوابات هي المنتج.
إطار واحد للغة والرؤية: نموذج هورايزن المفتوح بحجم 1.6 مليار
رهان على أن الجسور بين اللغة والرؤية لم تكن مطلوبة قط.