← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

TwelveLabs Pegasus 1.6 يحوّل فيديو المنظور الأول إلى بيانات تدريب للروبوتات

نُشر في 7 أكتوبر 2026
TwelveLabs Pegasus 1.6 يحوّل فيديو المنظور الأول إلى بيانات تدريب للروبوتات

يبدأ تعليم روبوت طي الملابس بمشاهدة شخص ساعات من لقطات لبشر يطوون الملابس، ثم كتابة كل حركة. تريد TwelveLabs أن ترفع تلك المهمة الثانية عن الطاولة.

في 6 أكتوبر، أصدرت شركة ذكاء الفيديو Pegasus 1.6، وهو نموذج يدعم فيديو المنظور الذاتي بشكل أصلي. وهذا يعني لقطات مصوّرة من منظور الشخص الأول للشخص الذي يؤدي العمل، سواء كان شخصًا يطبخ، أو يجمّع أجزاء على خط مصنع، أو يشغّل روبوتًا عن بُعد.

لماذا يشكّل فيديو المنظور الأول مشكلة مختلفة

تحمل لقطات المنظور الأول إشارات مكانية وأنماط حركة مختلفة عن فيديو الكاميرا الثابتة العلوية أو كاميرا الشخص الثالث. وهي تتضمن ضبابية الحركة، وإضاءة متغيرة، وأجسامًا تظهر وتختفي مع تحرك لابس الكاميرا. تميل النماذج المدرّبة على بيانات فيديو عامة إلى التعامل معها بشكل ضعيف.

صُمم Pegasus 1.6 لأخذ هذه المدخلات الفوضوية واستخراج التفاصيل المهمة لتعليم روبوت كيفية الحركة أو الإمساك أو التنقل. ويدعم النموذج خمسة مسارات عمل مباشرة.

يولّد تقسيم الأفعال ووسمها تسميات بطوابع زمنية للمهام والخطوات والأجسام والتفاعلات بين اليد والأجسام من الفيديو الخام، ومرتبطة بتصنيف خاص بالمجال. وينتج وسم التعليقات المكثفة لغة وصفية للعلاقات المكانية وسياق المشهد والتفاعلات بين اليد والأجسام، بهدف تدريب سياسات روبوتية مشروطة باللغة. وتصفّي تقييم الجودة المقاطع منخفضة الجودة عبر تقييم وضوح الفعل والتأطير والاستقرار قبل وصول اللقطات إلى المراجعين البشر. ويكشف البحث والتنظيم الأحداث النادرة والسيناريوهات ذات الذيل الطويل عبر مستودع فيديو كبير من خلال استعلامات باللغة الطبيعية. ويكتشف وضع علامات الموافقة والامتثال الوجوه والمارة والبيانات الحساسة الظاهرة على الشاشة أو على الورق قبل دخول اللقطات إلى خطوط المعالجة اللاحقة.

حسابات الجهد البشري

الرقم الذي يفسر المنتج هو تكلفة الوسم اليدوي. قد يستغرق وسم لقطات المنظور الذاتي يدويًا من 70 إلى 155 ساعة من وقت الإنسان لكل ساعة فيديو. ويمكن إسقاط ذلك على مقطع واحد مدته ساعتان ليجد المُوسِّم البشري نفسه أمام أسابيع من العمل لملف واحد.

يأتي Pegasus 1.6 بنافذة سياق بسعة 261,120 رمزًا، وهي كبيرة بما يكفي لمعالجة فيديوهات تصل مدتها إلى ساعتين. ويتم الوصول عبر واجهة برمجة تطبيقات TwelveLabs، بسعر 1.75 دولار لكل ساعة فيديو، و3 دولارات لكل مليون رمز إدخال صور، و15 دولارًا لكل مليون رمز إخراج، وهو ضعف سعر Pegasus 1.5.

هناك تحذير واحد للفرق التي تخطط لمهام كبيرة: لا يزال Pegasus 1.5 يتولى التحليل بالدفعات، لذا لم تنتقل المعالجة الضخمة عالية الحجم بالكامل إلى النموذج الجديد بعد.

التمييز بين الفهم والتنفيذ

وصف الرئيس التنفيذي للشركة، جاي لي، الفرصة المباشرة بأنها بنية تحتية للتدريب. ففهم الفعل ليس إلا جزءًا من تعليمه. يستطيع Pegasus وصف حركات الأطراف وتقديم فهم تقريبي للمسارات، لكنه لا يوفر كل المعلومات اللازمة لتنفيذها. ويبقى الضغط واللمس والتحكم الدقيق مشكلات منفصلة.

هذا تأطير صادق للحدود، ويستحق التمسك به. يجب على فرق الروبوتات دمج المعلومات المستمدة من الفيديو مع بيانات أخرى وبناء الأنظمة التي تترجمها إلى أفعال. يقع Pegasus في المرحلة الأولية، إذ يغذي عملية التدريب بدلًا من استبدال حزمة الروبوتات.

قابض روبوتي من الألومنيوم المصقول يقترب من مكعب سيراميكي أبيض بسيط على سطح رمادي باهت

قدّم لي مؤشرًا واحدًا على نطاق المعالجة، مستذكرًا تشغيلًا عالج نحو 17 سنة من لقطات المنظور الأول في حوالي 18 ساعة دون فشل أي فيديو. ولم يحدد موارد الحوسبة أو ظروف التقييم، ما يجعل ذلك ادعاء إنتاجية حكائيًا وليس معيارًا قابلًا للتكرار. وتصف المواد التقنية للشركة تقييمات داخلية لتحديد الفعل والتعرف على اليد المؤدية، لكنها لا تقدم درجات رقمية أو مقارنة قابلة للتكرار مع المنافسين.

موقعه مقابل البدائل

يمتد الميدان التنافسي عبر عدة أجزاء من مسار تطوير الروبوتات. يتداخل Cosmos Curator من NVIDIA مباشرة في إعداد البيانات من خلال التصفية والوسم وإزالة التكرار، وتمنح أدواته المفتوحة الفرق بديلًا عن خدمة مُدارة. وينافس تكامل Encord مع NVIDIA Cosmos Reason 2 وEmbed على أعمال الوسم والتنظيم، إذ يولّد تسميات أولية لمراجعة بشرية مع بحث قائم على السلوك. ويتداخل Gemini Robotics ER 2 من Google في تفسير الفيديو وتتبع تقدم المهمة، لكنه يركز على التخطيط والتنسيق، ويسلّم التنفيذ الحركي لنماذج أفعال منخفضة المستوى. ويستخدم FLUX-mimic من Black Forest Labs وmimic أساس نموذج فيديو لإنتاج أفعال روبوتية، ويتناول التنفيذ بدلًا من إعداد البيانات.

تختلف وحدات الفوترة ونطاقات المنتجات بين هذه الأدوات، لذا لا تحسم أسعارها أيها الأرخص لعبء عمل معين. يفوتر Pegasus الفيديو حسب المدة وإخراج النص حسب الرموز، وهو ما يناسب الفرق التي تكون عقبتها الأساسية هي الوسم وليس توليد الأفعال.

ما الذي يثبته الإصدار وما لا يثبته

يضع Pegasus 1.6 منتجًا ملموسًا خلف أبحاث فهم الفيديو لدى TwelveLabs، ويستهدف عنق زجاجة حقيقيًا. فالمسار من لقطات بشرية خام إلى بيانات تدريب روبوتية قابلة للاستخدام بطيء ومكلف فعلًا، وأتمتة جزء منه ستهم أي شخص يبني ذكاءً مجسّدًا.

ما يبقى غير محسوم هو ما إذا كان النموذج يحقق نتائج أفضل بشكل ملموس من البدائل الحالية. فلم يرافق الإعلان أي معايير طرف ثالث، أو مقارنات أسعار عبر الميدان كامل، أو نتائج عملاء منشورة. وأوضح شيء يجب مراقبته لاحقًا هو ما إذا كان مطورو الروبوتات ينشرون نتائج استخدام Pegasus 1.6 في مسارات وسم فعلية. فهذا الدليل سينقل النقاش من الإعلان إلى التقييم، وهو النوع الوحيد الذي يحسم ادعاءً حول الجهد البشري الموفور.

لماذا يشكّل فيديو البشر قاعدة الهرم

تستند الاستراتيجية وراء Pegasus 1.6 إلى حجة حول مصدر المعرفة السلوكية للروبوت، ويستحق ذلك القول بوضوح.

معظم ما يعرفه الناس عن أداء العمل الجسدي لم يُلتقط قط في شكل يمكن للآلة التعلم منه. فالطباخ يعدّل قبضته دون تفكير. والعامل يتعافى من سقوط أداة عبر نقل الوزن ومدى الوصول بطريقة لا يكتبها أحد. وهذه التعديلات هي الفرق بين روبوت يؤدّي حركة وروبوت يكمل مهمة.

يُعد فيديو البشر أحد أغنى مصادر هذه التعديلات، وهو متاح بحجم هائل. والرهان هو أن قاعدة واسعة من المعرفة السلوكية المستخرجة من لقطات بشرية، والمكيّفة مع روبوتات محددة عبر عروض التشغيل عن بُعد، مسار أسرع إلى آلات قادرة من البدء من الصفر لكل مهمة.

هذه استراتيجية تطوير وليست ضمانًا مُثبتًا، وقد قال الرئيس التنفيذي ذلك. فالمزيد من الفيديو لا ينتج تلقائيًا روبوتًا قادرًا على نطاق واسع، وتبقى ترجمة فعل مفهوم إلى فعل منفذ مشكلة منفصلة تتضمن القوة واللمس والتحكم.

بُعد الموافقة

يستحق أحد مسارات العمل الخمسة التي يدعمها Pegasus 1.6 الإفراد بالذكر، لأنه يشير إلى سؤال حوكمة يأتي مع المجال. يكتشف وضع علامات الموافقة والامتثال الوجوه والمارة والبيانات الحساسة الظاهرة على الشاشة أو على الورق قبل دخول اللقطات إلى خطوط المعالجة اللاحقة.

توجد هذه الميزة لأن فيديو المنظور الذاتي يُلتقط من منظور شخص أثناء العمل، وهذا التأطير يلتقط أكثر من المهمة. فهو يرصد شارة، أو شاشة، أو وجهًا في الخلفية، أو مستندًا على مكتب. وبالنسبة لفريق روبوتات يجمع لقطات على نطاق صناعي، فإن خطوة وضع العلامات هي ما يمنع خط تدريب من إدخال مواد لا ينبغي له إدخالها.

وإدراج مسار العمل هذا إلى جانب مسارات الوسم إقرار هادئ بأن لخط البيانات سطح امتثال، وأن هذا السطح يصعب إدارته يدويًا. وبالنسبة للفرق في الصناعات الخاضعة للتنظيم، قد ينتهي الأمر بقدرة وضع العلامات لتكون بنفس أهمية سرعة الوسم، لأن خط معالجة لا يستطيع فرز مدخلاته لا يمكن استخدامه إطلاقًا.

ما الذي يتوسع، وما الذي لا يتوسع

تصف TwelveLabs الإصدار كخطوة من مجموعات بيانات صغيرة ومنسقة بعناية نحو خط معالجة قابل للتوسع مبني على تجربة بشرية حقيقية. والتحذير الصادق هو أن التوسع في خطوة الوسم لا يحقق تلقائيًا توسعًا في خطوة التدريب.

حتى خط وسم سريع ورخيص ينتج بيانات لا تزال بحاجة إلى اقترانها بإشارات اللمس والتحكم التي يحتاجها الروبوت، وإلى تكييفها مع تجسيد آلة محددة. يزيل Pegasus 1.6 عنق زجاجة واحدًا، وهو جهد الوسم، ولا يفعل شيئًا تجاه الأخرى. وهذه مساهمة مفيدة وليست حلًا كاملًا، والفرق التي ستستفيد أكثر هي تلك التي كانت خطوة الوسم فيها هي القيد الملزم. وما إذا كان ذلك يصف معظم فرق الروبوتات هو بالضبط السؤال الذي تجيب عنه نتائج منشورة من عمليات نشر فعلية.

مقالات ذات صلة