صور الأقمار الصناعية أصبحت الآن بيانات تدريب للروبوتات

قد لا تكون أسرع طريقة لتعليم آلة مكانًا جديدًا هي قيادتها إليه. هناك إطلاقان هذا الشهر يشيران إلى الفكرة نفسها من اتجاهين متعاكسين. أحدهما يحوّل صور الأقمار الصناعية إلى مواقع عمل محاكاة حتى تتدرب الروبوتات قبل وصولها. والآخر يصلح الهندسة الكامنة تحت نماذج العالم القائمة على الفيديو بحيث يتطابق ما يتخيله الروبوت مع المواقع الفعلية للأشياء.
أطلقت شركة Bonsai Robotics، التي تبني برمجيات القيادة الذاتية لمعدات الزراعة والتعدين، نظام Bonsai World في الثاني من أكتوبر. يبدأ النظام من صور الأقمار الصناعية لمزرعة أو موقع تعدين أو تضاريس وعرة أخرى، ويحوّل تلك الصورة المسطحة إلى محاكاة ثلاثية الأبعاد منظمة. ويمكن للآلات بعد ذلك أن تتدرب على مسارات حقيقية داخلها. وتقول الشركة إنها تستطيع إضافة ظروف لم يواجهها الأسطول فعليًا، بما في ذلك الغبار والحطام والحيوانات والمركبات وتحرّك الأرض.
البنية الحاسوبية خلفه هي حزمة متعددة المورّدين. يقرأ نموذج الرؤية Gemini من جوجل صورة القمر الصناعي ويبني خريطة منظمة. أما نموذج العالم الخاص بـ Bonsai، الذي دُرّب لاحقًا على أكثر من 50 مليون عينة من العالم الحقيقي جُمعت من أكثر من مليون فدان، فيولّد المشاهد على مستوى الأرض. ويجري التدريب على أجهزة جوجل الافتراضية A2 مع وحدات معالجة رسومات Nvidia A100، بينما يستخدم التوليد الفوري للبيئات أجهزة جوجل G4 مع وحدات RTX PRO 6000 Blackwell الخادمية. وتقع نماذج Cosmos من Nvidia في الأساس.
الحجة التجارية تتعلق بزمن التشغيل الأولي. فتشغيل برمجيات القيادة الذاتية على محصول جديد أو آلة جديدة أو موقع جديد يعني عادةً جمع بيانات ميدانية والتكرار حسب الموقع، وهو أمر بطيء ومكلف. وإذا أمكن للنظام أن يتدرب أولًا على إعادة بناء معقولة، فإن الآلة تصل أقرب إلى الجاهزية. وتقول Bonsai إن هذا النهج يقلل الجمع الميداني بدلًا من أن يحل محله، وهذه هي النسخة الصادقة من الادعاء.
مشكلة الهندسة التي لا يراها أحد
المحاكاة من الصور لا تعمل إلا إذا كانت الهندسة ثلاثية الأبعاد التي تنتجها صادقة. وهنا يصبح بحث نُشر على arXiv هذا الشهر مثيرًا للاهتمام. أطلق فريق من الجامعة التقنية التشيكية ومعهد Inria نظام DepthWorld، الذي قُبل في مؤتمر تعلّم الروبوتات، ويبدأ البحث باعتراف يقوّض الكثير من العروض التوضيحية: نماذج العالم القائمة على الفيديو تُدرّب حاليًا على قنوات RGB فقط، وتنتج تسلسلات تبدو صحيحة إطارًا بإطار دون أن تتكوّن في عالم ثلاثي الأبعاد متسق.
يسهل تصوّر هذا الفشل. أعطِ نموذج عالم يعمل بـ RGB فقط مشهدًا فيه خزانة مفتوحة، فلن يستطيع التمييز بين الباب المفتوح والسطح الصلب، فيحاكي ذراعًا روبوتية تصطدم بفراغ. وإذا كنت تستخدم النموذج لتقييم سياسة، فإن هذا النوع من الأخطاء ينتج إشارة أسوأ من كونها بلا فائدة، لأنها تبدو كفشل حقيقي وليست كذلك.
الإصلاح الأول للفريق هو البيانات. بنوا خط معايرة يجمع بين العمق الاستيريو المُتعلّم ورسم بياني عاملي مشترك، يجمع كل حلقة جُمعت من الروبوت المادي نفسه حتى يتمكن النموذج من استعادة الحركة المشتركة لهذا الروبوت إلى جانب المعلمات الخارجية لكاميرا كل مشهد. وعند تطبيقه على DROID، أكبر مجموعة بيانات مفتوحة للتشغيل عن بُعد، ينتج DROID-3D: عمق متري كثيف ومعلمات خارجية متعددة المشاهد معاد معايرتها عبر أكثر من 70,000 حلقة، مع خطأ إعادة إسقاط أقل من 0.7 بكسل في 90% من الحلقات بالنسبة للكاميرات الخارجية.
الإصلاح الثاني معماري. فبدلًا من إعادة تهيئة نموذج فيديو مُدرّب مسبقًا لإضافة العمق، وهو ما يخاطر بتدمير الأولويات البصرية والحركية التي تعلمها بالفعل، يضعون RGB والعمق جنبًا إلى جنب في شبكة كامنة أوسع ويوسّعون تضمينات الموضع لتغطيتها. ويبقى المكوّن المُدرّب مسبقًا دون تغيير. والمكافأة نتيجة فاجأتني حين قرأتها: إضافة العمق كهدف تنبؤ ثانٍ حسّنت تنبؤ RGB نفسه، بمقدار 1.48 ديسيبل PSNR عند الميزانية التدريبية نفسها.
لماذا يهم هذا الرقم خارج حدود البحث
لا يكون نموذج العالم مفيدًا للتخطيط إلا إذا صمدت هندسته على مدى تسلسل طويل، وهنا أصبحت المقارنة مع PointWorld من Nvidia مثيرة للاهتمام. كان PointWorld أكثر دقة في الأجسام المتحركة على أفق قصير، لكن DepthWorld تدهور بدرجة أقل بكثير مع الوقت، إذ انتقل من 8 إلى 9 مليمترات من الخطأ في المشهد بأكمله، بينما انتقل الآخر من 8 إلى 18. وبالنسبة لنظام يخطط لدقائق قادمة، فإن المنحنى يهم أكثر من نقطة البداية.
إذا جمعت Bonsai World وDepthWorld معًا، يظهر نمط. لم تعد عنق الزجاجة في تدريب الذكاء الاصطناعي الفيزيائي هي القدرة الحاسوبية ولا حتى قدرة النموذج. بل أصبحت جودة العالم الاصطناعي، وتحديدًا ما إذا كانت الهندسة داخله مترية ومعايرة ومستقرة. وهذه مشكلة هندسة بيانات قبل أن تكون مشكلة نمذجة. وإسهام DROID-3D هو خط معالجة لا معمارية: فهو يستعيد أوضاع كاميرا دقيقة بالمليمتر من مجموعة بيانات لم تُصمم يومًا لتوفيرها، ويفعل ذلك بجمع الحلقات بدلًا من الوثوق بأي حلقة واحدة.
ما الذي يتحسن، وما الذي لا يتحسن
المكاسب حقيقية لكنها محدودة. يعمل Bonsai World في البيئات الخارجية المنظمة حيث تتوفر صور الأقمار الصناعية وتكون التضاريس المتغير المهيمن. وهذا يغطي الزراعة والتعدين السطحي جيدًا. لكنه يغطي مطبخًا مزدحمًا أو ممر مستشفى بشكل ضعيف، لأن هذه المساحات لا تُرى من المدار، وصعوبتها تأتي من الأشياء لا من الأرض. والوصف الذي تستخدمه الشركة نفسها، بيئات وعرة وغير منظمة، هو بيان نطاق بقدر ما هو وصف للسوق.
ويعاني DepthWorld من القيد المعاكس. فهو في أقوى حالاته حين تكون لديك حلقات كثيرة من روبوت واحد وتستطيع جمع معايرتها، وهو بالضبط الإعداد الموجود في مختبر بحثي وأقل شيوعًا في أسطول منتشر بمعدات متنوعة. ومعيار البحث نفسه يعتمد على مجموعة بيانات مفتوحة واحدة.
وهناك أيضًا فجوة تحقق تستحق الذكر. لم تنشر Bonsai قياسات أداء ميدانية مستقلة أو أوزان نموذج مفتوحة مع إعلانها. ويبقى نموذج العالم مجرد ادعاء حتى يختبره شخص خارج الشركة. أما كود DepthWorld ومجموعة بياناته فهما الحالة المعاكسة: بحث منشور، ومكان قبول معتمد، وخط معالجة قابل لإعادة الإنتاج، ولهذا من المرجح أن يؤثر في كيفية بناء فرق أخرى لنماذج عالمها حتى لو لم يستخدم أحد هذا النموذج تحديدًا.
الجزء الذي ينبغي أن يقلق فرق الروبوتات
إذا أصبحت البيئات الاصطناعية الطريقة الافتراضية للتدريب المسبق لأنظمة القيادة الذاتية، فإن جودة المحاكاة تصبح نقطة فشل واحدة عبر عمليات نشر كثيرة. وأي تحيز مضمّن في المولّد، سواء كان في الإضاءة أو التضاريس أو توزيع العوائق، ينتقل إلى كل آلة تُدرّب عليه، وينتقل بشكل غير مرئي، لأن الآلات التي تفشل لا تصل أبدًا إلى الميدان لتكشفه.
وهذه هي الحجة لصالح الإبقاء على بعض الجمع الميداني في الحلقة حتى عندما تبدو النسخة الاصطناعية مقنعة. فبيانات الميدان تستحق كلفتها بفضل الأمثلة التي توفرها، والأهم من ذلك، بفضل الرقابة التي تفرضها على المحاكي. وكلا الإطلاقين هذا الشهر يدفعان المجال إلى الأمام في هذا الاتجاه: أحدهما بجعل توليد البيئات المحاكاة رخيصًا، والآخر بجعل الهندسة داخلها صادقة. ولا أي منهما يلغي الحاجة إلى إخراج الآلة في النهاية ورؤية ما ستفعله.
مقالات ذات صلة
Gemini 3.5 Live Translate من Google يلغي التوقف
الترجمة التي تعمل باستمرار، بصوت المتحدث نفسه، على هاتف موجود أصلًا في جيبك، تنقل الميزة من شيء تفتحه إلى شيء يعمل فقط.
الصين تضع أول معيار سلامة إلزامي لوكلاء الذكاء الاصطناعي
تنتقل السلامة من ميزة تروّج لها إلى بوابة تعبر منها. وجرد المخاطر يضم 13 فئة و97 بنداً.
المحتوى المولّد بالذكاء الاصطناعي يبدأ في إعلان هويته
هذه الخطوة لا تحل كل المشكلات، لكنها تحوّل «مولّد بالذكاء الاصطناعي» من خيار يمكن إخفاؤه إلى سؤال يجب الإجابة عنه.
SearchQwen3-8B من علي بابا والحجة لصالح وكلاء البحث الصغار
النموذج وكيل بحث، وليس محرك بحث. معظم استدعاءات وكلاء البحث روتينية، والعمل الروتيني هو الأنسب لنموذج صغير.