← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

Atlas من في-في لي يحوّل صورة إلى غرفة يمكنك التجول فيها

نُشر في 2 أكتوبر 2026
Atlas من في-في لي يحوّل صورة إلى غرفة يمكنك التجول فيها

أطلقت World Labs نموذج Atlas في وصول مبكر في 1 سبتمبر. وتصفه الشركة، التي شاركت في تأسيسها في-في لي، بأنه نموذج عالم شامل للذكاء المكاني، ويتمثل العرض التوضيحي في إدخال بضع صور عادية من هاتف لغرفة، ثم إخراج مشهد ثلاثي الأبعاد تفاعلي. يمكنك تحريك كاميرا افتراضية في أي مكان داخله. ويمكنك قراءة العمق منه. ويمكنك تسليم الهندسة إلى روبوت واستخدامها كمكان للتدريب.

لطالما جادلت لي لسنوات بأن الحدود التالية للذكاء الاصطناعي ليست اللغة بل العالم المادي. وتستخدم مصطلح الذكاء المكاني، والادعاء هو أن نموذجًا دُرِّب على النصوص والصور المسطحة فقط يفتقد شيئًا جوهريًا. نماذج اللغة تصف عالمًا لا تراه. وAtlas هو أوضح محاولة حتى الآن لبناء نموذج قادر على ذلك.

ما الذي يفعله Atlas

تصف World Labs نموذج Atlas بأنه محوّل انتشار انحداري تلقائي متعدد الوسائط، بمعنى معمارية واحدة تستقبل النص والصور والفيديو وبيانات ثلاثية الأبعاد داخل إطار مكاني واحد وتولّد عبر المجموعة نفسها. ومخرجاته أوسع من مخرجات مولّد الفيديو: صور وفيديو بتحكم الكاميرا بدقة تصل إلى 1440p لمقاطع تبلغ نحو دقيقة، إضافة إلى مناظر جديدة وخرائط عمق وسحب نقطية وتمثيلات غاوسية ثلاثية الأبعاد.

المخرج الحجمي هو ما يفصل هذا عن نموذج تحويل النص إلى فيديو. فمولّد الفيديو يتنبأ بالإطار التالي. لكنه لا يعرف بالضرورة أين يقع أي شيء في الفضاء أو كيف يبدو المشهد من زاوية لم تشغلها الكاميرا قط. يحمل Atlas تمثيلًا داخليًا ثلاثي الأبعاد، بحيث تبقى البيئة متماسكة أثناء تحرك المشاهد عبرها. والفرق بين مقطع يبدو معقولًا وفضاء قابل للتنقل هو جوهر تسمية هذا بنموذج عالم.

ومن مدخلات متناثرة، وفي بعض العروض التوضيحية مجرد بضع لقطات من هاتف، يعيد النموذج بناء مشهد بجودة كافية لوضع كاميرا افتراضية داخله. وتُبلغ World Labs عن خطأ إعادة بناء من مشاهد متناثرة قدره 25.3، وهو أقل من أفضل نموذج متخصص عند 28.7. وفي تقييمات عمياء كلفت بها، فضّل المقيّمون البشريون التزام Atlas بحركة كاميرا مطلوبة على MiniMax H3 بنسبة 75 بالمئة، وعلى Gemini Omni Flash بنسبة 81 بالمئة، وعلى Seedance 2.5 بنسبة 94 بالمئة.

هذه أرقام الشركة نفسها من تقييمات أجرتها، ويجدر قول ذلك بوضوح. وAtlas في وصول مبكر، لذا لا يمكن لأحد خارج مجموعة الشركاء إعادة إنتاجها بعد.

من الواقع إلى المحاكاة، ولماذا تهم الروبوتات

التطبيقات التجارية الواضحة هي المؤثرات البصرية والألعاب والإنتاج الافتراضي. فيمكن لصانع أفلام أن يجهّز لقطة بعد التصوير. غير أن الإطار الذي تركز عليه World Labs هو الروبوتات.

يُسمى سير العمل هذا «من الواقع إلى المحاكاة». فتصوّر فيديو لفضاء حقيقي، ويحوّله Atlas إلى محاكاة ثلاثية الأبعاد حيث يمكن تدريب روبوت أو اختباره دون تكلفة تشغيل الشيء الحقيقي ومخاطره. ويمكن لفريق روبوتات يريد ألف تنويع من ممر مستودع أن يمسح الممر مرة واحدة ويولّد التنويعات بدلًا من تصوير كل واحد منها.

هذه نقطة ألم ضيقة لكنها حقيقية. فبيانات تدريب الروبوتات مكلفة لأن جمعها يعني تشغيل روبوتات. والمحاكاة رخيصة لكنها تتطلب عادةً أن يبني شخص ما البيئة يدويًا، وهو أمر بطيء وغالبًا لا يشبه المكان الحقيقي إطلاقًا. والنموذج الذي يحوّل غرفة حقيقية إلى ملف محاكاة يدمج خطوتين مكلفتين في خطوة واحدة. وهذا أيضًا يفسر لماذا تعد Nvidia وAMD من المستثمرين. فكلتاهما تبيعان القدرة الحاسوبية التي يعمل عليها التدريب والمحاكاة.

مشكلة الإفصاح

هناك فجوة بين الطموح والسجل الموثّق. فلم تنشر World Labs أي ورقة بحثية، ولا بطاقة نموذج، ولا عدد معاملات، ولا رقم قدرة حاسوبية للتدريب إلى جانب Atlas. ولم تفصح عن سعر ولا عن تاريخ إتاحة عامة. وبالنسبة لنظام يقدّم ادعاءات مقارنة ضد منافسين موثّقين جيدًا، فإن هذا الإغفال غير معتاد، ويجعل نتائج التقييمات العمياء مستحيلة التحقق.

طرح المشككون سؤالًا أحدّ: هل يحاكي Atlas العالم حقًا أم يعرض مناظر مقنعة له؟ هاتان قدرتان مختلفتان، والتمييز بينهما مهم لكل حالة استخدام تعتمد على الفيزياء. النموذج الذي يعرض غرفة من زاوية جديدة مفيد لفيلم. أما النموذج الذي يتعلم روبوت المشي عبره فيحتاج إلى أن تتصرف الأشياء داخله كما تتصرف الأشياء، وإلا تتعلم السياسة شيئًا لا يعمل إلا داخل النموذج.

تقول World Labs إن Atlas سيشغّل إصدارات مستقبلية من Marble، منتجها الحالي. وهذا يمنحه موطنًا تجاريًا، وهو أكثر مما تملكه معظم إعلانات الأبحاث. أما ما إذا كانت الهندسة تصمد خارج العروض المنسّقة، فهو ما سيعرفه شركاء الوصول المبكر أولًا.

النظير الصيني

لا يعد Atlas النموذج العالمي الوحيد بطموح بحجم مدينة. ففي 10 سبتمبر، أصدرت شركة الخرائط الصينية Amap نموذج ABot-Earth 0.7، الذي تصفه بأنه أول نموذج عالم لمدينة أصيل ثلاثي الأبعاد في العالم. فهو يأخذ صور الأقمار الصناعية أو وصفًا نصيًا ويحوّلها إلى مشهد ثلاثي الأبعاد تفاعلي قابل للتجول، مولّدًا على مقاييس متعددة من كوكب كامل وصولًا إلى معلم على مستوى الشارع داخل نموذج واحد. وتقول Amap إنه يمكنه إنتاج مشهد مدينة ثلاثي الأبعاد بمقياس كيلومتر في نحو عشر دقائق على وحدة معالجة رسومات استهلاكية، بتنسيق التقسيم الغاوسي ثلاثي الأبعاد، وإن هذه القدرة تعمل بالفعل في منتجها Flight Street View.

يشير الاثنان إلى الفكرة نفسها من طرفين متقابلين. يعمل Atlas من حفنة صور صعودًا، فيعيد بناء غرفة بدقة عالية. ويعمل ABot-Earth من بيانات الأقمار الصناعية نزولًا، فيولّد مدينة على نطاق واسع. ومعًا يرسمان النطاق الذي يمكن أن يغطيه نموذج مكاني، كما يظهران مدى اختلاف طرح المنتجين في السوق: أحدهما عبر برنامج شركاء بلا معايير مرجعية عامة، والآخر مدمج في منتج استهلاكي حيث يمكن لأي شخص النظر إلى المخرجات.

ما لا تزال النماذج المكانية بحاجة إلى إثباته

يمتلك هذا المجال زخمًا. دُرِّب نموذج V-JEPA 2 من Meta على أكثر من مليون ساعة فيديو. ويولّد Genie 2 من Google بيئات ثلاثية الأبعاد تفاعلية، ويعمل Gemini Robotics على الاستدلال والتلاعب في الفضاء المادي. وقد انتقلت حجة لي، بأن الهندسة والمنظور يجب أن يكونا أصيلين في النموذج بدلًا من استنتاجهما من النص، من موقف بحثي إلى فئة منتج.

ما لم يحسمه أي من ذلك هو ما إذا كان النموذج الذي ينتج هندسة متماسكة هو الشيء نفسه كالنموذج الذي يفهم فضاءً ماديًا. فإعادة البناء قابلة للقياس. أما المحاكاة فهي أصعب، وهي ما تحتاجه الروبوتات فعليًا. ويقدّم Atlas حجة قوية للأولى. وستحدد نتائج الشركاء في العام المقبل مقدار ما يأتي معه من الثانية.

بالنسبة إلى المصممين والمطورين، فإن التأثير قريب المدى أكثر تواضعًا مما توحي به لغة الإطلاق. فالأداة التي تعيد بناء غرفة من ثلاث صور وتتيح لك تحليق كاميرا عبرها مفيدة حقًا، وستظهر داخل البرمجيات الإبداعية قبل أن تظهر داخل روبوت. وهكذا تصل النماذج المكانية إلى معظم الناس أولًا، عبر عمل صناعة مشهد لا عبر عمل التنقل فيه.

مقالات ذات صلة