← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

PixVerse R2 يحوّل توليد الفيديو إلى عالم يمكنك التجول فيه

نُشر في 2 أكتوبر 2026
PixVerse R2 يحوّل توليد الفيديو إلى عالم يمكنك التجول فيه

تطلب منك معظم أدوات توليد الفيديو الشيء نفسه: صف مشهدًا، انتظر، احصل على مقطع، قرر ما إذا كنت ستحتفظ به. الناتج هو ملف. يُشغَّل بالطريقة نفسها في كل مرة. إذا أردت نهاية مختلفة، تكتب مطالبة مختلفة وتبدأ من جديد.

PixVerse R2، الذي أُطلق في 23 سبتمبر من قبل الشركة المالكة لمنصة PixVerse للفيديو، AIsphere، مبني على فرضية مختلفة. فبدلاً من إرجاع مقطع ثابت، فإنه يولّد عالمًا سمعيًا بصريًا مستمرًا يظل يعمل بينما تتفاعل معه. يمكنك إنشاء عالم من نص أو صورة، وتحريك شخصية بواسطة مفاتيح WASD، وتغيير الكاميرا، وكتابة مطالبات لتبديل الشخصيات أو إضافة كائنات أو تعديل البيئة. لا يُعاد تشغيل المشهد. تبقى الإجراءات السابقة وتشكّل ما سيحدث لاحقًا.

هذه التفصيلة الأخيرة هي الفكرة كلها. في معظم الفيديو التوليدي، يكون كل طلب مستقلًا. في R2، تُحدِّث المطالبة حالة العالم. قدّم هدية لمخلوق في الفيلم التفاعلي التجريبي *Zero Mark*، الذي بُني مع المبتكر شياولونغباو، وتُولَّد النتيجة مباشرة بناءً على الهدية التي اخترتها. أعطه تنينًا أو ورقة وتتفرع القصة. مبتكر آخر، جيد وو، بنى تسلسلًا حول شخصية رقمية في الوقت الفعلي تُدعى إيف تحافظ على هوية وذاكرة متسقتين عبر العديد من التبادلات.

شخصية ظلية وحيدة تسير عبر سهل سريالي نحو بوابة متوهجة من المناظر معلقة فوق الأفق المتلاشي

تصف AIsphere نموذج R2 بأنه نموذج عالمي عام للأغراض العامة في الوقت الفعلي، وقد فتحت مساحات تجريبية للألعاب والأفلام التفاعلية والبشر الرقميين على world.pixverse.video. ويأتي R2 بعد R1، الذي قدمته الشركة في يناير.

المقايضة التي يحاول كسرها

لطالما فرض التوليد في الوقت الفعلي خيارًا. النموذج الصغير السريع يمكنه مواكبة التفاعل المباشر لكنه لا يستطيع فعل الكثير. النموذج الكبير القادر ينتج إطارات أفضل لكنه يعمل ببطء شديد بحيث لا يستجيب لأي شيء. عادة ما يختار الفرق أحد الجانبين ويقبلون القيد.

يقسم R2 المشكلة إلى طبقتين. الأساس هو عمود فقري سببي انحداري ذاتي يُسمى Omni Causal AR، يُدرَّب باستمرار على فيديو قصير وطويل، ومراجع متعددة الوسائط، وصوت وتحكم بالحركة. ويتوسع على خمسة أبعاد: النموذج، والبيانات، والمهام، وإشارات التحكم، والآفاق الزمنية. وفوق ذلك توجد طبقة تسريع في الوقت الفعلي تقوم بتقطير العمود الفقري نفسه إلى نسخة فائقة قليلة الخطوات تعمل مباشرة.

التمييز مهم. فبدلاً من تدريب نموذج صغير منفصل للتعامل مع التفاعلية وقبول أنه سيكون أضعف، تقوم AIsphere بتقطير نموذجها القادر إلى شكل أسرع. الطبقتان تشتركان في الأصل، لذا لا تتعلم النسخة السريعة من الصفر.

تقنيات داعمة تملأ التفاصيل. يتعامل التقطيع الديناميكي مع الإشارات التي تعمل على مقاييس زمنية مختلفة، فلا يُجبر النموذج على معالجة تغيير بيئي بطيء وحركة شخصية سريعة بالطريقة نفسها. تحتفظ ثلاث قنوات ذاكرة بقواعد العالم الثابتة، والحركة الأخيرة، وحالة الكائن. ويعيد بنك الأخطاء تشغيل حالات فشل النموذج نفسه أثناء التدريب.

تذكر الشركة أن بنك الأخطاء خفّض مقياس انحراف السطوع طويل الأمد بنسبة 35.8 في المائة في اختبارات داخلية، وأن الانتباه الكتلي المتناثر يحافظ على الجودة شبه كاملة فوق 90 في المائة من التناثر. انحراف السطوع مقياس غير جذاب لكنه معبّر. في التسلسلات الطويلة، التراكم الخفي للخطأ هو بالضبط ما يكسر وهم أنك تنظر إلى مكان متماسك.

ما ليس عليه

AIsphere صريحة بشأن الحدود، وهذا منعش في فئة عادة ما يتجاوز فيها التسويق المنتج. في ظل قيود الوقت الفعلي والكمون الصارمة، لا تزال جودة الإخراج أحادي المسار لـ R2 متأخرة عن نماذج الفيديو الرائدة دون اتصال. إذا كنت تريد أوضح مقطع ممكن، فلا يزال من الأفضل أن تولّد دون اتصال وتنتظر.

لذا فإن عرض القيمة ليس الجودة. بل الاستمرارية والاستجابة. يقايض النموذج بعض الصقل لكل إطار مقابل القدرة على إبقاء العالم حيًا والتفاعل مع المدخلات، والرهان هو أن مجموعة كبيرة من الاستخدامات تهتم أكثر بالأخير.

هذا التأطير يفسر أيضًا مكان R2 مقابل الموجة الأوسع من نماذج العالم القادمة من مختبرات صينية وأماكن أخرى. يضع HD-V1 من HiDream، الذي تناولناه سابقًا هنا، نفسه حول الاتساق الفيزيائي والتماسك السردي في التوليد دون اتصال. دفعت نماذج العالم التفاعلية من جوجل في اتجاه البيئات القابلة للعب. عرض R2 يميل بقوة نحو استعارة «البيئة التي تدخلها». قال مؤسس AIsphere والرئيس التنفيذي، وانغ تشانغهو، بوضوح: الفيديو التفاعلي في الوقت الفعلي ليس كل نمذجة العالم، لكنه الطريق الذي يمكن للناس تجربته أبكر. ويتوقع أن يتطور R2 من أداة إبداع إلى بيئة يمكن للمستخدمين دخولها في أي وقت.

لماذا يهم محرك اللعبة

محرك ألعاب PixVerse، الذي أُطلق لأول مرة في يوليو، يعمل الآن على R2. هذا هو الجزء الجدير بالمتابعة لأي شخص خارج مجال البحث. نموذج عالم في الوقت الفعلي مرتبط بمحرك لعبة هو منتج مختلف تمامًا عن مولد الفيديو. إنه يعني تفاعلات مؤلفة، وحالات حفظ، ونوع استمرارية الجلسة التي يتوقعها اللاعبون بالفعل من البرمجيات وليس من الوسائط.

تتجمع حالات الاستخدام التجريبية حول هذه الفكرة: الألعاب، والأفلام التفاعلية، والبشر الرقميون. الثلاثة جميعها تنسيقات يقوم فيها الجمهور بشيء ما، وحيث لا يمكن لمقطع ثابت تقديم التجربة. إنسان رقمي يتذكر آخر تبادل مفيد في خدمة العملاء أو الرفقة بطريقة لا يكون فيها فيديو لقطة واحدة مفيدًا أبدًا. الفيلم التفاعلي حيث يتفرع اختيار المشاهد حقًا هو شكل لا تستطيع خطوط إنتاج الفيديو التقليدية إنتاجه على الإطلاق.

هناك فجوة عملية بين مساحة تجريبية ونشر إنتاجي، ولم تفصح AIsphere عن الجداول الزمنية للتوافر التجاري، أو التسعير، أو مقدار الحوسبة التي تستهلكها جلسة R2 المباشرة. هذه الأرقام ستحدد ما إذا كان النموذج سيصبح منصة أم سيبقى عرضًا تجريبيًا.

النمط وراء الإطلاق

تراجع قليلاً وسيتناسب R2 مع نمط يمكن التعرف عليه من العام الماضي من فيديو الذكاء الاصطناعي. تستمر الحدود في التحول من «توليد مقطع أجمل» نحو «الحفاظ على شيء متماسك بمرور الوقت». وهذا صحيح سواء كان الشيء سردًا مدته خمس دقائق، أو شخصية تبقى متسقة عبر اللقطات، أو في حالة R2، عالمًا يحافظ على قواعده بينما تضغط عليه.

كل من هذه هو المشكلة الأساسية نفسها في ثياب مختلفة: الحفاظ على اتساق حالة نظام توليدي مع تراكم الوقت والتفاعل. النماذج دون اتصال تحلها إطارًا بإطار داخل عرض واحد. R2 يحلها عبر جلسة مباشرة، حيث تستمر المدخلات في الوصول.

سواء أصبح R2 أداة مستخدمة على نطاق واسع أو تجربة ممولة جيدًا، فهو علامة مفيدة على أين تعتقد الفئة أن الميزة التالية تكمن. الشركات التي يمكنها الحفاظ على عالم متماسك تحت المدخلات في الوقت الفعلي ستكون في وضع جيد، لأن هذه هي القدرة التي تحول الفيديو التوليدي من شيء تشاهده إلى شيء تستخدمه.

مقالات ذات صلة