تريد يوتوباي أن يتذكر الذكاء الاصطناعي في صناعة الأفلام الفيلم بأكمله، لا مجرد اللقطة

أصبحت أدوات الفيديو بالذكاء الاصطناعي بارعة في إنتاج مقطع واحد مبهر. اطلب مشهدًا مدته ثلاثون ثانية وستعيد عدة نماذج شيئًا مقنعًا. لكن اطلب اللقطات الأربعين التي تشكّل تسلسلًا متناسقًا مدته خمس دقائق، بالشخصية نفسها وهي ترتدي السترة نفسها في الشقة نفسها، وستنهار الأدوات. تلك الفجوة بين المقطع والفيلم هي حيث يعيش معظم الإحباط المهني تجاه الفيديو التوليدي حاليًا.
أطلقت Utopai Studios منصة الإنتاج PAI ونموذج الفيديو Utopai X في 30 سبتمبر، والنظام مبني تحديدًا حول تلك الفجوة. الشركة الأمريكية غير معتادة من حيث إنها تطوّر وتنتج أيضًا مشاريعها السينمائية والتلفزيونية، لذا تُختبر الأدوات داخل الإنتاجات بدلًا من تصميمها بوصفها مولّدات للمستهلكين فقط.
PAI اختصار لـ Production Assistive Intelligence
تعمل المنصة كمساحة عمل تربط السيناريو والشخصيات والمواقع واللقطات والمشاهد المولّدة والقرارات الإبداعية السابقة. يبدأ صانع الفيلم بإعطاء PAI سيناريو، فيفكّكه النظام إلى عناصر مثل الشخصيات والمشاهد والمواقع والدعائم. تُنظَّم تلك التفاصيل في بنية إنتاج ثم تبقى متاحة أثناء تطوير اللقطات والأصول البصرية.
الكلمة المهمة هنا هي الاستمرارية. إذا كان الإنتاج قد حدّد بالفعل شكل الشخصية، أو كيف صُمّم الموقع، أو أي نسخة من اللقطة تم اعتمادها، فإن تلك المعلومات تبقى مرتبطة بالمشروع. ولا يلزم إعادة وصفها في كل مرة يُولَّد فيها جزء آخر من المشاهد. قد تبدو هذه ميزة عادية، لكنها تعالج واحدة من أكثر المشكلات إلحاحًا في الفيديو التوليدي، وهي أن كل عملية توليد طلب منعزل بلا ذاكرة لما سبقه.
يتضمن PAI أيضًا مساعدي إنتاج بالذكاء الاصطناعي يمكنهم استخدام معلومات المشروع الحالية للمساعدة في تخطيط اللقطات وتطوير بدائل بصرية. وتوضح الشركة صراحةً أن صنّاع الأفلام يظلون مسؤولين عن إخراج العمل ومراجعة ما يُنتَج وتحديد النسخ التي تمضي قدمًا. وهذه نقطة عملية لا تسويقية. فمن حاول تجميع تسلسل متماسك من عمليات توليد مستقلة بالذكاء الاصطناعي يعرف أن القرارات البشرية بشأن ما يتلاءم معًا تشكّل معظم المهمة.
Utopai X وأول ظهور في لوحة المتصدرين
إلى جانب PAI، قدّمت يوتوباي نموذج Utopai X الخاص بها لتحويل النص إلى فيديو، والمدمج مباشرة في نظام الإنتاج. دخل النموذج لوحة المتصدرين لتحويل النص إلى فيديو مع صوت من Artificial Analysis في 29 سبتمبر في المركز الثاني عالميًا، بدرجة Elo بلغت 1,150. وكان أيضًا النموذج الأعلى تصنيفًا من شركة مقرها الولايات المتحدة في ذلك التصنيف تحديدًا.
تتحرك مراكز لوحات المتصدرين سريعًا مع تحديث النماذج ووصول منافسين جدد. ومع ذلك، يهمّ التصنيف المستقل لأنه يعني أن النموذج لا يُقيَّم فقط مقابل عرض الشركة التجريبي الخاص. تستخدم Artificial Analysis مقارنات عمياء يختار فيها الناس بين فيديوهات مولّدة من الموجّه نفسه دون إخبارهم بالنظام الذي أنتجها.
لا يقتصر PAI على Utopai X. تدعم مساحة العمل توليد الصور والفيديو والصوت باستخدام النماذج المتاحة، مع اختيار صنّاع الأفلام للنموذج الذي يستخدمونه ومتى. وهذا خيار تصميمي معقول. فمنصة إنتاج تعمل فقط مع نموذجها الخاص هي حديقة مسوّرة، والاستوديوهات الاحترافية لن تعيد بناء خطوط إنتاجها حول نموذج فيديو لمورّد واحد.
من السيناريو إلى الجدول الزمني للمونتاج
أكثر ما يثير الاهتمام في PAI أنه يحاول ربط التوليد بالعمل الأقل بريقًا الذي يحوّل المقاطع إلى إنتاج مكتمل. تبقى اللقطات المولّدة مرتبطة باللقطات المقصودة، فيستطيع صنّاع الأفلام مقارنة البدائل والعودة إلى نسخ سابقة بدلًا من فقدان العمل السابق. ويمكن وضع المقاطع المختارة على جدول زمني للمونتاج لرؤية كيف تبدو إلى جانب اللقطات المحيطة بها.
يجدر التوضيح بشكل ملموس لماذا يكون الاتساق صعبًا إلى هذا الحد. لا يحمل نموذج الفيديو التوليدي تمثيلًا ثابتًا للشخصية كما يفعل محرك لعبة. بل يعيد اشتقاق الشخصية من الموجّه ومدخلات التكييف في كل عملية توليد، فتتسلل اختلافات صغيرة وتتراكم عبر اللقطات. ومهمة منصة الإنتاج هي الإبقاء على الأجزاء الثابتة مستقرة كي لا يضطر النموذج إلا إلى ابتكار الأجزاء التي ينبغي أن تتغير. وهذه مشكلة إدارة بيانات أكثر منها مشكلة نمذجة، ولهذا يمكن لمساحة عمل تتذكر القرارات أن تساعد حتى من دون نموذج فيديو أفضل في الخلفية.
يمكن للإنتاجات تصدير المواد لإتمامها في برامج راسخة تشمل Adobe Premiere Pro وDaVinci Resolve. وهذا يهم أكثر مما قد يبدو للوهلة الأولى. فأداة تصرّ على أن يبقى الإنتاج كله داخل نظامها تطلب من المحترفين التخلي عن أدوات أمضوا سنوات في إتقانها. واللقاء بالمحرّرين حيث يعملون بالفعل مسار أقل احتكاكًا بكثير نحو التبني.
هناك أيضًا ميزات موجهة لفرق الإنتاج الأكبر. يمكن لسير العمل المؤسسي إبقاء التعليقات والموافقات مرتبطة بنسخ معينة. ويُقصد بسجل عمليات التوليد مساعدة الاستوديوهات على تتبع مصدر المواد ومراجعة مشكلات الملكية الفكرية المحتملة. وهذه النقطة الأخيرة صارت ضرورية بشكل متزايد. فمع انتقال المشاهد المولّدة بالذكاء الاصطناعي إلى الإنتاجات التجارية، أصبح سؤال من أين جاء ناتج النموذج، وما إذا كان يمكن ترخيصه للتوزيع، مسألة قانونية لا فضولًا تقنيًا.
لماذا يُستخدم في أفلام حقيقية
تختبر يوتوباي التقنية في مشاريعها الخاصة، بما في ذلك فيلم رسوم متحركة قادم. وتقول الشركة إن صنّاع الأفلام والفنانين والمحرّكين من البشر يظلون مسؤولين عن القرارات الإبداعية، مع استخدام الذكاء الاصطناعي كجزء من عملية الإنتاج. وكون يوتوباي منتِجًا بجانب كونها بائعة أدوات يمنحها طريقة لاكتشاف مشكلات لن تواجهها شركة برمجيات محضة إلا عندما يبلّغ العملاء عنها.
كما يتاح PAI خارج إنتاجات الشركة الداخلية، بخيارات اشتراك فردية ووصول مؤسسي للاستوديوهات والفرق الأكبر. وهذا يعني أن صنّاع الأفلام يمكنهم البدء باستخدام البيئة الآن، ما يجعل الإطلاق أكثر من مجرد عرض تقني.
الاختبار الذي يهم
السؤال الأكبر هو ما إذا كان نظام مثل PAI يستطيع فعلًا حل مشكلة الاتساق التي تفصل فيديو ذكاء اصطناعي لافت للنظر عن حلقة كاملة. فقد أصبح توليد ثوانٍ من المشاهد المقنعة أمرًا روتينيًا. أما تذكّر الشخصيات والمواقع والقرارات الإبداعية والمراجعات عبر إنتاج كامل فهو تحدٍ أصعب بكثير، لأنه مشكلة إدارة بيانات بقدر ما هو مشكلة نموذج.
إعادة التأطير هذه هي المساهمة الفعلية للإطلاق. فلطالما دار الحديث حول فيديو الذكاء الاصطناعي عن أي نموذج ينتج أفضل مقطع من حيث المظهر. لكن يوتوباي تراهن على أن المرحلة التالية أقل ارتباطًا بتوليد لحظة منفردة مبهرة، وأكثر ارتباطًا بالحفاظ على مئات القرارات الإبداعية مترابطة من الصفحة الأولى في السيناريو إلى المونتاج النهائي.
إذا كان ذلك صحيحًا، فلن يكون الفائزون في صناعة الأفلام بالذكاء الاصطناعي بالضرورة هم المختبرات التي تملك أفضل نموذج فيديو. بل سيكون الفائز من يحل المشكلة المملة والجوهرية: جعل الإنتاج يتذكر ما قرره. وليست يوتوباي الشركة الوحيدة العاملة على ذلك، لكنها من القلائل التي تجادل بأن المشكلة نفسها هي المنتج.
مقالات ذات صلة
روبوت شبه بشري بعجلات أنهى ساعة من غسيل الملابس دون مساعدة
قد تنجح المهام الفردية بينما يفشل سير العمل ككل. غيّرت Dyna المقياس.
LTX 2.5 يريد تصيير مسودتك المتكتلة من Blender إلى لقطة نهائية
أنت لا تتحكم في ما يحدث في التوليد من النص إلى الفيديو. هذه الأداة تحاول إصلاح ذلك.
ServiceNow تحوّل إخفاقات الوكلاء إلى بيانات تدريب
التوليد دون تحقق ضجيج. والبوابات هي المنتج.
إطار واحد للغة والرؤية: نموذج هورايزن المفتوح بحجم 1.6 مليار
رهان على أن الجسور بين اللغة والرؤية لم تكن مطلوبة قط.