← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

المعركة القادمة في فيديو الذكاء الاصطناعي تدور حول فهم العالم

نُشر في 2 أكتوبر 2026
المعركة القادمة في فيديو الذكاء الاصطناعي تدور حول فهم العالم

على مدار معظم العامين الماضيين، كانت طريقة الحكم على نموذج فيديو بالذكاء الاصطناعي بسيطة: انظر إلى مدى جمال الإطارات. هذا الاختبار بدأ يفقد جدواه. فعندما تستطيع عدة نماذج جميعاً إنتاج مقطع مقنع مدته خمس ثوانٍ لشخص يسير في مدينة، تتوقف جودة الصورة عن التمييز بينها. لا بد أن يكون هناك شيء آخر.

في سبتمبر، أطلقت شركة ناشئة صينية تُدعى HiDream.ai نموذج HiDream-O1-Video-1.0، أو HD-V1، وجعلت ذلك «الشيء الآخر» محور عرضها بالكامل. وتقول الشركة إن النموذج مبني ليفهم كيف ينبغي أن تتكشف الأحداث، وليس فقط كيف ينبغي أن تبدو أي إطار واحد.

مشكلة الإطارات الجميلة

أي شخص أمضى وقتاً في توليد الفيديو يعرف أنماط الفشل. تطلب من شخصية أن تدفع باباً خشبياً ثقيلاً، فيرسم النموذج اليد تدفع إلى اليسار بينما يتأرجح الباب إلى اليمين. تطلب من شخص أن يركض من مكان إلى آخر خلال خمس ثوانٍ، فتُنهي الشخصية الحوار، وينفد الوقت، ثم تنتقل آنياً. يبدو المقطع جيداً حتى تشاهده فعلاً.

إعادة التوليد المتكررة تستهلك الوقت والرصيد، وقد يكلف مقطع مدته خمس عشرة ثانية أكثر بكثير مما تسمح به الميزانية. الفجوة ليست في الدقة وليست في الطول. إنها في الفيزياء والسبب والنتيجة. يرسم النموذج كل إطار دون أن يفهم أن الباب يجب أن يتأرجح في الاتجاه الذي تدفعه اليد، أو أن الانتقال بين نقطتين يستغرق وقتاً.

هذه هي الفجوة التي يستهدفها HD-V1. تقول HiDream إن النموذج يعزز فهمه لمدة الحركة، وعلاقات الأجسام، ومنطق الأحداث، والمزامنة السمعية البصرية قبل أن يولّد، بحيث تتماسك المخرجات كتسلسل بدلاً من كومة صور ثابتة.

شريط لوحة قصصية ثلاثي الأبعاد يظهر شخصية ظلية تدفع باباً لتفتحه في الاتجاه الصحيح

أربعة نماذج صينية، ثلاثة مناهج

لفهم لماذا يهم هذا، يساعد النظر إلى من يوجد في قمة لوحات الصدارة. بحلول سبتمبر 2026، دفعت أربعة نماذج صينية نفسها إلى الصفوف الأمامية في توليد الفيديو عالمياً: Seedance 2.0 و2.5 من ByteDance، وH3 من MiniMax، وWan 3.0 من علي بابا، وHD-V1 من HiDream. وقبل عام، كانت نماذج الفيديو الصينية بالكاد حاضرة في المعايير الدولية الرئيسية. أما الآن فهي تتجمع قرب القمة.

وصلوا إلى هناك عبر طرق مختلفة. يعتمد Seedance على حزمة ByteDance الكاملة من الحوسبة والهندسة والمنتج. ويبني MiniMax H3 على قاعدة نموذج كبيرة وقاعدة مستخدمين كبيرة، ليمتد إلى الفيديو. أما Wan 3.0 فمدمج في منظومة علي بابا الأوسع من Qwen وAlibaba Cloud. وHiDream هو الشاذ بينها، شركة ناشئة بلا موارد أو توزيع عملاق، تراهن بدلاً من ذلك على معمارية تسميها نموذج عالم أصلي متعدد الوسائط، مصمم ليسمح للصور والفيديو والتفاعل ثلاثي الأبعاد والذكاء المجسد بمشاركة أساس واحد.

يدعم HD-V1 مدخلات النص والصورة والفيديو ويولّد فيديو بدقة 1080p مدته من 5 إلى 20 ثانية. ويقول الفريق إنه أدى أداءً جيداً عبر لوحتي صدارة دوليتين، والادعاء البارز هو فهم العالم: فكرة أن النموذج يولّد تسلسلات أكثر تماسكاً لأنه يحاكي كيف تتقدم الأحداث.

لماذا أصبح «الفهم» هو الحدود الجديدة

عندما تستطيع عدة فرق بلوغ مستوى الجودة نفسه، ينتقل التنافس إلى ما يعرفه النموذج عن العالم. ويصبح الدقة والمدة ميزتين أساسيتين بدلاً من عوامل تمييز. والأسئلة الأصعب هي تلك التي لا تستطيع جودة الصورة الإجابة عنها: هل يخضع جسم متحرك لقواعد الفيزياء، وهل يبقى الفعل والصوت متزامنين، وهل يتبع حدثٌ الحدثَ السابق.

للصناعة أسماء أخرى للفكرة نفسها. تتحدث المنتجات المنافسة والسوق الأوسع عن الاتساق، وفهم النية، والتسليم المستقر. حتى إن شركة فيديو صينية واحدة، ZhiXiang Future، نشرت إطاراً تقييمياً من خمسة أجزاء لوكلاء الفيديو، يغطي الاتساق، والنية، والاكتمال السمعي البصري، والخط الزمني والسرد، والتسليم المستقر. تختلف الأسماء، لكن الهدف واحد: نماذج يمكن الوثوق بها لإكمال تسلسل، وليس مجرد بدئه.

هناك أموال خلف هذا. قدّرت Goldman Sachs أن سوق توليد الفيديو بالذكاء الاصطناعي عالمياً سينمو نحو عشرة أضعاف خلال خمس سنوات، ليصل إلى حوالي 29 مليار دولار بحلول 2030. وهذا النوع من التوقعات يجذب الاستثمار نحو أي شيء يبدو كقفزة القدرات الحقيقية التالية، و«يفهم العالم» هو المرشح الحالي.

لوحات الصدارة لا تتفق فيما بينها

جزء من صعوبة الحكم على مجال الفيديو هو أن لوحات النتائج لا تتفق. في سبتمبر، توّجت ساحة المجتمع عائلة واحدة، وفضّل المقيّمون البشر الذين يقيّمون المقاطع الفردية عائلة أخرى، واختار كتّاب الأوامر النصية بالتصويت عبر استخدامهم عائلة ثالثة. وضعت لقطة إيلو مجتمعية سلسلة Gemini Omni من Google في القمة، مع Flux 3 Video من Black Forest Labs كأقوى مدخل قريب من المصدر المفتوح، وSeedance 2.0 و2.5 من ByteDance قريبين خلفه. في المقابل، وضع المقيّمون البشر الذين قيّموا المقاطع على مقياس جودة من واحد إلى خمسة Seedance 2.0 أولاً، متقدماً على Kling وWan وحتى على خليفته. وبحسب الاستخدام الخام، يهيمن Seedance وVeo 3 من Google على حجم الأوامر النصية، بينما يمتلك Wan الساحة المحلية والمفتوحة.

الدرس من مجموعات البيانات الثلاث تلك هو أن «أفضل نموذج» يعتمد كلياً على ما تقيسه. يحتل Veo مرتبة أدنى في تقييمات البشر للمقاطع الصامتة مقارنة بالساحات، لأن قوته في الصوت الأصلي والحوار، وهو ما لا تستطيع معايير التقييم الصامتة رؤيته. وحصول Seedance 2.5 على درجة أقل من 2.0 في جودة كل مقطع تذكير بأن الإصدارات الأحدث ليست دائماً أكثر إبهاراً على الأوامر النصية التي يكتبها الناس فعلاً. وعلى أي شخص يختار أداة لمشروع أن يقرأ أكثر من لوحة قبل أن يقرر، وأن يعطي وزناً أكبر للوحة التي تطابق عمله.

ماذا يعني هذا التحول لمنشئي المحتوى

بالنسبة لأي شخص يصنع أشياء فعلاً بهذه الأدوات، التأثير العملي هو تغيّر في ما يتعطل. عندما يفهم النموذج منطق الأحداث، ينتقل الفشل من الواضح إلى الدقيق. تتوقف عن مصارعة شخصيات تنتقل آنياً وأبواب تُفتح في الاتجاه الخطأ، وتبدأ بملاحظة مشكلات أصغر: فعل يستمر نبضة أطول من اللازم، أو رد فعل لا يتبع الجملة السابقة. هذه هي المشكلات التي يُفترض أن يلتقطها المخرج البشري.

هذا هو الدرس نفسه الذي علّمته بالفعل طفرة الدراما القصيرة في الصين. يستطيع الذكاء الاصطناعي الآن توليد اللقطات، لكن الحلقة المكتملة لا تزال تحتاج إلى شخص يقرر أي اللقطات تنتمي، وبأي ترتيب، ولماذا. تتحسن النماذج في الإطار. أما الحكم على أي الإطارات تهم، فلا يزال مهمة بشرية، وقد يبقى كذلك أطول مما يتوقع المتفائلون.

سباق الأطراف الأربعة يهم أيضاً لسبب أهدأ. شركات مختلفة تهاجم المشكلة نفسها من اتجاهات مختلفة، حزمة عملاق هنا، ومعمارية شركة ناشئة هناك، يقلل اعتماد الصناعة على أي مسار تقني واحد. إذا تبيّن أن فهم العالم هو الهدف الصحيح، فأكثر من فريق يتجه إليه الآن. وإذا تبيّن أنه الهدف الخاطئ، فقد قام المجال بالتحوط.

في الوقت الحالي، القراءة الصادقة هي أن HD-V1 مجرد مدخل قوي آخر في مجال مزدحم، مع ادعاءات لم يختبرها طرف ثالث بعد. لكن ما لا شك فيه هو الاتجاه. النماذج التي ستفوز في الجولة التالية لن تكون تلك التي ترسم أجمل إطار منفرد. بل ستكون تلك القادرة على إمساك قصة معاً لمدة عشرين ثانية دون أن ينكسر شيء. فهم العالم هو المشكلة الأصعب، ولأول مرة، تعمل عليه دفعة واحدة فرق كثيرة ممولة جيداً.

مقالات ذات صلة