← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

Kling VIDEO O1 يحوّل توليد الفيديو إلى نظام مرجعي

نُشر في 7 أكتوبر 2026
Kling VIDEO O1 يحوّل توليد الفيديو إلى نظام مرجعي

--- title: Kling VIDEO O1 يحوّل توليد الفيديو إلى نظام مرجعي slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1 يجعل المراجع هي الواجهة meta_description: يقبل Kling VIDEO O1 من Kuaishou النصوص والصور ومقاطع الفيديو والإطارات المفتاحية والمراجع بأي مزيج، ثم يتيح لك سحب عناصر من مقطع إلى آخر. category: ai tags: Kling VIDEO O1,Kuaishou,توليد الفيديو,نظام مرجعي,الإطارات المفتاحية,متعدد الوسائط,Veo 3.1,Runway Aleph,الاتساق ---

أمضى قسم الفيديو في Kuaishou الشهر الماضي في الإطلاق. فُتح Kling 4.0 للمختبرين، ثم حصل على نافذة إطلاق أوسع. الآن يأتي VIDEO O1 كشيء أقرب إلى تحوّل فئوي: نموذج واحد يستقبل النصوص والصور ومقاطع الفيديو والإطارات المفتاحية ومراجع الشخصيات كمدخلات، ويتعامل معها جميعًا كقطع قابلة للتبادل في طلب واحد.

التسمية التي تستخدمها الشركة هي "متعدد الوسائط الموحّد". لكن النسخة العملية أسهل في الصياغة. يمكنك إرفاق ثلاثة مقاطع وكتابة: خذ الشخصية من الفيديو الأول، وحركة الكاميرا من الفيديو الثاني، وضع كليهما في الفيديو الثالث، وغيّر النمط إلى فن البكسل.

قبل عام، كان هذا الطلب الواحد سيتطلب ثلاث أدوات منفصلة وتصديرًا دقيقًا للملفات الوسيطة، مع إضافة كل انتقال لعملية ضغط واحتمال انحراف الشخصية.

ما الذي يجلبه لك المرجع الشامل فعليًا

كان اتساق الشخصيات والدعائم هو المشكلة العنيدة في فيديو الذكاء الاصطناعي. ربطت الحلول السابقة النماذج ببعضها، ما يعني الدفع مقابل كل خطوة وقبول أي انحراف يتراكم بينها. أما نهج Kling فيطوي تلك السلسلة في توليد واحد، بحيث تُحلّ الصور المرجعية والإطارات المفتاحية وتوجيه النمط دفعة واحدة.

تشير أرقام Kling الخاصة إلى أن O1 يحقق نسبة فوز 247 بالمئة مقابل ميزة "المكوّنات إلى فيديو" في Veo 3.1 من Google في مهام المراجع الصورية، و230 بالمئة مقابل Runway Aleph في مهام التحويل. هذه تقييمات داخلية، لذا تعامل معها كإشارة اتجاهية. أما الادعاء المتعلق بالقدرات فهو أكثر قابلية للاختبار: المشاهد الجماعية، حيث يجب تثبيت عدة أشخاص كل على حدة، تُعالَج لكل شخص على حدة بدل أن تُدمج في متوسط واحد.

يمتد طول الفيديو من ثلاث إلى عشر ثوانٍ، قابلة للتعديل، ما يتيح لك ضبط إيقاع اللقطة بدل قبول ما يقرره النموذج. وتصف الشركة تحت الغطاء محوّلًا متعدد الوسائط بسياق متعدد الوسائط طويل، إضافة إلى صيغة داخلية جديدة تسميها لغة بصرية متعددة الوسائط تمزج الإشارات النصية والبصرية والصوتية داخل المحوّل نفسه. ويُفترض أن يحافظ الاستدلال المدمج بسلسلة التفكير على واقعية الحركة المولّدة فيزيائيًا.

تبدو أنواع التوليد المذكورة وكأنها قائمة بكل ما كانت هذه الفئة تقسّمه إلى أدوات منفصلة: نص إلى فيديو، وصورة إلى فيديو، وفيديو إلى فيديو، وإطار مفتاحي إلى فيديو، وصور متعددة إلى فيديو، ومرجع إلى فيديو إلى فيديو. كان كل واحد من هذه سابقًا منتجًا قائمًا بذاته. ويدّعي O1 أنها أوضاع لنظام واحد.

لماذا تهم الواجهة أكثر من مقياس الأداء

الجزء المثير للاهتمام هو أن O1 يفوز في مقارنة أصلًا، لكن سطح إدخال النموذج هو التغيير الأهم. فهو الآن مكتبة من الأصول القابلة لإعادة الاستخدام. تصبح الشخصية المبنية من زوايا متعددة عنصرًا ترفقه بالاسم بدل إعادة وصفها في كل أمر نصي. وتصبح حركة الكاميرا شيئًا تستعيره من مقطع بدل تقريبه بالصفات.

لوح كلاكيت سينمائي خشبي فارغ يستريح على سطح كتاني شاحب، ولوحه بالكامل فارغ ودون أي علامات

يغيّر ذلك شكل سير العمل. فالسلسلة الخطية من نموذج الصور، ثم نموذج الفيديو، ثم المحرّر، مع تكلفة عند كل انتقال، تنكمش إلى انتقالات أقل. كما يغيّر الجمهور الذي تستهدفه الأداة: تحصل فرق ما بعد الإنتاج على تعليمات باللغة الطبيعية بدل مراحل التتبع وإنشاء الأقنعة، وتحصل فرق الإعلانات على طريقة لاستبدال تصوير كامل دون إعادة بناء كل لقطة من الصفر.

المفردات هي النصف الآخر من الواجهة. فإرفاق عنصر بالاسم يعني أن الفريق يمكنه الاتفاق على اسم الشخصية قبل كتابة أي أمر نصي للقطة، ثم إعادة استخدام ذلك الاسم عبر حملة كاملة. أما تقريب الشيء نفسه بالصفات فينجح مرة واحدة ويصبح أصعب مع كل مراجعة، لأنه لا يوجد سجل يوضح أي تركيبة صفات أنتجت النسخة التي أحبها الجميع.

تصف وثائق المورّد حالات الاستخدام الاحترافية بعبارات مشابهة. يعتمد صنع الأفلام بالذكاء الاصطناعي على مكتبة العناصر للحفاظ على اتساق الشخصيات والدعائم خلال التصوير. وتستخدمها الإعلانات والأزياء كبديل عن التصوير في مواقع خارجية، بما في ذلك منصات العرض الافتراضية. ويستخدمها ما بعد الإنتاج لإجراء تغييرات كانت تتطلب سابقًا تقنية الروتوسكوبينغ إطارًا بإطار.

ثمة تأثير انتقاء ذاتي هنا. فالنموذج بهذا العدد من أنواع المدخلات ليس أسهل للمبتدئين؛ بل هو أسهل للأشخاص الذين يعرفون بالفعل ما يريدون. وهذا تحوّل ذو مغزى لفئة أمضت عامين في تحسين تجربة الاستخدام الأولى.

ما الذي يستبدله نظام المراجع

أوضح طريقة لفهم هذا التحوّل هي النظر إلى ما كان الفريق يبنيه حول نموذج ضعيف. كانت خطوط اتساق الإنتاج أشبه بخطوط تجميع: أنشئ ورقة شخصية، وأدخلها في كل لقطة كأمر نصي صورة، وأنشئ نسخة أولية متحركة، ثم أعد توليد كل لقطة بإطار بداية مأخوذ من النسخة الأولية. كانت كل مرحلة موجودة لأن المرحلة السابقة لم تستطع حمل سياق كافٍ إلى الأمام.

يستهدف نظام المراجع في O1 السبب الذي جعل تلك المراحل موجودة. فإذا كان النموذج قادرًا على الحفاظ على هوية شخصية عبر مشهد جماعي مع أخذ حركة الكاميرا من مقطع منفصل، فإن بعض تلك المراحل يصبح اختياريًا بدل أن يكون إلزاميًا. والمراحل الاختيارية هي حيث تتحرك الميزانيات فعليًا، لأن خط الإنتاج المبني حول قيد ما لا يختفي لمجرد أن القيد خفّ.

ينطبق المنطق نفسه على تسلسل اللقطات. فالبرامج التي تولّد اللقطة السابقة أو التالية بناءً على مواد موجودة تحوّل مكتبة المقاطع إلى شيء أقرب إلى مشهد. وسيدرك المحررون الذين يعملون أصلًا على الجداول الزمنية القيمة: تنخفض تكلفة تجربة زاوية بديلة من إعادة تصوير إلى مجرد عملية توليد.

المقايضة حقيقية

تقول Kling إن منحنى التعلّم في O1 أكثر حدة من Sora 2 أو Veo 3.1، لأن هناك قدرات أكثر يجب فهمها قبل أن تصبح أي منها مفيدة. وهذه هي التكلفة المعتادة لواجهة أكثر تعبيرًا. فالنموذج الذي يقبل أي شيء كمرجع يطلب منك أن تقرر ما الذي ينبغي أن يكون مرجعًا.

لم تحل الشركة الصوت في O1. فـ Kling 2.6 هو النموذج الذي يحمل توليد الصوت للمنصة، مع حوار متزامن وموسيقى ومؤثرات صوتية. لذا فإن الإنتاج الكامل لا يزال يعني الجمع بين نموذجين، واحد للغة البصرية وآخر للموسيقى التصويرية. ويعتمد تسويق Kling نفسه لـ 2.6 على فكرة رؤية الصوت وسماع المرئي، وهو وصف عادل لقدرة تعيش خارج O1.

يعكس التسعير أيضًا المكانة التي تريد المنصة احتلالها. ترتفع أرصدة Kling المنشورة لكل ثانية من ستة أرصدة عند 720p دون صوت إلى اثني عشر عند 1080p معه، وتُسوّق المنصة سياسة استخدام تجاري تمتد إلى التوليد المجاني. وبالنسبة لنموذج موجّه لسير العمل الاحترافي، تبقى نقطة الدخول منخفضة بما يكفي ليختبره فريق صغير قبل الالتزام.

ما الذي يجب مراقبته

ما إذا كان نظام المراجع في O1 سيصمد خارج العروض التجريبية المضبوطة. تميل ادعاءات الاتساق إلى النجاة مع المقاطع القصيرة والجلسات القصيرة، ثم تتدهور عندما يستمر مشروع لأسابيع ويجمع عشرات العناصر. ولا يثمر مفهوم مكتبة العناصر إلا إذا بقيت العناصر مستقرة عبر تلك الفترة.

قالت Kuaishou بالفعل إن 4.0 يجلب توليدًا أصليًا لمدة 30 ثانية وما يصل إلى 10 إطارات مفتاحية. وإذا تكاملت طبقة المراجع في O1 مع تلك الحدود بدل أن تنافسها، فإن الثنائي يغطي سؤالي "كم المدة" و"لمن هذا الوجه". وهذا المزيج هو ما كانت الاستوديوهات تنتظره.

تهم الصورة التنافسية قصيرة المدى أيضًا. يحتل Gemini Omni 1.1 Flash المركز الأول في تحويل النص إلى فيديو على Arena عند 1516، بينما يتصدر MiniMax H3 مجال الصورة إلى فيديو، ويتصدّر Wan 3.0 لوحة الفيديو لدى Artificial Analysis. لا يدخل O1 ميدانًا فارغًا. يتمثل تميّزه في سطح الإدخال لا في موقع على لوحة المتصدرين، وهذا شيء أصعب في الإزاحة بمجرد أن تبني الفرق مكتبات عناصر حوله.

مقالات ذات صلة