كيلينغ 4.0 يصل، والدراما القصيرة بالذكاء الاصطناعي تنتج 430 ألف عمل في عام: على ماذا يعتمد فيديو الذكاء الاصطناعي المحلي هذه المرة لتجاوز المنافسين؟

في 28 سبتمبر، نشرت كيلينغ AI التابعة لـ كوايشو رسالة على حسابها الرسمي: Kling 4.0 سيُطلق رسميًا في أكتوبر، ونسخة Flash الخفيفة فُتحت بالفعل للمستخدمين السنويين في اختبار داخلي. الرسالة لم تكن طويلة، لكن قسم التعليقات كان صاخبًا للغاية. على مدار العام الماضي، انتقل مسار فيديو الذكاء الاصطناعي المحلي من «هل يمكن التوليد؟» إلى «هل يمكن التسليم؟»، والتحديثات القليلة التي أجرتها كيلينغ هذه المرة لمست بالضبط النقاط التي تؤرق الجميع حقًا.
لنبدأ بالأرقام. نسخة Flash تُخرج بدقة 720p، ومقطع واحد من 3 إلى 20 ثانية؛ النسخة الرسمية يمكن أن تمتد إلى 30 ثانية للمقطع الواحد، بحد أقصى 4K، وستدعم لاحقًا 10bit HDR. أبعاد الصورة مدعومة من 21:9 إلى 9:16. هذه ليست النقطة الأهم. أكثر ما يخيف من يصنعون فيديوهات المنتجات ليس ضعف الجودة، بل «عدم القدرة على التعديل» — عندما يقول العميل غيّر زاوية الصورة الرئيسية، عليك إعادة العمل بالكامل، ويتغير الوجه ودرجة اللون. ما تروج له كيلينغ 4.0 هذه المرة هو تحويل «إعادة الصنع» إلى «تحرير».
الأول هو التحرير الموضعي. في الفيديو المولّد بالفعل، يمكن تعديل واحد فقط من تعبيرات الوجه أو الحركة أو حركة الكاميرا أو الأسلوب أو الخلفية، مع بقاء الباقي دون تغيير، ويمكن إدخال ما يصل إلى 5 مقاطع فيديو. هذه نفس فكرة التحرير الموضعي التي فعلها Qwen-Image 2.1 في توليد الصور، لكنها نُقلت إلى الفيديو. الثاني هو الإطارات الرئيسية، حيث يمكن إدخال ما يصل إلى 10 صور إطار رئيسي في تحويل الصورة إلى فيديو، وتثبيت صورة رئيسية وصورة مشهد استخدام وصورة قريبة للتغليف، وترك الحركة بينها للنموذج. بعبارة الممارسين، الإطارات الرئيسية هي القصة المصورة، ويمكن للموافقة عليها من العميل قبل إنفاق النقاط، فيقل إعادة العمل بطبيعة الحال. الثالث هو Omni Reference، بحد أقصى 15 مدخلًا في المرة، مع خلط الصور والفيديو والصوت البشري، واستخدام @image1 و@video1 في النص التوجيهي لتحديد استخدام كل منها.
السعر أيضًا يستحق ذكرًا. عند الدفع السنوي، الباقة المبتدئة 21 دولارًا شهريًا، 180 نقطة، أي نحو 1.9 دولار للفيديو؛ الباقة المتقدمة 90 دولارًا، أي نحو 1.1 دولار للفيديو. جميع الباقات بدون علامة مائية، ويمكن تسليم الفيديو النهائي مباشرة. هذه التسعيرة تُقارن بالسوق الخارجي: Veo 3.1 من Google في الباقة القياسية يكلف 0.4 دولار للثانية، وWan 3.0 من علي بابا من 0.05 إلى 0.2 دولار للثانية. النماذج المحلية تستبدل السعر بالسوق، وهذا أمر معلن.
خلف كيلينغ 4.0 يوجد منحنى انفجار كامل للدراما القصيرة والدراما المصورة بالذكاء الاصطناعي. نشرت وكالة شينخوا مجموعة بيانات: في الأشهر الثمانية الأولى من 2026، تم إطلاق 430 ألف دراما قصيرة، أي 13 ضعف العام الماضي بأكمله، منها أكثر من 90% مسلسلات ذكاء اصطناعي. في تقرير DataEye، ارتفعت حصة الدراما المصورة بالذكاء الاصطناعي في قائمة أفضل 100 من 7% في نفس الفترة من 2025 إلى 38%. مقارنة مباشرة بالتكلفة: تكلفة إنتاج الحلقة الواحدة من الدراما القصيرة الواقعية تتراوح بين 50 ألف و100 ألف يوان، والمدة من 2 إلى 4 أسابيع؛ بعد دخول الذكاء الاصطناعي انخفضت تكلفة الحلقة إلى أقل من 5000 يوان، وتقلصت المدة إلى 3 إلى 7 أيام.
أكثر الظواهر إثارة للاهتمام في هذه الموجة هي شعبية «دراما المحاكاة البشرية». مسلسل 《斩仙台真人 AI 版》 الذي أُطلق في يناير 2026 تجاوزت مشاهداته على دوين 110 ملايين، و《风水天师》 تجاوزت حرارته على هونغقوه 40 مليونًا ووصل إلى الموسم السادس. في 30 سبتمبر، من بين أفضل خمسة في قائمة هونغقوه الأكثر مشاهدة، أربعة كانت دراما محاكاة بشرية، وواحد فقط تصوير واقعي. الجملة الأكثر انتشارًا في التعليقات هي: الممثلون الواقعيون قبيحون بأشكال غريبة متنوعة، والذكاء الاصطناعي جميل بشكل نمطي موحّد.

هذه الجملة مدح وذم في آن واحد. وبينما كانت دراما الذكاء الاصطناعي تتصدر القوائم، صعد أيضًا إلى الأكثر تداولًا نفور فسيولوجي سببه «الوجه بالذكاء الاصطناعي». بعض المستخدمين قارنوا بلقطات شاشة فوجدوا أن بطل الرواية في مسلسلات مختلفة يملكون الوجه نفسه تقريبًا: نفس شكل الوجه، نفس تصفيف الشعر، حتى الغرة موحدة في المنتصف. التفسير التقني هو أن توليد الفيديو يجب أن يحافظ على اتساق الوجه إطارًا بإطار، والوجه المتماثل المنتظم الخالي من العيوب لديه أعلى هامش تسامح عند تبديل الكاميرا، لذلك يفضل النموذج إخراج وجه قياسي «آمن». وإذا أضفنا أن كثيرًا من الفرق تعيد استخدام القوالب الرائجة مباشرة، وتستدعي مكتبات الوجوه الرقمية العامة بشكل جماعي، يصبح التماثل أسرع. نشرت صحيفة الشعب اليومية في نهاية يونيو مقالًا بعنوان «مللتم من وجه الذكاء الاصطناعي؟ حان وقت عودة ‹الإحساس بالإنسان الحقيقي›»، والفكرة الأساسية: يمكن استخدام التكنولوجيا لضغط النفقات والدورة الزمنية، لكن لا يمكن استبدال الفن والإنسانية بطاقة خط الإنتاج. كما تقود الجمعية الصينية للبث السمعي البصري على الإنترنت إعداد «معايير تقييم جودة محتوى الدراما القصيرة بالذكاء الاصطناعي»، وتضع تمييز الشخصية كبند تقييم مستقل.
لذلك فإن «تجاوز المنعطف» في هذه الجولة من فيديو الذكاء الاصطناعي المحلي ليس في جوهره معجزة تقنية من شركة واحدة، بل تشكّل سلسلة صناعية كاملة: في جانب النماذج توجد كيلينغ وجيمنغ وهيلو وVidu ولكل منها موقعها، وفي جانب سير العمل توجد أدوات مثل دووباو Skill وتأثيرات AI في جيانيينغ التي تخفض العتبة إلى مستوى الهاتف، وفي المصب توجد منصات مثل دوين وهونغقوه تدعم محتوى الذكاء الاصطناعي ببحيرات المرور. في دراما مصورة بالذكاء الاصطناعي، من النص إلى المونتاج الأولي، أصبحت الفرق المتمرسة تضغط المدة من أيام إلى ساعات. ما كان يتطلب طاقم إنتاج سينمائي كامل أصبح الآن في متناول هاتف واحد مع أدوات مجانية.
لكن كلما انخفضت العتبة، أصبح ذلك السؤال القديم أكثر حدة: عندما يستطيع الجميع إنتاج مسلسل في يوم واحد، لماذا يجب على الجمهور مشاهدتك أنت؟ التماثل هو أثر جانبي لفترة الميزة التقنية، وهو أيضًا إشارة إلى جولة الإقصاء القادمة. الفرق التي بدأت بالفعل في تمييز الشخصيات وصناعة سرد مختلف، بل وتستخدم الذكاء الاصطناعي كأداة وليس كبديل، هي فقط التي لديها فرصة للقفز خارج «النمطية الموحدة». التحرير الموضعي والإطارات الرئيسية في كيلينغ 4.0 يمنحان من يريدون العمل الدقيق مجموعة أدوات أكثر ملاءمة. الباقي، يظل مرهونًا بالإنسان.
مقالات ذات صلة
روبوت شبه بشري بعجلات أنهى ساعة من غسيل الملابس دون مساعدة
قد تنجح المهام الفردية بينما يفشل سير العمل ككل. غيّرت Dyna المقياس.
LTX 2.5 يريد تصيير مسودتك المتكتلة من Blender إلى لقطة نهائية
أنت لا تتحكم في ما يحدث في التوليد من النص إلى الفيديو. هذه الأداة تحاول إصلاح ذلك.
ServiceNow تحوّل إخفاقات الوكلاء إلى بيانات تدريب
التوليد دون تحقق ضجيج. والبوابات هي المنتج.
إطار واحد للغة والرؤية: نموذج هورايزن المفتوح بحجم 1.6 مليار
رهان على أن الجسور بين اللغة والرؤية لم تكن مطلوبة قط.