كاندينسكي 6.0 يفتح المصدر لأوزان فيديو تُولّد الصوت في تمريرة واحدة

--- title: كاندينسكي 6.0 يفتح المصدر لأوزان فيديو تُولّد الصوت في تمريرة واحدة meta_title: كاندينسكي 6.0 يفتح مصدر فيديو بصوت أصلي meta_description: أطلقت مختبرات كاندينسكي نماذج فيديو بحجم 3B و29B تولّد صوتًا متزامنًا في تمريرة واحدة، بموجب رخصة MIT، مع دعم vLLM-Omni من اليوم الأول. ---
تتعامل معظم أنظمة تحويل النص إلى فيديو المفتوحة مع الصوت باعتباره مشكلة شخص آخر. تُولّد مشاهد صامتة، ثم تضيف مسارًا صوتيًا لاحقًا، ونادرًا ما تتوافق حركة الشفاه مع الحوار. جواب مختبر كاندينسكي، الذي أُطلق هذا الأسبوع على fal، هو نمذجة الاثنين معًا.
يتوفر Kandinsky 6.0 Video بحجمين: نموذج Pro بحجم 29B موجه للمخرجات السينمائية، ونسخة Lite بحجم 3B للتكرار السريع. الكود والأوزان متاحة بموجب رخصة MIT، وهو أمر يهم أكثر من عدد المعاملات لأي شخص يخطط للاستخدام التجاري.
ما الذي تقدمه الفئتان فعليًا
يستهدف كلا النموذجين التوليد القصير. تمتد المقاطع إلى نحو خمس ثوانٍ، ويخرج الصوت بمعدل عينات 44kHz. Pro هي فئة الجودة؛ أما Lite فهي موجهة للفرق التي تحتاج إلى التكرار السريع والمستعدة لمقايضة الدقة بالسرعة والتكلفة.
القدرة الرئيسية هي التوليد المشترك. تُنمذج اللغة والرؤية والصوت معًا بدلًا من خط أنابيب، لذلك تتوافق خطوات الأقدام والمؤثرات المحيطة وأشكال الفم مع ما يحدث على الشاشة. هذا النوع من المزامنة الأصلية كان في الغالب حكرًا على الأنظمة التجارية المغلقة، وهذا ما يجعل الإصدار المفتوح جديرًا بالملاحظة.

يوفر vLLM-Omni دعم استدلال من اليوم الأول. وهذا يهم أبعد من الراحة. عندما تُطلق حزمة استدلال دعمها في يوم الإصدار بدلًا من أسابيع لاحقًا، يمكن للفرق تقييم النموذج مقابل عبء عملها قبل أن تخبو الحماسة الأولية.
على fal، يأتي النموذج مرفقًا مع رفع دقة مدمج وأداة مستقلة لتحسين دقة الفيديو. لذا فإن خط الأنابيب العملي هو نص أو صورة كمدخل، ومقطع مدته خمس ثوانٍ كمخرج، ثم رفع الدقة.
الترخيص يحتاج إلى قراءة متأنية
إليك الجزء الذي يستحق الانتباه. تصف تغطية الإصدار الرخصة بأنها MIT، ويقول إعلان مختبر كاندينسكي نفسه إن الكود والأوزان مقدمة بموجب رخصة MIT. لكن متعقبًا مستقلًا للنماذج يدرج الترخيص كترخيص مخصص وليس ترخيصًا متساهلًا قياسيًا.
يستحق هذا التناقض الحل قبل أن يبني أي شخص منتجًا على هذه الأوزان. الرخصة المتساهلة حقًا تعني الاستخدام التجاري والتعديل وإعادة التوزيع دون اتفاق منفصل. أما الرخصة المخصصة فقد تبدو متساهلة بالقدر نفسه للوهلة الأولى، لكنها قد تحمل قيودًا تظهر لاحقًا، غالبًا حول النطاق الجغرافي أو الحجم أو إعادة التوزيع اللاحقة.
كان النمط هذا العام أن تنشر المختبرات الصينية أوزانًا مفتوحة بأسماء تبدو متساهلة واستثناءات مدفونة في الشروط. فمثلًا، تستبعد رخصة MiniMax H3 الولايات المتحدة والاتحاد الأوروبي والمملكة المتحدة وكوريا الجنوبية. على أي شخص ينتقل من بطاقة النموذج إلى خطة نشر أن يقرأ الشروط الفعلية.
ستكون أوزان فيديو مرخصة بموجب MIT خطوة ذات معنى إذا صحت كما وُصفت. تراخيص الفيديو المتساهلة أندر من تراخيص نماذج اللغة المتساهلة، جزئيًا لأن نماذج الفيديو لديها أسئلة أكثر تعقيدًا حول مصدر بيانات التدريب، وجزئيًا لأن المختبرات التي تنتجها غالبًا تجارية أكثر. نموذج فيديو مفتوح حقًا يتعامل أيضًا مع الصوت سيمنح الاستوديوهات الأصغر مسارًا لا يتطلب عقد API.
لماذا يُعد الصوت المتزامن المشكلة الأصعب
أصبح توليد حركة معقولة من مطالبة نصية محلولًا بما يكفي لدرجة أن العمل المثير انتقل إلى مكان آخر. الجزء غير المرضي في توليد الفيديو المفتوح كان الصوت.
خذ في الاعتبار ما يفرضه التوليد الصامت على المستخدم. تتحدث شخصية، لكن الفك يتحرك وفق جدوله الخاص. يمشي أحدهم، لكن يجب إضافة خطوات الأقدام في مرحلة ما بعد الإنتاج، مع مطابقة الإطار يدويًا. يُغلق باب، لكن لا يوجد صوت، وإدراج مؤثر جاهز نادرًا ما يقع على الإطار الصحيح. هذه مشكلات صغيرة منفردة، لكنها ضريبة ثابتة مجتمعة، لأن كلًا منها يتطلب انتباه محرر.
تغيّر النمذجة المشتركة شكل المهمة. يتولى النموذج التوقيت داخليًا، لذا يصل المخرج كشيء أقرب إلى مقطع منتهٍ. بالنسبة للمحتوى القصير والإعلانات الاجتماعية وتحريك الشخصيات، هذا هو الفرق بين عرض تجريبي ومنتج قابل للتسليم.
ما إذا كان Pro يحقق بالفعل مزامنة دقيقة هو سؤال منفصل عن ما إذا كانت البنية تدعم ذلك، والتقييمات المستقلة التي ستحسم الأمر لم تصدر بعد. يقدم الإصدار الادعاء ويوفر عروضًا توضيحية؛ والتعامل معها كدليل سيكون سابقًا لأوانه.
أين يقع بين مجموعة الفيديو المفتوح
المقاطع القصيرة التي تبلغ خمس ثوانٍ تضع Kandinsky 6.0 مباشرة في مجال توليد الفيديو مفتوح المصدر الحالي وليس متقدمًا عليه. يحتل Wan 3.0 من علي بابا المركز الأول في لوحة تحويل النص إلى فيديو المعاد بناؤها من Artificial Analysis بتصنيف Elo قدره 1157، كما أن خيارات الأوزان المفتوحة التي تستحق التشغيل بنفسك، وأبرزها MiniMax H3، راسخة بالفعل.
لذا فإن التأطير المنصف هو تنافسي وليس ثوريًا. ما يضيفه Kandinsky 6.0 هو صوت أصلي بترخيص مفتوح ونطاق أحجام يمتد من فئة جودة جادة إلى فئة خفيفة. نموذج 3B Lite تحديدًا يفتح الباب للفرق التي لم يكن يمكنها أبدًا تبرير استضافة نموذج انتشار بحجم 29B.
كما يمنح هيكل الفئتين الفرق مقايضة يمكن التفكير فيها صراحة. شغّل Lite أثناء التكرار على المطالبات واللوحات القصصية، حيث يحتاج مقطع الخمس ثوانٍ إلى الوجود لكنه لا يحتاج إلى أن يكون جميلًا. انتقل إلى Pro بمجرد تثبيت التسلسل. هذا شكل من سير العمل دعمته المزودات المغلقة لفترة، وافتقرت إليه الأوزان المفتوحة إلى حد كبير.
ما الذي يجب مراقبته
ثلاثة أشياء ستخبرك ما إذا كان هذا الإصدار مهمًا بعد ستة أشهر.
أولًا، شروط الترخيص. إذا تبين أنها متساهلة حقًا، يصبح النموذج خيارًا افتراضيًا لعمل الفيديو المفتوح التجاري. وإذا كانت القيود ذات معنى، سيتركز التبني في الأقاليم التي لا تؤثر فيها.
ثانيًا، المعايير المستقلة. يعيد Artificial Analysis بناء لوحة تحويل الصورة إلى فيديو الخاصة به على مقياس جديد، وكل تصنيف Elo يتحرك عند صدوره. وإلى أن يظهر Kandinsky 6.0 على لوحة كهذه، تستند ادعاءات الجودة إلى عروض المورّد. تحتوي لوحة تحويل النص إلى فيديو الحالية على Wan 3.0 في المقدمة بتصنيف Elo قدره 1157 وتكلفة 12 دولارًا في الدقيقة، مع 10 من 20 فوزًا في الفئات، ما يعطي فكرة عن مدى ازدحام قمة المجال. لا ينافس Kandinsky 6.0 على ذلك المستوى، والسؤال الصادق هو ما إذا كان يحتاج إلى ذلك.
ثالثًا، ما إذا كان الصوت يصمد تحت التدقيق. يسهل إظهار المزامنة في مقطع مدته خمس ثوانٍ لشخص يتحدث إلى الكاميرا، ويصعب إظهارها في مشهد مزدحم بصوت متداخل. العروض المنشورة حتى الآن هي النسخة السهلة.
هناك اعتبار آخر ينطبق على أي فريق يخطط للبناء على هذا. تشغيل نماذج توليد الفيديو مكلف، ونموذج انتشار بحجم 29B هو نشر جاد. استئجار السعة عبر fal يزيل هذا العبء لكنه يزيل أيضًا الميزة الرئيسية للأوزان المفتوحة، وهي تشغيلها بنفسك. فئة 3B Lite هي الخيار الأكثر إثارة للاهتمام لمعظم الفرق، لأنها الفئة التي يمكن بشكل معقول تشغيلها على أجهزة يملكها استوديو صغير بالفعل.
في الوقت الحالي، الحقيقة المثيرة للاهتمام بنيوية. نموذج مفتوح ينتج الصورة والصوت معًا، بموجب ترخيص قد يكون أو لا يكون متساهلًا بالكامل، مع دعم استدلال يصل في اليوم نفسه. تضيق الفجوة بين توليد الفيديو المفتوح والمغلق هذا الأسبوع، وسيقرر سؤال الترخيص مقدار ما يبقى من هذه الفجوة مغلقًا.
مقالات ذات صلة
جوجل Flow وAdobe Firefly ينقلان فيديو الذكاء الاصطناعي خارج نافذة الدردشة
تقاربت جودة النماذج الأساسية بما يكفي لدرجة أن عامل التميّز انتقل إلى ما يحيط بالنموذج.
فيدا تريد الفوترة لوكلاء الذكاء الاصطناعي بالنتائج بدلاً من الاستخدام
تُوائم الفوترة القائمة على الاستخدام إيرادات المورّد مع استغراق الوكيل وقتاً أطول. أما التسعير القائم على النتائج فيعكس ذلك.
Voice 3 وPACT من Decagon يهيّئان دعم العملاء لاستقبال وكلاء على الطرف الآخر
أمضت أنظمة الدعم عقوداً في نمذجة السلوك البشري. والآن جزء من الطلبات الواردة آلات تعمل نيابة عن الناس.
Creatify تدرّب MiniMax H3 تدريباً لاحقاً للإعلانات وتخفض التكلفة إلى أربعة سنتات في الثانية
لا يحتاج المعلن إلى نموذج ينتج فيلماً وثائقياً. بل يحتاج إلى نموذج يظهر فيه المنتج بشكل صحيح ولا يتحوّل فيه الشخص في منتصف الجملة.