TaoMate-H3 يبيع مقياسًا لم يكن أحد يقيسه: زمن الوصول إلى أول مقطع

تتنافس معظم نماذج الفيديو على طول المقطع الذي يمكنها إنتاجه. أما TaoMate-H3، وهو إصدار مفتوح المصدر من فريق TaoLive AIGC التابع لـ Alibaba، فيتنافس على المدة التي تنتظرها قبل أن يوجد أول جزء منه.
يولّد النموذج الفيديو والصوت معًا، في مقاطع صغيرة، واحدًا تلو الآخر. ويحتاج كل مقطع إلى ثلاث خطوات إزالة ضوضاء عبر LoRA منخفض الخطوات، ثم ينتقل النموذج إلى المقطع التالي قبل اكتمال العمل كله. كود الاستدلال وأوزان LoRA على GitHub وHugging Face بترخيص متساهل، وهذا ما يجعل التصميم جديرًا بالفحص لا بمجرد القراءة عنه.
مقطعًا بمقطع بدلًا من دفعة واحدة
خط أنابيب تحويل النص إلى فيديو التقليدي يزيل الضوضاء من المقطع بأكمله ككتلة واحدة. هذا تجريد نظيف لكنه لا يناسب طريقة انتظار الناس فعليًا. تطلب فيديو مدته ثلاثون ثانية، فلا يوجد شيء قابل للاستخدام حتى تنتهي عملية إزالة الضوضاء كلها، لأن النموذج كان يصقل كل الإطارات معًا تقريبًا.
يقلب TaoMate-H3 الترتيب. فينهي مقطعًا قصيرًا أولًا، ويسلّمه، ثم يواصل. ولأن كل مقطع صغير، يمكن أن تكون ميزانية إزالة الضوضاء الخاصة به ضئيلة، وهنا يأتي دور LoRA بثلاث خطوات. الأثر المعلَن هو أن أول جزء قابل للاستخدام يصل أسرع بكثير، بينما تتدفق البقية خلفه.
هذا التغيير الوحيد هو ما يجعل فئة كاملة من التطبيقات قابلة للتصور. سرد مباشر حيث يولَّد فيديو المقدِّم أثناء نطق الكلمات. شخصية افتراضية تستطيع مواصلة الأداء بينما لا يزال الأداء قيد الإنشاء. فيديو تفاعلي لا يستطيع النظام فيه البقاء خاملًا وإنتاج ملف نهائي قبل عرض أي شيء.
الصوت لا يُضاف كزخرفة لاحقًا
الهندسة الأصعب هي الصوت. يولّد TaoMate-H3 الصوت والصورة في العملية نفسها بدلًا من إنتاج الفيديو وإضافة مسار صوتي لاحقًا. الحوار والغناء والأصوات البيئية مثل الأمواج أو حركة المرور أو انفجار، كلها تخرج من المولّد، ولأن الصوت يشارك في التوليد بدلًا من أن يتبعه، تكون حركة الشفاه والتعابير وتوقيت الحركة متوافقة في المصدر بدلًا من تصحيحها في مرحلة ما بعد الإنتاج.
كما يحتفظ النموذج بذاكرة KV صوتية-مرئية متجددة مع توجيه صوتي على مستوى المقطع، وهكذا تنجو الاستمرارية عبر حدود المقطع. يرث كل جزء جديد الشخصية والصوت والمشهد الذين أسسهم الجزء السابق، فلا ينزلق عمل مدته دقيقة إلى شخص مختلف في نهايته. إن اشتراك المقاطع المتجاورة في الهوية هو بالضبط العطل الذي يجعل التوليد المجزأ صعبًا، وهو السبب الذي يدفع معظم الأنظمة إلى تجنبه.
الحدود الصادقة
عدة مواصفات متواضعة. تصل دقات الإخراج إلى 480p و768p و1080p، في التأطيرين العريض والعمودي. ويوصف الاستمرار بأنه على مستوى الدقائق، وليس غير محدود. وهو مبني على MiniMax H3 بدلًا من البدء من قاعدة جديدة، لذا فالجودة البصرية الأساسية موروثة من ذلك النموذج، والمساهمة هنا هي طبقة البث والتوليد المشترك فوقه.
قدّم مطوّر اختبر نموذج التحسين أحادي الخطوة الحديث من NVIDIA في ComfyUI ملاحظة ذات صلة تستحق التذكر للفئة كلها. لم يبدُ التحسين وكأنه تحسين دقة فائقة، بل أقرب إلى إعادة تخيّل المدخلات، لأن النموذج كان يعيد بناء التفاصيل بدلًا من استعادتها. ويطرح توليد الصوت والفيديو بالبث السؤال نفسه في موضع مختلف. فعندما يولَّد كل مقطع بسرعة من ميزانية إزالة ضوضاء صغيرة، ثم يولَّد التالي بالإشارة إليه، تصبح الأخطاء الصغيرة أساسًا لكل ما يتلوها. لا تكون المقاطع الأولى السريعة مفيدة إلا إذا بقي المقطع العشرون شبيهًا بالمقطع الأول.

ثمة سقف عملي يختبئ في هذا الخطر. المولّد الباث الذي ينزلق سيحتاج نقاط تفتيش بشرية، ووجود إنسان في الحلقة كل ثلاثين ثانية يلغي جزءًا كبيرًا من ميزة السرعة. النماذج التي ستنجح في التوليد المجزأ هي تلك التي تصمد استمراريتها دون إشراف خلال جلسة طويلة، وهذه خاصية لا يستطيع أحد تأكيدها من مقطع تجريبي.
ما يغيّره البث في سير عمل المونتاج
هناك سبب عملي لأهمية البث يتجاوز وقت الانتظار. فقد كان التوليد تقليديًا عملية دفعية: تلتزم بموجّه، وتنتظر، وتستلم ملفًا نهائيًا، وأي تغيير يعني البدء من جديد. وعندما يصل الإخراج على شكل مقاطع، تنتقل النقطة التي يستطيع المبدع التدخل عندها إلى وقت أبكر. فيمكن لمخرج لا يعجبه المقطع الثالث أن يعدّل قبل أن ينفق النموذج ميزانيته في توليد البقية، ويمكن أن يتدفق التصحيح إلى كل ما يليه بدلًا من طلب لقطة جديدة.
هذه هي الحجة نفسها التي دفعت تحرير الصور نحو مسارات عمل متعددة الجولات، وهي تنطبق بقوة أكبر على الفيديو، حيث تكلف إعادة توليد لقطة أكثر بكثير من إعادة توليد إطار. العقبة أن التدخل المبكر لا يكون ذا قيمة إلا إذا أمكن توجيه المقاطع المتبقية دون كسر الاستمرارية. ذاكرة الصوت والفيديو في TaoMate-H3 هي وسيلته المقصودة للحفاظ على الاستمرارية، ويبقى السؤال المفتوح هل تصمد أمام تصحيح أثناء البث. النموذج الذي يبث لكن لا يمكن إعادة توجيهه ليس سوى طريقة أسرع لإنتاج شيء قد ترميه.
لماذا يهم الإصدار المفتوح هنا
فكرة بث المقاطع أكثر إثارة للاهتمام من النموذج نفسه. فبناؤها يتطلب حل تخزين KV عبر الأنماط، وتوجيهًا صوتيًا لحدود المقطع، وإعداد تدريب يجعل الاستدلال بثلاث خطوات يحافظ على الجودة، ولا شيء من ذلك بديهي من ملخص ورقة بحثية. وإتاحة كود الاستدلال وأوزان LoRA تعني أن فرقًا أخرى يمكنها اختبار ما إذا كان النهج يصمد مع محتواها، وبناء التطبيقات التفاعلية التي يستهدفها الإصدار دون انتظار API.
هذا هو التحول الهادئ في توليد الفيديو هذا العام. فلا تزال العروض الرائدة تدور حول مقطع واحد مثير للإعجاب، لكن الأدوات تحتها تتفرع نحو الخصائص التي يحتاجها الإنتاج فعلًا. زمن الوصول إلى أول نتيجة. الاستمرارية عبر الحدود. التكلفة لكل دقيقة من المحتوى المولَّد. يتخذ TaoMate-H3 موقفًا محددًا تجاه الثلاثة جميعًا، وينشر محاولته، ويترك السوق تحكم هل كان بث المقاطع الرهان الصائب. وبالنسبة لأي شخص يبني شيئًا تفاعليًا، هذا أنفع من مدخل آخر في لوحة صدارة. إن أوراق المواصفات التي ستحدد أي نموذج يختاره فريق منتج بعد ستة أشهر ستسرد زمن الاستجابة والانزلاق، لا الدقة، وإصدارات مثل هذه هي ما يضع تلك الأرقام على الصفحة.
وهو يتناسب أيضًا مع نمط يستحق التسمية. النماذج التي هيمنت على العامين الماضيين بُنيت لتربح مقارنة: مقطع أطول، ومعالجة أنظف، ودرجة أعلى في اختبار تفضيل. أما النماذج التي تظهر الآن فبُنيت لتلائم قيدًا: ميزانية زمن استجابة، وسقف ذاكرة، ومتطلب استمرارية عبر الحدود. القيود أصعب في الترويج وأسهل في التحقق، وهي ما يحدد ما إذا كانت التقنية ستنتهي داخل منتج أو داخل بكرة عرض تجريبية. بث المقاطع تصميم مدفوع بالقيود، وكونه شُحن مع كود لا مع فيديو هو الجزء الذي يمنحه فرصة.
مقالات ذات صلة
روبوت شبه بشري بعجلات أنهى ساعة من غسيل الملابس دون مساعدة
قد تنجح المهام الفردية بينما يفشل سير العمل ككل. غيّرت Dyna المقياس.
LTX 2.5 يريد تصيير مسودتك المتكتلة من Blender إلى لقطة نهائية
أنت لا تتحكم في ما يحدث في التوليد من النص إلى الفيديو. هذه الأداة تحاول إصلاح ذلك.
ServiceNow تحوّل إخفاقات الوكلاء إلى بيانات تدريب
التوليد دون تحقق ضجيج. والبوابات هي المنتج.
إطار واحد للغة والرؤية: نموذج هورايزن المفتوح بحجم 1.6 مليار
رهان على أن الجسور بين اللغة والرؤية لم تكن مطلوبة قط.