تاوباو TaoMate-H3 مفتوح المصدر: ضغط التوليد المستمر للصوت والفيديو على مستوى الدقائق إلى ثلاث خطوات إزالة ضوضاء لكل مقطع

قام فريق TaoLive AIGC التابع لـ Alibaba بنشر كود الاستدلال وأوزان LoRA الخاصة بـ TaoMate-H3 على GitHub و Hugging Face. ما يفعله هذا النموذج ليس جديدًا: توليد الصورة والصوت في المقطع نفسه. لكن طريقة قياسه لنفسه تغيّرت، فهو لا يقارن من لديه جودة أفضل لمقطع واحد، بل كم من الوقت ينتظر المرء من كتابة المطالبة (prompt) حتى رؤية أول مقطع مكتمل.
زمن انتظار المقطع الأول، مؤشر لم يكن أحد يهتم به سابقًا
منطق التوليد في نماذج الفيديو السائدة هو إزالة الضوضاء للمقطع كاملًا. تكتب وصفًا مدته ثلاثون ثانية، فيرمي النموذج كل إطارات الثلاثين ثانية معًا في عملية الانتشار (diffusion) ويكررها، دون أن يعطيك أي شيء في الأثناء، حتى ينتهي من حساب المقطع كاملًا ويسلّمه دفعة واحدة. مشكلة هذه الطريقة واضحة: زمن الانتظار يتناسب طرديًا مع طول الفيديو. إذا أردت مقطعًا أطول، عليك الانتظار أكثر.
يتبع TaoMate-H3 نهج التقدم مقطعًا بمقطع. يقسّم التوليد إلى مقاطع صغيرة، ويحتاج كل مقطع إلى ثلاث خطوات إزالة ضوضاء فقط. يوضّح النموذج المقطع الحالي أولًا، ثم يتابع توليد المحتوى اللاحق. تقنيًا، يربط استدلال LoRA بثلاث خطوات مع التوليد الانحداري الذاتي (autoregressive generation)، حيث تُنقل الشخصيات والأصوات والمشاهد من المقطع السابق إلى المقطع التالي كسياق.
الفرق العملي الذي يحدثه هذا التغيير يكمن في «متى يمكن رؤية شيء ما». في البث المباشر التوضيحي، أو أداء الشخصيات الافتراضية، أو أي سيناريو يتطلب استجابة فورية، لا ينتظر المستخدم انتهاء توليد الفيديو كاملًا ليرى الصورة لأول مرة. لقد تقلص زمن إنتاج المحتوى للمقطع الأول، وهذا مؤشر قلّما اتخذه نموذج ما نقطة بيع رئيسية من قبل. أشارت مجلة ماشين هارت في تقريرها إلى أن ما يروّج له TaoMate-H3 أساسًا هو «زمن توليد المقطع الأول».
كيف يشارك الصوت في التوليد
في مسألة التوليد المشترك للصوت والفيديو، هناك طريقتان في المجال. الأولى: توليد الصورة أولًا، ثم استخدام نموذج آخر لإضافة الصوت، وتُزامَن القطعتان في مرحلة ما بعد الإنتاج؛ والثانية: إشراك الصوت في عملية التوليد نفسها، ليوفّر قيودًا زمنية لحركة الشفاه وتعبيرات الوجه والحركات.

TaoMate-H3 يتبع الطريقة الثانية. في عملية التوليد نفسها، يُعالج الصوت والصورة معًا؛ كلام الشخصيات، الغناء، الحوار بين الأدوار كلها ضمن هذا الإطار، وكذلك المؤثرات الصوتية البيئية والحركية مثل أمواج البحر وحركة المركبات والانفجارات. لا حاجة لانتظار مرحلة ما بعد الإنتاج لضبط التزامن الزمني بين الحوار والصورة.
من حيث مواصفات الإخراج، يدعم ثلاث دقات: 480p و768p و1080p، ويمكنه الإخراج بالوضع الأفقي أو العمودي. يمكن كتابة وصف المشهد كمطالبة (prompt) كاملة، أو ترتيب الحوار والحركات والحبكة حسب المقاطع، بينما يواصل النموذج التوليد مع الحفاظ على السياق السابق. التوليد المستمر على مستوى الدقائق هو النطاق المستهدف له.
حجم المعلمات ليس كبيرًا، لكن قيمته تُفهم فقط عند إدخاله في سير عمل حقيقي
تم تدريب TaoMate-H3 لاحقًا (post-training) بناءً على MiniMax H3. النموذج الأساسي (Base) هو نموذج أساسي مفتوح المصدر من جهة أخرى، وأضاف فريق TaoMate عليه قدرة التوليد الانسيابي (streaming). هذا أيضًا سبب إمكانية إصدار الأوزان بهذه السرعة: لا حاجة لتدريب نموذج كبير من الصفر، والتركيز ينصب على خط أنابيب الاستدلال وLoRA.
بالنسبة للمطورين، القيمة العملية تأتي على عدة مستويات. الأكثر مباشرة هو إمكانية تشغيله على أجهزتهم الخاصة، دون الاعتماد على API سحابي لإجراء أبحاث التوليد الانسيابي. ثانيًا، التوليد الانسيابي نفسه يفتح سيناريوهات كانت غير ملائمة سابقًا: التشغيل أثناء التوليد، أداء مستمر للشخصيات لفترات طويلة، وفيديو تفاعلي يتطلب تعديل المحتوى اللاحق بناءً على تفاعل الجمهور.
هناك قيد يستحق التوضيح. ثلاث خطوات إزالة ضوضاء تعني أن كمية الحساب لكل مقطع قد ضُغطت بشدة، والثمن هو السقف الأعلى لجودة المقطع الواحد. التأثير في العروض الرسمية شيء، ووضعه في تسليم منتج نهائي يتطلب جودة عالية شيء آخر. هذا النموذج أقرب إلى توفير قاعدة مفتوحة المصدر قابلة للاستخدام لاحتياج «التوليد المستمر»، وليس للمنافسة مع أفضل النماذج المغلقة المصدر في جودة الإطار الواحد.
مسار الفيديو مفتوح المصدر المحلي هذا العام
إذا وضعنا TaoMate-H3 في الخط الزمني لهذا العام، نجد مسارًا واضحًا نسبيًا. في بداية العام كان الجميع يتنافسون على عدد المعلمات ونتائج لوحات التصنيف؛ وفي النصف الثاني، تحول التركيز إلى ضغط النماذج داخل سير عمل حقيقي: ذاكرة عرض أقل، إطار أول أسرع، وتكلفة أقل للثانية الواحدة.
أصدر MiniMax H3 نموذجًا أساسيًا مفتوح المصدر، وبنى TaoLive عليه قدرات الصوت والفيديو الانسيابية، ثم أصدرت Alibaba PAI فرع ControlNet-Union يدعم ثمانية شروط تحكم وترميم الفيديو. بمجرد ظهور نموذج، يسرع آخرون لبناء قدرات فوقه. هذا التقسيم للعمل يسير في مجتمع المصادر المفتوحة أسرع من النظام البيئي المغلق، لأن الجميع لا يحتاجون إلى انتظار فتح واجهات من أحد.
بالنسبة لمن يعملون في إنتاج المحتوى، ستصل هذه التغييرات في النهاية إلى نقاط ملموسة جدًا: لإنتاج فيديو يتطلب أداءً متواصلًا، كان عليك سابقًا توليد عشر مقاطع منفصلة ثم دمجها؛ الآن يمكنك الكتابة حسب المقاطع، ويستمر النموذج بنفسه حاملًا السياق. وبعد الانتهاء، إذا كان هناك خطأ في مكان ما، يمكنك تعديل ذلك المقطع فقط.
في الختام
أكثر ما يستحق التسجيل في إصدار TaoMate-H3 هو أنه وضع «انتظار المقطع الأول» على الطاولة. على مدى السنوات الماضية، كان توليد الفيديو يحل مسألة «هل يمكن التوليد؟» و«هل التوليد جيد؟»، والآن بدأ البعض يحسب بجدية «متى يمكن رؤية الإطار الأول؟». الإجابة عن هذا السؤال تحدد ما إذا كانت نماذج الفيديو قادرة على الانتقال من منصة العرض إلى سير عمل يومي.
الأوزان وكود الاستدلال أصبحت مفتوحة، وما ينتظرناه بعد ذلك هو ما إذا كان المجتمع سينمّي أشياء أكثر فوقه، خصوصًا في السيناريوهات التي تتطلب إخراجًا مستمرًا لفترات طويلة ولا تحتمل انتظار تصيير المقطع كاملًا.
مقالات ذات صلة
صور الأقمار الصناعية أصبحت الآن بيانات تدريب للروبوتات
لم يعد عنق الزجاجة في تدريب الذكاء الاصطناعي الفيزيائي القدرة الحاسوبية ولا قدرة النموذج، بل أصبح جودة العالم الاصطناعي.
Gemini 3.5 Live Translate من Google يلغي التوقف
الترجمة التي تعمل باستمرار، بصوت المتحدث نفسه، على هاتف موجود أصلًا في جيبك، تنقل الميزة من شيء تفتحه إلى شيء يعمل فقط.
الصين تضع أول معيار سلامة إلزامي لوكلاء الذكاء الاصطناعي
تنتقل السلامة من ميزة تروّج لها إلى بوابة تعبر منها. وجرد المخاطر يضم 13 فئة و97 بنداً.
المحتوى المولّد بالذكاء الاصطناعي يبدأ في إعلان هويته
هذه الخطوة لا تحل كل المشكلات، لكنها تحوّل «مولّد بالذكاء الاصطناعي» من خيار يمكن إخفاؤه إلى سؤال يجب الإجابة عنه.