← العودة إلى المدونة
Aiحوالي 1 دقيقة قراءة

قسّم Vidu Q3 التوليد من الفيديو المرجعي إلى ثلاثة منتجات. هذا قرار تغليف بقدر ما هو قرار نموذج.

نُشر في 5 أكتوبر 2026
قسّم Vidu Q3 التوليد من الفيديو المرجعي إلى ثلاثة منتجات. هذا قرار تغليف بقدر ما هو قرار نموذج.

معظم إصدارات نماذج الفيديو تُعلَن مرة واحدة ثم تظهر في كل مكان تحت اسم واحد. فعلت Vidu العكس مع مجموعة Q3 الخاصة بالتوليد من الفيديو المرجعي.

في 14 سبتمبر، أدرجت Model Studio من Alibaba Cloud ثلاثة نماذج Vidu Q3 منفصلة للتوليد من الفيديو المرجعي. الأول، viduq3-mix، نموذج عام يأخذ صورًا مرجعية ونصًا توجيهيًا ويمزج العناصر من تلك الصور في المشهد الموصوف. الثاني، viduq3-ad، مصمم للإعلانات، مع قطع مشاهد بمستوى تسويقي، وحركة كاميرا، وإخراج صوتي مباشر؛ ترفع صور المنتج وتحصل على فيديو إعلاني. الثالث، viduq3-drama، يستهدف الدراما وإنتاج المانغا بالذكاء الاصطناعي، مع اتساق الشخصية، وتأثيرات الحركة، والتعبير العاطفي المضبوط للمحتوى القائم على القصة.

تعمل الثلاثة جميعًا بتكلفة 0.14 دولار في الثانية لدقة 720p أو 1080p، مع حد معدل يبلغ 5 طلبات في الثانية. التسعير متطابق بين الثلاثة، ما يخبرك أن التمايز ليس في التكلفة بل في سلوك الإخراج.

المشكلة التي شرعت Vidu فعليًا في حلها

تأتي Vidu من شركة Shengshu Technology في بكين. أُطلق نموذج Q3 الخاص بها في 30 يناير 2026، وحل فورًا في دائرة المقارنات المعيارية. صنّفته Artificial Analysis أولًا في الصين وثانيًا عالميًا عند الإطلاق، متقدمًا على Runway Gen-4.5 وGoogle Veo 3.1 وSora 2 من OpenAI، بدرجة 1241.

تستحق التحولات التقنية الثلاثة خلف هذا التصنيف التسمية. كان Q3 من أوائل نماذج الفيديو الطويلة التي تنتج حوارًا متزامنًا ومؤثرات صوتية وموسيقى خلفية في نفس تمريرة العناصر البصرية، بدلًا من إضافة الصوت لاحقًا في مرحلة المونتاج. مدّد المقاطع المشغّلة مرة واحدة إلى 16 ثانية، وهو الأطول بين النماذج الرئيسية آنذاك. وبنى نظام توليد من الفيديو المرجعي حيث يرفع المستخدمون من ثلاث إلى سبع صور لشخصية أو كائن أو أسلوب، ويستخدمها النموذج كمراسٍ بصرية في عمليات التوليد اللاحقة.

نظام المرجع هو المثير للاهتمام. تتنافس معظم نماذج الفيديو في 2026 على المحور نفسه: اجعل مقطعًا واحدًا يبدو مبهرًا. كان رهان Vidu مختلفًا. لم تكن الرسالة الترويجية قط «انظر إلى هذه اللقطة الرائعة الواحدة». بل كانت «انظر إلى هذه الشخصية نفسها عبر عشر لقطات ولاحظ أنها ما زالت تبدو كالشخص نفسه».

تلك مشكلة أصعب، وهي التي يعتمد عليها محتوى السلاسل فعليًا. في مقارنة ضد Runway Gen-4 وKling 3.0 وLuma Ray وPika 2.0 وSora 2 باستخدام الأمر نفسه للشخصية عبر ست تنويعات مشهدية، حافظ Vidu Q3 على اتساق الوجه والملابس في خمس من الاختبارات الستة.

الاتساق هو ما يفصل أداة للمقاطع لمرة واحدة عن أداة للسلاسل. بالنسبة لمنشئي الأنمي، ومنتجي الدراما القصيرة، وأي شخص يبني محتوى علامة تجارية حول شخصية متكررة، فإنه يغيّر ما هو ممكن.

لماذا تهمّ وحدات SKU الثلاث

تقسيم عائلة نموذج واحدة إلى ثلاثة منتجات مسمّاة يبدو خيارًا تسويقيًا. لكنه أقرب إلى قرار مشتريات.

ثلاث أسطوانات داكنة بسيطة مصفوفة في صف على سطح عاكس مع دخان متصاعد

فريق الإعلانات واستوديو الدراما القصيرة لا يشتريان الشيء نفسه، حتى لو كان المحوّل الأساسي مشابهًا. يحتاج المشتري الإعلاني إلى أمانة المنتج، وانتقالات مشاهد نظيفة، وصوت يمكن أن يستقر تحت صوت العلامة التجارية. ويحتاج مشتري الدراما إلى شخصية تحافظ على هويتها عبر الحلقات واللقطات، بتعبيرات تُقرأ كأداء تمثيلي. تغليف ذلك كمعرّفات نماذج منفصلة مع توثيق منفصل يتيح لكل مشترٍ التقييم والموازنة لوظيفة واحدة بالضبط، بدل قراءة قائمة ميزات عامة وتخمين النتيجة.

ثم يخدم نموذج mix العام كل من هم خارج الصندوقين، وهو هيكل معقول لسوق أصبح فيه المشتري أكثر فأكثر فريق إنتاج لديه موعد نهائي بدلًا من هاوٍ يختبر الأوامر النصية.

Vidu Claw وطبقة خط الإنتاج

تغليف النماذج هو نصف الاستراتيجية. النصف الآخر هو طبقة تجميع. Vidu Claw هو محرك أتمتة لإنشاء المحتوى بالذكاء الاصطناعي مبني على إطار OpenClaw مفتوح المصدر ومدعوم بـ Q3. تربط رموز Vidu الخاصة بك، وتعرّف Skills، وتؤتمت المسار من الفكرة إلى فيديو منتهٍ. يكفي أمر واحد مثل «أنشئ إعلانًا قصيرًا لحذاء جري يستهدف الشابات على إنستغرام» ليقوم Vidu Claw بتوليد فكرة، ونص، ولوحة قصصية، ومواد بصرية، وتعليق صوتي، وموسيقى، ونسخة نهائية.

كانت المراجعات المستقلة متباينة بطريقة مفيدة. وجد أحد المراجعين، أثناء اختباره على إعلان منتج، أن المنصة مجانية حقًا وسهلة الوصول للطلاب والمبتدئين، لكنه أفاد بأنها واجهت صعوبة مع التفاصيل البنيوية الدقيقة. في إحدى الحالات، ظلّت تعرض تفصيلًا بشكل لافت حتى بعد تصحيحات متكررة للأمر النصي، وحمل الإخراج طابعًا واضحًا للذكاء الاصطناعي، مع إضاءة وألوان بدت رخيصة.

هذه هي المقايضة الصادقة. Vidu Claw أداة إنتاجية للمنشئين الفرديين وفرق التسويق الصغيرة التي تحتاج إلى الانتقال من الفكرة إلى مسودة قابلة للاستخدام بسرعة، وليس بديلًا عن فريق إنتاج احترافي. عندما ينجح، يضغط دورة إنتاج إعلاني مدتها خمسة أيام إلى يوم واحد. وعندما لا ينجح، تصعب تجاهل مشكلات الجودة.

المنظومة التي تبنيها Vidu

يرتبط التركيز على التوليد من الفيديو المرجعي بقصة توزيع. في فبراير 2026، أعلنت شركة البرمجيات Wondershare استثمارًا استراتيجيًا في Shengshu، مع خطط للعمل معًا على المانغا بالذكاء الاصطناعي. دُمج نموذج Vidu Q3 في منصة إنتاج مانغا بالذكاء الاصطناعي متكاملة السلسلة تُستخدم للحفاظ على اتساق الشخصيات والأصوات والمشاهد عبر الحلقات. كما أضافت منصة Bailian من Alibaba Cloud نموذج Vidu Q3 كنموذج طرف ثالث في مايو 2026.

لذا ينتقل النموذج عبر ثلاث قنوات على الأقل: الوصول المباشر عبر الويب وAPI، ومنصة إنشاء موجهة للمانغا والدراما القصيرة، وسوق نماذج سحابية. لكل قناة مشترٍ مختلف بتعريف مختلف لـ «جيد بما يكفي».

أين توجد الأموال فعليًا

التحول نحو محتوى السلاسل ليس تفضيلًا إبداعيًا. إنه حيث توجد الميزانيات. الدراما القصيرة منتج متعدد الحلقات بطاقم متكرر، واقتصادياتها تعتمد على إنتاج لقطات أكثر بكثير من إعلان واحد أو مقطع لمرة واحدة. وإذا أرجع نموذج المنشئ إلى الصفر في مظهر الشخصية لكل لقطة، فإن التوفير من اللقطات المولّدة تأكله إصلاحات الاتساق. رهان Vidu هو أن الفريق المستعد لدفع 0.14 دولار في الثانية لا يشتري لقطة جميلة واحدة، بل طريقة لإبقاء الشخص نفسه قابلًا للتعرف عليه طوال عمل كامل.

ولهذا أيضًا يهم نظام المرجع أكثر من درجة الجودة الخام. نموذج يحتل المرتبة الثانية عالميًا في مقارنة معيارية مثير للإعجاب، لكن المقارنة المعيارية تقيس المقاطع. ميزة المرجع تقيس السلاسل. الاثنان ليسا نفس عملية الشراء، وVidu تبيع للثانية.

أين لا يفي بالوعود بعد

اتساق المرجع ليس مثاليًا، وخمس من ست ليست ست من ست. حيث فشلت الحالة السادسة، قدّم النموذج وجهًا وملابس انحرفا عن المصدر، وهو بالضبط الفشل الذي يكسر سلسلة. التكلفة حقيقية عند 0.14 دولار في الثانية، وهي تتراكم سريعًا عبر مقطع مدته 16 ثانية وتصبح كبيرة على نطاق السلاسل، حيث تكون مئات اللقطات قيد الاستخدام. تنتج طبقة خط الإنتاج مسودات وليس إعلانات منتهية، وقد وجد المراجعون أنها لا تستطيع إصلاح تفصيل بنيوي بشكل موثوق حتى مع تصحيحات متكررة للأمر النصي.

هناك أيضًا حد بنيوي يستحق الذكر. يرسّخ التوليد من الفيديو المرجعي الهوية، لكنه لا يحل بعد الاستمرارية لعمل إنتاجي كامل. لا يزال على أحدهم اتخاذ الخيارات الإخراجية التي تحوّل مجموعة مقاطع متسقة إلى قصة، وليس للنموذج رأي في الإيقاع أو التغطية أو ما إذا كان ينبغي أن يوجد مشهد أصلًا.

ما يجب متابعته

هيكل وحدات SKU الثلاث هو الجزء الذي يُرجَّح أن يقلده موردون آخرون. إذا أصبح التوليد من الفيديو المرجعي الطريقة الافتراضية لصنع محتوى السلاسل، فتوقّع أن تطلق عائلات نماذج أكثر متغيرات مخصصة للمهمة بدلًا من نموذج رائد واحد. الأسئلة التي تهم لاحقًا هي ما إذا كان الاتساق يصمد عند مدد أطول وعمل كاميرا أصعب، وما إذا كانت طبقة خط الإنتاج تصبح جيدة بما يكفي لبيعها لاستوديو بدلًا من منشئ فردي.

مقالات ذات صلة