← العودة إلى المدونة
Newsحوالي 1 دقيقة قراءة

HeyGen Video 1 مقابل Tavus Griffin: كم تساوي ثانية من إنسان مُولَّد؟

نُشر في 2 أكتوبر 2026
HeyGen Video 1 مقابل Tavus Griffin: كم تساوي ثانية من إنسان مُولَّد؟

أُطلِق منتجان خلال ست وثلاثين ساعة من بعضهما البعض في أواخر سبتمبر، في الزاوية ذاتها من السوق. كلاهما يولّد إنسانًا مقنعًا على الشاشة. الشيء الأكثر فائدة في هذه المقارنة الثنائية ليس أن المشتري سيختار بينهما، لأنه عند الإطلاق كان واحد فقط منهما متاحًا للشراء. بل إن الفرق بينهما يوضّح ما صُمّم كل واحد منهما لفعله، وما قيمة ثانية من إنسان اصطناعي في كل حالة.

دخل HeyGen Video الخدمة في 30 سبتمبر، بسعر سنت واحد لكل ثانية حتى أكتوبر. وأُعلن عن Tavus Griffin في 1 أكتوبر مع دراسة مباشرة وجهاً لوجه اعتقد فيها 26 من أصل 54 مشاركًا أن شريك محادثتهم شخص حقيقي. لا يتوفر Griffin إلا لمختبرين موثوقين مختارين عبر نموذج طلب، بلا معرّف عام ولا نقطة اتصال ولا سعر.

أحدهما يبيع مقطعًا، والآخر يبيع محادثة

HeyGen Video هو نموذج فيديو عام الغرض، لكنه جيد بشكل غير معتاد في البشر. يأخذ أمرًا نصيًا، أو أمرًا مع صورة، أو أمرًا مع ما يصل إلى تسع صور مرجعية وثلاثة فيديوهات مرجعية وثلاثة مقاطع صوتية مرجعية. ويعيد مقطعًا يتراوح طوله بين خمس و15 ثانية بدقة 480p أو 768p، بمعدل 24 إطارًا في الثانية، مع صوت AAC يحمل حوارًا وصوتًا محيطيًا ومؤثرات مولّدة. وتغطي ثلاثة أوضاع التهيئة: النص إلى فيديو، والصورة إلى فيديو، والمرجع إلى فيديو، وهو الوضع الافتراضي. الحقول غير المعروفة في الطلب تُرفض بدلًا من تجاهلها، وتوجد بذرة (seed) لجعل اللقطة قابلة للتكرار بينما تغيّر بندًا واحدًا في كل مرة.

هذه أداة إنتاج ذات نطاق حتمي. تعرف ما طلبته، وتعرف ما عاد إليك، ويمكنك إعادة إنتاجه.

يقلب Griffin تقريبًا كل هذه الخصائص. فهو يولّد بدقة 720p في أجزاء مدتها 320 ميلي ثانية بمعدل 25 إطارًا في الثانية من صورة مرجعية واحدة، ويعرض كل جزء أثناء فك ترميزه. لا يوجد طول مقطع يجب تحديده ولا ملف يُعاد إليك. محرك نمذجة محادثة مستمر يلتهم الصوت والفيديو ويعيد تقييم التبادل على فترات أقل من ثانية، ليقرر ما إذا كان يصمت أو يشير أو يشارك بإيماءة أو يأخذ الدور. تدفع عناصر التحكم التعبيرية فيه مولّد كلام تدفقيًا ومولّد فيديو تدفقيًا بالتوازي، بحيث يظهر قرار يُتخذ في منتصف الجملة في الصوت والوجه خلال الدورة المصغرة نفسها.

أنت لا تكتب أمرًا نصيًا. بل تتحدث إليه، فيستجيب لوقفة أو نظرة بعيدًا أو مقاطعة. لهذا السبب ليس الاثنان بديلين لبعضهما رغم أن كليهما يولّد إنسانًا. يُسأل HeyGen Video عن شكل لحظة موصوفة. ويُسأل Griffin عما ينبغي أن يحدث بعد ذلك.

التسعير، ولماذا هو الخبر الرئيسي

سعر إطلاق HeyGen هو سنت واحد لكل ثانية، وتصفه الشركة بخصم 50 بالمئة عن السعر القياسي البالغ سنتين. ويضع مخطط التكلفة في الصفحة نفسها، مع حاشية تشير إلى سعر القائمة لكل ثانية بدقة 768p مع صوت قبل عروض الإطلاق، السعر عند ثلاثة سنتات. هذه فجوة خمسين بالمئة بين النص والمخطط في مواد البائع نفسه. وإلى أن تنشر HeyGen صفحة تسعير API، فالقراءة الآمنة هي أن رقم السنت الواحد مؤكد لأنه مطبّق فعليًا، وأن رقم ما بعد أكتوبر يقع في مكان ما بين سنتين وثلاث سنتات.

احسب الأرقام لألف ثانية، أي مئة مقطع من عشر ثوانٍ، وهي الوحدة التي يفكر بها فريق الكميات الكبيرة فعليًا. يبلغ سعر HeyGen Video في أكتوبر عشرة دولارات. وبعد أكتوبر يصبح عشرين دولارًا بسنتين، أو ثلاثين دولارًا بسعر المخطط البالغ ثلاث سنتات. يبلغ سعر MiniMax H3، النموذج الأساسي الذي ضُبط منه، ثمانية سنتات لكل ثانية، لذا فإن الألف ثانية نفسها ستكلف ثمانين دولارًا. ويصل Kling 3.0 Pro إلى 168 دولارًا، وVeo 3.1 إلى 400.

سبب كون هذه الحسابات هي الخبر الرئيسي هو معدل الاستبعاد. في توليد الفيديو، نادرًا ما يكون المقطع الذي تحتفظ به هو المقطع الذي ولّدته أولًا. تولّد الفرق عدة محاولات وتتخلص من معظمها. النموذج الرخيص لكل ثانية لكنه يتطلب ست محاولات يكلف أكثر من نموذج أغلى ينجح من المحاولة الأولى أو الثانية. وتراهن HeyGen فعليًا على أن التكرار، بسعر سنت واحد للثانية، يتوقف عن كونه الجزء المكلف.

الرقم الذي يجب أن يأتي مع تحفّظ

الرقم الرئيسي لدى Tavus هو 26 من أصل 54 مشاركًا اعتقدوا أن شريكهم بشري. هذه نتيجة حقيقية من دراسة محكومة، وهي أيضًا من نوع الأرقام التي يسهل المبالغة في تفسيرها. ظروف الدراسة ليست ظروف النشر الفعلي. المشاركون في تجربة وجهاً لوجه مهيؤون لخوض محادثة، لا لتدقيقها. معدل نجاح 48 بالمئة في الظهور كإنسان، عندما يُعرض في بيئة مواتية، يخبرك أن التقنية تتقدم دون أن يخبرك كيف ستتصرف عندما يحاول شخص ما كشفها، أو عندما تمتد المحادثة عشرين دقيقة بدلًا من بضع دقائق.

ما يجعل Griffin مثيرًا للاهتمام هو نموذج التفاعل، لا معدل الخداع. الإنسان الرقمي الذي يقرر في الوقت الفعلي ما إذا كان سيتكلم، ويعكس قرارًا في منتصف الجملة على وجهه خلال النبضة نفسها، هو فئة مختلفة من المنتجات عن مولّد الفيديو. إنه أقرب إلى أفاتار في الوقت الفعلي لمركز اتصال أو معلّم خاص أو تطبيق رفيق. وهذه أسواق تكمن القيمة فيها في الحلقة التفاعلية، لا في المقطع.

كون Griffin غير متاح للشراء ليس تحفظًا صغيرًا أيضًا. توجد برامج المختبرين الموثوقين تحديدًا لأن المنتج ليس مستقرًا أو قابلًا للتنبؤ بما يكفي لبيعه. هذه مرحلة معقولة للوجود فيها، وهي تعني أيضًا أن أي مقارنة مع HeyGen Video اليوم هي مقارنة بين منتج يُشحن ووعد.

ما الغرض الفعلي من كل منهما

ضع الاثنين جنبًا إلى جنب، ينقسم السوق بوضوح.

إذا كنت تحتاج إلى مكتبة من المقاطع الجاهزة، سواء إعلانات أو فيديو اجتماعي أو شذرات تسويقية مترجمة محليًا، فإن HeyGen Video هو الأداة الموجودة اليوم، بسعر يمكنك وضعه في جدول بيانات ونطاق حتمي يمكنك بناء سلسلة إنتاج حوله.

إذا كنت تحتاج إلى شيء يتصرف كشخص في مكالمة مباشرة، يستجيب بدلًا من أن يصيّر، فإن Griffin هو المؤشر في ذلك الاتجاه، لكنه ليس بعد منتجًا يمكنك دمجه.

النقطة الأكبر تتعلق بالوجهة التي يتجه إليها الفيديو الاصطناعي. فعلى مدى عامين، كانت المعايير تدور حول الواقعية في إطار واحد. أما الحدود الجديدة فهي تتعلق بالسلوك عبر الزمن: كيف يستجيب الشخص المولّد، ويتذكر، ويبقى متسقًا خلال تفاعل. تتنافس HeyGen على التكلفة والموثوقية في سير العمل القائم على «صيّره واحتفظ به». وتتنافس Tavus على ما إذا كان التفاعل يشعرك بأنه تفاعل أصلًا. ويمكن لكلتيهما أن تفوزا، لأنهما لا تبيعان الثانية نفسها.

مقالات ذات صلة