← العودة إلى المدونة
Communityحوالي 1 دقيقة قراءة

لماذا تبدو كل وجوه الذكاء الاصطناعي متشابهة، ولماذا بدأ المشاهدون يكرهون ذلك

نُشر في 1 أكتوبر 2026
لماذا تبدو كل وجوه الذكاء الاصطناعي متشابهة، ولماذا بدأ المشاهدون يكرهون ذلك

هناك لحظة تتكرر في طفرة الدراما بالذكاء الاصطناعي. يتصفح مشاهد، يشاهد مقطعًا، يعجبه، ثم يلاحظ أن بطل هذا العمل له الوجه نفسه الذي للبطل في العمل السابق، والذي قبله. شكل الوجه نفسه، الشعر نفسه، والغرة نفسها المفرودة من المنتصف. انتشرت لقطات المقارنة على نطاق واسع، ولرد الفعل اسم في العامية الصينية على الإنترنت: اشمئزاز فسيولوجي.

سبب تقارب كل وجه من وجوه الذكاء الاصطناعي نحو الوجه نفسه ليس لغزًا. إنها الإحصاءات. على نموذج الفيديو أن يحافظ على اتساق الوجه من إطار إلى إطار، والوجه المتماثل الخالي من العيوب والملامح المميزة لديه أعلى قدرة على تحمل الأخطاء الدقيقة التي تسبب الوميض بين الإطارات. السمات الفردية، أنف معوجّ، شامة، عينان غير متماثلتين، هي بالضبط الأشياء التي تنكسر عندما يعيد النموذج تصيير الوجه نفسه ثلاثين مرة في الثانية. لذا يمد النموذج يده إلى الوجه «الآمن»، الوجه الذي يمثل متوسط كل الوجوه التي تدرب عليها. ما يخرج هو ما سماه أحد الباحثين حلًا إحصائيًا «أمثل-متوسطًا».

الاقتصاد يدفع في الاتجاه نفسه. يُحاسب على الفيديو التوليدي بالثانية، وتخصيص وجه فردي يعني التكرار على الأوامر النصية، وتثبيت السمات، ومعايرة التعبيرات الدقيقة إطارًا بإطار، ما يضاعف الوقت. معظم الفرق التي تسعى إلى جدول رفع يومي تتخطى كل ذلك وتعيد استخدام قالب ناجح مع مكتبة وجوه عامة. بل هناك سوق رمادية لذلك: حزمة تضم عشرين ألف مقطع درامي يُزعم أنه منتهك للحقوق لأغراض التدريب تُباع بأقل من دولار. عندما تُستمد بيانات التدريب نفسها من المصادر القليلة نفسها، لا يسع الوجوه التي تنتجها إلا أن تبدو متشابهة.

النتيجة هي فئة محتوى تكون فيها الوجوه مثالية وقابلة للتبادل. صاغ أستاذ صحافة في جامعة تسينغهوا المشكلة بعبارات راسخة: يمكن للخوارزمية أن تحسب درجة جمال، لكنها لا تستطيع أن تحسب عمق الشخصية الإنسانية. النقص هو المقصد. النمش، لا تماثل طفيف، الطريقة التي تتجعد بها العين عندما يبتسم شخص حقًا، الطريقة التي يرتخي بها الحاجب عندما يكون متعبًا. تلك هي الأشياء التي تتيح لك التمييز بين شخص وآخر، وهي بالضبط ما يزيله نموذج مُحسَّن من أجل النعومة.

شبكة متكررة من وجوه بورتريه شبه متطابقة مولّدة بالذكاء الاصطناعي

هناك حجة تطورية كامنة هنا أيضًا. البشر مهيأون لقراءة الوجوه لتحديد الهوية والمشاعر، ونعتمد على الفروق الصغيرة للتمييز بين الناس. الوجه المعياري بلا علامات مميزة يطلق الإنذار نفسه الذي يطلقه وادي الغرابة: إنه قريب من البشر بما يكفي ليُسجَّل كوجه، لكنه مختلف بما يكفي لتبدو غرابته. الاشمئزاز ليس تعاليًا. إنه استجابة إدراكية لشيء يبدو شبه إنساني لكنه ليس كذلك تمامًا.

الديناميكية نفسها تتجلى في كيفية تعامل النموذج مع الهوية نفسها. «الممثل» بالذكاء الاصطناعي هو ملاءمة إحصائية لتوزيع من التعبيرات، وليس شخصًا لديه جهاز عصبي لاإرادي. الوجوه الحقيقية تتحرك بسبب الفسيولوجيا والموقف؛ حاجب شخص متعب يرتخي بطريقة معينة، وشخص مستمتع حقًا تتجعد عيناه. يمكن للنموذج أن يقارب هذه الأشياء، لكنه لا يستطيع أن يبتكرها، ويظهر الفرق كتسطيح خفي يسجله المشاهدون حتى عندما لا يستطيعون تسميته. إنه الفرق بين أداء وتصيير.

هناك نقطة بيانات ملموسة تُظهر إلى أي مدى وصل التجانس. تصف تقارير حزم مواد تدريب تحتوي على عشرات الآلاف من مقاطع الدراما القصيرة، يُزعم أنها جُمعت دون إذن، وتُباع بأقل من دولار. عندما تكون بيانات التدريب بهذا الضيق وتُعاد استخدامها بهذا الانتشار، لا يسع الوجوه التي تنتجها إلا أن تتقارب. التشابه ليس حادثًا في الذوق. إنه نتيجة لاحقة لسلسلة توريد مُحسَّنة من أجل حجم رخيص.

هذا ليس مجرد شكوى جمالية. إنه يصبح شكوى تجارية. عندما يبدو كل عرض كأنه العرض نفسه، لا شيء يستحق التذكر، وفئة تعيش على الجِدة تموت بالتشابه. الجهة التنظيمية الصينية تصوغ بالفعل معيار جودة يجعل تميز الشخصيات بندًا تقييميًا خاصًا به، وهو إشارة واضحة إلى أين تتوقع الصناعة أن تكون الموجة التالية من المنافسة. فئة لا تستطيع التمييز بين شخصياتها هي فئة لم تكتشف بعد لماذا يجب أن يستمر أي شخص في المشاهدة.

هناك نقطة أعمق تحت كل هذا تنطبق إلى أبعد من الدراما القصيرة. يميل الذكاء الاصطناعي التوليدي نحو المتوسط لأن المتوسط هو الرهان الأكثر أمانًا، والرهان الأكثر أمانًا هو ما يُدرَّب نموذج الاحتمالات على صنعه. يميل الإبداع البشري نحو المحدد لأن الخيار المحدد هو الشيء الوحيد الذي يبرز. الصراع بين الاثنين يجري الآن في الوقت الفعلي، على نطاق هائل، في زاوية من الإنترنت لا يراقبها معظم المراقبين الغربيين.

سبب أهمية هذا خارج نطاق الجماليات هو أنه يستبق سؤالًا ثقافيًا أكبر. إذا تقارب كل المحتوى الأرخص والأسهل نحو المظهر نفسه، والوجه نفسه، والصوت نفسه، فإن الإنترنت يصبح قاعة مرايا تعكس متوسطًا إحصائيًا واحدًا على نفسها. الأشخاص الذين يحاربون هذا التقارب، الذين يصرون على أنف معوجّ، ولهجة، وتوقف غير مخطط له، ليسوا حنينيين إلى الماضي. إنهم يدافعون عن الشيء الذي يجعل الثقافة تستحق الوجود أصلًا.

التوازي مع مشكلة المحتوى الرديء المولّد بالذكاء الاصطناعي الأوسع دقيق. تبلغ Deezer عن رفع 75,000 أغنية بالذكاء الاصطناعي يوميًا. وجد تدقيق في الصحف الأمريكية أن 9 في المائة من المقالات الجديدة موسومة بأنها مولّدة بالذكاء الاصطناعي. الخيط المشترك هو أن الأدوات التوليدية، عند تشغيلها دون قصد تحريري، تنتج سيلًا من مخرجات كفؤة لكن قابلة للتبادل. وجه الذكاء الاصطناعي ليس سوى المثال الأكثر إزعاجًا بصريًا لظاهرة تعيد تشكيل الموسيقى والنصوص والصور في الوقت نفسه.

الحل ليس جعل النماذج أقل نعومة. بل التوقف عن التعامل مع الإعداد الافتراضي للنموذج كمنتج نهائي. يجب تصميم تميز الشخصيات عن قصد، بالطريقة نفسها التي يصمم بها مدير التمثيل طاقم الممثلين. الأدوات تدعم ذلك بالفعل، الصور المرجعية، والإطارات المفتاحية، والسمات المثبتة. ما ينقص هو الإرادة لإنفاق الوقت الإضافي، لأن اقتصاد الطفرة يكافئ السرعة. المبدعون الذين يقاومون الوجه المتوسط هم من سيظل لديهم جمهور عندما تخبو الجِدة. هذا هو الرهان، وهو الرهان نفسه الذي تفرضه كل وسيلة ناضجة على مبدعيها: كن محددًا، أو تلاشَ في المتوسط.

هناك سبب للاعتقاد بأن الضغط يتحول بالفعل. المنصات التي غذّت الطفرة بمكافأة الحجم بدأت الآن تكافئ التميز، لأن خلاصة مليئة بوجوه قابلة للتبادل تمثل مشكلة احتفاظ. معيار الجودة رافعة واحدة؛ والخوارزمية رافعة أخرى. بمجرد أن تتوقف المنصة عن مكافأة التشابه، ينقلب الاقتصاد، وتصبح الفرق التي بنت عضلة تصميم الشخصيات هي المؤهلة للفوز. وجه الذكاء الاصطناعي لن يختفي. ما يختفي هو فكرة أنك تستطيع الفوز بالإعداد الافتراضي، وهذا تطور صحي لكل من يريد فعلًا صنع شيء يستحق المشاهدة.

مقالات ذات صلة

من مقاطع خمس عشرة ثانية إلى أفلام خمس دقائق: المنشئ الفردي يتحول إلى استوديو

تحوّلت الرسالة الترويجية من مقطع أجمل إلى عمل مكتمل. قد لا يكون السوق الحقيقي لفيديو الذكاء الاصطناعي هو الدراما القصيرة إطلاقًا، بل فيديوهات التجارة الإلكترونية ذات العائد القابل للقياس.

اقتصاد المحتوى الرديء بالذكاء الاصطناعي: 75,000 أغنية يوميًا وعصر المحتوى المتوسط تمامًا

جعل الذكاء الاصطناعي الإنتاج شبه مجاني، فامتلأ الإنترنت بمحتوى مقبول لكن منسي. والمورد النادر الآن هو سبب لوجود المحتوى.

ازدهار الدراما بالذكاء الاصطناعي في الصين: 430,000 دراما قصيرة في ثمانية أشهر، 90% منها من صنع الآلات

فئة لم تكن موجودة تقريبًا قبل عامين أصبحت الآن خط إنتاج صناعي. انتقل فيديو الذكاء الاصطناعي من العروض التوضيحية إلى عمل تجاري يحقق الدخل، وقد حدث ذلك أولًا في الصين.

من «slop» في الذكاء الاصطناعي إلى الشفافية الأصلية: عام من توليد الصور، في أربع تحولات

نضج توليد الصور هذا العام. الانتقال من الصور المكتملة إلى الأصول القابلة للتركيب هو الإنجاز الذي فاته معظم الناس.