هل ما زال بإمكانك التمييز بين صورة ذكاء اصطناعي وصورة حقيقية؟ سباق تسلح الكشف يزداد إزعاجًا

لعبة ويب صغيرة تُدعى «هل يمكنك تمييز الصور المولّدة بالذكاء الاصطناعي؟» تصدّرت الصفحة الرئيسية لـ Hacker News هذا الشهر بـ 112 نقطة و85 تعليقًا. الفكرة بسيطة: تُعرض عليك سلسلة من الصور وتخمّن هل هي حقيقية أم مولّدة. اجتمعت التعليقات على الاعتراف نفسه. أشخاص يعملون بالصور لكسب عيشهم لم يسجّلوا نتائج أفضل بكثير من رمي عملة معدنية.
بعد أيام قليلة، ظهر في نقاش آخر على HN اسم Pangram، وهي شركة ناشئة تبيع أدوات كشف الذكاء الاصطناعي للنصوص والصور معًا، في نقاش من 27 تعليقًا حول ما إذا كان الكشف ممكنًا أصلًا. وبين النقاشين يقع الوضع المقلق للمجال: التمييز بين الصور المولّدة والصور الحقيقية يزداد صعوبة أسرع مما يتحسّن الكشف.
لماذا تستمر عيناك في الخسارة
العلامات التي كانت تنفع سابقًا اختفت أو كادت. أيدٍ مشوّهة، نصوص ذائبة، إضاءة غير متسقة، جلد شمعي: كل إصلاح طُرح في أجيال النماذج المتعاقبة. أما عرض النصوص، الذي كان لوقت طويل دليلًا موثوقًا، فصار مشكلة محلولة في النماذج الرائدة، ولهذا جزئيًا بدأت معايير تقييم الصور توليه وزنًا كبيرًا. ما تبقّى هو فجوة أخفى. الصور المولّدة غالبًا أكثر تماسكًا بقليل، وملامحها أكثر انتظامًا بقليل، وخلفياتها أكثر استجابة بقليل. يلاحظ البشر الإحساس العام ولا يستطيعون وصفه، ولهذا تحديدًا تُحرج لعبة التخمين الجميع.
مسألة لوكي تطرح الفكرة بمستوى مختلف. سأل منشور على r/StableDiffusion كيف ينتج الناس صورًا بالذكاء الاصطناعي تحافظ بدقة على مظهر ممثل معيّن عبر ملابس ومشاهد جديدة. الجواب، من الأشخاص الذين يفعلون ذلك، هو التوليد القائم على المرجع ومحولات مضبوطة بدقة، ولا شيء من ذلك يتطلب أدوات غير مألوفة الآن. ملامح كانت تستغرق بيت مؤثرات بصرية سنوات صارت مشروع أمسية واحدة، ولم يستطع السائل تمييز أي من الصور المتدفقة في خلاصته كانت مخرجات نموذج.
الكشف كمنتج، الكشف كسياسة
عرض Pangram هو أن الكشف قابل للمعالجة عندما تدرّب كواشف بنفس شراسة تدريب المولّدات. دفع نقاش HN ضد ذلك بالاعتراضات المعتادة والصحيحة في معظمها: الكواشف تعمّم بشكل ضعيف على نماذج لم ترها، وتنتج إيجابيات كاذبة تضر المصورين الحقيقيين، وأي كاشف منشور يصبح هدفًا يهزمه إصدار النموذج التالي بصمت. هناك أيضًا نهج الإسناد، أي بيانات اعتماد المحتوى بأسلوب C2PA، الذي يتجنب الكشف بطلب توقيع الكاميرات والمولّدات على مخرجاتها. يساعد عندما يتعاون الجميع. لكنه لا يفعل شيئًا لصورة أعاد أحدهم ترميزها وجرّدها من البيانات.
السياسة تتحرك على أي حال. صارت المطاعم التي تستخدم تصوير طعام بالذكاء الاصطناعي قصة إخبارية ثانوية هذا الشهر عبر مقال في The Wall Street Journal، ولم يكن رد الفعل الغاضب حول الخداع المجرد بقدر ما كان حول الخيانة المحددة: البرغر الذي تطلبه يجب أن يشبه البرغر في الإعلان. هذه آلية كشف اجتماعية، ثقة من مصادر جماعية، وهي أكثر صرامة من أي مصنّف.
ما ناقشته نقاشات HN فعليًا
قسّم نقاشا Hacker News المشكلة ببراعة. كان نقاش اللعبة في معظمه أشخاصًا يبلغون عن نتائجهم ويتبادلون النصائح، والنصائح سجل أحفوري جيد لما كان ينفع سابقًا: انظر إلى الأيدي، افحص النص، دقق في الانعكاسات، عُدّ أصابع المشاة في الخلفية. تكاد كل هذه الفحوص تعطي الآن نتائج سلبية كاذبة على النماذج الحالية. توقف عرض النصوص تحديدًا عن كونه دليلًا موثوقًا بعدما جعلته النماذج الرائدة أولوية في المعايير؛ فمتجر مولّد بلافتة مقروءة كان أمرًا جديدًا قبل عامين وصار سلوكًا افتراضيًا الآن.
كان نقاش Pangram أكثر تشككًا. كانت الاعتراضات في التعليقات هي المعتادة، وهي تصح: الكواشف المدرّبة على مولّدات الأمس تفوت مولّدات الغد، والإيجابيات الكاذبة تقع أشد ما تقع على مصورين حقيقيين يُوسم عملهم بأنه تخليقي، ونشر كاشف دعوة مفتوحة للنموذج التالي كي يُدرّب ضده. جعل تعليق واحد عدم التكافؤ ملموسًا: المولّد يحتاج فقط إلى خداع الكواشف الموجودة، بينما يحتاج الكاشف إلى الإمساك بكل مولّد، بما في ذلك مولّدات لم تُصدر بعد. هذا سباق خاسر بالبناء، ولهذا تُبيع منتجات الكشف التجارية في الغالب لمؤسسات لديها التزامات إشراف لا لأفراد فضوليين بشأن صورة مريبة.
الإسناد، البديل الممل
البديل الذي يتكرر هو بيانات اعتماد المحتوى: بيانات وصفية موقّعة تشفيريًا، بأسلوب C2PA، تُرفق عند الالتقاط أو التوليد. توقّع الكاميرات ما رآه المستشعر. وتوقّع المولّدات ما صنعه النموذج. وتحفظ أدوات التحرير السلسلة أو تضيف إليها. لا شيء في ذلك يتطلب كشف أي شيء، وهذه ميزته الأساسية، لأن الكشف سباق تسلح دائم بينما التوقيع معيار بنيوي.
نقاط الضعف بنيوية بالقدر نفسه. التوقيع طوعي، والبيانات الوصفية تُجرّد عبر لقطات الشاشة وإعادات الترميز، والسلسلة تثبت فقط من أين جاءت الصورة، لا ما إذا كان الأصل صادقًا. الصورة المولّدة بالذكاء الاصطناعي الموقّعة تبقى صورة مولّدة بالذكاء الاصطناعي. لكن مع بدء المنصات بإظهار بيانات الاعتماد، يصبح وجود سلسلة نظيفة إشارة ثقة كما صار HTTPS كذلك، ويبدأ غيابها يُقرأ كسؤال لا تستطيع الصورة الإجابة عنه.
الطبقة الاجتماعية أكثر صرامة من الطبقة التقنية
بين الكشف والإسناد تقع الآلية التي أدت العمل فعليًا هذا الشهر: الجماهير. انتشرت قصة المطعم لأن العملاء لاحظوا الفجوة بين الطعام المصوّر والطعام المقدّم، لا لأن مصنّفًا أشار إليها. صارت صور الأحفاد المولّدة بأسلوب «البومر» قصة لأن الآباء في دردشة المجموعة قالوا لا. دفعت صور لوكي منتدى فرعيًا إلى السؤال كيف صُنعت، وحصلوا على جواب خلال يوم. تكتشف المجتمعات بما لا تستطيع الكواشف اكتشافه، عبر معرفة السياق.
ماذا يعني هذا لمن ينشرون الصور
إذا كنت تنشر الصور أو تكلّف بإنتاجها، فثلاث عادات تتبع من الوضع الحالي. أولًا، صار وسم المحتوى المولّد أصلًا من أصول الثقة لا اعترافًا. المبدعون الذين يفصحون، وهناك انقسام واضح في نقاشات r/StableDiffusion حول كيفية التعامل مع التعليقات المعادية للذكاء الاصطناعي، يبنون جماهير تبقى عندما يحدث الإفصاح مسبقًا. ثانيًا، البيانات الوصفية للإسناد رخيصة الحفظ وحاسمة أحيانًا؛ بدأت المنصات بإظهارها، وكلفة الحفاظ عليها مجرد مفتاح في الإعدادات. ثالثًا، بالنسبة لأي شيء تجعل فيه الصورة ادعاءً واقعيًا (أخبار، منتجات، أدلة)، افترض أن جمهورك لديه كاشف باحتمال رمي عملة وأداة لقطات شاشة. الدفاع الوحيد المستدام هو الصدق بشأن ما تمثله الصورة.

اللعبة التي أحرجت الجميع تستحق اللعب على أي حال. عشر دقائق أمام مجموعة مخلوطة من الصور الحقيقية والمولّدة تعيد معايرة ثقتك في اتجاه مفيد. الصور التي تفشل فيها لم تكن إخفاقات في الانتباه. إنها خط الأساس الجديد، وخط الأساس يتحرك كل شهر.