أحدهم فهرست 13,000 طريقة تفضح بها كتابة الذكاء الاصطناعي نفسها

أنجزت دراسة من شركة تحليل الكتابة Graphite شيئًا مفيدًا لكل من يقرأ الكثير من النصوص النثرية المولّدة آليًا: توقفت عن التخمين وبدأت العدّ.
أخذ الفريق 10,000 مقال نُشرت قبل وجود ChatGPT، وطلب من نماذج الذكاء الاصطناعي إعادة كتابتها، ثم قارن الكومتين. ما خرج من ذلك قائمة بنحو 13,000 عبارة تظهر بوتيرة أكبر مرتين على الأقل في النسخ المولّدة بالذكاء الاصطناعي مقارنة بالأصلية البشرية. ليست جملًا كاملة. بل عبارات. تحولات لغوية صغيرة معتادة يميل إليها النموذج عندما يملأ الفراغ.
العلامات الدالة انتقلت، ولم تختفِ
الجزء الواضح من هذا الاكتشاف هو الفهرس نفسه. أما الجزء الأكثر إثارة للاهتمام فهو ما حدث أثناء تجميعه.
قال غريغ دروك، مسؤول الذكاء الاصطناعي الرئيسي في Graphite، إن خط الاتجاه يسير في اتجاهين في آن واحد. العلامات الأقدم والأكثر وضوحًا، مثل الشرطات الطويلة (em-dashes)، جرى تدريب النماذج على تقليلها، لأن المطورين لاحظوها وسعوا إلى التخلص منها. لكن عندما تُنعَّم مجموعة من العادات اللغوية وتُزال، تنمو مجموعة أخرى لتملأ الفراغ. لم يصبح الفهرس أقصر مع الوقت. بل أصبح أقل ألفة.
هذا هو الجوهر المقلق للأمر. لا يزال الناس يتعاملون مع كشف الذكاء الاصطناعي كمسألة محسومة في أحد الاتجاهين. إما أن تعمل أدوات الكشف وتتمكن من رصد النموذج فورًا، أو أنها معطلة بلا فائدة. الواقع أشبه بالتآكل. يُفرَك السطح، ويبقى النسيج الكامن.
مختبران، واتجاهان
أكثر سطر مقتبس من الدراسة هو انقسام بين الشركات. لاحظ دروك أن نماذج Claude من Anthropic أصبحت تقترب عبر الأجيال من توزيعات الكلمات البشرية المعيارية. أما نماذج GPT من OpenAI، وبالمقياس نفسه، فقد ظلت تبتعد أكثر.
خذ ذلك بالحذر الذي يستحقه. هذا مقياس شركة واحدة، على مجموعة مقارنة خاصة بها، ويقيس تعريفها الخاص لـ«ما يشبه البشر». توزيعات تكرار الكلمات ليست حقيقة. يمكن لنموذج أن يقع تمامًا على المتوسط البشري ومع ذلك ينتج جملًا لا يكتبها أي إنسان، ويمكن لنموذج أن ينحرف بعيدًا عن التوزيع وهو يكتب شيئًا جيدًا حقًا.
ومع ذلك، يستحق الاتجاه الملاحظة، لأنه يتسق مع فرق يمكنك الإحساس به. بعض النماذج تبدو وكأنها كاتب حريص قيل له أن يتجنب الكليشيهات. ونماذج أخرى تبدو وكأنها مساعد واثق جدًا استوعب أسلوبًا مؤسسيًا ولن يتخلى عنه.
لماذا تهم العلامات الدالة على مستوى العبارة أكثر من تلك على مستوى الجملة
تعرّف معظم الناس على كشف الذكاء الاصطناعي عبر إشارات فاضحة في الجملة كاملة. الافتتاحية التي تهيئ المسرح. الخلاصة المرتبة في النهاية. القائمة الثلاثية التي تظهر سواء كان للمحتوى ثلاثة أجزاء أم لا.
أصبحت النماذج أفضل في تجنب فعل تلك الأشياء، على الأقل عندما يُطلب منها بلطف. ما يصعب إزالته بالصنفرة أكثر هو النسيج الرابط. الطريقة التي تُخاط بها فقرة إلى التالية. النزوع اللاواعي نحو التوازن، حيث تحصل كل دعوى على ثقل مقابل مطابق، سواء دعمت الأدلة وجوده أم لا. تفضيل الاسم المجرد على الاسم المحدد.
هذه تنجو من تعليمات إعادة الكتابة لأنها ليست قواعد يتبعها النموذج بوعي. إنها شكل التوزيع الذي تعلم منه. يمكنك أن تطلب من نموذج التوقف عن استخدام كلمة. لكن الأصعب بكثير أن تطلب منه التوقف عن التفكير بإيقاع معين.

تقدم قائمة العبارات أيضًا ملاحظة أكثر خفاءً عن المتوسطات. العلامات الدالة ليست موزعة بالتساوي. قد يستخدم النموذج عبارة واحدة أكثر بكثير مما يستخدمها البشر، وأخرى أقل، وفق نمط لا يظهر إلا عبر آلاف المقارنات. لا يلاحظ أي قارئ بشري هذا الإجمال. يلاحظ القارئ جملة تبدو غير سليمة، ونادرًا ما يعرف السبب. هذه الفجوة بين ما تستطيع الإحصاءات رؤيته وما يستطيع الشخص التعبير عنه هي بالضبط سبب صعوبة الكشف الجيد بالعين.
سوق الكشف الذي يغذيه هذا
هناك نتيجة تجارية واضحة لقائمة كهذه. أي شركة تبيع كشف الذكاء الاصطناعي لديها الآن مجموعة جديدة وملموسة من السمات لتتدرب عليها، وأي شركة تبيع الكتابة بالذكاء الاصطناعي لديها الآن قائمة جديدة من العادات التي يجب تجنبها.
هذا هو سباق التسلح مصغرًا. شركات الكشف تستخرج الأنماط، وشركات الكتابة تدرّب النماذج على التخلص منها، ويتغير الفهرس. السؤال المثير ليس ما إذا كان الإصدار التالي من أداة الكشف قادرًا على الإمساك بالإصدار الحالي من النموذج. بل ما يحدث للثقة عندما يصبح الطرفان جيدين بما يكفي بحيث لا يستطيع أي منهما أن يكون متأكدًا.
بالنسبة للقارئ، الأثر العملي هو فقدان تدريجي لطريق مختصر لم يكن يعمل بموثوقية على أي حال. لطالما كان الأسلوب إشارة ضعيفة. كتب المنتحلون بصوتهم الخاص لقرون، واقتبس الكتّاب الصادقون عبارات دائمًا. الفهرس الجديد يجعل الإشارة الضعيفة قابلة للقياس فحسب.
ماذا يعني هذا إذا كنت تنشر
بالنسبة للكاتب، تبدو الدراسة أقل شبهاً بالتهديد وأكثر شبهاً بالمرآة. إذا كانت 13,000 عبارة تميل نحو النثر الآلي، فإن مسودة تعتمد على تلك العبارات ستُقرأ كنثر آلي، مهما كانت الأفكار جيدة. الحل ليس أداة كشف. الحل هو التفاصيل.
الكتابة الآلية تلجأ افتراضيًا إلى العام لأن العام آمن دائمًا. أما الكتابة البشرية فمليئة بالخاص: اسم الشارع، الرقم الذي لا يُقرَّب، التفصيل الذي لا يعرفه إلا من كان هناك. هذه هي الأجزاء التي لا تستطيع أي كمية من تنقية العبارات تزييفها، لأنها لم تكن في بيانات التدريب من الأصل.
بالنسبة للمحرر، الدرس العملي هو عكس الأتمتة. أصبحت العلامات الدالة الآن خفية بما يكفي بحيث لا تلتقطها نظرة عابرة. عليك أن تقرأ بحثًا عن الإيقاع وعن غياب التفاصيل، لا بحثًا عن الشرطة الطويلة الفاضحة التي تعلم الجميع بالفعل البحث عنها. التحرير الأكثر موثوقية ليس حذف العادات اللغوية الواضحة. بل إضافة النوع من التفاصيل الملموسة التي لن يخترعها النموذج، وهو ما يخدم القارئ ويصادف أنه يهزم المصنف في الوقت نفسه.
سباق التسلح الذي لا يفوز به أحد فوزًا نظيفًا
هناك نسخة من هذه القصة يصبح فيها الكشف محلولًا. مصنف مُدرَّب على ما يكفي من أنماط العبارات هذه يحدد النص المولّد بالذكاء الاصطناعي بدقة عالية، ويعود الجميع إلى الثقة بما يقرؤون.
تلك النسخة فيها مشكلة. في اللحظة التي يُنشر فيها كاشف، يصبح إشارة تدريب. يُدرَّب النموذج التالي على تجنب أي شيء يعتمد عليه الكاشف، ويتغير الفهرس مجددًا. عبارات Graphite البالغة 13,000 هي لقطة، وليست تسوية نهائية.
ما يتبقى هو إعادة تعريف بطيئة لمعنى «أن يُقرأ كنص كتبه إنسان». كل جيل من النماذج يرفع الحد الأدنى للكفاءة العامة، وكل جيل يجعل العلامات البشرية المتبقية أكثر تميزًا قليلًا بالمقارنة. لا تتلاشى العلامات الدالة. بل تهاجر إلى إيماءات أصغر وأصغر، حتى لا تبقى إشارة موثوقة سوى تلك التي كانت موثوقة دائمًا: هل تعرف الكتابة شيئًا لم يعرفه القارئ، وتقوله بوضوح.
لا تستطيع قائمة عبارات قياس ذلك. ولا يستطيع مصنف ذلك حتى الآن. إنه الجزء من الكتابة الذي يقاوم الفهرسة، وربما يكون الجزء الذي سينتهي به الأمر الأكثر أهمية.
مقالات ذات صلة
سيلزفورس تدفع ملياري دولار لشركة تجري مقابلات مع عملائك نيابة عنك
المقابلات دليل. والتوائم الرقمية تنبؤ. والخط الفاصل بينهما هو الاختبار.
AMD تشتري World Labs لفي-في لي مقابل 8.2 مليار دولار لتملك الذكاء الاصطناعي الفيزيائي
AMD تشتري مختبر أبحاث، وتدفع فيه سعر شركة شرائح.
وضعت غوغل وحدة معالجة تنسور في المدار وبدأت في حساب تكلفة مراكز البيانات الفضائية
شريحة واحدة تعمل تثبت أن الرحلة قابلة للنجاة. لكنها لا تقول الكثير عن الربح.
العلامة المائية لا تواكب التزييف
الأنظمة تعمل. التغطية لا. والفجوة يملؤها ما يفترضه الجمهور.