← العودة إلى المدونة
Newsحوالي 1 دقيقة قراءة

ملف robots.txt جدار من ورق: قضية Reddit ضد Anthropic وجلسة الامتثال الأسترالية

نُشر في 7 أكتوبر 2026
ملف robots.txt جدار من ورق: قضية Reddit ضد Anthropic وجلسة الامتثال الأسترالية

لكل موقع ويب ملف نصي صغير يُسمى robots.txt. يخبر البرامج الآلية بالصفحات التي يجوز لها قراءتها وتلك التي يجب أن تتركها. إنه لافتة مؤدبة ملصقة على باب غير مقفل. ولا يوجد خلف اللافتة أي قفل.

وهذه الفجوة بين الطلب وآلية الإنفاذ أصبحت الآن محور معركتين منفصلتين، إحداهما في محكمة أمريكية والأخرى في جلسة استماع برلمانية أسترالية. وكلتاهما تطرحان السؤال نفسه من زاويتين مختلفتين: ما الذي تعنيه إشارة "لا تزحف" فعليًا عندما يتم تجاهلها؟

أستراليا: الانسحاب الذي لا يستطيع الانسحاب

مثَلت شركة Anthropic أمام اللجنة البرلمانية المشتركة الأسترالية المعنية بالذكاء الاصطناعي في أوائل أكتوبر. وقد اقترحت ما وصفته بـ"شكل ضيق من الموافقة المشروطة" لتدريب الذكاء الاصطناعي على المحتوى المحلي، مع انسحاب أصحاب الحقوق عبر حجب برامج الزحف في ملف robots.txt. وقد قبلت المذكرة ضمنيًا رفض أستراليا لإعفاء واسع لتعدين النصوص والبيانات، وقدمت الانسحاب كحل وسط.

لكن هيئات البث العامة لم تقبل ذلك. وقالت كيت غيلكريست، رئيسة المحتوى والعمليات القانونية في هيئة ABC، للجنة إن نظام حقوق النشر كافٍ وإن شركات الذكاء الاصطناعي تستطيع التفاوض للحصول على التراخيص التي تحتاجها. وكان اعتراضها على الانسحاب اعتراضًا بنيويًا. وقالت إن الهيئة لا تستطيع مسح الإنترنت بالكامل للتأكد من انسحابها على جميع المواقع المعنية: "إنه ببساطة لا يعمل".

وقد قدّمت قناة SBS الملاحظة نفسها في مذكرتها، إذ كتبت أن إشارات robots.txt يُلتف عليها بشكل روتيني وأن عبء تجنّب المخالفة يجب أن يقع على شركات الذكاء الاصطناعي.

وهذا التفاوت الذي وصفته غيلكريست هو جوهر المسألة. فعلى أصحاب الحقوق أن يحددوا إشارات الانسحاب ويراقبوها ويحافظوا عليها عبر كل قناة كشط ممكنة، وإلى أجل غير مسمى. في المقابل، تتحمل شركات الذكاء الاصطناعي تكلفة تقنية تقارب الصفر للالتفاف على الإشارة، وما دام لا يوجد علاج قانوني محدد، فتكلفة قانونية تقارب الصفر أيضًا. ويستطيع برنامج زحف تجاهل robots.txt باستخدام معرّف وكيل مستخدم مختلف، أو المرور عبر وسيط، أو الاعتماد على محتوى جمعه قبل وضع الحجب.

وهناك أساس موثّق لهذا الشك. فقد وجدت شركة TollBit، وهي شركة ناشئة تتوسط في صفقات الترخيص بين الناشرين وشركات الذكاء الاصطناعي، أن وكلاء ذكاء اصطناعي من مصادر متعددة كانوا يتجاوزون بروتوكول robots.txt لاسترجاع المحتوى. وأفادت Business Insider لاحقًا بأن OpenAI وAnthropic تجاوزتا إشارات robots.txt رغم ادعاءاتهما العلنية باحترامها.

وفي موقف ABC نفسه مفارقة تستحق الإشارة. ففي يوليو 2026 اختارت الهيئة نموذج Claude من Anthropic ليكون منصتها المؤسسية للذكاء الاصطناعي، وبدأت تجربة مع 100 موظف لتحويل البث الإذاعي إلى مقالات رقمية، في حين كانت في الوقت نفسه تحتج بأن منتجات Anthropic يُرجّح أنها دُرّبت على محتواها دون إذن. ويمكن أن يكون الأمران صحيحين في آن واحد، وهذا هو بيت القصيد: التعاون في جبهة لا يحل المسألة في جبهة أخرى.

الولايات المتحدة: مسار العقد

تسلك قضية Reddit ضد Anthropic مسارًا قانونيًا مختلفًا. فقد سمحت محكمة فيدرالية بمضي الدعاوى التعاقدية لـReddit، ما يمنح المنصات مسارًا للطعن في جمع البيانات خارج إطار قانون حقوق النشر.

وهذا التمييز مهم. فقانون حقوق النشر يسأل عما إذا كانت مواد محمية قد نُسخت وما إذا كان هناك دفاع ينطبق. أما العقد فيسأل عما إذا كان الجامع قد قبل شروطًا تتعلق بالوصول أو الجمع الآلي أو الاستخدام التجاري. وبالنسبة للمنصات التي يكمن جزء من قيمتها في مواد تستضيفها لكنها لا تملكها بالكامل، فإن النظرية التعاقدية هي الأكثر قابلية للاستخدام.

ولم يقرر أمر الإحالة أن Anthropic خرق اتفاق Reddit. لكن أهميته الأوسع أضيق نطاقًا: إذ تعاملت المحكمة مع الحقوق التعاقدية لـReddit على أنها مختلفة نوعيًا عن حقوق النشر، ما أبقى نظرية الإخلال بالعقد قائمة في النزاع الجاري.

وعندما تكتسب شروط الخدمة وزنًا عمليًا، فإنها تتحول إلى بنية تحتية لحوكمة البيانات. وتحتاج الشركة إلى إثبات الإشعار والموافقة وشروط الوصول والنسخة ذات الصلة من الشروط وقت الجمع، بما يتجاوز ما تنص عليه السياسة ظاهريًا. وقد يتوقف التقاضي على الشروط التي كانت سارية خلال فترة الوصول المتنازع عليها وكيفية عرضها.

لماذا لم يكن robots.txt ليصمد قط

لهذا الملف تاريخ مقلوب. ففي تسعينيات القرن الماضي، وُجد robots.txt أساسًا لمنع محركات البحث من إثقال الخادم بشكل مفرط. وكانت المواقع تتنافس على أن تُفهرَس، لأن الفهرسة تعني زوارًا. ثم انقلبت العلاقة. فاليوم يُستخدم الملف نفسه لإغلاق الباب، لأن الآلات الجديدة التي تقرأ الويب لا تعيد أحدًا.

ولا ينجح الحجب إلا مع برامج الزحف التي تطيعه. فقد قفزت نسبة مواقع الأخبار المرموقة التي تحجب برامج الذكاء الاصطناعي من نحو 23 بالمئة في سبتمبر 2023 إلى ما يقارب 60 بالمئة بحلول مايو 2025. ومع ذلك، رُصد برنامج الزحف الخاص بـOpenAI وهو يتجاهل هذه الملاحظات في 42 بالمئة من الحالات في أواخر 2024، وكشفت اختبارات أوسع عن انتهاكات في 72 بالمئة من مواقع الأعمال البريطانية.

اللافتة لا تكون أقوى من المحامي الواقف خلفها، ومعظم المواقع لا تملك محامي Reddit.

ماذا يعني هذا لمن يبنون الأنظمة

بالنسبة للشركات التي تبني أنظمة ذكاء اصطناعي، فإن الدرس العملي يتعلق بالعناية الواجبة. فعندما تشتري بيانات تدريب أو تجمعها، تحتاج إلى معرفة ما إذا كانت قد جُمعت في ظروف تتعارض مع شروط المنصة المصدر. وهذا يربط مصدر العقد التعاقدي بإشارات الثقة القابلة للقراءة آليًا التي يُفترض أن تجعل الامتثال التلقائي ممكنًا.

والخلاصة غير المريحة هي أن البروتوكول الطوعي يُختبر تحديدًا في أضعف نقاطه. بنت Reddit جدارًا مدفوعًا، وأرسلت تحذيرًا قانونيًا، وراقبت ارتفاع الاستشهادات بمحتواها نحو 40 ضعفًا في إجابات أحد المنافسين، ثم رفعت دعوى. اللافتة طلبت. والبوابة حجبت. ولا شيء يهدد سوى الدعوى القضائية.

وما إذا كان robots.txt سيكتسب أسنانًا يعتمد على مصير نظرية العقد في قضية Reddit، وعلى ما إذا كانت أستراليا ستسنّ علاجًا قانونيًا بدلًا من الاعتماد على إشارة تقول هيئة البث الوطنية فيها إنها لا تعمل. وإلى أن يحدث ذلك، تبقى اللافتة المؤدبة على الباب غير المقفل مجرد لافتة.

سؤال الامتثال الذي لا يستطيع أحد الإجابة عنه من الخارج

هناك سبب لعودة النقاش دائمًا إلى الإنفاذ بدلًا من المبدأ. فالجميع يتفقون نظريًا على أن شروط الوصول إلى الموقع ينبغي أن تعني شيئًا. والخلاف يدور حول من يتحمل تكلفة جعل ذلك حقيقة.

في نموذج الانسحاب الذي اقترحته Anthropic، تقع التكلفة على صاحب الحقوق. فعلى الناشر أن يكتشف أي برامج زحف تقرأ محتواه، ويشفّر الحجب المناسب، ويحافظ على تحديثه مع ظهور برامج زحف جديدة، ويراقب الانتهاكات. وهذا عبء تشغيلي مستمر يتضخم مع عدد شركات الذكاء الاصطناعي، ولا ينتج أي علاج عندما يتجاهل برنامج زحف الحجب.

وفي نموذج الإذن أولًا الذي دافعت عنه ABC، تقع التكلفة على شركة الذكاء الاصطناعي. فعليها أن تحدد ما تريد التدريب عليه، وتتفاوض على التراخيص، وتحتفظ بسجلات لما يُسمح لها باستخدامه. وهذا ترتيب مألوف، وهو الترتيب الذي يدعمه قانون حقوق النشر أصلًا.

لوحان شاحبان منتصبان على أرضية إردوازية داكنة مع خيط رفيع من الضوء يمتد بينهما

يضع النموذجان تكلفة المراقبة على أطراف مختلفة، وهو اختلاف سياساتي ذو حدّ عملي، والطرف الذي يتحملها حاليًا يقول إنه لا يستطيع تحملها. ولهذا يعاود نقاش robots.txt الظهور في كل ولاية قضائية تحاول تشريع تدريب الذكاء الاصطناعي: إذ يُطلب من المعيار التقني القيام بعمل قانوني لم يُصمم له قط.

لماذا يظل الحل التقني قاصرًا

حتى سجل الانسحاب المثالي لن يحل المشكلة الجوهرية، لأن الإشارة تحدد برنامج زحف لا شركة. فيمكن لشركة أن تكشط عبر وسيط، أو تستخدم وكيل مستخدم مختلفًا، أو تعتمد على محتوى جمعته قبل وضع أي حجب.

والسجل التاريخي يجعل هذا ملموسًا. فلم يبدأ GPTBot في الامتثال الرسمي لتعليمات robots.txt إلا بعد أن دُرّبت بالفعل النماذج التي جعلته ذا قيمة تجارية. والحجب المستقبلي لا يمكنه التراجع عن جمع حدث في الماضي، كما أن الحجب على معرّف واحد لا يُلزم شركة يمكنها أن تقدّم نفسها تحت معرّف آخر.

وهذه هي الفجوة التي أشارت إليها ABC حين قالت إنها لا تستطيع فرض الرقابة على الإنترنت بأكمله من جهة أصحاب الحقوق. فالإشارة رخيصة على المرسل ومكلفة على المتلقي، وهو عكس ما تعمل به عادة آلية امتثال فعّالة. وإلى أن يرتبط تجاهل الإشارة بعلاج قانوني، سيبقى الحافز يسير في اتجاه واحد.

مقالات ذات صلة