← Retour au blog
NewsEnviron 9 min de lecture

robots.txt n’est qu’un mur de papier : Reddit c. Anthropic et l’audition australienne sur la conformité

Publié le 7 oct. 2026
robots.txt n’est qu’un mur de papier : Reddit c. Anthropic et l’audition australienne sur la conformité

Chaque site web possède un petit fichier texte appelé robots.txt. Il indique aux programmes automatisés quelles pages ils peuvent lire et lesquelles ils doivent laisser tranquilles. C’est une pancarte courtoise scotchée sur une porte déverrouillée. Derrière la pancarte, il n’y a aucune serrure.

Cet écart entre une requête et un mécanisme d’application est désormais au centre de deux batailles distinctes, l’une devant un tribunal américain et l’autre lors d’une audition parlementaire australienne. Toutes deux posent la même question sous des angles différents : que signifie réellement un signal « do not crawl » lorsqu’il est ignoré ?

Australie : l’opt-out impossible à exercer

Anthropic a comparu devant la commission mixte spéciale australienne sur l’intelligence artificielle au début du mois d’octobre. Elle avait proposé ce qu’elle appelait une « forme étroite d’approbation conditionnelle » pour l’entraînement de l’IA sur du contenu local, les titulaires de droits pouvant se désinscrire en bloquant les crawlers dans robots.txt. La contribution acceptait implicitement le rejet par l’Australie d’une large exemption de fouille de textes et de données, et proposait l’opt-out comme compromis.

Les diffuseurs publics ne l’ont pas accepté. La responsable du contenu et des opérations juridiques de l’ABC, Kate Gilchrist, a déclaré au comité que le système de droit d’auteur est adéquat et que les entreprises d’IA peuvent négocier les licences dont elles ont besoin. Son objection à l’opt-out était structurelle. Elle a déclaré que le diffuseur ne peut pas parcourir tout l’internet pour s’assurer qu’il est bien désinscrit sur tous les sites pertinents : « Cela ne fonctionne tout simplement pas. »

SBS a fait valoir le même point dans sa propre contribution, écrivant que les signaux robots.txt sont régulièrement contournés et que la responsabilité d’éviter les manquements devrait incomber aux entreprises d’IA.

L’asymétrie décrite par Kate Gilchrist est le nœud du problème. Les titulaires de droits doivent identifier, surveiller et maintenir des signaux d’opt-out sur tous les canaux de scraping possibles, indéfiniment. Les entreprises d’IA n’ont quasiment aucun coût technique pour contourner un signal et, tant qu’il n’existe pas de recours spécifique, quasiment aucun coût juridique non plus. Un crawler peut ignorer robots.txt en utilisant un autre identifiant de user-agent, en passant par un intermédiaire, ou parce qu’il a collecté le contenu avant la mise en place du blocage.

La suspicion repose sur des éléments documentés. TollBit, une start-up qui sert d’intermédiaire pour des accords de licence entre éditeurs et entreprises d’IA, a constaté que des agents d’IA de diverses sources contournaient le protocole robots.txt pour récupérer du contenu. Business Insider a ensuite rapporté qu’OpenAI et Anthropic contournaient les signaux robots.txt malgré leurs déclarations publiques de les respecter.

La position de l’ABC elle-même comporte une ironie qu’il vaut la peine de souligner. En juillet 2026, le diffuseur a choisi Claude d’Anthropic comme plateforme d’IA d’entreprise, lançant un pilote avec 100 employés pour convertir des émissions de radio en articles numériques, tout en soutenant simultanément que les produits d’Anthropic avaient probablement été entraînés sur son contenu sans autorisation. Les deux peuvent être vrais en même temps, et c’est précisément là le point : la coopération sur un front ne résout pas la question sur un autre.

États-Unis : la voie contractuelle

L’affaire Reddit contre Anthropic emprunte une voie juridique différente. Un tribunal fédéral a autorisé les actions contractuelles de Reddit à se poursuivre, ce qui donne aux plateformes une voie pour contester la collecte de données en dehors du droit d’auteur.

Cette distinction compte. Le droit d’auteur demande si du matériel protégé a été copié et si une défense s’applique. Le contrat demande si le collecteur a accepté des conditions relatives à l’accès, à la collecte automatisée ou à l’usage commercial. Pour les plateformes dont la valeur repose en partie sur du matériel qu’elles hébergent sans en être pleinement propriétaires, la théorie contractuelle est la plus exploitable.

L’ordonnance de renvoi n’a pas jugé qu’Anthropic avait violé l’accord de Reddit. Son importance plus générale est en réalité plus étroite : le tribunal a traité les droits contractuels de Reddit comme qualitativement différents des droits d’auteur, laissant la théorie de la violation de contrat vivante dans le litige en cours.

Lorsque les conditions d’utilisation acquièrent un poids pratique, elles se transforment en infrastructure de gouvernance des données. Une entreprise doit prouver la notification, le consentement, les conditions d’accès et la version pertinente des conditions au moment de la collecte, au-delà de ce qu’une politique énonce à première vue. Un litige peut dépendre des conditions qui s’appliquaient pendant la période d’accès contestée et de la manière dont elles étaient affichées.

Pourquoi robots.txt n’allait jamais tenir

Ce fichier a une histoire inversée. Dans les années 1990, robots.txt servait principalement à empêcher les moteurs de recherche de surcharger un serveur. Les sites rivalisaient pour être indexés, car être indexé signifiait des visiteurs. La relation s’est depuis inversée. Le même fichier sert désormais à fermer une porte, parce que les nouvelles machines qui lisent le web ne renvoient aucun visiteur.

Le blocage ne fonctionne que sur les crawlers qui obéissent au blocage. La part des sites d’information réputés qui bloquent les programmes d’IA est passée d’environ 23 % en septembre 2023 à près de 60 % en mai 2025. Pourtant, le propre crawler d’OpenAI a été observé ignorant ces consignes dans 42 % des cas à la fin de 2024, et des tests plus larges ont trouvé des violations sur 72 % des sites d’entreprise britanniques.

Une pancarte ne vaut que par l’avocat qui se tient derrière elle, et la plupart des sites n’ont pas celui de Reddit.

Ce que cela signifie pour les constructeurs

Pour les entreprises qui construisent des systèmes d’IA, la leçon pratique relève de la diligence. Lorsque vous achetez ou collectez des données d’entraînement, vous devez savoir si elles ont été rassemblées dans des conditions qui entrent en conflit avec les conditions de la plateforme source. Cela relie la provenance contractuelle aux signaux de confiance lisibles par machine censés rendre possible une conformité automatique.

La conclusion inconfortable est que le protocole volontaire est mis à l’épreuve précisément là où il était le plus faible. Reddit a construit un paywall, envoyé un avertissement juridique, regardé les citations de son contenu augmenter de près de 40 fois dans les réponses d’un concurrent, puis a poursuivi. Le panneau demandait. La barrière bloquait. Seule l’action en justice menace.

Que robots.txt finisse par avoir des dents dépendra de l’issue de la théorie contractuelle de Reddit et de la question de savoir si l’Australie légifère un recours plutôt que de s’appuyer sur un signal dont son propre diffuseur national dit qu’il ne fonctionne pas. D’ici là, la pancarte courtoise sur la porte déverrouillée reste exactement cela.

La question de conformité à laquelle personne ne peut répondre de l’extérieur

Il y a une raison pour laquelle le débat revient sans cesse à l’application plutôt qu’au principe. Tout le monde s’accorde dans l’abstrait pour dire que les conditions d’accès d’un site devraient signifier quelque chose. Le désaccord porte sur qui supporte le coût de rendre cela vrai.

Dans le modèle d’opt-out proposé par Anthropic, le coût incombe au titulaire des droits. Un éditeur doit découvrir quels crawlers lisent son contenu, encoder les bons blocages, les maintenir à jour à mesure que de nouveaux crawlers apparaissent et surveiller les violations. C’est une charge opérationnelle continue qui augmente avec le nombre d’entreprises d’IA et qui ne produit aucun recours lorsqu’un crawler ignore le blocage.

Dans le modèle de l’autorisation préalable défendu par l’ABC, le coût incombe à l’entreprise d’IA. Elle doit identifier ce sur quoi elle veut entraîner ses modèles, négocier des licences et conserver des registres de ce qu’elle est autorisée à utiliser. C’est un arrangement familier, et c’est celui que le droit d’auteur soutient déjà.

Deux planches pâles dressées sur de l’ardoise sombre avec un fin fil de lumière courant entre elles

Les deux modèles placent le coût de surveillance sur des parties différentes, une différence de politique publique au tranchant pratique, et la partie qui le supporte actuellement dit qu’elle ne peut pas se le permettre. C’est pourquoi le débat sur robots.txt ne cesse de refaire surface dans chaque juridiction qui tente de légiférer sur l’entraînement de l’IA : on demande à la norme technique d’accomplir un travail juridique pour lequel elle n’a jamais été conçue.

Pourquoi le correctif technique reste insuffisant

Même un registre d’opt-out parfait ne résoudrait pas le problème sous-jacent, car le signal identifie un crawler plutôt qu’une entreprise. Une entreprise peut scraper via un intermédiaire, utiliser un autre user-agent ou s’appuyer sur du contenu qu’elle a collecté avant la mise en place d’un quelconque blocage.

Les faits historiques rendent cela concret. GPTBot n’a commencé à respecter formellement les instructions de robots.txt qu’après que les modèles qui lui donnaient de la valeur commerciale avaient déjà été entraînés. Un blocage prospectif ne peut pas annuler une collecte rétrospective, et un blocage visant un identifiant ne lie pas une entreprise qui peut se présenter sous un autre.

C’est l’écart que l’ABC a pointé lorsqu’elle a déclaré ne pas pouvoir surveiller tout l’internet du côté des titulaires de droits. Le signal est bon marché pour l’émetteur et coûteux pour le destinataire, l’inverse du fonctionnement habituel d’un mécanisme de conformité efficace. Tant qu’aucun recours n’est attaché au fait d’ignorer le signal, l’incitation ne va que dans un sens.

Articles associés