robots.txt ist eine Papierwand: Reddit gegen Anthropic und Australiens Compliance-Anhörung

Jede Website hat eine kleine Textdatei namens robots.txt. Sie teilt automatisierten Programmen mit, welche Seiten sie lesen dürfen und welche sie in Ruhe lassen sollen. Sie ist ein höfliches Schild, das an eine unverschlossene Tür geklebt wurde. Hinter dem Schild steckt kein Schloss.
Diese Lücke zwischen einer Bitte und einem Durchsetzungsmechanismus steht nun im Zentrum zweier getrennter Auseinandersetzungen, einer vor einem US-Gericht und einer in einer australischen Parlamentsanhörung. Beide stellen aus unterschiedlichen Blickwinkeln dieselbe Frage: Was bedeutet ein „Nicht crawlen“-Signal eigentlich, wenn es ignoriert wird?
Australien: Der Opt-out, der nicht opt-outen kann
Anthropic erschien Anfang Oktober vor dem Joint Select Committee on Artificial Intelligence des australischen Parlaments. Das Unternehmen hatte eine „eng gefasste Form der bedingten Genehmigung“ für das KI-Training mit lokalen Inhalten vorgeschlagen, wobei Rechteinhaber durch das Blockieren von Crawlern in robots.txt opt-outen können. Die Eingabe akzeptierte implizit Australiens Ablehnung einer breiten Text- und Data-Mining-Ausnahme und bot den Opt-out als Kompromiss an.
Die öffentlich-rechtlichen Rundfunkanstalten akzeptierten das nicht. Kate Gilchrist, Leiterin Inhalte und Rechtsoperationen bei der ABC, sagte dem Ausschuss, das Urheberrechtssystem sei ausreichend und KI-Unternehmen könnten über die benötigten Lizenzen verhandeln. Ihr Einwand gegen den Opt-out war struktureller Natur. Sie sagte, die Rundfunkanstalt könne nicht das gesamte Internet durchkämmen, um sicherzustellen, dass sie auf allen relevanten Websites ausgenommen sei: „Es funktioniert einfach nicht.“
SBS vertrat in seiner eigenen Eingabe denselben Standpunkt und schrieb, robots.txt-Signale würden routinemäßig umgangen und die Verantwortung sollte bei den KI-Unternehmen liegen, Rechtsverstöße zu vermeiden.
Die von Gilchrist beschriebene Asymmetrie ist der Kern. Rechteinhaber müssen Opt-out-Signale über jeden möglichen Scraping-Kanal hinweg identifizieren, überwachen und aufrechterhalten – auf unbestimmte Zeit. KI-Unternehmen haben nahezu null technische Kosten, um ein Signal zu umgehen, und solange keine konkrete Handhabe existiert, auch nahezu null rechtliche Kosten. Ein Crawler kann robots.txt ignorieren, indem er eine andere User-Agent-Kennung verwendet, über einen Vermittler geht oder die Inhalte bereits gesammelt hat, bevor die Sperre eingerichtet wurde.
Für diesen Verdacht gibt es eine dokumentierte Grundlage. TollBit, ein Startup, das Lizenzvereinbarungen zwischen Verlagen und KI-Unternehmen vermittelt, stellte fest, dass KI-Agenten aus verschiedenen Quellen das robots.txt-Protokoll umgingen, um Inhalte abzurufen. Business Insider berichtete anschließend, dass OpenAI und Anthropic robots.txt-Signale umgingen, trotz öffentlicher Beteuerungen, sie zu respektieren.
Die eigene Position der ABC birgt eine bemerkenswerte Ironie. Im Juli 2026 wählte die Rundfunkanstalt Anthropics Claude als ihre Unternehmens-KI-Plattform und startete einen Pilotversuch mit 100 Mitarbeitenden, um Radiobeiträge in digitale Artikel umzuwandeln – während sie gleichzeitig argumentierte, Anthropics Produkte seien wahrscheinlich ohne Erlaubnis mit ihren Inhalten trainiert worden. Beides kann zugleich zutreffen, und genau das ist der Punkt: Zusammenarbeit auf einer Ebene löst die Frage auf einer anderen nicht.
Die Vereinigten Staaten: Der Weg über den Vertrag
Der Fall Reddit gegen Anthropic nimmt einen anderen rechtlichen Weg. Ein Bundesgericht ließ Reddits Vertragsansprüche zu, was Plattformen einen Weg eröffnet, die Datenerhebung außerhalb des Urheberrechts anzufechten.
Dieser Unterschied ist wichtig. Das Urheberrecht fragt, ob geschütztes Material kopiert wurde und ob eine Verteidigung greift. Der Vertrag fragt, ob der Sammelnde Bedingungen in Bezug auf Zugang, automatisierte Erfassung oder kommerzielle Nutzung akzeptiert hat. Für Plattformen, deren Wert teilweise in Material liegt, das sie hosten, aber nicht vollständig besitzen, ist die Vertragstheorie die besser nutzbare.
Die Zurückverweisung entschied nicht, dass Anthropic gegen Reddits Vereinbarung verstoßen hat. Ihre größere Bedeutung ist enger gefasst: Das Gericht behandelte Reddits vertragliche Rechte als qualitativ anders als urheberrechtliche Rechte und hielt damit die Vertragsverletzungstheorie im laufenden Streit am Leben.
Wo Nutzungsbedingungen praktisches Gewicht erlangen, werden sie zu Infrastruktur für Daten-Governance. Ein Unternehmen muss den Hinweis, die Zustimmung, die Zugangsbedingungen und die maßgebliche Fassung der Bedingungen zum Zeitpunkt der Erhebung nachweisen – über das hinaus, was eine Richtlinie dem Wortlaut nach festhält. Ein Rechtsstreit kann sich daran entscheiden, welche Bedingungen während des strittigen Zugangszeitraums galten und wie sie dargestellt wurden.
Warum robots.txt nie standhalten konnte
Die Datei hat eine umgekehrte Geschichte. In den 1990er-Jahren existierte robots.txt hauptsächlich, um Suchmaschinen davon abzuhalten, einen Server zu stark zu belasten. Websites konkurrierten darum, indexiert zu werden, denn indexiert zu werden bedeutete Besucher. Seither hat sich die Beziehung umgekehrt. Dieselbe Datei wird nun genutzt, um eine Tür zu schließen, weil die neuen Maschinen, die das Web lesen, niemanden zurückschicken.
Blockieren funktioniert nur bei Crawlern, die die Sperre befolgen. Der Anteil angesehener Nachrichtenwebsites, die KI-Programme blockieren, sprang von etwa 23 Prozent im September 2023 auf fast 60 Prozent bis Mai 2025. Dennoch wurde beobachtet, dass OpenAIs eigener Crawler diese Hinweise Ende 2024 in 42 Prozent der Fälle ignorierte, und umfassendere Tests fanden Verstöße auf 72 Prozent der britischen Unternehmenswebsites.
Ein Schild ist nur so stark wie der Anwalt, der dahintersteht, und die meisten Websites haben keinen wie Reddit.
Was das für Entwickler bedeutet
Für Unternehmen, die KI-Systeme entwickeln, ist die praktische Lehre eine Frage der Sorgfalt. Wenn Sie Trainingsdaten kaufen oder sammeln, müssen Sie wissen, ob sie unter Bedingungen zusammengetragen wurden, die den Bedingungen der Quellplattform widersprechen. Das verbindet die vertragliche Herkunft mit den maschinenlesbaren Vertrauenssignalen, die automatische Compliance ermöglichen sollen.
Die unbequeme Schlussfolgerung ist, dass das freiwillige Protokoll genau dort auf die Probe gestellt wird, wo es am schwächsten war. Reddit errichtete eine Paywall, verschickte eine rechtliche Warnung, verfolgte, wie Zitate seiner Inhalte in den Antworten eines Wettbewerbers um fast das 40-Fache stiegen, und klagte dann. Das Schild bat. Das Tor blockierte. Nur die Klage droht.
Ob robots.txt Zähne bekommt, hängt davon ab, wie sich die Reddit-Vertragstheorie entwickelt und ob Australien eine Handhabe gesetzlich verankert, statt sich auf ein Signal zu verlassen, das nach Aussage des eigenen nationalen Rundfunks nicht funktioniert. Bis dahin bleibt das höfliche Schild an der unverschlossenen Tür genau das.
Die Compliance-Frage, die niemand von außen beantworten kann
Es gibt einen Grund, warum die Debatte immer wieder zur Durchsetzung statt zum Prinzip zurückkehrt. In der Abstraktion stimmen alle zu, dass die Zugangsbedingungen einer Website etwas bedeuten sollten. Der Streit dreht sich darum, wer die Kosten dafür trägt, dass dies auch zutrifft.
Nach dem von Anthropic vorgeschlagenen Opt-out-Modell liegt die Last beim Rechteinhaber. Ein Verlag muss herausfinden, welche Crawler seine Inhalte lesen, die richtigen Sperren kodieren, sie aktuell halten, wenn neue Crawler auftauchen, und Verstöße überwachen. Das ist eine fortlaufende operative Belastung, die mit der Zahl der KI-Unternehmen wächst und keine Handhabe bietet, wenn ein Crawler die Sperre ignoriert.
Nach dem Genehmigung-zuerst-Modell, für das die ABC argumentierte, liegt die Last beim KI-Unternehmen. Es muss bestimmen, womit es trainieren will, über Lizenzen verhandeln und Aufzeichnungen darüber führen, was es nutzen darf. Das ist eine vertraute Regelung, und es ist die, die das Urheberrecht bereits stützt.

Die beiden Modelle legen die Überwachungskosten unterschiedlichen Parteien auf – ein politischer Unterschied mit praktischer Schärfe –, und die Partei, die sie derzeit trägt, sagt, sie könne sie sich nicht leisten. Deshalb taucht die robots.txt-Debatte in jeder Jurisdiktion wieder auf, die das KI-Training gesetzlich regeln will: Von einem technischen Standard wird rechtliche Arbeit verlangt, für die er nie entworfen wurde.
Warum der technische Fix immer wieder zu kurz greift
Selbst ein perfektes Opt-out-Register würde das zugrunde liegende Problem nicht lösen, weil das Signal einen Crawler identifiziert und nicht ein Unternehmen. Eine Firma kann über einen Vermittler scrapen, einen anderen User-Agent verwenden oder sich auf Inhalte stützen, die sie gesammelt hat, bevor eine Sperre eingerichtet wurde.
Die historische Aufzeichnung macht das konkret. GPTBot begann erst dann formell, robots.txt-Anweisungen zu befolgen, als die Modelle, die ihn kommerziell wertvoll machten, bereits trainiert waren. Eine zukünftige Sperre kann eine nachträgliche Sammlung nicht rückgängig machen, und eine Sperre für eine Kennung bindet kein Unternehmen, das unter einer anderen auftreten kann.
Das ist die Lücke, auf die die ABC hinwies, als sie sagte, sie könne nicht das gesamte Internet auf der Seite der Rechteinhaber überwachen. Das Signal ist billig für den Sender und teuer für den Empfänger – das Gegenteil davon, wie ein wirksamer Compliance-Mechanismus üblicherweise funktioniert. Solange sich an das Ignorieren des Signals keine Handhabe knüpft, läuft der Anreiz nur in eine Richtung.
Verwandte Artikel
Indien schreibt seine eigenen KI-Sicherheitsregeln und lehnt es ab, Washingtons zu kopieren
Nur auf Englisch zu testen, würde einen Rahmen hervorbringen, der nichts über die meisten Einsätze zertifiziert, die er abzudecken vorgibt.
Tavus Griffin wurde in 48 Prozent der Fälle für einen Menschen gehalten, und das Unternehmen veröffentlicht es nicht
Eine vorab aufgezeichnete Fälschung beantwortet nur vorbereitete Fragen. Ein Echtzeitsystem beantwortet, was auch immer gefragt wird.
Anthropic fand 129.000 Schwachstellen – und verschärfte dann den Zugang
Das Unternehmen wählte auf dem Höhepunkt einer Sicherheitsdemonstration genau diesen Moment, um den Zugang weiter einzuschränken – und das ist kein Widerspruch.
Kein echter Mensch auf der Damenmode-Detailseite: KI-Models treiben das Vertrauen im E-Commerce an den Abgrund
Bilder sind nicht vertrauenswürdig, also steigt die Retourenquote; die Retourenquote steigt, also senken Händler die Fotokosten noch stärker; sinkende Kosten machen die Bilder noch unglaubwürdiger. Dieser Kreis ist kein technisches Problem – das Anreizsystem ist kaputt.