Sechs Zeitungen verklagen Microsoft und OpenAI wegen Paywall-Artikeln im Trainingsdatensatz

Am 2. Oktober reichten sechs Verlagshäuser Klage gegen Microsoft und zehn OpenAI-Gesellschaften beim US-Bezirksgericht für den südlichen Bezirk von Mississippi ein. Die Klage wirft Urheberrechtsverletzung und die Entfernung von Urheberrechtsverwaltungsinformationen bei der Entwicklung von GPT-Modellen vor.
Zu den Klägern gehören Emmerich Newspapers, Ojai Media und mehrere Coopwood-Unternehmen, die im Süden Zeitungen und Zeitschriften veröffentlichen. Die Beklagten sind Microsoft sowie eine Reihe miteinander verbundener OpenAI-Gesellschaften. Der Fall ist Richter Henry Travillion Wingate zugewiesen; das Verfahrensregister wurde zuletzt am 5. Oktober aktualisiert.
Was die Klage tatsächlich vorwirft
Drei Vorwürfe tragen das Gewicht.
Erstens behauptet die Klage, die Beklagten hätten die Websites der Kläger systematisch gecrawlt, einschließlich Inhalten hinter Bezahlschranken, und Artikel wiederholt auf ihre Server kopiert, während die Modelle aktualisiert wurden. Die wiederholte Vervielfältigung ist der rechtlich entscheidende Teil. Ein einzelner Crawl ist ein Akt. Das erneute Kopieren des Korpus bei jedem Trainingslauf vervielfacht die Zahl der angeblich rechtsverletzenden Kopien, was das Haftungsrisiko multipliziert.
Zweitens argumentieren die Kläger, die Modelle zeigten Memorisierung und kodierten abrufbare Kopien der Trainingswerke. Dieser Vorwurf knüpft an eine Reihe von Verfahren an, in denen nicht die Frage ist, ob trainiert wurde, sondern ob das resultierende Modell geschützte Ausdrucksformen auf Abruf reproduzieren kann.
Drittens behauptet die Klage, dass Produkte wie ChatGPT Search und Deep Research Inhalte in Echtzeit von den Websites der Kläger abrufen und in Antworten einbinden. Dies ist die Retrieval-Ebene, getrennt vom Training. Selbst ein auf lizenzierten Daten trainiertes Modell kann zum Zeitpunkt der Antwort Text von einer Website abrufen, für deren Nutzung es keine Lizenz hatte.
Die Kläger argumentieren außerdem, die Beklagten hätten Autorennennungen, Publikationsnamen, Urheberrechtshinweise und Informationen zu Nutzungsbedingungen aus den Artikeln entfernt. Das entspricht der Theorie der Urheberrechtsverwaltungsinformationen, die nicht den Nachweis erfordert, dass die zugrunde liegende Vervielfältigung rechtswidrig war. Das Entfernen eines Urheberrechtshinweises aus einem referenzierten Werk ist nach US-Recht ein eigener Verstoß.
Die drei Klagegründe sind unmittelbare Urheberrechtsverletzung, Entfernung von Urheberrechtsverwaltungsinformationen und vorsätzlicher Diebstahl der Artikel.
Warum das Paywall-Detail wichtig ist
Der Paywall-Vorwurf ist der schärfste Teil der Klage und ein Detail, das von der allgemeinen Frage getrennt werden sollte, ob das Training mit urheberrechtlich geschütztem Text unter Fair Use fällt.
Inhalte hinter einer Bezahlschranke stehen außerhalb des offenen Webs. Sie werden unter Bedingungen veröffentlicht, die den Zugang an Auflagen knüpfen, oft an eine Zahlung, und die Bedingungen verbieten in der Regel die automatisierte Sammlung. Ein Crawl, der über eine Bezahlschranke hinausgeht, umgeht die Zugangsbedingung selbst, statt einen Fehler darüber zu machen, welche Seiten öffentlich waren.
Diese Einordnung passt zu einer breiteren Verschiebung in der Art und Weise, wie Dateneigentümer prozessieren. Der Streit verlagert sich von der Frage, ob das Kopieren geschützt ist, hin zu der Frage, ob die Methode der Sammlung die vom Verlag gesetzten Zugangsbedingungen respektiert hat. Vertrags- und Zugangsbedingungen leisten, was das Urheberrecht allein nicht leisten könnte.

Wie sich dies in das größere Muster einfügt
Dieser Fall reiht sich in eine dichte Phase von Urheberrechts- und Zugangsstreitigkeiten ein. Reddits Vertragsklagen gegen Anthropic laufen und geben Plattformen einen Weg, Datensammlung außerhalb des Urheberrechts anzufechten. Anthropic schlug in seiner Stellungnahme an das australische Parlament eine „enge Form der bedingten Genehmigung“ für das Training vor, die es Rechteinhabern ermöglichen würde, über robots.txt zu widersprechen – ein Mechanismus, den Australiens öffentlich-rechtliche Rundfunkanstalten als routinemäßig umgangen zurückwiesen.
In all diesen Fällen tauchen dieselben technischen Fakten immer wieder auf. Robots.txt-Signale wurden in dokumentierten Tests von großen Crawlern ignoriert. Inhalte hinter Bezahlschranken scheinen gesammelt worden zu sein. Retrieval-Funktionen zeigen Text von Verlagen in Antworten an, selbst wenn der Verlag ihn nie lizenziert hat.
Die Verlage hier sind regionale und lokale Unternehmen, deren Archive echten Wert haben und deren Rechtsbudgets bescheiden sind. Genau deshalb ist der Fall beobachtenswert. Ein Sieg für große Verlage mit großen Rechtsteams prüft das Recht. Ein von regionalen Zeitungen angestrengter Fall prüft, ob die Rechtsmittel für die Rechteinhaber nutzbar sind, die sich jahrelange Beweisaufnahme nicht leisten können.
Was ein Urteil ändern könnte
Das Ergebnis wird von Fragen abhängen, die die Gerichte seit zwei Jahren umkreisen, ohne sie zu klären. Ist das Training mit urheberrechtlich geschütztem Text Fair Use, und ändert sich die Antwort, wenn der Text hinter einer Bezahlschranke lag? Macht Memorisierung aus einer Trainingsnutzung eine rechtsverletzende Vervielfältigung? Schafft Echtzeit-Retrieval eine vom Training getrennte Haftung? Und gilt das Entfernen von Urheberrechtshinweisen aus Werken, die in einem Datensatz erscheinen, als Verstoß, selbst wenn das Kopieren selbst erlaubt ist?
Nichts davon ist geklärt. Die Klage hängt alle vier Fragen an einen einzigen Sachverhalt und bringt sie vor ein Bezirksgericht. Für alle, die Produkte auf öffentlichen Webinhalten aufbauen, ist genau diese Kombination entscheidend. Die Antworten werden nicht schnell kommen, und die derzeitige Praxis der Branche, erst zu crawlen und später zu verhandeln, ist genau das, was diese Klage auf die Probe stellt.
Warum regionale Verlage einen anderen Fall einbringen
Die Identität der Kläger prägt den Rechtsstreit auf eine Weise, wie es die Fälle großer Verlage der letzten Jahre nicht taten.
Der Fall der New York Times und die Klagen der Musikindustrie davor stützten sich auf Unternehmensarchive, die auf jahrzehntelange kommerzielle Lizenzierungserlöse verweisen konnten. Sie konnten argumentieren, dass ein Markt existierte und verdrängt wurde. Eine Gruppe regionaler Zeitungen bringt eine andere Beweislage mit. Ihre Archive sind kleiner, ihre Lizenzierungshistorie ist dünner, und ihr Anspruch stützt sich direkter auf die Vervielfältigung selbst und auf die Entfernung von Urheberrechtsinformationen.
Das ist für den Rechtsbehelf wichtig. Wenn die Kläger beim Klagegrund der Urheberrechtsverwaltungsinformationen obsiegen, steht der Rechtsbehelf selbst dann zur Verfügung, wenn die zugrunde liegende Vervielfältigung bestritten ist, denn das Entfernen eines Hinweises ist ein eigenständiger Verstoß. Für einen Kläger ohne lange Lizenzierungshistorie ist dieser Klagegrund der gangbarere Weg.
Die Retrieval-Ebene als separates Haftungsrisiko
Der Vorwurf zu ChatGPT Search und Deep Research sollte von der Trainingsfrage getrennt werden, weil er auf eine andere Art von Haftung abzielt.
Das Training ist ein einmaliger Akt, egal wie oft der Korpus neu aufgebaut wird. Das Retrieval erfolgt bei jeder Anfrage, in dem Moment, in dem ein Nutzer fragt. Wenn ein Produkt Text in Echtzeit von der Website eines Verlags abruft und in eine Antwort einbindet, ist die angeblich rechtsverletzende Handlung fortlaufend und vom Nutzer ausgelöst.
Diese Unterscheidung gibt den Klägern einen Anspruch, der nicht davon abhängt, das Fair-Use-Argument zum Training zu gewinnen. Selbst ein vollständig auf lizenzierten Daten trainiertes Modell kann über eine Retrieval-Funktion Text aus einer Quelle anzeigen, die es nie lizenziert hat. Die Darstellung der Klage behandelt das Retrieval und das Training als zwei getrennte Rechtsverletzungen, was eine stärkere Struktur ist, als alles an den Trainingskorpus zu knüpfen.
Was Verlage beobachten
Zwei Signale werden der Branche zeigen, ob es sich lohnt, diese Art von Fall in großem Umfang zu führen.
Das erste ist, ob das Gericht zulässt, dass der Anspruch auf Urheberrechtsverwaltungsinformationen einen Antrag auf Klageabweisung übersteht. Dieser Klagegrund erfordert keine Entscheidung über Fair Use, sodass eine Entscheidung für die Kläger darauf den Verlagen einen schnelleren Weg zum Rechtsschutz bieten würde als ein vollständiges Verletzungsverfahren.
Das zweite ist, ob die Beweisaufnahme die Trainingspipeline erreicht. Wenn die Kläger die Herausgabe von Aufzeichnungen darüber erzwingen können, was wann gecrawlt wurde, wandelt sich der Fall von einem rechtlichen Argument über Fair Use zu einem tatsachenbezogenen Argument darüber, was der Crawler tatsächlich getan hat, einschließlich der Frage, ob er über Bezahlschranken hinausgegriffen hat. Praktiker auf Verlagsseite beobachten das Verfahrensregister genau auf einen solchen Beschluss, weil er ihnen zeigen würde, welche Beweise erhältlich sind, bevor sie sich zu eigenen Klagen entschließen.
Verwandte Artikel
Indien schreibt seine eigenen KI-Sicherheitsregeln und lehnt es ab, Washingtons zu kopieren
Nur auf Englisch zu testen, würde einen Rahmen hervorbringen, der nichts über die meisten Einsätze zertifiziert, die er abzudecken vorgibt.
Tavus Griffin wurde in 48 Prozent der Fälle für einen Menschen gehalten, und das Unternehmen veröffentlicht es nicht
Eine vorab aufgezeichnete Fälschung beantwortet nur vorbereitete Fragen. Ein Echtzeitsystem beantwortet, was auch immer gefragt wird.
Anthropic fand 129.000 Schwachstellen – und verschärfte dann den Zugang
Das Unternehmen wählte auf dem Höhepunkt einer Sicherheitsdemonstration genau diesen Moment, um den Zugang weiter einzuschränken – und das ist kein Widerspruch.
Kein echter Mensch auf der Damenmode-Detailseite: KI-Models treiben das Vertrauen im E-Commerce an den Abgrund
Bilder sind nicht vertrauenswürdig, also steigt die Retourenquote; die Retourenquote steigt, also senken Händler die Fotokosten noch stärker; sinkende Kosten machen die Bilder noch unglaubwürdiger. Dieser Kreis ist kein technisches Problem – das Anreizsystem ist kaputt.