← Zurück zum Blog
Newsca. 7 Min. Lesezeit

Sechs Zeitungen verklagen Microsoft und OpenAI wegen Paywall-Artikeln im Trainingsdatensatz

Veröffentlicht 7. Okt. 2026
Sechs Zeitungen verklagen Microsoft und OpenAI wegen Paywall-Artikeln im Trainingsdatensatz

Am 2. Oktober reichten sechs Verlagshäuser Klage gegen Microsoft und zehn OpenAI-Gesellschaften beim US-Bezirksgericht für den südlichen Bezirk von Mississippi ein. Die Klage wirft Urheberrechtsverletzung und die Entfernung von Urheberrechtsverwaltungsinformationen bei der Entwicklung von GPT-Modellen vor.

Zu den Klägern gehören Emmerich Newspapers, Ojai Media und mehrere Coopwood-Unternehmen, die im Süden Zeitungen und Zeitschriften veröffentlichen. Die Beklagten sind Microsoft sowie eine Reihe miteinander verbundener OpenAI-Gesellschaften. Der Fall ist Richter Henry Travillion Wingate zugewiesen; das Verfahrensregister wurde zuletzt am 5. Oktober aktualisiert.

Was die Klage tatsächlich vorwirft

Drei Vorwürfe tragen das Gewicht.

Erstens behauptet die Klage, die Beklagten hätten die Websites der Kläger systematisch gecrawlt, einschließlich Inhalten hinter Bezahlschranken, und Artikel wiederholt auf ihre Server kopiert, während die Modelle aktualisiert wurden. Die wiederholte Vervielfältigung ist der rechtlich entscheidende Teil. Ein einzelner Crawl ist ein Akt. Das erneute Kopieren des Korpus bei jedem Trainingslauf vervielfacht die Zahl der angeblich rechtsverletzenden Kopien, was das Haftungsrisiko multipliziert.

Zweitens argumentieren die Kläger, die Modelle zeigten Memorisierung und kodierten abrufbare Kopien der Trainingswerke. Dieser Vorwurf knüpft an eine Reihe von Verfahren an, in denen nicht die Frage ist, ob trainiert wurde, sondern ob das resultierende Modell geschützte Ausdrucksformen auf Abruf reproduzieren kann.

Drittens behauptet die Klage, dass Produkte wie ChatGPT Search und Deep Research Inhalte in Echtzeit von den Websites der Kläger abrufen und in Antworten einbinden. Dies ist die Retrieval-Ebene, getrennt vom Training. Selbst ein auf lizenzierten Daten trainiertes Modell kann zum Zeitpunkt der Antwort Text von einer Website abrufen, für deren Nutzung es keine Lizenz hatte.

Die Kläger argumentieren außerdem, die Beklagten hätten Autorennennungen, Publikationsnamen, Urheberrechtshinweise und Informationen zu Nutzungsbedingungen aus den Artikeln entfernt. Das entspricht der Theorie der Urheberrechtsverwaltungsinformationen, die nicht den Nachweis erfordert, dass die zugrunde liegende Vervielfältigung rechtswidrig war. Das Entfernen eines Urheberrechtshinweises aus einem referenzierten Werk ist nach US-Recht ein eigener Verstoß.

Die drei Klagegründe sind unmittelbare Urheberrechtsverletzung, Entfernung von Urheberrechtsverwaltungsinformationen und vorsätzlicher Diebstahl der Artikel.

Warum das Paywall-Detail wichtig ist

Der Paywall-Vorwurf ist der schärfste Teil der Klage und ein Detail, das von der allgemeinen Frage getrennt werden sollte, ob das Training mit urheberrechtlich geschütztem Text unter Fair Use fällt.

Inhalte hinter einer Bezahlschranke stehen außerhalb des offenen Webs. Sie werden unter Bedingungen veröffentlicht, die den Zugang an Auflagen knüpfen, oft an eine Zahlung, und die Bedingungen verbieten in der Regel die automatisierte Sammlung. Ein Crawl, der über eine Bezahlschranke hinausgeht, umgeht die Zugangsbedingung selbst, statt einen Fehler darüber zu machen, welche Seiten öffentlich waren.

Diese Einordnung passt zu einer breiteren Verschiebung in der Art und Weise, wie Dateneigentümer prozessieren. Der Streit verlagert sich von der Frage, ob das Kopieren geschützt ist, hin zu der Frage, ob die Methode der Sammlung die vom Verlag gesetzten Zugangsbedingungen respektiert hat. Vertrags- und Zugangsbedingungen leisten, was das Urheberrecht allein nicht leisten könnte.

Zwei fest gerollte leere Zeitungspapierrollen liegen in weichem Fokus nebeneinander auf einer dunklen Oberfläche

Wie sich dies in das größere Muster einfügt

Dieser Fall reiht sich in eine dichte Phase von Urheberrechts- und Zugangsstreitigkeiten ein. Reddits Vertragsklagen gegen Anthropic laufen und geben Plattformen einen Weg, Datensammlung außerhalb des Urheberrechts anzufechten. Anthropic schlug in seiner Stellungnahme an das australische Parlament eine „enge Form der bedingten Genehmigung“ für das Training vor, die es Rechteinhabern ermöglichen würde, über robots.txt zu widersprechen – ein Mechanismus, den Australiens öffentlich-rechtliche Rundfunkanstalten als routinemäßig umgangen zurückwiesen.

In all diesen Fällen tauchen dieselben technischen Fakten immer wieder auf. Robots.txt-Signale wurden in dokumentierten Tests von großen Crawlern ignoriert. Inhalte hinter Bezahlschranken scheinen gesammelt worden zu sein. Retrieval-Funktionen zeigen Text von Verlagen in Antworten an, selbst wenn der Verlag ihn nie lizenziert hat.

Die Verlage hier sind regionale und lokale Unternehmen, deren Archive echten Wert haben und deren Rechtsbudgets bescheiden sind. Genau deshalb ist der Fall beobachtenswert. Ein Sieg für große Verlage mit großen Rechtsteams prüft das Recht. Ein von regionalen Zeitungen angestrengter Fall prüft, ob die Rechtsmittel für die Rechteinhaber nutzbar sind, die sich jahrelange Beweisaufnahme nicht leisten können.

Was ein Urteil ändern könnte

Das Ergebnis wird von Fragen abhängen, die die Gerichte seit zwei Jahren umkreisen, ohne sie zu klären. Ist das Training mit urheberrechtlich geschütztem Text Fair Use, und ändert sich die Antwort, wenn der Text hinter einer Bezahlschranke lag? Macht Memorisierung aus einer Trainingsnutzung eine rechtsverletzende Vervielfältigung? Schafft Echtzeit-Retrieval eine vom Training getrennte Haftung? Und gilt das Entfernen von Urheberrechtshinweisen aus Werken, die in einem Datensatz erscheinen, als Verstoß, selbst wenn das Kopieren selbst erlaubt ist?

Nichts davon ist geklärt. Die Klage hängt alle vier Fragen an einen einzigen Sachverhalt und bringt sie vor ein Bezirksgericht. Für alle, die Produkte auf öffentlichen Webinhalten aufbauen, ist genau diese Kombination entscheidend. Die Antworten werden nicht schnell kommen, und die derzeitige Praxis der Branche, erst zu crawlen und später zu verhandeln, ist genau das, was diese Klage auf die Probe stellt.

Warum regionale Verlage einen anderen Fall einbringen

Die Identität der Kläger prägt den Rechtsstreit auf eine Weise, wie es die Fälle großer Verlage der letzten Jahre nicht taten.

Der Fall der New York Times und die Klagen der Musikindustrie davor stützten sich auf Unternehmensarchive, die auf jahrzehntelange kommerzielle Lizenzierungserlöse verweisen konnten. Sie konnten argumentieren, dass ein Markt existierte und verdrängt wurde. Eine Gruppe regionaler Zeitungen bringt eine andere Beweislage mit. Ihre Archive sind kleiner, ihre Lizenzierungshistorie ist dünner, und ihr Anspruch stützt sich direkter auf die Vervielfältigung selbst und auf die Entfernung von Urheberrechtsinformationen.

Das ist für den Rechtsbehelf wichtig. Wenn die Kläger beim Klagegrund der Urheberrechtsverwaltungsinformationen obsiegen, steht der Rechtsbehelf selbst dann zur Verfügung, wenn die zugrunde liegende Vervielfältigung bestritten ist, denn das Entfernen eines Hinweises ist ein eigenständiger Verstoß. Für einen Kläger ohne lange Lizenzierungshistorie ist dieser Klagegrund der gangbarere Weg.

Die Retrieval-Ebene als separates Haftungsrisiko

Der Vorwurf zu ChatGPT Search und Deep Research sollte von der Trainingsfrage getrennt werden, weil er auf eine andere Art von Haftung abzielt.

Das Training ist ein einmaliger Akt, egal wie oft der Korpus neu aufgebaut wird. Das Retrieval erfolgt bei jeder Anfrage, in dem Moment, in dem ein Nutzer fragt. Wenn ein Produkt Text in Echtzeit von der Website eines Verlags abruft und in eine Antwort einbindet, ist die angeblich rechtsverletzende Handlung fortlaufend und vom Nutzer ausgelöst.

Diese Unterscheidung gibt den Klägern einen Anspruch, der nicht davon abhängt, das Fair-Use-Argument zum Training zu gewinnen. Selbst ein vollständig auf lizenzierten Daten trainiertes Modell kann über eine Retrieval-Funktion Text aus einer Quelle anzeigen, die es nie lizenziert hat. Die Darstellung der Klage behandelt das Retrieval und das Training als zwei getrennte Rechtsverletzungen, was eine stärkere Struktur ist, als alles an den Trainingskorpus zu knüpfen.

Was Verlage beobachten

Zwei Signale werden der Branche zeigen, ob es sich lohnt, diese Art von Fall in großem Umfang zu führen.

Das erste ist, ob das Gericht zulässt, dass der Anspruch auf Urheberrechtsverwaltungsinformationen einen Antrag auf Klageabweisung übersteht. Dieser Klagegrund erfordert keine Entscheidung über Fair Use, sodass eine Entscheidung für die Kläger darauf den Verlagen einen schnelleren Weg zum Rechtsschutz bieten würde als ein vollständiges Verletzungsverfahren.

Das zweite ist, ob die Beweisaufnahme die Trainingspipeline erreicht. Wenn die Kläger die Herausgabe von Aufzeichnungen darüber erzwingen können, was wann gecrawlt wurde, wandelt sich der Fall von einem rechtlichen Argument über Fair Use zu einem tatsachenbezogenen Argument darüber, was der Crawler tatsächlich getan hat, einschließlich der Frage, ob er über Bezahlschranken hinausgegriffen hat. Praktiker auf Verlagsseite beobachten das Verfahrensregister genau auf einen solchen Beschluss, weil er ihnen zeigen würde, welche Beweise erhältlich sind, bevor sie sich zu eigenen Klagen entschließen.

Verwandte Artikel