Meta hat den Buch-Rechtsstreit beigelegt. Die Erlaubnis hat jetzt einen Preis.

Meta hat zugestimmt, die Sammelklage beizulegen, in der ihm vorgeworfen wird, seine Llama-Modelle mit raubkopierten Büchern trainiert zu haben. Die vorgeschlagene Vereinbarung wurde Ende September bei einem Bundesgericht eingereicht, und die Benachrichtigung erging wenige Tage später an die Rechteinhaber. Die finanziellen Bedingungen sind versiegelt, bis ein Richter sie genehmigt, und Meta erklärt öffentlich weiterhin, seine Trainingspraktiken fielen unter Fair Use. Was die Einigung nicht sagt, ist ebenso aussagekräftig wie das, was sie sagt.
Der Fall drehte sich um die Beschaffungsseite und nicht um die Trainingsseite. Autoren behaupteten, Llama-Modelle seien zwischen 2018 und 2024 mit Werken trainiert worden, die aus Schattenbibliotheken wie LibGen stammten. Dieses Detail ist wichtig, weil eine separate Entscheidung bereits eine Trennlinie mitten durch dieses Problem gezogen hat. Im Anthropic-Fall befand Richter William Alsup, dass das Training eines Modells mit urheberrechtlich geschützten Büchern rechtmäßig ist, das Aufbewahren einer Bibliothek mit Raubkopien jedoch nicht. Die Strafe in diesem Fall, eine Einigung über 1,5 Milliarden Dollar, hing daran, wie die Bücher beschafft wurden, nicht am Lernen selbst.
Zusammengenommen beschreiben die beiden Ergebnisse eine Regel, die leicht zu formulieren und schwer zu befolgen ist. Von einem Buch zu lernen, das man rechtmäßig erworben hat, ist in Ordnung. Aus Raubkopien einen Korpus aufzubauen, ist es nicht. Die Summe von 1,5 Milliarden Dollar entspricht ungefähr 3.000 Dollar pro Werk, was jedem Labor eine Möglichkeit gibt, sein eigenes Risiko zu beziffern. Wenn Sie einen Korpus von einer Piratenseite gescrapt haben, haben Sie jetzt eine grobe Zahl dafür, was diese Entscheidung kostet.
Opt-out wird durch einen Preis ersetzt
Der folgenreichere Wandel ist das, was als Nächstes passiert. Eine separate Einigung, über die diesen Monat berichtet wurde, ersetzte das Modell eines freiwilligen Opt-out-Registers durch eine verpflichtende Lizenzgebührenstruktur, die daran gekoppelt ist, wie viele Daten verwendet werden. Das Argument dahinter ist unverblümt: Opt-out-Wege sahen auf dem Papier fair aus und versagten in der Praxis, weil Entwickler die Ausschlusslisten selten prüften oder beachteten. Pro Datenmenge zu zahlen ist schwerer zu ignorieren.
Das rahmt die gesamte Verhandlung neu. Beim Opt-out bestand der einzige Hebel eines Rechteinhabers darin, Nein zu sagen und zu hoffen. Bei einer bepreisten Lizenz wird Erlaubnis zu einem Einzelposten mit einer Zahl daran, und die Debatte verschiebt sich davon, ob KI-Unternehmen das Werk nutzen dürfen, hin dazu, wie viel sie dafür schulden. Für Verlage und Autoren ist das eine weitaus bessere Position als eine technische Hürde, die niemand durchsetzte.
Die praktische Folge für Labore ist ein neues Compliance-Budget. Datenherkunft ist nicht länger eine technische Präferenz, sondern wird zu einer rechtlichen Anforderung. Wenn ein Korpus aus einem Multi-Petabyte-Datensatz aus einer Quelle stammt, die nicht dokumentiert werden kann, bringt das eine konkrete Haftung in die gesamte Trainingspipeline ein, und der Fehler passiert meist in der Aggregationsschicht, wo Datensätze Dritter ohne klare Zuordnung kombiniert werden.
Die Frage nach den Outputs ist noch offen
Trainingsdaten sind nur eine von zwei Fronten. Die andere ist das, was das Modell produziert, und dort ist das Bild weniger geklärt. Die New York Times überstand OpenAIs Antrag auf Klageabweisung, indem sie plausibel behauptete, dass die Outputs von ChatGPT mit ihrem Journalismus konkurrieren. Das ist eine Theorie der Marktsubstitution, und sie wirkt anders als die Beschaffungstheorie. Wenn das Modell von einem Werk lernt und es nicht reproduziert, hält das transformative Argument. Wenn sein Output auf dem Markt das Original ersetzt, wird das Argument schwächer.
Audio folgt nicht demselben Weg
Wenn sich Buchverlage auf einen Lizenzmarkt zubewegen, steuert Musik auf etwas Unordentlicheres zu. Suno verlor in Deutschland eine von der GEMA, der Verwertungsgesellschaft für Aufführungsrechte, angestrengte Entscheidung wegen der Nutzung urheberrechtlich geschützter Aufnahmen und Kompositionen. Die amerikanischen Textfälle lösen sich größtenteils in Zahlungen und rückwirkenden Lizenzen auf. Die Audiofälle führen zu Unterlassungsverfügungen und Zuständigkeitsstreitigkeiten, was für ein Produktunternehmen das schlechtere Ergebnis ist, weil eine Unterlassungsverfügung den Dienst stoppt, statt ihn zu besteuern.
Der Unterschied scheint darauf hinauszulaufen, wie nah der Output am Input sitzt. Ein Sprachmodell, das ein Buch zusammenfasst, ist einen Schritt vom Text entfernt. Ein Musikmodell, das einen Song im Stil eines Künstlers generiert, sitzt nah genug, dass der Vergleich unmittelbar ist, und Gerichte waren weniger bereit, das Transformationsargument so zu dehnen, dass es darauf passt.
Wo es noch keinen Preis gibt
Der Maßstab pro Werk ist bislang ein Textphänomen, und der Grund dafür ist Infrastruktur. Buchverlage haben kollektive Lizenzierungsstellen, jahrzehntelange Präzedenzfälle zum Vervielfältigungsrecht und eine einigermaßen klare Austauscheinheit, nämlich ein Werk. Das macht einen Preis pro Titel leicht definierbar und leicht, vor Gericht darüber zu streiten.

Bilder, Video und Code haben nicht denselben Aufbau. Eine Stockfoto-Bibliothek kann eine Lizenz pro Bild bepreisen, aber ein Screenshot einer Webseite enthält Dutzende urheberrechtlich geschützte Elemente auf einmal, und ein Code-Repository mischt lizenzierte, permissiv lizenzierte und nicht zuordenbare Dateien im selben Baum. Sobald sich die Frage von Text auf eines davon verschiebt, gilt die Formel pro Werk nicht mehr, und die Debatte kehrt zum Fair Use zurück, also zu dem Boden, auf dem KI-Unternehmen lieber kämpfen würden.
Die andere offene Frage ist, wer die Gebühren einzieht. Eine Lizenzgebühr, die niemand verwaltet, wird ohnehin zur Sammelklage, und die diesen Monat berichteten Einigungsstrukturen beschreiben weiterhin Zahlungen, die von Fall zu Fall ausgehandelt werden, statt einen bestehenden Markt mit veröffentlichten Sätzen. Solange die Sätze nicht öffentlich sind, findet jede Verhandlung im Privaten statt, wobei die größten Käufer die besten Bedingungen bekommen. Das ist die Gestalt eines Marktes, der sich gebildet hat, aber noch nicht ausgereift ist.
Was das bedeutet, wenn Sie auf diesen Modellen aufbauen
Die meisten Entwickler, die das lesen, trainieren keine Foundation-Modelle, daher ist die direkte Risikoexposition gering. Die indirekte ist es nicht. Labore, die Vergleiche in acht- und neunstelliger Höhe absorbieren, geben die Kosten weiter, und der Mechanismus dafür ist die API-Preisgestaltung. Rechnen Sie damit, dass der Zugang zu Modellen im nächsten oder übernächsten Jahr teurer wird, insbesondere bei Modellen, die mit lizenziertem Material trainiert wurden, wo die Lizenz selbst nun Teil der Warenkosten ist.
Es gibt eine zweite, leisere Implikation für alle, die KI-Workloads hosten oder betreiben. Wenn Sie Trainingsdatensätze für einen Kunden speichern, hängt das rechtliche Risiko jetzt davon ab, woher diese Dateien stammen, und nicht davon, was der Kunde damit tut. Eine klare Dokumentation der Herkunft ist nicht länger Overhead, sondern beginnt, das zu sein, was verhindert, dass ein Urteil in achtstelliger Höhe auf einem System landet, das Sie betreiben.
Der ungeklärte Teil ist, wie weit sich das Preismodell ausbreitet. Textverlage haben eine kollektive Lizenzinfrastruktur und einen Bestand abgeschlossener Fälle, auf den sie verweisen können. Musik hat Verwertungsgesellschaften, aber eine andere Output-Beziehung. Bilder, Video und Code haben jeweils ihre eigene Dynamik, und keines davon hat bislang einen Maßstab pro Werk. Metas Einigung entfernt einen Orientierungspunkt von der Karte. Sie zeichnet den Rest nicht, und die nächsten paar Einigungen werden entscheiden, ob Erlaubnis zu einem Markt wird oder eine Reihe von Ausnahmen bleibt.
Verwandte Artikel
Der Speicherchip ist jetzt der Engpass beim KI-Computing
Die Logik-Roadmap ist öffentlich und vorhersehbar. Die Speicher-Roadmap wird von Packaging-Ausbeuten, einer über Jahre aufgebauten Talentbasis und den Investitionsplänen dreier Unternehmen begrenzt.
KI-Musik hat eine Lizenz erhalten. Lesen Sie, was sie tatsächlich abdeckt.
Billige Tracks gibt es noch. Was verschwindet, ist die Annahme, dass ein aus einem Prompt generierter Track frei von Ansprüchen ist – was nie stimmte und jetzt nachweislich falsch ist.
Hengdians Studios stehen leer, während Asiens KI-Filmpipeline läuft
Hengdians leere Studios sind der Beweis, dass die Branche ihre Wette bereits gesetzt hat, ob das Publikum zustimmt oder nicht.
Google kauft 890 Megawatt Kernkraft für seine Rechenzentren
Die Rechenleistung ist verfügbar. Der Strom ist das, was Jahre im Voraus organisiert werden muss, so wie eine Lieferkette organisiert wird.