Ninth Circuit: Copilots Ausgaben sind keine Kopien mit entfernten Herkunftshinweisen

Ein Bundesberufungsgericht hat GitHub und OpenAI einen knappen, aber folgenreichen Sieg beschert – und dabei eine Grenze gezogen, die jedes Unternehmen, das ein Modell mit den Werken anderer trainiert, aufmerksam lesen sollte.
Der Fall heißt Doe v. GitHub. Die Kläger sind anonyme Programmierer, die Open-Source-Code unter Lizenzen veröffentlichten, die eine Namensnennung verlangen. Die Beklagten sind GitHub, dessen Muttergesellschaft Microsoft und die OpenAI-Gesellschaften. Bei den streitgegenständlichen Produkten handelt es sich um GitHub, Copilot und OpenAI Codex, die alle auf öffentlichen Repositories trainiert wurden.
Die Kläger stützten sich auf zwei Theorien nach dem Digital Millennium Copyright Act, die beide auf Section 1202 aufbauen, welche das Entfernen oder Verändern von Copyright-Management-Informationen verbietet. Die erste war eine Input-Theorie: Die Beklagten hätten Attributionsdaten aus dem Code der Kläger entfernt, bevor sie ihn als Trainingsdaten in Copilot eingespeist hätten. Die zweite war eine Output-Theorie: Copilot gebe manchmal memorierte Trainingsdaten ohne die Namensnennung des Quellcodes zurück, und dies komme dem Entfernen oder Verändern dieser Informationen gleich.

Die Input-Theorie wurde nie verhandelt
Der Ninth Circuit lehnte es ab, über den Anspruch auf der Trainingsstufe zu entscheiden, und der Grund dafür ist beachtenswert. In der Vorinstanz räumte der Anwalt der Kläger ein, dass das Kopieren der Trainingsdaten „vielleicht“ nicht gegen die Lizenzen verstoße, und das Bezirksgericht stellte unmissverständlich fest, dass die Klage „nicht das Training“ betreffe. Die Kläger erhoben keinen Widerspruch. In der Berufung behandelte das Gremium die Theorie als verwirkt.
Diese Verwirkung ist bedeutsamer, als es scheint. Die Frage der Trainingsstufe ist diejenige, die jedes Modell betroffen hätte, das auf gescrapten oder lizenzierten Daten trainiert wurde. Indem die Kläger sie aufgrund eines prozessualen Zugeständnisses statt in der Sache verloren, ließen sie die größte Frage offen – und überließen sie einem anderen Fall.
Warum die Output-Theorie scheiterte
In der Sache wies das Gericht die Output-Theorie zurück, indem es sich auf die eigene Beschreibung der Kläger stützte, wie Copilot funktioniert. Die Klage beschrieb einen „komplexen probabilistischen Prozess“, der statistische Muster ableitet und die wahrscheinlichste Vervollständigung vorhersagt. Das, so folgerte das Gremium, beschreibe eine Generierung und keinen Abruf, und ein generiertes Werk könne „vernünftigerweise nicht als Kopie des geschützten Codes beschrieben werden“.
Das Gericht stellte Copilot einer Suchmaschine gegenüber. Eine Suchmaschine ruft gespeicherte Kopien ab, verfügt also über eine Kopie, aus der die Namensnennung entfernt werden könnte. Ein Modell, das das nächste Token vorhersagt, hält nach Lesart des Gerichts keine solche Kopie.
Das Gremium befasste sich sodann mit dem sogenannten Identitätserfordernis, und hier tat es etwas, das jahrelang in Schriftsätzen zitiert werden wird. Es weigerte sich, Identität als separates Tatbestandsmerkmal eines Anspruchs nach Section 1202 zu behandeln. Stattdessen beschrieb es Identität als Auslegungshilfe für die gesetzlichen Begriffe „remove“, „alter“ und „copies“ und als Beweismittel statt als Test. Eine nahezu identische Wiedergabe ohne Namensnennung stützt die Schlussfolgerung, dass die Namensnennung entfernt wurde. Materielle Unterschiede weisen in die andere Richtung – auf ein neues Werk, dem nie eine Namensnennung beigefügt war.
Was das Urteil tatsächlich ändert
Die praktische Wirkung ist eine Verengung, kein Aufschub. Urheberrechtsinhaber, die gehofft hatten, der DMCA biete ihnen eine Abkürzung um die schwierigeren Fragen von Fair Use und substanzieller Ähnlichkeit herum, müssen nun den langen Weg gehen.
Die Formulierung des Gerichts selbst deutet an, wo die nächsten Auseinandersetzungen liegen. Rechteinhaber werden sich stärker auf Theorien zur Trainingsstufe stützen und argumentieren, dass die Namensnennung aus den Daten entfernt wurde, bevor sie überhaupt das Modell erreichten. Und sie werden weiterhin gewöhnliche Verletzungsklagen zu Outputs verfolgen, bei denen es auf die Ähnlichkeit mit einem geschützten Werk ankommt und nicht auf die Mechanik der Attributionsmetadaten.
Es gibt eine zweite Lesart, die man festhalten sollte. Das Gremium betonte sorgfältig, dass Identität ein Beweis und kein Tatbestandsmerkmal ist. Das eröffnet Rechteinhabern einen Weg: Man baue eine Aktenlage zu Outputs auf, die geschützten Code nahezu wörtlich wiedergeben, ohne Namensnennung, und die Schlussfolgerung steht zur Verfügung. Die Grenze zwischen einem Modell, das memorisiert hat, und einem, das generalisiert hat, ist nun teils eine Frage dessen, wie nah der Output landet und wie gut ein Kläger dies beweisen kann.
Die größere Dimension des Problems
Treten Sie einen Schritt zurück, und der Fall wirkt weniger wie ein Urteil über KI und mehr wie eine Momentaufnahme eines Rechtssystems, das ungleichmäßig aufholt. Die Namensnennung war nie dafür ausgelegt, ein probabilistisches Modell zu überstehen. Copyright-Management-Informationen setzen eine Kopie mit angehängten Metadaten voraus. Wenn das System aus einem statistischen Prozess etwas Neues erzeugt, gibt es keine Kopie, aus der die Metadaten hätten entfernt werden können.
Das ist ein Argument zur Beschaffenheit der Technologie, und es ist dasselbe Argument, das in jedem Streit auftaucht, in dem die alten Kategorien nicht passen. Der Ninth Circuit entschied sich, die Worte des Gesetzes wörtlich zu lesen, statt sie zu dehnen, was vertretbar ist und zugleich die zugrunde liegende Spannung unberührt lässt.
Für Entwickler ist die Erkenntnis wenig glamourös. Der DMCA ist ein schwächerer Schutzschild, als manche gehofft hatten, aber er ist nicht verschwunden. Für Kläger lautet die Erkenntnis, dass die Theorie, die man vor dem Bezirksgericht zugesteht, die Theorie ist, die man in der Berufung verliert. Und für alle, die Modelle auf öffentlichem Code trainieren, kommt die dauerhaftere Warnung aus der Logik des Gerichts selbst: Je näher der eigene Output an einem bestimmten Input landet, desto weniger wird die Einordnung als „neues Werk“ tragen.
Was es bedeutet, ein Modell auf dem Code anderer zu betreiben
Für alle, die ein Open-Source-Projekt betreuen, ist die praktische Lesart enger, als die Schlagzeilen nahelegen. Der DMCA-Weg über die Namensnennung ist nun schwieriger, aber die zugrunde liegenden Lizenzpflichten haben sich nicht geändert. Wenn Ihr Code unter MIT- oder Apache-Lizenz steht, ist ein Modell, das ihn memorisiert und ohne den Hinweis wiedergibt, weiterhin ein Lizenzproblem, und die Argumentation des Gerichts selbst weist darauf hin, wie man es beweist.
Das Unbehagen wirkt auch in die andere Richtung. Die Entscheidung stützt sich auf die Beschreibung von Copilot als probabilistischem Generator und nicht als Abrufsystem. Diese Beschreibung trifft auf die meisten Prompts und die meisten Outputs zu. Weniger zutreffend ist sie für den Randbereich, in dem ein Modell eine lange, unverwechselbare Passage nahezu exakt wiedergibt, und genau um diesen Randbereich müsste ein Kläger eine Aktenlage aufbauen. Das Gericht hat die Tür für diesen Fall nicht geschlossen. Es hat die Aktenlage zum gesamten Argument gemacht.
Es gibt auch eine praktische Konsequenz für Tooling. Die Bezugnahme des Bezirksgerichts auf GitHubs eigenen Duplikaterkennungsfilter, der Übereinstimmungen von 150 Zeichen markiert, ist nun Teil der Berufungsakte. Systeme, die bereits messen, wie nah ein Output an Trainingsdaten liegt, sind am besten geeignet, die vom Gericht offengelassene Frage zu beantworten, was nahelegt, dass Compliance-Infrastruktur und Prozessstrategie in dieselbe Richtung zeigen.
Die noch anhängigen Fälle
Diese Entscheidung trifft auf ein dichtes Feld. Thomson Reuters gewann im September seine Berufung gegen Ross Intelligence im Third Circuit zu einer Frage des Fair Use und nicht der Attributionsmetadaten, und jenes Urteil stützte sich stark darauf, dass Ross ein Produkt entwickelte, das mit genau der Datenbank konkurrierte, mit der es trainiert wurde. Die Copilot-Entscheidung des Ninth Circuit und die Westlaw-Entscheidung des Third Circuit beantworten unterschiedliche Fragen, und keine von beiden ist für die andere maßgeblich.
Diese Divergenz ist der Stand des KI-Urheberrechts im Jahr 2026. Gerichte entscheiden die Bruchstücke, die zu ihnen gelangen, in Inkrementen von Circuit zu Circuit, mit Sachverhalten, die sich schlecht verallgemeinern lassen. Ein Urteil über ein juristisches Recherchewerkzeug sagt wenig über einen Code-Assistenten, und ein Urteil über Attributionsmetadaten sagt wenig über Fair Use. Wer auf eine einzige Entscheidung wartet, die die Frage klärt, wartet auf etwas, das die Struktur des Systems nicht hervorbringt.
Die Entscheidung verengt einen Weg und lässt mehrere andere offen. So werden die meisten dieser KI-Urheberrechtsfragen derzeit gelöst – Stück für Stück, in dem Fall, der zufällig zuerst dort ankommt.
Verwandte Artikel
13.000 interne Screenshots landeten auf öffentlichem GitHub – und kein Angreifer hat sie dort abgelegt
Ein Standardverhalten, über eine ganze Flotte hinweg wiederholt, ist das Ergebnis einer Richtlinie.
Amazon will, dass Investoren Nvidia-Chips im Wert von 8 Milliarden Dollar besitzen, die es weiterhin nutzt
Fluggesellschaften haben Flugzeuge jahrzehntelang zurückgeleast. Nun wird dieselbe Idee auf GPUs übertragen.
OpenAI führte eine Kampagne zur Reasoning-Extraktion auf Personen mit Verbindungen zu Moonshot AI zurück
Das Modell wurde zum Entschlüsselungs-Orakel für sein eigenes verborgenes Reasoning.
Das erste KI-Filmfestival zahlte 450.000 Dollar aus und lehrte eine Lektion über das Erzählen
Die Gewinnerfilme nutzten die Werkzeuge, um einer bereits existierenden Idee zu dienen.