Le Ninth Circuit estime que les sorties de Copilot ne sont pas des copies dépouillées

Une cour d'appel fédérale a offert à GitHub et OpenAI une victoire étroite mais lourde de conséquences, et ce faisant, elle a tracé une ligne que toute entreprise entraînant un modèle sur le travail d'autrui devrait lire attentivement.
L'affaire est Doe c. GitHub. Les demandeurs sont des programmeurs anonymes qui ont publié du code open source sous des licences exigeant l'attribution. Les défendeurs sont GitHub, sa société mère Microsoft et les entités OpenAI. Les produits en cause sont GitHub, Copilot et OpenAI Codex, tous entraînés sur des dépôts publics.
Les demandeurs ont avancé deux théories au titre du Digital Millennium Copyright Act, toutes deux fondées sur l'article 1202, qui interdit de supprimer ou de modifier les informations de gestion des droits d'auteur. La première était une théorie des données d'entrée : les défendeurs auraient dépouillé le code des demandeurs de ses données d'attribution avant de l'injecter dans Copilot comme données d'entraînement. La seconde était une théorie des sorties : Copilot renverrait parfois des données d'entraînement mémorisées sans l'attribution du code source, et cela équivaudrait à supprimer ou modifier ces informations.

La théorie des données d'entrée n'a jamais été plaidée
Le Ninth Circuit a refusé d'examiner la demande relative à l'étape d'entraînement, et la raison mérite d'être soulignée. Devant la juridiction inférieure, l'avocat des demandeurs a concédé que la copie des données d'entraînement « ne violait peut-être pas » les licences, et le tribunal de district a déclaré clairement que la plainte « ne portait pas sur l'entraînement ». Les demandeurs n'ont pas objecté. En appel, la formation a considéré la théorie comme abandonnée.
Cet abandon compte plus qu'il n'y paraît. La question de l'étape d'entraînement est celle qui aurait touché tous les modèles entraînés sur des données aspirées ou sous licence. En la perdant sur une concession procédurale plutôt que sur le fond, les demandeurs ont laissé la plus grande question ouverte, et l'ont laissée pour une autre affaire.
Pourquoi la théorie des sorties a échoué
Sur le fond, la cour a rejeté la théorie des sorties en s'appuyant sur la description que les demandeurs eux-mêmes faisaient du fonctionnement de Copilot. La plainte décrivait un « processus probabiliste complexe » qui infère des schémas statistiques et prédit la complétion la plus probable. Selon la formation, cela décrit une génération plutôt qu'une récupération, et une œuvre générée « ne peut raisonnablement être décrite comme une copie » du code protégé.
La cour a opposé Copilot à un moteur de recherche. Un moteur de recherche récupère des copies stockées, il dispose donc d'une copie dont l'attribution pourrait être supprimée. Un modèle qui prédit le token suivant ne détient pas, selon la lecture de la cour, une telle copie.
La formation s'est ensuite penchée sur ce qu'on appelle l'exigence d'identité, et elle a fait ici quelque chose qui sera cité dans les mémoires pendant des années. Elle a refusé de traiter l'identité comme un élément distinct d'une demande fondée sur l'article 1202. Elle a plutôt décrit l'identité comme une glose sur les termes de la loi « supprimer », « modifier » et « copies », et comme un élément de preuve plutôt qu'un critère. Une reproduction quasi identique sans attribution permet de déduire que l'attribution a été supprimée. Des différences substantielles indiquent l'inverse, vers une nouvelle œuvre à laquelle aucune attribution n'a jamais été attachée.
Ce que la décision change réellement
L'effet pratique est un rétrécissement, non un répit. Les titulaires de droits d'auteur qui espéraient que le DMCA leur offrirait un raccourci pour contourner les questions plus difficiles de l'usage équitable et de la similitude substantielle doivent désormais emprunter le chemin long.
La formulation même de la cour indique où se situeront les prochains combats. Les titulaires s'appuieront davantage sur les théories relatives à l'étape d'entraînement, en soutenant que l'attribution a été retirée des données avant même qu'elles n'atteignent le modèle. Et ils continueront de faire valoir des actions en contrefaçon ordinaires concernant les sorties, où le critère est la similitude avec une œuvre protégée plutôt que la mécanique des métadonnées d'attribution.
Il y a une seconde lecture à retenir. La formation a pris soin de dire que l'identité est un élément de preuve, non un élément constitutif. Cela donne aux titulaires une voie : constituer un dossier de sorties qui reproduisent un code protégé presque mot pour mot, sans attribution, et l'inférence devient disponible. La frontière entre un modèle qui a mémorisé et un modèle qui a généralisé dépend désormais en partie de la proximité de la sortie, et de la capacité d'un demandeur à le prouver.
La dimension plus large du problème
Prenez du recul : l'affaire ressemble moins à un verdict sur l'IA qu'à un instantané d'un système juridique qui rattrape son retard de façon inégale. L'attribution n'a jamais été conçue pour survivre à un modèle probabiliste. Les informations de gestion des droits d'auteur supposent une copie à laquelle des métadonnées sont attachées. Lorsque le système produit quelque chose de nouveau à partir d'un processus statistique, il n'y a pas de copie dont les métadonnées auraient pu être retirées.
C'est un argument sur la forme de la technologie, et c'est le même argument qui apparaît dans chaque litige où les anciennes catégories ne conviennent pas. Le Ninth Circuit a choisi de lire les termes de la loi littéralement plutôt que de les étendre, ce qui est défendable et laisse aussi intacte la tension sous-jacente.
Pour les développeurs, la leçon est peu glamour. Le DMCA est un bouclier plus faible que certains l'espéraient, mais il n'a pas disparu. Pour les demandeurs, la leçon est que la théorie que vous concédez devant le tribunal de district est celle que vous perdez en appel. Et pour tous ceux qui entraînent des modèles sur du code public, la mise en garde la plus durable vient de la logique même de la cour : plus votre sortie se rapproche d'une entrée spécifique, moins le cadre de la « nouvelle œuvre » tiendra.
Ce que signifie entraîner un modèle sur le code d'autrui
Pour quiconque maintient un projet open source, la lecture pratique est plus étroite que ne le suggèrent les gros titres. La voie de l'attribution prévue par le DMCA est désormais plus difficile, mais les obligations sous-jacentes des licences n'ont pas bougé. Si votre code est sous licence MIT ou Apache, un modèle qui l'a mémorisé et le reproduit sans la mention reste un problème de licence, et le raisonnement même de la cour indique comment le prouver.
Le malaise joue aussi dans l'autre sens. La décision repose sur une description de Copilot comme un générateur probabiliste plutôt qu'un système de récupération. Cette description est exacte pour la plupart des invites et la plupart des sorties. Elle l'est moins pour la queue de distribution, où un modèle reproduit presque exactement un long passage distinctif, et c'est précisément cette queue qu'un demandeur devrait documenter pour constituer un dossier. La cour n'a pas fermé la porte à ce cas de figure. Elle a fait du dossier tout l'argument.
Il y a aussi une conséquence pratique pour l'outillage. La référence du tribunal de district au propre filtre de détection de doublons de GitHub, qui signale les correspondances de 150 caractères, fait désormais partie du dossier d'appel. Les systèmes qui mesurent déjà la proximité d'une sortie avec les données d'entraînement sont les mieux placés pour répondre à la question laissée ouverte par la cour, ce qui suggère que l'infrastructure de conformité et la stratégie contentieuse pointent dans la même direction.
Les affaires encore en cours
Cette décision arrive dans un domaine encombré. Thomson Reuters a gagné son appel contre Ross Intelligence devant le Third Circuit en septembre, sur une question d'usage équitable plutôt que de métadonnées d'attribution, et cette décision a largement reposé sur le fait que Ross avait construit un produit concurrençant la base de données même sur laquelle il s'était entraîné. La décision Copilot du Ninth Circuit et la décision Westlaw du Third Circuit répondent à des questions différentes, et ni l'une ni l'autre ne lie l'autre.
Cette divergence est l'état du droit d'auteur appliqué à l'IA en 2026. Les tribunaux tranchent les éléments qui leur parviennent, par incréments circuit par circuit, avec des faits qui se généralisent mal. Une décision sur un outil de recherche juridique dit peu de choses sur un assistant de code, et une décision sur les métadonnées d'attribution dit peu de choses sur l'usage équitable. Quiconque attend une décision unique pour trancher la question attend quelque chose que la structure du système ne produit pas.
La décision rétrécit une voie et en laisse plusieurs autres ouvertes. C'est ainsi que la plupart de ces questions de droit d'auteur liées à l'IA sont résolues en ce moment, pièce par pièce, dans l'affaire qui se présente la première.
Articles associés
13 000 captures d'écran internes se sont retrouvées sur GitHub public, et aucun attaquant ne les y a mises
Un comportement par défaut, répété sur toute une flotte, est le résultat d'une politique.
Amazon veut que des investisseurs détiennent 8 milliards de dollars de puces Nvidia qu'il utilise toujours
Les compagnies aériennes relouent leurs avions depuis des décennies. La même idée s'applique désormais aux GPU.
OpenAI a relié une campagne d'extraction de raisonnement à des personnes liées à Moonshot AI
Le modèle est devenu l'oracle de déchiffrement de son propre raisonnement caché.
Le premier festival de films IA a versé 450 000 $ et donné une leçon sur la narration
Les films lauréats ont utilisé les outils pour servir une idée qui existait déjà.