← Retour au blog
NewsEnviron 9 min de lecture

Six journaux poursuivent Microsoft et OpenAI pour des articles sous paywall dans le corpus d'entraînement

Publié le 7 oct. 2026
Six journaux poursuivent Microsoft et OpenAI pour des articles sous paywall dans le corpus d'entraînement

Le 2 octobre, six sociétés d'édition ont intenté une action contre Microsoft et dix entités d'OpenAI devant le tribunal de district des États-Unis pour le district sud du Mississippi. La plainte allègue une violation du droit d'auteur et la suppression d'informations de gestion des droits d'auteur lors du développement des modèles GPT.

Les demandeurs incluent Emmerich Newspapers, Ojai Media et plusieurs sociétés Coopwood, qui publient des journaux et des magazines dans tout le Sud. Les défendeurs sont Microsoft ainsi qu'un ensemble d'entités OpenAI liées entre elles. L'affaire est attribuée au juge Henry Travillion Wingate, le dossier ayant été mis à jour pour la dernière fois le 5 octobre.

Ce que la plainte allègue réellement

Trois allégations pèsent lourd.

Premièrement, la plainte affirme que les défendeurs ont exploré de manière systématique les sites web des demandeurs, y compris le contenu derrière des paywalls, et ont copié des articles sur leurs serveurs de façon répétée à mesure que les modèles étaient mis à jour. La copie répétée est l'élément qui compte juridiquement. Une seule exploration constitue un acte. Recopier le corpus à chaque exécution d'entraînement multiplie le nombre de copies prétendument contrefaisantes, ce qui multiplie l'exposition.

Deuxièmement, les demandeurs soutiennent que les modèles font preuve de mémorisation, en encodant des copies récupérables des œuvres d'entraînement. Cette affirmation rejoint un ensemble de litiges où la question n'est pas de savoir si l'entraînement a eu lieu, mais si le modèle résultant peut reproduire à la demande une expression protégée.

Troisièmement, la plainte allègue que des produits comme ChatGPT Search et Deep Research récupèrent en temps réel du contenu des sites web des demandeurs et l'incorporent dans leurs réponses. C'est la couche de récupération, distincte de l'entraînement. Même un modèle entraîné sur des données sous licence peut, au moment de répondre, extraire du texte d'un site qu'il n'était pas autorisé à lire.

Les demandeurs soutiennent également que les défendeurs ont supprimé des articles les crédits d'auteur, les noms de publication, les mentions de droit d'auteur et les informations sur les conditions d'utilisation. Cela correspond à la théorie des informations de gestion des droits d'auteur, qui n'exige pas de prouver que la copie sous-jacente était illicite. Supprimer une mention de droit d'auteur d'une œuvre référencée constitue en soi une violation en droit américain.

Les trois chefs de demande sont la violation directe du droit d'auteur, la suppression d'informations de gestion des droits d'auteur et le vol délibéré des articles.

Pourquoi le détail du paywall compte

L'allégation relative au paywall est l'élément le plus tranchant de la plainte, et c'est un détail qu'il vaut la peine de distinguer de la question générale de savoir si l'entraînement sur du texte protégé par le droit d'auteur relève du fair use.

Le contenu derrière un paywall se situe en dehors du web ouvert. Il est publié selon des conditions qui subordonnent l'accès, souvent à un paiement, et ces conditions interdisent généralement la collecte automatisée. Une exploration qui franchit un paywall contourne la condition d'accès elle-même, plutôt que de commettre une erreur sur les pages qui étaient publiques.

Ce cadrage s'aligne sur un changement plus large dans la manière dont les propriétaires de données plaident. Le combat passe de la question de savoir si la copie est protégée à celle de savoir si la méthode de collecte a respecté les conditions d'accès fixées par l'éditeur. Les clauses contractuelles et les conditions d'accès accomplissent un travail que le droit d'auteur seul ne pouvait pas faire.

Deux cylindres de papier journal vierge étroitement enroulés, posés côte à côte sur une surface sombre, dans un flou doux

Où cela s'inscrit dans une tendance plus large

Cette affaire rejoint une période dense de litiges en matière de droit d'auteur et d'accès. Les demandes contractuelles de Reddit contre Anthropic suivent leur cours, offrant aux plateformes une voie pour contester la collecte de données en dehors du droit d'auteur. Anthropic, dans sa contribution au Parlement australien, a proposé une « forme étroite d'approbation conditionnelle » pour l'entraînement, qui permettrait aux titulaires de droits de se retirer via robots.txt, un mécanisme que les radiodiffuseurs publics australiens ont rejeté comme étant systématiquement contourné.

Dans ces affaires, les mêmes faits techniques ne cessent d'apparaître. Les signaux robots.txt ont été ignorés par les principaux crawlers lors de tests documentés. Du contenu sous paywall semble avoir été collecté. Les fonctionnalités de récupération font apparaître le texte d'un éditeur dans les réponses, même lorsque celui-ci ne l'a jamais autorisé.

Les éditeurs concernés ici sont des entreprises régionales et locales dont les archives ont une réelle valeur et dont les budgets juridiques sont modestes. C'est précisément pourquoi cette affaire mérite d'être suivie. Une victoire pour de grands éditeurs disposant de grandes équipes juridiques met la loi à l'épreuve. Une affaire portée par des journaux régionaux teste si les recours sont utilisables par les titulaires de droits qui ne peuvent pas se permettre des années de communication de pièces.

Ce qu'une décision de justice pourrait changer

L'issue dépendra de questions autour desquelles les tribunaux tournent depuis deux ans sans les trancher. L'entraînement sur du texte protégé par le droit d'auteur relève-t-il du fair use, et la réponse change-t-elle lorsque le texte était derrière un paywall ? La mémorisation transforme-t-elle un usage d'entraînement en reproduction contrefaisante ? La récupération en temps réel crée-t-elle une responsabilité distincte de l'entraînement ? Et la suppression des mentions de droit d'auteur d'œuvres qui apparaissent dans un jeu de données compte-t-elle comme une violation même si la copie elle-même est autorisée ?

Aucune de ces questions n'est résolue. Ce que fait la plainte, c'est rattacher les quatre questions à un même ensemble de faits et les porter devant un tribunal de district. Pour quiconque construit des produits sur du contenu web public, c'est cette combinaison qu'il faut suivre. Les réponses n'arriveront pas rapidement, et la pratique actuelle de l'industrie consistant à explorer d'abord et à négocier ensuite est précisément ce que ce procès met à l'épreuve.

Pourquoi les éditeurs régionaux portent une affaire différente

L'identité des demandeurs façonne le litige d'une manière que les affaires des grandes maisons d'édition de ces dernières années n'ont pas connue.

L'affaire du New York Times, et les poursuites de l'industrie musicale qui l'ont précédée, s'appuyaient sur des archives d'entreprise pouvant se prévaloir de décennies de revenus de licences commerciales. Elles pouvaient soutenir qu'un marché existait et qu'il avait été supplanté. Un groupe de journaux régionaux présente une position probatoire différente. Leurs archives sont plus petites, leur historique de licences est plus mince, et leur demande repose plus directement sur la copie elle-même et sur la suppression d'informations de droit d'auteur.

Cela compte pour la réparation. Si les demandeurs obtiennent gain de cause sur le chef relatif aux informations de gestion des droits d'auteur, la réparation est disponible même lorsque la copie sous-jacente est contestée, car supprimer une mention constitue une violation autonome. Pour un demandeur sans long historique de licences, ce chef est la voie la plus praticable.

La couche de récupération comme risque distinct

L'allégation concernant ChatGPT Search et Deep Research mérite d'être séparée de la question de l'entraînement, car elle pointe vers un type différent de responsabilité.

L'entraînement est un acte ponctuel, quel que soit le nombre de fois où le corpus est reconstruit. La récupération se produit à chaque requête, au moment où un utilisateur la pose. Si un produit récupère en temps réel du texte sur le site d'un éditeur et l'incorpore dans une réponse, l'acte prétendument contrefaisant est continu et déclenché par l'utilisateur.

Cette distinction donne aux demandeurs une demande qui ne dépend pas de gagner l'argument sur le fair use concernant l'entraînement. Même un modèle entraîné entièrement sur des données sous licence peut, via une fonctionnalité de récupération, faire apparaître du texte provenant d'une source qu'il n'a jamais autorisée. Le cadrage de la plainte traite la récupération et l'entraînement comme deux fautes distinctes, ce qui constitue une structure plus solide que de tout rattacher au corpus d'entraînement.

Ce que les éditeurs surveillent

Deux signaux diront à l'industrie si ce type d'affaire vaut la peine d'être intenté à grande échelle.

Le premier est de savoir si le tribunal permet à la demande relative aux informations de gestion des droits d'auteur de survivre à une requête en rejet. Ce chef n'exige pas de trancher le fair use, de sorte qu'une décision favorable aux demandeurs sur ce point donnerait aux éditeurs une voie plus rapide vers une réparation qu'un procès complet pour contrefaçon.

Le second est de savoir si la communication de pièces atteint la chaîne d'entraînement. Si les demandeurs peuvent obtenir la production des enregistrements indiquant ce qui a été exploré et quand, l'affaire passe d'un argument juridique sur le fair use à un argument factuel sur ce que le crawler a réellement fait, y compris s'il a franchi des paywalls. Les praticiens du secteur de l'édition surveillent le dossier précisément pour ce type d'ordonnance, car elle leur indiquerait quels éléments de preuve peuvent être obtenus avant qu'ils ne s'engagent dans leurs propres poursuites.

Articles associés