← Retour au blog
NewsEnviron 8 min de lecture

Meta a réglé le litige sur les livres. La permission a désormais un prix.

Publié le 7 oct. 2026
Meta a réglé le litige sur les livres. La permission a désormais un prix.

Meta a accepté de régler à l'amiable l'action collective qui l'accusait d'avoir entraîné ses modèles Llama sur des livres piratés. L'accord proposé a été déposé devant un tribunal fédéral fin septembre, et la notification a été envoyée aux ayants droit quelques jours plus tard. Les conditions financières restent confidentielles jusqu'à leur approbation par un juge, et Meta continue d'affirmer publiquement que ses pratiques d'entraînement relèvent du fair use. Ce que l'accord ne dit pas est tout aussi révélateur que ce qu'il dit.

L'affaire portait sur le volet de l'acquisition plutôt que sur celui de l'entraînement. Les auteurs alléguaient que les modèles Llama avaient été entraînés sur des œuvres extraites de bibliothèques de l'ombre telles que LibGen entre 2018 et 2024. Ce détail compte, car une décision distincte a déjà tracé une ligne au milieu de ce problème. Dans l'affaire Anthropic, le juge William Alsup a estimé que l'entraînement d'un modèle sur des livres protégés par le droit d'auteur est licite, mais que conserver une bibliothèque de copies piratées ne l'est pas. La sanction dans cette affaire, un règlement de 1,5 milliard de dollars, était liée à la manière dont les livres avaient été obtenus, non à l'apprentissage lui-même.

Lus ensemble, ces deux résultats décrivent une règle facile à énoncer et difficile à appliquer. Apprendre à partir d'un livre que l'on a acquis légalement est acceptable. Constituer un corpus à partir de copies piratées ne l'est pas. Le montant de 1,5 milliard de dollars équivaut à environ 3 000 dollars par œuvre, ce qui donne à chaque laboratoire un moyen d'évaluer son propre risque. Si vous avez aspiré un corpus depuis un site de piratage, vous disposez désormais d'un ordre de grandeur approximatif du coût de cette décision.

L'opt-out cède la place à un prix

Le changement plus lourd de conséquences est ce qui se profile ensuite. Un autre règlement rapporté ce mois-ci a remplacé le modèle de registre d'opt-out volontaire par une structure de redevances de licence obligatoires liée à la quantité de données utilisées. L'argument est sans détour : les portes de sortie de l'opt-out semblaient équitables sur le papier et ont échoué dans la pratique, car les développeurs vérifiaient ou respectaient rarement les listes d'exclusion. Payer à l'ouvrage est plus difficile à ignorer.

Cela recadre toute la négociation. Avec l'opt-out, le seul levier d'un ayant droit était de dire non en espérant être entendu. Avec une licence tarifée, la permission devient une ligne budgétaire assortie d'un montant, et le débat passe de « les entreprises d'IA peuvent-elles utiliser l'œuvre ? » à « combien doivent-elles payer pour cela ? ». Pour les éditeurs et les auteurs, c'est une position bien meilleure qu'une barrière technique que personne n'appliquait.

L'effet concret pour les laboratoires est un nouveau budget de conformité. La provenance des données cesse d'être une préférence d'ingénierie pour devenir une exigence juridique. Si un corpus parmi un jeu de données de plusieurs pétaoctets provient d'une source impossible à documenter, il introduit une responsabilité spécifique dans toute la chaîne d'entraînement, et la défaillance se produit généralement dans la couche d'agrégation, où des jeux de données tiers sont combinés sans attribution claire.

La question des sorties reste ouverte

Les données d'entraînement ne sont qu'un des deux fronts. L'autre est ce que le modèle produit, et là, le tableau est moins stabilisé. Le New York Times a survécu à la motion de rejet d'OpenAI en alléguant de manière plausible que les sorties de ChatGPT concurrencent son journalisme. C'est une théorie de la substitution sur le marché, et elle se distingue de la théorie de l'acquisition. Si le modèle apprend d'une œuvre sans la reproduire, l'argument de transformation tient. Si sa sortie se substitue à l'original sur le marché, l'argument s'affaiblit.

Rejeter une motion de rejet ne constitue pas une reconnaissance de responsabilité, et l'affaire du Times suit toujours son cours. Mais les deux théories, prises ensemble, expliquent pourquoi les entreprises d'IA traitent désormais la provenance et la surveillance des sorties comme un seul problème. Un modèle entraîné sur des données sous licence peut encore générer quelque chose qui concurrence la source, et les conditions de licence précisent de plus en plus ce qu'il ne peut pas faire.

L'audio ne suit pas le même chemin

Si les éditeurs de livres s'orientent vers un marché de licences, la musique s'achemine vers quelque chose de plus désordonné. Suno a perdu une décision en Allemagne, intentée par la GEMA, la société de gestion des droits d'exécution, concernant l'utilisation d'enregistrements et de compositions protégés par le droit d'auteur. Les affaires américaines sur le texte se règlent en grande partie par des paiements et des licences rétrospectives. Les affaires audio produisent des injonctions et des batailles de compétence, ce qui, pour une entreprise de produits, est le pire résultat, car une injonction arrête le service au lieu de le taxer.

La différence semble tenir à la proximité entre la sortie et l'entrée. Un modèle linguistique qui résume un livre se situe à un degré de retrait du texte. Un modèle musical qui génère une chanson dans le style d'un artiste s'en rapproche suffisamment pour que la comparaison soit immédiate, et les tribunaux ont été moins enclins à étendre l'argument de transformation pour le couvrir.

Là où le prix n'existe pas encore

Le repère du prix par œuvre est, pour l'instant, un phénomène propre au texte, et la raison en est l'infrastructure. Les éditeurs de livres disposent d'organismes de licence collective, de décennies de précédents sur les droits de reproduction et d'une unité d'échange relativement claire : l'œuvre. Cela rend un prix par titre facile à définir et facile à débattre devant un tribunal.

Une pile bien nette de livres à couverture rigide crème vierges à côté d'une petite balance en laiton supportant des poids simples sur une surface en lin chaud.

Les images, la vidéo et le code n'ont pas la même configuration. Une banque de photos peut facturer une licence par image, mais une capture d'écran d'une page web contient des dizaines d'éléments protégés par le droit d'auteur à la fois, et un dépôt de code mélange des fichiers sous licence, sous licence permissive et non attribuables dans une même arborescence. Dès que la question passe du texte à l'un de ces domaines, la formule par œuvre cesse de s'appliquer et le débat revient au fair use, le terrain sur lequel les entreprises d'IA préféreraient se battre.

L'autre question ouverte est de savoir qui perçoit. Une redevance de licence que personne n'administre finit de toute façon en action collective, et les structures de règlement rapportées ce mois-ci décrivent encore des paiements négociés au cas par cas plutôt qu'un marché permanent avec des tarifs publiés. Tant que les tarifs ne sont pas publics, chaque négociation se déroule en privé, les plus gros acheteurs obtenant les meilleures conditions. C'est la forme d'un marché qui s'est constitué mais n'a pas encore mûri.

Ce que cela signifie si vous développez sur ces modèles

La plupart des développeurs qui lisent ceci n'entraînent pas de modèles de fondation, leur exposition directe est donc faible. L'exposition indirecte ne l'est pas. Les laboratoires qui absorbent des règlements à huit et neuf chiffres répercutent le coût, et le mécanisme est le prix des API. Prévoyez une hausse du budget d'accès aux modèles au cours des un à deux prochaines années, en particulier pour les modèles entraînés sur des contenus sous licence, où la licence elle-même fait désormais partie du coût des biens.

Il existe une seconde implication, plus discrète, pour quiconque héberge ou exécute des charges de travail d'IA. Si vous stockez des jeux de données d'entraînement pour un client, le risque juridique dépend désormais de l'origine de ces fichiers, et non de ce que le client en fait. Une documentation claire de la provenance cesse d'être une charge administrative et devient ce qui empêche un jugement à huit chiffres de retomber sur un système que vous exploitez.

La partie non réglée est l'ampleur de la diffusion du modèle de tarification. Les éditeurs de textes disposent d'une infrastructure de licence collective et d'un ensemble d'affaires réglées à invoquer. La musique a des sociétés de gestion, mais une relation de sortie différente. Les images, la vidéo et le code ont chacun leur propre dynamique, et aucun ne dispose encore d'un repère par œuvre. Le règlement de Meta retire un point de repère de la carte. Il ne dessine pas le reste, et les prochains règlements détermineront si la permission devient un marché ou reste une série d'exceptions.

Articles associés