OpenAI va filigraner le texte de ChatGPT dans l'UE. Ses propres chiffres montrent à quel point c'est fragile

Le 5 octobre, OpenAI a annoncé qu'elle ajouterait un filigrane invisible au texte produit par ChatGPT et Codex dans l'Union européenne, avec un déploiement au cours des prochaines semaines auprès des utilisateurs éligibles, toutes formules confondues. La méthode, baptisée textGrain, n'insère ni symbole visible ni caractère caché que l'on pourrait supprimer avec un rechercher-remplacer. Elle oriente subtilement les choix de mot suivant du modèle à l'aide d'une clé secrète, en empilant des centaines d'inflexions statistiques qu'un détecteur pourra ensuite retrouver à partir du seul texte. Parce que le motif réside dans la formulation, il survit au copier-coller.
Le déclencheur, c'est la réglementation. L'article 50 du règlement européen sur l'IA impose aux fournisseurs de systèmes génératifs de marquer leurs contenus produits sous une forme lisible par machine. Ces obligations de transparence sont entrées en vigueur le 2 août 2026, et la Commission européenne a confirmé que les systèmes déjà sur le marché avant cette date disposent jusqu'au 2 décembre 2026. La Commission a publié en juin un code de bonnes pratiques sur le marquage et l'étiquetage des contenus générés par IA, et environ 190 organisations l'avaient signé fin juillet. Anthropic a annoncé en août qu'elle filigranerait le texte de Claude à l'échelle mondiale ; Google dispose de SynthID pour le texte. OpenAI arrive à l'heure pour une échéance qu'elle a passée deux ans à éviter.
L'entreprise a publié sa propre courbe d'échec
La partie la plus utile de l'annonce, c'est la liste de chiffres qu'OpenAI y a jointe. Avec un taux de faux positifs cible de 1 %, sur du texte anglais issu du jeu de données ELI5, le détecteur a identifié le filigrane dans environ 80 % des passages de 200 tokens et environ 95 % des passages de 400 tokens. Les mathématiques obtiennent des scores nettement plus faibles, car le modèle dispose de moins de liberté dans le choix des mots. Remplacez 10 % des mots par des synonymes dans un passage de 400 tokens, et la détection chute d'environ 92 % à 66 %. Remplacez-en 25 %, et elle tombe à environ 17 %.
Lisez ces lignes dans l'ordre et le constat est clair. Le détecteur fonctionne au mieux sur de la prose longue et peu contrainte. Un e-mail court est plus proche de 200 tokens que de 400. Le code et les mathématiques laissent peu de place pour dissimuler un signal. Un simple passage dans n'importe quel outil de paraphrase fait tendre la détection vers un pile ou face.

OpenAI énumère cinq limites, et elles méritent d'être citées dans tout document de politique que vous rédigerez ce trimestre. Le filigrane ne mesure pas la contribution humaine. Il n'établit ni propriété ni responsabilité. Il n'identifie pas l'utilisateur, puisque aucun compte, prompt ou conversation n'est lié au texte. Il ne vérifie pas l'exactitude, et un passage filigrané peut être faux. Enfin, l'absence de filigrane ne prouve pas qu'un humain a écrit le texte, car le passage peut être trop court, avoir été modifié ou traduit, provenir d'un modèle non pris en charge ou d'avant le déploiement, ou simplement d'un outil d'une autre entreprise.
Ce dernier point est celui qui causera de vrais dégâts dans la pratique. Quelqu'un soumettra la dissertation d'un étudiant ou la lettre de motivation d'un candidat à un détecteur, n'obtiendra aucune correspondance et interprétera ce résultat comme la preuve d'un travail honnête. Ou obtiendra une correspondance et l'interprétera comme la preuve d'une tricherie. Aucune de ces conclusions ne tient, et OpenAI le dit elle-même dans son propre billet.
Pourquoi le détecteur n'est pas public
L'accès à l'outil de détection est limité, au lancement, aux chercheurs agréés et aux organisations d'experts, accordé au cas par cas. Cette prudence est défendable, car un outil affichant un taux de détection de 66 % après un simple remplacement par des synonymes est facile à détourner. Cela signifie aussi que la vérification indépendante est difficile pendant le déploiement du système, ce qui est un point de départ inconfortable pour une fonctionnalité de conformité.
Il y a un précédent. En août 2024, OpenAI avait renoncé à filigraner ChatGPT après qu'une enquête interne a révélé que près de 30 % des utilisateurs réduiraient leur usage si elle le faisait. Le dispositif actuel est un compromis : limité à l'UE dans un premier temps, désactivé par défaut pour les clients de l'API partout dans le monde, qui peuvent l'activer pour certains modèles. À l'échelle mondiale, le filigranage du texte n'est pas la norme par défaut.
Ce que cela change pour quiconque produit du texte
Pour les équipes dans l'UE, le changement pratique est plus modeste que le titre ne le suggère. Les productions des collaborateurs porteront un signal que personne ne peut voir. Il ne les identifie pas, ne dégrade pas la qualité du modèle selon les mesures d'OpenAI, et suit le texte dans tout document ou e-mail client où il est collé. Si une personne ayant accès au détecteur inspecte ensuite ce texte, elle pourra peut-être le signaler. Rien dans le flux de travail n'a besoin de changer.
Le vrai risque se situe plus loin dans la chaîne, dans tout processus qui traite la détection de provenance comme un verdict. Le recrutement, l'admission, la vérification en salle de rédaction et les systèmes d'intégrité académique sont les candidats évidents, et chacun d'eux abrite un humain qui sera tenté de lire un résultat de détection comme une preuve. Les chiffres d'OpenAI eux-mêmes plaident contre. Un marqueur qu'une paraphrase de routine peut effacer peut satisfaire la lettre de l'article 50 tout en manquant l'objectif pour lequel cet article a été écrit.
L'application de la loi donne des dents à l'échéance : une infraction peut coûter jusqu'à 15 millions d'euros ou 3 % du chiffre d'affaires annuel mondial, le montant le plus élevé étant retenu. C'est pourquoi ce déploiement a lieu. Mais la question plus intéressante est de savoir si un filigrane qui s'estompe sous une retouche légère peut porter le poids que les régulateurs y placent. L'échéance du 2 décembre pour les systèmes existants, la publication publique éventuelle du détecteur et toute orientation de la Commission sur des seuils de détection acceptables sont les étapes à surveiller.
Pour l'instant, la règle la plus sûre pour toute équipe est celle qu'OpenAI a inscrite dans son propre billet : l'absence de filigrane ne prouve pas qu'un humain a rédigé un texte, et sa présence ne prouve pas que le modèle l'a écrit en entier. Les filigranes peuvent indiquer qu'un système a touché à un passage. Ils ne peuvent pas vous dire quelle part de la réflexion revient à une personne.
Comment fonctionne réellement le filigranage de texte
Il est utile de comprendre pourquoi le signal se perd si facilement. Un filigrane classique est une marque attachée à un fichier, et le supprimer revient à trouver le bon champ. textGrain emprunte une autre voie. Pendant la génération, une clé secrète biaise le choix du modèle parmi des mots suivants quasi équivalents, l'orientant vers un sous-ensemble qu'un détecteur détenant la même clé peut reconnaître. Sur des centaines de ces choix, le motif devient statistiquement visible. Parce que le biais réside dans la formulation, la marque voyage avec le texte à travers le copier-coller, un autre éditeur et une autre application.
La fragilité découle de cette même conception. Tout processus qui réécrit les mots, qu'il s'agisse d'un outil de paraphrase, d'une traduction ou d'une lourde réécriture humaine, perturbe le motif que le détecteur recherche. C'est là le compromis au cœur de tout filigrane de texte : une marque assez robuste pour survivre à une retouche légère se distingue aussi visiblement d'une écriture ordinaire, ce qui en annule l'intérêt. OpenAI a choisi une marque subtile et publié la courbe de détection qui en résulte, ce qui est plus honnête que ne le feraient la plupart des fournisseurs.
La comparaison entre laboratoires est instructive. Anthropic a annoncé en août qu'elle filigranerait les productions de Claude à l'échelle mondiale, et cette décision a suscité des critiques d'utilisateurs qui soutenaient que les instructions, le contexte et les décisions viennent de la personne, le modèle n'agissant que comme un outil. SynthID de Google fait quelque chose de similaire pour son propre texte. Ces trois approches équivalent à une convergence du secteur vers la même idée, avec les mêmes limites, ce qui suggère que la technique approche du plafond de ce qui est actuellement possible pour le texte.
Pendant ce temps, le problème plus difficile reste non résolu. Marquer du texte est relativement facile, car un passage contient des centaines de choix de mots dans lesquels encoder un signal. Les images et l'audio offrent le même type de marge statistique, et OpenAI propose déjà une vérification pour ceux-ci. Mais aucun de ces marqueurs ne répond à la question à laquelle une salle de rédaction ou un établissement scolaire a réellement besoin de réponse : celle de savoir si une affirmation précise est vraie et qui en répond. Provenance et exactitude sont deux problèmes distincts, et le filigranage ne traite que le premier.
Articles associés
L'argent se déplace vers l'IA physique : les 1,45 Md$ de SiMa.ai, et des agents qui conçoivent le matériel
Le capital arrive avant les preuves. Les déploiements des douze prochains mois diront si le pari était le bon.
Une cour d’Arizona annule une peine parce qu’une vidéo IA a parlé à la place de la victime
Reproduire ce qu’une personne a fait est une chose. Parler en son nom en est une autre, et la frontière entre les deux est désormais inscrite dans un dossier judiciaire.
Le modèle de confiance de MCP a permis à un agent empoisonné de s’infiltrer dans un autre
L’instruction ne franchit jamais de frontière dans le code, de sorte qu’aucune couche n’est laissée pour demander si la requête avait un sens.
Un mini-drame animé par IA obtient le premier certificat de propriété intellectuelle de données : comment le processus de création devient une preuve en cas de litige
Lorsque le coût marginal de la réécriture de contenu tend vers zéro, ce qui manque le plus aux créateurs n’est pas l’idée, mais une trace capable de prouver d’où vient l’idée.