C2PA et SynthID : après l'AI Act européen, la provenance des médias est un travail d'ingénierie

Les textes, images, audios et vidéos générés par IA sont de plus en plus difficiles à distinguer d'un travail humain. Cela a transformé la provenance d'un sujet de recherche en une exigence de pipeline, et les échéances commencent à peser.
Les obligations de transparence de l'AI Act européen au titre de l'article 50 s'appliquent à partir du 2 août 2026, avec un délai de grâce pour le marquage courant jusqu'au 2 décembre 2026. L'Inde a modifié ses IT Rules en février 2026 pour couvrir les informations générées synthétiquement. Le marquage des médias générés est désormais quelque chose qu'une équipe doit implémenter, et non quelque chose dont une équipe discute.
Trois outils qui répondent à des questions différentes
L'erreur que commettent la plupart des équipes est de considérer la provenance, le filigrane et la détection comme interchangeables. Ils ne le sont pas, et ils échouent de différentes manières.
La provenance, au sens du C2PA, est des métadonnées signées cryptographiquement, attachées à un fichier ou référencées par celui-ci. Elle répond à une question précise : qui a signé ceci, avec quel outil, et cela a-t-il changé depuis. Sa principale faiblesse est qu'elle est facile à supprimer. Une capture d'écran, un ré-encodage ou une plateforme qui supprime les métadonnées élimine le manifeste.
Un filigrane invisible est un signal intégré au contenu lui-même, que ce soit dans les pixels, les échantillons audio ou les choix de tokens. Il répond à : est-ce que cela a été produit par un système qui applique ce filigrane. Sa faiblesse est qu'un montage lourd, une réécriture ou des attaques adversariales peuvent affaiblir ou supprimer le signal, et il n'est généralement détectable que par le détecteur du fournisseur lui-même.
Un classifieur de détection est un modèle entraîné à deviner si un contenu est synthétique. Il répond à : est-ce que cela ressemble à du contenu généré par IA. Il est probabiliste, il dérive à mesure que les générateurs s'améliorent, et il produit des faux positifs sur du contenu réel.
La distinction essentielle est que la provenance et les filigranes sont appliqués au moment de la création par une partie coopérative. La détection est appliquée après coup à du contenu provenant de n'importe qui, y compris d'adversaires, ce qui en fait la forme de preuve la plus faible, bien qu'elle soit la seule option pour du contenu qui n'a jamais été marqué.
Pourquoi la détection seule ne suffit pas
La détection est une course aux armements. Les classifieurs apprennent les artefacts des générateurs connus, et de nouveaux modèles, plus un simple post-traitement, modifient ces artefacts. Les faux positifs nuisent à de vraies personnes, car des photos réelles retouchées, des vidéos compressées et des écrits non natifs sont signalés. Quand cela devient un problème d'équité, un selfie authentique d'un client est rejeté.
Et un score propre ne prouve rien. Le contenu peut provenir d'un générateur que le modèle n'a jamais vu. La recommandation pratique est de traiter la détection comme un signal de risque parmi d'autres, avec une revue humaine pour les décisions importantes.
Comment le C2PA fonctionne réellement
La Coalition for Content Provenance and Authenticity publie une norme technique ouverte pour enregistrer l'origine et l'historique des modifications d'un contenu numérique. Son comité directeur comprend notamment Adobe, Google, Microsoft, Meta, OpenAI, Amazon, Sony et la BBC. La spécification en est à sa série 2.x et est révisée régulièrement, les architectures devraient donc vérifier la version actuelle plutôt que de figer une version.
L'unité de base est le manifeste C2PA, une structure de données signée cryptographiquement décrivant la provenance d'un actif. Un magasin de manifestes peut en contenir plusieurs, un par étape de la vie de l'actif. Les assertions sont des déclarations individuelles sur l'actif, les assertions standard couvrant des actions telles que créé ou modifié, y compris par un système d'IA, ainsi que les ingrédients et les vignettes.
À la mi-2026, OpenAI attache des manifestes C2PA à chaque image produite par ses modèles d'image, et Google attache à la fois des manifestes C2PA et des filigranes SynthID aux sorties de sa génération d'images et de vidéos. Le Firefly d'Adobe fait de même depuis 2024. Les firmwares d'appareils photo de Canon, Sony, Nikon et Leica écrivent désormais des Content Credentials à la prise de vue, ce qui signifie que la même plomberie qui permet à une salle de rédaction de vérifier une photographie permet aussi à un responsable du recrutement de vérifier une photo de profil.

Ce que SynthID fait différemment
SynthID de Google DeepMind est une famille de technologies de filigrane qui adapte le signal à chaque type de contenu plutôt que d'utiliser une seule technique pour tout. Les images reçoivent un signal réparti sur l'image afin que la qualité visuelle normale soit préservée et que certaines transformations courantes ne l'effacent pas. La vidéo distribue les informations de filigrane à travers les images, aidant un vérificateur à examiner un clip plutôt qu'une zone isolée. L'audio place le signal dans le son, inaudible mais détectable par machine. Le texte amène le modèle à décaler subtilement les probabilités de tokens, un vérificateur examinant suffisamment de texte pour le motif statistique attendu.
Le filigrane textuel est le cas le plus fragile. Une réponse courte peut ne pas contenir suffisamment de preuves. Une paraphrase lourde, une traduction ou le mélange de sorties de plusieurs modèles peuvent affaiblir le motif. C'est pourquoi un résultat négatif doit être rapporté comme « aucun filigrane pris en charge détecté », plutôt que « écrit par un humain ».
Ce que cela signifie pour une équipe qui livre des médias générés
Trois pratiques découlent des différences entre ces outils.
Signez à la création et conservez l'original. Le C2PA survit parfois au ré-encodage, mais les métadonnées sont souvent supprimées en aval. Le seul enregistrement fiable de la provenance est le fichier que vous avez conservé.
Ne considérez pas un filigrane absent comme une preuve de création humaine. Un signal absent peut signifier que le générateur n'en applique pas, que l'édition l'a supprimé ou que le détecteur était indisponible. Chacun de ces cas est un fait différent.
Séparez la question technique de la question de vérité. La cryptographie C2PA aide à révéler les modifications non autorisées, mais elle ne certifie pas en soi qu'une représentation de produit est exacte ou que chaque affirmation d'un manifeste est vraie. La provenance vous dit d'où vient un fichier. Elle ne vous dit pas si le fichier est honnête.
Le marché a réagi à tout cela. Les dépenses liées au filigrane IA et à la provenance étaient évaluées à environ 480 millions de dollars en 2025, avec des projections de croissance annuelle supérieure à 28 % jusqu'en 2034. Il s'agit de dépenses d'entreprise, et non d'adoption grand public, et cela reflète une réalité simple : à mesure que le coût de génération de médias baisse, la valeur de prouver la provenance des médias augmente. Les équipes qui traitent la provenance comme une infrastructure de pipeline plutôt que comme une curiosité de laboratoire seront celles qui seront prêtes lorsque les règles de marquage s'imposeront.
À quoi ressemble un pipeline conforme
Au-delà des abstractions, une équipe qui doit marquer des médias générés a désormais besoin d'une séquence précise d'étapes, et chaque étape correspond à l'un des outils ci-dessus.
À la création, le pipeline signe la sortie. Pour les images produites via une API majeure, cela se fait automatiquement : OpenAI attache un manifeste C2PA à chaque image, Google attache à la fois un manifeste et un filigrane SynthID, et Adobe fait de même via Firefly. Une équipe qui passe par un fournisseur mineur devra peut-être ajouter le manifeste elle-même.
Tout au long de l'édition, le pipeline préserve la chaîne. Chaque outil qui touche l'actif devrait ajouter une assertion plutôt que remplacer le manifeste, afin que l'historique survive. C'est là que la plupart des pipelines fuient, car un outil qui ré-encode le fichier peut supprimer des métadonnées qu'il ne comprend pas.
À la distribution, le pipeline conserve l'original. Les plateformes suppriment régulièrement les métadonnées, recompressent les téléversements et génèrent des aperçus. Le fichier signé qui quitte le système de production est le seul enregistrement fiable, et il doit être conservé indépendamment de l'endroit où l'image est publiée.
À la couche humaine, le pipeline appose un label. Un label visible est la forme la plus simple de divulgation et celle que les régulateurs attendent pour certains usages. C'est aussi celle qui est la plus facilement recadrée, ce qui explique pourquoi elle accompagne les signaux lisibles par machine plutôt que de les remplacer.
La distinction que font les régulateurs
L'article 50 de l'AI Act européen et les IT Rules modifiées de l'Inde tracent tous deux une ligne qu'il est facile de brouiller dans une discussion d'ingénierie.
L'obligation porte sur la transparence, pas sur l'exactitude. Une image marquée est certifiée comme générée ou modifiée par un processus identifié, et c'est tout ce que le marquage affirme. La distinction compte parce qu'elle détermine à quoi sert un manifeste. Il enregistre la provenance, c'est-à-dire qui a créé le fichier et comment. Il ne se porte pas garant du contenu, c'est-à-dire de savoir si ce que le fichier représente est réel.
Se tromper sur cette distinction mène à un échec prévisible. Une équipe traite un Content Credential valide comme une preuve qu'une image est digne de confiance, alors que le credential ne confirme que l'image provient du système dont elle prétend provenir. Une photo manipulée avec un manifeste intact reste une photo manipulée, et un manifeste ne détecte pas la manipulation.
Le point clé pour une équipe en activité
Trois choses en découlent, et elles relèvent toutes de la discipline plutôt que de la technologie.
Traitez le marquage comme faisant partie de l'étape d'export, et non comme un ajout ultérieur. La provenance est appliquée à la création, et l'ajouter rétroactivement n'est pas possible pour un actif déjà en circulation.
Conservez l'original, car la copie que les autres voient sera généralement dépouillée. Le manifeste n'est utile que si une équipe peut produire le fichier qui le porte.
Et séparez la question de la provenance de celle de la détection dans la façon dont l'équipe parle de la sortie. La provenance vous dit d'où vient un fichier. La détection vous dit ce qu'un modèle devine à propos d'un contenu qu'il n'a jamais vu, ce qui est l'affirmation la plus faible. Le dire clairement, en interne comme aux clients, est ce qui permet à un programme de conformité d'être honnête sur ce qu'il peut et ne peut pas prouver.
Articles associés
Meta prend sous licence la technologie d'image et de vidéo de Midjourney, et la raison est révélatrice
Les benchmarks évoluent chaque trimestre. Le jugement d'une communauté sur ce qui est beau, non.
AssemblyAI réduit la latence de la parole en temps réel à 91 millisecondes. Voici pourquoi ce chiffre compte
La contrainte sur la voix n'a jamais été le taux d'erreur de mots. C'est l'alternance des tours de parole.
Nano Banana 2.1 de Google est une mise à jour de fonctionnalités, pas un modèle phare
Une sortie de milieu de gamme vous dit ce qu’un laboratoire pense que la plupart de ses utilisateurs ont réellement besoin, ce qui est un signal plus utile qu’un modèle phare.
La pile publicitaire vidéo s'est scindée en spécialistes, et Boreal-H3 montre pourquoi
La qualité cinématographique et le débit d'itération sont des produits différents, et une seule couche de génération ne peut pas être en tête sur les deux.