← Torna al blog
Newscirca 7 min di lettura

Il watermark non tiene il passo con i falsi

Pubblicato 4 ott 2026
Il watermark non tiene il passo con i falsi

Ora le piattaforme etichettano automaticamente i contenuti generati dall'IA. Un nuovo audit suggerisce che le etichette continuano a mancare i falsi che contano di più.

I ricercatori hanno verificato l'etichettatura AI su Instagram, TikTok, X e YouTube, usando come riferimento le linee guida sui deepfake della Commissione europea di luglio 2026. Tutte e quattro le piattaforme applicavano le etichette automaticamente, e una quota maggiore di etichette era applicata dalla piattaforma stessa anziché da chi caricava il contenuto, il che rappresenta un progresso rispetto agli audit precedenti. Il problema è la copertura.

Solo il 33 per cento dei deepfake identificati dagli esperti in contesti di rischio sistemico riportava un'etichetta AI applicata dalla piattaforma. Gli elementi non etichettati raggiungevano una mediana di 160.000 visualizzazioni, il che significa che un vasto pubblico li ha visti senza alcun avviso allegato. Nei caricamenti controllati di contenuti generati dall'IA che riportavano segnali di provenienza standard, le piattaforme hanno etichettato solo il 61 per cento e hanno rimosso del tutto i segnali nascosti dal 39 per cento dei caricamenti.

Quest'ultimo dato è quello che dovrebbe preoccupare chiunque costruisca sulla provenienza. L'etichetta viene applicata in superficie. Il segnale che permetterebbe di tracciare l'elemento in seguito viene rimosso al momento dell'ingresso.

Perché il segnale scompare

Le piattaforme ricodificano i media. Li ridimensionano, li comprimono, rimuovono i metadati e li ospitano di nuovo. Ognuno di questi passaggi è ostile a un watermark fragile, e i sistemi che associano la provenienza al momento della generazione non possono controllare ciò che accade dopo.

Questa è la tensione che l'audit mette in luce. Le aziende che generano media sintetici hanno in gran parte fatto il lavoro di firmare il proprio output. Le piattaforme che li distribuiscono non hanno fatto il lavoro di preservare la firma e, in molti casi, la loro normale elaborazione la rimuove prima che qualcuno veda il post.

Il risultato è un regime di etichettatura che funziona quando chi carica collabora e fallisce quando non lo fa. Un utente che vuole che il proprio contenuto AI sia etichettato di solito lo ottiene. Un utente che lo vuole non etichettato può ricodificare il file, e le pipeline della piattaforma stessa spesso lo aiutano.

Cosa può e non può fare un watermark

SynthID di Google DeepMind è il tentativo più ampiamente diffuso di risolvere il problema dell'aggancio, e un podcast pubblicato dal laboratorio il 1° ottobre ha esposto gli obiettivi di progettazione con una chiarezza insolita. Condotto da Hannah Fry e con la partecipazione di Pushmeet Kohli, vicepresidente scientifico di DeepMind e uno degli architetti di SynthID, insieme al ricercatore di biosicurezza Jeremy Radcliffe, l'episodio descrive cosa rende utile un watermark: dovrebbe essere impercettibile per le persone, difficile da rimuovere anche dopo modifiche e trasformazioni, e facile da integrare e rilevare su larga scala.

L'embedder e il detector di SynthID sono addestrati insieme contro un avversario che ritaglia, ruota, riduce e aggiunge rumore ai contenuti, così il marchio è costruito per sopravvivere esattamente all'elaborazione che rimuove i segnali più deboli. Il rilevamento è integrato nell'app Gemini. I partner che condividono le proprie chiavi possono essere verificati tramite un servizio centrale. Le organizzazioni giornalistiche hanno usato SynthID per verificare immagini che circolano online.

Questa è una posizione tecnica forte contro la rimozione accidentale. Non è una posizione forte contro la rimozione deliberata, e il podcast è onesto riguardo al limite. Marcatori e metadati possono essere rimossi o alterati. I marcatori testuali possono essere offuscati riscrivendo. Un watermark aumenta il costo della cancellazione. Non rende impossibile la cancellazione.

Dalle immagini alle proteine

La seconda metà dell'episodio si sposta in un territorio più strano. Radcliffe descrive SynthID Bio, una proof of concept che applica le stesse idee a sequenze biologiche progettate dall'IA, così che una sequenza prodotta da un modello possa essere distinta da una trovata in natura.

Lo scopo è la tracciabilità prima della sintesi. Se un progetto ha origine da un sistema di IA, contrassegnarlo significa che l'origine può essere stabilita prima che venga costruito qualcosa di fisico, il che conta per la biosicurezza in un modo in cui una fotografia con watermark non conta. Lo stesso principio che protegge una redazione che controlla un'immagine in circolazione viene esteso a un laboratorio che decide se una sequenza debba esistere.

L'analogia non è perfetta. Le sequenze proteiche e di DNA hanno vincoli funzionali che le immagini non hanno, e la proof of concept è agli inizi. Ma mostra quanto lontano può arrivare l'idea di provenienza una volta accettato che la domanda non è "questo è reale" ma "chi ha firmato questo, e quando".

L'orologio normativo e il divario di fiducia

Le regole hanno recuperato terreno più in fretta degli strumenti. Gli obblighi di trasparenza dell'AI Act dell'UE si applicano dal 2 agosto 2026, richiedendo etichette leggibili da macchina per alcuni contenuti generati o manipolati dall'IA e avvisi visibili al pubblico per i deepfake e per alcuni materiali di interesse pubblico. Le sanzioni ai sensi dell'articolo 50 possono raggiungere i 15 milioni di euro o il 3 per cento del fatturato annuo globale, se superiore. Anthropic ha annunciato il watermarking per i contenuti prodotti da Claude, unendosi a un elenco di laboratori che ora contrassegnano il proprio output.

Anche le aspettative dei consumatori si sono spostate. In un sondaggio Capgemini del 2026 su 12.000 consumatori, il 67 per cento ha dichiarato di aspettarsi che le aziende indichino chiaramente quando una pubblicità mostrata loro è stata generata dall'IA. La richiesta di etichettatura non arriva solo dai regolatori.

Ciò che l'audit suggerisce è che l'etichetta e la fiducia si stanno allontanando. Le piattaforme possono indicare un sistema di etichettatura automatica e la conformità alle policy. Uno spettatore che guarda un deepfake non etichettato con 160.000 visualizzazioni non ha modo di sapere se l'assenza di un'etichetta significhi che il contenuto è autentico o che l'etichetta ha fallito. L'assenza di prove viene letta come prova di autenticità, che è l'opposto di ciò che un regime di etichettatura dovrebbe produrre.

La versione quotidiana del problema

I numeri dell'audit descrivono contesti di rischio sistemico, ma lo stesso meccanismo governa i contenuti ordinari. Un'immagine generata dall'IA di un prodotto, di una persona o di un luogo che circola senza un marchio viene trattata come una fotografia da quasi tutti coloro che la vedono, e la correzione, se mai arriva, arriva molto dopo che l'elemento ha viaggiato.

Un episodio separato ha reso il punto in modo più crudo. Un'immagine generata dall'IA di una scarpa inesistente, attribuita a un designer, si è diffusa attraverso i media e i social network ungheresi ed è stata citata in commenti di esperti prima che qualcuno stabilisse che l'oggetto non esisteva. Nessuno stava riciclando un segreto di Stato. Stavano facendo circolare un'immagine che sembrava plausibile, e la fase di verifica non è mai avvenuta perché farlo era più difficile che condividerla.

Questo è il problema pratico che il watermarking dovrebbe affrontare, ed è un problema di default più che di avversari determinati. La maggior parte delle persone non rimuoverà un marchio. Tratterà semplicemente la sua assenza come significativa, che lo intendano o no.

Cosa colmerebbe davvero il divario

Due cambiamenti sposterebbero i numeri più di qualsiasi miglioramento al watermarking. Il primo è la conservazione: le piattaforme dovrebbero trasportare la provenienza attraverso la propria elaborazione anziché rimuoverla, il che è un impegno infrastrutturale, non un problema di modello. Il secondo è un segnale pubblico per le etichette mancanti, così che un elemento non etichettato sia trattato come non verificato anziché verificato.

C2PA Content Credentials, lo standard di provenienza sostenuto da un gruppo di membri che comprende Adobe, Amazon, BBC, Google, Meta, Microsoft, OpenAI e Sony, è il veicolo più probabile per il primo. Allega un manifest firmato crittograficamente al momento della cattura o dell'esportazione e consente a chiunque di verificarlo con strumenti aperti. Non può rilevare falsi creati prima della firma e non classifica nulla come reale o falso. Ciò che fa è creare una catena di custodia, che è precisamente ciò che si perde sulla strada verso un feed.

Finché quella catena non sopravvive al caricamento, il riepilogo onesto dell'etichettatura AI nel 2026 è scomodo. I sistemi funzionano. La copertura no. E il divario viene riempito da qualunque cosa il pubblico decida di dare per scontata.

Articoli correlati