← Torna al blog
Newscirca 7 min di lettura

OpenAI applicherà un watermark al testo di ChatGPT nell'UE. I suoi stessi numeri mostrano quanto sia fragile

Pubblicato 6 ott 2026
OpenAI applicherà un watermark al testo di ChatGPT nell'UE. I suoi stessi numeri mostrano quanto sia fragile

Il 5 ottobre, OpenAI ha annunciato che aggiungerà un watermark invisibile al testo prodotto da ChatGPT e Codex nell'Unione europea, con un rilascio nelle prossime settimane per gli utenti idonei su tutti i piani. Il metodo, chiamato textGrain, non inserisce un simbolo visibile né un carattere nascosto che si possa eliminare con trova e sostituisci. Plasma sottilmente le scelte della parola successiva del modello usando una chiave segreta, accumulando centinaia di piccole spinte statistiche che un rilevatore può poi recuperare dal solo testo. Poiché il pattern vive nella formulazione, sopravvive al copia e incolla.

Il fattore scatenante è la regolamentazione. L'articolo 50 dell'AI Act dell'UE impone ai fornitori di sistemi generativi di contrassegnare il proprio output in un formato leggibile da una macchina. Tali obblighi di trasparenza sono entrati in vigore il 2 agosto 2026, e la Commissione europea ha confermato che i sistemi già sul mercato prima di tale data hanno tempo fino al 2 dicembre 2026. La Commissione ha pubblicato a giugno un Codice di buone pratiche sulla marcatura ed etichettatura dei contenuti generati dall'IA, e circa 190 organizzazioni avevano aderito entro la fine di luglio. Anthropic ha dichiarato ad agosto che avrebbe applicato un watermark al testo di Claude in tutto il mondo; Google ha SynthID per il testo. OpenAI arriva puntuale a una scadenza che ha evitato per due anni.

L'azienda ha pubblicato la propria curva di fallimento

La parte più utile dell'annuncio è l'elenco di numeri che OpenAI vi ha affiancato. Con un tasso target di falsi positivi dell'1%, su testo inglese tratto dal dataset ELI5, il rilevatore ha identificato il watermark in circa l'80% dei passaggi da 200 token e in circa il 95% dei passaggi da 400 token. La matematica ha ottenuto risultati sostanzialmente inferiori, perché il modello ha meno libertà nella scelta delle parole. Sostituendo il 10% delle parole con sinonimi in un passaggio da 400 token, il rilevamento scende da circa il 92% al 66%. Sostituendone il 25%, scende a circa il 17%.

Leggi quelle righe in ordine e il quadro è chiaro. Il rilevatore funziona meglio su prosa lunga e poco vincolata. Una breve email è più vicina a 200 token che a 400. Codice e matematica lasciano poco spazio per nascondere un segnale. Un leggero passaggio attraverso qualsiasi strumento di parafrasi spinge il rilevamento verso il lancio di una moneta.

Una lente d'ingrandimento tenuta sopra un foglio di carta bianco

OpenAI elenca cinque limiti, e vale la pena citarli in qualsiasi documento di policy scriviate questo trimestre. Il watermark non misura il contributo umano. Non stabilisce proprietà o responsabilità. Non identifica l'utente, poiché nessun account, prompt o conversazione è legato al testo. Non verifica l'accuratezza, e un passaggio con watermark può essere falso. Infine, l'assenza di un watermark non prova che il testo sia stato scritto da un umano, perché il passaggio potrebbe essere troppo breve, potrebbe essere stato modificato o tradotto, potrebbe provenire da un modello non supportato o da prima del rilascio, oppure potrebbe semplicemente venire dallo strumento di un'altra azienda.

Quest'ultimo punto è quello che causerà danni reali nella pratica. Qualcuno inserirà il saggio di uno studente o la lettera di presentazione di un candidato in un rilevatore, non otterrà alcuna corrispondenza e tratterà il risultato come prova di un lavoro onesto. Oppure otterrà una corrispondenza e la tratterà come prova di imbrogli. Nessuna delle due conclusioni è conseguente, e OpenAI lo dice nel proprio post.

Perché il rilevatore non è pubblico

L'accesso allo strumento di rilevamento è limitato al lancio a ricercatori approvati e organizzazioni esperte, concesso caso per caso. Questa cautela è difendibile, dato che uno strumento con un tasso di rilevamento del 66% dopo una sostituzione di sinonimi è facile da usare male. Significa anche che la verifica indipendente è difficile mentre il sistema viene distribuito, una posizione scomoda da cui far partire una funzionalità di conformità.

C'è un precedente. Nell'agosto 2024, OpenAI ha rifiutato di applicare un watermark a ChatGPT dopo che un sondaggio interno aveva rilevato che quasi il 30% degli utenti avrebbe ridotto l'utilizzo se lo avesse fatto. L'attuale assetto è un compromesso: solo UE all'inizio, disattivato per impostazione predefinita per i clienti API di tutto il mondo, che possono optare per modelli selezionati. A livello globale, il watermarking del testo non è l'impostazione predefinita.

Cosa cambia per chiunque distribuisca testo

Per i team nell'UE, il cambiamento pratico è più piccolo di quanto suggerisca il titolo. L'output dello staff porterà un segnale che nessuno può vedere. Non li identifica, non degrada la qualità del modello secondo le misurazioni di OpenAI, e segue il testo in qualsiasi documento o email cliente in cui viene incollato. Se qualcuno con accesso al rilevatore ispezionerà in seguito quel testo, potrebbe essere in grado di segnalarlo. Nulla nel flusso di lavoro deve cambiare.

Il rischio reale si trova più avanti nella catena, in qualsiasi processo che tratti il rilevamento della provenienza come un verdetto. Assunzioni, ammissioni, verifica nelle redazioni e sistemi di integrità accademica sono i candidati ovvi, e ciascuno di essi contiene un essere umano che sarà tentato di leggere un risultato di rilevamento come prova. I numeri stessi di OpenAI sostengono il contrario. Un marcatore che la parafrasi di routine può rimuovere può soddisfare la lettera dell'articolo 50 ma fallire il compito per cui l'articolo è stato scritto.

L'applicazione fornisce mordente alla scadenza: una violazione può costare fino a 15 milioni di euro o il 3% del fatturato annuo globale, se superiore. Ecco perché il rilascio sta avvenendo. Ma la domanda più interessante è se un watermark che svanisce sotto una leggera modifica possa sostenere il peso che i regolatori gli stanno attribuendo. La scadenza del 2 dicembre per i sistemi legacy, l'eventuale rilascio pubblico del rilevatore e qualsiasi guida della Commissione su soglie di rilevamento accettabili sono le tappe da monitorare.

Per ora, la regola più sicura per qualsiasi team è quella che OpenAI ha scritto nel proprio post: un watermark assente non prova che un umano abbia scritto un testo, e uno presente non prova che il modello lo abbia scritto tutto. I watermark possono indicare che un sistema ha toccato un passaggio. Non possono dirti quanto del pensiero sia stato di una persona.

Come funziona davvero il watermarking del testo

Aiuta vedere perché il segnale è così facile da perdere. Un watermark convenzionale è un marchio allegato a un file, e cancellarlo è questione di trovare il campo giusto. textGrain segue una strada diversa. Durante la generazione, una chiave segreta influenza le scelte del modello tra parole successive quasi equivalenti, spingendolo verso un sottoinsieme che un rilevatore in possesso della stessa chiave può riconoscere. Attraverso centinaia di tali scelte, il pattern diventa statisticamente visibile. Poiché il bias vive nella formulazione, il marchio viaggia con il testo attraverso copia e incolla, attraverso un editor diverso e attraverso un'app diversa.

La fragilità deriva dallo stesso design. Qualsiasi processo che riscrive le parole, che sia uno strumento di parafrasi, una traduzione o una pesante modifica umana, disturba il pattern che il rilevatore cerca. È il compromesso al centro di ogni watermark testuale: un marchio abbastanza forte da sopravvivere a una leggera modifica è anche visibilmente diverso dalla scrittura ordinaria, il che vanifica lo scopo. OpenAI ha scelto un marchio sottile e ha pubblicato la curva di rilevamento risultante, il che è più onesto di quanto farebbero la maggior parte dei fornitori.

Il confronto tra i laboratori è istruttivo. Anthropic ha dichiarato ad agosto che avrebbe applicato un watermark all'output di Claude in tutto il mondo, e la sua mossa ha attirato critiche da parte degli utenti che sostenevano che istruzioni, contesto e decisioni provengono dalla persona, con il modello che agisce come strumento. SynthID di Google fa qualcosa di simile per il proprio testo. I tre approcci equivalgono a una convergenza del settore sulla stessa idea, con gli stessi limiti, il che suggerisce che la tecnica è vicina al tetto di ciò che è attualmente possibile per il testo.

Nel frattempo, il problema più difficile resta intatto. Contrassegnare il testo è relativamente facile perché un passaggio contiene centinaia di scelte di parole in cui codificare un segnale. Immagini e audio offrono lo stesso tipo di margine statistico, e OpenAI offre già la verifica per essi. Ma nessuno di questi marcatori risponde alla domanda a cui una redazione o una scuola ha davvero bisogno di rispondere, cioè se un'affermazione specifica è vera e chi la sostiene. Provenienza e accuratezza sono problemi separati, e il watermarking affronta solo il primo.

Articoli correlati