← Torna al blog
Newscirca 7 min di lettura

Sei quotidiani fanno causa a Microsoft e OpenAI per articoli a pagamento nel set di addestramento

Pubblicato 7 ott 2026
Sei quotidiani fanno causa a Microsoft e OpenAI per articoli a pagamento nel set di addestramento

Il 2 ottobre, sei case editrici hanno presentato causa contro Microsoft e dieci entità OpenAI presso il Tribunale distrettuale degli Stati Uniti per il Distretto meridionale del Mississippi. La denuncia contesta la violazione del copyright e la rimozione di informazioni sulla gestione del copyright nello sviluppo dei modelli GPT.

Gli attori includono Emmerich Newspapers, Ojai Media e diverse società Coopwood, che pubblicano quotidiani e riviste in tutto il Sud. I convenuti sono Microsoft e un insieme di entità OpenAI tra loro correlate. Il caso è assegnato al giudice Henry Travillion Wingate, con il ruolo aggiornato da ultimo il 5 ottobre.

Che cosa contesta realmente la denuncia

Tre accuse sono quelle che pesano.

In primo luogo, la denuncia afferma che i convenuti hanno eseguito sistematicamente il crawling dei siti web degli attori, compresi i contenuti protetti da paywall, e hanno copiato gli articoli sui loro server ripetutamente man mano che i modelli venivano aggiornati. La copia ripetuta è l'elemento giuridicamente rilevante. Un singolo crawling è un solo atto. Ricopiare il corpus a ogni ciclo di addestramento moltiplica il numero di copie asseritamente illecite, il che moltiplica l'esposizione.

In secondo luogo, gli attori sostengono che i modelli presentino memorizzazione, codificando copie recuperabili delle opere di addestramento. Tale affermazione si ricollega a un insieme di contenziosi in cui la questione non è se l'addestramento sia avvenuto, ma se il modello risultante possa riprodurre su richiesta espressioni protette.

In terzo luogo, la denuncia sostiene che prodotti come ChatGPT Search e Deep Research recuperano contenuti dai siti web degli attori in tempo reale, incorporandoli nelle risposte. Questo è il livello di recupero, separato dall'addestramento. Persino un modello addestrato su dati concessi in licenza può, al momento della risposta, prelevare testo da un sito che non era autorizzato a leggere.

Gli attori sostengono inoltre che i convenuti abbiano rimosso dagli articoli i crediti degli autori, i nomi delle pubblicazioni, gli avvisi di copyright e le informazioni sui termini d'uso. Ciò corrisponde alla teoria delle informazioni sulla gestione del copyright, che non richiede di provare che la copia sottostante fosse illecita. La rimozione di un avviso di copyright da un'opera citata costituisce di per sé una violazione ai sensi del diritto statunitense.

I tre capi d'imputazione sono violazione diretta del copyright, rimozione di informazioni sulla gestione del copyright e furto intenzionale degli articoli.

Perché il dettaglio del paywall conta

L'accusa relativa al paywall è la parte più incisiva della denuncia, ed è un dettaglio che vale la pena separare dalla questione generale se l'addestramento su testi protetti da copyright costituisca fair use.

I contenuti protetti da paywall stanno al di fuori del web aperto. Sono pubblicati secondo termini che condizionano l'accesso, spesso al pagamento, e i termini di solito vietano la raccolta automatizzata. Un'operazione di crawling che oltrepassa un paywall aggira la condizione di accesso stessa, anziché commettere un errore su quali pagine fossero pubbliche.

Questa impostazione si allinea con un cambiamento più ampio nel modo in cui i titolari dei dati litigano. La battaglia si sta spostando dalla questione se la copia sia protetta a quella se il metodo di raccolta abbia rispettato le condizioni di accesso stabilite dall'editore. I termini contrattuali e di accesso stanno facendo un lavoro che il solo copyright non poteva fare.

Due cilindri di carta da giornale bianca strettamente arrotolati, adagiati fianco a fianco su una superficie scura, con messa a fuoco morbida

Come si inserisce nel quadro più ampio

Questo caso si aggiunge a una fase intensa di contenziosi su copyright e accesso. Le pretese contrattuali di Reddit contro Anthropic stanno procedendo, offrendo alle piattaforme una via per contestare la raccolta dei dati al di fuori del diritto d'autore. Anthropic, nella sua presentazione al parlamento australiano, ha proposto una «forma ristretta di approvazione condizionata» per l'addestramento che consentirebbe ai titolari dei diritti di esercitare l'opt-out tramite robots.txt, un meccanismo che le emittenti pubbliche australiane hanno respinto perché regolarmente aggirato.

In tutti questi casi, gli stessi fatti tecnici continuano a emergere. I segnali robots.txt sono stati ignorati dai principali crawler in test documentati. Contenuti protetti da paywall sembrano essere stati raccolti. Le funzioni di recupero fanno emergere testo dell'editore nelle risposte anche quando l'editore non lo ha mai concesso in licenza.

Gli editori qui coinvolti sono testate regionali e locali i cui archivi hanno un valore reale e i cui budget legali sono modesti. È proprio per questo che il caso merita attenzione. Una vittoria per grandi editori con grandi team legali mette alla prova la legge. Un caso portato da quotidiani regionali mette alla prova se i rimedi siano utilizzabili dai titolari dei diritti che non possono permettersi anni di discovery.

Cosa potrebbe cambiare una pronuncia

L'esito dipenderà da questioni attorno a cui i tribunali girano da due anni senza risolverle. L'addestramento su testi protetti da copyright è fair use, e la risposta cambia quando il testo era dietro un paywall? La memorizzazione trasforma un uso per addestramento in una riproduzione illecita? Il recupero in tempo reale crea una responsabilità separata dall'addestramento? E la rimozione di avvisi di copyright da opere che compaiono in un dataset conta come violazione anche se la copia stessa è consentita?

Nessuna di queste è risolta. Ciò che fa la denuncia è collegare tutte e quattro le questioni a un unico insieme di fatti e portarle davanti a un tribunale distrettuale. Per chiunque costruisca prodotti sopra contenuti web pubblici, quella combinazione è l'elemento da monitorare. Le risposte non arriveranno presto, e la pratica attuale del settore di fare crawling prima e negoziare dopo è esattamente ciò che questa causa mette alla prova.

Perché gli editori regionali portano un caso diverso

L'identità degli attori dà al contenzioso una forma diversa da quella dei casi che hanno coinvolto grandi editori negli ultimi anni.

Il caso del New York Times, e le cause dell'industria musicale precedenti, si basavano su archivi aziendali con decenni di ricavi da licenze commerciali da citare. Potevano sostenere che esisteva un mercato e che era stato sottratto. Un gruppo di quotidiani regionali presenta una posizione probatoria diversa. I loro archivi sono più piccoli, la loro storia di licenze è più limitata, e la loro pretesa si fonda più direttamente sulla copia stessa e sulla rimozione delle informazioni sul copyright.

Ciò conta ai fini del rimedio. Se gli attori prevalgono sul capo relativo alle informazioni sulla gestione del copyright, il rimedio è disponibile anche quando la copia sottostante è contestata, perché la rimozione di un avviso costituisce una violazione autonoma. Per un attore privo di una lunga storia di licenze, quel capo è il percorso più praticabile.

Il livello di recupero come esposizione separata

L'accusa relativa a ChatGPT Search e Deep Research merita di essere separata dalla questione dell'addestramento, perché punta a un tipo diverso di responsabilità.

L'addestramento è un atto una tantum, per quante volte il corpus venga ricostruito. Il recupero avviene a ogni interrogazione, nel momento in cui un utente la pone. Se un prodotto recupera testo dal sito di un editore in tempo reale e lo incorpora in una risposta, l'atto asseritamente illecito è continuo e attivato dall'utente.

Questa distinzione offre agli attori una pretesa che non dipende dal vincere l'argomentazione sul fair use relativa all'addestramento. Persino un modello addestrato interamente su dati concessi in licenza può, tramite una funzione di recupero, far emergere testo da una fonte che non ha mai licenziato. L'impostazione della denuncia tratta il recupero e l'addestramento come due illeciti separati, il che è una struttura più solida rispetto a legare tutto al corpus di addestramento.

Cosa stanno osservando gli editori

Due segnali diranno al settore se questo tipo di caso valga la pena di essere intentato su larga scala.

Il primo è se il tribunale consente che la pretesa relativa alle informazioni sulla gestione del copyright superi un'istanza di rigetto. Quel capo non richiede di risolvere la questione del fair use, quindi una pronuncia favorevole agli attori su di esso darebbe agli editori una via più rapida al rimedio rispetto a un processo completo per violazione.

Il secondo è se la discovery arriva fino alla pipeline di addestramento. Se gli attori riescono a ottenere l'esibizione di registrazioni su cosa è stato sottoposto a crawling e quando, il caso si trasforma da un'argomentazione giuridica sul fair use in un'argomentazione fattuale su ciò che il crawler ha effettivamente fatto, compreso se ha oltrepassato i paywall. Gli operatori del settore editoriale stanno osservando il ruolo proprio per quel tipo di provvedimento, perché direbbe loro quali prove siano ottenibili prima di impegnarsi in cause proprie.

Articoli correlati