Thomson Reuters v. Ross: la prima sentenza d'appello su addestramento dell'AI e fair use

Per tre anni, la battaglia legale sulla possibilità di addestrare modelli di AI su materiale protetto da diritto d'autore si è per lo più chiusa con accordi transattivi o si è arenata davanti ai tribunali distrettuali. A settembre, la Corte d'Appello del Terzo Circuito degli Stati Uniti ha cambiato le cose. La sua decisione in Thomson Reuters v. Ross Intelligence è la prima pronuncia di un'appellate federale che stabilisce che usare materiale protetto da copyright per addestrare uno strumento di AI commerciale concorrente non costituisce fair use.
La giudice Tamika Montgomery-Reeves ha confermato la constatazione del tribunale di primo grado del febbraio 2025, secondo cui Ross Intelligence ha violato 2.243 headnote di Thomson Reuters — brevi riassunti di questioni giuridiche redatti dagli editori — addestrando su di essi un prodotto concorrente di ricerca legale. Il suggello dell'appello conta perché eleva il ragionamento da singolo parere di un giudice a precedente vincolante per un circuito federale, il genere di cosa con cui gli altri tribunali devono ora fare i conti.
Che cosa ha deciso davvero il caso
La pronuncia, in senso stretto, riguarda un tipo specifico di sistema. Ross ha costruito uno strumento di ricerca legale pensato per competere direttamente con il prodotto sui cui contenuti era stato addestrato. La corte ha stabilito che questo uso non superava il test del fair use, in gran parte perché l'output competeva nello stesso mercato dell'originale.
Il ragionamento si fonda sulla sostituzione di mercato. Quando lo scopo dell'addestramento è produrre qualcosa che sostituisce la fonte, il quarto fattore del fair use — l'effetto sul mercato potenziale dell'originale — pesa fortemente a sfavore dell'utente. La corte non si è lasciata convincere che la copia intermedia insita nell'addestramento fosse sufficientemente trasformativa da superare questo punto.
Vale la pena essere precisi su ciò che questa decisione copre e ciò che non copre. Ross non era, nel senso rilevante, un modello generativo che produce espressione originale. Era un prodotto di ricerca e recupero che riproduceva e riutilizzava riassunti protetti da copyright. La corte ha tracciato esplicitamente questa distinzione, lasciando spazio all'AI generativa per rivendicare una tutela più ampia del fair use, sul presupposto che genera contenuti nuovi anziché riprodurre contenuti esistenti.
Questa eccezione è generosa in apparenza e meno rassicurante nella pratica. Significa che la pronuncia d'appello non risolve la questione a cui il settore delle immagini e dei video tiene di più: se addestrare un modello di diffusione su miliardi di immagini e video protetti da copyright costituisca fair use. La lascia a futuri procedimenti e implica che la risposta possa variare a seconda del tipo di modello.
La questione dell'AI generativa resta aperta
La battaglia parallela sul fronte generativo si sta muovendo attraverso tribunali diversi e non è stata risolta a favore dell'industria. Il dato più discusso è l'accordo transattivo in Bartz v. Anthropic, nel giugno 2025, che ha risolto una class action sui dati di addestramento per una cifra dichiarata di 1,5 miliardi di dollari. Un accordo non è una sentenza, ma l'entità della cifra dice come gli avvocati della difesa valutavano le loro probabilità.
Accanto alla pronuncia d'appello, un caso separato sull'addestramento di modelli di immagini è approdato a un processo con giuria a San Francisco, diventando la prima vicenda del genere ad arrivare davanti a una giuria invece di chiudersi con un accordo. Un verdetto in quel caso darebbe all'industria qualcosa che nessuna parte ha ancora avuto: un accertamento di fatto su se addestrare modelli di immagini su opere di artisti costituisca violazione, deciso da persone e non da un giudice.
Letti insieme, la sentenza Ross e i casi in corso indicano una sola direzione. I tribunali sono sempre meno disposti a trattare il «ci abbiamo addestrato un modello» come una difesa automatica e stanno differenziando l'analisi in base a quanto il prodotto risultante compete con la fonte. Quanto più direttamente un sistema sostituisce il contenuto da cui ha appreso, tanto più debole diventa l'argomento del fair use.
Perché questo va oltre il legal tech
È tentante archiviare Ross sotto una categoria ristretta, quella della ricerca legale, e passare oltre. Sarebbe un errore per chiunque usi l'AI per produrre contenuti commerciali, e il motivo è la logica della sostituzione di mercato.
Si consideri il caso ordinario di uno strumento di AI che scrive descrizioni di prodotto. Se è stato addestrato sui testi di catalogo di un rivenditore e poi usato per generare testi di catalogo concorrenti, il ragionamento di Ross si applica con scomoda immediatezza. Lo stesso vale per un modello di immagini addestrato sulle foto di prodotto del marchio che sta aiutando un concorrente a battere sul prezzo, o per uno strumento di copywriting nutrito con gli articoli di una testata e usato per generare contenuti che attirano gli stessi lettori.
L'esposizione pratica non si limita agli sviluppatori di modelli. Le aziende che impiegano strumenti di AI ereditano il rischio da come tali strumenti sono stati costruiti, e spesso manca la tracciabilità. I venditori che lavorano con modelli gratuiti addestrati su dati non autorizzati sono i più esposti, perché non possono dimostrare la provenienza nemmeno volendo. I team che si approvvigionano di modelli addestrati su dati concessi in licenza o di proprietà possono documentare questa scelta, che è una posizione difendibile in una controversia e sempre più spesso un requisito imposto da partner e piattaforme.
Il costo di conformità di questo cambiamento è reale e disomogeneo. Gli operatori più grandi possono negoziare licenze e costruire dataset concessi in licenza; quelli più piccoli no, e si trovano davanti a una scelta: pagare per strumenti con licenza, generare contenuti originali a mano o assumersi un rischio che potrebbero non essere in grado di quantificare. È probabile che le piattaforme colmino da sole parte di questo divario, analizzando i contenuti caricati alla ricerca di segnali di materiale non autorizzato generato dall'AI, come già fanno per i falsi.
Vale la pena dire chiaramente l'ambiguità pratica. La sentenza Ross riguarda un prodotto di recupero di informazioni, non un modello di diffusione, quindi nessuno dovrebbe leggerla come un verdetto sull'addestramento di immagini o video. Ciò che stabilisce è un metodo di analisi che verrà applicato più ampiamente: i tribunali si chiedono quanto l'output del sistema addestrato competi con il materiale da cui ha appreso. Questa domanda ha una risposta scomoda per molti prodotti di AI commerciale, e non dipende dal fatto che il modello sia generativo.
La conseguenza a breve termine è che la provenienza si sta trasformando in una caratteristica di prodotto. Gli strumenti in grado di mostrare da dove provengono i loro dati di addestramento, o costruiti solo su contenuti che il cliente già possiede, comportano meno rischi e possono farsi pagare per questo. Gli strumenti che non possono farlo si sposteranno verso clienti che o non sanno che bisogna chiedere, o non possono permettersi di preoccuparsene.
Il punto della situazione
Quello che esiste ora è un insieme di punti di riferimento, non una regola consolidata. Addestrare su materiale protetto da copyright per costruire un prodotto commerciale direttamente concorrente non è fair use, almeno nel Terzo Circuito. I modelli generativi hanno più margine per argomentare, e quel margine non è stato messo alla prova di un verdetto di giuria. Gli accordi transattivi hanno quantificato il rischio in cifre che attirano l'attenzione nelle sale riunioni.
Per chiunque costruisca prodotti basati sull'AI, la risposta sensata è smettere di aspettare che il diritto si cristallizzi. Sappiate da dove provengono i dati di addestramento, conservate quel registro, preferite modelli in grado di documentare la loro provenienza e trattate l'origine dei pesi di un modello come una questione di catena di fornitura, non come una nota a piè di pagina giuridica. La direzione è chiara anche se la destinazione non lo è, e le organizzazioni che oggi sanno rispondere alla domanda sulla provenienza spenderanno molta meno energia per farlo sotto scadenza in futuro.
Articoli correlati
Il Giappone ha destinato 101,6 trilioni di yen all'IA. La parte concreta è un data center vicino a Tokyo
Una società elettrica è il perno. JERA genera elettricità, e il suo ruolo significa che il primo problema viene risolto a livello di generazione.
Broadcom presterà ad Anthropic fino a 42 miliardi di dollari per noleggiare i propri chip
Un fornitore di hardware presta al proprio cliente il denaro per noleggiare hardware dallo stesso fornitore.
Tencent ha noleggiato 100.000 chip AI da Oracle. La parte interessante è la rotta.
I chip non si sono mossi. Ecco perché questo accordo è più difficile da contrastare rispetto a una spedizione intercettata in un porto.
La Cina ha iniziato a scrivere le regole per l'identità degli agenti, e la domanda è per chi lavora l'agente
L'identità è la metà facile. La metà difficile è l'attribuzione.