← Torna al blog
Newscirca 7 min di lettura

Meta ha chiuso la causa sui libri. Ora il permesso ha un prezzo.

Pubblicato 7 ott 2026
Meta ha chiuso la causa sui libri. Ora il permesso ha un prezzo.

Meta ha accettato di risolvere la class action che la accusava di aver addestrato i suoi modelli Llama su libri pirata. L'accordo proposto è stato depositato in un tribunale federale alla fine di settembre, e l'avviso è stato inviato ai titolari dei diritti pochi giorni dopo. I termini finanziari sono secretati fino all'approvazione da parte di un giudice, e Meta continua a dichiarare pubblicamente che le sue pratiche di addestramento rientrano nel fair use. Ciò che l'accordo non dice è tanto rivelatore quanto ciò che dice.

Il caso si concentrava sul lato dell'acquisizione, non su quello dell'addestramento. Gli autori sostenevano che i modelli Llama fossero stati addestrati su opere prelevate da biblioteche ombra come LibGen tra il 2018 e il 2024. Questo dettaglio conta perché una pronuncia separata aveva già tracciato una linea nel mezzo di questo problema. Nel caso Anthropic, il giudice William Alsup ha stabilito che addestrare un modello su libri protetti da copyright è lecito, ma che conservare una biblioteca di copie pirata non lo è. La sanzione in quel caso, un accordo da 1,5 miliardi di dollari, era legata a come i libri erano stati ottenuti, non all'apprendimento in sé.

Letti insieme, i due esiti descrivono una regola facile da enunciare e difficile da applicare. Imparare da un libro che hai acquisito legalmente va bene. Costruire un corpus con copie pirata no. La cifra di 1,5 miliardi di dollari equivale a circa 3.000 dollari per opera, il che offre a ogni laboratorio un modo per quantificare la propria esposizione. Se hai estratto un corpus da un sito pirata, ora hai un numero approssimativo di quanto costa quella decisione.

L'opt-out viene sostituito da un prezzo

Il cambiamento più significativo è quello che accade dopo. Un accordo separato riportato questo mese ha sostituito il modello del registro di opt-out volontario con una struttura obbligatoria di canoni di licenza legata a quanti dati vengono utilizzati. L'argomento alla base è netto: le porte di opt-out sembravano eque sulla carta e fallivano nella pratica, perché gli sviluppatori raramente controllavano o rispettavano le liste di esclusione. Pagare per volume è più difficile da ignorare.

Questo reimposta l'intera negoziazione. Con l'opt-out, l'unica leva di un titolare dei diritti era dire di no e sperare. Con una licenza a pagamento, il permesso diventa una voce di bilancio con un numero associato, e la discussione si sposta dal se le aziende di IA possano usare l'opera a quanto devono pagare per essa. Per editori e autori, è una posizione molto migliore rispetto a una barriera tecnica che nessuno faceva rispettare.

L'effetto pratico sui laboratori è un nuovo budget di conformità. La provenienza dei dati smette di essere una preferenza ingegneristica e diventa un requisito legale. Se un corpus in un dataset da diversi petabyte proviene da una fonte che non può essere documentata, introduce una responsabilità specifica nell'intera pipeline di addestramento, e il problema di solito si verifica nello strato di aggregazione, dove dataset di terze parti vengono combinati senza una chiara attribuzione.

La questione dell'output è ancora aperta

I dati di addestramento sono solo uno dei due fronti. L'altro è ciò che il modello produce, e lì il quadro è meno definito. Il New York Times ha superato la mozione di archiviazione di OpenAI sostenendo in modo plausibile che gli output di ChatGPT competono con il suo giornalismo. Questa è una teoria di sostituzione di mercato, e taglia in modo diverso rispetto alla teoria dell'acquisizione. Se il modello impara da un'opera e non la riproduce, l'argomento della trasformazione regge. Se il suo output sostituisce l'originale sul mercato, l'argomento si indebolisce.

Negare una mozione di archiviazione non è un accertamento di responsabilità, e il caso del Times è ancora in corso. Ma le due teorie insieme spiegano perché le aziende di IA ora trattano provenienza e monitoraggio degli output come un unico problema. Un modello addestrato su dati concessi in licenza può comunque generare qualcosa che compete con la fonte, e i termini della licenza specificano sempre più spesso ciò che non può fare.

L'audio non segue lo stesso percorso

Se gli editori di libri si stanno dirigendo verso un mercato delle licenze, la musica si sta dirigendo verso qualcosa di più caotico. Suno ha perso una pronuncia in Germania intentata da GEMA, la società di diritti di esecuzione, per l'uso di registrazioni e composizioni protette da copyright. I casi americani sul testo si stanno per lo più risolvendo in pagamenti e licenze retroattive. I casi sull'audio stanno producendo ingiunzioni e battaglie sulla giurisdizione, che per un'azienda di prodotto è l'esito peggiore, perché un'ingiunzione ferma il servizio invece di tassarlo.

La differenza sembra ridursi a quanto l'output sia vicino all'input. Un modello linguistico che riassume un libro è a un passo di distanza dal testo. Un modello musicale che genera una canzone nello stile di un artista è abbastanza vicino perché il confronto sia immediato, e i tribunali sono stati meno disposti a estendere l'argomento della trasformazione fino a coprirlo.

Dove il prezzo non esiste ancora

Il parametro di riferimento per opera è finora un fenomeno legato al testo, e il motivo è l'infrastruttura. Gli editori di libri hanno organismi di licenza collettiva, decenni di precedenti sui diritti di riproduzione e un'unità di scambio ragionevolmente chiara, cioè l'opera. Questo rende un prezzo per titolo facile da definire e facile da discutere in tribunale.

Una pila ordinata di libri con copertina rigida color crema e pagine bianche accanto a una piccola bilancia in ottone che sostiene pesi semplici su una superficie di lino caldo.

Immagini, video e codice non hanno la stessa configurazione. Una libreria di foto stock può prezzare una licenza per immagine, ma uno screenshot di una pagina web contiene dozzine di elementi protetti da copyright contemporaneamente, e un repository di codice mescola file concessi in licenza, con licenza permissiva e non attribuibili nello stesso albero. Una volta che la questione si sposta dal testo a uno qualsiasi di questi, la formula per opera smette di applicarsi e il dibattito torna al fair use, che è il terreno su cui le aziende di IA preferirebbero combattere.

L'altra questione aperta è chi riscuote. Un canone di licenza che nessuno amministra si trasforma comunque in una class action, e le strutture di accordo riportate questo mese descrivono ancora pagamenti negoziati caso per caso, anziché un mercato stabile con tariffe pubblicate. Finché le tariffe non saranno pubbliche, ogni negoziazione avverrà in privato, con i maggiori acquirenti che ottengono le condizioni migliori. Questa è la forma di un mercato che si è formato ma non è ancora maturato.

Che cosa significa se costruisci su questi modelli

La maggior parte degli sviluppatori che legge questo non addestra modelli di base, quindi l'esposizione diretta è bassa. L'esposizione indiretta non lo è. I laboratori che assorbono accordi da otto e nove cifre trasferiscono il costo, e il meccanismo è il prezzo delle API. Prevedi che il costo di accesso ai modelli aumenti nel prossimo anno o due, specialmente per i modelli addestrati su materiale concesso in licenza, dove la licenza stessa ora fa parte del costo del venduto.

C'è una seconda implicazione, più silenziosa, per chiunque ospiti o esegua carichi di lavoro di IA. Se memorizzi dataset di addestramento per un cliente, il rischio legale ora dipende da dove provengono quei file, non da ciò che il cliente ne fa. Una documentazione chiara della provenienza smette di essere un costo generale e inizia a essere ciò che impedisce a una sentenza da otto cifre di ricadere su un sistema che gestisci.

La parte irrisolta è quanto si diffonderà il modello di prezzo. Gli editori di testi hanno un'infrastruttura di licenza collettiva e un insieme di casi risolti a cui fare riferimento. La musica ha le società, ma un diverso rapporto con l'output. Immagini, video e codice hanno ciascuno le proprie dinamiche, e nessuno di essi ha ancora un parametro di riferimento per opera. L'accordo di Meta rimuove un punto di riferimento dalla mappa. Non disegna il resto, e i prossimi accordi decideranno se il permesso diventa un mercato o resta una serie di eccezioni.

Articoli correlati