La Nona Corte d'Appello: gli output di Copilot non sono copie private delle attribuzioni

Una corte d'appello federale ha consegnato a GitHub e OpenAI una vittoria limitata ma dalle conseguenze rilevanti e, così facendo, ha tracciato un confine che ogni azienda che addestra un modello sul lavoro altrui dovrebbe leggere con attenzione.
Il caso è Doe v. GitHub. I ricorrenti sono programmatori anonimi che hanno pubblicato codice open source con licenze che richiedono l'attribuzione. I convenuti sono GitHub, la sua controllante Microsoft e le entità OpenAI. I prodotti in questione sono GitHub, Copilot e OpenAI Codex, tutti addestrati su repository pubblici.
I ricorrenti hanno avanzato due tesi ai sensi del Digital Millennium Copyright Act, entrambe fondate sulla sezione 1202, che vieta di rimuovere o alterare le informazioni sulla gestione del copyright. La prima era una tesi sull'input: i convenuti avrebbero rimosso i dati di attribuzione dal codice dei ricorrenti prima di fornirlo a Copilot come dati di addestramento. La seconda era una tesi sull'output: Copilot talvolta restituisce dati di addestramento memorizzati senza l'attribuzione del codice sorgente, e ciò equivarrebbe a rimuovere o alterare tali informazioni.

La tesi sull'input non è mai stata discussa
La Nona Corte d'Appello ha rifiutato di esaminare la domanda relativa alla fase di addestramento, e il motivo merita di essere segnalato. Nel tribunale di primo grado, il legale dei ricorrenti ha ammesso che copiare i dati di addestramento «forse» non violava le licenze, e il tribunale distrettuale ha dichiarato senza giri di parole che il ricorso «non riguarda l'addestramento». I ricorrenti non hanno obiettato. In appello, il collegio ha considerato la tesi come decaduta.
Questa decadenza conta più di quanto sembri. La questione della fase di addestramento è quella che avrebbe toccato ogni modello addestrato su dati raccolti automaticamente o concessi in licenza. Avendola persa su una concessione procedurale anziché nel merito, i ricorrenti hanno lasciato aperta la questione più importante, e l'hanno lasciata a un altro caso.
Perché la tesi sull'output è fallita
Nel merito, la corte ha respinto la tesi sull'output basandosi sulla stessa descrizione del funzionamento di Copilot fornita dai ricorrenti. Il ricorso descriveva un «complesso processo probabilistico» che deduce schemi statistici e prevede il completamento più probabile. Secondo il collegio, questa è una descrizione della generazione, non del recupero, e un'opera generata «non può ragionevolmente essere descritta come una copia» del codice protetto.
La corte ha contrapposto Copilot a un motore di ricerca. Un motore di ricerca recupera copie archiviate, quindi dispone di una copia da cui l'attribuzione potrebbe essere rimossa. Un modello che prevede il token successivo, secondo la lettura della corte, non possiede tale copia.
Il collegio ha poi affrontato il cosiddetto requisito di identità e, qui, ha fatto qualcosa che sarà citato nelle memorie per anni. Ha rifiutato di trattare l'identità come un elemento autonomo di una domanda ex sezione 1202. L'ha invece descritta come una glossa alle parole della legge «rimuovere», «alterare» e «copie», e come una prova più che un test. Una riproduzione quasi identica senza attribuzione supporta l'inferenza che l'attribuzione sia stata rimossa. Differenze sostanziali indicano il contrario, verso un'opera nuova a cui nessuna attribuzione è mai stata collegata.
Che cosa cambia davvero la sentenza
L'effetto pratico è un restringimento, non una grazia. I titolari dei diritti che speravano che il DMCA offrisse loro una scorciatoia per aggirare le questioni più complesse del fair use e della sostanziale somiglianza ora devono fare la strada lunga.
La stessa impostazione della corte indica dove si collocheranno le prossime battaglie. I titolari insisteranno maggiormente sulle tesi relative alla fase di addestramento, sostenendo che l'attribuzione è stata rimossa dai dati prima ancora che raggiungessero il modello. E continueranno a promuovere normali azioni per contraffazione sugli output, dove il criterio è la somiglianza con un'opera protetta e non la meccanica dei metadati di attribuzione.
C'è una seconda lettura da tenere a mente. Il collegio ha avuto cura di precisare che l'identità è una prova, non un elemento costitutivo. Questo offre ai titolari una via: costruire un fascicolo di output che riproducono quasi alla lettera codice protetto, senza attribuzione, e l'inferenza diventa disponibile. La linea tra un modello che ha memorizzato e uno che ha generalizzato è ormai in parte una questione di quanto vicino cada l'output e di quanto bene un ricorrente riesca a dimostrarlo.
La dimensione più ampia del problema
Facendo un passo indietro, il caso appare meno come un verdetto sull'IA e più come l'istantanea di un sistema giuridico che rincorre in modo disomogeneo. L'attribuzione non è mai stata pensata per sopravvivere a un modello probabilistico. Le informazioni sulla gestione del copyright presuppongono una copia con metadati allegati. Quando il sistema produce qualcosa di nuovo da un processo statistico, non esiste alcuna copia da cui i metadati possano essere stati rimossi.
È un argomento che riguarda la forma della tecnologia, ed è lo stesso argomento che emerge in ogni controversia in cui le vecchie categorie non calzano. La Nona Corte d'Appello ha scelto di leggere letteralmente le parole della legge anziché forzarle, scelta difendibile che però lascia intatta la tensione di fondo.
Per gli sviluppatori, la conclusione è poco appariscente. Il DMCA è uno scudo più debole di quanto alcuni sperassero, ma non è sparito. Per i ricorrenti, la lezione è che la tesi che si concede in primo grado è la tesi che si perde in appello. E per chiunque addestri modelli su codice pubblico, l'avvertimento più duraturo viene dalla stessa logica della corte: più il vostro output si avvicina a un input specifico, meno reggerà l'inquadramento come «opera nuova».
Che cosa significa eseguire un modello sul codice altrui
Per chi mantiene un progetto open source, la lettura pratica è più ristretta di quanto suggeriscano i titoli. La via dell'attribuzione DMCA ora è più ardua, ma gli obblighi di licenza sottostanti non si sono spostati. Se il vostro codice è sotto licenza MIT o Apache, un modello che l'ha memorizzato e lo riproduce senza l'avviso resta un problema di licenza, e il ragionamento stesso della corte indica come dimostrarlo.
Il disagio vale anche nella direzione opposta. La decisione si fonda su una descrizione di Copilot come generatore probabilistico e non come sistema di recupero. Questa descrizione è accurata per la maggior parte dei prompt e della maggior parte degli output. È meno accurata per la coda della distribuzione, dove un modello riproduce quasi esattamente un passaggio lungo e distintivo, ed è proprio su quella coda che un ricorrente dovrebbe costruire un fascicolo probatorio. La corte non ha chiuso la porta a quel caso. Ha fatto del fascicolo probatorio l'intero argomento.
C'è anche una conseguenza pratica per gli strumenti. Il riferimento del tribunale distrettuale al filtro di rilevamento delle copie di GitHub, che segnala corrispondenze di 150 caratteri, fa ora parte del fascicolo d'appello. I sistemi che già misurano quanto un output si avvicini ai dati di addestramento sono quelli meglio posizionati per rispondere alla domanda lasciata aperta dalla corte, il che suggerisce che l'infrastruttura di conformità e la strategia processuale puntano nella stessa direzione.
Le cause ancora pendenti
Questa decisione arriva in un campo affollato. A settembre Thomson Reuters ha vinto il proprio appello contro Ross Intelligence nel Terzo Circuito, su una questione di fair use e non di metadati di attribuzione, e quella sentenza si è basata in larga misura sul fatto che Ross aveva costruito un prodotto concorrente proprio del database su cui si era addestrata. La decisione della Nona Corte su Copilot e quella del Terzo Circuito su Westlaw rispondono a domande diverse, e nessuna delle due vincola l'altra.
Questa divergenza è lo stato del diritto d'autore sull'IA nel 2026. Le corti risolvono i frammenti che arrivano loro, circuito per circuito, con fatti che generalizzano male. Una sentenza su uno strumento di ricerca giuridica dice poco su un assistente per il codice, e una sentenza sui metadati di attribuzione dice poco sul fair use. Chi aspetta una singola decisione che chiuda la questione aspetta qualcosa che la struttura del sistema non produce.
La decisione restringe una via e ne lascia aperte diverse altre. È così che, in questo momento, viene risolta la maggior parte di queste questioni di diritto d'autore sull'IA: un pezzo alla volta, nel caso che per primo arriva in giudizio.
Articoli correlati
Il watermark non tiene il passo con i falsi
I sistemi funzionano. La copertura no. Il divario viene riempito da qualunque cosa il pubblico presuma.
Il tuo agente AI ora chiama il supporto clienti, e le aziende devono rispondere
Una voce perfetta su una richiesta non autorizzata è peggio di una voce goffa su una verificata.
Reddit chiude la sua ultima porta aperta e dà la colpa agli scraper
Uno scraper che Reddit non ha autorizzato è abuso. Uno scraper che Reddit ha autorizzato è ricavo.
La Banca d'Inghilterra ha appena inserito il debito dell'IA tra i rischi per la stabilità finanziaria
Un boom finanziato con utili non distribuiti può essere riassorbito in privato. Questo, però, corre su 450 miliardi di dollari di nuovo debito.