← Torna al blog
Newscirca 7 min di lettura

ByteDance non è riuscita a sbarazzarsi di una causa su come ha ottenuto i video

Pubblicato 6 ott 2026
ByteDance non è riuscita a sbarazzarsi di una causa su come ha ottenuto i video

Un gruppo di YouTuber ha citato in giudizio ByteDance, sostenendo che l'azienda ha raccolto con lo scraping milioni di video per addestrare il suo modello text-to-video. ByteDance ha chiesto a un tribunale federale della California di archiviare il caso. Il 2 ottobre, la giudice Jacqueline Scott Corley ha rifiutato.

La sentenza si basa su una sezione della legge sul copyright che era rimasta ai margini del dibattito sull'addestramento dell'IA. Tutti hanno discusso di fair use, che è la sezione 107. I YouTuber stanno discutendo della sezione 1201, che vieta di eludere le misure tecniche che controllano l'accesso a un'opera protetta da copyright.

Si tratta di un caso diverso, e la difesa di ByteDance dipende dalla differenza.

L'argomentazione di ByteDance

La posizione dell'azienda era che le misure di protezione di YouTube regolano il download, non l'accesso. I video in questione sono pubblici. Chiunque può guardarli. Se il contenuto è già disponibile per tutti, ha sostenuto ByteDance, una misura che rallenta il download massivo non è un controllo di accesso nel senso inteso dalla legge, e la sezione 1201 non si applica.

La giudice Corley lo ha respinto. Ha stabilito che le protezioni di YouTube che ByteDance avrebbe aggirato sono il tipo di controllo di accesso che il DMCA vieta di eludere. Ciò che la piattaforma limitava, nella sua interpretazione, era il modo e il volume dell'accesso, e questo conta.

La distinzione che ha tracciato è quella che conta in futuro. Un paywall è un controllo di accesso. Lo è anche un login. Così, apparentemente, è un rate limiter o una misura anti-bot che protegge contenuti altrimenti liberi da visualizzare. La legge non dice che l'opera debba essere segreta.

Perché questo è un problema per la pipeline di addestramento

L'effetto pratico è che un metodo di raccolta dati può essere illegale anche quando i dati stessi erano stati pubblicati apertamente.

Se un tribunale concorda con questa interpretazione, allora la questione di conformità per chi addestra un modello cambia. Non è più solo «avevo il diritto di imparare da quest'opera». Diventa anche «ho ottenuto l'opera in un modo che la piattaforma permetteva». Sono domande separate con risposte separate, e un'azienda può avere ragione sulla prima e torto sulla seconda.

La seconda domanda è anche più facile da sostenere in giudizio per un attore. Il fair use richiede un'analisi a quattro fattori riguardante scopo, natura, quantità ed effetto sul mercato, e le risposte sono contestabili. Se uno scraper abbia aggirato una misura tecnica è più vicino a un accertamento di fatto. O lo strumento ha aggirato il controllo o non l'ha fatto.

Una colonna di barriera in acciaio inossidabile senza segni in un corridoio di cemento vuoto sotto una fredda luce blu

La sezione 1201 aleggia sui casi sull'IA da un po'

Non è la prima volta che quella sezione compare in una controversia sull'addestramento, e i casi precedenti sono andati nella direzione opposta.

In Doe v. GitHub, gli sviluppatori hanno sostenuto che Copilot riproduceva il loro codice senza licenza, e il modo in cui la corte ha trattato la domanda ai sensi della sezione 1202, che riguarda la rimozione delle informazioni sulla gestione del copyright, è stato più restrittivo di quanto sperassero gli attori. Nel caso Roblox, un artista di nome Austin Beaulier ha citato in giudizio per la rimozione dei tag NoAI da modelli 3D usati in un dataset di addestramento. Anche la giudice Beth Labson Freeman ha archiviato il caso il 2 ottobre, stabilendo che il tag NoAI conta come informazione di gestione dei contenuti, ma che l'attore non aveva dimostrato che Roblox lo avesse rimosso intenzionalmente.

Entrambi riguardano la sezione 1202, che concerne le informazioni allegate a un'opera. Il caso ByteDance riguarda la sezione 1201, che concerne il cancello davanti ad essa. L'archiviazione di Roblox e la sopravvivenza di ByteDance nello stesso giorno rendono visibile la spaccatura: una pretesa riguardante metadati eliminati è difficile da provare, e una pretesa riguardante un cancello aggirato è più facile.

Anche il quadro del fair use non è definito

La stessa settimana ha portato l'opinione non omissata in Thomson Reuters v. ROSS Intelligence, in cui il Terzo Circuito ha stabilito che addestrare uno strumento di ricerca legale sulle headnote di Westlaw non costituiva fair use. Quel caso riguarda la sezione 107 e non contiene alcuna misura tecnica. ROSS ha copiato riassunti editoriali e li ha usati per costruire un prodotto concorrente.

Le tre decisioni insieme descrivono un contesto in cui l'esposizione legale di una pipeline di addestramento IA dipende dalla meccanica più che dal principio. Come sono stati ottenuti i dati, se i metadati sono sopravvissuti alla pipeline e se l'output era in concorrenza con la fonte comportano ciascuno la propria regola.

Per un'azienda che raccoglie dati di addestramento su larga scala, la conseguenza operativa è che il livello di raccolta è ora una superficie di conformità a sé stante. Registrare come si è comportato un crawler, rispettare i limiti di frequenza e le direttive robots, e rifiutarsi di costruire aggirando le difese della piattaforma hanno smesso di essere cortesie. Ora decidono se un caso può essere archiviato nella fase degli atti introduttivi.

Perché l'interesse della piattaforma conta quanto quello del creatore

Una pretesa ai sensi della sezione 1201 appartiene tanto a chi ha costruito il cancello quanto a chi ha l'opera dietro di esso.

Le misure di protezione di YouTube esistono perché la piattaforma ha un proprio interesse a controllare come si accede al suo catalogo. Il download massivo è costoso per un servizio che distribuisce video su larga scala, e lo scraping ha conseguenze sulla larghezza di banda, sulla misurazione pubblicitaria e sugli accordi di licenza che la piattaforma negozia con i titolari dei diritti. Una sentenza che considera quelle misure come controlli di accesso consegna alle piattaforme uno strumento legale contro la raccolta automatizzata di qualsiasi tipo, e prima non ne avevano uno.

Ciò va oltre l'addestramento dell'IA. Copre il monitoraggio dei prezzi, i dataset di ricerca accademica, l'analisi competitiva e qualsiasi altra cosa che legga un sito in volume. La disposizione anti-elusione precede tutto ciò di decenni, e ora le viene chiesto di governare una categoria di attività che i suoi redattori non immaginavano.

Per i titolari dei diritti, la conseguenza è una seconda via per andare in tribunale. Un creatore che non riesce a vincere un'argomentazione di fair use contro chi addestra un modello può comunque avere una pretesa su come l'opera è stata ottenuta, e quella pretesa non richiede di provare un danno economico allo stesso modo. Richiede di provare che una misura tecnica è stata aggirata.

Su cosa verterà probabilmente la discovery

Se il caso sopravvive fino alla discovery, il materiale interessante sarà operativo più che legale. Quali strumenti di crawling sono stati usati, se erano configurati per rispettare le direttive della piattaforma, quante richieste sono state fatte e in quale periodo, e cosa hanno scritto gli stessi ingegneri dell'azienda sui rischi all'epoca.

I documenti interni hanno determinato l'esito di diversi recenti casi sull'IA, e una pipeline di addestramento su scala ByteDance lascia una traccia sostanziale. La questione se qualcuno abbia segnalato l'esposizione legale prima che iniziasse lo scraping è quella che tende a decidere il valore transattivo.

Cosa succede dopo

La sentenza non decide se ByteDance abbia violato il copyright. Mantiene il caso in vita nella fase degli atti introduttivi, il che significa che i YouTuber ottengono la discovery. È lì che i dettagli diventano pubblici: quali video, quali strumenti, quali misure sono state aggirate e quante volte.

Il percorso più probabile è un accordo prima del processo. Le cause di questo tipo di solito finiscono così, e ByteDance non ha interesse a creare un registro pubblico di come funzionava una pipeline di addestramento. Ma la questione legale è ora nel sistema, e la risposta plasmerà il modo in cui ogni futuro scraper affronta le difese di una piattaforma.

C'è un punto più ampio. Il problema dei dati dell'industria IA è stato trattato come un problema di licenze: paga il titolare dei diritti e tutto va bene. Questa linea di casi suggerisce che pagare non è sufficiente, perché la piattaforma che ospita l'opera ha i propri interessi, codificati in misure tecniche e sostenuti da una legge che non si preoccupa se l'opera era liberamente leggibile. Ottenere il contenuto legalmente e ottenerlo in modo pulito sono ora due obblighi separati.

Articoli correlati