PewDiePie è stato bannato due volte per distillazione, e le regole sono appena diventate personali

Felix Kjellberg, noto soprattutto come PewDiePie, ha detto al suo pubblico che OpenAI lo ha bannato due volte. La sua colpa non era contrabbandare pesi o rivendere accesso alle API su larga scala. Ha usato gli output di uno dei modelli di OpenAI per addestrare Ajax, un modello da 9B che esegue sul proprio hardware per cose di tutti i giorni come ricerca ed email.
Ajax è basato su Qwen3.5-9B, un piccolo modello aperto, ed è stato messo a punto su dati generati da uno più grande e chiuso. Questo processo si chiama distillazione. È la stessa tecnica che ha prodotto un'ondata di modelli economici e capaci negli ultimi due anni, ed è la tecnica che i grandi laboratori ora si stanno impegnando duramente a controllare.
Che cos'è davvero la distillazione
Distillare un modello significa addestrarne uno più piccolo a imitarne uno più grande. Si inviano prompt all'insegnante, se ne raccolgono le risposte e si addestra lo studente a riprodurle. Lo studente non ha bisogno dei pesi dell'insegnante né della sua architettura. Gli basta abbastanza del comportamento dell'insegnante per apprendere il pattern.
Ecco perché ai laboratori importa. Addestrare un modello di frontiera costa decine o centinaia di milioni di dollari. Se un concorrente o un individuo può raccogliere i suoi output tramite un'API e trasferire quella capacità in un modello di sua proprietà, la parte costosa del lavoro viene in parte aggirata. L'output sembra testo, ma il segnale sottostante è ciò che viene copiato.

Il caso di Kjellberg conta perché è piccolo. Non è una startup ben finanziata che lancia un prodotto rivale. È una persona con una GPU consumer e un modello locale. L'applicazione delle regole è arrivata fino a lì.
I laboratori non stanno tirando a indovinare sulla portata
Il ban di OpenAI nei confronti di Kjellberg è solo la punta visibile. Le campagne più grandi sono industriali. L'amministratore delegato di Anthropic, Dario Amodei, ha descritto una singola operazione di distillazione che ha usato circa 25.000 account falsi e ha effettuato circa 28,8 milioni di scambi con Claude. A quel volume, raccogliere output non è un progetto secondario; è una pipeline di dati con personale e infrastruttura.
OpenAI si è mossa anche contro aziende. Ha bloccato l'accesso di Cursor ai suoi modelli, citando preoccupazioni legate alla distillazione, dopo che xAI ha usato output di OpenAI per addestrare Grok. Il pattern di queste azioni è che l'applicazione non è più rivolta solo a rivenditori evidenti. È rivolta a chiunque il cui prodotto dipenda da capacità estratte da un modello chiuso.
Si sta formando un'intera industria del rilevamento attorno a questo. I laboratori cercano pattern negli account, volumi di richieste e impronte statistiche dei dati raccolti. Essere scoperti non significa sempre una causa legale; può significare perdere l'accesso alle API, che per una startup spesso è la stessa cosa.
Venticinque aziende hanno chiesto regole più chiare
L'applicazione delle regole da parte dei laboratori avviene sullo sfondo di un disaccordo aperto su quali dovrebbero essere le regole. Nel luglio 2026, venticinque organizzazioni, tra cui Nvidia, Meta e Microsoft, hanno firmato una lettera sostenendo che i modelli open-weight sono centrali per la leadership statunitense nell'IA. Hanno chiesto quadri giuridici mirati che affrontino direttamente la distillazione, anziché restrizioni ampie sui modelli aperti.
OpenAI, Anthropic e Google non hanno firmato. Tutte e tre hanno modelli di frontiera il cui valore dipende dal limitare quanto facilmente i loro output possono essere copiati. La divisione si riduce a chi può farlo e a quali condizioni.
In quella lacuna, una corte d'appello statunitense ha aggiunto un ulteriore elemento a fine settembre. In Thomson Reuters v. Ross Intelligence, il Third Circuit ha confermato una sentenza secondo cui copiare materiale editoriale di un concorrente per addestrare un prodotto di ricerca non costituiva fair use, perché il prodotto risultante competeva direttamente con la fonte. Quel caso riguarda un motore di ricerca, non un modello generativo, e la corte ha avuto cura di precisare che non stava decidendo su tutto l'addestramento dell'IA. Ma segnala che il terreno giuridico sotto i dati di addestramento sta cambiando nello stesso momento in cui l'applicazione tecnica si stringe.
Perché il termine "distillazione" sta facendo un gran lavoro
Non ogni uso dell'output di un modello è uguale, e le regole attuali confondono la differenza. Chiedere a un modello di aiutarti a scrivere codice è un uso normale. Chiedergli di generare milioni di esempi per addestrare un rivale non lo è. Da qualche parte tra queste due cose c'è una persona che usa gli output per far rendere un po' meglio un modello per hobby, che è più o meno la posizione di Kjellberg.
I laboratori trattano i dati di output come un asset di cui possiedono i diritti d'uso e di controllo. I loro termini di servizio lo dicono, e l'applicazione segue i termini anziché uno standard legale. Ecco perché lo stesso atto può essere permesso in un account e vietato in un altro: dipende dal volume, dall'intento come lo interpreta il fornitore, e dal fatto che il modello risultante assomigli a un concorrente. Non esiste una linea netta, e la sua assenza è il vero problema per chiunque cerchi di restare dalla parte giusta.
Il rilevamento rende il confine più difficile da vedere. I laboratori cercano pattern che suggeriscano una raccolta: volumi di richieste insoliti, account creati in batch, prompt che assomigliano a suite di valutazione. Una persona che esegue qualche migliaio di prompt potrebbe non incappare in nessuno di questi. Un'operazione che usa 25.000 account lo farà. Nel mezzo, la risposta è davvero incerta, e l'incertezza è una scarsa base per un prodotto.
Una decisione giudiziaria è arrivata nello stesso momento
L'applicazione tecnica si sta inasprendo mentre il quadro legale è ancora in movimento. A fine settembre, il Third Circuit ha confermato una sentenza secondo cui copiare materiale editoriale di un concorrente per addestrare un prodotto di ricerca non costituiva fair use, perché il prodotto risultante competeva con la fonte. La corte ha avuto cura di notare che la sua decisione riguardava un motore di ricerca, non un modello generativo, e che non stava stabilendo una regola universale per l'addestramento dell'IA.
Letto in senso stretto, il caso dice poco sul modello locale di Kjellberg. Letto come segnale, dice che i tribunali sono disposti a pesare molto il danno di mercato quando un modello è addestrato su materiale di un prodotto con cui compete. I laboratori si stanno già comportando come se quel principio si applicasse ai loro output. I tribunali non hanno ancora detto se è così.
Cosa significa se fai girare un modello piccolo
Per sviluppatori individuali e piccoli team, il quadro pratico è cambiato più in fretta della legge.
Addestrare un modello locale su output che hai generato tu stesso si trova in una zona grigia che dipende dai termini di servizio del fornitore, non dal diritto d'autore. La maggior parte dei principali fornitori vieta di usare gli output per addestrare modelli concorrenti. Ciò che conta come "concorrente" è definito dal fornitore, e l'applicazione può arrivare senza preavviso sotto forma di una chiave sospesa.
Ci sono alcune cose che vale la pena fare. Leggi i termini di servizio del modello specifico da cui stai distillando, non la politica generale. Conserva registrazioni di come sono stati prodotti i dati di addestramento, perché se un fornitore lo chiede, una traccia verificabile è la differenza tra un avvertimento e un ban. Preferisci output di modelli le cui licenze consentono esplicitamente l'addestramento derivato, il che include molti modelli open-weight. E se il tuo prodotto dipende dall'API di un singolo fornitore, tratta quella dipendenza come un rischio, non come una comodità.
Kjellberg è un caso di prova insolito perché è pubblico e la posta in gioco per lui è bassa. La lezione non è che è stato trattato ingiustamente o che se lo meritava. È che la tolleranza verso la distillazione si è ridotta al punto che un progetto personale su hardware consumer ha attirato due ban. I team che usano la stessa tecnica su larga scala dovrebbero presumere meno margine, non di più.
Articoli correlati
Salesforce paga 2 miliardi di dollari per un'azienda che intervista i tuoi clienti al posto tuo
Le interviste sono prove. I gemelli digitali sono una previsione. La linea che li separa è il banco di prova.
AMD acquista World Labs di Fei-Fei Li per 8,2 miliardi di dollari per possedere l'AI fisica
AMD sta comprando un laboratorio di ricerca, e per farlo paga il prezzo da produttore di chip.
Google ha messo una TPU in orbita e ha iniziato a fare i conti con il costo dei data center spaziali
Un chip funzionante dimostra che il viaggio è sopravvivibile. Dice poco sul profitto.
Qualcuno ha catalogato 13.000 modi in cui la scrittura AI si tradisce
Gli indizi non sono scomparsi. Si sono spostati in un punto più difficile da vedere.