robots.txt è un muro di carta: Reddit contro Anthropic e l'audizione australiana sulla conformità

Ogni sito web ha un piccolo file di testo chiamato robots.txt. Indica ai programmi automatizzati quali pagine possono leggere e quali lasciare stare. È un cartello gentile attaccato a una porta aperta. Dietro il cartello non c'è alcuna serratura.
Quel divario tra una richiesta e un meccanismo di applicazione è ora al centro di due battaglie separate, una in un tribunale statunitense e una in un'audizione parlamentare australiana. Entrambe pongono la stessa domanda da angolazioni diverse: cosa significa davvero un segnale "do not crawl" quando viene ignorato?
Australia: l'opt-out che non riesce a escludere
Anthropic è comparsa davanti alla Commissione mista speciale australiana sull'intelligenza artificiale all'inizio di ottobre. Aveva proposto quella che ha definito una "forma ristretta di approvazione condizionale" per l'addestramento dell'IA su contenuti locali, con i titolari dei diritti che esercitano l'opt-out bloccando i crawler in robots.txt. La presentazione accettava implicitamente il rifiuto dell'Australia di un'ampia esenzione per il text and data mining e offriva l'opt-out come compromesso.
I broadcaster pubblici non l'hanno accettata. La responsabile dei contenuti e delle operazioni legali dell'ABC, Kate Gilchrist, ha detto alla commissione che il sistema del copyright è adeguato e che le aziende di IA possono negoziare le licenze di cui hanno bisogno. La sua obiezione all'opt-out era strutturale. Ha affermato che l'emittente non può setacciare Internet per assicurarsi di essere esclusa da tutti i siti pertinenti: "Semplicemente non funziona".
SBS ha fatto lo stesso punto nella propria presentazione, scrivendo che i segnali robots.txt vengono regolarmente aggirati e che l'onere di evitare comportamenti illeciti dovrebbe ricadere sulle aziende di IA.
L'asimmetria descritta da Gilchrist è il nodo. I titolari dei diritti devono identificare, monitorare e mantenere i segnali di opt-out su ogni possibile canale di scraping, a tempo indeterminato. Le aziende di IA affrontano un costo tecnico quasi nullo per aggirare un segnale e, finché non esiste un rimedio specifico, anche un costo legale quasi nullo. Un crawler può ignorare robots.txt usando un identificatore user-agent diverso, passando attraverso un intermediario o avendo raccolto il contenuto prima che il blocco fosse inserito.
C'è una base documentata per il sospetto. TollBit, una startup che intermedia accordi di licenza tra editori e aziende di IA, ha scoperto che agenti di IA provenienti da più fonti aggiravano il protocollo robots.txt per recuperare contenuti. Business Insider ha successivamente riferito che OpenAI e Anthropic hanno aggirato i segnali robots.txt nonostante le dichiarazioni pubbliche di rispettarli.
La posizione stessa dell'ABC contiene un'ironia degna di nota. Nel luglio 2026 l'emittente ha scelto Claude di Anthropic come propria piattaforma di IA aziendale, avviando un progetto pilota con 100 dipendenti per convertire trasmissioni radiofoniche in articoli digitali, mentre contemporaneamente sosteneva che i prodotti di Anthropic erano probabilmente addestrati sui suoi contenuti senza autorizzazione. Entrambe le cose possono essere vere allo stesso tempo, ed è proprio questo il punto: la cooperazione su un fronte non risolve la questione su un altro.
Gli Stati Uniti: la via contrattuale
Il caso Reddit contro Anthropic segue un percorso legale diverso. Un tribunale federale ha consentito che le rivendicazioni contrattuali di Reddit proseguissero, offrendo alle piattaforme una via per contestare la raccolta di dati al di fuori del diritto d'autore.
Questa distinzione è importante. Il copyright chiede se materiale protetto è stato copiato e se si applica una difesa. Il contratto chiede se il raccoglitore ha accettato condizioni relative all'accesso, alla raccolta automatizzata o all'uso commerciale. Per le piattaforme il cui valore risiede in parte in materiale che ospitano ma non possiedono completamente, la teoria contrattuale è quella più utilizzabile.
L'ordinanza di rinvio non ha stabilito che Anthropic abbia violato l'accordo di Reddit. La sua importanza più ampia è più ristretta: il tribunale ha trattato i diritti contrattuali di Reddit come qualitativamente diversi dai diritti d'autore, lasciando viva la teoria dell'inadempimento contrattuale nella controversia in corso.
Quando i termini di servizio acquisiscono peso pratico, si trasformano in infrastruttura di governance dei dati. Un'azienda deve dimostrare notifica, consenso, condizioni di accesso e la versione pertinente dei termini al momento della raccolta, al di là di ciò che una policy afferma in apparenza. Il contenzioso può dipendere da quali termini si applicavano durante il periodo di accesso contestato e da come erano visualizzati.
Perché robots.txt non avrebbe mai retto
Il file ha una storia capovolta. Negli anni '90, robots.txt esisteva principalmente per impedire ai motori di ricerca di martellare troppo un server. I siti competevano per essere indicizzati, perché essere indicizzati significava visitatori. Da allora il rapporto si è ribaltato. Lo stesso file oggi viene usato per chiudere una porta, perché le nuove macchine che leggono il web non rimandano nessuno indietro.
Il blocco funziona solo sui crawler che obbediscono al blocco. La quota di siti di notizie rispettati che bloccano i programmi di IA è balzata da circa il 23 per cento nel settembre 2023 a quasi il 60 per cento entro maggio 2025. Eppure il crawler di OpenAI è stato osservato ignorare quelle note nel 42 per cento dei casi alla fine del 2024, e test più ampi hanno rilevato violazioni sul 72 per cento dei siti aziendali britannici.
Un cartello è forte solo quanto l'avvocato che gli sta dietro, e la maggior parte dei siti non ha quello di Reddit.
Cosa significa per chi costruisce
Per le aziende che costruiscono sistemi di IA, la lezione pratica riguarda la due diligence. Quando acquisti o raccogli dati di addestramento, devi sapere se sono stati raccolti in condizioni che confliggono con i termini della piattaforma di origine. Ciò collega la provenienza contrattuale ai segnali di fiducia leggibili dalle macchine che dovrebbero rendere possibile la conformità automatica.
La conclusione scomoda è che il protocollo volontario viene messo alla prova proprio dove era più debole. Reddit ha costruito un muro a pagamento, ha inviato un avvertimento legale, ha visto le citazioni dei suoi contenuti aumentare di quasi 40 volte nelle risposte di un concorrente, e poi ha fatto causa. Il cartello chiedeva. Il cancello bloccava. Solo la causa legale costituisce una minaccia.
Se robots.txt acquisirà denti dipende da come andrà la teoria contrattuale di Reddit e se l'Australia legifererà un rimedio invece di affidarsi a un segnale che il suo stesso broadcaster nazionale dice non funzionare. Fino ad allora, il cartello gentile sulla porta aperta resta esattamente quello.
La questione della conformità a cui nessuno può rispondere dall'esterno
C'è una ragione se il dibattito continua a tornare sull'applicazione più che sul principio. Tutti concordano in astratto che i termini di accesso di un sito dovrebbero significare qualcosa. Il disaccordo riguarda chi sopporta il costo per renderlo vero.
Nel modello di opt-out proposto da Anthropic, il costo ricade sul titolare dei diritti. Un editore deve scoprire quali crawler leggono i suoi contenuti, codificare i blocchi corretti, mantenerli aggiornati man mano che compaiono nuovi crawler e monitorare le violazioni. È un onere operativo continuo che cresce con il numero di aziende di IA e non produce alcun rimedio quando un crawler ignora il blocco.
Nel modello che privilegia il permesso, sostenuto dall'ABC, il costo ricade sull'azienda di IA. Questa deve identificare ciò su cui vuole addestrarsi, negoziare le licenze e conservare registrazioni di ciò che è autorizzata a usare. È un accordo familiare, ed è quello che il copyright già supporta.

I due modelli attribuiscono il costo di monitoraggio a parti diverse, una differenza politica con un risvolto pratico, e la parte che attualmente lo sopporta dice di non poterselo permettere. Ecco perché il dibattito su robots.txt continua a riemergere in ogni giurisdizione che cerca di legiferare sull'addestramento dell'IA: si chiede allo standard tecnico di svolgere un lavoro legale per cui non è mai stato progettato.
Perché la soluzione tecnica continua a essere insufficiente
Anche un registro di opt-out perfetto non risolverebbe il problema di fondo, perché il segnale identifica un crawler, non un'azienda. Un'impresa può fare scraping attraverso un intermediario, usare uno user-agent diverso o basarsi su contenuti raccolti prima che fosse inserito qualsiasi blocco.
Il registro storico lo rende concreto. GPTBot ha iniziato a conformarsi formalmente alle istruzioni di robots.txt solo dopo che i modelli che lo rendevano commercialmente prezioso erano già stati addestrati. Un blocco prospettico non può annullare una raccolta retrospettiva, e un blocco su un identificatore non vincola un'impresa che può presentarsi sotto un altro.
È il divario che l'ABC ha indicato quando ha detto di non poter sorvegliare l'intera Internet dalla parte dei titolari dei diritti. Il segnale è economico per chi lo invia e costoso per chi lo riceve, l'inverso di come di solito funziona un meccanismo di conformità efficace. Finché non si collega un rimedio all'ignorare il segnale, l'incentivo va in una sola direzione.
Articoli correlati
L'India scrive le proprie regole di sicurezza per l'IA e rifiuta di copiare quelle di Washington
Testare solo in inglese produrrebbe un quadro che non certifica nulla riguardo alla maggior parte delle implementazioni che pretende di coprire.
Tavus Griffin è passato per umano nel 48 percento dei casi, e l'azienda non lo rilascerà
Un falso preregistrato risponde solo a domande preparate. Un sistema in tempo reale risponde a qualunque cosa gli venga chiesta.
Anthropic ha trovato 129.000 vulnerabilità, poi ha stretto la porta
L'azienda, nel pieno di una dimostrazione di sicurezza, ha scelto proprio quel momento per limitare ulteriormente l'accesso, e il motivo non è contraddittorio.
Nelle pagine prodotto di abbigliamento femminile non c'è nessuna persona reale: le modelle AI spingono la fiducia nell'e-commerce sull'orlo del baratro
Le immagini non sono credibili, quindi il tasso di reso sale; il tasso di reso sale, quindi i venditori comprimono ancora di più i costi di produzione; e comprimere i costi rende le immagini ancora meno credibili. Questo circolo non è un problema tecnologico: è un sistema di incentivi che si è rotto.