← Volver al blog
Newsaprox. 8 min de lectura

robots.txt es un muro de papel: Reddit contra Anthropic y la audiencia sobre cumplimiento en Australia

Publicado 7 oct 2026
robots.txt es un muro de papel: Reddit contra Anthropic y la audiencia sobre cumplimiento en Australia

Cada sitio web tiene un pequeño archivo de texto llamado robots.txt. Indica a los programas automatizados qué páginas pueden leer y cuáles deben dejar en paz. Es un letrero amable pegado en una puerta sin cerradura. El letrero no tiene ninguna cerradura detrás.

Esa brecha entre una solicitud y un mecanismo de aplicación es ahora el centro de dos disputas separadas, una en un tribunal de EE. UU. y otra en una audiencia parlamentaria australiana. Ambas plantean la misma pregunta desde ángulos distintos: ¿qué significa realmente una señal de "no rastrear" cuando se ignora?

Australia: la exclusión voluntaria que no puede excluir

Anthropic compareció ante la Comisión Selecta Conjunta sobre Inteligencia Artificial de Australia a principios de octubre. Había propuesto lo que denominó una "forma limitada de aprobación condicional" para el entrenamiento de IA con contenido local, con titulares de derechos que se excluyeran bloqueando a los rastreadores en robots.txt. La presentación aceptaba implícitamente el rechazo de Australia a una amplia exención de minería de textos y datos, y ofrecía la exclusión voluntaria como el compromiso.

Los radiodifusores públicos no lo aceptaron. La directora de contenido y operaciones legales de la ABC, Kate Gilchrist, dijo al comité que el sistema de derechos de autor es adecuado y que las empresas de IA pueden negociar las licencias que necesitan. Su objeción a la exclusión voluntaria era estructural. Dijo que el radiodifusor no puede peinar internet para asegurarse de estar excluido en todos los sitios relevantes: "Simplemente no funciona".

SBS planteó el mismo punto en su propia presentación, escribiendo que las señales de robots.txt se eluden de forma rutinaria y que la responsabilidad debería recaer en las empresas de IA para evitar infracciones.

La asimetría que describió Gilchrist es el quid. Los titulares de derechos deben identificar, monitorear y mantener señales de exclusión en todos los canales posibles de scraping, indefinidamente. Las empresas de IA enfrentan un costo técnico casi nulo para eludir una señal y, hasta que exista un remedio específico, un costo legal casi nulo también. Un rastreador puede ignorar robots.txt usando un identificador de agente de usuario diferente, pasando por un intermediario o habiendo recolectado el contenido antes de que se colocara el bloqueo.

Existe una base documentada para la sospecha. TollBit, una startup que intermediaba acuerdos de licencia entre editores y empresas de IA, descubrió que agentes de IA de múltiples fuentes eludían el protocolo robots.txt para recuperar contenido. Business Insider informó posteriormente que OpenAI y Anthropic eludieron señales de robots.txt a pesar de sus declaraciones públicas de respetarlas.

La propia posición de la ABC conlleva una ironía que vale la pena señalar. En julio de 2026, el radiodifusor seleccionó Claude, de Anthropic, como su plataforma de IA empresarial, iniciando un piloto con 100 empleados para convertir transmisiones de radio en artículos digitales, mientras argumentaba simultáneamente que los productos de Anthropic probablemente fueron entrenados con su contenido sin permiso. Ambas cosas pueden ser ciertas a la vez, y ese es precisamente el punto: la cooperación en un frente no resuelve la cuestión en otro.

Estados Unidos: la vía contractual

El caso de Reddit contra Anthropic toma un camino legal diferente. Un tribunal federal permitió que las reclamaciones contractuales de Reddit continuaran, lo que da a las plataformas una vía para impugnar la recolección de datos fuera de la ley de derechos de autor.

Esa distinción importa. Los derechos de autor preguntan si se copió material protegido y si se aplica una defensa. El contrato pregunta si el recolector aceptó condiciones sobre el acceso, la recolección automatizada o el uso comercial. Para las plataformas cuyo valor reside en parte en material que alojan pero no poseen por completo, la teoría contractual es la más utilizable.

La orden de reenvío no decidió que Anthropic incumpliera el acuerdo de Reddit. Su importancia más amplia es más limitada: el tribunal trató los derechos contractuales de Reddit como cualitativamente diferentes de los derechos de autor, dejando viva la teoría de incumplimiento de contrato en la disputa activa.

Cuando los términos de servicio adquieren peso práctico, se convierten en infraestructura de gobernanza de datos. Una empresa necesita probar el aviso, la aceptación, las condiciones de acceso y la versión relevante de los términos en el momento de la recolección, más allá de lo que una política declara a simple vista. El litigio puede depender de qué términos se aplicaban durante el período de acceso en disputa y cómo se mostraban.

Por qué robots.txt nunca iba a sostenerse

El archivo tiene una historia invertida. En la década de 1990, robots.txt existía principalmente para evitar que los motores de búsqueda saturaran demasiado un servidor. Los sitios competían por ser indexados, porque estar indexado significaba visitantes. Desde entonces, la relación se ha invertido. El mismo archivo ahora se usa para cerrar una puerta, porque las nuevas máquinas que leen la web no devuelven a nadie.

El bloqueo solo funciona con rastreadores que obedecen el bloqueo. La proporción de sitios de noticias respetados que bloquean programas de IA saltó de aproximadamente el 23 % en septiembre de 2023 a casi el 60 % en mayo de 2025. Sin embargo, se observó que el propio rastreador de OpenAI ignoraba esas notas el 42 % de las veces a finales de 2024, y pruebas más amplias encontraron violaciones en el 72 % de los sitios empresariales del Reino Unido.

Un letrero es tan fuerte como el abogado que está detrás de él, y la mayoría de los sitios no tiene el de Reddit.

Qué significa esto para los desarrolladores

Para las empresas que construyen sistemas de IA, la lección práctica es de diligencia. Cuando compras o recopilas datos de entrenamiento, necesitas saber si se reunieron bajo condiciones que entran en conflicto con los términos de la plataforma de origen. Eso conecta la procedencia contractual con las señales de confianza legibles por máquina que se supone que hacen posible el cumplimiento automático.

La conclusión incómoda es que el protocolo voluntario se está poniendo a prueba precisamente donde era más débil. Reddit construyó un muro de pago, envió una advertencia legal, vio cómo las citas de su contenido aumentaban casi 40 veces en las respuestas de un competidor y luego demandó. El letrero pidió. La puerta bloqueó. Solo la demanda amenaza.

Que robots.txt adquiera fuerza depende de cómo le vaya a la teoría contractual de Reddit y de si Australia legisla un remedio en lugar de depender de una señal que su propio radiodifusor nacional dice que no funciona. Hasta entonces, el letrero amable en la puerta sin cerradura sigue siendo exactamente eso.

La cuestión del cumplimiento que nadie puede responder desde fuera

Hay una razón por la que el debate sigue volviendo a la aplicación en lugar del principio. Todos están de acuerdo en abstracto en que los términos de acceso de un sitio deberían significar algo. El desacuerdo es sobre quién soporta el costo de hacerlo realidad.

En el modelo de exclusión voluntaria que propuso Anthropic, el costo recae en el titular de los derechos. Un editor debe descubrir qué rastreadores leen su contenido, codificar los bloqueos correctos, mantenerlos actualizados a medida que aparecen nuevos rastreadores y monitorear infracciones. Es una carga operativa continua que escala con el número de empresas de IA, y no produce ningún remedio cuando un rastreador ignora el bloqueo.

En el modelo de permiso previo que defendía la ABC, el costo recae en la empresa de IA. Debe identificar con qué quiere entrenar, negociar licencias y mantener registros de lo que se le permite usar. Es un arreglo conocido, y es el que ya respalda el derecho de autor.

Dos tablas pálidas de pie sobre pizarra oscura con un fino hilo de luz que corre entre ellas

Los dos modelos ponen el costo de monitoreo en partes diferentes, una diferencia de política con un filo práctico, y la parte que actualmente lo soporta dice que no puede permitírselo. Por eso el debate sobre robots.txt sigue resurgiendo en cada jurisdicción que intenta legislar sobre el entrenamiento de IA: se le pide al estándar técnico que haga un trabajo legal para el que nunca fue diseñado.

Por qué la solución técnica sigue quedándose corta

Incluso un registro perfecto de exclusión voluntaria no resolvería el problema de fondo, porque la señal identifica a un rastreador y no a una empresa. Una firma puede hacer scraping a través de un intermediario, usar un agente de usuario diferente o depender de contenido que recopiló antes de que se colocara cualquier bloqueo.

El registro histórico lo hace concreto. GPTBot comenzó a cumplir formalmente las instrucciones de robots.txt solo después de que los modelos que lo hicieron comercialmente valioso ya habían sido entrenados. Un bloqueo prospectivo no puede deshacer una recolección retrospectiva, y un bloqueo sobre un identificador no obliga a una firma que puede presentarse bajo otro.

Esa es la brecha que señaló la ABC cuando dijo que no puede vigilar todo internet del lado de los titulares de derechos. La señal es barata para el emisor y costosa para el receptor, lo inverso a como suele funcionar un mecanismo de cumplimiento eficaz. Hasta que un remedio se vincule con ignorar la señal, el incentivo corre en una sola dirección.

Artículos relacionados