ByteDance no pudo librarse de una demanda por cómo obtuvo los videos

Un grupo de YouTubers demandó a ByteDance, alegando que la empresa extrajo millones de videos para entrenar su modelo de texto a video. ByteDance pidió a un tribunal federal de California que desestimara el caso. El 2 de octubre, la jueza Jacqueline Scott Corley rechazó la solicitud.
La sentencia se basa en una sección de la ley de derechos de autor que había permanecido al margen del debate sobre el entrenamiento de IA. Todos han estado discutiendo sobre el uso legítimo, que es la sección 107. Los YouTubers discuten sobre la sección 1201, que prohíbe eludir medidas técnicas que controlan el acceso a una obra protegida por derechos de autor.
Ese es un caso distinto, y la defensa de ByteDance depende de la diferencia.
El argumento que esgrimió ByteDance
La postura de la empresa era que las medidas de protección de YouTube regulan la descarga, no el acceso. Los videos en cuestión son públicos. Cualquiera puede verlos. Si el contenido ya está disponible para todos, argumentó ByteDance, una medida que ralentiza la descarga masiva no es un control de acceso en el sentido que pretende la ley, y la sección 1201 no se aplica.
La jueza Corley lo rechazó. Sostuvo que las salvaguardas de YouTube que ByteDance supuestamente eludió son el tipo de control de acceso que la DMCA prohíbe eludir. Lo que la plataforma restringía, según su interpretación, era la forma y el volumen de acceso, y eso cuenta.
La distinción que trazó es la que importa en adelante. Un muro de pago es un control de acceso. También lo es un inicio de sesión. Al parecer, también lo es un limitador de tasa o una medida antibots que protege contenido que, por lo demás, se puede ver gratis. La ley no dice que la obra tenga que ser secreta.
Por qué esto es un problema para el pipeline de entrenamiento
El efecto práctico es que un método de recolección de datos puede ser ilegal incluso cuando los datos en sí se publicaron públicamente.
Si un tribunal está de acuerdo con esa interpretación, entonces la cuestión de cumplimiento para quien entrena un modelo cambia. Ya no se trata solo de “¿tenía derecho a aprender de esta obra?”. También pasa a ser “¿obtuve la obra de una manera que la plataforma permitía?”. Son preguntas separadas con respuestas separadas, y una empresa puede acertar en la primera y equivocarse en la segunda.
La segunda pregunta también es más fácil de litigar para un demandante. El uso legítimo requiere un análisis de cuatro factores sobre propósito, naturaleza, cantidad y efecto en el mercado, y las respuestas son discutibles. Que un scraper haya eludido una medida técnica se acerca más a una determinación fáctica. O la herramienta eludió el control o no lo hizo.

La sección 1201 ha rondado los casos de IA desde hace un tiempo
Esta no es la primera vez que esa sección aparece en una disputa de entrenamiento, y los casos anteriores fueron en la dirección opuesta.
En Doe v. GitHub, los desarrolladores argumentaron que Copilot reprodujo su código sin licencia, y el tratamiento que hizo el tribunal de la reclamación bajo la sección 1202, que abarca la eliminación de información de gestión de derechos de autor, fue más restrictivo de lo que esperaban los demandantes. En el caso de Roblox, un artista llamado Austin Beaulier demandó por la eliminación de etiquetas NoAI de modelos 3D utilizados en un conjunto de datos de entrenamiento. La jueza Beth Labson Freeman también lo desestimó el 2 de octubre, sosteniendo que la etiqueta NoAI sí cuenta como información de gestión de contenido, pero que el demandante no había demostrado que Roblox la hubiera eliminado intencionalmente.
Ambos casos tratan sobre la sección 1202, que se refiere a la información adjunta a una obra. El caso de ByteDance trata sobre la sección 1201, que se refiere a la barrera frente a ella. La desestimación de Roblox y la supervivencia del caso de ByteDance el mismo día hacen visible la división: una reclamación sobre metadatos que se eliminaron es difícil de probar, y una reclamación sobre una barrera que se eludió es más fácil.
El panorama del uso legítimo tampoco está resuelto
La misma semana trajo la opinión sin tachaduras en Thomson Reuters v. ROSS Intelligence, donde el Tercer Circuito sostuvo que entrenar una herramienta de investigación legal con headnotes de Westlaw no constituía uso legítimo. Ese caso trata sobre la sección 107 y no contiene ninguna medida técnica. ROSS copió resúmenes editoriales y los usó para construir un producto competidor.
Las tres decisiones, en conjunto, describen un escenario en el que la exposición legal de un pipeline de entrenamiento de IA depende de la mecánica más que de los principios. Cómo se obtuvieron los datos, si los metadatos sobrevivieron al pipeline y si el resultado compitió con la fuente conllevan cada uno su propia regla.
Para una empresa que recopila datos de entrenamiento a escala, la consecuencia operativa es que la capa de recolección es ahora una superficie de cumplimiento por derecho propio. Registrar cómo se comportó un rastreador, respetar los límites de velocidad y las directivas de robots, y negarse a construir eludiendo las defensas de la plataforma han dejado de ser cortesías. Ahora deciden si un caso puede desestimarse en la etapa de alegaciones.
Por qué el interés de la plataforma importa tanto como el del creador
Una reclamación bajo la sección 1201 pertenece tanto a quien construyó la barrera como a quien tiene su obra detrás de ella.
Las medidas de protección de YouTube existen porque la plataforma tiene su propio interés en controlar cómo se accede a su catálogo. La descarga masiva es costosa para un servicio que sirve video a escala, y el scraping tiene consecuencias para el ancho de banda, para la medición publicitaria y para los acuerdos de licencia que la plataforma negocia con los titulares de derechos. Una sentencia que trata esas medidas como controles de acceso entrega a las plataformas una herramienta legal contra la recolección automatizada de cualquier tipo, y antes no tenían ninguna.
Eso va más allá del entrenamiento de IA. Abarca la monitorización de precios, los conjuntos de datos de investigación académica, el análisis competitivo y cualquier otra cosa que lea un sitio de forma masiva. La disposición contra la elusión es anterior a todo esto por décadas, y ahora se le pide que gobierne una categoría de actividad que sus redactores no imaginaron.
Para los titulares de derechos, la consecuencia es una segunda vía de acceso a los tribunales. Un creador que no pueda ganar un argumento de uso legítimo contra quien entrena un modelo aún puede tener una reclamación sobre cómo se obtuvo la obra, y esa reclamación no exige probar daño económico de la misma manera. Exige probar que se eludió una medida técnica.
Hacia dónde es probable que vaya el descubrimiento
Si el caso sobrevive hasta el descubrimiento, el material interesante será operativo más que legal. Qué herramientas de rastreo se usaron, si se configuraron para respetar las directivas de la plataforma, cuántas solicitudes se hicieron y durante qué período, y qué escribieron los propios ingenieros de la empresa sobre los riesgos en ese momento.
Los documentos internos han determinado el resultado de varios casos recientes de IA, y un pipeline de entrenamiento a la escala de ByteDance deja un rastro sustancial. La pregunta de si alguien señaló la exposición legal antes de que comenzara el scraping es la que tiende a decidir el valor de un acuerdo.
Qué viene después
La sentencia no decide si ByteDance infringió. Mantiene vivo el caso en la etapa de alegaciones, lo que significa que los YouTubers obtienen el descubrimiento. Ahí es donde los detalles se hacen públicos: qué videos, qué herramientas, qué medidas se eludieron y cuántas veces.
El camino más probable es un acuerdo antes del juicio. Las demandas de esta forma suelen terminar así, y ByteDance no tiene interés en un registro público de cómo operaba un pipeline de entrenamiento. Pero la cuestión legal ya está en el sistema, y la respuesta moldeará cómo cada futuro scraper se enfrenta a las defensas de una plataforma.
Hay un punto más amplio. El problema de los datos de la industria de la IA se ha tratado como un problema de licencias: pague al titular de derechos y todo está bien. Esta línea de casos sugiere que pagar no es suficiente, porque la plataforma que aloja la obra tiene sus propios intereses, codificados en medidas técnicas y respaldados por una ley a la que no le importa si la obra era gratuita de leer. Obtener el contenido legalmente y obtenerlo limpiamente son ahora dos obligaciones separadas.
Artículos relacionados
Los fundadores de una empresa de energía renovable acaban de pedir 20.000 GPU Nvidia Rubin
El pedido de chips es la parte fácil. Las estructuras de financiación que hay debajo son donde reside el riesgo.
La Casa Blanca entregó la política de IA a su jefe de inteligencia, y la aplicación viene desde otro lugar
La agenda de IA del gobierno federal se está definiendo en al menos dos lugares a la vez, y esos dos no están obviamente alineados.
Australia ordenó a todas las agencias federales que auditaran sus sistemas heredados tras la brecha de Medicare
La auditoría sacará a la luz la exposición. Financiar la solución es un ejercicio aparte con un presupuesto aparte.
Un tribunal de Wuhan incorporó el costo de cómputo de IA en un fallo de derechos de autor y sentó un nuevo tipo de precedente
La cantidad es pequeña. El método trata una factura de API como evidencia de lo que costó hacer la obra.