← Volver al blog
Newsaprox. 8 min de lectura

El Noveno Circuito afirma que las salidas de Copilot no son copias despojadas de atribución

Publicado 4 oct 2026
El Noveno Circuito afirma que las salidas de Copilot no son copias despojadas de atribución

Un tribunal federal de apelaciones le ha dado a GitHub y OpenAI una victoria limitada pero trascendente y, al hacerlo, ha trazado una línea que toda empresa que entrene un modelo con el trabajo de otras personas debería leer con atención.

El caso es Doe v. GitHub. Los demandantes son programadores anónimos que publicaron código de código abierto bajo licencias que exigen atribución. Los demandados son GitHub, su matriz Microsoft y las entidades de OpenAI. Los productos en cuestión son GitHub, Copilot y OpenAI Codex, todos entrenados con repositorios públicos.

Los demandantes presentaron dos teorías en virtud de la Ley de Derechos de Autor del Milenio Digital, ambas basadas en la sección 1202, que prohíbe eliminar o alterar la información de gestión de derechos de autor. La primera era una teoría de entrada: que los demandados eliminaron los datos de atribución del código de los demandantes antes de introducirlo en Copilot como datos de entrenamiento. La segunda era una teoría de salida: que Copilot a veces devuelve datos de entrenamiento memorizados sin la atribución del código fuente, y que hacerlo equivale a eliminar o alterar esa información.

Un pasillo subterráneo tenue de archivo flanqueado por estanterías metálicas con cajas de almacenamiento grises

La teoría de entrada nunca llegó a debatirse

El Noveno Circuito se negó a pronunciarse sobre la reclamación relativa a la etapa de entrenamiento, y vale la pena señalar el motivo. En el tribunal inferior, el abogado de los demandantes admitió que copiar los datos de entrenamiento “quizás” no violaba las licencias, y el tribunal de distrito declaró sin rodeos que la demanda “no trata sobre el entrenamiento”. Los demandantes no objetaron. En apelación, el panel consideró que se había renunciado a la teoría.

Esa renuncia importa más de lo que parece. La cuestión de la etapa de entrenamiento es la que habría afectado a todos los modelos entrenados con datos extraídos mediante scraping o con licencia. Al perderla por una concesión procesal y no por el fondo, los demandantes dejaron abierta la pregunta más importante y la dejaron para otro caso.

Por qué fracasó la teoría de salida

En cuanto al fondo, el tribunal rechazó la teoría de salida apoyándose en la propia descripción que los demandantes hacían del funcionamiento de Copilot. La demanda describía un “proceso probabilístico complejo” que infiere patrones estadísticos y predice la finalización más probable. Eso, concluyó el panel, describe generación en lugar de recuperación, y una obra generada “no puede describirse razonablemente como una copia de” el código protegido.

El tribunal contrastó Copilot con un motor de búsqueda. Un motor de búsqueda recupera copias almacenadas, por lo que tiene una copia de la cual podría eliminarse la atribución. Un modelo que predice el siguiente token no posee, según la lectura del tribunal, tal copia.

Luego el panel abordó el llamado requisito de identidad y aquí hizo algo que se citará en escritos judiciales durante años. Se negó a tratar la identidad como un elemento separado de una reclamación bajo la sección 1202. En su lugar, describió la identidad como una glosa de las palabras legales “eliminar”, “alterar” y “copias”, y como evidencia en lugar de una prueba. La reproducción casi idéntica sin atribución respalda la inferencia de que se eliminó la atribución. Las diferencias materiales apuntan en sentido contrario, hacia una obra nueva a la que nunca se le añadió atribución.

Qué cambia realmente el fallo

El efecto práctico es una restricción, no un respiro. Los titulares de derechos de autor que esperaban que la DMCA les diera un atajo para evitar las cuestiones más difíciles del uso justo y la similitud sustancial ahora tienen que recorrer el camino largo.

El propio enfoque del tribunal señala dónde estarán las próximas batallas. Los titulares se apoyarán con más fuerza en las teorías de la etapa de entrenamiento, argumentando que la atribución se eliminó de los datos antes de que llegaran siquiera al modelo. Y seguirán impulsando reclamaciones ordinarias de infracción sobre las salidas, donde la prueba es la similitud con una obra protegida, no la mecánica de los metadatos de atribución.

Hay una segunda lectura que vale la pena retener. El panel tuvo cuidado de decir que la identidad es evidencia, no un elemento. Eso les da a los titulares un camino: construir un registro de salidas que reproduzcan código protegido casi textualmente, sin atribución, y la inferencia queda disponible. La línea entre un modelo que ha memorizado y uno que ha generalizado ahora es en parte una cuestión de qué tan cerca cae la salida y qué tan bien puede probarlo un demandante.

La forma más amplia del problema

Si se mira con distancia, el caso se parece menos a un veredicto sobre la IA y más a una instantánea de un sistema legal que se pone al día de manera desigual. La atribución nunca se diseñó para sobrevivir a un modelo probabilístico. La información de gestión de derechos de autor presupone una copia con metadatos adjuntos. Cuando el sistema produce algo nuevo a partir de un proceso estadístico, no hay copia de la cual se hayan eliminado los metadatos.

Ese es un argumento sobre la forma de la tecnología, y es el mismo argumento que aparece en cada disputa donde las viejas categorías no encajan. El Noveno Circuito optó por leer las palabras de la ley literalmente en lugar de forzarlas, lo cual es defendible y también deja intacta la tensión de fondo.

Para los desarrolladores, la conclusión es poco glamorosa. La DMCA es un escudo más débil de lo que algunos esperaban, pero no ha desaparecido. Para los demandantes, la conclusión es que la teoría que concedes en el tribunal de distrito es la teoría que pierdes en apelación. Y para todos los que entrenan modelos con código público, la advertencia más duradera proviene de la propia lógica del tribunal: cuanto más cerca caiga tu salida de una entrada específica, menos se sostendrá el encuadre de “obra nueva”.

Qué significa ejecutar un modelo con el código de otra persona

Para cualquiera que mantenga un proyecto de código abierto, la lectura práctica es más limitada de lo que sugieren los titulares. La vía de atribución de la DMCA es ahora más difícil, pero las obligaciones subyacentes de la licencia no se han movido. Si tu código tiene licencia MIT o Apache, un modelo que lo memorizó y lo reproduce sin el aviso sigue siendo un problema de licencia, y el propio razonamiento del tribunal indica cómo probarlo.

La incomodidad también corre en la otra dirección. El fallo se apoya en una descripción de Copilot como generador probabilístico en lugar de sistema de recuperación. Esa descripción es precisa para la mayoría de los prompts y la mayoría de las salidas. Es menos precisa para la cola, donde un modelo reproduce casi exactamente un pasaje largo y distintivo, y es precisamente la cola en torno a la cual un demandante tendría que construir un registro. El tribunal no ha cerrado la puerta a ese caso. Ha hecho del registro todo el argumento.

También hay una consecuencia práctica para las herramientas. La referencia del tribunal de distrito al propio filtro de detección de duplicados de GitHub, que marca coincidencias de 150 caracteres, ahora forma parte del expediente de apelación. Los sistemas que ya miden qué tan cerca cae una salida de los datos de entrenamiento son los mejor posicionados para responder la pregunta que el tribunal dejó abierta, lo que sugiere que la infraestructura de cumplimiento y la estrategia litigiosa apuntan en la misma dirección.

Los casos aún en curso

Esta decisión llega a un campo abarrotado. Thomson Reuters ganó su apelación contra Ross Intelligence en el Tercer Circuito en septiembre, sobre una cuestión de uso justo y no de metadatos de atribución, y ese fallo dependió en gran medida del hecho de que Ross construyó un producto que competía con la misma base de datos con la que se entrenó. La decisión sobre Copilot del Noveno Circuito y la decisión sobre Westlaw del Tercer Circuito responden a preguntas diferentes, y ninguna controla a la otra.

Esa divergencia es el estado del derecho de autor sobre IA en 2026. Los tribunales resuelven las piezas que llegan a ellos, en incrementos circuito a circuito, con hechos que no se generalizan bien. Un fallo sobre una herramienta de investigación jurídica dice poco sobre un asistente de código, y un fallo sobre metadatos de atribución dice poco sobre el uso justo. Quien espere que una sola decisión resuelva la cuestión espera algo que la estructura del sistema no produce.

La decisión estrecha un camino y deja varios otros abiertos. Así se están resolviendo ahora mismo la mayoría de estas cuestiones de derechos de autor sobre IA, una pieza a la vez, en el caso que sea que llegue primero.

Artículos relacionados