PewDiePie fue baneado dos veces por destilación, y las normas se volvieron personales

Felix Kjellberg, más conocido como PewDiePie, les dijo a sus seguidores que OpenAI lo baneó dos veces. Su falta no fue contrabandear pesos ni revender acceso a la API a gran escala. Usó salidas de uno de los modelos de OpenAI para entrenar a Ajax, un modelo de 9B que ejecuta en su propio hardware para tareas cotidianas como búsquedas y correo electrónico.
Ajax está construido sobre Qwen3.5-9B, un modelo abierto pequeño, y se ha ajustado con datos generados por uno más grande y cerrado. Ese proceso se llama destilación. Es la misma técnica que ha producido una ola de modelos baratos y capaces en los últimos dos años, y es la técnica que los grandes laboratorios ahora se esfuerzan por vigilar.
Qué es realmente la destilación
Destilar un modelo significa entrenar a uno más pequeño para que imite a uno más grande. Le envías prompts al modelo profesor, recopilas sus respuestas y entrenas al modelo estudiante para que las reproduzca. El estudiante no necesita los pesos del profesor ni su arquitectura. Solo necesita suficiente comportamiento del profesor para aprender el patrón.
Por eso les importa a los laboratorios. Entrenar un modelo de frontera cuesta decenas o cientos de millones de dólares. Si un competidor o un particular puede cosechar sus salidas a través de una API y transferir esa capacidad a un modelo propio, la parte costosa del trabajo se evita en parte. La salida parece texto, pero la señal subyacente es lo que se está copiando.

El caso de Kjellberg importa porque es pequeño. No es una startup bien financiada que lanza un producto rival. Es una persona con una GPU de consumo y un modelo local. La aplicación de normas llegó hasta ese punto.
Los laboratorios no están especulando sobre la escala
La prohibición de OpenAI a Kjellberg es la punta visible. Las campañas mayores son industriales. El director ejecutivo de Anthropic, Dario Amodei, ha descrito una sola operación de destilación que usó alrededor de 25.000 cuentas falsas e hizo unos 28,8 millones de intercambios con Claude. Con ese volumen, cosechar salidas no es un proyecto secundario; es una canalización de datos con personal e infraestructura.
OpenAI también ha tomado medidas contra empresas. Le cortó a Cursor el acceso a sus modelos, citando preocupaciones por destilación, después de que xAI usara salidas de OpenAI para entrenar a Grok. El patrón en estas acciones es que la aplicación de normas ya no se dirige solo a revendedores obvios. Apunta a cualquiera cuyo producto dependa de capacidad extraída de un modelo cerrado.
Está surgiendo toda una industria de detección en torno a esto. Los laboratorios buscan patrones de cuentas, volúmenes de solicitudes y las huellas estadísticas de los datos cosechados. Ser descubierto no siempre significa una demanda; puede significar perder el acceso a la API, lo que para una startup suele ser lo mismo.
Veinticinco empresas pidieron reglas más claras
La aplicación de normas por parte de los laboratorios ocurre en un contexto de desacuerdo abierto sobre cuáles deberían ser las reglas. En julio de 2026, veinticinco organizaciones, entre ellas Nvidia, Meta y Microsoft, firmaron una carta en la que argumentaban que los modelos de pesos abiertos son centrales para el liderazgo de EE. UU. en IA. Pidieron marcos legales específicos que aborden la destilación directamente, en lugar de restricciones amplias sobre los modelos abiertos.
OpenAI, Anthropic y Google no firmaron. Los tres tienen modelos de frontera cuyo valor depende de limitar la facilidad con que se pueden copiar sus salidas. La división se reduce a quién puede hacerlo y bajo qué condiciones.
En ese vacío, un tribunal de apelaciones de EE. UU. añadió un dato aparte a finales de septiembre. En Thomson Reuters v. Ross Intelligence, el Tercer Circuito confirmó un fallo que dictaminaba que copiar material editorial de un competidor para entrenar un producto de búsqueda no constituía uso legítimo, porque el producto resultante competía directamente con la fuente. Ese caso trata de un motor de búsqueda, no de un modelo generativo, y el tribunal tuvo cuidado de decir que no estaba decidiendo sobre todo el entrenamiento de IA. Pero señala que el terreno legal bajo los datos de entrenamiento está cambiando al mismo tiempo que la aplicación técnica se endurece.
Por qué el término «destilación» tiene tanto peso
No todo uso de la salida de un modelo es igual, y las reglas actuales difuminan la diferencia. Pedirle a un modelo que te ayude a escribir código es un uso normal. Pedirle que genere millones de ejemplos para que puedas entrenar a un rival no lo es. En algún punto entre esos dos está una persona que usa salidas para hacer que un modelo de aficionado se comporte un poco mejor, que es más o menos donde se sitúa Kjellberg.
Los laboratorios tratan los datos de salida como un activo cuyos derechos de uso y control les pertenecen. Sus términos de servicio lo dicen, y la aplicación de normas sigue los términos en lugar de un estándar legal. Por eso el mismo acto puede permitirse en una cuenta y prohibirse en otra: depende del volumen, de la intención según la interprete el proveedor, y de si el modelo resultante se parece a un competidor. No hay una línea clara, y su ausencia es el verdadero problema para cualquiera que intente mantenerse del lado correcto.
La detección hace que el límite sea más difícil de ver. Los laboratorios buscan patrones que sugieran cosecha: volúmenes de solicitudes inusuales, cuentas creadas por lotes, prompts que se parecen a suites de evaluación. Una persona que ejecuta unos miles de prompts puede no activar ninguno. Una operación que usa 25.000 cuentas sí lo hará. En el medio, la respuesta es genuinamente incierta, y la incertidumbre es una base pobre para un producto.
Una decisión judicial llegó al mismo tiempo
La aplicación técnica se está endureciendo mientras el panorama legal sigue en movimiento. A finales de septiembre, el Tercer Circuito confirmó un fallo que dictaminaba que copiar material editorial de un competidor para entrenar un producto de búsqueda no constituía uso legítimo, porque el producto resultante competía con la fuente. El tribunal tuvo cuidado de señalar que su decisión trataba de un motor de búsqueda, no de un modelo generativo, y que no estaba estableciendo una regla universal para el entrenamiento de IA.
Leído en sentido estricto, el caso dice poco sobre el modelo local de Kjellberg. Leído como una señal, dice que los tribunales están dispuestos a sopesar fuertemente el daño al mercado cuando un modelo se entrena con material de un producto con el que compite. Los laboratorios ya actúan como si ese principio se aplicara a sus salidas. Los tribunales aún no han dicho si se aplica.
Qué significa esto si ejecutas un modelo pequeño
Para desarrolladores individuales y equipos pequeños, el panorama práctico cambió más rápido que la ley.
Entrenar un modelo local con salidas que generaste tú mismo está en una zona gris que depende de los términos de servicio del proveedor, no de la ley de derechos de autor. La mayoría de los proveedores importantes prohíben usar salidas para entrenar modelos competidores. Lo que cuenta como «competidor» lo define el proveedor, y la aplicación de normas puede llegar sin aviso en forma de una clave de API suspendida.
Hay algunas cosas que vale la pena hacer. Lee los términos de servicio del modelo específico del que estás destilando, no la política general. Lleva registros de cómo se produjeron los datos de entrenamiento, porque si un proveedor lo pregunta, un rastro auditable es la diferencia entre una advertencia y una prohibición. Prefiere salidas de modelos cuyas licencias permitan explícitamente el entrenamiento derivado, lo que incluye a muchos modelos de pesos abiertos. Y si tu producto depende de la API de un solo proveedor, trata esa dependencia como un riesgo, no como una comodidad.
Kjellberg es un caso de prueba inusual porque es público y lo que está en juego para él es poco. La lección no es que fue tratado injustamente o que se lo merecía. Es que la tolerancia hacia la destilación se ha estrechado hasta el punto de que un proyecto personal en hardware de consumo provocó dos prohibiciones. Los equipos que aplican la misma técnica a escala deberían asumir menos margen, no más.
Artículos relacionados
La marca de agua no sigue el ritmo de lo falso
Los sistemas funcionan. La cobertura, no. La brecha la está llenando lo que la audiencia asume.
Tu agente de IA ahora llama al servicio de atención al cliente, y las empresas tienen que responder
Una voz perfecta en una solicitud no autorizada es peor que una voz torpe en una verificada.
Reddit cierra su última puerta abierta y culpa a los scrapers
Un scraper que Reddit no ha licenciado es abuso. Un scraper que Reddit ha licenciado es ingresos.
El Banco de Inglaterra acaba de incorporar la deuda de la IA a la estabilidad financiera
Un auge financiado con beneficios retenidos puede deshacerse en privado. Este funciona con 450.000 millones de dólares de deuda nueva.