Cuatro pasos en lugar de cuarenta: cómo la destilación está comprimiendo los modelos de imagen abiertos para que quepan en las GPU de consumo

La brecha entre un modelo de imagen abierto potente y una tarjeta gráfica de consumo lleva meses cerrándose. El mecanismo son menos pasos de eliminación de ruido. Un modelo que antes necesitaba cuarenta pasadas para convertir ruido en una imagen ahora puede lograrlo en cuatro, seis u ocho, si le acoplas el adaptador adecuado.
Dos lanzamientos a principios de octubre volvieron a mover esa frontera desde direcciones opuestas: un artículo de investigación que replantea cómo se entrena la destilación, y un LoRA de producción que aplica la idea a un modelo abierto ampliamente usado.
DMAD convierte la coincidencia de distribuciones en un problema de clasificación
El artículo es DMAD, abreviatura de Distribution Matching as Adversarial Distillation (coincidencia de distribuciones como destilación adversarial), de investigadores de Texas A&M y ByteDance. Se publicó por primera vez el 1 de octubre y aborda un costo bien conocido de la destilación.
La receta estándar funciona así. Un modelo maestro genera muestras de alta calidad a lo largo de muchos pasos. Un modelo estudiante tiene que aproximar la misma distribución en uno a cuatro pasos. Para guiar al estudiante, se entrena un modelo de difusión auxiliar que se sigue ajustando a la distribución actual del estudiante, y luego se usa la diferencia entre la puntuación del maestro y la del estudiante para actualizar al estudiante. El problema es que el estudiante no deja de cambiar, así que el modelo auxiliar tiene que seguirlo persiguiendo. El uso de memoria y cómputo aumenta.
DMAD reescribe el objetivo como clasificación. Sobre un tronco de características compartido se asientan dos cabezas discriminadoras. Una separa datos reales de muestras del estudiante. La otra separa muestras del maestro de muestras del estudiante. En condiciones óptimas, la puntuación de salida del discriminador corresponde a un ratio logarítmico de densidad, lo que significa que el estudiante puede actualizarse a lo largo de un objetivo lineal derivado de la puntuación del discriminador. No se necesita un modelo de puntuación auxiliar separado.
El segundo ingrediente es la supervisión dependiente del nivel de ruido. Un maestro está cerca de la distribución real en algunos niveles de ruido y visiblemente desviado en otros. DMAD mide la diferencia empírica de puntuaciones entre muestras reales y del maestro con la primera cabeza discriminadora, y luego repondera el entrenamiento del estudiante en consecuencia, de modo que el estudiante hereda menos sesgo del maestro en los niveles de ruido donde el maestro es más débil. Eso convierte una suposición, "el maestro siempre tiene razón", en algo medible.
Los resultados abarcan tres escalas. En entrenamiento de clasificación de imágenes sobre ImageNet, la generación de 64x64 en un paso alcanzó un FID de 1.04. El FID mide cuánto difiere la distribución generada de la real, y cuanto más bajo, mejor.
La versión de producción ya está disponible
La misma idea llega a los usuarios a través de adaptadores LoRA en lugar de artículos. Alibaba PAI publicó Qwen-Image-2.1-Fun-Acc-LoRAs en Hugging Face, aplicando destilación con decodificación paralela para reducir la inferencia de las 40 evaluaciones de funciones neuronales del maestro a 4, tanto para texto a imagen como para edición basada en instrucciones. El adaptador es de rango 64 con alpha de red 64 en BF16, y la tarjeta del modelo ofrece scripts de inicio rápido para Diffusers y VideoX-Fun.
La tarjeta del modelo es sincera sobre las contrapartidas. El texto pequeño y denso se degrada en comparación con el maestro, y las ediciones de imagen salen un poco más borrosas u oscuras. Para un póster con un párrafo de letra pequeña, cuatro pasos no son la herramienta adecuada. Para imágenes de tamaño para redes sociales donde el texto es corto y grande, sí lo son.
Un segundo adaptador va más lejos en calidad. Qwen-Image-2.1 Turbo v0.2.1 es un LoRA de rango 128 y seis pasos de unos 648 megabytes que comprime la larga ODE de flujo de probabilidad del modelo base de flow matching en una programación sigma que va de 1.0 a 0.25. Seis pasos son un ajuste intermedio: suficientes pasadas para conservar el detalle, lo bastante pocas para seguir siendo rápido.
Las destilaciones de la comunidad completan el resto de la escala. Un adaptador turbo de Viggle apunta a cuatro pasos. Los adaptadores de PrunaAI apuntan a cinco u ocho. Ambos son honestos sobre ser trabajos en curso, y las notas de Pruna dicen que la versión de pocos pasos todavía no iguala al modelo base en composición con múltiples referencias, intercambios de caras y ediciones con varias restricciones.
Krea 2 Turbo tomó una ruta diferente en licencias. Sus adaptadores de destilación de dos y cuatro pasos ahora se distribuyen con flujos de trabajo ComfyUI Apache-2.0 para Comfy Cloud, ComfyUI local y Apple MLX, con cambio automático de pasos. Apache-2.0 en la capa de flujo de trabajo importa para cualquiera que quiera construir un producto encima sin revisión legal.
Qué cambia realmente para alguien que ejecuta esto
El efecto práctico es que el mismo hardware produce más imágenes, y los ajustes que importan cambian. Los hilos de la comunidad sobre Qwen 2.1 recomiendan CFG de 2.0 a 3.0 y 40 pasos cuando se carga un LoRA, junto con un VAE de corrección de textura de unos 676 megabytes. Otros informan que el flujo de trabajo estándar a 2.0 megapíxeles sin LoRA ahora produce una calidad de renderizado que los modelos abiertos anteriores rara vez alcanzaban.
La lectura honesta es que la destilación de pocos pasos es un intercambio, no un almuerzo gratis. La fidelidad del texto, la precisión de edición y la consistencia con múltiples referencias son las primeras cosas que se resienten, porque esas son las tareas que necesitan más pasadas para resolverse. La adherencia al prompt con un único sujeto claro se mantiene bien.

Eso sugiere un flujo de trabajo más que un único ajuste. Haz un borrador a cuatro pasos, elige la composición que quieras y luego vuelve a renderizar la imagen elegida con el número completo de pasos. Los adaptadores de destilación abaratan la exploración y dejan la pasada final a plena calidad.
Qué aporta la investigación más allá de los adaptadores
Los LoRA que los usuarios descargan son el extremo visible de este trabajo, pero el artículo de DMAD explica por qué la próxima generación de adaptadores debería ser mejor. La vieja receta necesitaba un modelo auxiliar activo para seguir la distribución cambiante del estudiante, y ese sobrecosto crecía con cada paso de entrenamiento. Reformular el objetivo como un par de discriminadores elimina el modelo auxiliar, lo que significa que el mismo presupuesto de GPU puede entrenar un estudiante más fuerte.
La idea de reponderación es la contribución más duradera. Tratar al maestro como uniformemente correcto es la suposición que limita cuán bueno puede ser un estudiante destilado, porque un estudiante entrenado contra los peores momentos del maestro hereda esos errores. Medir dónde diverge el maestro de los datos reales y reducir el peso de esas regiones es una técnica general, y debería transferirse a la difusión de video, el audio y cualquier otra modalidad generativa donde se use destilación para reducir el costo de inferencia.
Cómo decidir si un adaptador destilado es suficiente
La decisión se reduce al tipo de tarea. Los adaptadores de pocos pasos manejan bien composiciones de un solo sujeto, con iluminación clara y en formato grande. Tienen problemas con todo lo que necesita muchas pasadas para resolverse: párrafos de texto pequeño, tipografía fina, ediciones que deben preservar la identidad a través de múltiples referencias e instrucciones que apilan varias restricciones a la vez. Esos son exactamente los casos sobre los que advierten las tarjetas de modelo, y las advertencias son consistentes entre proveedores.
Las licencias son la otra variable. Algunos de estos adaptadores tienen términos de investigación o restringidos de otro modo, y la cuestión del uso comercial no siempre está resuelta en la tarjeta del modelo. El lanzamiento de Alibaba PAI lista su licencia como "other" sin indicar términos comerciales, lo que significa que un equipo que lo despliegue en un producto tiene tarea por hacer antes de lanzarlo. Los flujos de trabajo Apache-2.0 de Krea son la excepción, y esa permisividad probablemente importe para cualquiera que construya un servicio comercial encima.
La dirección de la tendencia es clara. Los modelos de imagen abiertos se están comprimiendo para caber en el hardware que la gente ya tiene, y la compresión ocurre en público, con pesos, tarjetas de modelo y limitaciones declaradas. Esa apertura es útil en sí misma, porque permite a un comprador juzgar las contrapartidas antes de comprometerse. Un proveedor cerrado puede recortar calidad en una actualización y llamarlo mejora de velocidad. Un adaptador publicado con una tarjeta de modelo que nombra sus puntos débiles no puede.
Una nota sobre qué medir
Las afirmaciones de velocidad en este espacio son fáciles de exagerar, porque el número de pasos es solo una entrada de la latencia. La resolución, el tamaño del lote, el sampler y el número de imágenes generadas por prompt cambian el tiempo transcurrido mucho más de lo que sugiere el número de pasos anunciado. Un adaptador de cuatro pasos a alta resolución en una tarjeta de gama media puede ser más lento que una ejecución de cuarenta pasos a resolución de borrador en el mismo hardware.
La comparación que importa para un comprador son las imágenes por minuto a la calidad que realmente necesita, en el hardware que realmente posee. Las tarjetas de modelo rara vez informan ese número, así que hay que medirlo localmente. Los adaptadores abaratan la medición, que es el beneficio real. Cuatro pasos es lo bastante rápido para ejecutar el experimento que te dice si cuatro pasos fueron suficientes.
Qué observar a continuación
Los adaptadores y el artículo apuntan en la misma dirección. El costo de inferencia de los modelos de imagen abiertos sigue cayendo, y cada nueva destilación estrecha la brecha entre una tarjeta de consumo y un acelerador alquilado. La pregunta que vale la pena seguir es si la próxima ronda de adaptadores cierra la brecha de renderizado de texto y fidelidad de referencias, o si esos límites resultan estar integrados en la propia generación de pocos pasos. Hasta que eso se resuelva, la postura sensata es tratar el número de pasos como un ajuste entre varios, y medir imágenes por minuto en el hardware que realmente posees.
Artículos relacionados
BOSSFIGHT hizo que modelos frontera dirigieran cafeterías durante 24 semanas. La mayoría perdió frente a no hacer nada.
Resistir un soborno en un cuestionario y negarse a ceder en un trimestre real son dos habilidades distintas, y las evaluaciones actuales tienden a medir la más fácil.
La NASA e IBM publicaron como código abierto un modelo fundacional lunar entrenado con 17 años de datos de orbitadores
El modelo es útil para encontrar y caracterizar características, y poco fiable para decir exactamente dónde están con alta precisión.
Los agentes empezaron a dirigir cortometrajes esta semana. El cuello de botella se trasladó al control de calidad.
La generación es barata, la orquestación es el producto, y lo que decide si un pipeline es útil es si puede saber cuándo ha fallado.
Reka Rho-1 pone la comprensión y la generación en la misma caché KV
Los mismos pesos que predicen una imagen de cámara también impulsan el movimiento del robot, porque ambos viven en el mismo espacio de representación.