La generación de imágenes de código abierto cabe en una tarjeta gráfica de consumo: Hunyuan DiT rebaja el umbral a 6 GB de VRAM

Durante el último año, las actualizaciones de la generación de imágenes de texto a imagen de código abierto giraron básicamente en torno a la calidad de imagen. Quien tuviera textos más nítidos, quien lograra una iluminación más fotográfica, podía permanecer unos días más en las clasificaciones. Pero en este octubre el viento cambió un poco. El foco de discusión de la comunidad ya no es «qué imagen se ve mejor», sino «mi tarjeta gráfica, ¿realmente puede con esto?».
La línea de los 6 GB de VRAM se ha conseguido a pulso
Entre los anuncios recientes del gran modelo de texto a imagen Hunyuan de Tencent (Hunyuan DiT), el más práctico es la liberación de código abierto de una «versión de VRAM reducida». Según la versión oficial, basta con 6 GB de VRAM para ejecutarlo. Cualquiera que haya usado generación de imágenes de código abierto entiende el peso de esta cifra: hasta ahora, para ejecutar localmente un generador de texto a imagen decente, 16 GB de VRAM era casi el mínimo, 8 GB era lo justo y con 6 GB te disuadían directamente.

Las acciones complementarias también llegaron. Esta versión adaptó a la biblioteca Diffusers complementos como LoRA y ControlNet, y añadió soporte para la interfaz gráfica de Kohya. El papel de Kohya en la comunidad es sacar «entrenar tu propio LoRA» de la barrera de la línea de comandos y convertirlo en cosa de unos pocos clics. Su integración allana el camino para «quiero que el modelo aprenda mi propio estilo de dibujo».
Al mismo tiempo, Hunyuan DiT pasó a la versión 1.2, y las mejoras oficiales se centran en las texturas y la composición de la imagen. Precisamente estos dos puntos han sido criticados durante mucho tiempo en los modelos de código abierto: cuando hay muchos detalles, la imagen se emborrona, y cuando la composición se complica, se desordena.
Otra noticia más fácil de pasar por alto, pero crucial: Tencent también liberó el código abierto de «Hunyuan Captioner», el modelo de etiquetado de Hunyuan. El modelo de etiquetado es el primer paso para entrenar un LoRA: primero hay que hacer que la máquina descomponga cada material en descripciones legibles, y solo entonces se puede hablar de entrenamiento. Antes, este paso requería una API de código cerrado o alternativas de calidad desigual. Con su código abierto, la cadena de entrenamiento local pierde una dependencia más de servicios externos.
Una vez que los modelos de código abierto funcionan, la comunidad se ocupa de «arreglarlos»
Los avances de Hunyuan ensanchan el camino, mientras que la comunidad está parcheando otra línea. Tras el lanzamiento de código abierto de Qwen-Image 2.1, se desató una gran cantidad de creaciones derivadas y, con ellas, una oleada intensiva de correcciones.
Una combinación bastante representativa es Qwen-Image-2.1-viggle-turbo: 7,26 GB, inferencia en 6 pasos, cuantización int8; se usa a menudo para generar rápidamente hojas de diseño de personajes, junto con un VAE texture-fix de 676 MB para completar texturas. El Fix v2.0 de otro autor afirma eliminar esa capa característica de ruido y detalles desordenados de Qwen, casi sin alterar la composición. También hay una versión Opinionated con una imagen más nítida, a costa de desplazar ligeramente la imagen; el autor la publicó empaquetada con un conjunto de samplers res_2m_nc derivados de RES4LYF.
Estos parches suenan triviales, pero demuestran una cosa: cuando un modelo de código abierto entra en producción real, lo que de verdad determina si es útil o no suele no ser la versión del día de su lanzamiento, sino si la comunidad está dispuesta a escribir correcciones para él en las semanas siguientes.
En la comunidad también se han sedimentado algunos parámetros que se pueden copiar directamente. Alguien recomendó, tras cargar un LoRA en Qwen 2.1, usar CFG de 2,0 a 3,0, 40 pasos y el sampler res_multistep o beta. Otra persona que ejecuta el flujo de trabajo estándar de 2,0 MP sin LoRA dice que el nuevo modelo de imagen Qwen tiene un aire a Midjourney que antes solo se veía en modelos de código cerrado.
En velocidad también hay avances notables. Un checkpoint LoRA de destilación en dos pasos de Krea 2 Turbo redujo el tiempo de eliminación de ruido para 1024x1024 de 76,4 segundos a 19,3 segundos, casi cuatro veces menos. El precio es que la calidad de los detalles queda entre 0,97 y 1,09 veces la del modelo maestro, mucho mejor que el 0,40 a 0,65 del Turbo nativo de dos pasos, pero rinde mejor en primeros planos y todavía se queda corto en grandes escenas.
Los pequeños huecos que también se han ido tapando
Además de los modelos principales, varios modelos de código abierto de nicho pero con buena reputación en la comunidad también están cubriendo poco a poco sus carencias. Aesthetic v1.1 y One Obsession v4 de Anima se usan a menudo para producciones estilizadas; los usuarios elogian que su estilo obedece, que los prompts son fáciles de escribir, que al fijar la semilla y cambiar el prompt se obtienen variantes coherentes y que además puede renderizar textos cortos. Sus debilidades son igual de francas: todavía le cuesta con varios personajes en la misma escena y con textos largos, y la comunidad espera Anima 2.
En el caso de Krea 2, las quejas se centran en que «semillas distintas se ven casi iguales», así que alguien ideó un método sin añadir LoRA ni instalar nodos específicos del modelo: reutilizar el codificador de texto de ComfyUI (por ejemplo, Qwen3VL 4B) como LLM para expandir los prompts, usar la semilla del prompt como perilla de ajuste grueso y la semilla de muestreo como perilla de ajuste fino. Este tipo de «soluciones caseras» se difunde rápido y suele resolver problemas reales mejor que la documentación oficial.
Con el umbral más bajo, ¿qué se compara?
Vistos en conjunto, la dirección está clara. La generación de imágenes de código abierto ya no solo responde a «¿puede dibujar de forma realista?», sino que empieza a responder otras dos preguntas: ¿puede ejecutarse en una máquina que puedo pagar? y ¿puede modificarse con precisión según mi intención?
Hunyuan responde a la primera pregunta al reducir la VRAM a 6 GB y liberar el modelo de etiquetado. Esa tanda de correcciones y LoRA de aceleración de la comunidad de Qwen responde a «modificar con precisión» y «ejecutar rápido» dentro de la segunda pregunta. Las dos líneas parecen no tener relación, pero confluyen en lo mismo: llevar la generación de una demostración a la rutina diaria.
Para los creadores comunes, este es probablemente el cambio más tangible del último año. Ya no necesitas alquilar potencia de cómputo por una sola imagen, ni reinstalar todo el entorno para cambiar de estilo. Una tarjeta gráfica de gama media de hace unos años, junto con esa cadena de herramientas que la comunidad ha ido acumulando, ya basta para producir un conjunto decente de obras.
Lo que de verdad se ha acortado es la distancia entre «quiero probarlo» y «ponerme de verdad a hacerlo».
Artículos relacionados
Agility Digit 5 llega con un caso de seguridad, no solo una hoja de especificaciones
El suelo de un almacén no es un laboratorio. La certificación es la puerta de entrada, no la demo.
Los agentes de frontera completaron el 30 por ciento de un flujo de trabajo de investigación. Ese es el número.
Los agentes pueden ejecutar investigación. Inventar el procedimiento sigue estando fuera de su alcance.
Figure AI aseguró 3.500 millones de dólares en cómputo antes de tener un producto que vender
La apuesta es que la generalización es un problema de cómputo. El sector aún no lo ha resuelto.
OpenAI por fin incorpora fondos transparentes a la API de imágenes
Una función pequeña que elimina todo un paso del flujo de trabajo.