Tongyi Wanxiang Qwen-Image 2.1 es open source: cómo un modelo pequeño de 7B mete imágenes transparentes y edición con 10 imágenes en una GPU de consumo

El 20 de septiembre, el equipo Qwen de Alibaba publicó Qwen-Image 2.1 en la plataforma de código abierto. En cuanto se dio a conocer, ese mismo día empezaron a multiplicarse los vídeos en Bilibili con paquetes todo en uno, y la mayoría de los títulos incluían la misma frase: se puede ejecutar con solo 6 GB de VRAM. Para un campo de texto a imagen que solía llevar la etiqueta de “devorador de GPU”, esta cifra ya es noticia por sí sola.
Muchos, a primera vista, pensarán que es la nueva generación posterior a Qwen-Image 3.0. En realidad, no. Qwen ya había anticipado en julio de este año Qwen-Image 3.0, que según decía admitía prompts ultralargos de 4500 tokens, pero aquello fue solo un avance: no se publicaron pesos ni resultados de benchmarks. La 2.1 es la sucesora formal de la línea open source 2.0; su parte de generación visual sigue siendo un Single-Stream DiT de 32 capas, con 7B de parámetros, y mantiene la misma arquitectura ligera de la 2.0 lanzada en febrero.
Lo realmente sorprendente son las funciones, no los parámetros. Vistas en conjunto, las tres mejoras de esta versión apuntan en la misma dirección: que las herramientas de generación de imágenes entren de verdad en el flujo de producción, en lugar de quedarse en la fase de “demo impresionante”.
La primera es la imagen transparente nativa. Antes, para generar un PNG con canal alfa había que recurrir a un modelo aparte; Qwen ya había lanzado en diciembre pasado un Qwen-Image-Layered específico. La 2.1 integra la capacidad de imagen transparente en un modelo unificado: con un solo prompt se puede alternar entre imagen normal y RGBA, y también editar directamente capas transparentes —por ejemplo, cambiar la expresión manteniendo el fondo transparente, o recortar el sujeto de una foto para usarlo como recurso—. Para quienes crean imágenes de e-commerce o recursos de UI, este paso ahorra bastantes idas y venidas.
La segunda es que las imágenes de referencia pasan de unas pocas a 10. En la 2.0, la edición con varias imágenes todavía se limitaba a unas pocas entradas; la 2.1 puede combinar directamente seis retratos distintos en una foto grupal, o tomar una imagen de modelo, ropa, zapatos, bolso y sombrero, una de cada una, para armar un conjunto completo. En la implementación se usa un mecanismo de atención de granularidad mixta: el texto sigue una máscara causal a nivel de token, la generación de imágenes sigue una máscara a nivel de chunk y, además, se reutiliza la KV cache, de modo que las imágenes de referencia y las instrucciones se calculan una sola vez y se reutilizan repetidamente. En pocas palabras, se trata de usar ingeniería para contener el problema de que “cuantas más imágenes, más lento”.
La tercera es el refinamiento de la edición local. Ahora se puede dibujar un círculo, pintar una anotación o subir una imagen de máscara por separado para limitar la instrucción de modificación a una pequeña zona, sin tocar el resto de la imagen. La cobertura de tareas también se amplió a panoramas, infografías y guiones gráficos.

Pero esta vez el código abierto viene con una condición poco habitual. Qwen-Image 2.1 usa la Qwen Research License, que solo permite investigación y evaluación; para uso comercial hay que negociar aparte una licencia de pago. Esto difiere de la ruta Apache 2.0 que han seguido la mayoría de los proyectos de código abierto recientes de Alibaba, y también marca distancia frente a modelos de pesos abiertos totalmente permisivos como Z-Image o Ideogram 4.0. Para los equipos que quieran usarlo en encargos comerciales o para crear productos, la licencia es algo que conviene revisar antes que el umbral de GPU.
La reacción de la comunidad china se centró en que “se puede ejecutar”. Varios creadores de Bilibili están haciendo paquetes todo en uno, promocionados como listos para usar tras descomprimir, con un mínimo de 6 GB de VRAM y compatibilidad con generación por lotes y edición de imágenes; en los comentarios a menudo se compara con herramientas de pago. Este ánimo tiene un contexto: en los últimos dos años, la mayoría de los modelos de generación de imágenes con mejores resultados estaban encerrados detrás de API y suscripciones, y los que se podían ejecutar localmente solían estar un escalón por debajo. Qwen-Image 2.1 cae justo en esa intersección: es pequeño, es open source y su rendimiento se compara con el de rivales de código cerrado, así que la afirmación de “aplasta a las herramientas de pago” tiene terreno para difundirse, aunque la frase en sí merezca un signo de interrogación.
Visto con objetividad, el valor de Qwen-Image 2.1 no está en “aplastar” a nadie, sino en meter la imagen transparente, la edición con varias imágenes y el control local —tareas que los diseñadores hacen a diario— en un modelo pequeño que puede ejecutarse en una GPU de consumo. Cuando llega el momento de entregar, ¿qué le falta a una imagen generada por IA para ser utilizable? Hay que recortar personas, cambiar texto en recursos, ajustar la colocación de productos, y evitar que el texto del envase o la forma de la botella cambien al editar. La 2.1 apunta precisamente a esa “última milla”. Si puede sustituir de verdad a parte de las herramientas de pago dependerá de lo que hagan quienes lo usen, no de lo que digan los titulares.
Al menos a juzgar por el interés en la comunidad open source, la respuesta tiende al optimismo. Un modelo pequeño de 7B y una GPU de 6 GB hacen que “ejecutar localmente un modelo de generación de imágenes que sirva” pase de ser un quebradero de cabeza a descomprimir y hacer doble clic. El impacto de esto en todo el sector podría ser más duradero que el de una puntuación concreta en un benchmark.
Artículos relacionados
Agility Digit 5 llega con un caso de seguridad, no solo una hoja de especificaciones
El suelo de un almacén no es un laboratorio. La certificación es la puerta de entrada, no la demo.
Los agentes de frontera completaron el 30 por ciento de un flujo de trabajo de investigación. Ese es el número.
Los agentes pueden ejecutar investigación. Inventar el procedimiento sigue estando fuera de su alcance.
Figure AI aseguró 3.500 millones de dólares en cómputo antes de tener un producto que vender
La apuesta es que la generalización es un problema de cómputo. El sector aún no lo ha resuelto.
OpenAI por fin incorpora fondos transparentes a la API de imágenes
Una función pequeña que elimina todo un paso del flujo de trabajo.