Tongyi Wanxiang Qwen-Image 2.1 ya es de código abierto: ¿por qué un modelo de 7B se atreve a plantar cara a Google y OpenAI?

El 20 de septiembre, el equipo de Tongyi de Alibaba lanzó discretamente una «pequeña bomba nuclear»: Qwen-Image 2.1. Un modelo de texto a imagen de solo 7000 millones de parámetros que, sin embargo, superó a Nano Banana 2.0 de Google en su propia evaluación, obligando a los modelos de código cerrado de OpenAI y Meta a volver la vista atrás. En cuanto se conoció la noticia, Bilibili, Zhihu y también Hacker News y Reddit en el extranjero ardieron.
Por qué se dice que es «pequeño pero potente»
Los modelos de generación de imágenes se han vuelto cada vez más grandes en los últimos años; los de código cerrado tienen fácilmente decenas o cientos de miles de millones de parámetros y necesitan una tarjeta gráfica profesional para funcionar. Qwen-Image 2.1 hace lo contrario: comprime la parte de generación a 7B y, como resultado, obtiene 60,28 puntos en su propia clasificación Qwen-Image-Bench. ¿Qué nivel representa esa puntuación en la tabla general? Nano Banana 2.0 de Google tiene 59,82 puntos y queda medio puesto por detrás; en el bando del código abierto, el segundo lugar lo ocupa LongCat-Image (6B) de Meituan, con poco más de 54 puntos. Es decir, es el modelo más competitivo de todos los que permiten descargar sus pesos en la actualidad.
Las conclusiones de la evaluación independiente de terceros AI Arena son algo más frías. Allí Nano Banana 2.0 obtuvo 1260 puntos, Qwen-Image 2.1 obtuvo 1228 y el modelo de código cerrado GPT Image 2.5 Sunburst llegó hasta 1423. La diferencia sigue existiendo, pero ya es tan pequeña que «pisa los talones». Para un modelo de código abierto, esta posición ya es una victoria en sí misma.
Tres capacidades realmente útiles
La primera es el fondo transparente nativo. Antes, para hacer pegatinas, impresiones personalizadas o borradores de diseño, había que recortar la imagen otra vez después de generarla con IA. Qwen-Image 2.1 genera directamente imágenes RGBA con canal alfa; un solo modelo se encarga tanto de la generación como de la edición, y las capas transparentes se pueden editar directamente sin fusionarlas. Para quienes trabajan en productos culturales y creativos y merchandising, esto ahorra muchísimo trabajo.
La segunda es la edición simultánea con diez imágenes de referencia. Introduces la foto de una persona y luego varias imágenes de ropa, y el modelo puede componer «esta persona con estas prendas puestas». También puede combinar seis retratos en una foto de grupo, o integrar diez imágenes de muebles en una misma habitación. En Bilibili ya hay creadores que demuestran la «coherencia de personaje + cambio de vestuario», y la sección de comentarios se llena de «qué natural se ve».
La tercera es que es lo bastante ligero como para funcionar en tarjetas domésticas. En una RTX 4090, una imagen de 1 megapíxel tarda unos 5 segundos; en las tarjetas de la serie 50, unos 25 segundos; incluso hay quien ejecuta imágenes 2K con una RTX 3060 y 64 GB de RAM, a razón de 50 segundos por imagen. La configuración mínima oficial de Alibaba llega a 6 GB de VRAM, y en Bilibili ya empiezan a aparecer en fila tutoriales con «paquetes todo en uno».

Lo más llamativo no es el rendimiento, sino la licencia
Lo que realmente hizo que la comunidad se enzarzara fue la licencia. La serie Qwen-Image anterior usaba Apache 2.0, con uso comercial libre. Esta vez se cambió a la Qwen Research License, «solo para uso de investigación», y para uso comercial hay que negociar por separado con Alibaba. En Reddit y HN se armó un buen debate: algunos consideran que es ir hacia atrás, y otros creen que «te damos los pesos para descargar y puedes usar las imágenes como quieras» ya es bastante generoso.
Alibaba salió rápidamente a aclarar una frase: los pesos del modelo no se pueden redistribuir con fines comerciales, pero las imágenes que generes con él son tuyas y puedes usarlas comercialmente sin problema. Esta distinción es clave: para la inmensa mayoría de quienes solo quieren crear imágenes, el impacto no es tan grande.
La importancia más amplia de este suceso
Qwen-Image 2.1 demostró una cosa: gracias a la destilación de arquitectura y a datos de entrenamiento más limpios, los modelos pequeños pueden alcanzar el nivel de generación de imágenes de los grandes. El título del vídeo del creador de Bilibili «爱分享的剑二十七» lo dice sin rodeos: «el modelo de dibujo con IA de código abierto de Alibaba deja en ridículo a un montón de herramientas de pago». La frase exagera un poco, pero la dirección es correcta.
Cuando una imagen puede generarse en unos segundos con una tarjeta gráfica doméstica, la pregunta de si vale la pena seguir pagando una suscripción mensual se convierte en una cuenta que cada creador debe rehacer. En adelante, los fabricantes de código cerrado tendrán que demostrar que valen ese dinero con velocidad, integración de flujos de trabajo y colaboración multimodal, y ya no bastará con «genero imágenes bonitas».
Para el público general, la buena noticia es que el techo de la generación de imágenes de código abierto se ha elevado otro tramo este mes.
Artículos relacionados
¿Todavía puedes distinguir una imagen de IA de una real? La respuesta honesta es no.
Los indicios han desaparecido y los detectores no son fiables. La respuesta honesta a la hora de detectar imágenes de IA es no, y la solución está aguas arriba de tus ojos.
El silencioso cambio en las licencias que podría cambiar las imágenes de IA de código abierto
Los pesos abiertos ya no significan lo que significaban hace un año. La letra pequeña de las licencias se está volviendo más complicada justo cuando los modelos mejoran.
La presión de los modelos locales: por qué los creadores siguen persiguiendo modelos de imágenes sin restricciones
Cada semana, otro creador pide un modelo sin restricciones. La demanda dice más sobre las herramientas en la nube que sobre quienes preguntan.
El stack de imágenes de IA de código abierto se está reconstruyendo, un flujo de trabajo a la vez
Workflow1111 recrea AUTOMATIC1111 con 73 nodos y 11 pipelines. Qué significa la reconstrucción comunitaria para la generación local de imágenes.