Qwen-Image 2.1 vs. Nano Banana 2.0: un modelo abierto de 7B acaba de pisarle los talones a Google

Alibaba lanzó Qwen-Image 2.1 el 20 de septiembre, y la conversación sobre benchmarks no ha vuelto a ser la misma desde entonces. Un generador de imágenes de 7.000 millones de parámetros con pesos descargables se sitúa ahora por delante de Nano Banana 2.0 de Google en la propia clasificación de Alibaba, y lo bastante cerca en las tablas independientes como para que la gente tenga que mirar dos veces. El hilo de Hacker News sobre el lanzamiento superó los 700 puntos y rozó los 200 comentarios en un día, lo que da una idea de la atención contenida que arrastra esta categoría.
Las cifras, y por qué importan
En el Qwen-Image-Bench de Alibaba, el nuevo modelo obtiene 60,28 frente a los 59,82 de Nano Banana 2.0. Es una ventaja de medio punto, que importa menos como afirmación técnica y más como señal: Alibaba ya señala a Google como el referente que pretende superar. El único modelo de pesos abiertos con menos parámetros, LongCat-Image de 6B de Meituan, se queda atrás con unos 54 puntos. A modo de comparación, GPT Image 2.5 Sunburst de OpenAI encabeza la tabla de Alibaba con 67, y Muse Image se sitúa en 62,34, ambos cerrados.
AI Arena, que realiza votaciones ciegas entre humanos, cuenta una historia más modesta. Nano Banana 2.0 mantiene 1.260 puntos Elo frente a los 1.228 de Qwen-Image 2.1, con GPT Image Sunburst en cabeza con 1.423 y Muse con 1.276. El modelo abierto todavía no gana esa batalla. Sin embargo, ocupa el primer puesto entre todos los modelos de pesos abiertos tanto en la Image Edit Arena como en la Text-to-Image Arena, que es la categoría que a mucha gente le importa de verdad. La propia cuenta de Qwen lo presentó como «el modelo de código abierto número uno», y en esa afirmación más acotada, los datos independientes les dan la razón.
Donde realmente brilla
La transparencia es la función que todo el mundo menciona. Qwen-Image 2.1 genera imágenes RGBA de forma nativa, así que puedes pedir un fondo transparente y obtener un recorte limpio sin pasar de nuevo por una herramienta de eliminación de fondos. Para los vendedores de pegatinas, las tiendas de impresión bajo demanda y cualquiera que componga recursos dentro de un diseño mayor, eso elimina un paso real. El modelo también puede editar una capa transparente sin aplanarla, algo que antes requería un modelo de capas aparte.
La edición con hasta diez imágenes de referencia es el otro gran titular. Dale una foto de una persona y unas cuantas imágenes de ropa, y compone a esa persona llevando esa ropa. Fusiona seis retratos en una foto de grupo. Ensambla diez imágenes de muebles en una sola habitación. Puedes indicar la región que quieres editar de tres formas: dibujar círculos de colores, pintar sobre el área o pasar el original junto con una máscara aparte. La opción de la máscara es la que conviene usar cuando no puedes permitirte sobrescribir los píxeles originales.
Y luego está la velocidad en hardware modesto. Los primeros usuarios reportan una imagen de 1 megapíxel en unos cinco segundos en una RTX 4090, alrededor de 25 segundos en las tarjetas de la serie 50 y unos 50 segundos para una imagen 2K en una RTX 3060 con 64 GB de RAM del sistema. Un comentarista de Hacker News dijo que convirtió una imagen de 1 MP en unos cinco segundos en una 4090. Un usuario de r/StableDiffusion reportó imágenes de 1 MP en unos 25 segundos en una 5070 o 5080, y señaló además que la edición es la operación más lenta y que acumular imágenes de referencia dispara la latencia de forma notable. No es la velocidad de la nube, pero es lo bastante rápido como para dejar de ser una excusa.

El inconveniente de la licencia
Aquí llega la parte que dividió a la comunidad. Los modelos de imagen anteriores de Qwen se distribuían bajo Apache 2.0, lo que te permitía ajustarlos y vender lo que construyeras. Qwen-Image 2.1 se distribuye bajo una licencia solo para investigación, que prohíbe el uso comercial de los pesos sin un acuerdo aparte con Alibaba. El hilo de HN se encendió por la ambigüedad, y la cuenta de Alibaba intervino para aclararlo: los pesos están restringidos, pero las imágenes que generas con ellos son tuyas, también para uso comercial.
Esa distinción parece pequeña, pero importa mucho. Si solo quieres generar imágenes para clientes, productos o tus propios proyectos, no hay problema, y Alibaba confirmó que los resultados no conllevan obligaciones de licencia. Si lo que querías era ajustar y redistribuir el modelo, entonces eres tú quien se queda negociando. La mayoría de la gente cae en el primer grupo, y por eso la reacción fue ruidosa pero, al final, contenida.
El argumento más amplio de la eficiencia
La línea interesante aquí no es la puntuación bruta. Es la eficiencia. Qwen-Image 2.1 se queda a unos pocos puntos Elo de modelos que son muchas veces más grandes y totalmente cerrados. El generador tiene 32 capas DiT Single-Stream, lee los prompts a través de un codificador de texto Qwen3-VL 8B y renderiza de forma nativa a 2K, hasta 2752 por 2752 píxeles. En el frente de la eficiencia, demuestra que la destilación arquitectónica y unos datos de entrenamiento más limpios pueden cerrar la mayor parte de la brecha que todo el mundo asumía que exigía escala.
Eso ejerce presión sobre el modelo de suscripción de una forma que ninguna diapositiva de marketing podría. Si una GPU de consumo puede renderizar resultados de calidad de estudio en segundos, «generamos las mejores imágenes» deja de ser razón suficiente para pagar cada mes. Google y OpenAI siguen liderando en las tareas de razonamiento semántico y espacial más difíciles, donde las evaluaciones ciegas siguen dándoles ventaja. Qwen-Image 2.1 no cerró esa brecha. Solo hizo que la brecha pareciera opcional para una gran parte del trabajo cotidiano, y eso es una disrupción mayor que cualquier puntuación de benchmark por sí sola.
El veredicto práctico de la comunidad
Los argumentos de benchmark solo llegan hasta cierto punto. La señal más fundamentada es lo que la gente reporta realmente después de ejecutarlo por su cuenta, y los informes de esta semana son inusualmente consistentes. En r/StableDiffusion, un usuario publicó una comparación lado a lado de 192 imágenes generadas enfrentando Qwen-Image 2.1 con Krea 2, ordenadas por categorías como generación de texto y anatomía humana. La conclusión fue que el modelo abierto se defendía bien en estructura, pero tuvo que sortear un codificador de texto cuantizado para que el denoiser cupiera en una 5090.
Otro usuario consiguió ejecutar el modelo en un MacBook Pro M1 Max con 32 GB de memoria, generando una imagen de 512 por 512 en unos 24 segundos mediante un entorno de ejecución nativo para Apple Silicon. Es lento para los estándares de escritorio, pero demuestra que el modelo no está atado al hardware de Nvidia, algo que importa a una gran parte de los usuarios ocasionales. Un tercero construyó alrededor de él un estudio local al estilo Fooocus, añadiendo máscaras, anotaciones, outpainting y referencias de pose de OpenPose, y pidió críticas honestas en lugar de elogios.
Las capacidades de edición fueron las que más entusiasmo suscitaron. Una publicación describía la generación de hojas de diseño de personajes sin ningún LoRA, usando la edición con imágenes de referencia del modelo para mantener la coherencia de un personaje entre poses y atuendos. Eso antes requería un montón de modelos ajustados y mucha limpieza manual. El hecho de que un único modelo de 7B lo haga sin configuración adicional es el titular silencioso que la mayoría de las tablas de benchmark no recogen.
Qué observar a continuación
Los primeros resultados aún se están asentando. Qwen creó su propio benchmark y no ha publicado los prompts ni las puntuaciones por categoría, así que las cifras internas son más una afirmación que una medición. Las cifras independientes de AI Arena son más fiables y algo menos halagadoras. La lectura honesta ahora mismo es que Qwen-Image 2.1 es el mejor modelo de imágenes de pesos abiertos disponible, un escalón real por debajo de los líderes cerrados, y una prueba genuina de que lo pequeño y abierto puede ser competitivo. Las próximas semanas de pruebas independientes dirán si la ventaja de medio punto sobre Nano Banana 2.0 es duradera o fue solo un fragmento favorable del benchmark.
Artículos relacionados
Los modelos chinos de IA para imágenes conquistan adeptos en el extranjero, y Washington observa
La adopción es técnica primero, política después. Los desarrolladores descargan lo que funciona, y ahora mismo eso viene cada vez más de laboratorios chinos.
Qué están apostando los mercados de predicción sobre las imágenes de IA
Hay dinero real apostando por quién gana en imágenes de IA. OpenAI lidera las imágenes fijas, MiniMax lidera el vídeo, y los modelos abiertos son el comodín que nadie valora.
Los modelos chinos de imágenes se globalizan, y este mes cambió la conversación
Los modelos chinos de imágenes se están globalizando. Cómo cambiaron este mes los benchmarks, las secciones de comentarios y Washington.
Los mercados de predicción apuestan dinero real a quién gana en IA de imágenes, y las probabilidades están desequilibradas
Los mercados de predicción apuestan a quién gana en IA de imágenes. Qué miden realmente las probabilidades desequilibradas y cómo leerlas.