Qwen-Image 2.1 vs Nano Banana 2.0 : un modèle ouvert de 7B vient de coller aux basques de Google

Alibaba a publié Qwen-Image 2.1 le 20 septembre, et depuis, la conversation autour des benchmarks n'a plus jamais été la même. Un générateur d'images de 7 milliards de paramètres aux poids téléchargeables dépasse désormais le Nano Banana 2.0 de Google dans le classement d'Alibaba lui-même, et s'en approche suffisamment sur les classements indépendants pour que les gens y regardent à deux fois. Le fil Hacker News consacré à la sortie a récolté plus de 700 points et près de 200 commentaires en une journée, ce qui en dit long sur l'attention contenue que suscite cette catégorie.
Les chiffres, et pourquoi ils comptent
Sur Qwen-Image-Bench d'Alibaba, le nouveau modèle obtient 60,28 contre 59,82 pour Nano Banana 2.0. Un demi-point d'avance, ce qui compte moins comme affirmation technique que comme signal : Alibaba désigne désormais Google comme le benchmark qu'il entend dépasser. Le seul modèle à poids ouverts doté de moins de paramètres, LongCat-Image 6B de Meituan, suit à environ 54 points. Pour comparaison, GPT Image 2.5 Sunburst d'OpenAI trône en tête du classement d'Alibaba avec 67, et Muse Image se situe à 62,34, tous deux fermés.
AI Arena, qui organise des votes à l'aveugle entre humains, raconte une histoire plus modeste. Nano Banana 2.0 conserve 1260 Elo contre 1228 pour Qwen-Image 2.1, avec GPT Image Sunburst en tête à 1423 et Muse à 1276. Le modèle ouvert ne remporte pas encore ce combat. Il se classe toutefois premier parmi tous les modèles à poids ouverts dans l'Image Edit Arena comme dans la Text-to-Image Arena, la catégorie qui intéresse réellement beaucoup de gens. Le compte officiel de Qwen l'a présenté comme « le modèle open source numéro un », et sur cette affirmation plus étroite, les données indépendantes leur donnent raison.
Là où il brille vraiment
La transparence est la fonctionnalité que tout le monde ne cesse de mentionner. Qwen-Image 2.1 produit nativement des images RGBA : vous pouvez donc demander un fond transparent et obtenir un détourage propre, sans repasser par un outil de suppression d'arrière-plan. Pour les vendeurs de stickers, les boutiques d'impression à la demande et tous ceux qui intègrent des éléments dans une composition plus large, cela supprime une étape bien réelle. Le modèle peut aussi modifier un calque transparent sans l'aplatir, ce qui nécessitait auparavant un modèle dédié aux calques.
L'édition avec jusqu'à dix images de référence est l'autre grand titre. Donnez-lui la photo d'une personne et quelques clichés de vêtements, et il compose la personne portant ces vêtements. Fusionnez six portraits en une photo de groupe. Assemblez dix images de meubles en une seule pièce. Vous pouvez désigner la zone à modifier de trois manières : dessiner des cercles colorés, peindre par-dessus la zone, ou fournir l'original plus un masque séparé. La méthode du masque est celle à privilégier quand vous ne pouvez pas vous permettre d'écraser les pixels d'origine.
Vient ensuite la vitesse sur du matériel modeste. Les premiers utilisateurs rapportent une image de 1 mégapixel en environ cinq secondes sur une RTX 4090, environ 25 secondes sur les cartes de la série 50, et à peu près 50 secondes pour une image 2K sur une RTX 3060 avec 64 Go de RAM système. Un commentateur sur Hacker News a indiqué avoir converti une image de 1 MP en cinq secondes environ sur une 4090. Un utilisateur de r/StableDiffusion a rapporté des images 1 MP en environ 25 secondes sur une 5070 ou 5080, tout en notant que l'édition est l'opération la plus lente et que l'accumulation d'images de référence fait grimper la latence de façon notable. Ce n'est pas la vitesse du cloud, mais c'est assez rapide pour ne plus servir d'excuse.

Le piège de la licence
Voici le point qui a divisé la communauté. Les précédents modèles d'image Qwen étaient publiés sous Apache 2.0, ce qui vous permettait d'affiner le modèle et de vendre ce que vous en faisiez. Qwen-Image 2.1 est publié sous une licence à usage de recherche uniquement, qui interdit l'usage commercial des poids sans accord distinct avec Alibaba. Le fil HN s'est enflammé face à cette ambiguïté, et le compte d'Alibaba est intervenu pour clarifier : les poids sont restreints, mais les images que vous générez avec eux vous appartiennent, y compris pour un usage commercial.
Cette distinction semble mineure, mais elle compte beaucoup. Si vous voulez simplement générer des images pour des clients, des produits ou vos propres projets, tout va bien, et Alibaba a confirmé que les résultats ne sont soumis à aucune obligation de licence. Si vous vouliez affiner et redistribuer le modèle, c'est vous qui devez négocier. La plupart des gens appartiennent à la première catégorie, ce qui explique pourquoi la levée de boucliers a été bruyante mais finalement contenue.
L'argument plus large de l'efficacité
Le point intéressant ici n'est pas le score brut. C'est l'efficacité. Qwen-Image 2.1 arrive à quelques points Elo de modèles plusieurs fois plus gros et entièrement fermés. Le générateur compte 32 couches DiT Single-Stream, lit les prompts via un encodeur textuel Qwen3-VL 8B et génère nativement en 2K jusqu'à 2752 par 2752 pixels. Sur le plan de l'efficacité, il prouve que la distillation architecturale et des données d'entraînement plus propres peuvent combler l'essentiel de l'écart dont tout le monde supposait qu'il exigeait de l'échelle.
Cela met la pression sur le modèle par abonnement d'une manière qu'aucune diapositive marketing ne saurait égaler. Si un GPU grand public peut produire un rendu de qualité studio en quelques secondes, « nous générons les meilleures images » ne suffit plus à justifier un abonnement mensuel. Google et OpenAI gardent l'avantage sur les tâches de raisonnement sémantique et spatial les plus difficiles, où les évaluations à l'aveugle continuent de leur donner l'avantage. Qwen-Image 2.1 n'a pas comblé cet écart. Il a simplement rendu cet écart facultatif pour une grande part du travail quotidien, et c'est une perturbation plus importante que n'importe quel score de benchmark.
Le verdict pratique de la communauté
Les arguments de benchmark ne mènent pas très loin. Le signal le plus concret, ce sont les retours de ceux qui l'ont réellement fait tourner, et les témoignages de cette semaine sont étonnamment cohérents. Sur r/StableDiffusion, un utilisateur a publié une comparaison côte à côte de 192 images générées entre Qwen-Image 2.1 et Krea 2, classées par catégorie comme la génération de texte et l'anatomie humaine. La conclusion : le modèle ouvert tenait bien la structure, mais il fallait contourner un encodeur textuel quantifié pour faire tenir le denoiseur sur une 5090.
Un autre utilisateur a fait tourner le modèle sur un MacBook Pro M1 Max avec 32 Go de mémoire, générant une image de 512 par 512 en environ 24 secondes grâce à un runtime natif Apple Silicon. C'est lent selon les standards d'un ordinateur de bureau, mais cela prouve que le modèle n'est pas verrouillé au matériel Nvidia, ce qui compte pour une large part des utilisateurs occasionnels. Un troisième a construit autour de lui un studio local à la Fooocus, en ajoutant masques, annotations, outpainting et références de pose OpenPose, et a demandé des critiques honnêtes plutôt que des éloges.
Les capacités d'édition ont suscité le plus d'enthousiasme. Un post décrivait la génération de planches de design de personnage sans aucun LoRA, en utilisant l'édition par image de référence du modèle pour garder un personnage cohérent d'une pose et d'une tenue à l'autre. Cela nécessitait auparavant une pile de modèles affinés et beaucoup de nettoyage manuel. Le fait qu'un seul modèle de 7B y parvienne d'emblée est le titre discret que la plupart des graphiques de benchmark ne captent pas.
Ce qu'il faut surveiller ensuite
Les premiers résultats sont encore en train de se stabiliser. Qwen a construit son propre benchmark et n'a pas publié les prompts ni les scores par catégorie : les chiffres internes relèvent donc plus de l'affirmation que de la mesure. Les chiffres indépendants d'AI Arena sont plus fiables et légèrement moins flatteurs. La lecture honnête, à l'heure actuelle, est que Qwen-Image 2.1 est le meilleur modèle d'image à poids ouverts disponible, qu'il reste nettement en retrait des leaders fermés, et qu'il constitue une vraie preuve que petit et ouvert peut être compétitif. Les prochaines semaines de tests indépendants diront si ce demi-point d'avance sur Nano Banana 2.0 est durable ou n'était qu'un échantillon flatteur du benchmark.
Articles associés
Les modèles chinois d’IA d’image gagnent des adeptes à l’étranger, et Washington surveille
L’adoption est d’abord technique, politique ensuite. Les développeurs téléchargent ce qui fonctionne, et aujourd’hui, cela vient de plus en plus de laboratoires chinois.
Ce que les marchés de prédiction parient sur les images IA
De l’argent réel parie sur qui remportera la course à l’image IA. OpenAI mène sur les images fixes, MiniMax sur la vidéo, et les modèles ouverts sont la carte joker que personne n’intègre dans les prix.
Les modèles d’image chinois s’internationalisent, et ce mois-ci la conversation a changé
Les modèles d’image chinois s’internationalisent. Comment les benchmarks, les sections de commentaires et Washington ont changé ce mois-ci.
Les marchés de prédiction mettent de l'argent réel sur le gagnant de l'IA d'image, et les cotes sont déséquilibrées
Les marchés de prédiction parient sur qui remportera l'IA d'image. Ce que les cotes déséquilibrées mesurent réellement, et comment les lire.