Tongyi Wanxiang Qwen-Image 2.1 est open source : comment 7B de paramètres osent-ils défier Google et OpenAI

Le 20 septembre, l’équipe Tongyi d’Alibaba a discrètement lâché une « petite bombe nucléaire » : Qwen-Image 2.1. Un modèle texte-image de seulement 7 milliards de paramètres, qui a pourtant surpassé Nano Banana 2.0 de Google dans ses propres évaluations, forçant les modèles propriétaires d’OpenAI et de Meta à y regarder à deux fois. Dès l’annonce, Bilibili, Zhihu, mais aussi Hacker News et Reddit à l’étranger, se sont enflammés.
Pourquoi dit-on qu’il est « petit mais redoutable »
Ces dernières années, les modèles de génération d’images sont devenus de plus en plus gros ; les modèles propriétaires comptent souvent des dizaines, voire des centaines de milliards de paramètres, et nécessitent une carte graphique professionnelle pour tourner. Qwen-Image 2.1 fait l’inverse : il comprime la partie génération à 7B, et obtient pourtant 60,28 points sur son propre classement Qwen-Image-Bench. Que représente ce score à l’échelle du classement complet ? Nano Banana 2.0 de Google est à 59,82 points, soit une demi-longueur derrière ; dans le camp open source, le deuxième est LongCat-Image (6B) de Meituan, avec à peine plus de 54 points. Autrement dit, c’est actuellement le plus performant de tous les modèles dont on peut télécharger les poids.
Le verdict de l’évaluation indépendante AI Arena est un peu plus mesuré. Là-bas, Nano Banana 2.0 obtient 1 260 points, Qwen-Image 2.1 en obtient 1 228, et le modèle propriétaire GPT Image 2.5 Sunburst culmine à 1 423 points. L’écart demeure, mais il s’est réduit au point de « coller aux talons ». Pour un modèle open source, cette position est déjà une victoire.
Trois capacités vraiment utiles
La première est le fond transparent natif. Avant, pour créer des stickers, des impressions personnalisées ou des maquettes, il fallait encore détourer l’image après la génération par IA. Qwen-Image 2.1 produit directement des images RGBA avec canal alpha ; un seul modèle se charge à la fois de la génération et de l’édition, et les calques transparents peuvent être édités sans être fusionnés. Pour ceux qui travaillent dans la création culturelle et les produits dérivés, cela fait gagner un temps considérable.
La deuxième est l’édition simultanée avec dix images de référence. On lui fournit une photo de personne, puis quelques images de vêtements, et il parvient à synthétiser « cette personne portant ces vêtements ». Il peut aussi fusionner six portraits en une photo de groupe, ou intégrer dix images de meubles dans une même pièce. Sur Bilibili, des créateurs ont déjà fait la démonstration de la « cohérence de personnage + changement de tenue », et les commentaires fusent : « c’est trop naturel ».
La troisième est sa légèreté, qui lui permet de tourner sur une carte grand public. Sur une RTX 4090, une image de 1 mégapixel prend environ 5 secondes ; sur une carte de la série 50, environ 25 secondes. Certains font même tourner des images 2K sur une RTX 3060 avec 64 Go de RAM, à raison de 50 secondes par image. Alibaba annonce officiellement une configuration minimale à 6 Go de VRAM, et les tutoriels « pack tout-en-un » commencent déjà à fleurir sur Bilibili.

Le plus frappant n’est pas la performance, mais la licence
Ce qui a vraiment fait débat dans la communauté, c’est la licence. La précédente série Qwen-Image était sous Apache 2.0, utilisable librement à des fins commerciales. Cette fois, elle passe à la Qwen Research License, « réservée à la recherche » ; toute utilisation commerciale doit être négociée séparément avec Alibaba. Sur Reddit et HN, les avis se sont déchirés : certains y voient un retour en arrière, d’autres estiment que « les poids sont téléchargeables et les images libres d’utilisation » est déjà suffisamment généreux.
Alibaba a rapidement clarifié la situation en une phrase : les poids du modèle ne peuvent pas être redistribués à des fins commerciales, mais les images que vous générez avec lui vous appartiennent, et leur usage commercial ne pose aucun problème. Cette distinction est essentielle — pour l’immense majorité des gens qui veulent simplement créer des images, l’impact est en réalité limité.
La portée plus large de cette annonce
Qwen-Image 2.1 prouve une chose : grâce à la distillation d’architecture et à des données d’entraînement plus propres, un petit modèle peut rattraper le niveau de génération d’images des grands modèles. Le titre de la vidéo du créateur Bilibili « 爱分享的剑二十七 » était on ne peut plus direct : « Le modèle de peinture IA open source d’Alibaba écrase une flopée d’outils payants ». C’est un peu exagéré, mais la direction est juste.
Quand une image peut être générée en quelques secondes sur une carte graphique grand public, la question de payer ou non un abonnement mensuel devient un calcul à refaire pour chaque créateur. Les éditeurs de modèles propriétaires devront désormais prouver leur valeur par la vitesse, l’intégration dans les workflows et la collaboration multimodale, et non plus seulement par un « je génère de belles images ».
Pour le grand public, la bonne nouvelle est celle-ci : le plafond de la génération d’images open source vient encore d’être relevé ce mois-ci.
Articles associés
Peut-on encore distinguer une image générée par IA d’une image réelle ? La réponse honnête est non.
Les indices ont disparu et les détecteurs ne sont pas fiables. La réponse honnête à la détection d’images IA est non, et la solution se situe en amont de vos yeux.
Le changement discret de licence qui pourrait transformer les images IA open source
Les poids ouverts ne signifient plus ce qu'ils signifiaient il y a un an. Les petites lignes des licences se compliquent au moment même où les modèles s'améliorent.
La pression des modèles locaux : pourquoi les créateurs courent sans cesse après des modèles d'image sans restrictions
Chaque semaine, un nouveau créateur demande un modèle sans restrictions. Cette demande en dit plus sur les outils cloud que sur les personnes qui la formulent.
La pile open-source d'images IA se reconstruit, un workflow à la fois
Workflow1111 recrée AUTOMATIC1111 avec 73 nœuds et 11 pipelines. Ce que la reconstruction par la communauté signifie pour la génération d'images locale.