← Retour au blog
Ai5 min

Tongyi Wanxiang Qwen-Image 2.1 passe en open source : comment un petit modèle 7B intègre les images transparentes et l’édition de 10 images dans une carte graphique grand public

Publié le 27 sept. 2026
Tongyi Wanxiang Qwen-Image 2.1 passe en open source : comment un petit modèle 7B intègre les images transparentes et l’édition de 10 images dans une carte graphique grand public

Le 20 septembre, l’équipe Qwen d’Alibaba a publié Qwen-Image 2.1 sur une plateforme open source. Dès l’annonce, les vidéos de packs d’installation tout-en-un se sont multipliées le jour même sur Bilibili, avec souvent la même phrase dans les titres : il tourne avec seulement 6 Go de VRAM. Pour un domaine de la génération d’images à partir de texte longtemps étiqueté comme « gourmand en carte graphique », ce chiffre est en soi une nouvelle.

Beaucoup pourraient d’abord le prendre pour la génération suivante après Qwen-Image 3.0. Ce n’est pas le cas. Qwen avait annoncé en juillet de cette année Qwen-Image 3.0, censé prendre en charge des prompts ultra-longs de 4 500 tokens, mais il ne s’agissait que d’un aperçu, sans poids ni benchmarks. La 2.1 est la véritable successeuse de la lignée open source 2.0 ; sa partie génération visuelle reste un DiT Single-Stream de 32 couches, avec 7B de paramètres, dans la même architecture légère que la 2.0 sortie en février.

Ce qui surprend vraiment, ce sont les fonctionnalités, pas les paramètres. Prises ensemble, ces trois améliorations pointent dans la même direction : faire réellement entrer les outils de génération d’images dans le flux de production, plutôt que de les laisser au stade de « démo impressionnante ».

Premièrement, les images transparentes natives. Auparavant, pour générer un PNG avec canal alpha, il fallait recourir à un modèle distinct ; Qwen avait d’ailleurs publié en décembre dernier un Qwen-Image-Layered dédié. La 2.1 intègre la capacité d’image transparente dans un modèle unifié : une simple instruction permet de basculer entre une image normale et du RGBA, et même d’éditer directement des calques transparents — modifier une expression tout en gardant l’arrière-plan transparent, ou détourer le sujet d’une photo pour l’utiliser comme asset. Pour ceux qui produisent des visuels e-commerce ou des assets d’interface, cette étape élimine bien des allers-retours.

Deuxièmement, le nombre d’images de référence passe de quelques-unes à 10. À l’époque de la 2.0, l’édition multi-images restait limitée à peu d’entrées ; la 2.1 peut directement fusionner six portraits différents en une photo de groupe, ou assembler une tenue complète à partir d’une image de mannequin, de vêtement, de chaussure, de sac et de chapeau. Cela repose sur un mécanisme d’attention à granularité mixte : le texte passe par un masque causal au niveau des tokens, la génération d’image par un masque au niveau des chunks, avec en plus une réutilisation du cache KV, afin que les images de référence et les instructions ne soient calculées qu’une fois puis réutilisées. Autrement dit, on utilise des astuces d’ingénierie pour contenir le ralentissement dû à la multiplication des images.

Troisièmement, l’édition locale est affinée. Il est désormais possible de dessiner un cercle, de peindre une annotation ou de fournir séparément une image de masque pour limiter l’instruction de modification à une petite zone, sans toucher au reste de l’image. La couverture des tâches s’étend aussi aux panoramas, aux infographies et aux storyboards.

Sur le poste de travail d’un designer, l’écran affiche une édition d’image par IA et la superposition de calques transparents

Mais cette ouverture s’accompagne d’une condition rare jusqu’ici. Qwen-Image 2.1 utilise la Qwen Research License, qui n’autorise que la recherche et l’évaluation ; toute utilisation commerciale nécessite une licence payante négociée séparément. Cela diffère de la voie Apache 2.0 suivie récemment par la plupart des projets open source d’Alibaba, et marque une distance avec des modèles à poids ouverts totalement permissifs comme Z-Image ou Ideogram 4.0. Pour les équipes qui veulent l’utiliser pour des missions commerciales ou des produits, la licence est un point à examiner avant même le seuil de carte graphique.

Dans la communauté chinoise, les réactions se concentrent sur une chose : « ça tourne ». Une série de créateurs sur Bilibili préparent des packs d’installation en un clic, mettant en avant le fonctionnement après simple décompression, un minimum de 6 Go de VRAM, la génération d’images par lots et l’édition d’images ; dans les commentaires, on le compare souvent à des outils payants. Ce sentiment a un contexte : ces deux dernières années, les meilleurs modèles de génération d’images sont souvent restés derrière des API et des abonnements, tandis que ce qui tournait en local était généralement un cran en dessous. Qwen-Image 2.1 tombe précisément à ce croisement — petit, open source, avec des résultats comparés à ceux d’adversaires propriétaires — ce qui donne un terreau à l’expression « il surclasse les outils payants », même si cette phrase mérite elle-même d’être nuancée.

Pour être objectif, la valeur de Qwen-Image 2.1 ne réside pas dans le fait de « surclasser » qui que ce soit, mais dans le fait de faire tenir les images transparentes, l’édition multi-images et le contrôle local — des tâches que les designers accomplissent chaque jour — dans un petit modèle exécutable sur une carte graphique grand public. Au moment de la livraison, que manque-t-il encore à une image générée par IA pour être utilisable ? Il faut détourer les personnes, modifier le texte d’un asset, ajuster le placement d’un produit, sans que le texte sur l’emballage ni la forme de la bouteille ne changent. La 2.1 s’attaque justement à ce « dernier kilomètre ». Savoir si elle peut réellement remplacer une partie des outils payants dépendra de ce que les utilisateurs en font, et non de ce que les titres annoncent.

À en juger au moins par l’engouement dans la communauté open source, la réponse est plutôt optimiste. Un petit modèle 7B, plus une carte à 6 Go, fait passer « faire tourner localement un modèle de génération d’images utilisable » d’une galère à un simple double-clic après décompression. L’impact sur tout le secteur pourrait être plus durable qu’un benchmark ponctuel.

Articles associés