Alibaba publie en open source un modèle qui découpe une image plate en calques modifiables

L'équipe Qwen d'Alibaba a mis Qwen-Image-Layered sur ModelScope et Hugging Face début octobre, sous une licence qui autorise l'usage commercial. L'annonce chinoise du 2 octobre le présentait comme le premier modèle d'image doté d'une compréhension et d'une édition natives des calques, à la manière de Photoshop. Cette affirmation mérite d'être décortiquée, car le mécanisme sous-jacent n'est pas celui vers lequel la plupart des éditeurs d'images ont travaillé.
La méthode standard pour modifier une image générée consiste à sélectionner une zone et à la régénérer à l'intérieur. L'inpainting fonctionne ainsi. FLUX 3 Image, sorti la veille, fonctionne lui aussi de cette façon, avec des boîtes englobantes qui définissent exactement les pixels que le modèle est autorisé à toucher. Cette approche a une faiblesse connue : le modèle n'a aucune idée de ce qu'est un calque. Il voit une zone rectangulaire et un prompt, puis il remplit le trou.
Qwen-Image-Layered part d'une représentation différente. Il décompose une image finie en un ensemble de calques RGBA, chacun en pleine résolution et doté de sa propre transparence. Un objet devient un calque, un texte en devient un autre, l'arrière-plan un troisième. Vous pouvez déplacer un calque, le recolorer ou le remplacer, puis recomposer la pile. L'objectif d'entraînement rend cela mesurable : le modèle apprend à produire des calques dont la recomposition reproduit l'image d'entrée, si bien que la qualité de la décomposition a un score direct.

Pourquoi c'est un problème différent de la segmentation
Segmenter une image en objets est une tâche ancienne, et les modèles y excellent depuis un moment. La décomposition en calques exige quelque chose de plus précis. La sortie doit être utilisable comme primitive d'édition, ce qui signifie que chaque calque a besoin de bords alpha propres, d'un ordre d'empilement correct, et qu'aucun pixel apparaissant dans deux calques à la fois ne soit compté doublement.
Ces deux modes de défaillance sont courants. Un détourage d'une personne debout devant un mur laissera, avec une segmentation naïve, un fantôme de la personne derrière lorsque le calque est retiré. Le calque du mur doit avoir appris que la personne l'occulte, et il doit reconstruire l'aspect du mur derrière la personne. C'est un problème de génération, pas d'étiquetage, et c'est pourquoi la représentation RGBA importe. Chaque calque porte son propre canal alpha, donc le modèle doit décider, pixel par pixel, quel calque possède quoi.
Le rapport chinois attribue cela à deux éléments d'architecture : un encodeur RGBA-VAE conçu pour cet usage, et un encodage positionnel 3D au niveau des calques. Le second est la partie intéressante. Si les calques sont empilés en profondeur, le modèle a besoin d'une notion de l'endroit où chacun se situe dans cette pile, ce que fournit l'encodage positionnel.
L'affirmation du « zéro dérive »
L'argument est que les modifications n'entraînent presque aucune dérive : changez un calque et tout le reste reste en place.
La dérive est le défaut que connaît quiconque a déjà modifié une image générée. Vous demandez un changement d'arrière-plan, et le modèle renvoie un visage légèrement différent, une chemise dans une autre teinte, ou une ombre qui a bougé. Toute modification fondée sur la diffusion en porte une part, car le modèle régénère plus que ce que vous avez demandé. La nouvelle fonction Prompt to Edit d'Adobe dans Lightroom a exactement ce problème, et c'est la raison pour laquelle les photographes s'en méfient.
Un modèle par calques contourne le problème par sa structure. Si l'objet que vous ne modifiez pas existe comme calque RGBA distinct, et que la modification ne touche qu'un autre calque, le calque non touché est copié plutôt que régénéré. La dérive devient un bug du moteur de composition plutôt qu'une propriété du modèle.
C'est une garantie plus propre que ce que peut offrir n'importe quelle approche d'inpainting, et c'est pourquoi le choix architectural est le vrai sujet ici, plutôt que les chiffres de benchmark.
Ce que cela change pour le travail réel
Trois flux de travail se raccourcissent.
Réutilisation des ressources existantes. Une photo de produit intégrée dans une bannière peut être extraite et réutilisée sans qu'il faille tracer un tracé de détourage. Le calque est déjà là, avec son alpha.
Sortie transparente. Un modèle qui produit des calques RGBA par défaut peut générer des PNG transparents comme effet secondaire de son fonctionnement normal. Cela supprime une étape qui nécessite actuellement soit un modèle de segmentation, soit un masquage manuel.
Variation en lot. Si l'image maîtresse est une pile de calques, une équipe peut régénérer des variantes en échangeant un calque et en recomposant. Le reste de l'image n'est pas touché, ce qui compte lorsque la charte de marque fixe tout sauf le produit.
Un quatrième est moins évident. Les calques sont des données structurées. Une pile de composants RGBA nommés s'intègre dans un éditeur ou un pipeline automatisé bien plus proprement qu'un bitmap plat, ce qui rend le modèle utile comme composant plutôt que comme destination.
Où sont les limites
Le modèle décompose une image. Il ne sait pas comment les calques devraient être nommés et il ne déduit pas l'intention. Demandez-lui de découper la photo d'un bureau encombré : le résultat pourra bien séparer les objets et mal l'éclairage. Les matériaux semi-transparents sont le cas difficile, puisqu'un verre d'eau appartient sans doute à plusieurs calques à la fois.
L'ordre de profondeur reste aussi ambigu pour les reflets et les ombres. Une ombre projetée sur un mur est une propriété d'un objet, mais elle vit sur le calque d'arrière-plan, et décider de quel côté de cette frontière la placer est un jugement que le modèle doit faire sans qu'on le lui indique.
Rien de tout cela ne rend la publication moins importante. Cela en fait une fondation plutôt qu'un outil fini.
Pourquoi le format en calques se répand mieux qu'un meilleur inpainting
Depuis deux ans, la course aux modèles d'image se déroule sur le même parcours. Chaque génération a produit un inpainting plus net, une meilleure fidélité au prompt et moins d'artefacts évidents.
Ce parcours a des limites, et elles sont structurelles. Peu importe à quel point l'outil d'inpainting s'améliore, le modèle d'interaction reste le même : l'utilisateur définit une zone, le modèle la remplit, et l'utilisateur juge le résultat. La qualité progresse, mais le flux de travail ne change pas. La preuve, c'est que la même plainte revient sans cesse d'une génération de modèles à l'autre : une modification locale produit des changements ailleurs.
Les calques s'attaquent au flux de travail plutôt qu'à la métrique de qualité. Une fois qu'une image est une pile, l'unité de travail devient le calque plutôt que la sélection, et l'utilisateur manipule directement des composants. C'est ainsi que les designers travaillent dans des outils dédiés depuis trente ans, et si les modèles d'image ne le faisaient pas, c'est que la représentation n'était pas disponible.
Construire cette représentation coûte cher. Un modèle doit apprendre l'occlusion, l'ordre de profondeur et l'alpha à partir de données qui, pour l'essentiel, ne contiennent pas de décompositions en calques ; c'est pourquoi l'objectif d'entraînement, la reconstruction de l'entrée à partir de la pile prédite, est l'élément porteur de la conception.
Si l'approche fonctionne, les conséquences dépassent les produits d'Alibaba. Un outil de composition qui accepte une pile de calques peut être intégré à un pipeline qui nécessitait auparavant qu'un humain découpe des masques. Une banque d'images qui fournit des décompositions devient plus précieuse qu'une banque qui livre des JPEG plats. Le modèle est le premier maillon de cette chaîne, et l'écosystème n'en possède pas encore le reste.
Le paysage concurrentiel
La décomposition en calques n'est pas propre à Alibaba. Ming-Image d'Ant Group adopte une position proche, en générant des créations sous forme de compositions en calques plutôt que d'images plates. Stability et d'autres ont livré des modèles de segmentation qui approximent certaines parties du flux de travail. Ce qui diffère, c'est l'engagement en faveur des calques RGBA comme format de sortie natif, et la décision de publier des poids que tout le monde peut exécuter.
Ce dernier choix compte pour la vitesse à laquelle l'idée se répand. Le marché des outils d'image a passé deux ans à converger vers l'interaction « sélectionner une zone, décrire une modification », et les résultats ont atteint un plateau en qualité pour la simple raison que la représentation sous-jacente n'a pas changé. Donner à l'écosystème une pile modifiable plutôt qu'un bitmap est le genre de basculement qui apparaît dans les produits des autres avant d'apparaître dans un tableau de benchmark.
Ce qu'il faut surveiller, c'est si les outils de composition commencent à accepter les piles de calques comme format d'entrée, et si les logiciels d'édition commencent à traiter la décomposition comme la première étape d'un projet plutôt que comme une opération de réparation. Le score de benchmark est un détail.
Articles associés
Salesforce dote ses agents d'un runtime qui tourne pendant des semaines
La liste est la partie la moins intéressante. Le runtime qui se trouve en dessous change la finalité d'un agent.
Cohere impose un plafond strict aux dépenses autorisées d'un agent d'entreprise
Un agent qui fonctionne sans surveillance est un agent qui peut faire grimper une facture sans surveillance. North 2 intègre le budget au produit.
Adobe a intégré l’édition générative à Lightroom, et les photographes ont raison de s’inquiéter
Un outil qui côtoie les curseurs encourage à croire qu’il s’agit d’un réglage de routine. Il réécrit la photographie.
JetBrains installe un orchestrateur d'agents dans chaque IDE qu'il publie
JetBrains ne rivalise pas sur la qualité des modèles. Elle se bat pour la couche où les agents sont lancés et examinés.