← Volver al blog
Aiaprox. 8 min de lectura

Alibaba publica como código abierto un modelo que divide una imagen plana en capas editables

Publicado 6 oct 2026
Alibaba publica como código abierto un modelo que divide una imagen plana en capas editables

El equipo Qwen de Alibaba publicó Qwen-Image-Layered en ModelScope y Hugging Face a principios de octubre, con una licencia que permite el uso comercial. El anuncio en chino del 2 de octubre lo describió como el primer modelo de imagen con comprensión y edición de capas nativas al estilo de Photoshop. Esa afirmación merece analizarse, porque el mecanismo que hay detrás no es el que la mayoría de los editores de imagen ha estado persiguiendo.

La forma estándar de editar una imagen generada es seleccionar una región y regenerar dentro de ella. El inpainting funciona así. FLUX 3 Image, publicado el día anterior, también funciona así, con cuadros delimitadores que definen exactamente qué píxeles puede tocar el modelo. El enfoque tiene una debilidad conocida: el modelo no tiene ni idea de qué es una capa. Ve una región rectangular y un prompt, y rellena el hueco.

Qwen-Image-Layered parte de una representación distinta. Descompone una imagen terminada en un conjunto de capas RGBA, cada una a resolución completa y cada una con su propia transparencia. Un objeto se convierte en una capa, un fragmento de texto en otra y el fondo en una tercera. Puedes mover una capa, recolorearla o sustituirla, y después recomponer la pila. El objetivo de entrenamiento es lo que hace que esto sea medible: el modelo aprende a producir capas cuya recomposición reproduce la imagen de entrada, de modo que la calidad de la descomposición tiene una puntuación directa.

Tres finos paneles de vidrio esmerilado apilados con un ligero desfase sobre una losa de piedra pálida

Por qué este es un problema distinto al de la segmentación

Segmentar una imagen en objetos es una tarea antigua, y los modelos llevan tiempo siendo buenos en ella. La descomposición en capas exige algo más específico. La salida tiene que ser utilizable como primitiva de edición, lo que significa que cada capa necesita bordes alfa limpios, un orden de apilamiento correcto y ningún recuento doble de píxeles que aparezcan en dos capas a la vez.

Ambos modos de fallo son habituales. El recorte de una persona de pie frente a una pared dejará, con una segmentación ingenua, un fantasma de la persona detrás cuando se elimine la capa. La capa de la pared tiene que haber aprendido que la persona la ocluye, y tiene que reconstruir cómo era la pared detrás de la persona. Eso es un problema de generación, no de etiquetado, y es la razón por la que la representación RGBA importa. Cada capa lleva su propio canal alfa, así que el modelo tiene que decidir, píxel a píxel, qué pertenece a cada capa.

El informe en chino atribuye esto a dos piezas de arquitectura: un codificador RGBA-VAE creado específicamente para ello y una codificación posicional 3D a nivel de capa. La segunda es la parte interesante. Si las capas se apilan en profundidad, el modelo necesita alguna noción de dónde se sitúa cada una en esa pila, y eso es lo que aporta la codificación posicional.

La afirmación de la «deriva cero»

La propuesta es que las ediciones apenas causan deriva: cambia una capa y todo lo demás se queda igual.

La deriva es el fallo que conoce cualquiera que haya editado una imagen generada. Pides un cambio de fondo y el modelo devuelve una cara ligeramente distinta, o una camisa de otro tono, o una sombra que se ha movido. Toda edición basada en difusión arrastra algo de esto, porque el modelo regenera más de lo que le pediste. La nueva función Prompt to Edit de Adobe en Lightroom tiene exactamente este problema, y es la razón por la que los fotógrafos desconfían de ella.

Un modelo de capas esquiva el problema de forma estructural. Si el objeto que no estás editando existe como una capa RGBA independiente, y la edición solo toca otra capa distinta, la capa intacta se copia en lugar de regenerarse. La deriva pasa a ser un error del compositor y no una propiedad del modelo.

Esa es una garantía más limpia que la que puede ofrecer cualquier enfoque de inpainting, y por eso la noticia aquí es la elección arquitectónica y no las cifras de los benchmarks.

Qué cambia para el trabajo real

Tres flujos de trabajo se acortan.

Reutilización de recursos existentes. Una foto de producto incrustada en un banner se puede extraer y reutilizar sin que nadie tenga que dibujar un trazado de recorte. La capa ya está ahí, con su alfa.

Salida con transparencia. Un modelo que emite capas RGBA por defecto puede producir PNG transparentes como efecto secundario de su funcionamiento normal. Eso elimina un paso que actualmente requiere un modelo de segmentación o un enmascarado manual.

Variaciones en lote. Si la imagen maestra es una pila de capas, un equipo puede regenerar variaciones sustituyendo una capa y recomponiendo. El resto de la imagen queda intacto, lo que importa cuando las directrices de marca lo fijan todo excepto el producto.

Un cuarto es menos obvio. Las capas son datos estructurados. Una pila de componentes RGBA con nombre se integra en un editor o en un flujo automatizado de forma mucho más limpia que un mapa de bits plano, lo que hace que el modelo sea útil como componente y no como destino final.

Dónde están los límites

El modelo descompone una imagen. No sabe cómo deberían llamarse las capas y no infiere la intención. Pídele que divida la fotografía de un escritorio desordenado y el resultado puede separar bien los objetos y mal la iluminación. Los materiales semitransparentes son el caso difícil, ya que un vaso de agua podría pertenecer a varias capas a la vez.

El orden de profundidad también sigue siendo ambiguo para reflejos y sombras. Una sombra proyectada sobre una pared es una propiedad de un objeto, pero vive en la capa de fondo, y decidir de qué lado de esa línea colocarla es un juicio que el modelo tiene que hacer sin que nadie se lo indique.

Nada de esto resta importancia al lanzamiento. Lo convierte en una base más que en una herramienta terminada.

Por qué el formato de capas viaja mejor que un inpainting mejorado

Durante los últimos dos años, la carrera de los modelos de imagen se ha disputado en el mismo circuito. Cada generación produjo un inpainting más preciso, mejor adherencia al prompt y menos artefactos evidentes.

Ese circuito tiene límites, y son estructurales. Por muy bueno que llegue a ser el inpainter, el modelo de interacción sigue igual: el usuario define una región, el modelo la rellena y el usuario juzga el resultado. La calidad mejora, pero el flujo de trabajo no cambia. La prueba es que la misma queja reaparece generación tras generación de modelos: que una edición local produce cambios en otro sitio.

Las capas atacan el flujo de trabajo en lugar de la métrica de calidad. Una vez que una imagen es una pila, la unidad de trabajo pasa a ser la capa y no la selección, y el usuario manipula los componentes directamente. Así han trabajado los diseñadores en herramientas dedicadas durante treinta años, y la razón de que los modelos de imagen no lo hicieran era que la representación no estaba disponible.

Construir esa representación es caro. Un modelo tiene que aprender oclusión, orden de profundidad y alfa a partir de datos que en su mayoría no contienen descomposiciones en capas, y por eso el objetivo de entrenamiento —reconstruir la entrada a partir de la pila predicha— es la parte que sostiene todo el diseño.

Si el enfoque funciona, las consecuencias van más allá de los propios productos de Alibaba. Una herramienta de composición que acepte una pila de capas se puede conectar a un flujo que antes necesitaba a una persona recortando máscaras. Una biblioteca de imágenes de stock que entregue descomposiciones se vuelve más valiosa que una que entregue JPEG planos. El modelo es la primera pieza de esa cadena, y el ecosistema todavía no tiene el resto.

El panorama competitivo

La descomposición en capas no es exclusiva de Alibaba. Ming-Image, de Ant Group, adopta una postura relacionada: genera diseños como composiciones por capas en lugar de imágenes planas. Stability y otros han lanzado modelos de segmentación que se aproximan a partes del flujo de trabajo. Lo que marca la diferencia es el compromiso con las capas RGBA como formato de salida nativo y la decisión de publicar unos pesos que cualquiera puede ejecutar.

Esa última decisión importa para la rapidez con que se difunda la idea. El mercado de herramientas de imagen ha pasado dos años convergiendo en la interacción de «selecciona una región, describe un cambio», y los resultados se han estancado en calidad por la sencilla razón de que la representación subyacente no ha cambiado. Entregar al ecosistema una pila editable en lugar de un mapa de bits es el tipo de cambio que aparece antes en los productos de otros que en una tabla de benchmarks.

Lo que hay que observar es si las herramientas de composición empiezan a aceptar pilas de capas como formato de entrada, y si los editores empiezan a tratar la descomposición como el primer paso de un proyecto en lugar de una operación de reparación. La puntuación en los benchmarks es una cuestión secundaria.

Artículos relacionados