阿里巴巴开源了一款可将平面图像拆分为可编辑图层的模型

阿里巴巴的 Qwen 团队于十月初将 Qwen-Image-Layered 发布在 ModelScope 和 Hugging Face 上,许可证允许商业使用。10 月 2 日的中文公告称其为首个具备原生、Photoshop 式图层理解与编辑能力的图像模型。这一说法值得细究,因为它背后的机制并不是大多数图像编辑器一直努力的方向。
编辑生成图像的常规做法是选定一个区域并在其中重新生成。Inpainting 就是这么工作的。前一天发布的 FLUX 3 Image 也是这样,用边界框精确限定模型可以触碰哪些像素。这种方法有一个众所周知的弱点:模型根本不知道什么是图层。它看到一个矩形区域和一段提示词,然后把洞填上。
Qwen-Image-Layered 从另一种表示出发。它把一张成品图像分解为一组 RGBA 图层,每个图层都是全分辨率,并且各自带有透明度。一个物体成为一个图层,一段文字成为另一个图层,背景则成为第三个图层。你可以移动图层、重新着色或替换图层,然后重新合成整个图层堆栈。训练目标让这件事可以被度量:模型学习生成这样的图层,使其重新合成后能够还原输入图像,因此分解质量有了直接的评分标准。

为什么这与分割是不同的问题
把图像分割成物体是一项老任务,模型在这方面已经表现不错有一段时间了。图层分解要求的是更具体的东西。输出必须能作为编辑基元使用,这意味着每个图层都需要干净的 alpha 边缘、正确的堆叠顺序,并且不能把同时出现在两个图层中的像素重复计算。
这两种失败模式都很常见。对站在墙前的人做抠图,在朴素分割下,当移除该图层时,会留下人的鬼影。墙面图层必须学会人遮挡了它,并且必须重建人在后面时墙原本的样子。这是一个生成问题,而不是标注问题,也正是 RGBA 表示重要的原因。每个图层都有自己的 alpha 通道,因此模型必须逐像素决定哪个图层拥有什么。
中文报道把这一点归功于两项架构:专门构建的 RGBA-VAE 编码器,以及图层级 3D 位置编码。第二项才是有意思的部分。如果图层按深度堆叠,模型就需要知道每个图层在这一堆栈中位于哪里,而位置编码提供的正是这一点。
“零漂移”的说法
其卖点是编辑几乎不会造成漂移:改动一个图层,其他一切保持不变。
漂移是所有编辑过生成图像的人都熟悉的失败。你要求换背景,模型却返回一张略有不同的脸、颜色深浅不同的衬衫,或者移动了的阴影。每一种基于扩散的编辑都带有一些这类问题,因为模型重新生成的内容超出了你的要求。Adobe 在 Lightroom 中新增的 Prompt to Edit 功能恰恰有这个问题,这也是摄影师对它保持警惕的原因。
图层模型从结构上绕开了这个问题。如果你没有编辑的物体作为独立的 RGBA 图层存在,而编辑只触及另一个图层,那么未受影响的图层会被复制,而不是重新生成。漂移变成了合成器里的一个 bug,而不是模型的一种属性。
这是任何 inpainting 方法都无法提供的更干净的保证,也正是为什么这里的故事是架构选择,而不是基准测试数字。
它对实际工作改变了什么
三个工作流会变短。
复用现有素材。嵌入横幅中的产品图可以被提取出来复用,无需有人描摹剪切路径。图层已经在那里,并且带有 alpha。
透明输出。默认输出 RGBA 图层的模型可以在正常操作中顺带产生透明 PNG。这省去了一步目前需要分割模型或手动蒙版的操作。
批量变体。如果主图是一堆图层,团队可以通过替换一个图层并重新合成来生成变体。图像其余部分不受影响,当品牌规范固定了除产品之外的一切时,这一点很重要。
第四个好处不那么明显。图层是结构化数据。一组带名称的 RGBA 组件输入编辑器或自动化流水线时,比一张扁平位图要干净得多,这使得该模型可以作为组件使用,而不是作为终点。
限制在哪里
该模型分解图像。它不知道图层应该叫什么,也不会推断意图。让它拆分一张杂乱书桌的照片,结果可能很好地分离物体,却糟糕地处理光照。半透明材质是难点,因为一杯水可以说同时属于好几个图层。
对于反射和阴影,深度排序也仍然模糊。投在墙上的阴影是物体的属性,但它存在于背景图层上,决定把它放在这条线的哪一侧,是模型不得不独自做出的判断。
这些都不影响这次发布的重要性。它使其成为一块基石,而不是一件成品工具。
为什么图层格式比更好的 inpainting 传播得更广
过去两年,图像模型竞赛一直在同一条赛道上进行。每一代都带来更锐利的 inpainting、更好的提示词遵循度和更少明显的伪影。
这条赛道有极限,而且是结构性的。无论 inpainting 变得多好,交互模型都保持不变:用户定义区域,模型填充区域,用户判断结果。质量提高了,但工作流没有改变。证据就是,同样的抱怨在不同模型代际中反复出现,即局部编辑会在别处产生变化。
图层攻击的是工作流,而不是质量指标。一旦图像变成图层堆栈,工作单位就变成了图层,而不是选区,用户直接操作组件。三十年来设计师在专业工具中一直是这样工作的,而图像模型没有这样做,原因是这种表示此前并不存在。
构建这种表示代价高昂。模型必须从大多不包含图层分解的数据中学习遮挡、深度排序和 alpha,这就是为什么训练目标——从预测的图层堆栈重建输入——是设计中承重的部分。
如果这种方法奏效,其影响会超出阿里巴巴自己的产品。一个接受图层堆栈的合成工具可以被接入此前需要人工裁切蒙版的流水线。发布分解结果的图库会比只发布扁平 JPEG 的图库更有价值。该模型是这条链条的第一环,而生态还没有其余部分。
竞争格局
图层分解并非阿里巴巴独有。蚂蚁集团的 Ming-Image 采取了相关立场,将设计生成为图层化构图,而不是平面图片。Stability 等公司也发布了近似于部分工作流的分割模型。不同之处在于对 RGBA 图层作为原生输出格式的承诺,以及发布任何人都可以运行的权重这一决定。
最后这个选择关系到这个想法传播的速度。图像工具市场花两年时间趋同于“选择区域、描述修改”的交互方式,而结果在质量上趋于平台期,原因很简单:底层表示没有改变。交给生态一个可编辑的图层堆栈而不是位图,这种转变会先出现在别人的产品里,然后才出现在基准表上。
值得关注的是,合成工具是否会开始接受图层堆栈作为输入格式,以及编辑器是否会开始把分解当作项目的第一步,而不是一种修复操作。基准分数是次要问题。