将 JPG 拆分为图层正成为常规设计步骤

设计师们常用的工具正在发生一场悄然的转变。在过去一年的大部分时间里,AI 图像领域最引人关注的动向是生成:创造出本不存在的东西。而如今不断涌现的工具,则是从一张已经存在的图像出发,把它拆解开来。
这一转变很容易被忽略,因为它并不会产出惊艳的演示视频。没有人会分享一张图层分离得干净漂亮的截图。但正是这一变化,决定了生成图像能否用于专业工作,因为一项设计资产的价值,更多取决于它日后是否可编辑,而非它看起来如何。
LayerGrab 于 10 月 2 日面世。它能把一张平面的 PNG、JPG 或 WebP 转换为最多十六个独立的透明图层,并为它们配上描述性的英文名称,同时通过图像修复(inpainting)重建被提取元素背后的背景。它可导出单独的 PNG、ZIP 压缩包,或适用于 Photoshop 的分层 PSD,并提供 Photoshop、Figma 和 Sketch 插件,以及一个可从浏览器抓取图像的 Chrome 扩展。浏览器工具本身不提供 .psd 导出;图层以编号 PNG 的形式输出,你需要自行在编辑器中叠放。
处理过程耗时 60 到 100 秒。它基于分割模型和生成模型运行,其中包括 Qwen-Image-Layered——阿里巴巴于 10 月 2 日以宽松许可开源发布的模型。输入文件上限为 20MB,而 Chrome 扩展让设计师可以右键点击任意网站上的图片,将其直接发送到分离面板。
为什么图层分解才是真正有用的一半
生成解决了一个设计师多年来一直在绕开的问题,同时又制造了一个新问题。AI 生成的图像看起来像是设计成品的平面照片,而不是可编辑的工作文件。你无法把产品移到横幅的另一侧,因为它已经焊死在像素里了。你无法替换标题文字,因为那里没有文本对象,只有文字的样貌。
这正是图层分解所填补的空白。它的要点在于还原平面图像所隐藏的结构,让图像能像设计文件那样被编辑,而不是去创造新东西。
阿里巴巴对 Qwen-Image-Layered 的表述将这一问题称为「平面像素耦合」。该模型使用 RGBA-VAE 编码器和图层级 3D 位置编码来识别空间层级与遮挡关系,然后将图像分解为相互独立的可编辑图层。该公司宣称在精确编辑时几乎零偏移,这解决了那种当你改动图像的一部分、却发现其他部分也跟着变化的连贯性问题。
蚂蚁集团的 inclusionAI 在同一天发布了一对相关模型:用于生成完整视觉设计的 Ming-Image-0.1-Design,以及用于将扁平化设计分解为透明图层的 Ming-Image-0.1-Design-Layer,两者均为 6B 参数,默认部署均需 80GB GPU。
创作者实际用它来做什么
这些工具的描述读起来就像一份琐碎、不起眼的工作清单。把一张已经完成的广告拆成图层,再把产品移到另一侧以适配新尺寸。把一幅插画分成图层,以便制作视差动画。把照片中的产品和背景分开,让它们能在不同的幻灯片上分别动起来。从海报中提取元素,以便修改文字或在新项目中复用图形。
这些都不是能登上作品集演示视频的任务。它们却是会耗掉设计师一整个下午的活儿,而且此前完全无法自动化,因为没有任何工具能从一张已渲染的图像中还原结构。面对一张平面 JPG,设计师只有唯一的选择:手动逐层重绘,并靠猜来推断每个元素背后是什么。
这件事的重要性超出它听起来的分量,原因在于设计师收到的素材大多是平面的。客户发来去年海报的 JPG,要求出一个新尺寸的版本。品牌团队只有最终导出文件,源文件却丢了。某个营销活动的素材只以截图的形式存在。图层分解把这些死路变成了起点,这是一种与生成所提供的不相同的价值。
也存在一些坦率的局限。LayerGrab 不会保留投射阴影。极细小的文字在被模型重绘时可能出现轻微的色彩差异,而且文字是作为图像图层被提取出来,而非可编辑的文本。和任何分割系统一样,同一输入在不同运行之间,切分结果也会有轻微差异。
Kenerate 的 Image Layer 工具采用了类似的方法,但侧重点不同:它生成 2 到 8 个图层,数量由用户选择,或使用自动数量——在 Pro 版中通常落在 6 到 12 之间。它同样导出 PNG 而非 PSD,文档也明确说明了这一限制,而这类工具恰恰受益于这种坦诚。期待拿到可用的 PSD 文件、结果却收到一文件夹 PNG 的设计师,会白白浪费一个下午才发现差别。
工具之间的差异颇具启发意义。一个针对设计师可控的固定图层数量做优化;另一个则让模型自行决定。两者都在绕开同一个约束:图层分割本质上是一种主观判断,而不同工具做出的判断各不相同。
更大的趋势
把本月发布的东西放在一起看,规律就浮现出来了。阿里巴巴开源了一个图层模型。蚂蚁集团发布了一对「设计 + 分解」模型。一款商业工具则把这能力封装成了插件,接入设计师已经在用的编辑器。这项能力从研究成果变成产品功能,只用了大约两周。
这个速度才是有意思的地方。当一个模型以宽松许可开源时,「它还只存在于论文里」和「它成了 Figma 里的一个按钮」之间的窗口期就崩塌了。设计师采纳的不是架构,而是按钮。胜出的模型很少是基准测试分数最高的那个,而是出现在设计师第二块显示器上已打开软件里的那个。
实际效果是,AI 图像不再是终点式的成品。今天生成的图像,明天可以被拆解,周四可以重新排布,并以客户团队下个季度仍能编辑的格式交付。正是这种灵活性,让生成资产能够用于专业工作流程,也正是图层分解从新奇玩物变成标准步骤的原因。
下一个问题是:图层分解最终会被纳入生成模型内部,还是留在它旁边。如果模型能直接输出分层结果,那么单独的分解步骤就会消失。在那之前,从平面图像中还原结构的工具,就是生成器输出与设计师需求之间的桥梁;而这座桥正以足够快的速度被搭建起来,以至于大多数设计团队会在从未刻意决定采用它的情况下就用上它。