原生透明正悄然成为 AI 图像中最实用的新功能

问一个人想要 AI 图像生成器具备什么,他们会说真实感、风格或速度。但去问一位真正要交付作品的设计师,你会得到不同的答案:透明背景。
这个不起眼的功能——Alpha 通道——从一开始就是 AI 图像模型的一块短板。大多数生成器输出的只是一个扁平矩形。要想得到一个 logo、产品抠图,或能放到另一份设计里的元素,你之后还得把图像丢进背景移除工具,这是一个单独的步骤,会带来自己的伪影和边缘问题。移除工具会啃坏发丝边缘、抹花半透明材质,或残留旧背景的一圈光晕。然后你还得手动修补。正是这种摩擦感,让 AI 图像生成更像制作成品图的小玩具,而不是用于真实工作的工具。
Qwen-Image 2.1 将透明度内置到模型本身,填补了这一空白。只需一条提示词,就可以请求普通图像,或带有真实 Alpha 通道的 RGBA 图像。无需单独模型,无需后处理步骤。这听起来微不足道,但想想现实设计工作中有多少是在把元素层层叠加到其他元素之上。透明图像是一块积木。扁平矩形则是一条死路。
阿里巴巴此前确实在 2025 年 12 月推出过专门的透明度模型 Qwen-Image-Layered。2.1 的意义在于,它把这项能力融入了统一的生成与编辑模型。现在可以直接编辑透明图层。在保持背景透明的同时改变角色表情。替换嵌入透明图层中的文字。把真实照片中的主体提取为可放置到任何地方的 RGBA 抠图。该模型不仅生成透明度,还能在编辑过程中保留透明度,而这才是对工作流真正重要的部分。

用例近在眼前。电商卖家需要干净背景的产品图,以便合成到横幅和商品列表中。UI 设计师需要没有背景的图标和插画。游戏开发者需要边缘干净的精灵图资源。内容创作者需要可放入缩略图、封面和叠加层的元素。此前所有这些都需要一串工具链:生成器、移除工具、清理、合成。有了原生透明,生成器直接交给你可用的图层,中间步骤全都跳过。
这里有一个更深层的转变,关乎图像模型正在变成什么。第一波浪潮是生成一张独立完整的图片,那是“哇,看它做出了什么”的时代。下一波浪潮则是生成能融入工作流的素材,也就是“看我能用它做什么”的时代。透明度、编辑和多图合成都指向同一个方向:模型不再是一台吐出成品图的自动售货机,而变成一种把可组合的原材料交给你的工具。
这关乎人们如何评价图像模型。发布帖里引用的基准分数,大多衡量的是单张图好不好看、是否逼真、文字是否清晰、手指数目对不对。它们并不衡量 Alpha 通道是否干净、抠图边缘是否锐利、透明图层能否在编辑后保留,或者模型是否尊重你并未要求更改的图像部分。这些才是专业人士在实际使用五分钟内就会注意到的品质,而它们很少出现在排行榜上。
这也是 AI 图像讨论为何总是分成两半的部分原因。一边是关于模型、基准和突破的公开讨论,另一边是那些靠这些工具谋生的人之间的私下讨论,关乎工作流、边缘、图层和控制权。透明度属于后一种讨论,所以它尽管很重要,却很少获得报道。它不上镜。你没法像炫耀一条逼真的龙那样,在推文里炫耀一个 Alpha 通道。
对开源生态而言,一个 70 亿参数模型具备原生透明能力,是行业基础水位正在抬高的又一个信号。一年前,你需要专门模型或付费 API 才能获得干净的透明输出。现在,它成了你可以在中端 GPU 上本地运行的模型自带的功能。实际效果是,小团队和独立创作者也能用上曾经属于企业级功能的能力,而尝试分层、可组合图像工作的成本几乎降到零。
限制仍然存在。透明度生成在精细细节、头发、毛发、烟雾,以及任何半透明或纤细的东西周围都很挑剔。模型可以为实心物体生成干净的抠图,却可能对角色飘散的发丝束手无策。这些正是曾让背景移除工具头疼的边缘,模型并没有神奇地解决它们,只是把它们移到了生成步骤内部,从而更容易迭代。这是进步,但并非完美。
这个功能很容易被低估,因为它是隐形的。透明背景由“不存在的东西”来定义,你没法在一张主视觉图里指出背景的缺席。但对那些日常工作就是抠产品、隔离主体或构建分层合成的人来说,它区分了“生成图片的模型”和“生成素材的模型”。这就是藏在一个不起眼缩写背后的升级,而且它悄然比本月宣布的大多数更花哨的功能都更有用。
值得退一步想想,为什么透明度花了这么久才到来。Alpha 通道在计算机图形学中早已是一个已解决的问题,几十年来都是如此。AI 图像模型在这方面落后的原因,并不是它在原理上很难,而是模型是在从网上抓取的扁平化 RGB 图像上训练的,而网络存储的大多是成品图,不是分层工作文件。外面根本没有多少透明图像数据可供训练,因为人们不会公开发布自己的 Photoshop 文件。于是模型学会了生成矩形,透明度则不得不在事后通过工程手段补上,要么借助单独模型,要么通过精心策划合成透明数据。
这解释了为什么 Qwen-Image-Layered 先以独立模型存在,之后才被并入主模型。当“透明”这一概念在训练数据中代表性不足时,要教会模型它到底意味着什么需要真正下功夫,而要让这种理解在编辑后依然成立则需要更多功夫。2.1 在 7B 参数下于统一模型中同时做到这两点,说明团队在一项永远不会登上炫目基准排行榜的能力上投入了严肃的努力。
这种投入本身就是一种信号。当一个实验室把精力花在透明度和局部编辑这类工作流功能上,而不只是追逐基准分数时,它是在押注图像生成的市场在于专业用途,而不只是新奇玩具。它押的是:真正重要的人,是那些需要在截止日期前交付干净素材的人,而不是想生成一张酷图发一次的人。这个赌注能否得到回报,是整个图像生成行业的核心问题,而原生透明正是它最清晰的体现之一。
相关文章
一次十张参考图:AI 图像编辑从单张生成迈向合成
单图编辑产生变体,多图编辑产生组合。一次使用十张参考图,如何改变我们提示和构图的方式。
阿里巴巴 Qwen-Image 2.1 刚刚改变了开放模型许可的讨论
技术规格令人印象深刻,但许可证才是真正的故事。Qwen-Image 2.1 弃用 Apache 2.0,转而采用研究许可证,而细则如今比以往任何时候都更重要。
通义万相 Qwen-Image 2.1 开源:7B 小模型如何把透明图和 10 图编辑装进一张消费级显卡
一个 7B 的开源生图模型,凭什么把透明图、多图编辑装进一张 6G 显卡?拆解 Qwen-Image 2.1 的核心升级与授权转折。
你还能分辨AI图片和真实照片吗?诚实的答案是不能。
破绽已经消失,检测器也不可靠。对于识别AI图片,诚实的答案是不能,而解决之道在你眼睛的上游。