← 返回博客
Ai5 分钟

通义万相 Qwen-Image 2.1 开源:7B 小模型如何把透明图和 10 图编辑装进一张消费级显卡

发布于 2026年9月27日
通义万相 Qwen-Image 2.1 开源:7B 小模型如何把透明图和 10 图编辑装进一张消费级显卡

9 月 20 日,阿里千问团队把 Qwen-Image 2.1 放上了开源平台。消息一出,B 站上的整合包视频当天就多了起来,标题大多带着同一句话:最低 6G 显存就能跑。对一个过去常被贴上"吃显卡"标签的文生图赛道来说,这个数字本身就是新闻。

很多人第一眼会把它当成 Qwen-Image 3.0 之后的新一代。其实不是。千问在今年 7 月预告过 Qwen-Image 3.0,号称支持 4500 token 的超长提示词,但那只是预览,没给权重、没给跑分。2.1 是 2.0 这条开源线上的正经继任,视觉生成部分依然是 32 层 Single-Stream DiT,参数 7B,和 2 月发布的 2.0 保持同款轻量架构。

真正让人意外的是功能,而不是参数。这次三个升级放一起看,指向同一个方向:让生图工具真的进入生产流程,而不是停在"惊艳 demo"的阶段。

第一是原生透明图。以前要生成一张带透明通道的 PNG,得靠单独的模型,千问去年 12 月就发过专门的 Qwen-Image-Layered。2.1 把透明图能力并进了统一模型里,一句提示词就能在普通图和 RGBA 之间切换,还能直接编辑透明图层——改表情时背景保持透明,或者把照片里的主体抠出来当素材。对做电商图、做 UI 素材的人来说,这一步省掉了不少来回切换的麻烦。

第二是参考图从几张涨到 10 张。2.0 那会儿多图编辑还局限在少量输入,2.1 可以直接把六张不同的人像合成一张合影,或者拿模特、衣服、鞋、包、帽子各一张图拼出一整套穿搭。实现上用的是混合粒度的注意力机制:文本走 token 级的因果 mask,图像生成走 chunk 级的 mask,再加上 KV cache 复用,让参考图和指令只算一次、反复复用。说白了,就是用工程手段把"图多了变慢"这件事压下去。

第三是局部编辑的细化。现在可以画圈、涂标注、或者单独传一张 mask 图,把修改指令限定在某一小块区域,不动画面其他地方。任务覆盖也扩展到了全景图、信息图、分镜稿。

设计师工作台上,屏幕正在展示 AI 图像编辑与透明图层叠加

但这次开源带着一个过去少见的条件。Qwen-Image 2.1 用的是 Qwen Research License,只允许研究和评估,商用要另外谈付费授权。这跟阿里近期大多数开源项目走的 Apache 2.0 路线不一样,也跟 Z-Image、Ideogram 4.0 这类完全宽松的开放权重模型拉开了距离。对想拿它接商单、做产品的团队来说,许可证是比显卡门槛更值得先看清楚的东西。

中文社区的反应集中在"能跑"这件事上。B 站一批 UP 主在做一键整合包,主打解压即用、最低 6G 显存、支持批量生图和图片编辑,评论区常有人拿它和付费工具比。这种情绪有个背景:过去两年,效果最好的生图模型大多关在 API 和订阅墙后面,本地能跑的往往差一档。Qwen-Image 2.1 恰好踩在那个交叉点上——体量小、开源、效果被拿来对标闭源对手,于是"吊打付费工具"的说法就有了传播的土壤,哪怕这句话本身需要打个问号。

客观一点看,Qwen-Image 2.1 的价值不在"吊打"谁,而在它把透明图、多图编辑、局部控制这几件设计师每天都在做的事,塞进了一个消费级显卡能跑的小模型。真到了交付这一步,AI 生成的图离能用还差什么?人物要抠图、素材要改字、商品摆放要调、包装上的字和瓶身形状不能跟着变。2.1 正是冲着这些"最后一公里"去的。能不能真的取代一部分付费工具,得看用的人拿它干了什么,而不是看标题写了什么。

至少从开源社区的热度看,答案是偏乐观的。一个 7B 的小模型,加上一张 6G 的卡,让"本地跑一个能用的生图模型"从折腾变成了解压双击。这对整个赛道的影响,可能比某一次跑分更长久。

相关文章