← 返回博客
Ai5 分钟

通义万相 Qwen-Image 2.1 开源了:7B 参数凭什么敢叫板谷歌和 OpenAI

发布于 2026年9月27日
通义万相 Qwen-Image 2.1 开源了:7B 参数凭什么敢叫板谷歌和 OpenAI

9 月 20 日,阿里通义团队悄悄放出了一颗"小核弹"——Qwen-Image 2.1。一个只有 70 亿参数的文生图模型,却在自家评测里压过了谷歌的 Nano Banana 2.0,逼着 OpenAI 和 Meta 的闭源模型回头看。消息一出,B 站、知乎、还有海外的 Hacker News 和 Reddit 全都炸了。

为什么说它"小而猛"

生图模型这几年越做越大,闭源的动辄几十上百亿参数,跑起来要一张专业显卡。Qwen-Image 2.1 反着来,把生成部分压缩到 7B,结果在自己的 Qwen-Image-Bench 榜单上拿了 60.28 分。这个分数放在全榜是什么水平?谷歌 Nano Banana 2.0 是 59.82 分,被它压了半个身位;开源阵营里排第二的是美团的长猫 LongCat-Image(6B),分数只有 54 出头。也就是说,它是目前所有能下载权重模型里最能打的一个。

独立第三方评测 AI Arena 的结论要更冷静一点。那边 Nano Banana 2.0 拿了 1260 分,Qwen-Image 2.1 是 1228 分,闭源的 GPT Image 2.5 Sunburst 顶到 1423 分。差距还在,但已经小到"咬着后脚跟"的程度。对一个开源模型来说,这个位置本身就是胜利。

三个真正好用的能力

第一个是原生透明背景。以前做贴纸、做打印定制、做设计稿,AI 生成完还得再抠一次图。Qwen-Image 2.1 直接输出带 alpha 通道的 RGBA 图,一个模型同时干生成和编辑的活,透明图层还能不合并直接编辑。对做文创和周边的人,这一条省了太多事。

第二个是十张参考图同时编辑。把一个人物照片丢进去,再喂几张衣服的图,它能把"这个人穿着这几件衣服"合成出来。还能合并六张肖像成一张合影,或者把十张家具图拼进同一个房间。B 站上已经有 UP 主演示"人物一致性 + 换装",评论区一片"这也太自然了"。

第三个是轻量到能上家用卡。RTX 4090 上 1 兆像素的图大概 5 秒,50 系显卡 25 秒左右,甚至有人用 RTX 3060 加 64G 内存跑 2K 图,50 秒一张。阿里官方最低配置喊到了 6G 显存,B 站上的"一键整合包"教程已经开始排队出现了。

桌面电脑正在生成一张图片,屏幕上的画面由粒子逐渐汇聚成形

最扎眼的不是性能,是授权

真正让社区吵起来的是许可证。之前的 Qwen-Image 系列是 Apache 2.0,随便商用。这一次换成了"仅限研究用途"的 Qwen Research License,商用要单独找阿里谈。Reddit 和 HN 上吵成一片,有人觉得这是开倒车,也有人觉得"权重给你下,图你随便用"已经够意思。

阿里官方很快出来澄清了一句话:模型权重不能商用二次分发,但你用它生成的图片,版权是你的,商用没问题。这个区分点很关键——对绝大多数只想做图的人来说,影响其实没那么大。

这件事更大的意义

Qwen-Image 2.1 证明了一件事:靠架构蒸馏和更干净的训练数据,小模型能追平大模型的生图水平。B 站 UP 主"爱分享的剑二十七"那期视频标题说得很直接——"阿里开源的 AI 绘画模型,效果吊打一众付费工具"。这话有点夸张,但方向没错。

当一张图在家用显卡上几秒就能出来,还要不要每个月付订阅费,就成了每个创作者要重新算的一笔账。闭源厂商接下来得靠速度、靠工作流集成、靠多模态协作来证明自己值这个钱,而不能再只靠"我生得好看"。

对普通人来说,好消息是:开源生图的天花板,这个月又抬高了一截。

相关文章