← 返回博客
News9 分钟

Qwen-Image 2.1 对比 Nano Banana 2.0:7B 开源模型已逼近谷歌

发布于 2026年9月27日
Qwen-Image 2.1 对比 Nano Banana 2.0:7B 开源模型已逼近谷歌

阿里巴巴于 9 月 20 日发布了 Qwen-Image 2.1,自那以后,基准测试的讨论就彻底变了样。一个拥有 70 亿参数、权重可下载的图像生成器,如今在阿里自家榜单上领先于谷歌的 Nano Banana 2.0,在独立排行榜上也足够接近,以至于人们都要多看两眼。发布帖在 Hacker News 上一天内收获超过 700 分和近 200 条评论,这足以说明这个领域积压了多少关注。

数字,以及它们为何重要

在阿里的 Qwen-Image-Bench 上,新模型得分 60.28,而 Nano Banana 2.0 为 59.82。这是半个百分点的优势,与其说它是一项技术声明,不如说是一个信号:阿里现在把谷歌列为它想要超越的基准。唯一参数更少的开放权重模型——美团的 6B LongCat-Image——以约 54 分落后。作为对比,OpenAI 的 GPT Image 2.5 Sunburst 以 67 分位居阿里榜单榜首,Muse Image 为 62.34 分,二者均为闭源。

AI Arena 采用盲测的人类对人类的投票,给出的结果则更为保守。Nano Banana 2.0 以 1260 Elo 对 Qwen-Image 2.1 的 1228,GPT Image Sunburst 以 1423 居首,Muse 为 1276。这个开源模型目前还没有赢下这场对决。不过,它在 Image Edit Arena 和 Text-to-Image Arena 中均位列所有开放权重模型第一,而这正是很多人真正关心的类别。Qwen 自己的账号将其称为“排名第一的开源模型”,就这一较窄的说法而言,独立数据支持他们。

它真正出彩的地方

透明度是大家反复提到的功能。Qwen-Image 2.1 原生输出 RGBA 图像,因此你可以通过提示词要求透明背景,并直接得到干净抠图,而无需再用去背工具处理一遍。对于贴纸卖家、按需印刷商店,以及任何要把素材合成到更大设计中的人来说,这省掉了一个实实在在的步骤。该模型还能在不展平透明图层的情况下对其进行编辑,而过去这需要单独的分层模型。

另一个头条功能是支持最多十张参考图进行编辑。给它一张人物照片和几张服装图,它就能合成出这个人穿着那些衣服的效果。把六张肖像合并成一张合影。将十张家具图拼进一个房间。你可以用三种方式指定要编辑的区域:画彩色圆圈、在区域上涂抹,或传入原图外加一张单独的遮罩。当你不能覆盖原始像素时,就该用遮罩这种方式。

然后是在普通硬件上的速度。早期用户报告称,在 RTX 4090 上生成一张 100 万像素图像约需五秒,在 50 系显卡上约 25 秒,而在配备 64GB 系统内存的 RTX 3060 上生成一张 2K 图像大约需要 50 秒。一位 Hacker News 评论者说,他们在 4090 上转换一张 1MP 图像大约用了五秒。r/StableDiffusion 上的一位用户报告称,在 5070 或 5080 上生成 1MP 图像约需 25 秒,同时指出编辑是最慢的操作,而堆叠参考图会明显拉高延迟。这不算云端级速度,但已经快到不能再拿它当借口。

秒表旁边是正在渲染的图像缩略图,象征本地生成速度

许可上的坑

接下来是让社区产生分歧的部分。早期的 Qwen 图像模型以 Apache 2.0 发布,允许你微调并销售你构建的任何东西。Qwen-Image 2.1 则以仅限研究的许可证发布,禁止未经与阿里另行达成协议就将权重用于商业用途。HN 帖子因这种模糊性而炸开了锅,阿里的账号出面澄清:权重受到限制,但你用它们生成的图像归你所有,包括用于商业用途。

这一区别听起来不大,但很重要。如果你只是想为客户、产品或是自己的项目生成图像,那没问题,阿里已确认输出结果不附带任何许可义务。如果你想要微调并重新分发模型,那你就得去谈判了。大多数人属于第一类,这就是为什么反对声很大,但最终有限。

更广泛的效率论点

这里有趣的不是原始分数,而是效率。Qwen-Image 2.1 与那些体量大它许多倍且完全闭源的模型只差几个 Elo 分。该生成器有 32 层 Single-Stream DiT,通过 Qwen3-VL 8B 文本编码器读取提示词,并原生渲染高达 2752×2752 像素的 2K 图像。在效率方面,它证明了架构蒸馏和更干净的训练数据可以弥合大多数人以为必须靠规模才能填补的大部分差距。

这给订阅模式带来了营销幻灯片永远无法带来的压力。如果消费级 GPU 能在几秒内渲染出工作室级输出,那么“我们生成最好的图像”就不再是每月付费的充分理由。谷歌和 OpenAI 仍然在最难的语义和空间推理任务上领先,盲测评估持续赋予它们优势。Qwen-Image 2.1 并没有弥合这一差距。它只是让这一差距在很大一部分日常工作中显得可有可无,而这比任何单一基准分数都更具颠覆性。

社区的实际使用评价

基准测试的争论只能说明一部分问题。更接地气的信号是人们自己运行后实际报告的内容,而本周的报告异常一致。在 r/StableDiffusion 上,一位用户发布了 192 张生成图像的并排对比,将 Qwen-Image 2.1 与 Krea 2 进行比较,并按文本生成、人体解剖等类别排序。结论是,这个开源模型在结构上表现良好,但为了在 5090 上容纳去噪器,不得不绕过量化后的文本编码器。

另一位用户在配备 32GB 内存的 M1 Max MacBook Pro 上运行了该模型,使用原生 Apple Silicon 运行时,在大约 24 秒内生成了 512×512 图像。按桌面标准这很慢,但它证明该模型并未锁定在 Nvidia 硬件上,这对很大一部分普通用户很重要。第三位用户围绕它搭建了一个 Fooocus 风格的本地工作室,加入了遮罩、标注、外绘和 OpenPose 姿势参考,并请求坦诚批评而非赞美。

编辑能力引发的热情最高。有帖子描述了在没有任何 LoRA 的情况下生成角色设计图,利用该模型的参考图编辑功能,让角色在不同姿势和服装下保持一致。过去这需要一堆微调模型和大量手动清理。而单个 7B 模型开箱即用就能做到,这是大多数基准图表没有捕捉到的低调头条。

接下来值得关注什么

早期结果仍在沉淀。Qwen 构建了自己的基准,但没有发布提示词或分类得分,因此内部数字更像是一种声明而非测量。独立的 AI Arena 数字更可信,也没有那么好看。目前诚实的解读是:Qwen-Image 2.1 是现有最好的开放权重图像模型,与闭源领先者仍有明显差距,也是小规模开源模型可以具备竞争力的真实验证。未来几周的独立测试将告诉我们,它对 Nano Banana 2.0 的那半个百分点优势是持久的,还是仅仅是基准中一个讨喜的切片。

相关文章