Google 将 Nano Banana 2.1 的输出价格减半,并修复了其最薄弱的功能

--- 标题:Google 将 Nano Banana 2.1 的输出价格减半,并修复了其最薄弱的功能 元标题:Nano Banana 2.1 价格减半并重塑编辑功能 元描述:Google 的 Nano Banana 2.1 面向视觉设计、蒙版编辑和主体一致性,在 1K 和 4K 分辨率下输出价格大约减半。 ---
Google 于 10 月 6 日发布了 Nano Banana 2.1,而最重要的细节不在功能列表中:价格。
按照 Gemini API 标准定价,每张 1K 图像输出成本从 $0.067 降至 $0.0336,每张 4K 图像从 $0.151 降至 $0.0756。两次降价都接近一半,这改变了任何批量生成图像工作流的经济性,并且新模型基于 Gemini 3.6 Flash 架构构建。
从表面上看,该公司改进了三个方面:视觉设计、蒙版编辑和主体一致性。
视觉设计与文本渲染
Google 的演示针对图像生成中最薄弱的环节:正确呈现文本和布局。示例展示了带有重叠字形和坐标字符串的瑞士粗野主义字体设计、一张 1970 年代公路旅行海报(其中人物遮挡了后面的文字)、一个设计工作室主页,以及一张模仿现有产品照片的产品海报。
该声明不止于干净地渲染这些内容:模型遵循具体的文本和布局指令,而不是生成看起来合理的近似结果。对排版的提示词遵循一直是一个持续存在的差距,而设计工作正是失败最明显的地方,因为一个错位的字符就会毁掉整个作品。
该模型还支持不寻常的宽高比,包括 1:4、4:1、1:8 和 8:1,并且 Google 表示 2K 和 4K 输出中的拼接伪影已得到修复。
蒙版编辑以及为什么它比听起来更重要
蒙版编辑意味着在图像中标记一个区域,让模型仅更改该区域。Google 的演示使用了一个带有水滴的蒲公英种子头,用一条手绘线围绕种子,并通过提示词要求将圈出的对象提取到一个完全不同的环境中。
这是对生产工作最重要的功能,尽管它比图像质量受到的关注更少。当你想要更改一个元素时,重新生成整张图像的模型与仅更改标记区域的模型之间的区别,就是你用于草稿的工具与用于修订的工具之间的区别。迭代是大多数真正创意时间所在之处。
这里的技术门槛比看起来更高。保持图像其余部分不变意味着模型必须保留特定的像素邻域,同时生成在边界处自然融合的新内容。Black Forest Labs 本月发布了类似能力,即 FLUX 3 Image,其中部分编辑会让 67.8% 到 89.7% 的像素保持位级相同。这个范围是诚实的报告方式,因为该比例取决于编辑区域的大小。
主体一致性
Google 表示,该模型最多可在 14 张参考图像中保持角色一致性,覆盖最多四个角色。对于通用图像模型来说,这个数量很高,并指向同一人物或产品必须出现在一组图像中的用途:漫画分镜、营销活动变体、产品目录。
跨参考图像的一致性是一个难题,因为模型必须将身份与风格、姿势和光照分开保持。在 14 张参考图像下做到这一点,表明这个数字是真实能力而非营销上限,尽管该公司尚未发布对该上限的独立验证。

实际价值取决于上限实际在哪里。持续保持四个角色一致性,足以用于有多个模特的产品目录,或有一个小型常驻演员阵容的营销活动。但对于拥有庞大角色阵容的漫画来说还不够,那需要多次调用或微调。独立测试将是解决这个问题的关键。
同一发布窗口还有一个相关能力值得注意。阿里巴巴的 Qwen-Image-2.1-Pro 自 10 月 2 日起在阿里云上线,强调透明 RGBA 图层生成和从照片中提取主体,使用 7B 视觉生成组件和 32 层单流 DiT 设计。这两个模型从不同方向汇聚于同一个问题,这是一个合理的迹象,表明一致性和编辑局部性现在已成为买家所关心的内容。
基准测试差距是诚实的警告
第三方对该发布的报道包含了一个 Google 自己的表述中省略的重要说明。报道称该模型在某些图像生成基准测试中优于之前的 Pro 模型,同时也指出前代模型在测试中得分很高,并且据报道 Pro 模型在实际使用中生成的图像更好。
基准测试表现与实际输出之间的差距是图像模型评估中反复出现的特征。一个模型可以在结构化测试中得分很高,但在用户实际尝试的任务中仍然令人失望。更低的价格加剧了这个问题:一个在实际中表现不佳的便宜模型,并不是定价所暗示的价值主张。
解决方案将来自独立测试。如果用户将 Nano Banana 2.1 与 Pro 模型进行比较时,始终偏向较新的模型,那么基准测试就获得了可信度。如果 Pro 模型在实际输出中继续胜出,那么分数就成为一个较弱的信号。
还有一个值得注意的实际问题。对此次发布的报道指出了一个差异:Google 的官方文档声明已全面可用,而一些第三方聚合网站将模型列为即将登陆某些平台。早期报告还表明,尽管界面已更新,但在某些情况下请求可能仍会路由到以前的模型版本。任何集成该模型的人都应验证实际响应的是哪个版本。
模型退役与维护税
对于任何在生产环境中使用当前模型的人来说,有一个细节很重要:Nano Banana 2 的 API 版本将于 10 月 29 日退役。
这是一个很短的时间窗口。在流水线中使用 Nano Banana 2 的团队大约有三周时间来测试 2.1、在自有语料库上比较输出质量并迁移。鉴于新模型更便宜,迁移可能值得做,但时间安排比大多数团队会选择得更紧。
这种退役节奏正变得司空见惯,这本身就是一些团队倾向于开放权重图像模型的原因。当权重属于你时,模型不会按照供应商的时间表消失。权衡之处在于,你要负责部署、更新和质量回退,这是供应商托管模型为你吸收的真实成本。
值得关注的点
在独立测试下,基准测试与实际应用之间的差距是否会缩小。这是核心问题,答案将来自用户在自己的工作上进行比较,而不是来自新闻材料。
14 张参考图像的一致性在实践中是否成立。如果成立,该模型将开启以前需要微调的使用场景:系列中一致的角色、产品套装、营销活动变体。如果它对四个角色成立但对十四个不成立,那么实际上限就低于规格所暗示的水平。
降价是持久的还是引入期的。大约减半是激进的,如果竞争对手跟进,规模化图像生成将全面大幅便宜。如果这是一个促销窗口,围绕它建立成本预测的团队将需要重新审视。
Nano Banana 2.1 是一次扎实的迭代,解决了正确的弱点,并将自身定价为可供使用而非仅作试用。降价才是真正的故事,而且很可能成为其他供应商回应的部分。
相关文章
Google Flow 与 Adobe Firefly 将 AI 视频移出聊天框
基础模型质量已经足够趋同,差异化因素已经转移到模型周围的东西。
Vida 希望按结果而非使用量为 AI 智能体计费
按使用量计费会让供应商的收入与智能体耗时更长保持一致。按结果定价则颠覆了这一点。
Decagon 的 Voice 3 与 PACT 让客户支持为另一端的智能体做好准备
支持系统花了几十年对人行为建模。现在,一部分传入请求是代表人们行事的机器。
Creatify 为广告对 MiniMax H3 进行后训练,将成本降至每秒四美分
广告主不需要一个能渲染纪录片的模型。它需要的是产品看起来正确、人物不会说到一半就变形的模型。