Google 的 Nano Banana 2.1 是一次功能下放,而非旗舰发布

Google 于 10 月 7 日发布了 Nano Banana 2.1,这是其 AI 图像生成与编辑模型的升级版。该公司称其是一次全面改进,并特别指出了三个方面:视觉设计、基于蒙版的编辑,以及主体一致性。
结合其所处的市场定位来看,更准确的说法是,Google 正在将 Pro 级能力下放到更便宜的模型中。
实际改变了什么
据 Google 称,Nano Banana 2.1 能生成构图更好的视觉素材。这是三项说法中最模糊、也最难验证的一项,因为“更好的构图”并不是任何人会公开发布的指标。
基于蒙版的编辑则更具体。用户可以选择并修改现有图像的特定区域,而无需重新生成整张图。两年来,正是这项功能将严肃的编辑模型与生成演示区分开来;把它放进中端模型而非 Pro 层级,才是本次发布的实质。
主体一致性是第三项,对任何批量产出的人来说,这一项最为重要。在编辑图像或批量生成一组相关图像时,模型能更好地保留主体的外观和特征。对于要在十张图像中生成一致角色的 Gemini 用户来说,这是可用的素材库与一堆差之毫厘的失败品之间的区别。
该模型正逐步在 Gemini 应用、Google 搜索中的 AI 模式、Google AI Studio、Google Flow、Stitch、Google Ads 和 Gemini 企业平台推出。对开发者而言,可通过模型 ID gemini-nano-banana-2.1 使用,接受文本、图像、音频和视频输入,并以 1K、2K 或 4K 输出。
这份输入清单值得停下来想一想。一个接受音频和视频输入并返回图像的模型,属于与附带营销段落的文生图生成器不同的类别。它是一个多模态系统,其输出恰好是一张静态帧。
层级定位
今年早些时候,Google 发布了 Nano Banana 2,也称为 Gemini 3.1 Flash Image。它将 Flash 血统的速度与堪比 Nano Banana Pro 的输出质量结合在一起,Google 还将多项 Pro 功能下放其中:现实世界知识、改进的文本渲染,以及更好的角色与物体一致性。
Nano Banana 2.1 延续了这一迁移。这种模式一致到足以被称为一种战略:Google 将 Flash 层级用作走量产品,不断从 Pro 下放能力,并让 Pro 层级定义上限。
Google 自己的材料所支持的竞争框架是:OpenAI 的 ChatGPT Images 2.5 仍是全球领先的图像生成与编辑模型,尤其是在迭代式工作方面。其优势具体且技术性:当用户在多轮中不断细化图像时,它能更好地保留先前的编辑、不碰未修改区域,并在迭代累积时保持图像质量稳定。
这又是漂移问题,也是当前图像编辑领域的核心工程挑战。所有人都在攻克它。Ideogram 4.5 增加了 Precise Edit 和 Generate + Edit 模式。Black Forest Labs 发布了具有区域保持能力的编辑功能,并公布了像素一致性数据。Google 在 2.1 中的答案是中端层级的主体一致性。
微软的 MAI-Image-2.6 于 8 月发布,在同一讨论中紧随 OpenAI 之后。这一阵容已稳定为某种清晰可辨的格局:OpenAI 在迭代式编辑上领先,Google 在分发和价格上领先,而以 Qwen-Image 2.1 为首的开放权重阵营,在质量上已接近到足以构成威胁,成本却只有其零头。
值得精确界定“漂移”究竟是什么,因为这个词涵盖了几种不同的失效。有像素漂移,即未修改区域在迭代之间发生轻微偏移。有身份漂移,即人脸或产品在一连串编辑中发生变化。有风格漂移,即随着模型每一轮重新生成更多画面,渲染美学逐渐迁移为一种泛化外观。还有质量漂移,即图像像复印件的复印件那样累积噪点和模糊。
每一种都有不同的修复方式。像素保持是蒙版问题。身份保持是条件控制问题。风格和质量保持,在很大程度上取决于模型被允许丢弃多少原始内容。一个在其中三项上表现出色的模型,仍可能在五轮编辑链中失败,这就是为什么厂商关于一致性的说法需要明确是哪一种。
Google 的 2.1 明确处理了身份一致性和蒙版编辑,却没有具体说明长链条中的风格或质量问题。这种沉默很能说明问题。
为什么中端发布才是重要的那一个
旗舰发布告诉你一个实验室能做到什么。中端发布告诉你,它认为大多数用户实际需要什么。
Google 将蒙版编辑和主体一致性放进横跨搜索、广告和消费级 Gemini 应用的模型中,是在声明这些是基线预期,而非高级功能。仅搜索 AI 模式一项,就将图像生成呈现在以数十亿次会话计的受众面前。广告则将其呈现在广告主面前,他们会批量制作创意素材,并立刻知道它是否有效。
这种分发优势不是模型能力,却可能比一项模型能力更有价值。一个比领先者差 5% 的模型,如果出现在用户已经在用的搜索框里,就会生成多得多的图像。OpenAI 在迭代式编辑质量上的领先是真实存在的,也是一种只对已经决定使用图像工具的用户才重要的领先。
对开发者而言,实际的解读在于默认选项。如果一款产品需要图像编辑,并且已经使用 Gemini,那么 2.1 升级几乎免费,还消除了集成第二家供应商的理由。如果一款产品需要可用的最强迭代式编辑,那么评估问题只会变得更难,因为 Flash 层级与领先者之间的差距,已经在多轮工作最关键的那个维度上缩小了。
你自己该测试什么
有三件事值得检查,而不是想当然。
第一,边缘处的蒙版精度。关于区域编辑的宽泛说法,往往在大区域中间站得住脚,却会在边界处退化,因为模型要判断每个像素属于边缘的哪一侧。要在精细结构上测试:头发、玻璃、树叶、细带。
第二,超过两轮后的一致性。主体一致性说法通常只在短编辑链上得到验证。漂移问题会累积,因此有用的测试是连续五到六次编辑,检查主体能否存活。
第三,4K 输出是原生还是放大而来。Google 将 1K、2K 和 4K 列为输出选项,却没有说明生成分辨率,而差异会体现在精细纹理上,而不是整体锐度上。
战略结论则没有那么模棱两可。Google 并不是想通过这次发布去追逐图像模型排行榜。目标是让中端足够好,以至于排行榜不再是任何人选择其他工具的理由。这能否奏效,取决于市场上有多少工作属于迭代式精确编辑,而不是其他一切;而诚实的答案是,2026 年的大多数图像生成仍属于第二类。