谷歌将图像价格减半,却把发送参考图的成本提高到三倍

谷歌于 10 月 6 日发布了 Nano Banana 2.1。最引人注目的消息是降价:1K 图像从 6.70 美分降至 3.36 美分,4K 图像从 15.10 美分降至 7.56 美分。批量定价在此基础上再减半,使一次 1K 生成降至 1.68 美分。对于任何大规模运行图像生成的人来说,这种变化会改变什么值得构建。
较少受到关注的是输入侧。谷歌将每百万输出 token 的价格减半,从 60 美元降至 30 美元,同时将每百万输入 token 的价格从 0.50 美元提高到 1.50 美元。文本和思考输出从每百万 3 美元涨到 7.50 美元。不过,按图像计算的数字只是客户实际支付费用的一小部分。
为什么输入侧的变化很重要
一次图像请求所携带的远不止一个输出。它包含提示词,而且越来越多地包含参考图。Nano Banana 2.1 一次请求最多接受 14 张参考图,每张输入图像大约消耗 1,120 个 token。一个融合十几张参考图、以保持产品在不同变体中一致的工作流,每产生一个输出都要发送大量输入。
输入价格提高到三倍后,重度使用参考图的工作流所获得的节省可能远小于单张图像价格所暗示的幅度。从这次发布中受益最大的,是那些以短提示词大规模进行文生图的团队。而需要先算清自己账目的,是那些进行多参考图编辑的团队,因为在这种情况下,输入侧才是主导成本。
谷歌自己的说明并没有掩盖这一点。定价页面列出每张 4K 图像消耗 3,780 个 token,算下来更接近 11 美分,而不是报道中流传的 7.56 美分。在假设账单会减半之前,请先根据你自己的工作量算一遍。
实用的建模方法是:统计每月各分辨率的图像数量,乘以新的单张图像输出价格,然后加上输入成本,即每次请求的平均参考图数量 × 每张图像的 token 数 × 新的输入价格。对于使用短提示词的文生图工作负载,节省幅度会接近标题宣传的水平。对于每次调用都发送十几张参考图的重编辑工作负载,输入侧可能吞掉大部分节省。这次发布奖励一种工作方式,同时向另一种工作方式征税,而定价页面是唯一能让这种区别显现的地方。
真正改进的是什么
能力方面的故事比价格方面的故事更具体。该模型在融合最多 14 张参考图的同时,能保持四个角色和十个物体一致,这对产品目录、故事板和品牌活动来说正是关键功能。跨编辑轮次的主体一致性一直是图像工具中更令人沮丧的失败点之一,而这次更新直接针对这一点。
图像中的文字也有所改进。谷歌自己的信息图事实性得分从 0.179 跃升至 0.521,公司表示已修复宽高比下出现的拼接伪影。输出支持 1K、2K 和 4K,宽高比最高可达 8:1。
可通过 Google 网页搜索和图像搜索进行接地(Grounding),思考级别可配置为最低、中等和最高。该模型还带有用于来源追踪的 C2PA 内容凭证,随着平台和监管机构推动生成图像的来源溯源,这一点变得更加重要。
在把智能体迁移过来之前,有一些限制值得了解。不支持音频生成、缓存、代码执行、文件搜索、函数调用、Maps 接地、Live API、结构化输出和 URL 上下文。如果你的流水线在图像步骤周围依赖函数调用或结构化输出,那么这部分逻辑必须放在单独的文本模型调用中。Batch API 受支持。
发布首日起,分发范围就非常广泛:Gemini 应用、搜索中的 AI Mode、Google AI Studio、Google Flow、Stitch、Google Ads 和企业平台都会在发布时获得该模型。这很重要,因为它意味着改进会同时触达消费级产品和开发者 API。开发者可以基于一个数百万人已通过不同界面使用的模型来发布功能,从而缩短产品决策与用户反应之间的反馈循环。
有一项限制延续自行业其他厂商。企业平台层级不提供生成真实人物的功能。这会对某些用例产生影响,也提醒我们:能力问题和许可问题是两回事,即使对大型平台供应商也是如此。
迁移截止日期比看起来更宽松
一些文章称,10 月 29 日是上一代模型 gemini-3.1-flash-image 停止响应之日。但谷歌自己的变更日志称其已弃用,并未公布关闭日期。任何围绕 10 月 29 日安排迁移的人,都是在依据一个供应商并未发布的日期。
但这并不意味着迁移是可选项。已弃用的模型会继续工作,直到供应商另行通知,而继续使用它的成本相对于替代模型已经翻倍。旧模型现在相当于对相同输出长期加收 50% 的附加费。
更大的图景是一场价格战
谷歌、OpenAI 和中国的开放权重实验室都在争夺那些将图像功能构建到应用中的开发者。OpenAI 将于 10 月 23 日从 API 中移除 gpt-image-1,并引导用户使用 GPT Image 2.5 Sunburst 或 Flare。在独立的 Arena 文生图排行榜上,Nano Banana 2.1 排名第五,落后于 OpenAI 模型的多个版本。
这个排名是解读此次降价时必须参照的背景。在独立排行榜上,谷歌落后于质量领先者。它在分发方面领先:模型同一天登陆多个消费级界面和开发者 API,并且它选择在价格上竞争,而不是在偏好投票中争夺头名。对于一家已经拥有用户的公司来说,这是一个连贯的战略。这同时也是一个信号:对于中间市场而言,足够好且便宜胜过最好但昂贵。
与此同时,开放权重选项不断从下方缩小差距。像 Qwen-Image 和图层分解类发布这样的模型根本不存在按图像计费,这设定了一个任何托管供应商都无法突破的价格下限。按图像的价格战正在免费开放权重与高端层级之间的空间中展开,而这个空间每个季度都在变窄。
更便宜的输出和更好的文字渲染,正把 AI 图像进一步推入过去每次修改都需要设计师的工作:本地化横幅、菜单卡片、简单信息图。这就是降价所指向的方向。每个团队都必须自己回答的问题是:他们自身流水线的输入侧是否允许他们收获这一好处。
更广泛的影响在于,什么才算合理的产品功能。当一张生成图像只花三美分并在几秒内返回时,一个每次会话为每位用户生成一张图像的功能,其可负担性绝非去年可比。个性化插图、按地点定制的营销素材和生成的占位图,都从昂贵的想法变成了实现细节。这种级别的价格变化不只是降低现有工作的成本。它让新类别的工作成为可能,因为曾经排除它们的算术已不再适用。
谷歌在降低输出价格的同时将输入价格提高到三倍,是在押注哪种工作方式将占主导。它假设团队会做更多生成、更少重度依赖参考图的编辑,并据此定价。做法相反的团队应该在迁移前先测试,而不是想当然地认为标题所宣传的优惠适用于自己。