OpenAI 把旗舰图像模型一分为二。这件事比任何基准测试都更能说明问题。

9 月 8 日,OpenAI 发布了 ChatGPT Images 2.5,而在公告里埋着一个比任何速度数字都更重要的决定:这家公司把原本单一的旗舰图像模型拆成了两个。
对开发者来说,API 现在提供 GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst。Flare 是快的那一个。OpenAI 称它比 GPT-Image 2 快两到四倍,早期合作伙伴 Manus 用自己的测试佐证了这一点,还提到它的透明背景输出更好。Sunburst 则是慢而精确的那一个,专为必须让其他一切保持原样的编辑任务而构建。两者价格相同:每百万输入 token 8 美元,每百万输出 token 30 美元。
定价细节才是最有趣的部分。当两个模型做不同的工作却价格完全一致时,厂商卖的并不是更多算力。它是在让你自己决定真正需要什么——这和“这是我们的最强模型,什么都用它”是截然不同的产品对话。

究竟改变了什么
在消费者这一侧,最醒目的数字是延迟。OpenAI 声称生成延迟相比 Images 2.0 最多下降 50%,同时锐度、自然光照和纹理细节都有提升。这种组合并不常见。通常你只能用其中一个换另一个。
编辑能力才是 Sunburst 名字的由来。它的卖点在于模型懂得什么不该改。OpenAI 点名的合作伙伴之一 Higgsfield AI 就是这么表述的,而这确实是对此次更新核心的恰当概括。早期的图像编辑器擅长执行指令,却拙于让画面其余部分保持不变。你只是想让夹克换个颜色,结果却得到一张脸部微妙不同、地平线移位、光源偏移的图。Sunburst 正是直指这一失败模式,在多轮编辑中让面部、产品和品牌元素保持稳定。
ChatGPT 应用里有三款新工具。Sketch 让你输入 @Sketch 并在对话中画出示意布局或轮廓,把你的涂鸦当作最终渲染的参考。Templates 为海报、周边商品等常见格式提供起点。Comments 让你把备注钉在图像的某个位置上,从而无需重写提示词就能说“删掉这个”或“把这个改成蓝色”。
OpenAI 还强调了一项安全统计数据。Sunburst 生成不安全内容的比率为 1.09%,Flare 为 1.41%,而此前模型为 1.64%。方向是好的,不过这些数据都是自报的,更像一个话题点,而非保证。
Adobe 的动作
同一天,Adobe 宣布已将 GPT-Image-2.5 集成到 Firefly 中。这不是一条无足轻重的合作消息。Adobe 花了两年时间把 Firefly 重新定位为编排层——一个让 Google、Runway 等公司的模型接入专业工作流的地方。在第一天就接入 OpenAI 最新的图像模型,正是这一战略按设计运行的结果。
Adobe 的 Matt Chotin 将其描述为让创作者从创意到交付都拥有灵活性。实际意味着,竞争已经从单纯的模型质量上移开了。如今双方互为分发渠道。超过 70 款 Adobe 工具嵌入在 ChatGPT 中,设计师可以在 OpenAI 的界面内调用 Photoshop、Premiere 或 Firefly 的功能。每家公司都成为对方的渠道,谁也无法独自占据创意任务的起点。
发布背后的数字
这次发布读起来像一次产品战略动作,而不是纯粹的能力跃升,是有原因的。2026 年 4 月 GPT Image 2 发布时,它以 1178 的 Elo 位居 Artificial Analysis 文生图排行榜榜首,并在编辑榜上排名第二。Images 2.5 是在这个基础上的增量,而截至发布后数日,两个新的 API 模型在 Artificial Analysis 排行榜上都还没有条目,也没有第三方发布可复现的基准测试。速度和质量上的提升全部来自自报,或来自被点名的合作伙伴 Adobe、Manus 和 Higgsfield。这并不意味着它们是错的,但意味着任何关于这次拆分是否奏效的判断,都应等待独立测试。
不是自报的是价格。两个模型都是每百万图像输入 token 八美元、每百万输出 token 三十美元,彼此完全相同。输出分辨率范围从 1024×1024 到 3840×2160,总像素数上限在 655,360 到 8,294,400 之间。对开发者来说,为某个功能做决定如今归结为一个问题:这个负载需要跑得快,还是需要第四次编辑后主体依然纹丝不动?能回答这个问题的模型获得调用,而两者价格相同这一点,也消除了选错的价格借口。
为什么分叉才是真正的故事
图像生成已经不再是实验。OpenAI 称该平台每周生成超过 30 亿张图像,这个数字就是线索。在这样的量级下,有意思的问题不再是“它能不能画出漂亮的图”,而是“它被要求做的是哪一类工作”。
需要推出数百个社交变体的营销团队关心吞吐量。为一场活动敲定唯一主视觉的品牌团队关心第四次编辑后 logo 会不会走形。这两类工作方向相反,而单一模型会迫使其中一方妥协。把产品线拆开,等于承认客户群本身也已经分裂。
竞争对手的回应已经因此被塑造。Midjourney 仍以某种特定的电影质感取胜,但它没有原生对话交互,学习曲线也更陡。Adobe Firefly 倚重商业授权与软件生态,但其独立的对话式创作能力薄弱。Google 的应用内图像模型在某些任务上很强,但在品牌级控制上不够稳定。没有人能通吃全局。
对任何选工具的人来说,实用的结论是:别再寻找唯一最好的图像模型,而要开始把模型与任务相匹配。大批量迭代与精细收尾如今是两笔分开的采购,即便它们来自同一家公司、价格相同。基准排名会继续变化,而且会越来越不重要。重要的是围绕模型的工作流能否挺过下一次发布,因为它底下的模型几个月后又会再被替换。
最后一点值得好好想想。Images 2.5 距 Images 2 大约五个月,而两者都取代了去年还处于最前沿的版本。能建立一套持久流程的团队——拥有自己的提示词、风格参考和审核步骤——才能消化这种更替。把单一模型硬编码进流水线的团队,则要继承它的每一次停服和涨价。从这个角度看,这次双模型发布是房间里声音最大的厂商给出的一个有益提醒:连领先者都在告诉你,别依赖单一模型。