ChatGPT Images 2.5 更快、更清晰,终于支持草图输入

OpenAI 于 2026 年 9 月 8 日发布了 ChatGPT Images 2.5,所有人最先抓住的头号数字是速度:延迟比上一版本最多降低 50%。这一点很重要,但它反而掩盖了真正的变化。更有意思的是,该模型现在可以让你画一张粗略草图作为参考交给它,而且编辑在多轮修改中能够保持稳定,不再跑偏。
如果你上次使用这些工具还是在春天,差异会立刻显现。你首先注意到的是等待时间。过去需要六秒的生成现在大约三秒就能完成。你注意到的第二点是,当你要求进行小幅修改时,画面的其余部分会保持不动。
真正变好的地方
官方列表涵盖三个方面:速度、细节和编辑稳定性。
速度是最容易验证的一项。OpenAI 表示延迟最多降低一半,并且该模型可在桌面端、移动端和网页端使用,因此改进覆盖所有端,而不仅限于 API。
细节是模型最有提升空间的地方。早期版本在构图上很强,但可能抹糊细腻纹理、丢失材质质感。2.5 在光照和材质渲染上做了推进,因此皮肤、织物和金属看起来更像它们本来的样子,而不是光滑的近似效果。
编辑稳定性是真正使用这些工具的人最关心的部分。长期以来,人们对图像模型最大的抱怨就是多轮编辑会跑偏。你改了衬衫颜色,脸却突然变了。2.5 的设计目标是在你进行针对性修改时,保持主体、产品形状、构图和整体风格不变。仅这一项改进节省的实际工作时间,就比任何延迟数字都更有意义。

草图功能是被低估的亮点
最大的产品新增功能是草图(Sketch)。你可以直接在 ChatGPT 中画一个粗略布局,模型会把它变成一张成品图像。你不需要会画画。几个方框、一个火柴人、一条地平线和一句颜色说明,就足以传达用三段提示词才能描述清楚的意图。
这弥补了自第一代文生图工具以来一直存在的短板。提示词不擅长空间思维。“把产品放在左边,标题放在右上角,人物放在下三分之一处”——要用很多文字才能描述清楚的事,一张草图十秒就能传达。草图给模型提供了更接近故事板的东西,而故事板才是视觉工作真正的沟通方式。
两种 API 版本,对应两种不同任务
在 API 方面,OpenAI 将此次发布拆分为两个角色明确的版本。
GPT-Image-2.5 Flare 是通用模型。它具备 2.5 系列的速度、质量和编辑能力,面向社交媒体素材、产品原型以及需要快速大量出图的大批量生成场景。
GPT-Image-2.5 Sunburst 是高精度模型。它专为广告静帧和商业产品图而打造,在这些场景中,控制力比吞吐量更重要。你能获得更强的图像控制力,代价是更长的生成时间。
这种拆分是市场成熟的有用信号。两年前,一个模型试图服务所有人。现在供应商按工作负载进行切分,因为“制作一百个表情包”和“制作一张广告主视觉图”确实是不同的工作。
实际转变:把它当编辑器,而不是生成器
如果你不再把模型当作老虎机,而是开始把它当作编辑器,这次升级会最有价值。旧的工作流是:写提示词、生成四张图、挑最好的一张,如果都不行,就写更好的提示词重新生成。大多数挫败感都来自这个循环。
2.5 的工作流不同。你从一个粗略想法开始,生成一张过得去的图,然后通过一系列小幅、有针对性的编辑来完善它。换背景、调光照、移动某个物体。由于编辑时其余画面能够保持稳定,每一步都是真正的改进,而不是一次赌博。
这也是 Sketch 发挥作用的地方。当空间布局很重要时,一张糟糕的草图也胜过冗长的描述。画上标题放在哪里、产品放在哪里、人物站在哪里。模型负责填充质量,你负责提供意图。
有一个习惯值得保留:在宣布完成之前检查细节。没有模型是完美的,2.5 仍然偶尔会出现变形的手或错误的文字。不同的是,现在的错误已经少到值得再做一次编辑,而不是足以让你放弃图像、从头再来。这比任何基准测试都更能说明什么叫“可用”。
这给行业格局带来了什么
值得了解的背景是规模。OpenAI 曾表示,ChatGPT Images 系列及其 API 每周生成超过三十亿张图像。这个数字在 2023 年听起来会很荒谬,如今却只是基准线。
这也解释了为什么 OpenAI 有能力进行整合。在发布 2.5 的同一周,该公司悄悄停用了 ChatGPT 内部旧的 DALL-E GPT,把所有人引导到 ChatGPT Images。DALL-E 这个名字可能消失了,但它承担的工作已经完全融入一条更快、更清晰的流程中。
对竞争对手来说,压力非常具体。Midjourney 仍然拥有纯粹的美学广度,这一点几乎没有人会认真质疑。Adobe Firefly 仍然在谨慎企业的商业授权角度占据优势。Google 的 Nano Banana 系列仍然在原生高分辨率和角色一致性上领先。ChatGPT Images 2.5 并不打算在他们各自的赛道上击败他们。它想做的是最好的默认选择:足够快、足够清晰,现在编辑能力也足够好,好到让你不再需要第二个工具。
诚实的结论是,2.5 是一次迭代,而非革命。但它恰好迭代了那三个让图像模型在实际工作中令人恼火的地方。速度、细节和编辑稳定性并不光鲜,但它们正是人们放弃一个工具的原因。OpenAI 在这次发布中,把这些原因一个接一个地消除了。
相关文章
9月国产开源生图模型接连放招:商汤、蚂蚁、书生都坐不住了
商汤8B、蚂蚁6B、书生InternLumina-U2接连开源,本文拆解三家路线差异与开源潮对创作者的真实影响。
腾讯混元把AI生图送进了影视片场:HyImage 3.5预览版上手
HyImage 3.5 preview盲测提升约30%,支持5图参考与2K输出,已接入WorkRally并在《行镖》中实战,本文拆解其能力与使用路径。
2026年9月最佳AI图像生成器排名
GPT Image 2.5、Midjourney V8.2、Nano Banana 2、Flux 2 等,按价格和任务推荐排名。
微软 MAI-Image-2.6 正悄然逼近 GPT Image 2
微软的挑战者已将 Elo 差距缩小到 21 分。MAI-Image-2.6 的崛起对 AI 图像市场意味着什么。