OpenAI 將旗下旗艦圖像模型一分為二。這比基準測試更能說明問題。

9 月 8 日,OpenAI 推出了 ChatGPT Images 2.5,而藏在公告裡的一項決定,比任何速度數字都更重要。該公司把單一旗艦圖像模型拆成了兩個。
對開發者而言,API 現在提供 GPT-Image-2.5 Flare 與 GPT-Image-2.5 Sunburst。Flare 是速度較快的那個。OpenAI 表示它的執行速度比 GPT-Image 2 快兩到四倍,早期合作夥伴 Manus 也用自己的測試支持這個說法,並指出透明背景輸出更好。Sunburst 則是較慢、較精確的那個。它是為了必須讓其他一切保持原樣的編輯工作而打造。兩者價格相同:每百萬輸入 token 8 美元,每百萬輸出 token 30 美元。
定價細節才是耐人尋味之處。當兩個模型做著不同工作、價格卻完全相同時,供應商賣的不是更多算力。它是在要求你決定自己真正需要什麼,而這是一種不同的產品對話,不同於「這是我們最強的模型,什麼都用它就好」。

實際上改變了什麼
在消費者端,最受矚目的數字是延遲。OpenAI 聲稱與 Images 2.0 相比,生成延遲最多降低 50%,同時銳利度、自然光線與紋理細節都有所提升。這種組合並不尋常。通常你得犧牲其中一項來換取另一項。
編輯能力才是 Sunburst 打響名號的地方。它的賣點是模型懂得哪些東西不該改。OpenAI 點名的合作夥伴之一 Higgsfield AI 就是這麼說的,而這也公允地總結了這次更新的真正重點。較早的圖像編輯器很擅長遵循指令,卻很不擅長放過畫面其餘部分。你要求把外套換個新顏色,結果拿到一張臉略微不同、地平線移動了、光源也偏移了的圖。Sunburst 正是針對這種失敗模式而來,能在多輪編輯中讓臉孔、產品與品牌元素保持穩定。
ChatGPT 應用程式中有三項新工具。Sketch 讓你可以輸入 @Sketch,並在聊天中畫出粗略版面或輪廓,把你的塗鴉當作最終算圖的參考。Templates 為海報、周邊商品等常見格式提供起點。Comments 則讓你把註記釘在圖像上的某個位置,這樣就能直接說「刪掉這個」或「把這裡改成藍色」,不必重寫提示詞。
OpenAI 也倚重一項安全統計數據。Sunburst 產生不安全內容的比率為 1.09%,Flare 為 1.41%,前一代模型則為 1.64%。方向是好的,不過這些都是自行回報的數據,是宣傳說法而非保證。
Adobe 的出招
同一天,Adobe 宣布已將 GPT-Image-2.5 整合進 Firefly。這可不是一則小小的合作備註。Adobe 花了兩年把 Firefly 重新定位為協作層,一個讓 Google、Runway 等公司的模型接入專業工作流程的地方。首日就加入 OpenAI 最新的圖像模型,正是這套策略按計畫運作的體現。
Adobe 的 Matt Chotin 將其定調為讓創作者從發想到交付都擁有彈性。實際上,這代表競爭已經從原始模型品質轉移開來。雙方現在透過彼此進行通路分發。超過 70 項 Adobe 工具嵌入 ChatGPT 之中,因此設計師可以在 OpenAI 的介面內呼叫 Photoshop、Premiere 或 Firefly 功能。每家公司都成為對方的通路,而雙方都無法獨自擁有創意任務的起點。
這次發布背後的數字
這次發布讀起來像是產品策略動作,而非純粹的能力躍進,其來有自。GPT Image 2 在 2026 年 4 月推出時,以 Elo 1178 在 Artificial Analysis 的文字生圖排行榜上拿下第一,並在編輯排行榜上排名第二。Images 2.5 是在那個基礎上的增量,而截至發布後幾天,兩款新 API 模型都還沒出現在 Artificial Analysis 排行榜上,也沒有第三方公布可重現的基準測試。速度與品質的改善全是自行回報,或由點名的合作夥伴 Adobe、Manus 與 Higgsfield 所回報。這不代表它們是錯的,但意味著任何關於這種拆分是否奏效的判斷,都應該等到獨立測試出爐。
並非自行回報的是價格。兩款模型都是每百萬圖像輸入 token 8 美元、每百萬輸出 token 30 美元,彼此完全相同。輸出解析度範圍從 1024 x 1024 到 3840 x 2160,總像素數上限介於 655,360 與 8,294,400 之間。對開發者來說,某項功能的抉擇如今只歸結為一個問題:這個工作負載需要快,還是需要第四次編輯後主體仍原封不動?能回答這個問題的模型就會被選中,而兩者價格相同這一點,也排除了用價格當作選錯的藉口。
為什麼分岔才是真正重點
圖像生成已經不再是一場實驗。OpenAI 表示該平台每週產生超過 30 億張圖像,而這個數字說明了一切。在這種量體下,有趣的問題不再是「它能不能做出漂亮的圖片」,而是「這項工作被要求完成的是哪一種任務」。
行銷團隊要產出數百個社群變體,在意的是吞吐量。品牌團隊要定稿一張活動主視覺,在意的是標誌在第四次編輯後是否會跑位。這兩種工作拉往相反方向,而單一模型會迫使其中一方妥協。把產品線拆開,等於承認客戶群也已經分裂了。
競爭對手的回應早已被這件事形塑。Midjourney 仍以某種電影感打磨取勝,但沒有原生聊天互動,學習曲線也更陡。Adobe Firefly 靠的是商業授權與其軟體生態系,但獨立的對話式創作偏弱。Google 的應用程式內圖像模型在某些任務上很強,但在品牌層級的控制上表現不穩。沒有人掌握整張棋盤。
對任何正在挑選工具的人來說,實用結論是:別再尋找單一最強圖像模型,而是開始讓模型匹配工作。大量迭代與精密收尾如今是分開的採購項目,即使它們來自同一家公司、價格也相同。基準測試排名會不斷變動,而且重要性只會越來越低。真正重要的是模型周邊的工作流程能否撐過下一次發布,因為底層模型幾個月後又會被替換。
最後這一點值得好好思考。Images 2.5 在 Images 2 推出約五個月後到來,而兩者都取代了去年還是最先進的版本。建立持久流程的團隊,擁有自己的提示詞、風格參考與審核步驟,才有能力吸收這種汰換。把單一模型硬接進流程的團隊,則會承受該模型的每一次關閉與價格變動。就這點而言,雙模型發布是房間裡最大聲的供應商給出的實用提醒:即便是領導者也在告訴你,不要依賴單一模型。