← 返回部落格
Ai預計閱讀 9 分鐘

Flux 3 與 Imagen 4 登上 Replicate,影像模型貨架愈來愈擁擠

發布於 2026年10月2日
Flux 3 與 Imagen 4 登上 Replicate,影像模型貨架愈來愈擁擠

10 月 1 日,Black Forest Labs 與 Google 同一天在 Replicate 上架新的影像模型。Black Forest Labs 推出 Flux 3,支援文字生圖與影像編輯,最多可吃十張參考圖。Google 則一次上架四款模型:主打速度與成本的 Imagen 4 fast、講究細節的 Imagen 4 ultra、鎖定價格敏感應用的 Imagen 3 fast,以及追求最高輸出品質的 Imagen 3。這些模型都能透過你原本就在用的同一套 API 呼叫。

這個標題讀起來像是一場模型發表會,實際上更接近一則通路公告。這些模型早就存在於某個地方。真正改變的是:一個手握 Replicate token 的開發者,現在不必另外開 Black Forest Labs 帳號,也不用架設 Google Cloud 專案,就能直接取用它們。

十張參考圖究竟買到什麼

最值得停下來細想的數字,是 Flux 3 的十張參考圖。一年前,所謂的影像編輯就是一張輸入圖加一段文字指令。十張參考圖則改變了你能對模型提出的要求。你可以丟給它一張產品照、從第二張圖取材質、從第三張圖取配色、再從第四張圖取人臉,然後要它產出一個同時尊重這四者的構圖。

這正是整個市場一路競逐的能力。Nano Banana Pro 最多可融合十四張影像與五個人。GPT Image 2.5 Sunburst 靠著只改動單一區域、不擾動其餘部分,站上 Artificial Analysis 編輯排行榜首位。Seedream 5.0 在編輯需要真實世界參照時,會即時連上網路搜尋。競爭的基準線,已經從「第一張圖看起來多好」,移到「模型在第十次編輯時多麼聽得懂指令」。

一整面密集排列的小尺寸影像縮圖,場景各異,其中一格特別明亮並從網格中飄浮而出

對任何在這些工具之上打造產品的人來說,參考圖數量是比跑分更有用的規格。它告訴你能把多少控制權交到使用者手上。只吃一張參考圖的模型,適合做成一個文字生圖按鈕;能吃十張的模型,則適合一款設計工具,讓使用者從裝滿核可素材的資料夾裡拼組品牌素材。

Google 的四款模型,其實只有兩個等級

Google 的產品陣容看起來像四次發表,但仔細看名字,其實是兩款模型依成本切分。Imagen 4 fast 與 Imagen 4 ultra 跑的是同一套生成,只是一個調校成便宜、一個調校成細緻。Imagen 3 fast 與 Imagen 3 也是如此。fast 版本並不是真的比較差的模型,它們是同一款模型配上較低的運算預算,然後用較低的價格賣出。

這是販售影像生成的一種合理方式,同時也暗示了成本落在哪裡。當 fast 與 ultra 等級之間唯一的差別,只是模型被允許思考多久,模型本身就不再是產品了。運算才是產品,而模型只是負責花掉運算的那個東西。

對正在決定正式環境要跑什麼的團隊來說,這改變了盤算方式。問題不是四款裡哪一款最好,而是你的使用情境實際需要哪個品質等級;因為在只需要 fast 的情境裡付錢買 ultra,只是燒錢,卻不會改善任何使用者察覺得到的東西。

上架平台究竟值多少

值得精確地談談:為什麼模型登上 Replicate 算是一則新聞。Replicate 出租的是代管推論服務。開發者註冊一次、拿到一組 token,就能用同一套介面呼叫型錄裡的任何模型。對 Black Forest Labs 與 Google 來說,上架意味著觸及那些永遠不會為了一款模型另外開帳號的開發者,並為這份觸及率付費給平台。

這是開放模型開發者被迫接受的交易。公開權重,技術愛好者就能自己跑,對誰都不收費、實驗室也拿不到營收。上架代管平台,客群會擴大到想要一個端點加一張月帳單的人,但中間人多抽一手,而且模型得在選擇器裡跟十幾個競爭對手並排。

另一條路是直接販售存取權,這也是封閉模型的做法,而多數實驗室無法大規模做到。於是代管平台成了中立場域,讓開放與封閉模型在同一頁上爭奪同一位開發者。一家握有好權重的小型實驗室,如今能和 Google 的發表並列出現,這究竟是良性競爭還是商品化競賽,取決於你站在哪一邊。

對買方而言,這帶來一個實際後果:你今天挑的模型,可以透過你早就熟悉的介面取用,轉換成本低、嘗試也便宜。但這也意味著你挑的模型大概沒什麼特別,因為同一個貨架對所有人開放。

同一天的其他消息

同一天還有一整批規模較小的發布。Cloudflare 把圖文轉文字的模型 Clef 放上 Hugging Face。ISTA-DASLab 發布了 Qwen3.8 Flash 的 GGUF 版本,這主要對在本機跑模型的人有意義。Vercel 的 AI Gateway 新增了一款名為 Laya 的決策模型,用機率分數來分流客服請求與代理工作流程,10 月底前免費,同批上線的還有 Microsoft 的音訊模型與 Browserbase 的搜尋工具。Google 則在 Gemini Live 加入即時視覺輔助,並與盲人及低視力使用者共同打造。

這些單獨來看都不會改變一條影像工作流程。但合在一起,它們顯示平台廠商正往哪裡推。Replicate、Vercel 與 Hugging Face 正在競爭成為開發者挑選模型的地方,而它們競爭的方式,就是把型錄做得更寬、把帳務做得更簡單。模型實驗室從中受益,因為透過平台經銷,是小型實驗室觸及那些永遠不會另外簽約的開發者的方式。

這是每個開放模型開發者都要面對的取捨。公開權重、讓社群自行運行,成本為零,觸及的是技術愛好者。或者上架代管平台,觸及那些想要一個端點和一張帳單的開發者,觸及更多人,但得讓平台抽成。Flux 3 上了 Replicate,這說明 Black Forest Labs 想要第二種客群,而且想要到願意分一杯羹。

如果你正在做選擇,這代表什麼

這一切的實際效果,就是貨架很擠,標籤卻越來越難讀。四款 Imagen 模型、一次 Flux 發布,還有一長串社群自建版本,全都在搶同一條工作流程裡的同一個位置。真正要緊的差異,比行銷說法所暗示的窄得多。

下手之前,有三件事值得確認。模型能吃幾張參考圖,因為這決定了控制權的天花板。授權是否允許商業使用,這正是 Apache-2.0 與非商業版本分道揚鑣之處。以及模型是否能在符合你部署方式的環境取得,因為再好的模型,只要卡在你用不了的平台上,就是你用不了的模型。

這些都不光鮮,也不會出現在發表貼文裡。但正是這一部分,決定了一款模型在發表消息被滑過去半年之後,還能不能在一件產品裡派上用場。

相關文章