FLUX 3 Image:邊界框、4K 輸出,以及將版面配置化為設定檔

Black Forest Labs 於 10 月 1 日發布 FLUX 3 Image,補齊 FLUX 3 系列中的圖像元件。此模型可透過該公司的 API 與 Playground 使用,10 月 8 日前提供 50% 的首發折扣,並承諾在未來幾週內釋出開放權重版本。
三大主打宣稱分別是原生 4K 輸出、元素層級的版面配置控制,以及保留區域的編輯。每一項都值得拆開檢視,因為第三項實際承擔的功用比行銷文案所暗示的更多。
網格取代了文字描述
FLUX 3 Image 接受附加在提示詞後方的 JSON 邊界框陣列,這些邊界框以正規化 0–1000 的座標網格表示。每個元素都有 ID、文字描述,以及格式為 [y_min, x_min, y_max, x_max] 的框。模型接著會把該元素放置於該框內,且不受輸出解析度影響。
這是本次發布所圍繞的核心,也是版面配置指定方式的一次真正轉變。在多數文字轉圖像工作流程中,空間安排是以自然語言描述(「瓶子在左側三分之一處,一隻手從右側伸入」),而模型會將其解讀為一種柔性偏好。結果是一組輸出分布,通常會落在描述附近,有時則不然。
座標網格移除了解讀步驟。你不再是一邊描述版面配置、一邊期待結果;你是在明確宣告版面配置。對於在版面配置工具中工作的設計師而言,這對應到既有的心智模型。對於要產生數百張產品照、且全都需要模特兒位在相同位置的流程而言,這把美學問題變成了設定問題。
任何座標系統都有一個附帶條件:框本身不會告訴模型裡面要放什麼,而若描述指定了錯誤的物件,模型仍會自信地把它渲染在錯誤的位置。幾何上的精確不必然帶來語意上的精確。
無需放大步驟的 4K
FLUX 3 Image 可在多種長寬比下原生生成最高 5,456 x 3,072 像素(約 1,680 萬像素)的影像,無需經過超解析度處理。
多數圖像模型的原生輸出上限大約落在 1024 到 2048 像素,更大的尺寸則交由後續放大處理。這對螢幕交付來說沒問題,但對印刷輔銷品、電子商務主圖與大尺寸展示來說卻越來越尷尬,因為後處理步驟往往會抹平那些正是讓高解析度有意義的紋理細節。
以 4K 生成也改變了工作流程必須驗證的內容。放大器是獨立階段,有其自身的失效模式;移除一個階段,也就移除了一整類品管項目。原生輸出在完整尺寸下是否真的站得住腳,而不只是避開明顯偽影,只有實際測試才能定論。
區域編輯與像素一致性宣稱
第三項功能是局部編輯:僅重新生成指定的邊界框區域,框外的一切維持不變。Black Forest Labs 回報,編輯後有 67.8% 至 89.7% 的像素維持位元完全相同。
這個範圍很寬,而這種分布本身帶有資訊。低端意味著未觸及區域出現了明顯漂移;高端則接近真正的遮罩編輯。某次編輯會落在哪裡,很可能取決於重新生成區域對周遭造成多大約束——光線溢出、陰影與接觸邊緣都會形成壓力,迫使鄰近像素為了連貫性而被改動。
不過,願意公布像素一致性數字本身就是有用的做法。兩年來,迭代式圖像編輯中的漂移問題一直是針對擴散模型編輯的核心抱怨:每一輪後續修訂都會讓原本滿意的部分逐漸劣化,直到你放棄並從頭來過。一個能量化自身保留多少內容的模型,至少把目標講清楚了。
FLUX 3 Image 也在單一請求中接受最多十張參考圖像,並根據提示詞與邊界框版面配置來定位主體。這種組合(多張參考圖加上明確宣告的位置)正是模型開始看起來不再那麼像圖像生成器,而更像一個搭配生成後端的合成工具之處。
十張參考圖也引出一個問題:所謂「參考」究竟是要做什麼。在目前多數工作流程中,參考圖像意味著風格轉移:給模型一個外觀,讓它去近似。把每個被參考的主體定位在明確宣告的框內,則是更狹窄、更機械化的承諾。它說的是:這個物件,放在這裡。模型在高負載下(十個主體、4K 畫布、重疊的框)是否仍能兌現這點,屬於會在生產使用中浮現、而不是在發布貼文裡出現的那類問題。
值得注意的訓練細節
埋藏在技術細節中的一點是:FLUX 3 Image 使用 Black Forest Labs 的 Self-Flow 架構,聯合圖像、影片與音訊資料進行訓練。FLUX 3 基礎模型是一個涵蓋全部三種模態的多模態流模型,而圖像模型只是其中一個面向。
這對如何解讀產品藍圖很重要。如果圖像、影片與音訊共享同一個訓練基礎,那麼「幾週內開放權重」的承諾就不只涵蓋這次發布,而是指向一個將建立在相同基礎上的模型家族,也指向一家把自己定位為 Google 與 OpenAI 封閉式多模態堆疊之開放權重替代方案的公司。
這也解釋了推出順序。Black Forest Labs 先發布 FLUX 3 的影片與音訊元件,最後才推出靜態圖像模型。對一家以圖像生成建立起名聲的公司來說,在影片模型之後才發布圖像模型是很奇怪的順序,除非圖像模型是在共享基礎上最難做對的那一個。邊界框控制可能不那麼像一項功能,而更像是針對三種模態聯合訓練對細粒度空間保真度造成之影響的變通方案。
值得觀察的重點
目前為止,實際層面的解讀較為狹窄。FLUX 3 Image 是一項付費 API 產品,具備過去需要合成步驟才能做到的版面配置控制、可移除放大器的原生解析度,以及附有公布保真度數字的區域編輯。這些功能是否比替代方案更好,是基準測試的問題,而接下來幾週的獨立測試正是為此而做。
權重釋出後,有三件事值得追蹤。第一,邊界框 API 是否會原封不動地延續到開放版本,或變成僅限 API 的功能;若為後者,將是付費與免費層級之間有意義的分野。第二,社群微調能否在較小硬體上達到相同的版面配置精確度,或者座標行為是否取決於規模。第三,像素一致性數字能否在獨立重現中站得住腳,或會證明只是在有利編輯上的最佳情況測量。
更廣泛的訊號,是發布說明幾乎不經意提到的那一點:圖像生成的競爭已經從單一輸出能有多驚豔,轉移到第一百張輸出是否能與第一張一致。版面配置網格、區域保留與像素一致性指標,都是對這個問題的回答。它們都不會讓一張圖像變美,而是讓圖像變得可重複。