← 返回部落格
Ai預計閱讀 10 分鐘

FLUX 3 Image 把圖像生成變成了一份版面配置檔

發布於 2026年10月3日
FLUX 3 Image 把圖像生成變成了一份版面配置檔

Black Forest Labs 於 10 月 1 日推出 FLUX 3 Image,多數報導都聚焦在解析度:原生輸出最高 4K、約 1,680 萬像素,流程中不需要任何放大工具。這確實是實質升級,卻也是這次發布最不有趣的一件事。

真正值得翻開文件細讀的,是輸入格式。FLUX 3 Image 要的不是一段文字加一個心願,而是一張表。

每個元素都有自己的門牌號碼

一次生成請求,就是一組 JSON 元素陣列。每個元素都帶有唯一 ID、一組以 0 到 1000 正規化網格表示的邊界框 `[y_min, x_min, y_max, x_max]`,以及一段白話描述,說明該位置應該放什麼。背景區塊橫跨整張畫布;產品落在 `[400, 200, 950, 800]`;標誌待在左上角。場景提示詞依然存在,但它現在只是眾多輸入中的一項,而不是全部的委託內容。

這個網格與解析度無關。同一份版面 JSON 在 768 像素寬或原生 4K 下都能算出同樣的構圖,也就是說,你在便宜草稿上測試過的版面,就是昂貴成品會拿到的版面。

聽起來像是便利性功能。但實務上,它改變了誰有資格呼叫這個模型。BFL 把元素表設計成能讓語言模型從一行簡報和一個目標長寬比寫出來。代理程式不必再把意圖翻譯成散文然後祈禱結果正確,它可以像排試算表那樣排出一張圖,而元素 ID 會保留下來,成為後續回合可以引用的把手。

一張白紙用膠帶貼在木桌上,被分割成均勻的網格,幾件小型抽象物件擱在其中幾個方格裡

還有一個更省錢的連帶效果。因為網格與解析度無關,一份版面可以只花一小部分成本在 768 像素下驗證,再以 4K 算圖,構圖完全不變。反覆迭代與最終交付不再為了預算互相拉扯,這對任何要用同一套範本產出數十張圖的人來說都很重要。

像素鎖定與漂移問題

編輯遵循同樣的邏輯。你指定來源邊界框與目標邊界框,選出要移動、替換或移除的元素,而該區域以外的像素理應原封不動留在原地。BFL 自家的量測顯示,未觸及區域達到 67.8% 到 89.7% 的位元級一致度,這個範圍取決於編輯的複雜程度。

誠實的地方在於用字。發表示範承諾編輯「不會改變任何其他像素」;API 文件則說未觸及的像素「大致上」維持不變,而 BFL 也承認編輯可能會溢出指定的框外。邊界瑕疵真實存在。任何要把這套東西放進產線的團隊,都該建立驗收測試,而不是相信示範影片。

不過,它與一般內補(inpainting)的差距仍然懸殊。傳統內補即使在被交代不要動的區域,也會留下細微漂移。只做一次編輯,沒人看得出來;但歷經十個來回的核准循環之後,背景已經位移、字體筆畫已經糊掉,構圖也不再是三輪前客戶點頭的那一份。這種累積正是長編輯鏈無法使用的元兇,也正是邊界框想要阻擋的特定問題。

創作者實際測出了什麼

有位創作者把同樣的編輯指令分別丟給 Midjourney、Ideogram 4.5 和 FLUX 3 Image,做了一份很實用的比較。在一項要求把服裝改成粉色絲綢、綴上白花,再加上奶油黃蝴蝶結的測試,以及後續要求臉部與手部微距特寫的測試中,Midjourney 處理得了特寫,卻漏掉白花與精確色調;Ideogram 4.5 對得上服裝的改動,但微距鏡頭的光線看起來不對;FLUX 3 Image 對上了服裝改動,微距特寫的光線與情境也獲得好評。在另一項測試裡,它把狹長柱狀區域的編輯侷限在指定物件內,另外兩者則讓變動擴散得更遠。

一位創作者的討論串不能算基準測試。把它當成一種訊號,指出模型擅長什麼——看起來是細節層面的指令遵循,而不是大範圍的風格化。

邊界框修不好的那些事

定位與漂移只是兩個問題,不是全部。框告訴模型東西該放哪裡,卻沒告訴模型那東西該長什麼樣,也阻擋不了參考元素在放定位之後改變風格。要把同一個產品放到三十種不同背景上生成的團隊,仍得維持產品本身的一致性,而這份功夫住在參考圖與提示詞裡,不在座標裡。

文字算圖是另一道還沒縫合的裂口。BFL 自家的示範圖來自人類精心雕琢過的提示詞。版面模型能否穩定地把清晰可讀的字型放進一個小框裡、指定特定字體,這是另一個問題,而發布素材並沒有回答。對雜誌排版與電商這類正是本次發布鎖定的受眾而言,這個細節才是決定要不要採用的關鍵。

結構化輸入也不會讓模型在美學上變得不那麼黑箱。你可以指定標誌放在左上角,卻無法指定整體構圖應該給人一種平靜感。

沒人寫進標題的取捨

邊界框的設定成本比直接打一句「把背景改成藍色」高。你必須知道東西該放哪裡。對一次性的單張圖片來說,這份額外負擔大概不划算;但對一條要把同一份版面套用到二十張產品照的產線,或是一個必須可靠地放上標誌的代理程式來說,它很快就回本。

上市優惠價在 10 月 8 日前五折:768 像素圖片約 $0.0205,4K 約 $0.3035,參考圖與提示詞都包含在內,生成失敗不收費。商業用途的自架權重可與 BFL 聯繫取得,開源權重版本也承諾會在未來幾週推出。

參考圖的處理方式本身就值得一記。單次呼叫最多接受 10 張參考圖,而且每個元素都能指定自己來自哪張參考圖、該放在哪裡。光是 10 張參考圖並不稀奇;10 張各自對應到畫布上特定區塊的參考圖,則是一套用現有素材組裝構圖的工作流程,這更接近設計師的做事方式,而不是提示詞的方式。再把版面網格疊上去,這個模型看起來就越來越不像畫家,而更像一位有主見的合成師。

更宏觀地看,圖像 API 多年來的優化都圍繞著一個問題:圖看起來有多好?FLUX 3 Image 加上了第二個問題,而代理程式更在意這個問題:你能不能只針對圖像的某一部分進行定址、修改它,並讓其他一切保持原樣?一旦答案是肯定的,圖像生成就不再是吃角子老虎機,而開始像一份你可以編輯的檔案。

這個區別,正是為什麼它與 Midjourney、Ideogram 的比較並沒有乍看那麼重要。那些模型比的是全新生成的圖有多美,而它們在這方面依然非常出色。BFL 比的是生成出來的圖能不能被當成一份具有穩定區域的文件,那是另一場比賽,也會有另一位贏家。第一場比賽幾乎已經定局,第二場才剛開始,而這大致就是基礎設施押注想站的位置。

相關文章