← 返回部落格
Ai預計閱讀 9 分鐘

圖像模型的軍備競賽:Midjourney、Nano Banana,與開放權重的悄然崛起

發布於 2026年10月1日
圖像模型的軍備競賽:Midjourney、Nano Banana,與開放權重的悄然崛起

如果你離開 AI 圖像生成領域幾個月,回來時看到的景象幾乎已經面目全非。大廠牌換了版本,曾經的消費者寵兒正在退場,而開放權重陣營則壯大了許多。以下是 2026 年秋季的現況。

Midjourney 已推進到 V8,V8.2 在七月成為預設版本。當目標是藝術指導而非單純的效能時,它依然是大家首選的工具,那是個會像人類導演一樣解讀氛圍與光線的模型。原生 2K 輸出無須放大、更佳的提示詞理解,以及一套會從你挑選的圖片中學習你品味的個人化系統。取捨也沒變:沒有免費方案、三起進行中的著作權訴訟,以及雖然更好、但面對複雜字體排版仍不可靠的文字渲染。

Google 的 Nano Banana 走過最令人困惑的一段歷程。原版在 2026 年二月被悄悄換成以 Gemini 3.1 Flash 為基礎的 Nano Banana 2,並成為 Gemini 應用程式中的預設選項。較舊的 Gemini 2.5 Flash Image 正在被淘汰,將於 10 月 2 日關閉。這個社群暱稱掩蓋了一個事實:Nano Banana 根本不是獨立產品。它是內嵌在 Gemini 裡的圖像生成功能,這究竟方便還是惱人,取決於你想要的是聊天介面還是專用工具。它的優勢很實在:能記住上下文的多輪編輯,以及經過實測、可在多次編輯中維持多達五個人與十四個物件一致性的能力。

正如某份社群指南所言,Nano Banana 的訣竅在於讓每張參考圖只負責一件事:一張管身分、一張管姿態、一張管風格。把所有東西塞進單一參考圖,輸出就會變得混濁。這是個小小的紀律,卻比大多數提示詞技巧更重要,而這也是整個領域多參考編輯背後的同一套原則。

OpenAI 的 GPT Image 系列正以最多十六張參考圖推動指令範圍編輯(instruction-scoped editing),其較新的 Sunburst 與 Flare 變體則高居 LMArena 圖像編輯排行榜榜首;該排行榜如今已在 57 個模型上累積超過 3,000 萬張投票。xAI 的 Grok Imagine Image 2.0 則把精準編輯與清晰文字渲染當作賣點,在先前的深偽醜聞迫使它重新思考防護機制之後,將自身定位為可投入生產的選項。

長期而言最重要的故事發生在開放權重領域。Black Forest Labs 的 FLUX.2 如今在可編輯的高解析度開放模型中獨占鰲頭,並有 klein 4B 變體與講求速度的 turbo 變體。Z-Image、Qwen-Image 與 Ideogram 4.0 補齊了 Apache-2.0 授權的選項,而 Ideogram 的開放權重渲染品質更讓開發者直呼頂尖。授權條款已成為真正的差異化關鍵:FLUX.2 dev 不可商用,而 FLUX.2 klein、Z-Image 與 Qwen-Image 則依 Apache 2.0 允許商業使用。現在挑選基礎模型,得先看授權,而不是看跑分。

授權這一點值得特別強調,因為多數人正是在這裡栽跟頭。兩個模型在跑分上可以打成平手,但在你能拿輸出做什麼這件事上卻可能天差地遠。一個能微調並為客戶部署的模型,比一個略好卻只能用於研究的模型更有價值。開放陣營正是沿著這條線分裂,而可商用的那一層——Apache 2.0 或同等授權——才是生態系真正在建造的地方。

這一切底下的轉變是:編輯已取代生成,成為新的前沿。一年前,競賽比的是誰能從文字生成最逼真的圖像。現在人人都做得到。新的競賽是誰能讓你只改一個地方而不必整個重新生成、誰能讓角色在一百張圖中維持一致、誰能把清晰正確的文字放到海報上。勝出的模型,是為反覆迭代最佳化的那些,而不是為了第一眼的驚豔。

硬體的故事與這一切並行發展。開放模型已經小到讓 7B 等級的模型能在消費級 GPU 上跑,社群也以一鍵整合包回應,向那些從不想碰終端機的人承諾本地生成。「能在 6GB 顯卡上跑」這項指標已經和任何排行榜分數一樣成了行銷話術,因為它決定了模型是件新奇玩物還是真正可用的工具。

人們對一致性的想法也悄悄轉變,而這已成為真正的戰場。能生成一張美麗圖像的模型只是基本門檻。能在上百張圖中生成同一個角色,或從十幾個角度呈現同一款產品的模型,才能在真正的工作流程中占有一席之地。以參考圖為基礎的做法——附上一到十四張角色圖片,讓模型重現——是快速的起步方式。LoRA 訓練,也就是用你自己精選圖片微調的小型適配器,則是參考圖開始走鐘時更重的鐵鎚。取捨在於可控性與設定時間,而誠實的答案是:沒有任何方法能保證臉部穩定,這也是為什麼每位認真的創作者在定案前,都會用固定的鏡頭清單來測試。

這個類別也為一般使用者發展出一套實用的詞彙。多輪編輯指的是模型記得自己做過什麼,並與你一同迭代。指令範圍編輯指的是你能明確告訴它要改什麼,其餘原封不動。多參考構圖指的是餵進數張圖片,並告訴每一張負責什麼。這些都不稀奇;它們如今已是標準功能,而模型競爭的是執行得好不好,而不是有沒有這些功能。

對於今天要挑工具的人來說,誠懇的建議沒變,而且大概也不會變。把模型對上任務。要美感用 Midjourney,要在 Google 生態系內做多輪編輯用 Nano Banana,要指令範圍的生產級編輯用 GPT Image 或 Grok,需要掌控權、資料落地,或一個能永久保留的微調角色時就用開放權重。一個模型能通吃一切的時代已經悄悄結束,而且沒人正式宣布。取而代之的是一個市場:正確答案完全取決於你想做什麼,而表現最好的人,是那些不再追逐單一贏家、學會逛街比價的人。

在所有這些轉變當中,唯一不變的是:差異化關鍵已不再是原始圖像品質,而是圍繞著它的工作流程。一致性、可編輯性、授權的明確性,以及與你已在使用的工具之間的整合。這才真正決定了一個模型會出現在你的日常工作裡,還是躺進一個你再也不會打開的驚豔展示資料夾。軍備競賽是真的,但贏家不是跑分最好的模型,而是能融入人們實際工作方式的那些——這更難衡量,卻更能預測什麼會留下來。

相關文章