Google 的 Nano Banana 2.1 是功能下放,而非旗艦之作

Google 於 10 月 7 日發布 Nano Banana 2.1,這是其 AI 圖像生成與編輯模型的升級版。該公司形容這是一次全面的改良,並特別點出三大領域:視覺設計、遮罩式編輯,以及主體一致性。
若對照它所處的市場定位來解讀,更精確的描述是:Google 正把 Pro 等級的行為下放到更便宜的模型中。
實際上改變了什麼
根據 Google 的說法,Nano Banana 2.1 能生成構圖更佳的視覺素材。這是三項說法中最模糊、也最難驗證的一項,因為「更好的構圖」並不是任何人會公開的量化指標。
遮罩式編輯則具體得多。使用者可以選取並修改既有圖像中的特定區域,而不必重新生成整張圖。兩年來,這正是區分「認真做編輯的模型」與「生成展示品」的關鍵功能,而把它放進中階模型、而非 Pro 等級,正是這次發布的實質重點。
第三項是主體一致性,而對任何大量產出內容的人來說,這才是最要緊的一項。在編輯圖片或批次生成一組相關圖像時,模型能更妥善保留主要主體的外觀與特徵。對一位要在十張圖中生成一致角色的 Gemini 使用者而言,這差別在於得到一套可用的素材庫,還是一堆差一點的失敗品。
該模型正陸續在 Gemini 應用程式、Google 搜尋的 AI 模式、Google AI Studio、Google Flow、Stitch、Google Ads,以及 Gemini 企業平台上推出。對開發者而言,可透過模型 ID gemini-nano-banana-2.1 使用,接受文字、圖像、音訊與影片輸入,並以 1K、2K 或 4K 輸出。
這份輸入清單值得停下來細想。一個接受音訊與影片輸入、並回傳圖像的模型,與其說是一台附帶行銷文案的文生圖產生器,不如說屬於另一個類別。它是一套多模態系統,只是輸出恰好是一張靜態畫面。
這個級距的定位
今年稍早,Google 發布了 Nano Banana 2,又名 Gemini 3.1 Flash Image。它結合了 Flash 系列的速度與可媲美 Nano Banana Pro 的輸出品質,而 Google 也把多項 Pro 功能下放到其中:真實世界知識、更佳的文字渲染,以及更好的角色與物件一致性。
Nano Banana 2.1 延續了這條遷移路線。這個模式一致到足以稱之為策略:Google 把 Flash 級距當作衝量的產品,持續把 Pro 的能力往下拉,並讓 Pro 級距負責定義天花板。
Google 自家資料所支持的競爭框架是:OpenAI 的 ChatGPT Images 2.5 仍是全球領先的圖像生成與編輯模型,尤其在反覆迭代的工作上。它的優勢具體且技術性:當使用者進行多輪修圖時,它能更妥善保留先前的編輯、不去動未觸及的區域,並在迭代累積之際維持穩定的畫質。
這又是漂移(drift)問題,而它是當前圖像編輯的核心工程挑戰。每個人都在攻克它。Ideogram 4.5 加入了 Precise Edit 與 Generate + Edit 模式。Black Forest Labs 推出了具備區域保留能力的編輯功能,並公布了像素同一性的數據。Google 在 2.1 給出的答案,是在中階級距實現主體一致性。
微軟於八月發布的 MAI-Image-2.6,在同一場討論中緊追 OpenAI 之後。整體陣容已穩定成一個清楚可辨的格局:OpenAI 在反覆迭代編輯上領先,Google 在通路與價格上領先,而以 Qwen-Image 2.1 為首的開放權重陣營,則以極低的成本在品質上逼近到可一戰的距離。
值得精確釐清「漂移」究竟是什麼,因為這個詞涵蓋了好幾種不同的失效。有像素漂移,即未觸及的區域在迭代之間出現輕微位移。有身分漂移,即一張臉或一項產品在一連串編輯中改變了。有風格漂移,即隨著模型每一輪重新生成更大比例的畫面,渲染美學逐漸朝通用外觀遷移。還有品質漂移,即圖像像影印本的影印本那樣,累積了雜訊與模糊。
每一種都有不同的解法。像素保留是遮罩問題。身分保留是條件化(conditioning)問題。風格與品質的保留,則大致取決於模型被允許捨棄多少原始內容。一個在四者中擅長其中三者的模型,仍會在五輪編輯鏈中失敗——這正是為什麼廠商關於一致性的說法,必須指明是哪一種一致性。
Google 的 2.1 明確處理了身分一致性、也明確處理了遮罩編輯,卻對長鏈條下的風格或品質未置一詞。這份沉默本身就很說明問題。
為什麼中階發布才是真正重要的那一個
旗艦發布告訴你一家實驗室能做到什麼。中階發布告訴你,它認為多數使用者真正需要什麼。
Google 把遮罩編輯與主體一致性放進那個橫跨搜尋、廣告與消費級 Gemini 應用程式的模型,等於宣告這些是基本門檻,而非加值功能。光是搜尋的 AI 模式,就把圖像生成推到以數十億次工作階段計的受眾面前。廣告則把它推到廣告主面前,而這些廣告主會大量產出素材,並立刻知道它管不管用。
這種通路優勢不是模型能力,而它可能比任何一項能力都更有價值。一個比領先者差 5%、卻就放在使用者早已置身其中的搜尋框裡的模型,將會產出遠多於對手的圖像。OpenAI 在迭代編輯品質上的領先是真實的,但也是只對那些早就決定要用圖像工具的使用者才重要的領先。
對開發者而言,實際的解讀在於預設選擇。如果一款產品需要圖像編輯,而且已經在使用 Gemini,那麼升級到 2.1 幾乎不費成本,還少了一個再整合第二家供應商的理由。如果一款產品需要市面上最強的迭代編輯能力,那麼評估的問題只變得更難了,因為 Flash 級距與領先者之間的差距,正是在多輪作業最關鍵的那個維度上縮小了。
你自己該測試什麼
有三件事值得親自驗證,而不是理所當然。
第一,邊緣處的遮罩準確度。關於區域編輯的籠統說法,通常在大面積區域的中央站得住腳,卻會在邊界處劣化——那裡正是模型要判斷每個像素屬於邊界哪一側的地方。請用細微結構來測試:毛髮、玻璃、枝葉、細肩帶。
第二,超過兩輪以上的一致性。主體一致性的說法通常只在簡短的編輯鏈上被驗證。漂移問題會複合累積,因此有用的測試是連續五、六次編輯,看看主體是否還撐得住。
第三,4K 輸出是原生解析度還是向上取樣。Google 列出 1K、2K 和 4K 為輸出選項,卻未說明生成解析度,而這項差異會顯現在細部紋理上,而非整體銳利度。
策略上的結論就沒那麼多保留餘地了。Google 這次發布並不是在追逐圖像模型的排行榜。目標是讓中階級距好到足以讓排行榜不再是任何人選擇其他工具的理由。這能否奏效,取決於市場上的工作量有多少屬於反覆迭代的精準編輯、多少屬於其他一切,而誠實的答案是:2026 年大多數的圖像生成仍屬於第二類。