Qwen-Image 2.1 對決 Nano Banana 2.0:7B 開源模型已緊追 Google 其後

阿里巴巴於 9 月 20 日推出 Qwen-Image 2.1,此後基準測試的討論熱度就完全不同了。一款可下載權重的 70 億參數圖像生成器,如今在阿里巴巴自家排行榜上超越 Google 的 Nano Banana 2.0,在獨立排行榜上也近到讓人忍不住多看兩眼。發布消息在 Hacker News 的討論串一天內吸引超過 700 分與近 200 則留言,這說明了這個領域積壓了多少關注。
數字,以及它們為何重要
在阿里巴巴的 Qwen-Image-Bench 上,新模型得分 60.28,Nano Banana 2.0 則為 59.82。這半分的領先,與其說是一項技術主張,不如說是一個訊號:阿里巴巴現在直接把 Google 點名為它打算超越的基準。參數更少的唯一開放權重模型——美團的 6B LongCat-Image——以約 54 分落後。相較之下,OpenAI 的 GPT Image 2.5 Sunburst 以 67 分高居阿里巴巴排行榜榜首,Muse Image 則為 62.34 分,兩者皆為封閉模型。
舉辦盲測人類對人類投票的 AI Arena 則講述了較為保守的故事。Nano Banana 2.0 以 1260 Elo 領先 Qwen-Image 2.1 的 1228,GPT Image Sunburst 以 1423 居首,Muse 為 1276。這款開源模型尚未贏下這場對決。不過,它在 Image Edit Arena 與 Text-to-Image Arena 中,都在所有開放權重模型裡排名第一,而這正是許多人真正在乎的類別。Qwen 自家帳號將其形容為「第一名開源模型」,而在這個較狹義的主張上,獨立數據確實支持他們。
它真正出色的地方
透明度是每個人都不斷提到的功能。Qwen-Image 2.1 原生輸出 RGBA 圖像,因此你可以提示生成透明背景,直接得到乾淨的去背結果,不必再經過一次背景移除工具。對貼紙賣家、按需印刷店家,以及任何要把素材合成到更大設計中的人來說,這省下了一個實際步驟。該模型還能編輯透明圖層而不將其平面化,這在過去需要另一套專門處理圖層的模型。
最多可使用十張參考圖進行編輯,則是另一大亮點。餵給它一張人物照片和幾張服裝照,它就能合成出這個人穿上那些衣服的畫面。把六張肖像合併成一張團體照。將十張家具圖片組合成一個房間。你可以用三種方式指定要編輯的區域:畫彩色圓圈、直接塗抹該區域,或傳入原圖外加一張獨立遮罩。當你不能承受覆寫原始像素時,就該使用遮罩這種方式。
再來是在一般硬體上的速度。早期採用者回報,在 RTX 4090 上生成一張 100 萬像素圖像約需五秒,在 50 系列顯卡上約 25 秒,而在配備 64GB 系統記憶體的 RTX 3060 上,2K 圖像約需 50 秒。一名 Hacker News 留言者表示,他們在 4090 上約五秒就能轉換一張 1MP 圖像。一位 r/StableDiffusion 使用者回報,在 5070 或 5080 上生成 1MP 圖像約需 25 秒,同時指出編輯是最慢的操作,而且疊加參考圖會讓延遲明顯增加。這速度稱不上雲端飛快,但已快到不能再當成藉口。

授權條件的但書
這就是讓社群分裂的部分。較早的 Qwen 圖像模型以 Apache 2.0 授權發布,讓你可以微調並販售你打造出的任何東西。Qwen-Image 2.1 則以僅限研究用途的授權發布,禁止將權重用於商業用途,除非與阿里巴巴另行達成協議。HN 討論串因這種模糊性而炸鍋,阿里巴巴的帳號出面澄清:權重受到限制,但你用它們生成的圖像屬於你,包括可作商業使用。
這個區別聽起來很小,卻非常重要。如果你只是想為客戶、產品或自己的專案生成圖像,那沒問題,阿里巴巴已確認輸出內容不帶任何授權義務。如果你想微調並重新散布該模型,那就是你得去談判了。大多數人屬於第一種情況,這也是為什麼反彈聲浪很大,但最終仍受到控制。
更宏觀的效率論點
這裡有趣的地方不是原始分數,而是效率。Qwen-Image 2.1 與體積大上許多、且完全封閉的模型只差幾點 Elo。這個生成器有 32 層 Single-Stream DiT,透過 Qwen3-VL 8B 文字編碼器讀取提示,並原生渲染 2K、最高達 2752 x 2752 像素。在效率方面,它證明了架構蒸餾與更乾淨的訓練資料,可以彌補大多數大家原本以為必須靠規模才能縮小的差距。
這對訂閱模式構成了行銷簡報永遠做不到的壓力。如果消費級 GPU 能在幾秒內渲染出工作室級成果,「我們能生成最好的圖像」就不再足以成為每月付費的理由。Google 與 OpenAI 仍領先最困難的語意與空間推理任務,盲測評估也持續給予他們優勢。Qwen-Image 2.1 並沒有彌補那道差距。它只是讓那道差距在很大一部分日常工作裡顯得可有可無,而這比任何單一基準測試分數都更具顛覆性。
社群的實測評價
基準測試的爭論只能帶你到這裡。更扎實的訊號,是人們親自跑過之後的實際回報,而本週的報告異常一致。在 r/StableDiffusion 上,一名使用者貼出 192 張生成圖像的並排比較,將 Qwen-Image 2.1 與 Krea 2 對照,並按文字生成、人體解剖等類別分類。結論是這款開源模型在結構上表現良好,但為了在 5090 上容納去噪器,必須設法繞過量化文字編碼器來運作。
另一名使用者讓模型在配備 32GB 記憶體的 M1 Max MacBook Pro 上運行,使用原生 Apple Silicon 執行環境,約 24 秒生成一張 512 x 512 圖像。以桌機標準來說這很慢,但它證明該模型並未被鎖定在 Nvidia 硬體上,這對很大一部分休閒使用者來說很重要。第三個人圍繞它打造了 Fooocus 風格的本地工作坊,加入遮罩、標註、向外補繪與 OpenPose 姿勢參考,並要求大家誠實批評而非讚美。
編輯能力引來最多熱情。有一則貼文描述在完全不用任何 LoRA 的情況下生成角色設計表,利用該模型的參考圖編輯功能,讓角色在不同姿勢與服裝之間保持一致。這在過去需要一整疊微調模型與大量手動清理。單一個 7B 模型就能開箱完成這件事,正是大多數基準測試圖表沒有捕捉到的低調頭條。
接下來該關注什麼
早期結果仍在沉澱。Qwen 建立了自家的基準測試,卻沒有公布提示詞或各類別分數,因此內部數字與其說是測量,不如說是一項主張。獨立的 AI Arena 數字更值得信賴,也稍嫌不那麼好看。目前誠實的解讀是:Qwen-Image 2.1 是現有最佳的開放權重圖像模型,確實比封閉模型領導者差了一截,也是「小而開放也能有競爭力」的真實例證。接下來幾週的獨立測試將說明,它對 Nano Banana 2.0 的那半分領先究竟是能持久,還是只是基準測試中一段討喜的切片。