通義萬相 Qwen-Image 2.1 開源了:7B 參數憑什麼敢叫板 Google 和 OpenAI

9 月 20 日,阿里通義團隊悄悄放出了一顆「小核彈」——Qwen-Image 2.1。一個只有 70 億參數的文字生成圖片模型,卻在自家評測裡壓過了 Google 的 Nano Banana 2.0,逼著 OpenAI 和 Meta 的閉源模型回頭看。消息一出,B 站、知乎,還有海外的 Hacker News 和 Reddit 全都炸了。
為什麼說它「小而猛」
生圖模型這幾年越做越大,閉源的動輒幾十上百億參數,跑起來要一張專業顯示卡。Qwen-Image 2.1 反著來,把生成部分壓縮到 7B,結果在自己的 Qwen-Image-Bench 榜單上拿了 60.28 分。這個分數放在全榜是什麼水準?Google Nano Banana 2.0 是 59.82 分,被它壓了半個身位;開源陣營裡排第二的是美團的長貓 LongCat-Image(6B),分數只有 54 出頭。也就是說,它是目前所有能下載權重的模型裡最能打的一個。
獨立第三方評測 AI Arena 的結論要更冷靜一點。那邊 Nano Banana 2.0 拿了 1260 分,Qwen-Image 2.1 是 1228 分,閉源的 GPT Image 2.5 Sunburst 頂到 1423 分。差距還在,但已經小到「咬著後腳跟」的程度。對一個開源模型來說,這個位置本身就是勝利。
三個真正好用的能力
第一個是原生透明背景。以前做貼圖、做列印客製、做設計稿,AI 生成完還得再去背一次圖。Qwen-Image 2.1 直接輸出帶 alpha 通道的 RGBA 圖,一個模型同時做生成和編輯的工作,透明圖層還能不合併直接編輯。對做文創和週邊的人,這一條省了太多事。
第二個是十張參考圖同時編輯。把一個人物照片丟進去,再餵幾張衣服的圖,它能合成出「這個人穿著這幾件衣服」。還能合併六張肖像變成一張合照,或者把十張家具圖拼進同一個房間。B 站上已經有 UP 主示範「人物一致性 + 換裝」,留言區一片「這也太自然了」。
第三個是輕量到能上家用卡。RTX 4090 上 1 百萬像素的圖大概 5 秒,50 系顯示卡 25 秒左右,甚至有人用 RTX 3060 加 64G 記憶體跑 2K 圖,50 秒一張。阿里官方最低配置喊到了 6G 顯示記憶體,B 站上的「一鍵整合包」教學已經開始排隊出現了。

最扎眼的不是效能,是授權
真正讓社群吵起來的是授權條款。之前的 Qwen-Image 系列是 Apache 2.0,隨便商用。這一次換成了「僅限研究用途」的 Qwen Research License,商用要單獨找阿里談。Reddit 和 HN 上吵成一片,有人覺得這是開倒車,也有人覺得「權重給你下載,圖你隨便用」已經夠意思。
阿里官方很快出來澄清了一句話:模型權重不能商用二次分發,但你用它生成的圖片,著作權是你的,商用沒問題。這個區分點很關鍵——對絕大多數只想做圖的人來說,影響其實沒那麼大。
這件事更大的意義
Qwen-Image 2.1 證明了一件事:靠架構蒸餾和更乾淨的訓練資料,小模型能追平大模型的生圖水準。B 站 UP 主「愛分享的劍二十七」那期影片標題說得很直接——「阿里開源的 AI 繪畫模型,效果打趴一票付費工具」。這話有點誇張,但方向沒錯。
當一張圖在家用顯示卡上幾秒就能出來,還要不要每個月付訂閱費,就成了每個創作者要重新算的一筆帳。閉源廠商接下來得靠速度、靠工作流程整合、靠多模態協作來證明自己值這個錢,而不能再只靠「我生得好看」。
對普通人來說,好消息是:開源生圖的天花板,這個月又抬高了一截。