通義萬相 Qwen-Image 2.1 開源:7B 小模型如何把透明圖和 10 張圖編輯裝進一張消費級顯示卡

9 月 20 日,阿里千問團隊把 Qwen-Image 2.1 放上了開源平台。消息一出,B 站上的整合包影片當天就多了起來,標題大多帶著同一句話:最低 6G 顯示記憶體就能跑。對一個過去常被貼上「吃顯示卡」標籤的文生圖賽道來說,這個數字本身就是新聞。
很多人第一眼會把它當成 Qwen-Image 3.0 之後的新一代。其實不是。千問在今年 7 月預告過 Qwen-Image 3.0,號稱支援 4500 token 的超長提示詞,但那只是預覽,沒給權重、沒給跑分。2.1 是 2.0 這條開源線上的正經繼任,視覺生成部分依然是 32 層 Single-Stream DiT,參數 7B,和 2 月發布的 2.0 保持同款輕量架構。
真正讓人意外的是功能,而不是參數。這次三個升級放一起看,指向同一個方向:讓生圖工具真的進入生產流程,而不是停在「驚豔 demo」的階段。
第一是原生透明圖。以前要生成一張帶透明通道的 PNG,得靠單獨的模型,千問去年 12 月就發過專門的 Qwen-Image-Layered。2.1 把透明圖能力併進了統一模型裡,一句提示詞就能在普通圖和 RGBA 之間切換,還能直接編輯透明圖層——改表情時背景保持透明,或者把照片裡的主體去背當素材。對做電商圖、做 UI 素材的人來說,這一步省掉了不少來回切換的麻煩。
第二是參考圖從幾張增加到 10 張。2.0 那時候多圖編輯還侷限在少量輸入,2.1 可以直接把六張不同的人像合成一張合照,或者拿模特、衣服、鞋、包、帽子各一張圖拼出一整套穿搭。實作上用的是混合粒度的注意力機制:文字走 token 級的因果 mask,圖像生成走 chunk 級的 mask,再加上 KV cache 復用,讓參考圖和指令只算一次、反覆復用。說白了,就是用工程手段把「圖多了變慢」這件事壓下去。
第三是局部編輯的細化。現在可以畫圈、塗標註、或者單獨傳一張 mask 圖,把修改指令限定在某一小塊區域,不動畫面其他地方。任務覆蓋也擴展到了全景圖、資訊圖、分鏡稿。

但這次開源帶著一個過去少見的條件。Qwen-Image 2.1 用的是 Qwen Research License,只允許研究和評估,商業使用要另外談付費授權。這跟阿里近期大多數開源專案走的 Apache 2.0 路線不一樣,也跟 Z-Image、Ideogram 4.0 這類完全寬鬆的開放權重模型拉開了距離。對想拿它接商案、做產品的團隊來說,授權條款是比顯示卡門檻更值得先看清楚的东西。
中文社群的反應集中在「能跑」這件事上。B 站一批 UP 主在做一鍵整合包,主打解壓即用、最低 6G 顯示記憶體、支援批次生圖和圖片編輯,留言區常有人拿它和付費工具比。這種情緒有個背景:過去兩年,效果最好的生圖模型大多鎖在 API 和訂閱牆後面,本地能跑的往往差一檔。Qwen-Image 2.1 恰好踩在那個交叉點上——體量小、開源、效果被拿來對標閉源對手,於是「狂勝付費工具」的說法就有了傳播的土壤,哪怕這句話本身需要打個問號。
客觀一點看,Qwen-Image 2.1 的價值不在「狂勝」誰,而在它把透明圖、多圖編輯、局部控制這幾件設計師每天都在做的事,塞進了一個消費級顯示卡能跑的小模型。真到了交付這一步,AI 生成的圖離能用還差什麼?人物要去背、素材要改字、商品擺放要調、包裝上的字和瓶身形狀不能跟著變。2.1 正是衝著這些「最後一哩路」去的。能不能真的取代一部分付費工具,得看用的人拿它做了什麼,而不是看標題寫了什麼。
至少從開源社群的熱度看,答案是偏樂觀的。一個 7B 的小模型,加上一張 6G 的卡,讓「本地跑一個能用的生圖模型」從折騰變成了解壓雙擊。這對整個賽道的影響,可能比某一次跑分更長久。
相關文章
一次十張參考圖:AI 圖像編輯從單張操作邁向合成
單圖編輯產生變化,多圖編輯產生組合。一次十張參考圖,改變了我們提示與合成的方式。
原生透明正悄然成為 AI 圖像中最實用的新功能
大家都要求寫實感。設計師要求的是透明背景。為什麼原生 Alpha 通道生成,是那個默默改變真實工作流程的低調功能。
阿里巴巴的 Qwen-Image 2.1 剛剛改變了開源模型授權的討論
技術規格令人印象深刻,但授權才是真正的故事。Qwen-Image 2.1 放棄了 Apache 2.0,轉而採用研究授權,而細則現在比以往任何時候都更重要。
你還分得出 AI 圖像和真實照片嗎?老實說,不能。
破綻已經消失,偵測器也不可靠。辨識 AI 圖像的誠實答案是:沒辦法,而解決方案在你們眼球的上游。