阿里巴巴的 Qwen-Image 2.1 剛剛改變了開源模型授權的討論

當阿里巴巴的 Qwen 團隊於 9 月 20 日開源 Qwen-Image 2.1 時,頭條新聞都聚焦在技術規格上。七十億個參數。原生透明圖像生成。最多可使用十張參考圖像進行編輯。一個模型同時處理文字轉圖像和編輯,而不是兩個模型。這些都是真的,也都值得關注。
對於任何計劃在此基礎上進行開發的人來說,更重要的細節是授權條款。
Qwen-Image 2.1 採用 Qwen 研究授權協議發布。它允許研究和評估,但商業部署需要單獨的付費授權。這與阿里巴巴近期大多數 Qwen 版本(包括語言模型)所使用的 Apache 2.0 條款大相徑庭。這使得 Qwen-Image 2.1 與完全寬鬆的開放權重圖像模型(如阿里巴巴自家的 Z-Image 或 Ideogram 的 Ideogram 4.0)處於不同的類別。
要理解這為什麼重要,你必須看看這個模型實際能做什麼。主要功能是原生透明。一個提示可以要求生成普通圖像或帶有真實 alpha 通道的 RGBA 圖像,無需單獨的模型。阿里巴巴曾在 2025 年 12 月推出專用的透明模型 Qwen-Image-Layered。版本 2.1 將其整合到統一的生成和編輯系統中,因此你可以直接編輯透明圖層,在保持背景透明的同時更改表情,或將主體從照片中提取為剪裁圖。
多圖像編輯是另一個重大飛躍。參考圖像從幾張增加到多達十張。將六張肖像組合成一張合照。從模特、襯衫、鞋子、包包和帽子組裝一套服裝。團隊構建了一種混合粒度注意力機制來保持速度,對文本指令應用 token 級掩碼,對圖像生成應用塊級掩碼,並採用 KV 緩存重用方案,使參考圖像只需計算一次並重複使用。
這些正是專業工作流程所需的能力。電子商務團隊希望將產品替換到場景中而不觸及包裝文字。設計師希望在透明背景上編輯標誌。創作者希望從多個參考中進行合成,而不是從頭重新生成。Qwen-Image 2.1 直接針對生產用途,而授權條款則旨在確保有人為該生產用途付費。
這並不一定是壞事。帶有商業使用條款的開放權重模型仍然允許研究人員、學生和愛好者檢查和運行權重。它改變的是規劃。一家假設「開源」意味著「可以免費構建產品」的新創公司現在必須閱讀細則。同樣的困惑也在 Meta 的 Llama 授權中出現過,這些授權施加了社區許可,對規模和商業使用有自己的限制。
「開源」一詞本身已成為爭論的焦點。純粹主義者指出,限制商業使用的授權不符合開源促進會對開源的定義,因為開源應該允許任何用途。實用主義陣營反駁說,即使在研究授權下,開放權重仍然讓世界能夠以封閉 API 永遠無法做到的方式檢查、研究和構建模型。Qwen-Image 2.1 正好落在這場爭論的中間,開放得足以被研究,封閉得足以被貨幣化。
還有第二點值得標記,而且很容易被忽略。Qwen-Image 2.1 並不是 Qwen-Image 3.0 的後繼者。團隊在 7 月預覽了 3.0,支持 4,500 個 token 的提示,但該預覽沒有附帶基準測試和權重,並且仍未發布。版本 2.1 是開放權重線的實際下一步,直接從 2.0 演進而來。保持版本號的準確性很重要,因為人們一直將 2.1 描述為 3.0 所承諾的東西,而兩者是具有不同完整程度的產品。
授權轉變也反映了中國 AI 實驗室更廣泛的商業現實。阿里巴巴在其 Qwen 語言模型中一直慷慨地使用 Apache 2.0 授權,建立善意和採用率。但圖像模型訓練成本高昂,且對企業用途越來越有價值,而研究授權方法是保持開放社區參與同時保留收入的一種方式。這是其他實驗室使用過的相同策略,它表明圖像生成現在是一項業務,而不僅僅是研究展示。
對於開源社區來說,這次發布在技術方面是一個真正的勝利。一個 70 億參數的模型,可以在消費級 GPU 上運行,並原生處理透明度和多圖像編輯,這是邁向本地、可控圖像生成的有意義的一步。權重在 Hugging Face 和 ModelScope 上沒有限制,並在 Diffusers、ComfyUI 和少數推理框架中提供首日支持,這意味著社區可以立即開始構建。
授權只是意味著討論不能再假設「開放」和「免費商業使用」是同一回事。它們從來都不是,但 Qwen-Image 2.1 讓這個差距無法忽視。對於研究人員來說,這個區別幾乎無關緊要。對於計劃在模型之上構建產品的創始人來說,這是首先要檢查的事情,在基準測試之前,在架構之前,在任何其他事情之前。
這是這次發布的真正教訓。技術令人印象深刻,開放權重確實有用。但授權的悄然變化是一個信號,表明行業的發展方向:開放模型越來越可以免費檢查,但部署成本高昂。任何想要基於它們進行構建的人都應該在閱讀論文之前先閱讀授權條款。
還有一個值得考慮的角度,那就是國際角度。中國的開放圖像模型一直在海外贏得用戶,部分原因是技術優勢,部分原因是開放權重相對於封閉的西方 API 所提供的自由。研究授權使這個故事稍微複雜化,因為這意味著海外商業用戶面臨與國內用戶相同的授權決定。但這並沒有消除吸引力。歐洲的研究人員或美國的愛好者仍然可以下載權重、運行模型,並在其基礎上進行非商業工作,這比封閉 API 提供的更多。授權縮小了商業路徑,但沒有完全關閉大門,這是一種刻意的中間立場。
開放圖像模型領域現在真正擁擠,一年前並非如此。在阿里巴巴的 Qwen 系列、其自家的 Z-Image、Ideogram 的發布以及源源不斷的社區模型之間,想要開放圖像模型的人的選擇比以往任何時候都更廣泛。每次發布都增加了一個數據點,說明該領域認為開放和可貨幣化之間的界線應該在哪裡。Qwen-Image 2.1 的研究授權是這個問題的一個答案,而且不會是最後一個。
對於研究人員來說,這個區別幾乎無關緊要,而這正是整個練習的重點。權重在那裡可供檢查,架構在那裡可供學習,能力在那裡可供挑戰。對於創始人來說,這個區別就是一切,這是首先要檢查的事情,在基準測試之前,在架構之前,在任何其他事情之前。兩個人可以看著同一個發布,並對其對自己的意義得出相反的結論,而兩者都可能是對的,因為授權正好位於那條斷層線上。
相關文章
一次十張參考圖:AI 圖像編輯從單張操作邁向合成
單圖編輯產生變化,多圖編輯產生組合。一次十張參考圖,改變了我們提示與合成的方式。
原生透明正悄然成為 AI 圖像中最實用的新功能
大家都要求寫實感。設計師要求的是透明背景。為什麼原生 Alpha 通道生成,是那個默默改變真實工作流程的低調功能。
通義萬相 Qwen-Image 2.1 開源:7B 小模型如何把透明圖和 10 張圖編輯裝進一張消費級顯示卡
一個 7B 的開源生圖模型,憑什麼把透明圖、多圖編輯裝進一張 6G 顯示卡?拆解 Qwen-Image 2.1 的核心升級與授權轉折。
你還分得出 AI 圖像和真實照片嗎?老實說,不能。
破綻已經消失,偵測器也不可靠。辨識 AI 圖像的誠實答案是:沒辦法,而解決方案在你們眼球的上游。