阿里巴巴開源可將平面影像拆解為可編輯圖層的模型

阿里巴巴的 Qwen 團隊在十月初將 Qwen-Image-Layered 放上 ModelScope 與 Hugging Face,並採用允許商業使用的授權。十月二日的中文公告將其描述為首個具備原生、Photoshop 風格圖層理解與編輯能力的影像模型。這個說法值得細究,因為其背後的機制並不是大多數影像編輯器一直以來努力的方向。
編輯生成影像的標準做法是選取一個區域,然後在該區域內重新生成。內補(inpainting)就是這樣運作。前一天發布的 FLUX 3 Image 也是如此,它用邊界框精確定義模型可以觸及哪些像素。這種方法有一個已知弱點:模型根本不知道什麼是圖層。它看到的是一個矩形區域和一段提示詞,然後把洞補上。
Qwen-Image-Layered 從不同的表徵方式出發。它會將完成後的影像分解成一組 RGBA 圖層,每個圖層都是全解析度,且各自帶有透明度。一個物件成為一個圖層,一段文字成為另一個圖層,背景則是第三個。你可以移動圖層、重新上色或替換圖層,然後重新合成整個堆疊。訓練目標讓這件事變得可衡量:模型學習產生出的圖層,在重新合成後能重現輸入影像,因此分解品質有直接的分數。

為什麼這與分割是不同的問題
將影像分割成物件是一項老任務,模型擅長這件事已經有一段時間。圖層分解要求的東西更為特定。輸出必須能當作編輯的基本單元來使用,這意味著每個圖層都需要乾淨的 alpha 邊緣、正確的堆疊順序,而且不能重複計算同時出現在兩個圖層中的像素。
這兩種失敗模式都很常見。用樸素的分割法處理一個站在牆前的人物去背時,當人物圖層被移除,牆上會留下人物的殘影。牆面圖層必須學會人物遮擋了它,並且必須重建人物後方的牆面原本是什麼樣子。這是生成問題,不是標註問題,這也是 RGBA 表徵之所以重要的原因。每個圖層都帶有自己的 alpha 通道,因此模型必須逐像素決定哪個圖層擁有什麼。
中文報告將此歸功於兩項架構:專門打造的 RGBA-VAE 編碼器,以及圖層級的 3D 位置編碼。第二項是有趣的部分。如果圖層是在深度方向上堆疊,模型就需要某種概念來知道每個圖層位於堆疊中的哪個位置,而這正是位置編碼所提供的。
「零漂移」的說法
其賣點是編輯幾乎不會造成漂移:改變一個圖層,其他一切保持不動。
漂移是所有編輯過生成影像的人都熟悉的失敗情況。你要求替換背景,模型卻回傳一張臉略有不同的圖,或是一件色調不同的襯衫,或是一道移動了的陰影。每一種基於擴散的編輯都帶有某種程度的這種問題,因為模型重新生成的範圍超出你的要求。Adobe 在 Lightroom 中新的 Prompt to Edit 功能正好有這個問題,這也是攝影師對它保持戒心的原因。
圖層模型在結構上避開了這個問題。如果你沒有要編輯的物件存在於獨立的 RGBA 圖層中,而編輯只觸及另一個圖層,那麼未被觸及的圖層會被複製,而不是重新生成。漂移變成合成器的錯誤,而不是模型的特性。
這是任何內補方法都無法提供的更乾淨保證,也是為什麼這裡真正的重點是架構選擇,而不是基準測試分數。
它為實際工作帶來什麼改變
三種工作流程會變得更短。
重複使用既有素材。橫幅中嵌入的產品照可以被取出並重複使用,不需要有人描繪剪裁路徑。圖層已經在那裡,還帶著 alpha。
透明輸出。預設輸出 RGBA 圖層的模型,可以在正常運作下順帶產生透明 PNG。這省去了一個目前需要分割模型或手動遮罩的步驟。
批次變化。如果主影像是圖層堆疊,團隊可以透過替換一個圖層並重新合成來產生變化版本。影像其餘部分不受影響,這在品牌規範固定了所有元素、只差產品本身時特別重要。
第四種比較不明顯。圖層是結構化資料。一疊具名的 RGBA 元件送進編輯器或自動化流程時,遠比平面點陣圖來得乾淨,這讓模型可以作為一個元件,而不是終點。
限制在哪裡
模型會分解影像。它不知道圖層應該叫什麼名字,也不會推斷意圖。請它拆解一張雜亂書桌的照片,結果可能物件分得很好,但光線分得很糟。半透明材質是棘手案例,因為一杯水可以說同時屬於好幾個圖層。
對於反射和陰影,深度排序也仍然不明確。投射在牆上的陰影是物件的屬性,但它存在於背景圖層上,而要決定把它放在這條線的哪一側,是模型在沒有被告知的情況下必須做出的判斷。
這些都不會讓這次發布變得較不重要。它讓這個模型成為基礎,而不是完成品工具。
為什麼圖層格式比更好的內補器更能普及
過去兩年,影像模型競賽一直在同一條賽道上進行。每一代都帶來更銳利的內補、更好的提示詞遵循度,以及更少明顯的偽影。
那條賽道有其限制,而且是結構性的。無論內補器變得多好,互動模式都維持不變:使用者定義一個區域,模型填滿它,然後使用者評判結果。品質提升了,但工作流程沒有改變。證據就是同一個抱怨在好幾代模型之間不斷重複出現:局部編輯會在別處造成改變。
圖層攻擊的是工作流程,而不是品質指標。一旦影像成為堆疊,工作單位就變成圖層,而不是選取範圍,使用者直接操作元件。三十年來設計師在專用工具中就是這樣工作的,而影像模型沒有這麼做的原因,在於這樣的表徵過去並不存在。
建立這種表徵很昂貴。模型必須從大多不包含圖層分解的資料中學習遮擋、深度排序和 alpha,這就是為什麼訓練目標——從預測出的堆疊重建輸入——是設計中承重的部分。
如果這種方法行得通,其影響會超出阿里巴巴自家的產品。一個能接受圖層堆疊的合成工具,可以接入過去需要人工剪裁遮罩的流程。一個提供分解圖層的圖庫,會比只提供平面 JPEG 的圖庫更有價值。這個模型是那條鏈的第一塊,而生態系還沒有其餘部分。
競爭態勢
圖層分解並非阿里巴巴獨有。螞蟻集團的 Ming-Image 採取了相關立場,將設計生成為圖層式構圖,而不是平面圖片。Stability 等公司已經推出能模擬部分工作流程的分割模型。不同之處在於對 RGBA 圖層作為原生輸出格式的投入,以及決定釋出任何人都能執行的權重。
最後那個選擇會影響這個概念傳播的速度。影像工具市場花了兩年時間,收斂到「選取一個區域、描述一項變更」的互動方式,而結果的品質已經停滯,原因很簡單:底層表徵沒有改變。交給生態系一個可編輯的堆疊,而不是點陣圖,這種轉變通常會先出現在其他人的產品中,之後才出現在基準測試表上。
值得觀察的是,合成工具是否開始接受圖層堆疊作為輸入格式,以及編輯器是否開始把分解視為專案的第一步,而不是修補操作。基準測試分數只是次要問題。