原生透明正悄然成為 AI 圖像中最實用的新功能

問任何人想要 AI 圖像生成器具備什麼,他們會說寫實感、風格或速度。但問一位真正要交付作品的設計師,你會得到不同的答案:透明背景。
這個不起眼的功能——Alpha 通道——從一開始就是 AI 圖像模型的一大缺口。大多數生成器只會產出一個扁平矩形。若想要取得標誌、產品去背圖,或可放到另一個設計上的元素,你得事後把圖像送進去做去背的工具,這是另一個步驟,還會有自己的瑕疵和邊緣問題。去背工具會咬壞髮絲邊緣、抹糊半透明材質,或留下舊背景的光暈。然後你還得手動修補。正是這類摩擦,讓 AI 圖像生成用起來像只能做完成品的玩具,而不是真正能工作的工具。
Qwen-Image 2.1 把透明能力直接建進模型本身,補上了這道缺口。只要一則提示詞,就能要求一般圖像,或帶有真正 Alpha 通道的 RGBA 圖像。不需要另開模型,也不需要後處理步驟。這聽起來沒什麼,直到你想到真實設計工作有多少是在把元素層層疊加到其他元素上。透明圖像是一塊積木;扁平矩形則是死路一條。
阿里巴巴其實早在 2025 年 12 月就推出過專門的透明模型 Qwen-Image-Layered。2.1 的重要之處,在於它把這項能力收進統一的生成與編輯模型中。現在可以直接編輯透明圖層。在保持背景透明的同時改變角色表情。替換嵌入透明圖層中的文字。把真實照片裡的主體提取成可放到任何位置的 RGBA 去背圖。這個模型不只是生成透明,還能在編輯過程中保留透明——而這正是對工作流程真正重要的部分。

這些使用情境立刻就能派上用場。電商賣家需要乾淨背景的產品照,才能合成到橫幅和商品頁面中。UI 設計師需要沒有背景的圖示和插圖。遊戲開發者需要邊緣乾淨的 Sprite 素材。內容創作者需要能放進縮圖、封面和疊加層的元素。這些以往都需要一串工具:先生成器,再去背工具,接著清理,最後合成。有了原生透明,生成器直接交給你可立即使用的圖層,中間步驟全部跳過。
這裡還有更深層的轉變,關於圖像模型正在變成什麼。第一波是產出單一、自成一體的圖片,也就是「哇,你看它做出了什麼」的時代。下一波則是產出能融入工作流程的素材,也就是「你看我能用這個做什麼」的時代。透明、編輯和多圖合成全都指向同一個方向:模型不再是一台販售完成品的販賣機,而是開始成為交給你原始素材、讓你能自行組合的工具。
這對人們如何評判圖像模型很重要。發布貼文中被引用的基準測試分數,大多只衡量單一圖片看起來好不好、是否逼真、文字是否清晰可讀、手部手指數量是否正確。它們不衡量 Alpha 通道乾不乾淨、去背邊緣銳不銳利、透明圖層能不能在編輯後保留下來,或模型是否尊重你沒有要求它改變的圖像部分。這些才是專業人士在實際使用五分鐘內就會注意到的品質,卻很少出現在排行榜上。
這也是為什麼 AI 圖像的討論一直分裂成兩邊。一邊是關於模型、基準測試和突破的公開對話;另一邊是靠這些工具吃飯的人之間的私下對話,談的是工作流程、邊緣、圖層和控制權。透明屬於第二種對話,所以儘管它如此重要,卻很少受到報導。它不上相。你沒辦法像炫耀一頭逼真的龍那樣,在推文中炫耀 Alpha 通道。
對開源圈來說,一個 70 億參數模型具備原生透明,是整體門檻正在拉高的另一個跡象。一年前,你還需要專門模型或付費 API 才能取得乾淨的透明輸出。現在,這只是一個能在中階 GPU 上本機執行的模型功能。實際效果是,小型團隊和個人創作者也能取得過去屬於企業級功能的能力,而嘗試圖層化、可組合的圖像工作的成本,幾乎降到零。
仍然有限制。透明生成在處理細節、頭髮、毛皮、煙霧,以及任何半透明或纖細飄逸的東西時,還是很挑剔。模型可以為紮實物件產出乾淨的去背結果,卻可能對角色飛散的髮絲束手無策。這些正是過去讓去背工具頭痛的邊緣,模型並沒有神奇地解決它們,只是把它們移到了生成步驟裡面,讓迭代調整更容易。這是進步,但還不是完美。
這個功能很容易被低估,因為它看不見。透明背景是由「不在那裡」的東西所定義,而你無法在一張主視覺圖片中指出背景的缺席。但對那些日常工作就是要把產品去背、把主體獨立出來,或建立圖層化合成的人來說,這是「會做圖片的模型」和「會做素材的模型」之間的差別。這就是躲在一個不起眼縮寫背後的升級,而且它悄悄比本月發布的大多數花俏功能都更實用。
值得把視角拉遠,看看為什麼透明功能花了這麼久才出現。Alpha 通道在電腦圖學中早已是已解決的問題,而且幾十年來都是如此。AI 圖像模型在這方面落後,原因不是它在本質上很難,而是模型是用從網路上抓取的扁平化 RGB 圖像訓練的,而網路上大多儲存的是完成品圖片,不是分層的工作檔案。可用來訓練的透明圖像資料根本不多,因為人們不會公開自己的 Photoshop 檔案。所以模型學會了產出矩形,透明只能事後補上,不是透過另一個模型,就是靠仔細策劃的合成透明資料。
這也說明了為什麼 Qwen-Image-Layered 得先以獨立模型存在,之後才能被收進主要模型。當「透明」這個概念在訓練資料中代表性不足時,要教會模型它到底是什麼,需要紮實的功夫;而要讓這種理解在編輯後依然保留,又需要更多功夫。2.1 能在一個統一模型中同時做到這兩點,而且只有 7B 參數,這表示團隊投入了認真的努力,去打造一項永遠不會登上華麗基準測試排行榜的能力。
這種投資本身就是一種訊號。當一家實驗室把心力花在透明和本機編輯這類工作流程功能上,而不是只追逐基準測試分數,它就是在押注:圖像生成市場在於專業用途,而不只是新奇玩具。這是在賭真正重要的人,是那些需要在期限內交付乾淨素材的人,而不是只想生成一張酷圖發一次文的人。這個賭注是否會成功,是整個圖像生成產業的核心問題,而原生透明正是最清楚的體現之一。
相關文章
一次十張參考圖:AI 圖像編輯從單張操作邁向合成
單圖編輯產生變化,多圖編輯產生組合。一次十張參考圖,改變了我們提示與合成的方式。
阿里巴巴的 Qwen-Image 2.1 剛剛改變了開源模型授權的討論
技術規格令人印象深刻,但授權才是真正的故事。Qwen-Image 2.1 放棄了 Apache 2.0,轉而採用研究授權,而細則現在比以往任何時候都更重要。
通義萬相 Qwen-Image 2.1 開源:7B 小模型如何把透明圖和 10 張圖編輯裝進一張消費級顯示卡
一個 7B 的開源生圖模型,憑什麼把透明圖、多圖編輯裝進一張 6G 顯示卡?拆解 Qwen-Image 2.1 的核心升級與授權轉折。
你還分得出 AI 圖像和真實照片嗎?老實說,不能。
破綻已經消失,偵測器也不可靠。辨識 AI 圖像的誠實答案是:沒辦法,而解決方案在你們眼球的上游。