本地模型困境:為何創作者持續追逐不受限制的圖像模型

本週有一則 Reddit 討論串,實際上是在問:有沒有人擁有比 Z-Image-Turbo 更適合 RTX 5070 Ti 的、更好的不受限制圖像模型。這個問題如今幾乎每天都會以不同形式出現在 r/StableDiffusion。擁有堪用本地硬體的人不斷尋找不會拒絕他們的模型,而答案也不斷變動。值得理解為何這個問題反覆出現,因為它真實在某種程度上反映了 AI 圖像生成正走向何方。
「不受限制」到底是什麼意思
這個詞承載了很多含義。大多數要求不受限制模型的人,並不是想做任何違法的事。他們只是厭倦了雲端服務會拒絕某些提示詞、在輸出加上浮水印,或默默軟化某種風格。在本機執行會完全移除審核層,因為模型就在你的機器上,沒有人能說不。這就是它的吸引力,而且這種吸引力比「無審查」這個詞所暗示的更廣泛。
這種吸引力真實且正在增長。Nanosaur 2 被宣傳為一款無審查的開放圖像模型,本週在 r/StableDiffusion 上發布,一天內就獲得超過 300 個讚和近 100 則留言。留言中既有真心熱情,也有常見的玩笑,但數量說明了需求。人們想要掌控權,而且願意用一些精緻度來換取。
為什麼本地端進步得這麼快
硬體已經跟上了。像 RTX 5070 Ti 這樣的 16GB 顯示卡,現在能執行三年前還需要資料中心才能跑的模型。Qwen-Image 2.1 的 7B 生成器在這類顯示卡上,約 25 秒就能渲染出一張 100 萬像素的圖像。Z-Image Turbo、Flux,以及一批不斷輪替的較小型微調模型,全都能在家輕鬆運行。入門門檻已經從「你需要一台伺服器」崩降到「你需要一張還不錯的顯示卡」。

軟體也跟上了。ComfyUI 提供節點圖,讓你不用寫程式就能串接遮罩、補圖和控制。一波對初學者友善的前端工具已經出現,為了解決社群不斷碰到的問題:人們想要 ComfyUI 的強大功能,卻在還沒做出第一張圖之前就卡在節點圖上。有一個專案 EasyAI 明確要解決這個問題,它把 ComfyUI 包裝成桌面應用程式,將流程簡化為挑選模型、輸入提示詞、生成。
炒作貼文不會提到的取捨
本地端並非沒有成本。你要付出 VRAM、模型檔案的磁碟空間,以及當相依套件更新時,為了不讓工作流程壞掉所花費的時間。量化有幫助,但它是一種妥協,不是魔法。有幾位使用者指出,他們必須在 5090 上同時執行量化的文字編碼器和全精度的去噪器,才能塞得下一個模型。這種折騰正是炒作貼文略過不提的。
另外還有編輯方面的落差。多圖條件調節在消費級硬體上的擴展性很差。你每加入一張參考圖,延遲就會增加,而編輯始終是最慢的操作。任何需要大量空間推理或一次吃進許多參考輸入的工作,雲端服務仍然領先。如果你的工作流程是「快速生成一個想法然後反覆調整」,本地端很棒。如果是「把十張參考圖合併成一個連貫場景」,你就會感受到等待。
接著還有那個顯而易見卻少人提起的問題:著作權與肖像。那則詢問不受限制模型的討論串裡,也有人問如何生成能在新姿勢和服裝中保留真實演員臉孔的圖像。這是個灰色地帶,而且工具愈好,問題就愈棘手。模型會樂意照做。但你該不該這麼做,是另一個問題,再多的本地硬體也無法解決。
認清你放棄了什麼
這裡有一場關於品質的真實討論,卻往往被埋沒。「不受限制」的開放模型在困難的事情上,通常比旗艦閉源模型落後一步,例如文字渲染、複雜構圖和邊緣案例。追逐這類模型的人,通常是在自由與精緻度之間選擇了自由,這是個站得住腳的選擇,但終究是個選擇。如果你需要一個能優雅處理混亂提示詞的模型,不受限制的選項可能會讓你失望。
社群在被追問時對這點很誠實。那些慶祝新的無審查模型發布的討論串裡,也同樣有人默默指出,你重新生成和修正的時間,會比用一個調校好的閉源模型還多。自由是真的。額外的工作量也是真的。大多數有經驗的使用者最後會兩者並用:用閉源模型追求品質,用開放模型換取控制權。
生態系正在填補缺口
在模型本身之外,一整個支援生態系正快速成長,值得了解,因為它改變了新手的盤算。AI Horde 是一項自 2022 年以來持續運作的免費群眾外包推論服務,本月重新上線,帶來新介面、新的圖像生成前端、新後端,以及全新文件。它的訴求很簡單:你可以在不用 GPU 時貢獻閒置算力,並在需要進行本地跑不動的渲染時,取用社群匯聚的算力。
這類基礎設施低調卻意義重大。它意味著本地圈不只是硬體門檻很高的業餘愛好者小眾。沒有好顯示卡的人也有參與的途徑:貢獻算力或借用算力,完全不必碰雲端訂閱。這是一個與 API 巨頭截然不同的模式,而且完全建立在自願合作之上。
工具層也在補齊。除了 ComfyUI 及其更親民的包裝之外,人們正在為特定工作流程打造專門前端,例如角色設定表、透明素材、姿勢控制。這和開源軟體曾上演的模式相同:核心工具依然難以學習,而圍繞它生長的眾多專用工具,會一次一個利基市場,讓困難的部分變得更容易。
人們為自己畫下的道德界線
很容易把這整場對話簡化成「人們想要無審查模型」,但這樣就忽略了細微差異。社群其實相當認真思考界線在哪裡,而那條界線並不是「什麼都可以」。那些想要一個不會拒絕前衛藝術風格的模型的人,往往也是看到濫用時最先出聲指責的人。
對他們來說,重要的區別在於題材與執行方式。他們想要的是風格自由、能創作的圖像類型自由,以及創意探索的自由。大多數人對深偽、未經同意的圖像,或真正有害的使用情境並不感興趣。對「不受限制」的需求,多半是對創作自由的需求,而不是要求移除所有道德護欄。
這個區別正是雲端供應商大多未能尊重的地方,也是本地圈持續成長的一大原因。當模型因為觸發關鍵字過濾器而拒絕一個無害的提示詞時,那感覺不像是安全,而像是審查,並促使人們去執行自己的模型,在那裡做出自己的判斷。諷刺的是,這種高壓式的審核,可能正在創造它原本想防止的、對無審核模型的需求。
這一切將走向何方
對本地、不受限制模型的需求不會消失,供給也不會。每一次小型開放模型的發布,都讓繼續使用雲端訂閱的理由又少了一些。有趣的問題不是本地端是否會追上,而是當「完全控制、無需帳號、不會拒絕」成為預設期待,而非進階使用者的利基時,雲端供應商會怎麼做。
目前,對 RTX 5070 Ti 這個問題的誠實答案是:取決於你想做什麼,以及你願意花多少時間折騰。模型確實存在。取捨只是移動中的目標,而且每週都會移動一點。
相關文章
你還分得出 AI 圖像和真實照片嗎?老實說,不能。
破綻已經消失,偵測器也不可靠。辨識 AI 圖像的誠實答案是:沒辦法,而解決方案在你們眼球的上游。
可能改變開源 AI 圖像的無聲授權轉變
開放權重已經不再是一年前的意思。就在模型越來越好之際,授權細則也變得越來越複雜。
通義萬相 Qwen-Image 2.1 開源了:7B 參數憑什麼敢叫板 Google 和 OpenAI
一個 7B 的開源生圖模型,憑什麼和 Google、OpenAI 掰手腕?本文拆解 Qwen-Image 2.1 的成績單、核心能力與授權爭議。
開源 AI 影像堆疊正被重建,一次一個工作流程
Workflow1111 以 73 個節點和 11 條管線重現 AUTOMATIC1111。社群重建對本地影像生成的意義。