2026 年在自己硬體上執行圖像模型:本地社群實際使用的工具

問問 r/StableDiffusion 這個月本地該跑什麼,你會得到比預期更長的答案。這個 subreddit 一直是本地生成的最前線,但過去幾週顯示出一個異常慷慨的社群氛圍:新工具、完整的大學課程、移植的執行環境,以及一波適合大多數人現有硬體的新開放模型。
以下是實際討論串所揭示的內容。
模型堆疊已經多元化
Z-Image Turbo 不斷被提及為入門選擇。一位擁有 RTX 5070 Ti 和 16 GB VRAM 的新手本週問到該從它升級到什麼,這說明它已成為全新本地設置的預設起始模型。快速、輕量且對記憶體友善,它是人們在釐清自己真正想要什麼之前,最先安裝的模型。
Qwen Image 2.1 是仍能裝進消費級機器的新重量級模型。社群移植幾乎立刻出現:TensorSharp 中的 GGUF 版本,支援編輯和 LoRA;原生 Apple Silicon 執行環境,在 M1 Max 上約 24 秒生成 512x512 圖像;以及 Fooocus 風格的 Gradio 前端,支援遮罩、外擴和姿勢參考。與 Krea 2 進行的 192 張圖並排比較,按類別排序,讓人們有具體的東西可以爭論。在文字渲染和編輯方面,它正把大量使用者從較舊的檢查點拉走。
Krea 2、Flux 2 Klein 和 LTX-2.5 充實了陣容。一篇 EasyAI 發布貼文將它們全列為初學者桌面 GUI 中的一級選項,這是人們實際載入什麼的好指標。
工具落差正在縮小
工具落差一直是本地生成持續不斷的抱怨,特別是針對 ComfyUI 的節點圖。本月有兩個專案從不同角度切入。EasyAI 是一個 PySide6 桌面應用程式,位於 ComfyUI 前面,將體驗簡化為提示框和一個按鈕,針對那些對自訂節點感到卻步的人。Fooocus 風格的 Qwen 工作室採取相反路線:保留複雜性,但以單頁工作室的形式呈現,並附帶合理的預設值。兩者合起來涵蓋了這個社群一直以來的受眾分歧:想把圖形隱藏起來的人,以及想把它組織好的人。
甚至還有一個值得一提的小眾奇聞。一位工程師讓圖像生成在 RP2350 微控制器上運行,在兩美元的晶片上生成郵票大小的圖像。沒有人會為了生產工作而轉向它,但它說明了這些模型壓縮到什麼程度,以至於社群慶祝微控制器移植的方式,就像過去慶祝新檢查點一樣。
學習資源變得認真
一門免費的十四講生成式 AI 大學課程本月發布了第二講:使用 Z-Image Turbo 從頭建構 ComfyUI 工作流程,涵蓋依賴管理、模型檔案,以及追蹤封裝工作流程的每個階段。AI Horde,這個自 2022 年以來一直運行的群眾外包免費推論服務,推出了新介面、新後端和文件,這對任何沒有 GPU 但仍想嘗試的人來說,默默地重要。
硬體數學看起來如何
Reddit 硬體討論串給出了真實世界的下限。本週經常被引用的入門問題來自一位擁有 RTX 5070 Ti 和 16 GB VRAM 的人,詢問除了 Z-Image Turbo 之外還能跑什麼,回覆平實地描繪了這個空間:如果你接受對較重的部分進行量化,幾乎所有當前開放目錄都能裝進 16 GB。在另一端,一位 5090 擁有者以未量化方式運行 Qwen Image 2.1 的完整 BF16 去噪器,只需要量化文字編碼器作為記憶體優化。Apple Silicon 以不同方式縮小了差距:32 GB 統一記憶體運行原生 Qwen 執行環境,每張 512x512 圖像約 24 秒。
較舊、較簡樸的硬體也沒有被鎖在外面。EasyAI 貼文和 AI Horde 都是為那些機器完全無法運行當前模型的人而存在,而一個長期存在的 subreddit 討論串,來自一台配備 MX500 等級 GPU 的筆記型電腦,顯示低端仍在用 SD1.5 衍生模型排除故障,朝可接受的輸出邁進。現實的訊息是,下限已提升到「過去三年的遊戲 PC」,而上限則完全停留在原來的位置,這與大多數軟體趨勢的走向相反。
實際挑選配置
如果你現在要組裝本地設備,社群共識分為三個層級。低 VRAM,8 到 12 GB:Z-Image Turbo 或量化 Qwen 變體,以速度作為取捨。中階,16 GB,例如那張 RTX 5070 Ti:當前開放目錄大多能順跑,問題變成你需要哪些編輯功能。高階,24 GB 以上,或配備 32 GB 統一記憶體的 Apple Silicon:全精度 Qwen Image 2.1,支援編輯、LoRA 和多參考工作流程。
儲存空間是沒有人警告過你、被低估的限制。這世代的模型檔案,從快速變體的幾 GB 到全精度的二十多 GB 不等,而 ComfyUI 工作流程模式中保留多個已安裝模型的做法,會迅速倍增。大學課程的第二講花了整整一個段落講解如何在不重啟伺服器的情況下更新模型檔案,這告訴你工作流程的摩擦真實到足以拿來教。
同一批討論串中有一個誠實的警告:未審查和無限制的變體廣泛流傳,其中一個此類模型 Nanosaur 2 的高參與度發布,在幾天內獲得數百個讚和近一百則留言。本地生成意味著本地責任。無論你運行什麼,你都擁有輸出,包括法律風險。社群自身的禮儀強化了這一點;未披露的寫實圖像被其他使用者監管的可靠性,勝過任何平台。
為什麼本地持續重要
當託管服務只需點擊一下時,很容易問為什麼這一切會持續存在。本月的事件三次提供了答案。一個人們已經圍繞其整合的獨立產品 DALL·E,在八月底退役並併入 ChatGPT Images,讓所有人按照別人的時程遷移。託管工具的免費層級隨著使用者無法控制的計費決策而波動。而 AI Horde 展示了第三條路:一個由志工運營的群眾外包推論網路,古老到已經比幾個商業轉向存活得更久。
本地生成是唯一由你掌握路線圖的選項。模型明年的運行速度和今天一樣,權重不會在提示下改變,工具在公開環境中改進。當一個 7B 模型在基準測試中接近前沿系統,而一鍵前端取代節點圖考古時,問題已經轉變。以前是「我的機器能跑這個嗎?」現在是「這些裡面我真正想要哪一個?」
相關文章
在家運行 AI 圖像生成:2026 年務實指南
本機 AI 圖像生成終於能在普通硬體上運作。以下是 2026 年務實指南:顯卡、模型、工具,以及沒人提到的成本。
每月二十款新圖像模型,我的提示詞依然有效:結構優先提示法的理由
為什麼結構優先提示詞能在模型汰換中存活,以及提示詞庫中該保留與捨棄什麼。
一個人做 AI 漫劇:從寫劇本到成片的完整流程
劇本、分鏡、生圖、配音、剪輯五步全流程拆解,附角色一致性技巧與避坑指南,一個人也能做出 AI 漫劇。
Guizang PPT Skill:直接在 Claude Code 中製作令人驚豔的 HTML 投影片
Guizang PPT Skill 能將任何文章變成精美的 HTML 簡報——雜誌風或瑞士風、AI 圖片、簡報者工具,可透過 npx 或 git clone 安裝。