开源生图被压到一张消费级显卡:混元 DiT 把门槛砍到 6G 显存

过去一年,开源文生图的更新基本围着画质转。谁的字更清楚、谁的光影更像摄影,谁就能在榜单上多待几天。到了这个十月,风向有点变。社区讨论的焦点不再是"哪张图更好看",而是"我这张显卡,到底跑不跑得动"。
6G 显存这条线,是被硬啃下来的
腾讯混元文生图大模型(混元 DiT)最近放出的消息里,最实用的一条是开源了"小显存版本"。按官方说法,6G 显存就能把它跑起来。这个数字的分量,用过开源生图的人都懂:此前想在本地跑一套像样的文生图,16G 显存几乎是起步价,8G 属于勉强,6G 会被直接劝退。

配套动作也跟上了。这个版本连 LoRA、ControlNet 这类插件一起适配进了 Diffusers 库,还补上了对 Kohya 图形界面的支持。Kohya 在社区里的角色,就是把"训练自己的 LoRA"从命令行的门槛里拽出来,变成点几下鼠标的事。它被接进来,等于把"我想让模型学会我自己的画风"这条路铺平了。
同时,混元 DiT 本体升到了 1.2 版,官方给出的改善集中在画面纹理和构图上。这两项恰好是开源模型长期被诟病的地方:细节一多就糊,构图一复杂就散。
另一条消息更容易被忽略,却很关键:腾讯把混元的标记模型"混元 Captioner"也开源了。打标模型是训练 LoRA 的第一道工序,你得先让机器把每张素材拆成一句句可读的描述,才谈得上训练。过去这一步要么用闭源接口,要么用质量参差的替代品。它开源之后,本地训练链条上又少了一个对外部服务的依赖。
开源模型跑起来之后,社区在忙着"修"
混元这边的进展属于把路修宽,而社区正在给另一条线打补丁。Qwen-Image 2.1 开源后引发了大量二创,随之而来的是一轮密集的修复潮。
比较有代表性的一个组合是 Qwen-Image-2.1-viggle-turbo:7.26GB,6 步推理,int8 量化,常被用来快速产出角色设定图,再配一个 676MB 的 texture-fix VAE 补纹理。另一位作者的 Fix v2.0 声称能去掉 Qwen 那层标志性的噪点和杂乱细节,而且几乎不动构图。还有一个 Opinionated 版本画面更锐利,代价是会轻微移动画面,作者把它和一套从 RES4LYF 派生出来的 res_2m_nc 采样器打包在一起发布。
这些补丁听起来琐碎,却说明一件事:当一个开源模型进入实际生产,真正决定它好不好用的,往往不是发布当天的那一版,而是接下来几周社区愿不愿意为它写修复。
社区里还沉淀出一些可直接抄的参数。有人在 Qwen 2.1 上加载 LoRA 后给出的建议是 CFG 取 2.0 到 3.0,40 步,采样器用 res_multistep 或 beta。另一位跑无 LoRA 的 2.0MP 标准工作流,说新版的 Qwen 图像模型出了一种以前只在闭源模型里见过的 Midjourney 味道。
速度上也有明显进展。Krea 2 Turbo 一个两步蒸馏的 LoRA 检查点,把 1024x1024 的去噪时间从 76.4 秒压到 19.3 秒,差不多是四倍。代价是细节质感只剩老师模型的 0.97 到 1.09 倍之间,远好于原生 Turbo 两步的 0.40 到 0.65 倍,但特写类的画面表现最好,大场面还差点意思。
顺手也补上的那些小缺口
除了主线模型,社区里几款小众但口碑稳的开源模型也在慢慢补齐短板。Anima 的 Aesthetic v1.1 和 One Obsession v4 常被拿来做风格化产出,用户称赞它风格听话、提示词好写,固定种子后改提示词就能得到连贯的变体,还能渲染短文本。它的弱点同样坦白:多角色同框和长文本仍然吃力,社区在等 Anima 2。
Krea 2 这边,抱怨集中在"不同种子看起来差不多",于是有人摸索出一套不加 LoRA、不装模型专属节点的办法:复用 ComfyUI 的文本编码器(比如 Qwen3VL 4B)当 LLM 来扩写提示词,把提示词种子当成粗调旋钮、采样种子当成微调旋钮。这种"土办法"流传得快,往往比官方文档更能解决实际问题。
门槛下移之后,比的是什么
把这些动作放在一起看,方向是清楚的。开源生图不再只回答"能不能画得像",开始回答另外两个问题:能不能在我买得起的机器上跑,以及能不能按我的意图精确地改。
混元把显存压到 6G、把打标模型开源,是在回答第一个问题。Qwen 社区那批修复和加速 LoRA,是在回答第二个问题里的"改得准"和"跑得快"。两条线看似无关,落点却是同一个:让生成这件事从演示走向日常。
对普通创作者来说,这大概是近一年最实在的变化。你不需要再为了一张图去租算力,也不必为了换风格重装整套环境。一块几年前的中端显卡,加上社区攒出来的那套工具链,已经够你做出一组像样的作品。
真正被压缩的,是"想试试"到"真的开始做"之间的距离。