← 返回博客
Ai预计阅读 12 分钟

四步而非四十步:蒸馏如何将开放图像模型压缩进消费级 GPU

发布于 2026年10月6日
四步而非四十步:蒸馏如何将开放图像模型压缩进消费级 GPU

强大的开放图像模型与消费级显卡之间的差距已经缩小了数月。其机制在于更少的去噪步数。一个曾经需要四十次迭代才能把噪声变成图像的模型,如今只要接上合适的适配器,就能在四步、六步或八步内完成。

十月初的两个发布从相反方向再次推进了这一前沿:一篇重新思考蒸馏训练方式的研究论文,以及一个将这一思路应用于广泛使用的开放模型的生产级 LoRA。

DMAD 将分布匹配变成分类问题

这篇论文是 DMAD,全称为 Distribution Matching as Adversarial Distillation(作为对抗蒸馏的分布匹配),来自德克萨斯 A&M 大学和字节跳动的研究人员。它于 10 月 1 日首次公开,针对的是蒸馏中一项众所周知的成本。

标准做法是这样的。教师模型通过多步生成高质量样本。学生模型必须在一到四步内近似相同的分布。为了引导学生模型,需要训练一个辅助扩散模型,让它持续拟合学生模型的当前分布,然后利用教师分数与学生分数之间的差异来更新学生模型。问题在于学生模型不断变化,因此辅助模型必须一直追赶它。内存和计算开销随之攀升。

DMAD 将目标改写为分类。在共享特征主干之上设有两个判别器头。一个区分真实数据与学生样本。另一个区分教师样本与学生样本。在最优条件下,判别器的输出分数对应一个对数密度比,这意味着学生模型可以沿着由判别器分数导出的线性目标进行更新。不再需要单独的辅助分数模型。

第二个要素是依赖噪声水平的监督。教师模型在某些噪声水平上接近真实分布,而在另一些噪声水平上则明显偏离。DMAD 用第一个判别器头测量真实样本与教师样本之间的经验分数差,并据此重新加权学生模型的训练,从而让学生在教师最弱的噪声水平上更少继承教师的偏差。这把“教师总是对的”这一假设,变成了可以度量的东西。

结果覆盖了三个规模。在 ImageNet 上进行图像分类训练时,一步生成 64x64 图像的 FID 达到 1.04。FID 衡量生成分布与真实分布的差异程度,数值越低越好。

生产版本已经在发布

同样的思路通过 LoRA 适配器而非论文触达用户。阿里巴巴 PAI 在 Hugging Face 上发布了 Qwen-Image-2.1-Fun-Acc-LoRAs,将并行解码蒸馏应用于文生图和基于指令的编辑,把推理从教师模型的 40 次神经函数评估压缩到 4 次。该适配器为 rank 64、网络 alpha 64,采用 BF16,模型卡提供了 Diffusers 和 VideoX-Fun 的快速开始脚本。

模型卡坦率说明了取舍。密集的小号文字相比教师模型会退化,图像编辑结果会略微更模糊或更暗。对于带有一整段小字的海报,四步并不是合适的工具。而对于文字短且大的社交媒体尺寸图片,它就很合适。

第二个适配器在质量上更进一步。Qwen-Image-2.1 Turbo v0.2.1 是一个 rank-128、六步的 LoRA,约 648 兆字节,将基础流匹配模型冗长的概率流 ODE 压缩为一个从 1.0 到 0.25 的 sigma 调度。六步是一个折中设置:足够的迭代次数以保留细节,又足够少以保持速度。

社区蒸馏填补了梯子的其余部分。Viggle turbo 适配器面向四步。PrunaAI 的适配器面向五步或八步。两者都坦诚自己是进行中的工作,Pruna 的说明称低步数版本在多参考合成、换脸以及带有多个约束的编辑上,尚未匹配基础模型。

Krea 2 Turbo 在许可上走了不同的路线。它的两步和四步蒸馏适配器现在附带 Apache-2.0 的 ComfyUI 工作流,适用于 Comfy Cloud、本地 ComfyUI 和 Apple MLX,并支持自动切换步数。工作流层面的 Apache-2.0 对任何想在其上构建产品而无需法律审查的人来说都很重要。

对实际运行者来说,真正改变的是什么

实际效果是同样的硬件能产出更多图像,而重要的设置也发生了变化。关于 Qwen 2.1 的社区讨论建议,在加载 LoRA 时使用 CFG 2.0 到 3.0 和 40 步,并搭配约 676 兆字节的纹理修复 VAE。其他人报告称,在 2.0 百万像素下、不使用 LoRA 的标准工作流,现在能产生早期开放模型很少达到的渲染质量。

诚实的解读是,低步数蒸馏是一种取舍,而不是免费午餐。文本保真度、编辑精度和多参考一致性会最先受损,因为这些任务需要最多的迭代步数才能解析清楚。对于单一明确主体的提示词遵循度则保持得很好。

一片绿叶连续出现四次,胶片颗粒和噪点逐渐增加

这暗示的不是单一设置,而是一种工作流。用四步打草稿,挑选你想要的构图,然后以完整步数重新渲染选中的画面。蒸馏适配器让探索变得廉价,而把最终一遍留给完整质量。

研究在适配器之外增加了什么

用户下载的 LoRA 是这项工作可见的一端,但 DMAD 论文解释了为什么下一代适配器应该更好。旧方法需要一个实时辅助模型来跟踪学生模型不断变化的分布,而这种开销随每个训练步骤增长。将目标重新切分为一对判别器,就去掉了辅助模型,这意味着同样的 GPU 预算可以训练出更强的学生模型。

重新加权这个想法是更持久的贡献。把教师模型视为始终正确,这一假设限制了蒸馏学生模型能达到的上限,因为针对教师最差时刻训练的学生会继承那些错误。测量教师模型与真实数据发生偏离的位置,并对这些区域降权,是一种通用技术,应该能迁移到视频扩散、音频,以及任何其他使用蒸馏来降低推理成本的生成模态。

如何判断蒸馏适配器是否够用

决定取决于任务类型。低步数适配器擅长处理单一主体、光线清晰、大画幅的构图。它们难以应对任何需要大量迭代才能解析的内容:成段的小字、精细排版、必须在多个参考之间保持身份一致的编辑,以及同时叠加多个约束的指令。这些正是模型卡警告的情况,而且各厂商的警告是一致的。

许可是另一个变量。这些适配器中有一些带有研究用途或其他限制性条款,而商业使用问题并不总是在模型卡上写明。阿里巴巴 PAI 的发布将其许可证列为“其他”,没有说明商业条款,这意味着要将其部署到产品中的团队在发布前还有功课要做。Krea 的 Apache-2.0 工作流是例外,这种宽松许可很可能对任何在其上构建商业服务的人都很重要。

前进方向是明确的。开放图像模型正被压缩到人们已经拥有的硬件上,而且这种压缩是公开进行的,带有权重、模型卡和明确说明的局限。这种开放本身就有用,因为它让买家在投入之前判断取舍。闭源厂商可以在一次更新中降低质量,却称之为速度改进。而一个随模型卡发布、并列出自身弱点的适配器不能这样做。

关于该测量什么的说明

在这个领域,速度声明很容易被夸大,因为步数只是延迟的一个输入因素。分辨率、批量大小、采样器以及每个提示生成的图像数量,对实际耗时的影响远比标题上的步数所暗示的更大。在中端显卡上以高分辨率运行四步适配器,可能比在同一硬件上以草稿分辨率运行四十步更慢。

对买家真正重要的比较,是在他们实际拥有的硬件上、以他们实际需要的质量,每分钟能产出多少张图像。模型卡很少报告这个数字,因此必须在本地测量。适配器让这种测量变得便宜,这才是真正的好处。四步足够快,可以跑完那个告诉你四步是否足够的实验。

接下来该关注什么

适配器和论文指向同一个方向。开放图像模型的推理成本持续下降,每一次新的蒸馏都在缩小消费级显卡与租用加速器之间的差距。值得追踪的问题是:下一轮适配器是否会弥合文本渲染和参考保真度的差距,还是这些限制实际上是低步数生成本身固有的。在这一点尘埃落定之前,明智的姿态是把步数视为多个旋钮中的一个,并在你实际拥有的硬件上测量每分钟图像数。

相关文章