一个 2.6 亿参数的图像模型通过循环复用相同模块,击败了规模大 6.5 倍的对手

一篇新论文提出了一种扩展文本到图像模型的不同思路,其结果属于那种会让人忍不住多看两眼的数字。通过在每个去噪步骤中反复运行一组共享 Transformer 模块,而不是增加新参数,一个据称拥有 2.6 亿参数的模型击败了规模大 6.5 倍的对手,同时使用的计算量约少 4.9 倍。这项技术被称为循环扩散 Transformer(Looped Diffusion Transformer),其背后的想法在机器学习其他领域早已为人熟悉。
原理是跨深度进行权重共享。标准图像模型通过堆叠更多模块来变强,而每个模块都带有自己的参数。循环模型在单个去噪步骤内反复运行一小组模块,因此同一组权重在图像最终生成前完成更多工作。计算量会随循环次数增加,但参数量保持不变,这改变了任何思考模型将在何处运行的人的计算。
为什么参数放在哪里很重要
参数量和计算量通常被放在一起讨论,但它们约束的是不同东西。参数决定模型占用多少内存,也往往决定它能否装进一个人实际拥有的硬件。计算量决定生成需要多长时间以及服务成本是多少。
用循环次数换取参数的设计瞄准的是第一个约束,同时不忽视第二个。报告的 4.9 倍计算节省表明,在这个基准上这种取舍是有利的,不过论文中的结果并不等同于已发布检查点的结果,而且循环架构的训练稳定性在早期工作中一直是个反复出现的担忧。
开放图像竞赛如今比的是占用空间
时机之所以相关,是因为开放图像社区过去一年一直在另一条轴上竞争。内存占用成了一个明确目标,模型宣传自己需要多小的显存,以及通过蒸馏技术减少采样步数。减少步数的方法和减少参数的方法从同一流程的两端解决问题。循环扩散 Transformer 位于参数这一端。
斯坦福 NLP 的一项相关结果也朝着类似方向前进。一种名为 UniEvo-VL 的方法使用同策略自蒸馏(on-policy self-distillation),让单个模型同时充当教师和学生,在没有外部教师模型的情况下,将基于 Qwen 的图像模型的 GenEval 分数从 0.747 提升到 0.808。贯穿其中的主线是一样的:从给定模型中挤出更多能力,而不是训练一个更大的模型。
这不仅仅是一种研究偏好。开放权重文本到图像排行榜的顶部是一个规模适中、彼此紧咬的集群。Qwen-Image-2.1 以约 1,036 Elo 领先,其生成组件有 70 亿参数,领先于 FLUX.2 dev 和 HunyuanImage 3.0 Instruct。最好的开放模型仍大幅落后于 OpenAI 的 GPT Image 2.5 Sunburst,后者接近 1,197。如果前沿在规模上遥不可及,效率技巧就成了较小实验室留在对话中的方式。
诚实的注意事项
第一,标题级对比只来自单一基准。一个规模大 6.5 倍的对手在一次评估中输给循环模型,并不意味着这项技术在所有地方都获胜,而图像质量对提示词和采样器选择出了名地敏感。第二,这个领域里自我报告的胜利有个习惯,就是在独立测试下缩水,尤其是当推理没有在相同硬件和设置上运行时。第三,循环以训练简单性换取推理效率,而当循环次数设置错误时的失败模式,并不能从发布摘要中明显看出。
这些都没有推翻方向。对实际创作者来说,有趣的问题不是 2.6 亿参数模型是否在表格中击败了 6.5 倍对手。而是这种设计是否会出现在可下载的检查点中,并且能在消费级 GPU 上运行,而不需要四小时设置。效率技术一直如此:它们从论文开始,被社区微调吸收,然后在一两个月内变成一种预期,而非一项功能。
值得关注什么
留意循环式或权重共享式设计是否出现在已发布权重中,而不只是论文里,以及计算节省能否在更高分辨率下保持——在那里注意力成本占主导。关注下一轮开放发布后的排行榜,因为一项降低参数门槛的技术往往会表现为多个新模型同时落入同一效率区间。
这批研究带来的更广泛教训是,图像生成中的扩展讨论已经成熟。增加参数仍然有效。但更活跃的工作是让给定模型用更少资源做更多事,而这类进步到达笔记本电脑的速度比到达数据中心更快。
为什么循环是个老想法却有了新动力
跨深度权重共享并不新鲜。它出现在多年前的循环网络中,也出现在若干语言模型中,这些模型复用一组层而不是堆叠唯一的层。如今它对扩散模型有意思的原因在于生成过程的结构。生成图像要经过许多去噪步骤,而每一步本来就会运行整个网络。在一步内循环增加了第二个重复轴,这意味着计算倍数和质量增益可以在某种程度上独立调节。
取舍是真实存在的。复用权重会让训练更难,因为每次循环的梯度都必须流回同一组参数,而循环过于激进的模型可能会丢失精细细节。报告的结果使用了一个论文有资源去调优的特定循环次数;已发布的检查点必须能在广泛用户的提示词上工作,这是更严格的测试。
还有一个实际原因会让社区比基准所暗示的更关心这件事。几乎所有流通中的开放图像模型都会部分根据它需要多少显存来评判,因为运行它们的人用的是一两块消费级 GPU,而不是集群。一种降低参数门槛而不会成比例损害质量的设计,直接面向这群受众,而这个受众如今已经大到足以影响哪些技术会被采用。
效率军备竞赛有两条战线
把被笼统归为“效率”的两个杠杆分开会更有帮助。步数蒸馏减少去噪次数,主要降低生成时间和每张图像成本。参数削减——也就是循环设计所瞄准的方向——主要降低内存和下载体积。模型可以又快又大,也可以又慢又小,最佳匹配取决于机器。
过去一年的开放图像发布一直在强力推进第一个杠杆,四步和两步变体已成为任何以交互方式运行的模型常态。第二个杠杆进展较慢,这就是为什么一项关于参数效率的结果会显得突出。如果它能站住脚,预计会与蒸馏采样器结合,产生既小到能装下、又快到能使用的模型,这大致就是端侧图像生成故事一段时间以来一直前进的方向。
这一切并不能由一篇论文保证。但方向是清晰的,而且对任何曾排队等待生成单张图像的人来说,回报是实实在在的。
相关文章
AI 视频价格战:Luma 将 Seedance 费率最高下调 73%,Runway 开始转售竞品
如今各引擎的差距已经足够小,账单比排行榜更有参考价值。
两款语音模型刚刚重设标杆:首段音频 50 毫秒,以及一个跑在笔记本 CPU 上的 99M 模型
质量已经趋同,竞争转向了模型跑在哪里、启动有多快、每次调用要多少钱。
Moonshot 的 Kimi K2.6 可同时运行上千个智能体,并在十小时内建成一个编译器
一千个各自都需要监督的智能体,放大的是监督量,而不是产能。
Oracle 将智能体编排嵌入 ERP,治理的算式就此改写
智能体的能力已不再是头条。如今的头条是:企业能否在事后证明,它的智能体究竟做了什么。