← 返回博客
Ai11 分钟

训练文本到图像模型的速度刚刚提升了 3.6 倍

发布于 2026年9月27日
训练文本到图像模型的速度刚刚提升了 3.6 倍

训练一个图像模型就是一场等待游戏。你要花上几周时间,外加一大笔 GPU 开销,才能教会一个网络把文字变成图片,而其中大部分时间都花在了计算那些看起来本该可以复用的东西上。本月由 Linum AI 发布、正在广泛流传的一篇论文,宣称在文本到图像模型的训练上实现了 3.6 倍的加速,而它背后的技术即便你从不亲自训练模型,也值得了解一下。

这项工作名为 JIT-DDT,它属于让扩散模型训练更高效这一研究脉络。扩散模型,也就是驱动大多数图像生成器的那个模型家族,其工作原理是学习逆转一个加噪过程。训练它们意味着要反复让模型跑在逐步被破坏的数据上,在众多时间步上做前向和反向传播。其中大量的计算是冗余的,而这种冗余并不明显,除非你仔细去看训练循环实际上把时间花在了哪里——而这正是这篇论文所做的。

那个醒目的结果——训练速度提升 3.6 倍——意味着原本要花三周的同一个模型可能只需一周,或者同样的预算可以通过跑更多轮迭代来训练出更好的模型。对于一个算力是主要成本、迭代速度决定胜负的领域来说,这是一个有分量的数字。它降低了小型实验室和开源团队的门槛,这也是 Hacker News 上的讨论串会如此热闹的原因。评论照例五花八门,既有对基准测试条件持怀疑态度的人,也有立刻看出更深远含义的人:训练更便宜意味着更多模型、更多实验,以及对所有人来说都更快的反馈回路。

更大的背景是,训练效率本身已经成为一片独立的研究前沿。几年前,面对“我们怎样才能得到更好的模型”这个问题,答案几乎总是“更多算力”,而更多算力意味着“更多钱”,也就意味着这个领域会向最能花钱的一方倾斜。如今,这个领域也在问“我们怎样才能用更少的东西得到同样的结果”。这其中有经济因素,有环境因素,也有一种认识:扩展曲线不可能永远是唯一的杠杆。到了某个节点,蛮力的成本会超过即便最大的实验室也愿意支付的限度,效率于是成了竞争优势。

具体到图像生成,效率提升带来的影响尤其巨大。相对于自身规模而言,图像模型的训练成本很高,因为图像是高维的,而扩散过程需要很多步。它们的推理服务成本也很高,因为每一条用户提示词都会触发一次全新的生成,有时还会并行跑上好几个。加速训练的技术往往有加速推理的“同胞兄弟”,所以一项训练上的突破可以传导为更快、更便宜的产品。这种联系并非自动成立,但那些底层的洞见——关于哪些计算可以被跳过或复用——往往会迁移过去。

开源这一角度在这里很重要。3.6 倍的训练加速,主要受益者是那些原本负担不起旧成本的人,也就是开源社区和创业群体,而不是拥有最大集群的实验室。巨头们可以消化低效,他们只要往里砸更多算力就行。小玩家做不到,所以每一次效率提升都在扩大他们能够尝试的范围。当训练变便宜时,更多人有能力构建自己的模型,这又助推了开源图像模型不断缩小与闭源模型差距的趋势。效率研究与开源模型浪潮是相互强化的,彼此都让另一方变得更易触及。

这又与本月其他几条大新闻相关。Qwen-Image 2.1,一个能在消费级硬件上运行的 70 亿参数模型,就是效率能买到什么的示范。在中国创作者平台上流传的各种整合包,那些“6GB 显卡也能跑”的教程,全都依赖同一个假设:图像模型可以被做得又小又快,同时不掉太多质量。训练效率就是这一假设的上游版本。如果你不能高效地训练,你就负担不起对最终会跑遍各处的小模型进行反复迭代。

有一个值得记住的保留意见,它适用于每一篇训练论文:在特定设置、特定硬件、特定数据上测得的加速,并不总能干净地迁移到其他设置上。这个结论是真实的,但 3.6 倍这个数字只是某一种配置的结果,你的实际效果取决于具体细节——模型规模、数据分布、硬件。这不是要否定它,只是解读机器学习结果的标准方式,而 Hacker News 讨论串里那些质疑确切数字的人,正是在正确地运用这种解读。

尽管如此,方向是明确的。训练正变得更便宜,图像模型正变得更易获取,而受益最大的人,恰恰是那些曾被成本挡在门外的人。每一篇效率论文,哪怕是那些夸大了数字的,都在把这个领域推向一个世界:构建一个图像模型是小团队也负担得起去尝试的事情。这是一种结构性变化,而不是一次性的成果。

3.6 倍的加速只是其中一步,它表明效率前沿正以和能力前沿一样快的速度向前推进。对任何关注这个领域的人来说,这正是一种日后会以“你真的能跑起来的模型、你真的拥有的硬件、真正存在的团队训练出来的”形式显现出来的进步。基准测试抢走了头条,但正是那些效率论文,才让这些基准测试成为可能。

值得再深入一点去理解,扩散模型训练为什么一开始就是浪费的,因为正是这一点让加速成为可能。扩散模型的学习方式是:反复观看带有不同程度噪声的图像,并学会去除这些噪声。训练循环会采样一个噪声水平,把图像破坏到那个程度,然后让模型预测干净版本,如此反复,跨越许多噪声水平。大量计算都花在了在略微不同的噪声水平上重复处理同样的信息,而那个添加噪声的前向过程在每一步之后就被丢弃了。如果你能避免重新计算那些不变的部分,或者跨步骤复用信息,浪费就消失了,训练也就加速了。

这就是扩散领域大多数效率工作的总体形态,而 JIT-DDT 只是这类技术不断增长的目录中的一条。对普通读者而言,具体的机制不如它所展示的模式重要:一个曾经把算力视为无限可用的领域,如今把它当作需要节约的东西来对待,因为事实证明,那些浪费从来都不是必需的,只是从未被审视过。从某种意义上说,每一篇效率论文都在提醒我们:早期的实现是为了开发的快而构建的,而不是为了执行的快,而且还有大量空间可以挖掘。

环境这一角度也值得一提,即便它不是头条。训练一个大型图像模型有实打实的能耗成本,而在其他条件相同的情况下,3.6 倍的缩减就是这项成本 3.6 倍的缩减。在 AI 的环境足迹已成为公共辩论一部分的这一年,效率不只是经济上的胜利,它也是让这项技术更可持续的一种方式。这不是研究者做这项工作的原因,但它是一个值得注意的后果。

对于只想使用图像生成的人来说,这一切都不需要采取什么行动。效率提升会以间接的方式显现:更便宜的 API、更快的本地模型、更多的开源发布。但理解这些收益从何而来,会改变你阅读新闻的方式。当某个实验室宣布一个新模型比预期更便宜或更快时,原因往往不是某个单一的巧妙花招,而是累积的效率研究在底下默默工作——就像一辆更快的车,通常是上百项小改进的结果,而不是某一次突破。

相关文章