← 返回博客
Ai预计阅读 9 分钟

SparkDiffusion 将 720p 视频生成从 79 分钟压缩到 18 秒

发布于 2026年10月2日
SparkDiffusion 将 720p 视频生成从 79 分钟压缩到 18 秒

一段原本需要约 4,769 秒才能生成的 720p 视频,如今在单张 RTX 5090 上只需约 18 秒。取得这一成果的团队——来自北京大学、清华大学和阿里巴巴的研究者——已将代码以 SparkDiffusion 之名开源,而这约 265 倍的加速,属于那种会改变一条流水线能做什么、而不只是让它更快跑完的数字。

这个说法值得对照它的实现方式来审视,因为如此巨大的提速通常都藏着一个星号注脚。SparkDiffusion 组合了三项各自独立成熟的技术:稀疏注意力、少步蒸馏和 FP8 量化。稀疏注意力避开了扩散视频模型通常耗费大部分时间的那一整个注意力矩阵计算。少步蒸馏训练模型以远少于常规数十步的去噪步数达到良好样本。FP8 则降低了计算的数值精度。三者叠加,每段视频的运算量便轰然崩塌。

硅晶圆的极微距特写,蓝白色光轨疾速掠过其上,暗示着极大的速度提升

为什么那个星号注脚依然重要

稀疏注意力和少步蒸馏都是以牺牲一点质量来换取大幅提速。对任何打算部署它的人来说,真正该问的问题是该质量会落在哪里。在单张消费级显卡上做到 265 倍确实令人印象深刻,而带来这一结果的方法也可能让精细细节变糊、或削弱运动的连贯性。论文报告的是加速倍数;而输出能否经受专业审视,才是工作室在信任它之前会做的测试。

即便有这个保留,方向本身依然意义重大。视频生成一直被定价为数据中心级别的工作负载。一段 720p 短片需要集群才能在合理时间内渲染,这就迫使每个团队都转向 API,等于把成本模型交到别人手里。把单张 GPU 上的渲染时间降到几秒,这笔账就变了。迭代变得便宜,而便宜的迭代正是把一台生成器变成你能真正用来探索的工具的关键。

同一个故事的另一个角度

在攻克视频成本这件事上,SparkDiffusion 并非孤军。NVIDIA 的 Sana 项目发布了 SoL-Refiner,一个单步视频精修模型,能把任意生成器输出的低分辨率结果变成清晰的 2K 或 4K 视频,报告端到端提速 8.91 倍。这个设计与 SparkDiffusion 的所作所为互为补充:SparkDiffusion 加速生成,SoL-Refiner 加速打磨。两者合起来指向一条两阶段流水线——昂贵的模型少做一些,廉价的精修器负责收拾。

与此同时,质量前沿仍在推进。Artificial Analysis 发布了 AA-Video-T2V v2.0 基准,基于约 1,000 条提示词、超过 68,000 份人类偏好投票构建,并以 1080p 评判所有模型。Wan 3.0 以 1157 的 Elo 分登顶榜单,价格为每分钟 12 美元,在 20 项分类排名中拿下 10 项第一。而 12 美元这个数字正是故事的另一半。一个模型可以世界最强,但如果每一分钟的花费都相当于自由职业者时薪的相当一部分,它在大规模使用时就依然不可行。

在 18 秒内生成视频意味着什么

79 分钟与 18 秒之间的差别,不是同一套工作流的更好版本,而是另一套工作流。在 79 分钟的节奏下,创作者会仔细规划、慎重敲定提示词,然后等待;迭代足够昂贵,以至于你只舍得偶尔为之。而在 18 秒的节奏下,你会去尝试。你生成十个变体,并排观看,留下两个。工具从“你下指令的对象”变成“你与之对话的对象”,而通常正是这种交互方式的转变释放了质量,而不是基础模型本身。

图像生成领域也发生过同样的事。当好图需要几分钟时,人们会字斟句酌地写提示词,把每一次生成都当成一个决定。当时间降到几秒后,他们开始随意地写提示词,大量生成,然后挑选。质量的上限并没有提高多少,但可用产出的下限提高了,因为筛选能吸收大量方差。如果 SparkDiffusion 对视频的作用正如快速采样器对图像的作用,那么效果最先体现在团队生成的频率上,而不是某一段视频变得特别出色。

有一个硬件方面的前提,而且不容忽视。18 秒这个数字来自 RTX 5090——一张顶级的消费级显卡。在大多数工作室实际拥有的中端 GPU 上运行同一套流水线会更慢,相对于基线的加速倍数看起来也可能没那么惊艳。但对规划而言,重要的是方向,因为底层硬件的价格正在下降,而软件的效率同时在上升。两股力量朝同一个方向推动。

真正的较量在于每秒的经济账

把这两半拼在一起,视频生成竞赛看起来就不太像一场纯粹的质量比拼,而更像一场成本比拼。一边是模型越来越好、每秒也越来越贵;另一边是研究社区不断找到办法,用更便宜的芯片、更少的时间完成同样的工作。在大多数真实项目里,胜出的是相对而言跑得更快的那一方。

这里有一个与图像生成领域相呼应的模式。某个前沿模型落地,拿到高分,按高端定价;随后一个开放权重的项目证明同样的任务大体上只是工程问题,价格随之崩塌。视频遵循这条曲线的速度更慢,因为算力需求更高,但 SparkDiffusion 和 SoL-Refiner 是它开始发生的第一批可信信号。

对内容团队而言,实际后果是:在视频生成上“自建还是购买”的决定不再那么显而易见。六个月前,付费调用 API 是唯一负担得起的路径。如果单张 GPU 能在几秒内渲染出可用的 720p,那么对产量稳定的团队来说,自持流水线开始变得合理——至少对粗剪用的那些版本是如此,只有需要定稿时才送去付费服务。

值得关注的几点

有三件事将决定它的重要性有多大。第一,加速后输出的质量能否在独立测试中站得住脚,而不是只在论文自己的样例里。第二,开源代码在大多数团队实际拥有的消费级显卡上,能否像结果中的 RTX 5090 那样顺畅运行。第三,前沿实验室是否会以更激进的定价作为回应,因为一旦如此,本地运行的动力又会缩小。

就目前而言,有意义的转变是观念上的:视频生成正从一项服务被重新归类为你自己就能运行的软件。这与当年把图像模型从一次 API 调用变成本地 ComfyUI 工作流的是同一种重新归类,而它的结局往往也一样:前沿居于顶端,底下是一层广泛、廉价、够用就好的东西承担大部分工作。

相关文章