← 返回部落格
Ai預計閱讀 9 分鐘

SparkDiffusion 將 720p 影片生成從 79 分鐘縮短至 18 秒

發布於 2026年10月2日
SparkDiffusion 將 720p 影片生成從 79 分鐘縮短至 18 秒

一段原本需要約 4,769 秒才能生成的 720p 影片,現在在單張 RTX 5090 上只需約 18 秒。促成這項成果的團隊——來自北京大學、清華大學與阿里巴巴的研究人員——將程式碼以 SparkDiffusion 開源,而約 265 倍的加速,是那種會改變一套流程能做什麼、而不只是它多快跑完的數字。

這項說法值得對照其實現方式來檢驗,因為如此巨大的加速通常暗藏但書。SparkDiffusion 結合了三項各自獨立成熟中的技術:稀疏注意力、少步蒸餾與 FP8 量化。稀疏注意力避免計算擴散影片模型通常耗費大半時間的完整注意力矩陣。少步蒸餾訓練模型以遠少於慣常數十步的去噪步驟,達到良好的樣本。FP8 則降低運算的數值精度。把這些堆疊起來,每段影片的運算量便大幅下降。

矽晶圓的極特寫,藍白光軌在其上疾馳,暗示極大幅度的加速

為何但書仍然重要

稀疏注意力與少步蒸餾都是以一點品質換取大量速度,而對任何要部署此技術的人來說,誠實的問題是品質最後落在哪裡。在單張消費級顯卡上達到 265 倍數字確實驚人,但產生它的同一批方法也可能讓細節變柔和、或降低動作連貫性。論文報告的是加速幅度;輸出能否通過專業審查,才是工作室在信任它之前會做的測試。

即使有這項但書,方向仍然意義重大。影片生成一直被視為資料中心等級的工作負載來定價。一段需要叢集才能在合理時間內算完的 720p 短片,迫使每個團隊都得使用 API,這讓成本模型落入他人手中。把單張 GPU 的算圖時間降到幾秒,經濟結構就會改變。迭代變得便宜,而便宜的迭代正是讓生成器變成真正能探索的工具的關鍵。

從另一個角度看的同一件事

SparkDiffusion 並非唯一著手降低影片成本的專案。NVIDIA 的 Sana 專案發布了 SoL-Refiner,這是一款一步式影片精修模型,能接收任何生成器的低解析度輸出,並將其轉為銳利的 2K 或 4K 影片,端到端速度號稱快 8.91 倍。此設計與 SparkDiffusion 所做的事互補。SparkDiffusion 加速生成;SoL-Refiner 加速後製精修。兩者共同指向一套兩階段流程:昂貴模型做得更少,再由便宜的精修器收拾乾淨。

與此同時,品質前沿仍在推進。Artificial Analysis 推出 AA-Video-T2V v2.0 基準測試,由約 1,000 條提示詞、超過 68,000 張人類偏好投票建構而成,並以 1080p 評判每個模型。Wan 3.0 以每分鐘 12 美元、Elo 1157 登上榜首,在 20 個分類排名中拿下 10 個第一。那個 12 美元的數字是故事的另一半。一個模型可以是世界最強,但如果每分鐘成本占自由工作者費率的可觀比例,在大規模使用下仍可能不可行。

在 18 秒內生成影片意味著什麼

79 分鐘與 18 秒之間的差異,不是同一套工作流程的更好版本,而是截然不同的工作流程。在 79 分鐘的情況下,創作者會仔細規劃、慎重定下提示詞,然後等待。迭代成本高到讓人只能偶爾為之。在 18 秒的情況下,你會多方嘗試。你生成十個版本,把它們並排比較,留下兩個。工具從你下指令的對象,變成你與之對話的對象,而這種互動方式的轉變,通常才是釋放品質的關鍵,而不是基礎模型本身。

同樣的事情也發生在圖像生成。當一張好圖要花好幾分鐘時,人們會仔細撰寫提示詞,把每次生成當成一項決策。當時間降到幾秒,他們開始隨性地下提示詞、大量生成,再從中挑選。品質上限沒有提升多少,但可用輸出的下限提高了,因為挑選能吸收大量變異。如果 SparkDiffusion 對影片的影響,正如快速採樣器對圖像的影響,那麼效果會先反映在團隊多常生成,而不是任何單一短片變得特別好。

有一個硬體方面的但書,而且不小。18 秒的數字是在 RTX 5090 上測得,那是頂級消費級顯卡。在大多數工作室實際擁有的中階 GPU 上跑同一套流程會更慢,相對於基線的加速幅度也可能看起來沒那麼誇張。但對規劃而言,方向才是重點,因為底層硬體的價格正在下降,同時軟體效率正在提升。兩股力量朝著同一個方向推。

真正的競爭在於每秒經濟效益

把這兩半放在一起看,影片生成競賽與其說是純粹的品質競賽,不如說是一場成本競賽。一邊是模型不斷變得更好,但每秒也更昂貴。另一邊是研究社群不斷找出方法,用更便宜的晶片、更短的時間完成同樣的工作。在多數實際專案中,贏家會是相對另一方移動更快的那一邊。

這裡有一個呼應圖像生成世界的模式。一個前沿模型問世,拿到高分,並以高價定位。接著一個開放權重專案證明同樣的任務多半只是工程問題,價格便隨之崩跌。影片因為運算需求更高,遵循這條曲線的速度較慢,但 SparkDiffusion 與 SoL-Refiner 是它開始走上這條路的第一批可信跡象。

對內容團隊的實際影響是,影片生成的自建與外購決策不再顯而易見。六個月前,付費使用 API 是唯一負擔得起的途徑。如果單張 GPU 能在幾秒內算出可用的 720p,那麼對有穩定產量的團隊來說,自行擁有這套流程開始說得通,至少對於粗略版本是如此——只有在需要最終成品時,才送到付費服務處理。

值得關注的重點

有三件事將決定這一切有多重要。第一,加速後輸出的品質,能否在獨立測試中站得住腳,而不只是在論文自己的樣本裡。第二,開源程式碼在大多數團隊實際擁有的消費級顯卡上,是否能像結果中的 RTX 5090 一樣順暢運行。第三,前沿實驗室是否會以更積極的定價回應,因為如果他們這麼做,本機運行的誘因又會縮小。

就目前而言,最有意義的轉變是概念上的。影片生成正從一項服務,被重新歸類為一套你可以自行運行的軟體。這種重新歸類,就如同當年圖像模型從 API 呼叫,變成可在本機運行的 ComfyUI 工作流程;而它往往以相同方式收場:前沿模型居於頂端,底下則有一層廣泛、便宜、夠好的技術負責大部分工作。

相關文章