← ブログに戻る
Ai読了目安 13 分

SparkDiffusion、720p動画生成を79分から18秒に短縮

公開日 2026年10月2日
SparkDiffusion、720p動画生成を79分から18秒に短縮

生成に約4,769秒かかっていた720p動画が、単一のRTX 5090上で約18秒で済むようになった。この結果を生み出した北京大学、清華大学、アリババの研究者チームは、コードをSparkDiffusionとしてオープンソース化した。約265倍という高速化は、単に処理が速く終わるというだけでなく、パイプラインで何ができるかを変える類の数字だ。

この主張は、どのように達成されたかと照らし合わせて確認する価値がある。これほど大きな高速化には、たいてい但し書きが隠れているからだ。SparkDiffusionは、それぞれ別々に成熟してきた3つの技術を組み合わせている。スパースアテンション、少ステップ蒸留、そしてFP8量子化だ。スパースアテンションは、拡散動画モデルが通常その大半の時間を費やす完全なアテンション行列の計算を避ける。少ステップ蒸留は、通常の数十ステップよりもはるかに少ないノイズ除去ステップで良好なサンプルに到達するようモデルを訓練する。FP8は計算の数値精度を下げる。これらを重ねると、動画1本あたりの演算量は劇的に減る。

青と白の光の軌跡が走るシリコンウェハーの極端なクローズアップ。非常に大きな高速化を示唆している

それでも但し書きが重要な理由

スパースアテンションと少ステップ蒸留はどちらも、わずかな品質と引き換えに大きな速度を得ている。これを導入する誰もが抱く正直な疑問は、品質がどこに着地するかだ。単一のコンシューマー向けカードで265倍という数字は印象的だが、それを生み出す同じ手法は、細部をぼやけさせたり、動きの一貫性を低下させたりしうる。論文が報告しているのは高速化であり、その出力がプロのレビューに耐えるかどうかこそ、スタジオが信頼する前に実施するテストだ。

たとえその留保があっても、方向性は重要だ。動画生成はこれまでデータセンター向けのワークロードとして価格設定されてきた。妥当な時間でレンダリングするのにクラスタを必要とする720pクリップは、あらゆるチームをAPIへと追いやり、コストモデルを他人の手に委ねることになる。1台のGPUでレンダリング時間が秒単位まで下がれば、経済性は変わる。反復は安くなり、安い反復こそがジェネレーターを、実際に探求できるツールへと変えるのだ。

別の角度から見た同じ話

動画のコストに挑んでいるのはSparkDiffusionだけではない。NVIDIAのSanaプロジェクトはSoL-Refinerを公開した。これは1ステップの動画リファインモデルで、任意のジェネレーターの低解像度出力を受け取り、シャープな2Kまたは4K動画に変換するもので、エンドツーエンドで8.91倍高速だと報告している。この設計はSparkDiffusionのやることと相補的だ。SparkDiffusionは生成を高速化し、SoL-Refinerは仕上げを高速化する。両者を合わせると、高コストなモデルがより少ない仕事をこなし、安価なリファイナーが仕上げる2段階パイプラインが見えてくる。

一方で、品質のフロンティアは動き続けている。Artificial AnalysisはAA-Video-T2V v2.0ベンチマークを公開した。約1,000のプロンプトにわたる68,000以上の人間の嗜好投票から構築され、すべてのモデルを1080pで評価する。Wan 3.0がElo 1157、毎分12ドルでリーダーボードの頂点に立ち、20のカテゴリランキングのうち10で1位を獲得している。この12ドルという数字が話のもう半分だ。世界最高のモデルであっても、毎分のコストがフリーランサーの料金の無視できない割合を占めるなら、スケールでは使えない。

18秒で動画を生成するということ

79分と18秒の違いは、同じワークフローの改良版ではない。別のワークフローだ。79分なら、クリエイターは慎重に計画し、プロンプトを確定し、待つ。反復は十分に高コストなので、控えめにしか行わない。18秒なら、試せる。10種類のバリエーションを生成し、並べて見て、2つを残す。ツールは指示するものから対話するものへと変わり、このインタラクションの変化こそが、ベースモデルではなく品質を解き放つことが多い。

同じことが画像生成でも起きた。良い画像に数分かかっていた頃は、人々は丁寧にプロンプトを書き、各生成をひとつの決断として扱った。それが数秒に短縮されると、雑にプロンプトを書き、広く生成し、選別するようになった。品質の天井はさほど上がらなかったが、使える出力の床は上がった。選別がばらつきの多くを吸収するからだ。SparkDiffusionが動画に対して、高速サンプラーが画像に対して果たしたことを果たすなら、その効果は、単一のクリップが劇的に良くなることではなく、チームがどれだけ頻繁に生成するかにまず現れる。

ハードウェアに関する留保があり、それは小さくない。18秒という数字はRTX 5090という最上位のコンシューマー向けカードでのものだ。ほとんどのスタジオが実際に所有しているミッドレンジGPUで同じパイプラインを動かせば遅くなり、ベースラインに対する高速化もそれほど劇的には見えないかもしれない。しかし計画にとって重要なのは方向性だ。基盤ハードウェアの価格は下がり、ソフトウェアの効率は上がっている。両方の力が同じ方向に押している。

本当の競争は秒あたりの経済性

両方の半分を合わせると、動画生成の競争は純粋な品質競争というよりコスト競争に見えてくる。一方では、モデルはどんどん良くなり、毎秒あたりのコストも上がる。もう一方では、研究コミュニティが同じ作業をより安いシリコンでより短時間に実行する方法を見つけ続けている。実際のプロジェクトの多くで勝つのは、相手に対してより速く動く側だ。

ここには画像生成の世界を想起させるパターンがある。フロンティアモデルが登場し、高いスコアを得て、プレミアム価格で提供される。するとオープンウェイトのプロジェクトが、同じタスクは主にエンジニアリングの問題だと示し、価格が崩壊する。動画は計算需要が高いため、この弧をたどるのが遅かったが、SparkDiffusionとSoL-Refinerは、それが始まっている最初の信頼できる兆候だ。

コンテンツチームにとっての実務的な帰結は、動画生成における自前構築か購入かの判断がもはや自明ではなくなったことだ。6か月前は、APIに支払うことが唯一の手頃な道だった。単一のGPUが使える720pを秒単位でレンダリングできるなら、安定した量を抱えるチームにとっては、パイプラインを自前で持つことが妥当になり始める。少なくとも、最終版が必要なときだけ有料サービスに送るラフ段階については。

注目すべき点

このことがどれほど重要かは3つの点で決まる。第一に、高速化された出力の品質が、論文自身のサンプルではなく独立したテストで持ちこたえるかどうか。第二に、オープンソースのコードが、結果で使われたRTX 5090と同様に、ほとんどのチームが実際に所有するコンシューマーカードでもきれいに動くかどうか。第三に、フロンティアラボがより積極的な価格設定で応じるかどうか。もし応じれば、ローカルで動かす動機はまた小さくなる。

今のところ、意味のある変化は概念的なものだ。動画生成は、サービスから、自分で実行できるソフトウェアへと再分類されつつある。この再分類は、画像モデルをAPI呼び出しからローカルのComfyUIワークフローへと変えたのと同じもので、たいてい同じ結末を迎える。フロンティアが頂点に立ち、その下に広く、安価で、十分に良い層が広がって大半の作業を担う、という結末だ。

関連記事