← ブログに戻る
Ai読了目安 12 分

Taobao TaoMate-H3 がオープンソース化:分単位の音声・動画連続生成を、各セグメントわずか3ステップのノイズ除去に圧縮

公開日 2026年10月7日
Taobao TaoMate-H3 がオープンソース化:分単位の音声・動画連続生成を、各セグメントわずか3ステップのノイズ除去に圧縮

アリババの TaoLive AIGC チームが、TaoMate-H3 の推論コードと LoRA ウェイトを GitHub と Hugging Face で公開した。このモデルがやっていること自体は目新しくない。映像と音声を同じ生成の中で同時に出力する、というものだ。だが、その評価軸は変わっている。誰の単一セグメントの画質がすごいかではなく、プロンプトを入力してから最初のセグメントの完成品が見えるまでにどれだけ待つかを競っている。

初回セグメントの待ち時間——これまで誰も気にしなかった指標

主流の動画モデルの生成ロジックは、全体を一括でノイズ除去するというものだ。30秒の説明を書くと、モデルは30秒分のすべてのフレームをまとめて拡散プロセスに投入し、繰り返し反復する。途中では何も返ってこず、全体の計算が終わって初めて一括で納品される。この方法の問題はきわめて明快だ。待ち時間は動画の長さに正比例する。より長くしたいなら、より長く待たなければならない。

TaoMate-H3 が取るのはセグメント単位で進める方式だ。生成を小さな断片に分割し、各断片はわずか3ステップのノイズ除去で済む。モデルはまず現在の断片をはっきりと描き切り、それから続きの内容を生成していく。技術的には、3ステップの LoRA 推論と自己回帰生成をつなぎ合わせており、前のセグメントの人物・音声・シーンがコンテキストとして次のセグメントに引き継がれる。

この変更がもたらす実質的な違いは、「いつものを見られるようになるか」にある。ライブ配信の解説、バーチャルキャラクターの演技、あるいは即時フィードバックが必要なあらゆるシーンでは、ユーザーが動画全体の生成を待って初めて画面を見る、ということにはならない。初回セグメントのコンテンツが出るまでの時間は短縮され、この指標を主要なセールスポイントとして打ち出すモデルは、これまでほとんどなかった。機器之心(ジーチーシン)の報道では、TaoMate-H3 が押し出しているのはまさに「初回セグメントの生成時間」だと述べている。

音声はどのように生成に関わるのか

音声と映像の同時生成について、業界には二つのアプローチがある。一つは、まず映像を生成し、別のモデルに音声を付けさせ、後工程で両者を合わせる方法。もう一つは、音声を生成プロセスの中に最初から参加させ、口の動きや表情、動作に対して時間的な制約を与える方法だ。

Two small blank brass sound-wave tiles standing upright on a pale wood table, warm light raking across their smooth unmarked surfaces

TaoMate-H3 は後者だ。同じ生成プロセスの中で音声と映像を同時に扱い、人物の話し声、歌唱、キャラクターの台詞はこの枠組みの中にあり、波の音、車両の走行音、爆発といった環境音やアクション効果音も同様だ。台詞と映像の時間的な同期を、後工程で修正する必要はない。

出力仕様では、480p、768p、1080p の3段階に対応し、横画面・縦画面のどちらでも出力できる。シーンの記述は、一つの完全なプロンプトとして書くこともできるし、セグメントごとに台詞・動作・筋書きを配置することもでき、モデルは履歴のコンテキストを保持したまま続きを生成する。分単位の連続生成が、このモデルが狙う領域だ。

パラメータは大きくない。しかし実際のワークフローに入れて初めて理解できる

TaoMate-H3 は MiniMax H3 をベースに事後学習を行っている。ベースは他者がすでにオープンソース化した基盤モデルで、TaoMate チームはそこにストリーミング生成の能力を追加した。これもウェイトをこれほど早く公開できた理由だ。ゼロから大きなモデルを学習する必要はなく、重点は推論パイプラインと LoRA にある。

開発者にとって、実用的な価値にはいくつかの階層がある。最も直接的なのは、自分のハードウェア上で動かせることだ。ストリーミング生成の研究のためにクラウド API に依存する必要はない。次に、ストリーミング生成そのものが、以前はやりにくかったいくつかのシーンを開いた。生成しながら再生する、長時間にわたるキャラクターの連続演技、視聴者の反応に応じて以降の内容を調整する必要があるインタラクティブ動画などだ。

一つ、はっきり述べておくべき制約がある。3ステップのノイズ除去は、各セグメントの計算量がきわめて低く抑えられていることを意味し、その代償として単一セグメントの画質の天井がある。公式デモでの出来は一つの話であり、高い画質が求められる完成品の納品に持ち込むのはまた別の話だ。このモデルはどちらかといえば、「連続生成」というニーズに対して使えるオープンソースの土台を提供するものであり、トップクラスのクローズドモデルと単一フレームの品質を競うために来たわけではない。

中国製オープンソース動画、この一年の道筋

TaoMate-H3 を今年のタイムラインに戻して見ると、比較的はっきりした道筋が見えてくる。年初は皆がパラメータを比べ、ベンチマークのスコアを比べていた。下半期に入ると、重点はモデルを実際のワークフローに押し込むことに移った。より低い VRAM、より速い初回フレーム、より安い1秒あたりのコストだ。

MiniMax H3 が基盤モデルをオープンソース化し、TaoLive がその上で音声・映像ストリーミングを実装し、アリババ PAI が8種類の制御条件と動画の修復をサポートする ControlNet-Union ブランチを公開した。あるモデルが出ると、すぐに誰かがその上層の能力を作り始める。このような役割分担は、クローズドなエコシステムよりもオープンソースコミュニティの方が速く回る。誰かがインターフェースを開放するのを待たなくていいからだ。

コンテンツを作る人にとって、こうした変化は最終的にごく具体的なところに落ちてくる。連続した演技が必要な動画を作る場合、以前は10個のセグメントを別々に生成してからつなぎ合わせる必要があったかもしれないが、今は段落ごとに書けば、モデルが自分でコンテキストを引きずりながら続きを進めてくれる。出来上がった後でどこかおかしければ、そのセグメントだけを直すこともできる。

最後に

TaoMate-H3 の今回のリリースで最も記憶に値するのは、「初回セグメントの待ち時間」を正面から取り上げたことだ。動画生成はここ数年ずっと「生成できるかどうか」と「うまく生成できるか」を解決してきたが、今や「いつ最初のフレームを見られるか」を誰かが本気で計算し始めている。この問いへの答えが、動画モデルがデモ台から日次更新のワークフローに入り込めるかどうかを決める。

ウェイトと推論コードはすでに公開されている。次に見るべきは、コミュニティがその上でさらに多くのものを育てるかどうか、とりわけ長時間の連続出力が必要で、全体のレンダリングを待っていられないシーンにおいてだ。

関連記事