AI動画の次の戦場は『世界を理解すること』にある

過去2年のほとんどで、AI動画モデルを評価する方法は単純だった。フレームがいかに美しいかを見ればよかった。だがそのテストは限界に近づいている。複数のモデルが、人物が街を歩く説得力のある5秒クリップを作れるようになると、画質ではもう差がつかない。別の何かが必要になる。
9月、中国のスタートアップHiDream.aiはHiDream-O1-Video-1.0、略してHD-V1を発表し、その「別の何か」を売り文句の中心に据えた。同社によれば、このモデルは単一のフレームがどう見えるかだけでなく、出来事がどう展開すべきかを理解するように作られている。
美しいフレームの問題点
動画生成に時間を費やしたことのある人なら、失敗のパターンを知っている。キャラクターに重い木のドアを押し開けるようプロンプトを出すと、モデルは手が左に押しているのにドアが右に開く絵を描く。誰かが5秒間で別の場所へ走るところを頼むと、キャラクターは台詞を言い終え、時間切れになり、テレポートする。実際に観るまでは、そのクリップは問題なく見える。
再生成を繰り返せば時間とクレジットを消費し、15秒のクリップは予算をはるかに超えるコストになることがある。欠けているのは解像度でも長さでもない。物理法則と因果関係だ。モデルは、ドアは手が押す方向に開かねばならないこと、二点間を移動するには時間がかかることを理解せずに、各フレームを描いている。
HD-V1が狙うのは、まさにこのギャップだ。HiDreamによれば、このモデルは生成前に、アクションの持続時間、オブジェクト間の関係、イベントの論理、音声と映像の整合性についての理解を強化する。そのため出力は、静止画の寄せ集めではなく、一続きのシーケンスとしてまとまりを持つ。

中国の4モデル、3つのアプローチ
これがなぜ重要なのかを理解するには、ほかに誰がリーダーボードの上位にいるかを見るといい。2026年9月までに、中国の4モデルが世界の動画生成の最前線に押し上がった。ByteDanceのSeedance 2.0と2.5、MiniMaxのH3、AlibabaのWan 3.0、そしてHiDreamのHD-V1だ。1年前、中国の動画モデルは主要な国際ベンチマークにほとんど姿を見せていなかった。今では上位付近に群がっている。
彼らは異なるルートでそこへ到達した。SeedanceはByteDanceの計算資源、エンジニアリング、プロダクトの完全なスタックに頼っている。MiniMax H3は大規模モデルの基盤と大規模ユーザー基盤の上に構築され、動画へ展開している。Wan 3.0はAlibabaのQwenとAlibaba Cloudというより広いエコシステムに組み込まれている。HiDreamはその中での異端児だ。巨大企業のリソースも流通網も持たないスタートアップであり、代わりに「ネイティブ・オムニモーダル・ワールドモデル」と呼ぶアーキテクチャに賭けている。画像、動画、3Dインタラクション、身体性を備えた知能が一つの基盤を共有できるように設計されている。
HD-V1はテキスト、画像、動画の入力に対応し、5~20秒の1080p動画を生成する。チームによれば、2つの国際リーダーボードで好成績を収めたという。中でも際立つ主張は「世界理解」だ。つまり、出来事がどう進展するかをモデル化しているため、より一貫したシーケンスを生成するという考え方である。
なぜ「理解」が新たなフロンティアなのか
複数のチームが同じ品質水準に到達できるようになると、競争はモデルが世界について何を知っているかに移る。解像度と長さは差別化要因ではなく、基準となる機能になる。より難しい問いは、画質では答えられないものだ。動く物体が物理法則に従うか、アクションと音が同期しているか、ある出来事が前の出来事から自然に続くか、といった問いである。
業界では同じ考え方に別の名前がついている。競合製品やより広い市場では、一貫性、意図理解、安定した出力といった言葉が使われる。中国の動画企業ZhiXiang Futureは、動画エージェント向けの5項目からなる評価フレームワークまで公開した。一貫性、意図、音声と映像の完全性、タイムラインと物語、安定した出力を対象にしている。名称は違えど、目標は同じだ。シーケンスを始められるだけでなく、最後まで信頼して完結できるモデルである。
そこには資金も動いている。Goldman Sachsは、世界のAI動画生成市場が5年間で約10倍に成長し、2030年までに約290億ドルに達すると推定した。この種の予測は、次に本物の能力飛躍に見えるものへ投資を引き寄せる。そして現在の候補が「世界を理解する」ことなのだ。
リーダーボードは互いに食い違う
動画分野の評価を難しくしている一因は、スコアボード同士が一致しないことだ。9月、コミュニティアリーナは1つのファミリーを王座に据え、個々のクリップを採点する人間の評価者は別のものを好み、利用実績で投票するプロンプト作成者はさらに別のものを選んだ。コミュニティのEloスナップショットでは、GoogleのGemini Omniシリーズが首位で、Black Forest LabsのFlux 3 Videoがオープン系に近い中で最強のエントリー、ByteDanceのSeedance 2.0と2.5がすぐ後ろに続いた。一方、人間の評価者がクリップを1~5の品質尺度で採点すると、Seedance 2.0が1位で、Kling、Wan、さらにはその後継モデルよりも上だった。純粋な利用量では、SeedanceとGoogleのVeo 3がプロンプト量を支配し、Wanはローカルおよびオープンのニッチを握っている。
これら3つのデータセットから得られる教訓は、「最高のモデル」は何を測定しているかに完全に依存するということだ。Veoは、アリーナよりも無音クリップの人間評価で順位が低い。その強みはネイティブの音声と対話にあり、無音の採点基準ではそれが見えないからだ。Seedance 2.5がクリップ単位の品質で2.0を下回ることは、新しいバージョンが、人々が実際に書くプロンプトで常により印象的とは限らないことを思い出させる。プロジェクト用にツールを選ぶ人は、決める前に複数のボードを読むべきであり、自分の仕事に合うボードを重く見るべきだ。
この変化がクリエイターにとって意味すること
実際にこれらのツールで作品を作っている人にとって、実用的な影響は「何が壊れるか」の変化だ。モデルがイベントの論理を理解すると、失敗は明白なものから微妙なものへ移る。テレポートするキャラクターや逆に開くドアと格闘することはなくなり、代わりにより小さな問題に気づき始める。アクションが一拍長すぎる、直前の台詞から反応が自然につながらない、といった問題だ。それらは本来、人間の監督が捉えるべき問題である。
これは中国のショートドラマブームがすでに教えたのと同じ教訓だ。AIは今やショットを生成できるが、完成したエピソードには、どのショットを、どの順番で、なぜ入れるかを決める誰かが依然として必要だ。モデルはフレームをどんどん上手くなっている。どのフレームが重要かを見極める判断は依然として人間の仕事であり、楽観主義者が予想するよりも長くそうであり続けるかもしれない。
4者による競争が重要なのは、もっと静かな理由からでもある。異なる企業が同じ問題に異なる方向から挑むこと、ここでは巨大企業のスタック、そこではスタートアップのアーキテクチャが、業界の単一の技術経路への依存を下げる。世界理解が正しい標的だと判明すれば、今や複数のチームがそれを目指している。そして間違った標的だと判明しても、分野全体がヘッジしていることになる。
現時点で正直に言えば、HD-V1は混雑した分野におけるもう一つの強力なエントリーであり、その主張はまだ第三者によって検証されていない。疑いがないのは方向性だ。次のラウンドで勝つモデルは、最も美しい単一フレームを描くモデルではない。何も破綻させずに20秒間ストーリーを保てるモデルである。世界を理解することはより難しい問題であり、今、多くの潤沢な資金を持つチームが初めて一斉に取り組んでいる。