← ブログに戻る
Ai読了目安 15 分

Vidu Q3、参照画像からの動画生成を3製品に分割。それはモデルと同じくらいパッケージングの決断だ。

公開日 2026年10月5日
Vidu Q3、参照画像からの動画生成を3製品に分割。それはモデルと同じくらいパッケージングの決断だ。

ほとんどの動画モデルのリリースは一度発表されると、その後は単一の名前でどこにでも登場する。ViduはQ3の参照動画生成ラインで逆を行った。

9月14日、Alibaba CloudのModel Studioは3つの別々のVidu Q3参照動画生成モデルを掲載した。1つ目はviduq3-mixで、参照画像とテキストプロンプトを受け取り、それらの画像の被写体を記述されたシーンに合成する汎用モデルだ。2つ目はviduq3-adで、広告向けに作られ、マーケティング品質のシーンカット、カメラワーク、直接的な音声出力に対応する。商品画像をアップロードすると広告動画が得られる。3つ目はviduq3-dramaで、ドラマやAIマンガ制作を対象とし、キャラクターの一貫性、モーション効果、感情表現がストーリー主導のコンテンツ向けに調整されている。

3つとも720pまたは1080pで毎秒$0.14で動作し、レート制限は毎秒5リクエストだ。価格は3つとも同一で、差別化がコストではなく出力の挙動にあることがわかる。

Viduが実際に解決しようとした問題

Viduは北京のShengshu Technology(生数科技)によるものだ。そのQ3モデルは2026年1月30日にローンチされ、すぐにベンチマーク界で話題になった。Artificial Analysisはローンチ時に、スコア1241で中国で1位、世界で2位とし、Runway Gen-4.5、Google Veo 3.1、OpenAIのSora 2を上回った。

そのランキングの背景にある3つの技術的変化は挙げておく価値がある。Q3は、映像と同じパスで同期した会話、効果音、BGMを生成する初期の長尺動画モデルの1つであり、音声を後から付け足すのではなかった。単一実行のクリップを16秒に延ばし、当時の主要モデルの中で最長だった。そして、ユーザーがキャラクター、物体、スタイルの画像を3〜7枚アップロードし、モデルがそれらを後の生成における視覚的アンカーとして使う参照動画生成システムを構築した。

興味深いのは参照システムの方だ。2026年のほとんどの動画モデルは同じ軸で競っている。すなわち、単一のクリップを印象的に見せることだ。Viduの賭けは違った。その売り込みは「この美しい1カットを見てほしい」では決してなく、「10カットにわたる同じキャラクターを見て、それでも同じ人物に見えることに気づいてほしい」だった。

それはより難しい問題であり、シリーズコンテンツが実際に依存している問題だ。同じキャラクターのプロンプトを6つのシーン変化で使った、Runway Gen-4、Kling 3.0、Luma Ray、Pika 2.0、Sora 2との比較では、Vidu Q3は6つのテストのうち5つで顔と衣装の一貫性を維持した。

一貫性は、単発クリップ向けのツールとシリーズ向けのツールを分けるものだ。アニメクリエイター、ショートドラマ制作者、そして繰り返し登場するキャラクターを軸にブランドコンテンツを作るすべての人にとって、それは可能なことを変える。

なぜ3つのSKUが重要なのか

1つのモデルファミリーを3つの名前付き製品に分けるのは、マーケティング上の選択に見える。それはどちらかといえば調達上の決断に近い。

反射面の上に一列に並んだ3つの無地の暗い円柱と漂う煙

広告チームとショートドラマスタジオは、たとえ基盤となるTransformerが似ていても、同じものを買うわけではない。広告の買い手が必要とするのは、製品の忠実性、クリーンなシーン遷移、ブランドボイスの下に置ける音声だ。ドラマの買い手が必要とするのは、エピソードやショットをまたいで同一性を保つキャラクターであり、演技として読める表情だ。それらを別々のモデルIDと別々のドキュメントとしてパッケージ化することで、各買い手は汎用の機能リストを読んで推測するのではなく、まさに1つの仕事のために評価し予算を組める。

汎用のmixモデルは、そのどちらの枠にも当てはまらないすべての人に応える。買い手がプロンプトを試す趣味人ではなく、締め切りのある制作チームになりつつある市場にとって、これは合理的な構造だ。

Vidu Clawとパイプライン層

モデルのパッケージ化は戦略の半分だ。もう半分は組み立て層である。Vidu Clawは、オープンソースのOpenClawフレームワーク上に構築され、Q3を動力とするAI制作自動化エンジンだ。Viduトークンを接続し、Skillsを定義して、アイデアから完成動画までの道筋を自動化できる。「Instagramで若い女性をターゲットにしたランニングシューズのショート広告を作成して」といった1つのプロンプトで、Vidu Clawがコンセプト、スクリプト、絵コンテ、ビジュアル、ナレーション、音楽、最終カットを生成するのに十分だ。

独立系レビューは、有益な形で賛否が分かれている。製品CMでテストしたレビュアーは、プラットフォームが学生や初心者にとって本当に無料でアクセスしやすいと評価した一方で、正確な構造的ディテールに苦戦すると報告した。あるケースでは、プロンプトを繰り返し修正した後でも目立つ形でディテールを描画し続け、出力には明らかなAIらしさがあり、照明と色が安っぽく感じられた。

それが正直なトレードオフだ。Vidu Clawは、コンセプトから使えるドラフトへ素早く移行する必要がある個人クリエイターや小規模マーケティングチーム向けの生産性ツールであり、プロの制作チームの代替ではない。うまくいけば、5日間の広告制作サイクルを1日に圧縮する。うまくいかなければ、品質上の問題は見逃しにくい。

Viduが築いているエコシステム

参照動画生成への注力は、流通の話にもつながる。2026年2月、ソフトウェア企業のWondershareはShengshuへの戦略的投資を発表し、両社はAIマンガに取り組む計画を明らかにした。Vidu Q3モデルは、エピソードをまたいでキャラクター、声、シーンを一貫させるために使われるフルチェーンのAIマンガ制作プラットフォームに統合された。Alibaba CloudのBailianプラットフォームも2026年5月にVidu Q3をサードパーティモデルとして追加した。

つまりこのモデルは少なくとも3つのチャネルを通る。直接のWebとAPIアクセス、マンガとショートドラマ向けの制作プラットフォーム、そしてクラウドモデルマーケットプレイスだ。各チャネルには異なる買い手がおり、「十分に良い」の定義も異なる。

実際にお金がある場所

シリーズコンテンツへの移行は、クリエイティブな好みではない。そこに予算があるからだ。ショートドラマは繰り返し登場するキャストを擁する複数エピソードの製品であり、その経済性は単発広告や単発クリップよりはるかに多くの映像を制作することに依存する。もしモデルが、ショットごとにキャラクターの外見をゼロから作り直すことを制作者に強いるなら、生成映像による節約は一貫性の修正に食われてしまう。Viduの賭けは、毎秒$0.14を払うチームが、美しい1カットを買っているのではなく、全編を通して同じ人物を認識可能に保つ方法を買っている、というものだ。

だからこそ、参照システムは生の品質スコアよりも重要だ。ベンチマークで世界2位にランクされるモデルは印象的だが、ベンチマークが測るのはクリップだ。参照機能が測るのはシリーズだ。この2つは同じ買い物ではなく、Viduは後者を売っている。

まだ実現できていない点

参照の一貫性は完璧ではなく、6回中5回は6回中6回ではない。6番目のケースが失敗したところでは、ツールは元画像から逸脱した顔と衣装を出力し、まさにそれがシリーズを壊す失敗だ。コストは毎秒$0.14で現実的であり、16秒のクリップではすぐに積み上がり、何百ものショットが動くシリーズ規模では重大になる。パイプライン層が生み出すのは完成したCMではなくドラフトであり、レビュアーはプロンプトを繰り返し修正しても構造的ディテールを確実に修正できないと指摘している。

名指しする価値のある構造的限界もある。参照動画生成は同一性を固定するが、制作全体の連続性をまだ解決していない。一貫したクリップ群を物語に変える演出上の選択は、依然として誰かが行わなければならず、モデルはペース、カバレッジ、あるいはそのシーンが存在すべきかどうかについて何の意見も持たない。

注目すべき点

3つのSKU構造は、他のベンダーが真似しそうな部分だ。参照動画生成がシリーズコンテンツ制作の既定の方法になるなら、より多くのモデルファミリーが単一のフラッグシップではなく、用途別のバリアントを投入するだろう。次に重要な問いは、より長い尺と難しいカメラワークで一貫性が保たれるか、そしてパイプライン層が個人クリエイターではなくスタジオに売れるほど良くなるかだ。

関連記事