← ブログに戻る
Ai読了目安 15 分

Vibe Video:フロントエンドコードを書いて映画をつくるコーディングモデル

公開日 2026年10月10日
Vibe Video:フロントエンドコードを書いて映画をつくるコーディングモデル

この1か月で世界で最も話題になったAI動画は、動画モデルによって作られたものではなかった。アニメーションが現れるまでフロントエンドコードを書き続けた、コーディングモデルが作ったものだ。

そのクリップはClaude Opus 5.5から生まれた。広く共有された一例では、あるクリエイターが参照プロンプト、Midjourneyへのアクセス、ムードボードを使い、約12時間で映画的なディストピア短編を制作した。その投稿は2000万回再生を超えた。別のクリエイターはたった1つの指示で2分16秒の文明史作品を生成し、2日で1000万回再生を突破した。Opus 5.5の動画を集めたGitHubコレクションには400件以上が集まり、ほとんどが公開プロンプトとコード付きだ。

人々はこれをVibe Videoと呼び始めた。名前は洗練されていないが、この手法は理解する価値がある。なぜなら、他の誰もが進んでいる道とは本当に異なる、動く映像への道だからだ。

レンダリングエンジンとしてのコード

通常のAI動画パイプラインは、ピクセルを予測する拡散モデルだ。プロンプトや静止画を与えると、フレームが返ってくる。モデルは動画で訓練されており、その動きの感覚はそのデータから学習される。

コードレンダリングは仕組みが異なる。言語モデルがアニメーションを描くHTML、CSS、SVG、JavaScriptを書き、ブラウザがそれをレンダリングする。フレームごとに予測されるものは何もない。動きは、位置、タイミング、イージングを明示的に記述したコードから生まれる。

この違いは重要だ。なぜなら、拡散モデルが苦手とするいくつかのことを簡単にするからだ。精密なグラフィック、タイポグラフィ、チャート、幾何学的な動き、画面間のトランジションは、コードであれば簡単だ。それらはまさに、動画モデルからは濁って出てくるものだ。代償として、コードレンダリングは動く写実的な人間の顔を生成できない。コードが記述できるものを描くのだ。

左側のコードエディタパネルが、右側の鮮明なアニメーションフレームに供給している

クリエイターたちがなぜ飛びついたのか

熱狂を説明する2つの特性がある。1つ目は再現性だ。拡散モデルのクリップはサンプルであり、もう一度実行すると双子ではなくいとこのようなものが得られる。コード化されたアニメーションはプログラムだ。1つの値を変えれば、何が起こるかわかる。そのため修正が安く済み、実際の作業のほとんどは修正にある。

2つ目は、出力がすでにワークフローの残りの部分で使える形式であることだ。ブラウザアニメーションはキャプチャでき、サイトに埋め込め、データソースに接続できる。製品ページやダッシュボードの中に自然に収まり、モーションに対する商業的な需要の多くは実際そこから来ている。

供給側の理由もある。Claude Opus 5.5は9月22日に、230ページのシステムカードと、入力100万トークンあたり4ドル、出力100万トークンあたり20ドルのAPI価格でローンチされた。ほとんどのタスクで前世代のフラッグシップに近いベンチマーク性能を、実質的により低いコストで達成した。より安価なフロンティアモデルは、長く反復的なコード生成を個人にとって実用的にし、それこそが12時間の制作に実際に必要なものだ。

もうひとつのレーン

同じ週、別の汎用モデルが異なる方向から動画に進出していた。GPT-6 Astraは一種のAIディレクターとして機能し、絵コンテの計画やホワイトモデルのプリビジュアライゼーションを担当し、Blender、Unreal Engine、DaVinci Resolveに踏み込んでシーンを構築し、ショットをブロッキングし、編集を処理すると報じられた。

この2つを合わせると、あるパターンが見えてくる。汎用モデルは、写実的なモーションでSeedance、Kling、MiniMaxを打ち負かそうとしているわけではない。彼らは上流の、計画と制作パイプラインへと動き、そして横方向へ、写真的というよりプログラム的なモーションへと動いている。そうして専門特化した動画モデルにはリアリズムを追求し続ける役割が残り、汎用モデルはプロセスの中でもソフトウェアらしい部分を担う。

ワークフローは実際どう回るのか

良い結果を出しているクリエイターたちが語るプロセスは、映画製作よりもソフトウェア開発に近い。ムードと制約を設定するプロンプトを書き、モデルがコードを生成し、コードがブラウザでレンダリングされ、結果を見る。それから1か所を変えて、また実行する。ループは短く、出力は検査可能で、だからこそ12時間の制作が可能になる。動画モデルに段落を渡して12時間かけてもノイズしか生まれない。コードを12時間編集すれば完成作品が生まれる。

ムードボードと参照モデルが重要なのは、構図とは無関係な理由からだ。それらはスチルに一貫したパレットと被写体を与え、コードがそれらを配置して周囲をアニメーションさせるとき、パーツが1本の映画に属しているように見える。コードが動きとタイポグラフィを供給する。スチルが世界を供給する。どちらの半分も、もう一方なしでは機能しない。

コストは実際どこにのしかかるのか

コードレンダリング動画は無料だと思いたくなる。レンダリングは自分のマシン上のブラウザで行われるからだ。しかしモデル呼び出しは無料ではなく、ループは長い。書き直すたびに有料リクエストが発生し、数百回の編集がある作品は、大きなコンテキストを伴う数百回のリクエストになる。Anthropicが入力100万トークンあたり4ドルに値下げしたことが、このループをスタジオだけでなく個人にも手頃にした。モデルが安いほど、クリエイターは自由に反復でき、反復こそがこの手法のすべてだ。

そこには奇妙な帰結がある。このスタイルのボトルネックは、レンダリングの計算資源ではない。レビューだ。誰かが各レンダリングを見て、何を変えるか決めなければならず、その注意力はAPI価格の低下ではスケールしない。Vibe Videoで成功しているクリエイターは、機能的には、デイリーフッテージを見つめて注文を出すディレクターだが、その注文はdiffに入っていく。

コードレンダリングと生成動画を並べると

どのスタイルが何をするのか正確に考えると役に立つ。コードレンダリングは再現可能で、修正が安く、グラフィックとテキストに鋭く、データを得意とする。写実的な俳優、群衆、何気ない一瞬を生成することはできない。拡散動画はそれらを得意とし、それ以外のすべてを近似として扱う。動画モデルがレンダリングしたロゴはほぼ正しい。コードがレンダリングしたロゴは正確だ。

この分離は、2つが競争するのではなく共存することを示唆している。作品は生成された確立ショットで始まり、コード化されたアニメーションチャートに切り替わり、生成された映像で閉じるかもしれない。興味深いクリエイティブ上の問いは、どのツールを使うかではなく、どこで切り替えるかになる。その継ぎ目を見極めたチームは、意図的に見える作品を作るだろう。

うまくいかないところ

コードレンダリングは動画生成の代替ではなく、そう扱うと人々を失望させる。俳優を撮影することはできない。ドキュメンタリーのフレームや信憑性のある群衆を生み出すこともできない。デザイン、抽象的なモーション、情報、インターフェースには強いが、カメラがそこにあったように見せる必要があるものには弱い。

また、誰も語らないコスト特性もある。1フレームが正しく見えるまでに、大量のモデルトークンを消費することがある。ループは、書く、レンダリングする、検査する、書き直す、だからだ。より安いモデルはそのコストを下げるが、なくしはしない。印象的な結果を出しているクリエイターは、ただプロンプトを書いているのではない。コードをレビューしているのだ。

この分野について何を物語るか

Vibe Videoの興味深い点は、コーディングモデルが素敵なクリップを作れることではない。「動画生成」と「ものを動かすソフトウェア」の境界が、誰もが想定していたより柔らかいとわかったことだ。言語モデルがアニメーションを直接書けるとき、生成動画への需要の一部は代わりにコードによって満たされる。

ビジュアルを作る人々にとって、実用的な問いはもはや、どちらか一方のツールを選ぶべきかではない。作品のどの部分が予測されたフレームで最もよく表現され、どの部分が書かれたフレームで最もよく表現されるかだ。今それを見極めているチームこそ、単に生成されただけではなく、意図的に見える作品を作るだろう。

関連記事