ストーリーボードの瞬間:なぜキーフレームは実行時間よりも重要なのか

動画モデルは2年間、どれだけ長いクリップを生成できるかを競ってきた。より有用な能力はずっとその再生時間の数字の下に潜んでおり、それは動画モデルの存在意義を変える。
その数字は10個のキーフレームだ。Kling 4.0は、前世代の最初と最後のフレーム制御から拡張し、最大10個のキーフレーム入力のサポートを発表した。RunwayのSolarisは、デザインをコードにコンパイルするのではなく、インターフェースをフレームごとにレンダリングするという隣接する方向で、このアイデアをさらに推し進めている。どちらも同じ転換点を指し示している。モデルは即興するのではなく、決められたポイントを的確に捉えることを求められている。
この転換が重要なのは、モデルの存在意義が変わるからだ。即興するシステムはアイデアの源である。決められたポイントを捉えるシステムは制作工程の一部である。動画制作における資金の大半は制作現場にあり、だからこそ制御機能は、モデルをデモから予算の一行項目へと押し上げる機能になりやすい。
最初と最後のフレーム制御にはできなかったこと
初期の世代の動画ツールは、最初と最後の2フレームを受け取り、モデルがその間を埋めるというものだった。実際には、これは制作ツールというより宝くじに近かった。始点と終点は指定されていても、中間はすべてモデルの推測だった。3秒の時点で特定のアクションを必要とするディレクターは、それをリクエストする手段がなかった。
それが10個のキーフレームが解決する問題だ。10個のコントロールポイントは、単一の補間を一連のセグメントに変え、各セグメントを演出できる。脚本に沿って納品する人にとっての実用的な意味は、ショットの中盤がランダムでなくなることだ。アクションを特定のビートに合わせる必要があるなら、そこにキーフレームを置けば、モデルがその周囲を埋めてくれる。
付随する機能もこれを補強している。Kling 4.0は最大15個のマルチモーダル参照を受け付け、これには最大10枚の画像、5本の動画クリップ、7つの被写体定義を含めることができるため、キャラクターの外見、製品のディテール、ロケーションの見た目をシーケンス全体で固定できる。プロンプト長は8,000トークンまで拡大し、これは雰囲気ではなくショットを記述するのに十分な長さだ。
多くのコントロールポイント+多くの参照+長いプロンプトという組み合わせは、1年前の生成インターフェースとは異なる種類のツールを表している。チャットボックスというより、3Dレンダラーのコントロールパネルに近い。ユーザーは試行錯誤で計画を見つけるのではなく、計画を持って臨むことが前提とされている。
参照の上限は、実用上の幅が最も広い部分だ。シーケンス全体で7つの被写体を固定できるということは、繰り返し登場するキャスト、繰り返し登場する製品、繰り返し登場するロケーションを、1つの生成タスク内で一貫させられるということであり、これはシリーズ作品に必要なことだ。被写体を追加するためにモデルを再トレーニングする必要は何もない。参照を追加して名前を付けるだけだ。
ディレクターの仕事の形が変わる
生成が宝くじであるとき、ワークフローは生成、確認、再生成であり、ディレクターのスキルは確率を高めるプロンプトを書くことにあった。生成が決められたポイントを捉えるようになると、ワークフローは設計、キーフレームの配置、確認、1つの区間の調整になる。スキルはプロンプト作成からショット設計へと移行する。
アニメーションやVFXの経験がある人なら、2つ目のワークフローに見覚えがあるだろう。モデルが中割りを担うキーフレームアニメーションであり、ツールは新しい分野を発明するのではなく、確立された実務に対応している。だからこそこの機能は制作チームが使えるものになる。すでに回しているプロセスにそのまま組み込めるのだ。
失敗のあり方も変わる。悪い生成はもはや無駄なサイコロの目ではなく、新しいキーフレームが必要な1つの区間にすぎない。ショット全体を再生成して祈るのではなく、壊れた部分だけを直せばいい。
フレーム単位のアイデアの次に行く先
同じ論理が別の形で現れるのが、RunwayのSolarisだ。これはインターフェースとその入力への応答を1フレームずつレンダリングし、デザインをコードにコンパイルする工程をなくす。その根底にある主張は、ワールドモデルがピクセルを直接生成できるため、中間表現が不要になるというものだ。
どちらのケースもモデルに同じ問いを投げかけている。「もっともらしいものを作る」ではなく、「この特定のものを、この特定の瞬間に生成する」ということだ。生成システムの価値は、決められたポイントを守らせることができるときに急激に高まる。それが草案と納品物の違いだからだ。
違いは何が置き換わるかにある。キーフレーム制御はショット中盤のランダム性を置き換える。Solarisは、常に情報が失われがちだった翻訳工程、すなわちデザインとそのコード実装が時間とともに乖離していく工程をなくす。どちらの場合も、生成モデルはかつて中間プロセスに属していた仕事を吸収しており、それを任せるべき理由はどちらも同じだ。忠実さが失われていたのは、その中間プロセスだったのだ。
注目すべき点
未解決の問いは、キーフレーム制御が実際にアクセスできるモデルでどこまで機能するかだ。Kling 4.0の全機能はまだ順次展開中であり、最初に出荷されたのはFlashティアで、リリース時期は以前も発表された10月の枠からずれ込んでいる。制御機能に関する発表は、歴史的にその機能自体よりも信頼できることが多かった。
2つ目の問いはコストだ。細かい制御はより多くのキーフレーム、より多くの参照、より長いプロンプトを意味し、秒単位の課金ではツマミを増やすたびに請求額が膨らむ。キーフレーム制御を採用するチームは、いくつのコントロールポイントならコストに見合うかを決めなければならず、料金ページが1秒あたりの単一料率しか示していない場合、その計算は自明ではない。
3つ目の問いは、インターフェースがそれに合わせて変わるかどうかだ。10個のキーフレームと15個の参照を受け付けるモデルには、テキストボックスではなくタイムラインが必要であり、生成動画用の適切なタイムラインを最初に作ったベンダーは、競合がまだ気づいていない問題を解決したことになる。
その閾値こそ、AI動画がデモのカテゴリーでなくなる地点だ。再生時間は決して難しい部分ではなかった。
同じ転換から、人員配置上の含意も生じる。モデルが決められたポイントを捉えるようになると、時々うまくいくプロンプトを書ける人よりも、ショットを設計できる人のほうが価値を持つ。活きるスキルは伝統的な制作のものである。ショットが何を伝える必要があるか、アクションをどこに着地させるべきか、カットがどう感じられるべきかを知っていること。これらは宝くじの時代に価値を下げられ、モデルを演出できるようになって再び重要になる。
残る問いは、誰がその制御にアクセスできるかだ。安価なモデルと制御可能なモデルはまだ収束しておらず、両者の価格差は大きい。精度がプレミアム層に留まれば、実用的な恩恵はすでに制作予算を持つスタジオに届く。下方向に広がれば、脚本と計画を持つ個人クリエイターが、かつてチームを必要とした仕事を納品できるようになる。
関連記事
衛星写真がロボットの訓練データになる時代
フィジカルAIの学習におけるボトルネックは、もはや計算資源でもモデル能力でもなくなった。それは合成世界の品質である。
GoogleのGemini 3.5 Live Translateが会話の間をなくす
話者本人の声で、すでにポケットにあるスマートフォン上で継続的に動く翻訳は、この機能をわざわざ開くものから、ただオンになっているものへと変える。
中国、AIエージェント初の強制安全標準を制定
安全性は、宣伝する機能から、通過すべきゲートへと移る。リスク一覧は13カテゴリ・97項目に上る。
AI生成コンテンツ、身元を明示する段階に入る
この一歩はすべての問題を解決しないが、「AI生成」を、隠せる選択肢から、必ず答えなければならない問いへと変える。