2フレーム法:最初と最後のフレーム補間がAI動画のプランニングをどう変えたか

Googleは10月9日、Veo 3.1の「最初と最後のフレームから動画へ」機能を更新しました。開始フレームと終了フレームの2枚の静止画をアップロードすると、モデルがその間の動きを生成します。出力はネイティブ音声付きで最大4K/60fps、9:16の縦動画に対応し、キャラクターとスタイルの一貫性を保つために3~4枚の参照画像を受け付けます。
単体で見ると、小さな追加機能に思えます。しかし実際には、ショットの計画の立て方を変えます。本当に重要な2つの判断を、制作プロセスの最初に戻すからです。
プロンプトのみの動画が抱える問題
この2年のほとんどの期間、AI動画はスロットマシンのように機能してきました。文章を書いて、待って、何かが出てくるのを見る。結果は投稿するには十分でも、採用するにはめったに十分ではありませんでした。キャラクターが崩れたり、カメラが妙な動きをしたら、プロンプトを書き直して再試行する。その繰り返しです。
クリエイターはこれを回避する方法を学びました。強い静止画を生成し、それをモデルに動かしてもらう、いわゆるimage-to-videoです。これで開始フレームは固定できましたが、ショットがどこで終わるかは誰も制御できませんでした。クリップは勢いが尽きるか、誰も望んでいない結末を勝手に生み出すかのどちらかになりがちでした。
両端を定義すれば、その当て推量の多くを取り除けます。観客がどこから見始め、どこで見終えるかを自分で決められます。モデルの仕事はより狭くなります。つまり、その2つをつなぐだけです。
なぜ絵コンテ的思考が戻ってきたのか
アニメーションスタジオは1世紀にわたってこの方法で仕事をしてきました。アニメーターはキーポーズを描き、次にもう一つのキーポーズを描き、その間を埋めます。肝心なのはポーズの選択であり、すべてのフレームを描くことではありません。AI動画は別の道を通りながら、同じ分業に到達しつつあります。
これはVeoに限った話ではありません。制御性をめぐる競争は何カ月も前から激しくなっています。Kling 4.0は10個のキーフレームと30秒のネイティブクリップで登場しました。Seedance 2.5は既存の映像を新しいカメラアングルから再撮影できます。Wan 3.0はArtificial AnalysisのAA-Video-T2V v2.0ベンチマークでElo 1157を記録して首位に立ち、価格は毎分約12ドルです。10月7日に公開されたViduのQ4プレビューは毎秒約0.014ドルからで、最大15枚の画像参照を扱えます。最強モデルに共通するのは、生の品質よりも、どれだけ精密に操作できるかです。

実際に機能するセットアップとは
2フレーム法は、その2つのフレームがつなぐ価値のあるものでなければ効果を発揮しません。いくつかの習慣が役立ちます。
フレームは、以前のクリップのスクリーンショットではなく、画像モデルで生成しましょう。両端で構図、照明、衣装を制御したいからです。GoogleのVeoが参照画像を受け付けるのは、顔や製品がトランジションを越えて維持されるようにするためですが、それも参照画像が最初から一貫している場合にしか機能しません。
カメラの動きはシンプルに保ちましょう。補間は、プッシュイン、プルバック、リビール、ゆっくりしたドリフトをうまく処理します。単一クリップ内でハードカットを求めると苦手です。補間すべきカットが存在しないからです。ショットにカットが必要なら、2つのクリップを作りましょう。
音声の計画はショットに合わせましょう。Veo 3.1はネイティブ音声を合成するので、環境音や簡単な効果音には便利です。シーンに特定のセリフやライセンス楽曲が必要なら、生成された音と格闘するのではなく、後から追加する計画を立てましょう。
この方法は、ストーリーのビートを担うショットに取っておきましょう。2秒のトランジションに、丁寧に作った2つのフレームを使う理由はありません。観客に変化を気づかせたい場所で使いましょう。
2つの余分なフレームに実際いくらかかるのか
フレーム単位で計画することは、値札の付いた判断です。そしてその値段は、1年前より読みやすくなっています。動画市場は毎秒コストをめぐって下落競争を続けてきました。10月7日に公開されたViduのQ4プレビューは毎秒約0.014ドルからで、最大15枚の画像参照を扱えます。10月8日にAPIへ追加されたxAIのGrok Imagine Video 1.5 Liteは、480pで毎秒0.02ドル、1080pで毎秒0.14ドルとされています。HeyGenの新しい汎用動画モデルは、10月のプロモーション価格で毎秒1セントで提供されました。Artificial Analysisの動画ベンチマークでElo 1157を記録し首位となったWan 3.0は、毎分約12ドル、つまり毎秒20セントになります。
ここから2つのことが導かれます。第一に、今や生成そのものが高価な部分であることはほとんどありません。数秒の補間モーションは、ドルではなくセント単位で済みます。第二に、希少な資源はフレームです。強い静止画を2枚生成して選ぶには人の時間がかかり、APIが安くなってもその時間は安くなりません。経済性が報いるのは、量ではなく計画です。これは、プロンプトのみのツールが人々に身につけさせた行動とは正反対です。
実際の仕事で通用するワークフロー
すべてを変えずに、この方法を小規模制作に当てはめる手順はこうです。コンセプトから始め、そのショットが着地させるべき単一のビートを決めます。開始フレームと終了フレームを画像として作り、同じ参照画像を使って顔、衣装、小道具を一致させます。補間を生成したら、構造を見るために一度、細部を見るためにもう一度確認します。動きのカーブがおかしければ、プロンプトではなくフレームを直しましょう。モデルが実際に読んでいるのはフレームだからです。ショットに応じて音声を追加または差し替えます。そしてシーケンスにカットし、文脈の中で評価します。単体では印象的に見えるクリップも、隣り合うカット次第では遅く感じられることがあるからです。
ここでの規律とは、すべての修正がサイコロを振ることではなく、ストーリーに関する判断であることです。これは、この機能を初めて試す人が見落とす部分です。近道のように感じられますが、最初世代のAI動画ツールが人々に飛ばさせたプリプロダクションを、静かに復活させているのです。
通常のカメラが依然として勝つ場面
これは、撮影が時代遅れだと言っているわけではありません。補間が最も強みを発揮するのは、両端が強く、その間の動きがシンプルな場合です。これは製品ショット、トランジション、タイトルカード、雰囲気のある確立カットの多くをカバーします。最も弱いのは、現実が特定の予測不能なことをしている場合です。全速力で走る本物の馬、反応する群衆、本物らしく見えなければならない料理などです。そうした場面では、カメラと有能な編集者がいれば、議論は決着します。
賢明な立場は退屈です。制御が重要で動きが予測できる場所では補間を使い、シーンが本物である必要がある場所ではカメラを使う。実際に働くクリエイターの多くは、同じプロジェクトで両方を使うことになりますが、その混合は妥協ではありません。ただの制作です。
正直な限界
補間はやはり補間です。2つのフレームが物理的に複雑な中間を暗示している場合、たとえば人が一回転する、液体が形を変えるなどでは、モデルは何かをでっち上げ、それが常に正しいとは限りません。暗示される動きは、カメラが現実的に記録できる範囲にとどめましょう。
またコストも押し上げます。磨かれた静止画2枚と生成クリップは、1つのプロンプトより手間がかかります。現在の市場の毎秒価格なら、1年前より手頃ですが、計画にかかる時間は現実に発生します。この方法は、すでにショット単位で考える人に報いるものです。
そして中間については、依然として保証はありません。この機能が本当に売りにしているのは、解決済みの問題ではなく、より小さな探索空間です。それは意味のある一歩です。使えるクリップと記憶に残るクリップの違いは、今やほとんど選ぶフレームにかかっており、それは人が下す判断なのです。
次に注目すべきこと
同じパターンが広がることを予想しましょう。一つの主要モデルがフレームを主要な入力として扱い始めれば、競合も追随する傾向があり、面白い問いは、誰の補間が継ぎ目で最も自然に見えるかになります。中間キーフレームを追加できるツールに注目しましょう。タイムラインを離れずに、監督に3つ目のアンカーを与えることになります。
今のところ、実用的な結論は地味です。AI動画を作るなら、プロンプトを主要な創作行為として扱うのはやめましょう。まずフレームを作り、ストーリーを語る2枚を選び、その間の旅はモデルに任せましょう。
関連記事
Decagon の PACT プロトコルは「同意」を標準にしようとしている
Decagon は、個人エージェントの身元と、顧客が与えた権限を検証するプロトコルをオープンソース化した。地味な配管だが、エージェント経済が機能するかを決める。
AI「再会」ブーム:まだどう感じるべきか決めきれない中国の議論
AI の追悼動画が亡くなった著名人を中国の画面に連れ戻し、数十万の「いいね」を集めた。そして反発が来た。争点は「同意」だった。
Apple はオープンなマルチモーダルモデルを公開し、ほとんど誰にも知らせなかった
研究優先のこのリリースは主流の視野を静かにすり抜けたが、細粒度の視覚グラウンディングは Apple の AI スタックの行き先を語っている。
OpenCut と「オープンソース版 CapCut」の瞬間
無料で MIT ライセンスの動画編集アプリが GitHub のトレンドを上り続け、ロードマップには AI エージェント向けの MCP サーバーが含まれる。AI メディアを囲む道具がモデルに追いつきつつある。