AI動画が今も手と顔で破綻する理由、そしてそれを解決する順序

クライアント向けにAI動画を納品した経験のある人に聞けば、同じ不満が返ってくる。手がおかしい。顔がずれる。何もかも見事に見えるのに、キャラクターが何かを手に取った瞬間、視聴者がどうしても目を離せない場所で幻想が崩れる。
解決策は、モデルよりも作業の順序にある。安定した結果を出しているスタジオは、まず静止画を生成し、確認し、修正し、それから初めて動画化する。
順序はモデルより重要
静止画の段階で壊れた親指を見つければ、画像編集1回で済む。動画を生成した後に見つければ、クリップを丸ごと再生成することになる。現在の価格では、8秒のクリップはモデルにもよるが、わずか数クレジットから数百クレジットかかる一方、画像編集はその何分の一かで済む。動画から逆算して作業すると、ほとんど無料で気づけたはずの欠陥に、高価なリソースを浪費することになる。
だから実用的なワークフローはプロンプトではなくチェックリストだ。フレームを生成する。手と顔を拡大する。壊れている部分を修正する。承認する。一度だけ動画化する。この手順をテンプレートに組み込めば、あらゆる商品ショットが同じステップで回り、すでに推測が多すぎるプロセスから当て推量を取り除ける。
モデルによって、人体のどこまで固定できるかが異なる
現在の動画モデルはすべて何らかの画像入力を受け付けるが、一貫性の限界は、参照画像を何枚取れるか、そして最初と最後のフレーム制御に対応しているかどうかで決まる。その制御は、あまり使われていないレバーだ。モデルに動きの到達点を発明させるのではなく、両端をこちらが用意し、モデルにすでに承認済みの2つのフレーム間を補間させる。
Veo 3.1は、単一の人物または商品のアセット画像を最大3枚、さらに最初と最後のフレームを受け付ける。顔と音声の両方を決めたいときに選ぶモデルだ。Veo 3.1 Fastは同じ参照入力をより低価格で提供し、フラッグシップのクレジットを使う前に動きのブロッキングを行うのに向いている。Seedance 2.0は最大9枚の画像、3本の動画クリップ、3本の音声クリップを参照として受け付け、生成は最大15秒まで可能だが、実在の人間の顔にはByteDanceの同意と顔チェックが必要だ。Kling 3.0はElementsをそれぞれ2〜4枚の参照画像から構築し、クリップごとに最大3つまで。これにより、マルチショットのシーケンスを通して1つの被写体を維持できる。Runway Gen-4.5は最初のフレームのみを受け付ける。
比較から導かれる実用的なルールはこうだ。高速モデルでのドラフト生成は、最も安価な診断手段である。Veo Fastで手が失敗するなら、フラッグシップでも維持できる可能性は低く、より少ないクレジットでそれが分かる。
商品をすでに持っている状態から始める
制作ノートで何度も登場する手法があり、それはほとんど単純すぎるほどだ。商品をすでに手に持った状態から始め、それからカメラを動かす。モデルは、新しく握る動作を形成するよりも、既存の握りをはるかに信頼性高く保持する。人間がどうやって物を手に取るかをモデルに考えさせるのは、そのショットの目的とは何の関係もない問題を解かせることになる。
同じ論理は顔にも当てはまる。認識できる人物が必要なショットなら、参照を用意し、テキストで顔を説明して願うのではなく、モデルに補間させる。説明から生まれる顔は、ちらりと見ればもっともらしいが、じっと見ると不気味で、これは視聴者が何度も見るものにとって最悪の結果だ。
クリップの長さが選択を迫る
約8秒より長いテイクでは、選択肢はSeedance 2.0とKling 3.0に絞られ、これらは最大15秒まで生成できる。それ以外はすべて連結が必要で、連結はキャラクターとオブジェクトの一貫性が再び崩れる場所だ。だからこそ最初と最後のフレーム制御が重要になる。それは、モデルに握りを作り直させることなく、カットをまたいで把持状態を維持させる仕組みだ。
静止画ファーストの順序は、実は経済的な議論である
これを制作手法として捉えれば、算数は明らかだ。画像生成と画像編集は、動画生成に比べればどちらも安い。クリップのコストは長さと解像度に比例して増え、そしてこれが、支払いを済ませた後に1つのミスが判明する、工程の中で唯一のステップだ。上流のすべては、その唯一高価なステップを繰り返さずに済むように存在している。
それは、多くの人がプロンプトから持ち込む直感を逆転させる。自然な行動は、シーン全体をテキストで説明して直接動画を生成することだ。なぜなら、それがモデルを最も強力に使っているように感じられるからだ。しかしそれは、最も少ない保証に最も多くのお金を使う道でもある。先にフレームを承認すれば、オープンエンドな生成が制御された生成に変わる。モデルは今、正しいとすでに判断したものを動かしているからだ。
同じ順序は、より微妙な失敗からも守ってくれる。それは、1フレームずつ見ると良く見えるのに、動きの中では間違って見えるショットだ。静止画では問題なく見える手も、動いた瞬間に崩れることがあり、それを知る唯一の方法は見ることだ。つまり、どちらにせよ見ることになる。問題は、修正できる問題を抱えた1本のクリップを見ているのか、お金を払って作り直すしかない問題を抱えたクリップを見ているのか、ということだ。
モデルが今なお本当に異なる点
モデル間の違いがすべて価格帯の違いというわけではない。受け付ける参照画像の数と、最初と最後のフレーム制御が存在するかどうかは、コストだけでなく、何が可能かを変える。最初のフレーム1枚しか使えないモデルは、カットをまたいで被写体を維持できない。モデルが目標にできる2つ目の参照が存在しないからだ。
だからこそ、参照仕様は品質評価と同じくらい注目に値する。9枚の参照画像を受け付けるモデルは、最初のフレームしか使えないモデルにはできない方法で、シーケンスを通してキャラクターを維持できる。たとえ後者のモデルがより美しい単発クリップを生み出してもだ。トーキングヘッドのショットなら、より美しいモデルが勝つ。繰り返し登場する商品がある短いシーケンスなら、参照数を多く取れるモデルが勝つ。
最初と最後のフレーム制御は、ほとんどのチームが十分に活用していないレバーであり、あらゆる動画モデルの中核的な弱点、つまり予測できない到達点を発明してしまうという問題に対処する。両端を用意すれば、モデルはすでに確認済みの2つのフレーム間を補間する。端点が実在するため動きはもっともらしく保たれ、一貫性の問題はモデルの想像力への賭けではなくなる。
誰がこの仕事をできるか、これが意味するもの
順序と参照制御が組み合わさることで、許容できるAI動画を制作できる人の幅が広がる。ポストプロダクションのパイプラインを持たない小さなスタジオでも、今では静止画を生成し、画像エディタで修正し、まとまりのあるショットを動画化できる。かつて必須だった専門的なクリーンアップは要らない。求められるスキルは、壊れたフレームを直すことから、モデルがまだ失敗するケースを避けるショットを計画することへと移る。
それは、2年前に静止画生成を襲ったのと同じ移行だ。ツールが十分に信頼できるようになると、クラフトは上流のアートディレクションと下流のレビューへ移り、真ん中のステップ、つまり人がツールを協力させようと格闘する工程は縮小した。動画も今その段階に入っており、いち早くプロセスを適応させたチームが、他のすべてがクリップを再生成している間にスケジュール通りに納品するチームになる。
だからこの規律は書き留めておく価値がある。静止画を生成し、手を修正し、フレームを承認し、それから動画化する。クレジットはモデルに。結果は順序に。
関連記事
Comfy API、ComfyUIワークフローを本番エンドポイントに変換
ワークフローを作ることは決して難しい部分ではありませんでした。難しかったのはそれを出荷することであり、だからこそこれまで小規模チームは社内のComfyUIツールを製品に変えられませんでした。
自宅でAI画像生成を動かす:2026年の現実的なガイド
ローカルAI画像生成は、ついに一般的なハードウェアで動作します。2026年の現実的なガイド:カード、モデル、ツール、そして誰も口にしないコスト。
毎月20の新しい画像モデル、それでも私のプロンプトは機能する:構造優先プロンプティングの主張
構造優先プロンプトがなぜモデルの入れ替わりを生き延びるのか、そしてプロンプトライブラリで残すものと捨てるもの。
2026年に自分のハードウェアで画像モデルを動かす:ローカルコミュニティが実際に使っているもの
2026年にローカルAI画像生成コミュニティが実際に動かしているもの:モデル、ツール、ハードウェア階層。