Kling VIDEO O1、動画生成を参照システムに変える

--- title: Kling VIDEO O1、動画生成を参照システムに変える slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1、参照をインターフェースにする meta_description: KuaishouのKling VIDEO O1は、テキスト、画像、動画、キーフレーム、参照を任意の組み合わせで受け取り、あるクリップの要素を別のクリップに引き込めるようにする。 category: ai tags: Kling VIDEO O1,Kuaishou,動画生成,参照システム,キーフレーム,マルチモーダル,Veo 3.1,Runway Aleph,一貫性 ---
Kuaishouの動画部門はこの1か月、リリースを続けてきた。Kling 4.0はテスターに公開され、その後、より広いローンチ枠を得た。そして今、VIDEO O1が、よりカテゴリーの転換に近いものとして登場する。つまり、テキスト、画像、動画クリップ、キーフレーム、キャラクター参照を入力として受け取り、それらすべてを単一リクエストの交換可能な部品として扱うモデルだ。
同社が使う呼び名は「統合マルチモーダル」だ。実用的な言い方をすればもっと簡単だ。3つのクリップを添付し、こう書ける。動画1からキャラクターを、動画2からカメラモーションを取り、両方を動画3に落とし込み、スタイルをピクセルアートに切り替えよ。
1年前なら、その単一のリクエストには3つの別々のツールと、中間ファイルの慎重な書き出しが必要だった。各ホップごとに圧縮処理が加わり、キャラクターがずれる可能性もあった。
オールインワン参照が実際にもたらすもの
キャラクターと小道具の一貫性は、AI動画における頑固な問題だった。以前の回避策はモデルを連鎖させるもので、各ステップに料金を払い、それらの間で蓄積するずれを受け入れることを意味した。Klingのアプローチはその連鎖を単一生成に折り畳むので、参照画像、キーフレーム、スタイルの方向性がすべて一度に解決される。
Kling自身の数値では、O1は画像参照タスクでGoogleのVeo 3.1「Ingredients to Video」機能に対して247パーセントの勝率、変換タスクでRunway Alephに対して230パーセントの勝率を記録している。これらは社内評価なので、方向性を示すものとして扱うべきだ。より検証可能なのは能力の主張だ。複数の被写体を個別に固定する必要があるグループシーンでは、1つの混ぜ合わされた平均としてではなく、被写体ごとに処理される。
動画の長さは3秒から10秒まで調整可能で、モデルが決めたままを受け入れるのではなく、ショットのテンポを自分で決められる。内部では、同社は長いマルチモーダル文脈を持つマルチモーダルトランスフォーマーに加え、テキスト、視覚、音声信号をトランスフォーマー内部で混ぜ合わせる「マルチモーダル視覚言語」と呼ぶ新しい内部フォーマットを説明している。組み込みの連鎖的思考推論は、生成される動きを物理的に妥当に保つためのものだ。
列挙されている生成タイプは、このカテゴリーが別々のツールに分割してきたものすべてのチェックリストのように読める。テキストから動画、画像から動画、動画から動画、キーフレームから動画、複数画像から動画、参照から動画、動画へ。それらはかつてそれぞれが製品だった。O1の主張は、それらが1つのシステムのモードであるということだ。
ベンチマークよりインターフェースが重要な理由
興味深いのは、O1がそもそも比較で勝っていることだが、より重要な変化はモデルの入力面だ。それは今や再利用可能なアセットのライブラリである。複数の角度から作られたキャラクターは、各プロンプトで説明し直すのではなく、名前で添付する要素になる。カメラの動きは、形容詞で近似するのではなく、クリップから借りてくるものになる。

これはワークフローの形を変える。画像モデル、次に動画モデル、次に編集者という直線的な連鎖は、各ホップにコストがかかるが、より少ないホップに畳み込まれる。また、このツールが誰に向けられているかも変える。ポストプロダクションチームは、トラッキングやマスキングの工程の代わりに自然言語の指示を得て、広告チームはすべてのショットをゼロから作り直すことなく撮影を置き換える手段を得る。
語彙はインターフェースのもう半分だ。要素を名前で添付するということは、チームがショットプロンプトを1つ書く前にキャラクターの呼び方を合意し、その名前をキャンペーン全体で再利用できるということだ。同じことを形容詞で近似するのは1回ならうまくいくが、改訂のたびに難しくなる。なぜなら、どの形容詞の組み合わせがみんなの気に入ったバージョンを生んだのか、記録がないからだ。
ベンダーのドキュメントも、プロ向けのユースケースを同様の言葉で説明している。AI映画制作は、撮影全体を通してキャラクターと小道具の一貫性を保つために要素ライブラリに依存する。広告とファッションは、バーチャルランウェイを含むロケーション撮影の代替として使う。ポストプロダクションは、以前はフレームごとのロトスコープが必要だった変更を行うために使う。
ここには自己選択効果がある。これほど多くの入力タイプを持つモデルは、初心者に優しいわけではない。すでに何が欲しいかを知っている人に優しいのだ。これは、2年間にわたって初回体験の最適化に費やしてきたカテゴリーにとって、意味のある転換だ。
参照システムが置き換えるもの
この転換を理解する最も明快な方法は、チームが弱いモデルの周りに何を構築していたかを見ることだ。一貫性パイプラインは組み立てラインだった。キャラクターシートを生成し、それを画像プロンプトとしてすべてのショットに投入し、アニマティックを生成し、次にアニマティックから取った開始フレームで各ショットを再生成する。各段階が存在したのは、前の段階が十分な文脈を先に運べなかったからだ。
O1の参照システムは、それらの段階が存在した理由を狙っている。モデルがグループシーン全体でキャラクターの同一性を保持しつつ、別のクリップからカメラの動きも取り入れられるなら、それらの段階のいくつかは必須ではなく任意になる。任意の段階こそ予算が実際に動くところだ。なぜなら、制約を前提に構築されたパイプラインは、制約が緩和されただけでは消えないからだ。
同じ論理はショットの並びにも当てはまる。既存のフッテージに基づいて前後のショットを生成するプログラムは、クリップライブラリをよりシーンに近いものに変える。すでにタイムラインで作業している編集者はその価値を理解するだろう。別アングルを試すコストが、再撮影から1回の生成に下がる。
トレードオフは現実に存在する
Klingは、O1はSora 2やVeo 3.1よりも学習曲線が急だと述べている。どの機能も役立つようになる前に、理解すべき機能が多いからだ。これは、より表現力の高いインターフェースの標準的なコストだ。何でも参照として受け入れるモデルは、何を参照すべきかをあなたに決めさせる。
同社はO1で音声を解決していない。Kling 2.6がプラットフォームの音声生成を担うモデルで、同期した台詞、音楽、効果音を備えている。したがって、完全な制作には依然として2つのモデルを組み合わせる必要がある。1つは視覚言語用、1つはサウンドトラック用だ。Kling自身の2.6のマーケティングは「音を見て、映像を聞く」という考えに依拠しており、これはO1の外側にある能力を適切に説明している。
価格も、プラットフォームがどの位置を狙うかを反映している。Klingが公表している1秒あたりのクレジットは、音声なしの720pで6クレジットから、音声ありの1080pで12クレジットに上がる。また、プラットフォームは無料生成にも及ぶ商用利用ポリシーを売りにしている。プロのワークフローに位置づけられたモデルとしては、参入点は小規模チームが本格導入前に試せる程度に低く保たれている。
注目すべき点
O1の参照システムが制御されたデモの外でも持ちこたえるかどうか。一貫性の主張は短いクリップや短いセッションでは生き残りやすいが、プロジェクトが数週間続き、数十の要素が蓄積されると劣化する傾向がある。要素ライブラリの概念は、その期間を通じて要素が安定している場合にのみ報われる。
Kuaishouはすでに、4.0が30秒のネイティブ生成と最大10キーフレームをもたらすと述べている。O1の参照レイヤーがそれらの制限と競合するのではなく組み合わさるなら、この2つは「どれだけ長く」と「誰の顔」という両方の問いをカバーする。その組み合わせこそ、スタジオが待っていたものだ。
短期的な競合状況も重要だ。Gemini Omni 1.1 FlashがArenaのテキストから動画部門で1516のトップを保持し、MiniMax H3が画像から動画をリードし、Wan 3.0がArtificial Analysisの動画ボードを制している。O1は空の分野に参入するわけではない。その差別化はリーダーボード上の順位ではなく入力面であり、チームがその周りに要素ライブラリを構築してしまうと、置き換えるのがより難しいものだ。
関連記事
衛星写真がロボットの訓練データになる時代
フィジカルAIの学習におけるボトルネックは、もはや計算資源でもモデル能力でもなくなった。それは合成世界の品質である。
GoogleのGemini 3.5 Live Translateが会話の間をなくす
話者本人の声で、すでにポケットにあるスマートフォン上で継続的に動く翻訳は、この機能をわざわざ開くものから、ただオンになっているものへと変える。
中国、AIエージェント初の強制安全標準を制定
安全性は、宣伝する機能から、通過すべきゲートへと移る。リスク一覧は13カテゴリ・97項目に上る。
AI生成コンテンツ、身元を明示する段階に入る
この一歩はすべての問題を解決しないが、「AI生成」を、隠せる選択肢から、必ず答えなければならない問いへと変える。