Kandinsky 6.0、同じパスで音声を生成する動画の重みをオープンソース化

--- title: Kandinsky 6.0、同じパスで音声を生成する動画の重みをオープンソース化 meta_title: Kandinsky 6.0、ネイティブ音声付き動画をオープンソース化 meta_description: Kandinsky Labは、同期音声を一度の処理で生成する3Bおよび29Bの動画モデルをMITライセンスで公開し、vLLM-Omniの初日サポートを提供した。 ---
ほとんどのオープンなテキストto動画システムは、音声を他人事として扱っている。無音の映像を生成し、後からサウンドトラックを継ぎ足す。すると、口の動きがセリフに合う位置に来ることはほとんどない。Kandinsky Labの答えは、今週falで公開されたもので、両方を同時にモデル化するというものだ。
Kandinsky 6.0 Videoは2つのサイズで提供される。映画的な出力を狙った29BのProモデルと、素早い反復のための3BのLite版だ。コードと重みはMITライセンスで公開されており、商用利用を計画している人にとっては、パラメータ数よりも重要なことだ。
2つのティアが実際に提供するもの
両モデルともショートフォーム生成を対象としている。クリップは最大約5秒で、音声は44kHzのサンプルレートで出力される。Proは品質重視のティアであり、Liteは素早く反復する必要があり、速度とコストのために忠実度を犠牲にしてもよいチーム向けに位置づけられている。
最大の特徴は同時生成だ。言語、視覚、音声がパイプラインではなく一緒にモデル化されるため、足音、環境効果、口の形が画面上で起きていることと揃う。この種のネイティブな同期は、これまで主にクローズドな商用システムの領域だった。だからこそ、オープンな公開が注目に値する。

vLLM-Omniは初日から推論サポートを提供する。これは利便性以上の意味がある。推論スタックが数週間後ではなくリリース当日にサポートを提供すると、チームは最初の熱意が冷める前に、自社のワークロードでモデルを評価できる。
falでは、モデルに統合アップスケーリングと単体の動画超解像ツールがバンドルされている。したがって実用的なパイプラインは、テキストまたは画像を入力し、5秒クリップを出力し、その後アップスケールするという流れだ。
ライセンスは注意深く読む必要がある
ここが注意に値する部分だ。このリリースの報道はMITと説明しており、Kandinsky Lab自身の発表も、コードと重みはMITライセンスで提供されると述べている。しかし、独立系のモデルトラッカーは、ライセンスを標準的な寛容型ではなくカスタムとして記載している。
この不一致は、誰かがこれらの重みの上に製品を構築する前に解決する価値がある。真に寛容なライセンスなら、別途契約なしで商用利用、改変、再配布が可能だ。カスタムライセンスは一見同じくらいオープンに見えても、後になって表面化する制限を伴うことがあり、多くの場合、地域、規模、下流での再配布に関するものだ。
今年のパターンは、中国のラボが寛容に聞こえる名前のオープンウェイトを公開し、条件の中に除外規定を埋め込むというものだった。たとえばMiniMaxのH3ライセンスは、米国、欧州連合、英国、韓国を除外している。モデルカードからデプロイ計画へ進む人は、実際の条件を読むべきだ。
MITライセンスの動画重みは、説明どおりなら意味のある一歩だろう。寛容な動画ライセンスは、寛容な言語モデルライセンスより珍しい。一部には、動画モデルの方が学習データに関する来歴の問いが複雑であるため、また一部には、それを生み出すラボがより商用であることが多いためだ。音声も扱う真にオープンな動画モデルは、小規模スタジオにAPI契約を必要としない道を与えるだろう。
なぜ同期音声がより難しい問題なのか
テキストプロンプトからもっともらしい動きを生成することは、十分に解決され、興味深い作業は別の場所へ移った。オープンな動画生成の物足りない部分は音声だった。
無音生成がユーザーに押し付けるものを考えてみよう。キャラクターが話しても、あごは独自のタイミングで動く。誰かが歩いても、足音はポストプロダクションで追加し、手作業でフレームを合わせなければならない。ドアが閉まっても音はなく、ストック効果音を入れても正しいフレームに合うことはほとんどない。これらは個別には小さな問題だが、まとめると絶え間ない負担になる。それぞれに編集者の注意が必要だからだ。
同時モデリングはタスクの形を変える。モデルがタイミングを内部で処理するため、出力はより完成したクリップに近いものとして届く。ショートフォームコンテンツ、ソーシャル広告、キャラクターアニメーションにとって、それはデモと納品物の違いだ。
Proが実際に緊密な同期を実現しているかは、アーキテクチャがそれを支えているかとは別の問題であり、それを決着させる独立評価はまだ出ていない。このリリースは主張をし、デモを提供しているが、それらを証明として扱うのは早計だろう。
オープン動画の仲間内での位置づけ
5秒の短いクリップは、Kandinsky 6.0をオープンソース動画生成の現行分野のただ中に置くもので、その先頭に立つものではない。AlibabaのWan 3.0は、Artificial Analysisが再構築したテキストto動画ボードでElo 1157を記録して首位にあり、自分で動かす価値のあるオープンウェイトの選択肢、特にMiniMax H3はすでに確立されている。
したがって公平な位置づけは、革命的というより競争的だ。Kandinsky 6.0が加えるのは、オープンライセンスでのネイティブ音声と、本格的な品質ティアから軽量ティアまでをカバーするサイズ範囲だ。特に3BのLiteモデルは、29Bの拡散モデルをホストすることを正当化できなかったチームに門戸を開く。
2層構造はまた、チームに明示的に検討すべきトレードオフを与える。プロンプトと絵コンテを反復している間はLiteを実行する。そこでは5秒クリップが存在する必要はあるが、美しい必要はない。シーケンスが固まったらProに移る。これはクローズドプロバイダーがしばらく前から支えてきたワークフローの形であり、オープンウェイトには主に欠けていたものだ。
注目すべき点
このリリースが6か月後に意味を持つかどうかを教えてくれる3つのことがある。
第一に、ライセンス条件だ。それが真に寛容であると判明すれば、このモデルは商用のオープン動画作業におけるデフォルトの選択肢になる。制限が実質的であれば、採用はそれらが影響しない地域に集中するだろう。
第二に、独立したベンチマークだ。Artificial Analysisは画像to動画ボードを新しい尺度で再構築しており、それが公開されればすべてのEloが動く。Kandinsky 6.0がそのようなボードに登場するまで、品質の主張はベンダーのデモに依存している。現在のテキストto動画リーダーボードでは、Wan 3.0がElo 1157、コストは毎分12ドルで首位に立ち、20カテゴリー中10勝している。これはこの分野のトップがどれほど混み合っているかを示している。Kandinsky 6.0はそのレベルで競っているわけではなく、正直な疑問は、そうする必要があるのかどうかだ。
第三に、音声が精査に耐えるかどうかだ。同期は、人物がカメラに向かって話す5秒クリップでは示しやすいが、音が重なり合う混雑したシーンでは示しにくい。これまで公開されたデモは、簡単なバージョンだ。
もう1つ、これの上に構築しようと計画しているあらゆるチームに当てはまる考慮事項がある。動画生成モデルの実行は高コストであり、29Bの拡散モデルは本格的なデプロイだ。fal経由でキャパシティを借りればその負担はなくなるが、オープンウェイトの主な利点、つまり自分で動かせるという利点もなくなる。ほとんどのチームにとって、3BのLiteティアの方が興味深い選択肢だ。小規模スタジオがすでに所有しているハードウェアでも、もっともらしく動かせるのはこちらだからだ。
今のところ、興味深い事実は構造的なものだ。画像と音声を一緒に生成するオープンモデルが、完全に寛容とは限らないライセンスの下にあり、推論サポートは同じ日に登場する。オープンとクローズドの動画生成の差は今週縮まった。そして、その差のどれだけが閉じたままになるかは、ライセンスの問いが決めるだろう。
関連記事
Google FlowとAdobe Firefly、AI動画をチャットボックスの外へ
基盤モデルの品質は十分に収束し、差別化要因はモデルを取り巻くものへと移った。
Google、Nano Banana 2.1の出力価格を半額にし、最も弱い機能を修正
最も重要な詳細は機能リストの外にあり、それは価格です。
Vida、AIエージェントの課金を利用量ではなく成果で請求へ
利用量ベース課金は、ベンダーの収益をエージェントがより長く時間をかけることと一致させる。成果ベースの価格設定はそれを逆転させる。
DecagonのVoice 3とPACT、顧客対応を「電話の向こう側にいるエージェント」に備えさせる
サポートシステムは何十年もかけて人間の行動をモデル化してきた。今や、入ってくるリクエストの一部は人間のために行動する機械だ。