Gemini Omni 1.1 Flash、4つのリクエストを連結して40秒のショットに。ワークフローこそが製品だ。

GoogleのGemini Omni 1.1 Flashは、評価するのが妙な製品だ。モデル自体は新しくないからである。2026年8月27日にID「gemini-omni-1.1-flash」で一般提供を開始し、古いプレビューエンドポイントは9月30日に廃止された。生成を取り巻くすべては変わったが、生成品質はほぼ以前のままだ。
機能リストは制作チェックリストのように読める。シーン延長は最大10秒の先行コンテキストを分析するようになり、Googleはこれを、最後の1秒しか参照しなかった従来モデルからの飛躍だと説明する。動画は10秒単位で延長でき、累計上限は40秒だ。開始フレームと終了フレームの制御により、開発者はショットの両端を指定し、その間の動きを生成できる。カメラの周回、ズームトランジション、継ぎ目が見えないループを狙ったものだ。360pドラフトモードは、標準720pの3分の1のコストで最大60%高速に生成する。最終出力は1080pまたは4Kにアップスケールされる。最大3秒の動画を、キャラクターとシーンの一貫性のための参照素材として供給できる。
延長機能は注意深く読むべきだ。マーケティングでは丸められているからである。40秒のOmniクリップは4つの連結されたリクエストであり、それぞれが最後の10秒をコンテキストとして使うのであって、単一の40秒パスではない。個々の生成は依然として3~10秒の間に収まる。この区別は、成果物に対してレイテンシと推論コストを見積もるすべての人にとって重要であり、40秒のショットが実用的なのか、単に可能なだけなのかを決める種類の詳細である。

料金体系は反復を促すように設計されている
Googleの価格構造はドラフト作成に報いる。API価格は入力トークン100万あたり1.50ドル、動画出力トークン100万あたり17.50ドルで、720p動画1秒あたり5,792トークンで課金される。これはおおよそ1秒あたり0.10ドル、1分あたり6ドルになる。10秒クリップあたりでは、料金の階段は360pで約0.30ドル、720pで1.00ドル、1080pで1.50ドル、4Kで3.00ドルとなる。
この勾配は偶然ではない。360pドラフトと4Kマスターの差は桁違いであり、チームを、低解像度の階層で安く反復し、最終テイクにだけ支払う作業方法へと押しやる。これを、ほとんどの人が動画生成に持ち込んだ習慣と比較してみよう。プロンプトを書き、待ち、結果を見て、プロンプトを書き直し、サイコロを振るたびに満額を支払うという習慣だ。Googleは後者の行動をワークフローから価格設定によって排除しようとしている。
提供サーフェスも比較すべきだ。配布は不均一だからである。Googleは全機能セットを開発者向けかつAPI利用可能として位置づけている。5つの機能がAI Studio、Gemini API、Gemini Enterprise Agent Platformを通じて開発者に出荷される一方、Geminiアプリでの消費者向け展開はシーン延長のみに限定されている。同じモデルはAI Plus、Pro、Ultra加入者向けのGoogle Flow内にあり、YouTube Shorts RemixとYouTube Createアプリ内では無料だ。1つのモデル、5つのアクセス階層、そのうち4つは興味深い機能を利用できない。
40秒ショットの計算
連結延長はショットのコストを変えるが、その変化は線形ではない。
単一の3~10秒生成は安くて速い。40秒のシーケンスは直列の4リクエストであり、それぞれが独立して失敗しうる。3番目のリクエストが連続性を壊すテイクを生んだ場合、40秒全体を再生成するのではない。壊れたセグメントの最初のフレームから再生成し、その後ろをすべて再連結する。そして、ミスのコストはシーケンス内の位置とともに倍増する。最初の10秒はやり直すのが安い。最後の10秒は高くつく。やり直すことが、その下流すべてをやり直すことを意味するからだ。
これがキーフレーム制御の実用的な論拠だ。開始フレームと終了フレームを指定できることで、各セグメントは両端に検証ステップを備えた境界のある問題になる。シーケンス全体を視聴して連続性が保たれたことを願うのではなく、チームはセグメントが着地すべきフレームに着地したかを確認できる。カメラの周回やズームトランジションでは、それは自由形式のプロンプトよりもはるかにテスト可能な作業単位である。
360pドラフト階層も同じ理屈に合う。40秒のシーケンスを6ドルではなくおよそ1ドルでプロトタイピングできれば、反復は手頃になり、1080pや4Kへのアップスケールは別個の意図的なステップになる。Googleが実質的に出荷したのは、価格設定にレビューゲートを組み込んだ制作パイプラインである。
ベンチマークが今示すもの
Gemini Omni 1.1 FlashはArenaのテキストto動画ボードで1516を記録して首位に立ち、わずかに自身の前身であるGemini Omni Flashの1513を上回る。Arena自身の新しいモデルの順位帯は1~4にわたり、これは2つが信頼区間内で並んでいることを丁寧に言ったものだ。
他の場所のリーダーボードの状況は、ローンチ時の報道が示唆したほど好意的ではない。このモデルは2026年7月中旬までにArtificial Analysisの4つのボードすべてを制した。その制覇は終わった。再構築されたテキストto動画ボードでは、10月初旬時点でGemini Omni Flash 1.1は音声ありで8位、無音で8位につけ、Arenaの画像to動画ボードではMiniMax H3に次いで2位だ。Artificial Analysisは1.1 Flashをテキストto動画ボードで直接評価しておらず、そこでは旧Flashモデルが首位で、AlibabaのWan 3.0とMiniMax H3がすぐ後ろにつけている。
それは動きの速いカテゴリーでは普通の結果であり、ワークフロー面の追加を損なうものではない。ただ、このリリースを正直に位置づけるなら、Googleは生の出力品質ではなく、制御性と価格階層で競争しているのであり、リーダーボードはもはや同社が勝つ場所ではないということだ。
このリリースが解決しない2つのこと
ネイティブの同期音声は確認されていない。Googleのローンチ資料は動画と並行したサウンドトラック生成を詳述しておらず、音声出力は後続リリースで提供されると記載されている。入力音声はローンチ時点では音声参照に限定される。その名前を持つany-to-anyモデルファミリーにとって、音声出力の欠如は際立つギャップであり、特にサウンドが成果物の半分を占めるショートフォームコンテンツを制作するチームにとってそうだ。
2つ目は尺である。4つの連結リクエストから組み立てられた40秒は実際の能力であり、同時に、ナラティブ動画フォーマットがすぐにぶつかる上限でもある。Googleはリリース日のないハイエンドのGemini Omni Proを匂わせており、延長の仕組みは、より長いショットへの道が、単一のより長い生成ではなく、より良いコンテキスト処理を通ることを示唆している。
すべての出力にはデフォルトでSynthIDウォーターマーキングとC2PA Content Credentialsが付与され、廃止されたプレビューエンドポイントはGoogleのモデルリストにもはや表示されない。Googleは現在、Veo 3.1プレビューエンドポイントよりもOmni 1.1を推奨しており、これは注目すべき内部の引き継ぎである。Veo 3.1は現行のフラッグシップVeoのままで、Veo 4は発表されていない。
実際に何を使って構築すべきか
このリリースを読む有用な方法は、製品とは何かが変わったと捉えることだ。10秒クリップを生成する動画モデルは目新しさの生成器である。10秒の先行コンテキストを分析し、開始フレームと終了フレームを受け入れ、3分の1の価格で360pのドラフトを作り、4Kにアップスケールするモデルは、タイムラインの中に組み込めるコンポーネントだ。
それこそ制作チームが計画を立てられる生成動画の姿であり、興味深いエンジニアリングがプロンプト作成からパイプライン設計へ移る姿である。このリリースでは、クリップよりも組み立てが重要だ。
関連記事
Step 5はバージョン番号を4つ飛ばしてオープンモデル2位に着地した。だが誰もAPIを叩いていない
ベンチマークの順位は、作り手がモデルを評価するために使うシグナルだ。呼び出し量は、使い手が実際に使うことで生み出すシグナルだ。
Microsoft、部分文字起こしのレイテンシを100ミリ秒に短縮。文字起こしの目的が変わる。
100ミリ秒を下回ると、文字起こし製品は誰かがまだ話している間に応答できる。
Synthesiaは10年をかけてアバターを録画してきた。今度は、アバターに話し返してもらおうとしている。
人が自発的に繰り返す研修ツールは、誰かに割り当てられてこなすツールとは別物だ。
文章を書くことを拒否するモデルが、今や1日1兆トークンを処理している
はるかに優れたインターフェースを備えた分類器。ソフトウェアがすでに構造化してほしかった作業に向けたもの。