Gemini Omni 1.1 Flash 把四次请求串联成一段 40 秒镜头。工作流才是产品。

Google 的 Gemini Omni 1.1 Flash 是个很难评估的产品,因为模型本身并不新。它于 2026 年 8 月 27 日以 id gemini-omni-1.1-flash 正式开放通用可用,旧的预览端点已于 9 月 30 日退役。围绕生成的一切都变了;生成质量大体还停在原地。
能力清单读起来像一份制作检查表。场景延展现在会分析最多十秒的前序上下文,Google 称这是相较此前只能参考最后一秒的模型的一次飞跃。视频以十秒为增量逐段延长,累计上限为四十秒。首尾帧控制让开发者可以指定一个镜头的两端,并生成其间的运动,面向的是环绕镜头、变焦转场以及无可见接缝的循环。360p 草稿模式的生成速度最高快 60%,成本仅为标准 720p 的三分之一。最终输出可放大至 1080p 或 4K。最多可提供三秒视频作为参考素材,用于角色与场景一致性。
请仔细读延展功能,因为营销话术把它四舍五入了。一段四十秒的 Omni 片段是四次串联的请求,每次都以最近十秒作为上下文,而不是一次四十秒的单次生成。单次生成的时长仍在三到十秒之间。对于要依据交付物来核算延迟与推理成本的人来说,这个区别很重要,也正是这类细节决定了一段四十秒镜头是切实可行,还是仅仅理论上可能。

定价的设计意图就是让你反复迭代
Google 的定价结构奖励打草稿。API 定价为每百万输入 token 1.50 美元、每百万视频输出 token 17.50 美元,720p 视频按每秒 5,792 token 计费,折算下来大约每秒 0.10 美元,即每分钟 6 美元。按十秒片段计算,各档位从 360p 约 0.30 美元,到 720p 的 1.00 美元,到 1080p 的 1.50 美元,再到 4K 的 3.00 美元。
这个梯度并非偶然。360p 草稿与 4K 成片之间相差一个数量级,这会推动团队采用一种工作方法:在低分辨率档位里低成本迭代,只为最终那一版付费。对比一下大多数人带到视频生成里的习惯——写一段提示词、等待、看结果、改写提示词,每一次掷骰子都按全价付费。Google 正在用定价把第二种行为挤出工作流。
也不妨比较一下各个入口,因为能力分发并不均衡。Google 把完整能力集定位为面向开发者、可通过 API 获取:五项能力通过 AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 交付给开发者,而 Gemini 应用中的消费者版本只限于场景延展一项。同一个模型也内置于 Google Flow,面向 AI Plus、Pro 和 Ultra 订阅用户,并在 YouTube Shorts Remix 和 YouTube Create 应用中免费提供。一个模型,五个访问层级,其中四个拿不到有意思的功能。
四十秒镜头的算术
串联式延展改变了一段镜头的成本,而这种改变并非线性。
单次三到十秒的生成既便宜又快。一段四十秒的序列是四次串行请求,而每一次都可能独立失败。如果第三次请求生成的那一版破坏了连续性,你不是重新生成四十秒,而是从出问题那一段的第一帧重新生成,然后把它之后的所有内容重新串联,错误成本会随其在序列中的位置而成倍放大。头十秒重做很便宜。最后十秒很贵,因为重做它们意味着要重做其下游的一切。
这正是关键帧控制的现实论据。能够指定起始帧和结束帧,就把每一段变成了一个边界明确的问题,两端都有可验证的检查点。团队不必靠观看整段序列、指望连续性没出问题来判断,而是可以检查这一段是否落在了它本该落到的帧上。对于环绕镜头或变焦转场来说,这比自由形式的提示词是远更容易测试的工作单元。
360p 草稿档位符合同一套逻辑。以大约一美元而非六美元来给一段四十秒序列做原型,让迭代变得负担得起,而放大到 1080p 或 4K 则成为一个独立的、审慎的步骤。Google 实际上交付的,是一条把审核关卡内置进定价里的制作流水线。
现在的基准测试怎么说
Gemini Omni 1.1 Flash 以 1516 分领跑 Arena 的文生视频榜单,仅略高于它自己的前代 Gemini Omni Flash 的 1513 分,而 Arena 给新模型划定的排名区间是一到四名——这是一种礼貌的说法,意思是两者在置信区间内并列。
其他榜单的情况则不如发布报道所暗示的那样光彩。该模型在 2026 年 7 月中旬横扫了 Artificial Analysis 的全部四个榜单。这一横扫已经结束。在重建后的文生视频榜上,截至十月初,Gemini Omni Flash 1.1 在有声类别排第八、无声类别也排第八;在 Arena 的图生视频榜上它位列第二,落后于 MiniMax H3。Artificial Analysis 尚未在其文生视频榜上直接评测 1.1 Flash,该榜目前由较旧的 Flash 模型领跑,阿里巴巴的 Wan 3.0 和 MiniMax H3 紧随其后。
在一个瞬息万变的品类里,这是正常结果,也并不削弱这些工作流方面的新增能力。它确实意味着,对这次发布诚实的定位是:Google 比拼的是可控性与价格档位,而非原始输出质量,榜单已不再是它取胜的地方。
这次发布没有解决的两件事
原生同步音频尚未确认。Google 的发布材料没有详述与视频同步的音轨生成,音频输出被列为将在后续版本中推出。输入音频在发布时仅限于人声参考。对于一个以此命名的任意到任意(any-to-any)模型家族来说,缺失的音频输出是最显眼的缺口,尤其对于制作短视频内容的团队而言——在短视频里,声音占交付成果的一半。
第二是时长。由四次串联请求拼出的四十秒确实是一项实打实的能力,但它同时也是一个叙事类视频形式很快就会触到的天花板。Google 已预告了更高端的 Gemini Omni Pro,但没有公布发布日期,而延展机制表明,通往更长镜头的路径在于更好的上下文处理,而非单次更长的生成。
每一份输出默认都带有 SynthID 水印和 C2PA 内容凭证(Content Credentials),已退役的预览端点也不再出现在 Google 的模型列表中。Google 现在建议在 Veo 3.1 预览端点之上选用 Omni 1.1,这是一次值得注意的内部交接。Veo 3.1 仍是当前旗舰 Veo,且尚无 Veo 4 发布的消息。
究竟该用什么来构建
理解这次发布的一个有用角度,是把它看作产品定位的转变。一个产出十秒片段的视频模型是一个新奇玩意生成器。一个能分析十秒前序上下文、接受起止帧、以三分之一价格在 360p 出草稿、并可放大到 4K 的模型,是可以放进时间线里的组件。
这才是制作团队能够据此做规划的那类生成式视频,也是有意思的工程从写提示词转向流程设计的那一类。在这次发布中,组装比片段本身更重要。