← 返回博客
Ai预计阅读 10 分钟

双帧方法:首尾帧插值如何改变了 AI 视频规划

发布于 2026年10月10日
双帧方法:首尾帧插值如何改变了 AI 视频规划

Google 于 10 月 9 日更新了 Veo 3.1 的首尾帧生成视频(First and Last Frame to Video)功能。你上传两张静态图,开场帧和结束帧,模型会生成两者之间的运动。输出最高可达 4K、60fps,并带原生音频,支持 9:16 竖屏,还可接受三到四张参考图像,以保持角色和风格一致。

单看这一点,似乎只是个小功能。但在实践中,它改变了人们规划镜头的方式,因为它把真正重要的两个决策重新放回了流程的最前端。

只靠提示词生成视频的问题

过去两年的大部分时间里,AI 视频就像老虎机。你写一段话,等待,然后看生成出什么东西。结果常常好到能发出去,却很少好到能真正用上。如果角色漂移了,或者镜头做了奇怪的动作,你就重写提示词再试一次。

创作者学会了绕开这个问题。他们先生成一张出色的静态图,再让模型把它动画化,也就是图生视频。这固定了开场帧,但没人能控制镜头在哪里结束。片段往往会要么后劲不足,要么凭空发明一个没人要求的结局。

把两端都定义清楚,能消除很大一部分猜测。你决定观众从哪里开始看,到哪里结束看。模型的任务更窄了:连接这两端。

为什么分镜思维回来了

动画工作室这样做已经有一个世纪了。动画师画一个关键姿势,再画另一个关键姿势,然后在两者之间填充画面。手艺在于选择姿势,而不是绘制每一帧。AI 视频正通过另一条路径抵达同样的分工。

这并非 Veo 独有。可控性竞赛已经酝酿了数月。Kling 4.0 发布时支持十个关键帧和 30 秒原生片段。Seedance 2.5 可以从新的摄像机角度重拍现有素材。Wan 3.0 以 Elo 1157 分登顶 Artificial Analysis 的 AA-Video-T2V v2.0 基准,价格约为每分钟 12 美元。Vidu 于 10 月 7 日发布的 Q4 预览版,起价约为每秒 0.014 美元,最多支持 15 张图像参考。最强的模型们共同之处,与其说在于原始质量,不如说在于你能多精确地操控它们。

一条时间线,两个关键帧由一条发光运动弧线连接

可用的工作流是什么样

只有当这两张帧值得连接时,双帧方法才划算。几个习惯会有帮助。

用图像模型生成这些帧,而不是从之前的片段里截图。你需要在两端都控制构图、灯光和服装。Google 的 Veo 接受参考图像,正是为了让面孔或产品在过渡中保持稳定,而这只有在参考图从一开始就一致时才有效。

让镜头运动保持简单。插值能很好地处理推近、拉远、揭示或缓慢漂移。如果你要求在单个片段内做硬切,它就会吃力,因为没有什么可插值的切点。如果某个镜头需要切,就做成两个片段。

让音频计划和镜头匹配。Veo 3.1 合成原生音频,这对环境声和简单音效很有用。如果场景需要一句具体对白或授权音乐,就计划之后再添加,而不是和生成的声音较劲。

把这种方法留给承载故事节拍的镜头。没有理由为两秒钟的转场花两张精心构建的帧。用在观众本该注意到变化的地方。

多出的两帧到底要花多少钱

按帧规划是一个有价签的决策,而这个价格现在比一年前更容易看清楚。视频市场在每秒成本上一直在向下竞赛。Vidu 于 10 月 7 日发布的 Q4 预览版,起价约为每秒 0.014 美元,最多支持十五张图像参考。xAI 的 Grok Imagine Video 1.5 Lite 于 10 月 8 日加入其 API,480p 标价为每秒 0.02 美元,1080p 升至 0.14 美元。HeyGen 新的通用视频模型以 10 月促销价每秒 1 美分推出。Wan 3.0 以 Elo 1157 分在 Artificial Analysis 视频基准上排名第一,标价约为每分钟 12 美元,也就是每秒 20 美分。

由此可得出两点。第一,如今生成本身很少是昂贵的部分。几秒钟的插值运动花费的是美分,而不是美元。第二,稀缺资源是帧。生成并挑选两张出色的静态图需要人的时间,而 API 变便宜时,这段时间并不会变便宜。这种经济回报的是规划,而不是数量,这恰恰与只靠提示词的工具训练人们的行为方式相反。

在真实项目中也站得住的工作流

下面是一个小规模制作中,不用改变一切就能套用该方法的方式。从概念开始,确定这个镜头必须落下的那个单一节拍。用图像构建开场帧和结束帧,使用相同的参考,让面孔、服装和道具匹配。生成插值,然后先看一遍结构,再看一遍细节。如果运动曲线不对,就修帧,而不是修提示词,因为模型实际读取的是帧。根据镜头添加或替换音频。然后把它剪进序列,在上下文中判断,因为一个单独看很惊艳的片段,放在相邻镜头旁边仍可能显得拖沓。

这里的纪律在于,每一次修正都是关于故事的决策,而不是掷骰子。这是人们第一次尝试该功能时会忽略的部分。它感觉像捷径,却悄然恢复了第一代 AI 视频工具让人们跳过的前期制作。

普通摄影机仍然胜出的地方

这一切并不是说实拍已经过时。当两端都很强、二者之间的运动又简单时,插值效果最好,这覆盖了许多产品镜头、转场、标题卡和氛围建立镜头。当现实在做某种具体且不可预测的事情时,它最弱:一匹全速奔跑的真马、一群人的反应、以必须显得真实的方式烹饪的食物。对于这些,摄影机加一位称职的剪辑师仍然能一锤定音。

合理的立场很无聊。在控制重要且运动可知的地方使用插值,在场景需要真实的地方使用摄影机。大多数从业创作者最终会在同一个项目里两者都用,这种混合不是妥协。它只是制作。

诚实的局限

插值仍然是插值。如果两张帧暗示了物理上复杂的中间状态,比如一个人转了一整圈,或者液体改变形状,模型就会发明一些东西,而且并不总是对的。让隐含的运动保持在一台摄影机可能合理记录的范围之内。

它也会推高成本。两张打磨过的静态图加一个生成片段,比一条提示词工作量更大。以现在市场上的每秒价格来看,这比一年前更负担得起,但规划时间是真实存在的。这种方法回报的是那些本就以镜头思考的人。

而且中间仍然没有保证。这个功能真正卖出的,是一个更小的搜索空间,而不是一个已解决的问题。这是有意义的一步。它意味着,可用片段和令人难忘的片段之间的差异,现在主要取决于你选择的帧,而这是由人做出的决定。

接下来看什么

预计同样的模式会扩散开来。一旦一个主要模型把帧当作主要输入,竞争者往往会跟进,而有趣的问题就变成谁的插值在接缝处看起来最自然。留意那些允许你添加中间关键帧的工具,那会让导演在不离开时间线的情况下获得第三个锚点。

就目前而言,实用的要点并不光鲜。如果你在做 AI 视频,别再只把提示词当作主要的创作行为。先构建帧,选出能讲故事的这两张,然后让模型处理它们之间的旅程。

相关文章