双帧方法:首尾帧插值如何改变了 AI 视频规划

Google 于 10 月 9 日更新了 Veo 3.1 的首尾帧生成视频(First and Last Frame to Video)功能。你上传两张静态图,开场帧和结束帧,模型会生成两者之间的运动。输出最高可达 4K、60fps,并带原生音频,支持 9:16 竖屏,还可接受三到四张参考图像,以保持角色和风格一致。
单看这一点,似乎只是个小功能。但在实践中,它改变了人们规划镜头的方式,因为它把真正重要的两个决策重新放回了流程的最前端。
只靠提示词生成视频的问题
过去两年的大部分时间里,AI 视频就像老虎机。你写一段话,等待,然后看生成出什么东西。结果常常好到能发出去,却很少好到能真正用上。如果角色漂移了,或者镜头做了奇怪的动作,你就重写提示词再试一次。
创作者学会了绕开这个问题。他们先生成一张出色的静态图,再让模型把它动画化,也就是图生视频。这固定了开场帧,但没人能控制镜头在哪里结束。片段往往会要么后劲不足,要么凭空发明一个没人要求的结局。
把两端都定义清楚,能消除很大一部分猜测。你决定观众从哪里开始看,到哪里结束看。模型的任务更窄了:连接这两端。
为什么分镜思维回来了
动画工作室这样做已经有一个世纪了。动画师画一个关键姿势,再画另一个关键姿势,然后在两者之间填充画面。手艺在于选择姿势,而不是绘制每一帧。AI 视频正通过另一条路径抵达同样的分工。
这并非 Veo 独有。可控性竞赛已经酝酿了数月。Kling 4.0 发布时支持十个关键帧和 30 秒原生片段。Seedance 2.5 可以从新的摄像机角度重拍现有素材。Wan 3.0 以 Elo 1157 分登顶 Artificial Analysis 的 AA-Video-T2V v2.0 基准,价格约为每分钟 12 美元。Vidu 于 10 月 7 日发布的 Q4 预览版,起价约为每秒 0.014 美元,最多支持 15 张图像参考。最强的模型们共同之处,与其说在于原始质量,不如说在于你能多精确地操控它们。

可用的工作流是什么样
只有当这两张帧值得连接时,双帧方法才划算。几个习惯会有帮助。
用图像模型生成这些帧,而不是从之前的片段里截图。你需要在两端都控制构图、灯光和服装。Google 的 Veo 接受参考图像,正是为了让面孔或产品在过渡中保持稳定,而这只有在参考图从一开始就一致时才有效。
让镜头运动保持简单。插值能很好地处理推近、拉远、揭示或缓慢漂移。如果你要求在单个片段内做硬切,它就会吃力,因为没有什么可插值的切点。如果某个镜头需要切,就做成两个片段。
让音频计划和镜头匹配。Veo 3.1 合成原生音频,这对环境声和简单音效很有用。如果场景需要一句具体对白或授权音乐,就计划之后再添加,而不是和生成的声音较劲。
把这种方法留给承载故事节拍的镜头。没有理由为两秒钟的转场花两张精心构建的帧。用在观众本该注意到变化的地方。
多出的两帧到底要花多少钱
按帧规划是一个有价签的决策,而这个价格现在比一年前更容易看清楚。视频市场在每秒成本上一直在向下竞赛。Vidu 于 10 月 7 日发布的 Q4 预览版,起价约为每秒 0.014 美元,最多支持十五张图像参考。xAI 的 Grok Imagine Video 1.5 Lite 于 10 月 8 日加入其 API,480p 标价为每秒 0.02 美元,1080p 升至 0.14 美元。HeyGen 新的通用视频模型以 10 月促销价每秒 1 美分推出。Wan 3.0 以 Elo 1157 分在 Artificial Analysis 视频基准上排名第一,标价约为每分钟 12 美元,也就是每秒 20 美分。
由此可得出两点。第一,如今生成本身很少是昂贵的部分。几秒钟的插值运动花费的是美分,而不是美元。第二,稀缺资源是帧。生成并挑选两张出色的静态图需要人的时间,而 API 变便宜时,这段时间并不会变便宜。这种经济回报的是规划,而不是数量,这恰恰与只靠提示词的工具训练人们的行为方式相反。
在真实项目中也站得住的工作流
下面是一个小规模制作中,不用改变一切就能套用该方法的方式。从概念开始,确定这个镜头必须落下的那个单一节拍。用图像构建开场帧和结束帧,使用相同的参考,让面孔、服装和道具匹配。生成插值,然后先看一遍结构,再看一遍细节。如果运动曲线不对,就修帧,而不是修提示词,因为模型实际读取的是帧。根据镜头添加或替换音频。然后把它剪进序列,在上下文中判断,因为一个单独看很惊艳的片段,放在相邻镜头旁边仍可能显得拖沓。
这里的纪律在于,每一次修正都是关于故事的决策,而不是掷骰子。这是人们第一次尝试该功能时会忽略的部分。它感觉像捷径,却悄然恢复了第一代 AI 视频工具让人们跳过的前期制作。
普通摄影机仍然胜出的地方
这一切并不是说实拍已经过时。当两端都很强、二者之间的运动又简单时,插值效果最好,这覆盖了许多产品镜头、转场、标题卡和氛围建立镜头。当现实在做某种具体且不可预测的事情时,它最弱:一匹全速奔跑的真马、一群人的反应、以必须显得真实的方式烹饪的食物。对于这些,摄影机加一位称职的剪辑师仍然能一锤定音。
合理的立场很无聊。在控制重要且运动可知的地方使用插值,在场景需要真实的地方使用摄影机。大多数从业创作者最终会在同一个项目里两者都用,这种混合不是妥协。它只是制作。
诚实的局限
插值仍然是插值。如果两张帧暗示了物理上复杂的中间状态,比如一个人转了一整圈,或者液体改变形状,模型就会发明一些东西,而且并不总是对的。让隐含的运动保持在一台摄影机可能合理记录的范围之内。
它也会推高成本。两张打磨过的静态图加一个生成片段,比一条提示词工作量更大。以现在市场上的每秒价格来看,这比一年前更负担得起,但规划时间是真实存在的。这种方法回报的是那些本就以镜头思考的人。
而且中间仍然没有保证。这个功能真正卖出的,是一个更小的搜索空间,而不是一个已解决的问题。这是有意义的一步。它意味着,可用片段和令人难忘的片段之间的差异,现在主要取决于你选择的帧,而这是由人做出的决定。
接下来看什么
预计同样的模式会扩散开来。一旦一个主要模型把帧当作主要输入,竞争者往往会跟进,而有趣的问题就变成谁的插值在接缝处看起来最自然。留意那些允许你添加中间关键帧的工具,那会让导演在不离开时间线的情况下获得第三个锚点。
就目前而言,实用的要点并不光鲜。如果你在做 AI 视频,别再只把提示词当作主要的创作行为。先构建帧,选出能讲故事的这两张,然后让模型处理它们之间的旅程。
相关文章
Decagon 的 PACT 协议,想让「同意」成为一个标准
Decagon 开源了一个协议,用来验证个人智能体的身份,以及客户授予它的权限。这是管道工程,而它决定了智能体经济能不能跑起来。
AI「重逢」热潮:一场还没想好该如何感受的讨论
AI 致敬短片把逝去的公众人物带回中国荧幕,拿下数十万点赞。然后反弹来了,而它争论的是「同意」。
Apple 发布了一个开源多模态模型,却几乎没告诉任何人
苹果的这次「研究优先」式发布悄然越过了主流视野,但模型那种细粒度的视觉 grounding,透露了它的 AI 栈正走向哪里。
OpenCut 与「开源剪映」的那一刻
一款免费、MIT 许可的视频剪辑器持续冲上 GitHub 趋势榜,而它的路线图里包含一个面向 AI 智能体的 MCP server。围绕 AI 媒体的工具,正在追上模型本身。