← 返回博客
Ai预计阅读 10 分钟

关键帧时刻:为什么关键帧比运行时长更重要

发布于 2026年10月7日
关键帧时刻:为什么关键帧比运行时长更重要

视频模型花了两年时间比拼能生成多长的片段。而更有用的能力其实一直就藏在那些时长数字之下,它改变的是视频模型存在的意义。

十个关键帧,就是那个数字。Kling 4.0 宣布支持最多十个关键帧输入,比上一代的首尾帧控制更进一步。Runway 的 Solaris 则沿着相邻方向把这个思路推得更远——它逐帧渲染界面,而不是把设计编译成代码。两者都指向同一个转变:模型被要求去命中指定位置,而不是即兴发挥。

这个转变之所以重要,是因为它改变了模型存在的意义。一个即兴发挥的系统是点子的来源。一个能命中指定位置的系统则是生产环节。视频行业的大部分钱都在生产环节里,这也是为什么控制类功能往往才是让模型从演示变成预算表里一行条目的东西。

首尾帧控制做不到的事

上一代视频工具接受两帧——一帧开头、一帧结尾——然后由模型填补中间的空隙。实际用起来,这更接近抽奖,而不是生产工具。开头和结尾是确定的,中间的一切都是模型的猜测。如果导演需要某个动作精确发生在第三秒,他没有任何办法提出这个要求。

这就是十个关键帧所解决的问题。十个控制点把一次插值变成一系列分段,而每一段都可以被导演。对任何按脚本交付的人来说,实际后果就是镜头中段不再是随机的。如果动作需要在某个具体节拍上落点,你就在那里放一个关键帧,模型围绕它来填补。

配套能力进一步强化了这一点。Kling 4.0 最多接受 15 个多模态参考,其中可包含最多 10 张图像、5 个视频片段和 7 个主体定义,因此角色的外貌、产品的细节和场景的观感都能在一条序列里被固定下来。提示词长度已增至 8,000 个 token,长到足以描述一个镜头,而不只是描述一种感觉。

这样的组合——大量控制点、大量参考、超长提示词——所描述的工具,与一年前的生成界面已经属于不同类型。它更接近 3D 渲染器的控制面板,而不是一个聊天框。用户被期待带着计划而来,而不是通过反复迭代去发现一个计划。

参考上限是实际适用范围最广的一项。能够在一段序列中固定 7 个主体,意味着一个反复出现的演员阵容、一款反复出现的产品和一处反复出现的地点,都能在同一次生成任务中保持一致,而这正是剧集所需的能力。要增加一个主体,模型完全不需要重新训练。你添加一个参考,给它命名即可。

导演的工作形态变了

当生成像抽奖时,流程就是生成、查看、重新生成,而导演的本事在于写出能提高胜率的提示词。当生成能命中指定位置时,流程就变成设计、放置关键帧、查看、调整某一个区间。核心技能从提示词技巧转向镜头规划。

任何做过动画或视效的人都会认得第二种流程。那就是关键帧动画,只不过由模型来补中间帧,而且这些工具对应的是既有的实践,而不是在发明一门新学科。这正是这项能力能被制作团队用得起来的原因:它嵌入的是他们本来就在跑的一套流程。

失败模式也随之改变。一次糟糕的生成不再是一把浪费掉的骰子,而只是一个需要新关键帧的区间。你修复出问题的那一段,而不是把整个镜头重新生成一遍再祈祷。

逐帧渲染的思路接下来走向何处

同样的逻辑在 Runway 的 Solaris 中以另一种形式出现:它逐帧渲染界面及其对输入的响应,省去了把设计编译成代码这一步。其背后的主张是,世界模型可以直接生成像素,因此中间表征变得不再必要。

这两个案例向模型提出的其实是同一个问题:不是“生成点看起来合理的东西”,而是“在这个具体时刻产出这个具体的东西”。当一个生成系统能被要求命中指定位置时,它的价值会急剧上升,因为这正是草稿和可交付成果之间的差别。

差别在于被替代的是什么。关键帧控制替代的是镜头中段的随机性。Solaris 去掉的则是一个向来有损的转译步骤——设计与其代码实现会随时间逐渐偏离。在这两种情况下,生成模型都在吸收原本属于某个中间流程的工作,而支持这么做的理由在两种情况下也一样:那个中间环节正是保真度流失的地方。

接下来要看什么

悬而未决的问题是,关键帧控制在人们真正能用到的模型上是否站得住。Kling 4.0 的完整能力仍在陆续推出;最先发布的只是 Flash 档,而且发布时间此前已经错过了宣布的十月窗口。从历史上看,关于控制功能的公告,往往比功能本身更可靠。

第二个问题是成本。精细控制意味着更多关键帧、更多参考和更长的提示词,而按秒计价意味着每多一个旋钮,账单就会上涨。采用关键帧控制的团队必须决定,多少个控制点才值得其成本,而当定价页面只给出一个每秒单价时,这笔账并不好算。

第三个问题是界面是否会随之改变。一个接受十个关键帧和十五个参考的模型,需要的是时间线,而不是文本框,而最先为生成式视频做出像样时间线的厂商,将解决一个竞争对手尚未察觉的问题。

这道门槛,正是 AI 视频不再只是一个演示品类的分界线。时长从来都不是难点。

同样的转变还带来一层人员配置上的含义。当模型能命中指定位置时,能规划镜头的人会比能写出偶尔生成出镜头的提示词的人更有价值。能够迁移过来的是传统制作里的那些技能:知道一个镜头需要传达什么、一个动作应该在哪里落点、一次剪辑应该是什么感觉。这些技能在抽奖时代曾被贬值,而当模型可以被导演时,它们又回到了牌桌上。

剩下的问题是,谁能用上这些控制能力。便宜模型和可控模型尚未汇聚,两者之间的价格差距很大。如果精确性始终留在高价档位之后,那么实际收益就会落在那些本来就有制作预算的工作室手里。如果它向下普及,那么一个手握脚本和计划的个人创作者,就能交付过去需要一整个团队才能完成的工作。

相关文章