可灵 4.0 发布:十个关键帧、三十秒,以及抽卡式剪辑的终结

快手的可灵 4.0 于 9 月 28 日开启内测,轻量级可灵 4.0 Flash 档位当晚面向会员推出,完整模型则承诺于 10 月发布。过去近一年里,该公司一直在与字节跳动的 Seedance 打规格战,而此次发布最清楚地表明了这场较量究竟是为了什么。
核心数字很直白。原生单次生成从可灵 3.0 的 15 秒翻倍至 30 秒,视频扩展则承诺通过多轮生成达到最长两分钟。输出可达 4K 和 1080p 10-bit HDR,并支持 21:9 超宽画幅。音频升级为双声道立体声,上一代备受困扰的口型同步漂移,正是发布说明声称已修复的具体缺陷。提示词输入上限提升至 8,000 个 token。
但这些数字没有一个是真正有意思的。
十个关键帧意味着不同的产品品类
可灵 3.0 只接受一个起始帧和一个结束帧。两张图,模型在二者之间插值生成一切。任何试过用这种方式拍产品视频的人都知道那是什么感觉:你能设定首尾,然后只能看着它生成什么算什么。中国创作者对此有个说法——抽卡,也就是抽牌,和抽卡游戏里指随机抽取的用法一样。
可灵 4.0 最多接受十个关键帧。这听起来像是数量变化。并不是。
有了十个控制点,你可以在一次生成中描述一连串节拍:角色入场、走向柜台、镜头推近、产品旋转、伸手去拿、切到更宽的景别。每个节拍都有自己的锚定图像,模型不再猜测两个端点之间的弧线形状,而是在十个端点之间填补空白。
对于批量制作短商业视频的团队来说,这改变了交付单元。以前,一支 30 秒产品广告意味着实拍或剪辑素材库视频,AI 生成仅限于几秒填充镜头。现在,整条时间线都可以根据脚本制作,关键帧对应到各个镜头节拍。工作从“生成然后祈祷”转向“先画分镜,再生成”。

快手自己公告的评论区值得一读,因为得票最高的问题与能力毫无关系,全都在谈价格。这相当诚实地揭示了 2026 年的约束所在:能力上限不断抬升,而成本下限的下降速度远远跟不上。
多模态参考实际控制的是什么
可灵 4.0 在单个任务中最多支持 15 个多模态参考,包括最多 10 张图片、5 段视频片段和 7 个主体组合。快手将其命名为 Omni Reference,它还能让你在现有素材中添加、修改或删除主体和背景。
再读一遍这份清单,它开始看起来不太像生成功能,而更像一份一致性契约。AI 视频反复出现的失败模式从来不是单帧,而是第四个镜头:演员的脸漂移了,外套变了色调,产品标签也变形到无法通过法务审核。在 30 秒生成中把身份锁定到 15 个参考槽位,就是直接回应这一问题的一次尝试。
这里隐藏着一个真实的生产约束。参考素材必须先存在,你才能使用它,而制作角色设定表、产品多角度图和声音样本本身就是一项制作工作。真正能从可灵 4.0 获得价值的团队,将是那些已经建好这类素材库的团队,或者已经把建库纳入自身工作流的团队。
速度、成本,以及可灵的真实位置
可灵 4.0 Flash 是高频档位:生成更快、成本更低,早期访问阶段上限为 720p。完整模型则是面向影视和广告工作的专业档位。
与其重复快手的叙事,不如精确看待竞争格局。在 Artificial Analysis 的文生视频排行榜上,可灵 3.0 大约排在第 12 位,落后于谷歌的 Gemini Omni Flash、阿里巴巴的 Wan 3.0 和 MiniMax 的 H3 Max。可灵 4.0 是一次严肃的能力跃升,但它能否缩小这一排名差距,在独立评测出炉之前仍是未知数。
市场背景比排名更重要。快手在 2026 年 7 月报告了约 30 亿美元的独立融资,投后估值约 180 亿美元,据报道还附带五年上市承诺。根据《证券时报》,花旗的解读集中在两个问题上:可灵能否从据称占据国内八成以上市场的 Seedance 手中赢回用户,以及其定价是否足够有竞争力、真正产生影响。
价格问题并非无关紧要。就在可灵 4.0 发布的那一周,HeyGen 推出了每秒 1 美分的通用视频模型,Creatify 上线了经过后训练的 MiniMax H3 衍生模型,价格为每秒 4 美分,SpaceXAI 则通过第三方平台推出 Grok Imagine Video 轻量档,并声称比此前选项便宜四倍。生成层正同时从多个方向被商品化,而一个在 4K HDR 输出上领先的模型,是在竞争对手决定不主导的维度上竞争。
这重新定义了可灵 4.0 的用途。它的野心是成为这样一个生成器:制作团队把需求简报交给它,就能拿回可交付成果。这是一种不同的主张,也更难定价。
工作流才是真正的升级
这次发布中最不炫目的部分,可能恰恰影响最大:文生视频、图生视频、参考生成、视频扩展和视频编辑现在都处在一个原生多模态工作流中。图片、视频和音频参考可以组合在同一个输入框内。生成页面支持时间线预览和编辑、网格与列表布局,以及快手所称的画布 Agent 体验。
过去两年,AI 视频工具一直是一堆互不连接的步骤:在这里生成,在那里放大,在第三个应用里剪辑,在第四个应用里同步音频。把这些整合到一个界面,才让 30 秒时间线变得可行。这也正是该工具开始与剪辑软件重叠的地方,而这与对抗 Seedance 是另一场竞争。
整合也有自身代价。一个同时掌控生成、剪辑和时间线审阅的工具,必然想要掌控项目文件,而已有成熟后期制作技术栈的团队将不得不决定要把多少流程交出去。快手一段时间以来一直在朝这个方向建设,通过 MCP 和 CLI 支持 Agent 驱动的批量创作,而画布这一提法表明,该公司把编排视为产品,而不是单个片段。
瓶颈实际转移到了哪里
快手正在推的叙事是,AI 视频从老虎机走向分镜。这是对十个关键帧所带来能力的公允描述。它也转移了瓶颈:过去难以制作出连贯 30 秒作品的团队,现在将难以写出连贯的 30 秒脚本。工具已经把分镜控制权交到了用户手中。是否真有分镜可以交给它,则是另一个问题,也不是一次模型发布能回答的。
这件事有一个版本是真正的好消息,另一个版本则是陷阱。好版本:拥有脚本和镜头清单的团队获得制作效率倍增器,因为他们流程中昂贵的一环(协调拍摄)压缩为一次生成。陷阱版本:既没有脚本也没有镜头清单的团队,以更高产量生成大量同等质量的内容,然后发现瓶颈从来都不是渲染。
可灵 4.0 对此的回应,本质上是在押注市场已经完成了这一转变。十个关键帧、15 个参考和 8,000 个 token 的提示词,是给那些有具体表达需求的人准备的功能。只有当你按下生成之前就知道自己想要镜头是什么样,要求这么多控制权才值得。