← 返回博客
Ai预计阅读 11 分钟

Kling VIDEO O1 将视频生成变为参考系统

发布于 2026年10月7日
Kling VIDEO O1 将视频生成变为参考系统

--- title: Kling VIDEO O1 将视频生成变为参考系统 slug: kling-video-o1-turns-video-generation-into-a-reference-system meta_title: Kling VIDEO O1 让参考成为交互界面 meta_description: 快手的 Kling VIDEO O1 可接受文本、图像、视频、关键帧和参考素材的任意组合,然后让你将元素从一个片段提取到另一个片段。 category: ai tags: Kling VIDEO O1,快手,视频生成,参考系统,关键帧,多模态,Veo 3.1,Runway Aleph,一致性 ---

快手的视频部门在过去一个月里密集发布。Kling 4.0 先向测试者开放,随后获得了更广泛的发布窗口。如今,VIDEO O1 登场,更像是一次品类转变:一个模型即可接收文本、图像、视频片段、关键帧和角色参考素材作为输入,并把它们全部视为同一个请求中可以互换的组成部分。

该公司使用的标签是“统一多模态”。更实用的说法则更容易表述。你可以附上三段视频并写下:从视频一中提取角色,从视频二中提取镜头运动,将两者放入视频三,然后把风格切换为像素艺术。

一年前,这样一个单独请求需要三个独立工具,并仔细导出中间文件,每一次转换都会增加一次压缩,也让角色有偏离的风险。

一体化参考究竟给你带来什么

角色和道具的一致性一直是 AI 视频中顽固的难题。早期的变通做法是把多个模型串联起来,这意味着要为每一步付费,并接受它们之间累积的任何偏离。Kling 的方法将这条链条折叠进单次生成,因此参考图像、关键帧和风格方向都会一次性得到解析。

Kling 自己的数据显示,在图像参考任务上,O1 对 Google 的 Veo 3.1 “Ingredients to Video”功能取得了 247% 的胜率;在变换任务上,对 Runway Aleph 取得了 230% 的胜率。这些都是内部评估,因此应视作方向性参考。更可检验的是能力主张:在需要让多个主体各自保持锁定的群像场景中,O1 会按主体分别处理,而不是混成一个平均结果。

视频长度从三秒到十秒不等,可调,这让你能够控制一个镜头的节奏,而不是接受模型自行决定的结果。在底层,该公司描述了一种具有长多模态上下文的多模态 Transformer,以及一种新的内部格式,称为多模态视觉语言,它在 Transformer 自身内部融合文本、视觉和音频信号。内置的思维链推理旨在让生成的运动会保持物理上的合理性。

列出的生成类型读起来就像一份清单,涵盖了这个品类一直在拆分成独立工具的所有方向:文本生成视频、图像生成视频、视频生成视频、关键帧生成视频、多图像生成视频,以及参考视频到视频。过去,其中每一项都可能是一个产品。O1 的主张是,它们只是一个系统的不同模式。

为什么界面比基准测试更重要

有趣之处在于,O1 竟然能在对比中胜出,但真正更重要的变化是模型的输入界面。它现在是一个可复用素材库。一个从多个角度构建的角色会成为一个元素,你可以按名称挂载,而不必在每个提示词中重新描述。镜头运动也成为可以从某个片段中借用的东西,而不是用形容词去近似。

一块空白的木质电影场记板放在浅色亚麻布表面上,其板面完全空白且未做标记

这改变了工作流形态。图像模型、视频模型、剪辑器这种线性链条,每一步都有成本,如今会压缩成更少的步骤。它也改变了工具的面向对象:后期制作团队获得自然语言指令,取代跟踪和遮罩流程;广告团队则获得一种无需从头重建每个镜头就能替代实拍的方式。

词汇是界面的另一半。按名称挂载元素意味着团队可以在编写任何单个镜头提示词之前,先就角色叫什么达成一致,然后在整个营销活动中复用该名称。用形容词去近似同一件事,第一次可能有效,但每次修订都会变得更难,因为没有任何记录说明是哪种形容词组合产生了大家都喜欢的那一版。

厂商文档也用类似方式描述专业用例。AI 电影制作依赖元素库,让角色和道具在整个拍摄过程中保持一致。广告和时尚行业用它替代外景工作,包括虚拟 T 台。后期制作则用它来完成以前需要逐帧转描的修改。

这里存在一种自我选择效应。一个拥有这么多输入类型的模型,对初学者并不更友好;它更友好的是那些已经知道自己想要什么的人。对于一个花两年时间优化首次使用体验的品类来说,这是一个意义重大的转变。

参考系统取代了什么

理解这一转变最清晰的方式,是看看团队过去会围绕一个能力较弱的模型构建什么。一致性流水线就像装配线:生成角色设定图,把它作为图像提示词喂给每个镜头,生成动态分镜,然后用从动态分镜中取出的起始帧重新生成每个镜头。每个阶段之所以存在,都是因为前一个阶段无法携带足够的上下文向前推进。

O1 的参考系统瞄准的正是这些阶段存在的原因。如果模型能在群像场景中保持角色身份,同时还能从另一个片段中获取镜头运动,那么其中一些阶段就会从必需变为可选。可选的阶段才是预算真正松动的地方,因为围绕某种限制搭建的流水线,并不会仅仅因为限制缓解就自动消失。

同样的逻辑也适用于镜头排序。基于现有素材生成前一个或后一个镜头的程序,会把片段库变成更接近一场戏的东西。已经在时间线上工作的剪辑师会认识到其价值:尝试另一个角度的成本,从重新拍摄降为一次生成。

取舍是真实存在的

Kling 表示,O1 的学习曲线比 Sora 2 或 Veo 3.1 更陡峭,因为在任何一项能力变得有用之前,需要理解的能力更多。这是更具表现力的界面的标准代价。一个接受任何东西作为参考的模型,会要求你决定应该参考什么。

该公司尚未在 O1 中解决声音问题。Kling 2.6 才是该平台承载音频生成的模型,具备同步对话、音乐和音效。因此,完整制作仍然意味着要搭配两个模型:一个负责视觉语言,一个负责声轨。Kling 自己对 2.6 的营销强调“看见声音、听见画面”的理念,这恰当地描述了一项存在于 O1 之外的能力。

定价也反映了该平台想要占据的位置。Kling 公布的每秒积分从 720p 无音频的 6 积分,上升至 1080p 带音频的 12 积分,并且该平台宣传其商业使用政策也覆盖免费生成内容。对于一个定位专业工作流的模型来说,入门门槛仍然足够低,小团队可以在正式投入前先进行测试。

值得关注什么

O1 的参考系统能否在受控演示之外也站得住脚。一致性方面的宣称往往能在短片段和短会话中成立,但当项目运行数周、积累数十个元素后就会退化。只有当这些元素在整个周期内保持稳定,元素库概念才真正划算。

快手已经表示,4.0 将带来 30 秒原生生成和最多 10 个关键帧。如果 O1 的参考层能与这些限制协同,而不是相互竞争,那么两者结合就能同时回答“多长”和“谁的脸”这两个问题。这种组合正是工作室一直在等待的。

短期竞争格局也很重要。Gemini Omni 1.1 Flash 以 1516 分占据 Arena 文本生成视频榜首,MiniMax H3 领跑图像生成视频,Wan 3.0 则登顶 Artificial Analysis 的视频榜单。O1 并非进入一片空地。它的差异化在于输入界面,而不是排行榜位置;一旦团队围绕它构建元素库,这种优势就更难被取代。

相关文章