Kandinsky 6.0 开源视频权重:同一次生成即可产出声音

--- title: Kandinsky 6.0 开源视频权重:同一次生成即可产出声音 meta_title: Kandinsky 6.0 开源带原生音频的视频 meta_description: Kandinsky Lab 发布 3B 和 29B 视频模型,可在一次生成中生成同步音频,采用 MIT 许可,并获 vLLM-Omni 零日支持。 ---
大多数开源文生视频系统都把声音当成别人的问题。先生成无声画面,之后再外挂一条音轨,而嘴唇动作很少能对上对白。Kandinsky Lab 本周在 fal 上发布的方案,是同时对两者进行建模。
Kandinsky 6.0 Video 提供两种规模:面向电影级输出的 29B Pro 模型,以及用于快速迭代的 3B Lite 版本。代码与权重以 MIT 许可证发布,对于任何计划商用的人来说,这一点比参数量更重要。
两个层级实际能带来什么
两个模型都面向短视频生成。片段最长约五秒,音频以 44kHz 采样率输出。Pro 是质量层级;Lite 则面向需要快速迭代、并愿意用保真度换取速度和成本的团队。
最核心的能力是联合生成。语言、视觉和音频被一起建模,而不是放在一条流水线中,因此脚步声、环境效果和口型都能与屏幕上发生的事对齐。这种原生同步此前主要属于闭源商业系统,这也让开源发布显得格外值得注意。

vLLM-Omni 提供零日推理支持。这不只是方便而已。当推理栈在发布当天而不是几周后才支持时,团队就能在最初的热情消退之前,用自己的工作负载来评估模型。
在 fal 上,该模型与集成式放大功能以及独立的视频超分辨率工具打包提供。因此实际流程就是输入文本或图像,输出五秒片段,然后再放大。
许可证需要仔细阅读
这部分值得注意。关于此次发布的报道称其为 MIT,Kandinsky Lab 自己的公告也表示代码和权重是在 MIT 许可证下提供的。不过,一个独立模型追踪器将其许可证列为自定义,而非标准宽松许可证。
在任何人基于这些权重构建产品之前,这个差异值得先弄清楚。真正的宽松许可证意味着无需单独协议即可商用、修改和再分发。自定义许可证乍看之下可能同样开放,但仍可能带有后来才显现的限制,通常涉及地域、规模或下游再分发。
今年的一种模式是,中国实验室发布开放权重,使用听起来宽松的名称,却在条款中埋下例外。例如,MiniMax 的 H3 许可证排除了美国、欧盟、英国和韩国。任何从模型卡走向部署计划的人,都应该阅读实际条款。
如果 MIT 许可的视频权重真如描述那样成立,那将是有意义的一步。宽松的视频许可证比宽松的语言模型许可证更少见,部分原因是视频模型在训练数据方面有更复杂的来源问题,部分原因是生产这些模型的实验室往往更偏商业化。一个真正开放、还能处理音频的视频模型,将为小型工作室提供一条无需 API 合同的路径。
为什么同步音频是更难的问题
从文本提示生成看似合理的运动已经解决得足够好,以至于有趣的工作已经转移到了别处。开源视频生成中令人不满意的部分一直是音频。
想想无声生成把什么推给了用户。角色在说话,但下颌却按自己的节奏移动。有人在走路,但脚步声必须在后期添加,还要逐帧手动匹配。门关上了,却没有声音,而塞入一个现成音效很少能落在正确的帧上。这些问题单独看都很小,合在一起却是一笔持续的成本,因为每一个都需要剪辑师投入注意力。
联合建模改变了任务形态。模型在内部处理时序,因此输出更接近一个完成的片段。对于短视频内容、社交广告和角色动画来说,这就是演示品与可交付成果之间的差别。
Pro 是否真正实现了紧密同步,与架构是否支持它是两个不同的问题,而能够定论的独立评估尚未出炉。此次发布提出了这一主张并提供了演示;把这些当作证据还为时过早。
它在开源视频阵营中的位置
五秒短片让 Kandinsky 6.0 稳稳处于当前开源视频生成领域之中,而不是领先于它。阿里巴巴的 Wan 3.0 在 Artificial Analysis 重建的文生视频榜单上以 1157 的 Elo 位居榜首,而值得自行运行的开放权重选项,尤其是 MiniMax H3,也早已确立。
所以公平的定位是:具有竞争力,而非革命性。Kandinsky 6.0 增加的是开放许可证下的原生音频,以及覆盖严肃质量层级和轻量层级的规模范围。尤其是 3B Lite 模型,为那些永远无法证明有理由托管 29B 扩散模型的团队打开了大门。
双层级结构也让团队能明确权衡取舍。在迭代提示词和故事板时运行 Lite,这时五秒片段需要存在,但不必精美。当序列锁定后,再转向 Pro。这种工作流形态,闭源提供商已经支持了一段时间,而开放权重则大多缺乏。
值得关注什么
三件事能告诉你,这次发布在六个月后是否仍然重要。
第一,许可证条款。如果它们最终确实是真正宽松的,该模型将成为商业开放视频工作的默认选项。如果限制具有实际意义,采用就会集中在这些限制不产生影响的地域。
第二,独立基准。Artificial Analysis 正在以新的规模重建其图生视频榜单,而一旦新榜单落地,每个 Elo 都会变动。在 Kandinsky 6.0 出现在这样的榜单上之前,质量主张都只依赖于厂商演示。当前文生视频排行榜上,Wan 3.0 以 1157 的 Elo 和每分钟 12 美元的成本位居榜首,并在 20 个类别中赢得 10 个,这让人感受到领域顶部的竞争有多拥挤。Kandinsky 6.0 并没有在那个层级竞争,而诚实的问题是,它是否需要。
第三,音频在仔细审视下是否站得住脚。同步在一个人对着镜头说话的五秒片段中很容易展示,但在声音重叠的拥挤场景中却很难展示。到目前为止发布的演示都是简单版本。
还有一个考虑适用于任何计划在此基础上构建的团队。视频生成模型的运行成本很高,而 29B 扩散模型是一项严肃的部署。通过 fal 租用算力可以消除这一负担,但也消除了开放权重的主要优势,即自行运行它们。对大多数团队来说,3B Lite 层级是更有趣的选择,因为它是那个有可能在小型工作室已有硬件上运行的选项。
目前,有趣的事实是结构性的。一个开放模型能同时生成画面和声音,采用可能完全宽松也可能不完全宽松的许可证,并且推理支持在同一天到来。开源与闭源视频生成之间的差距本周缩小了,而许可证问题将决定这一差距还有多少会保持封闭。