Wan 3.0 登顶重建后的视频排行榜,Kling 3.0 成为其锚点

Artificial Analysis 于 9 月 30 日重建了其文生视频榜单。新的评分体系 AA-Video-T2V v2.0 以 1080p 为标准评测每一个模型,并基于约 1,000 条提示词、超过 68,000 份人类偏好投票,这些提示词被归入十个使用类别和十个能力维度。Wan 3.0 在有声榜中以 1,156 的 Elo 分位居第一,并在二十项分类排名中的十项拿下榜首。
更能说明市场现状的数字,是排在最底下的那一个。1080p 的 Kling 3.0 是固定在 1,000 分的锚点。由于评分体系以此为基准固定,没有任何模型排在其下方。快手此前的旗舰模型曾是国内 AI 视频的标准;在这张榜上,它成了衡量其他一切模型的参照点。
不是一个领奖台,而是一个梯队
前四名之间的分差在 18 分以内,而误差棒约为九到十分。Wan 3.0 以 1,156 分领跑。基于 MiniMax H3 后训练、且没有公开 API 的 Utopai X 以 1,148 分位列第二。Dreamina Seedance 2.5 以 1,142 分紧随其后,768p 的 MiniMax H3 以 1,138 分排名第四。fal 的 H3 Max 以 1,134 分为这个梯队收尾。
把这些数字看成一个梯队,而不是一级级的阶梯。得分落在领先者误差棒范围内的模型,并不比领先者明显更差。前五名中有三个是 H3 或基于 H3 构建的,这才是更有意思的事实:MiniMax 发布的开放权重基座模型,已经成为其他团队进行后训练的底层基础,就像三年前人们基于 Stable Diffusion 做开发一样。
排名之下还藏着一个分布层面的故事,而这张榜第一次把它显现出来。一年前,视频榜单的榜首是一串来自少数几家资金雄厚实验室的闭源模型。如今前五名中包括一个开放权重基座,以及两个由较小团队在其上后训练出的模型。Utopai X 没有公开 API,因此这个在公开榜单上排名第二的模型,对公司以外的人来说依然遥不可及。这是一种新的排名现象,也说明一次出色的后训练能多快地把一个开放基座推入竞争行列。
在同日推出的无声榜单上,Wan 3.0 以 1,129 分领跑,H3 和 H3 Max 分列第二、第三。去掉音频后差距收窄,这说明中国模型的优势很大程度上来自其音频处理能力,而不仅仅是画面。这也颠覆了对榜单的解读:只需要无声素材的工作室,与需要唇形同步对白的工作室,看到的竞争格局并不相同。
价格那一列说明了什么
榜单还附带每分钟价格,而这一列读起来与 Elo 列完全不同。Wan 3.0 每分钟视频收费 12 美元。Seedance 2.5 以每分钟 34.12 美元成为前十名中最贵的模型。任何人都能下载的 MiniMax H3,价格为每分钟 4.80 美元。

也就是说,排名第三的开放权重模型,价格是领先者的四分之一,是排名第二的商业模型的七分之一。对一支要把产品推向市场的团队来说,这个差距比十九个 Elo 分更重要。问题从“哪个模型最好”变成了“哪个模型足够好,以至于每分钟的账单不会拖垮商业可行性”。对许多一年前还愿意为 Seedance 掏钱的团队来说,H3 就是答案。
Seedance 2.5 每分钟 34.12 美元这个数字值得再看一眼,因为它是前十名中最贵的一档,且排名第三。这一定价意味着其客户愿意为质量付出开放权重模型七倍的价格,而这样的客户在广告和影视行业确实存在。榜单无法展示的是,这种溢价在与预算正面交锋后是否还站得住。如果一个制作需要两百个镜头,每分钟 34 美元与 4.80 美元之间的差距,就是“一个项目”与“一道表格难题”之间的差别。
Wan 3.0 的领先有一个前提:它仍处于邀请制的商业测试阶段。H3 才是你今天就能以公开价格实际购买的那一个。一个你无法使用的模型占据榜首,是关于行业走向的信号,而不是购买决策。
视频编辑榜增加了第二个维度。Wan 3.0 以 1,188 的 Elo 分在该榜位居第一,从自 8 月首次亮相以来一直占据该位置的 MiniMax H3 手中夺走了这一类别。编辑才是实际工作流所在之处,因为大多数商业视频工作都是从已有素材开始的。对制作团队来说,一个生成领先但编辑落后的模型,不如一个两者都强的模型有用。Wan 3.0 目前在两项上都领先,这是任何模型在这张榜上取得过的最强位置。
Kling 4.0 以一份规格表的形式“发布”
这张榜还澄清了另一点:最近的 Kling 4.0 发布,究竟有多少内容真正存在于新闻稿之外。快手的账号于 9 月 28 日公布了该模型:最高 4K、10 位 HDR、15 个多模态参考、10 个关键帧、原生 30 秒生成、立体声音频。发布时间是“今年十月推出”。
实际推出的只是 Kling 4.0 Flash,面向 Ultra 年费订阅用户开放。它的功能页面没有价格、没有日期、没有分辨率说明,也没有提到十月。Artificial Analysis 各榜单上最新的 Kling 条目仍然是 3.0。一位披露“由 Kling 付费”的创作者帖子称,首发输出为 1080p,且比 Seedance 更便宜,这与“最高 4K”的标题宣传相矛盾。
这并不意味着公布的能力是假的。它意味着,从宣布到可用模型之间的那段差距,才是大部分工作所在,而这次发布尚未填补它。一份列出 4K、HDR、十五个参考和十个关键帧的规格表,描述的是这样一套能力:如果真能落地,将是公开市场中最强的。它同时也描述了一套所有竞争对手都必须在一个季度内做出回应的功能。
这个模式在过去两年的模型发布中屡见不鲜。公告设定预期,而从公告到全面可用之间的这段时间,才是真正打造产品的地方。对买家来说,实用建议一如既往:不要围绕一个功能页面来规划生产流程,而要围绕你今天就能调用的东西来规划。
接下来该关注什么
下一个信号是 Wan 3.0 是否会走出邀请制测试、公布价格。如果会,那么领先者与开放权重梯队之间的差距就会从理论问题变成真实的预算决策。
第二个信号是 Kling 4.0 本身。它的上一代旗舰为这套评分体系设定了锚点。而下一代在快手之外还没有人跑过之前,就已经被写进了预期定价里。当它真正到来时,面对的榜单上,前五名中已有三席被成本更低的模型占据。
第三是锚点本身会怎样。Kling 3.0 按定义固定在 1,000。如果 Kling 4.0 发布并落在它之上,这套体系的固定点就会移动,榜上每一个 Elo 分都将变成与新基线的比较。那一刻,这份排名将不再描述九月,而开始描述这一年将走向何方。