Wan 3.0 刚刚登顶视频排行榜。开放权重的故事,如今成了视频的故事。

在生成式 AI 的大部分爆发期里,开放权重的讨论一直属于图像领域。Stable Diffusion 证明了你可以用自己的 GPU 运行一个真正的模型,围绕它成长起了完整的 LoRA 和 ControlNet 生态。视频则不同。最好的视频模型始终锁在 API 背后,而“开源视频”意味着那些落后于闭源领先者的小模型。
这个月,情况变了。阿里巴巴的视频模型 Wan 3.0 在 Artificial Analysis 的下一代 AA-Video-T2V v2.0 基准测试中登顶,该测试基于约一千条提示词、超过 68,000 份人类偏好投票构建。Wan 3.0 拿到 1157 的 Elo 分,并在 20 个类别排名中的 10 个位列第一。同一榜单中,Wan 3.0 在视频编辑上也排名第一,领先于字节跳动的 Seedance 和 MiniMax 的 H3。
其意义不在于某个数字,而在于它所代表的东西。一个开放权重的中国模型如今已能与 Google 的 Veo 3.1 及闭源阵营的其余模型竞争,并在多个排名中领先。定价也说明了同样的事。Wan 3.0 按分辨率不同,每秒收费 0.05 到 0.20 美元,而 Veo 3.1 标准档为 0.40 美元。阿里巴巴在香港配股中筹集了 100 亿美元,正是为了资助这一推进,其战略也清晰可辨:低价销售、抢占份额、让企业客户成为增长引擎。
从技术上看,Wan 3.0 为一致性和结构化输入而构建。它单次生成最长 30 秒的片段,是前代 15 秒上限的两倍,最高 1080p,并具备同步的微表情和多语言语音。更有意思的是,它接受文档、PDF、PowerPoint 和电子表格作为输入,把幻灯片或报告变成视频。这个“文档到视频”的切入点直接瞄准企业工作流,而不只是个人创作者。
文档到视频功能值得更多关注。大多数视频模型想要的是文本提示词或图像。Wan 3.0 想要的是你已有的资产——你已经做好的演示文稿、你已经写好的报告——并把它们当作事实来源。对于依赖文档运转的企业来说,这把从“我们有一份报告”到“我们有一条视频”的阻力降到几乎为零。它是第一个把企业文档流水线变成入口的模型,这是一步安静却聪明的棋。
对于正在选择视频技术栈的团队来说,这重新洗牌了决策。旧有假设——开放模型是你负担不起或无法使用闭源模型时的选择——正在弱化。你现在可以自托管一个登顶排行榜的模型,这对那些与质量无关、完全关乎控制权的场景很重要。数据不能离开自有基础设施的客户,除了自托管模型没有合规选项,而这也是第一次,这个选项不再意味着要在输出质量上妥协。
有一个在热情中常被跳过的提醒。自托管不会因为权重免费就免费。你要付出 GPU、集成工作,以及无论业务量达到多少都要持续维护流水线健康运行的长期成本。模型是免费的;工程不是。对大多数小团队来说,在业务量足以证明硬件投入合理之前,托管端点仍然在总成本上胜出。
基准测试的背景对于正确解读这次胜利很重要。AA-Video-T2V v2.0 是新一代人类偏好评估,它以 1080p 评判每一个模型,从而消除了过去靠低分辨率取胜的伎俩。Wan 3.0 在 20 个类别排名中拿下 10 个第一,并以 1157 的总 Elo 位居榜首。这不是某个小众类别的胜利,也不是有利类别带来的优势;这是对整个领域——包括每秒成本高出八倍的模型——广泛而具有竞争力的结果。当一个每秒 0.05 美元的开放模型击败每秒 0.40 美元的闭源模型时,价值主张很难被反驳。
还有一个难以忽视的政治维度。AI 视频竞赛已成为中美实验室之间更大竞争的代理战场,而 Wan 3.0 的基准测试桂冠正是那种会被两国以不同理由引用的结果。在中国,它证明国内技术栈能在质量上竞争,而不仅是价格。在美国,它证明算力成本并非唯一在变化的东西。两种框架都没有完全捕捉正在发生的事:一种真正的竞争性趋同,并以更低价格和更强开放模型的形式惠及用户。
开放权重跨入视频领域,也对 AI 更广泛的地缘政治产生影响。中国实验室在价格战中已经赢了一段时间,如今在基准测试上也赢了,这让叙事从“廉价模仿”变成了“真正具有竞争力”。同样的动态已经在图像生成领域由 Qwen-Image 和 Z-Image 上演,在语言模型领域由 DeepSeek 和 Qwen 上演。视频曾是西方闭源实验室最后的主要堡垒,而 Wan 3.0 刚刚表明大门已经打开。
基准测试桂冠是头条,但真正的故事是视频生成现在有了一条可信的开放之路。跟随 Stable Diffusion 出现的那些动态,很可能也会在这里出现:微调、社区控制节点、区域化部署,以及 API 供应商从未费心服务的长尾用例。在图像工作中,微调开放模型早已是保持特定角色或风格的标准方式,视频创作者也会希望拥有同样的能力,在自己的品牌或产品上训练。
已经有早期证据表明这个生态正在形成。MiniMax H3 生态已经产出了一个开源提示词构建器,以及一波面向动漫和角色创作的社区微调,呼应了 Stable Diffusion 的剧本。当开放权重好到足以登顶基准测试时,围绕它形成的社区就不再是小众,而是主流;从中产生的创新——控制节点、区域托管、保护隐私的本地推理——往往比任何单一供应商能发布的速度更快到来。
对团队的实际影响很具体,值得再说一遍。如果你在 2026 年底选择视频技术栈,问题不再是“开放还是闭源”这种质量问题。它是控制、成本和退出风险的问题。开放权重给你控制并降低退出风险,代价是成本。闭源 API 给你便利,代价是三者都付出。那些能在下一次模型弃用时不受折磨的团队,是早已在这项权衡中决定好立场的人,而不是等供应商宣布关停时才发现自己有多被动。
对于任何基于生成式视频进行构建的人来说,实际教训是:不要再把开放权重当作备用方案。把它当作战略选项。下一次闭源供应商像 OpenAI 刚刚对 Sora 所做的那样弃用某个模型时,不会手忙脚乱的团队,将是那些至少把一只脚留在开放道路上的人。开放权重过去是安慰奖。在视频领域,它刚刚变成了奖杯陈列柜。