AI 视频的下一场竞争在于理解世界

过去两年的大部分时间里,评判一个 AI 视频模型的方法很简单:看画面有多漂亮。这个测试标准已经快走到尽头。当好几个模型都能生成一段令人信服的五秒视频——一个人走过城市——图像质量就不再能把它们区分开来。必须有别的东西来决定高下。
今年 9 月,一家名为 HiDream.ai 的中国初创公司发布了 HiDream-O1-Video-1.0,简称 HD-V1,并把那个“别的东西”作为自己的全部卖点。该公司称,这个模型旨在理解事件应该如何展开,而不只是单帧画面应该长什么样。
漂亮画面的问题
任何花时间生成过视频的人都知道这些失败模式。你提示一个角色推开一扇沉重的木门,模型却画出左手往左推,而门向右摆。你让某人在五秒内从一个地方跑到另一个地方,角色说完了台词,时间不够了,然后瞬移。片段看起来没问题,直到你真的去看它。
反复重新生成会耗费时间和额度,一段十五秒的片段可能远超预算允许。差距不在于分辨率,也不在于时长。而在于物理规律和因果。模型绘制每一帧时,并不理解门必须朝手推的方向摆动,也不理解从一点移动到另一点需要时间。
这正是 HD-V1 要填补的差距。HiDream 表示,该模型在生成之前会加强对动作时长、物体关系、事件逻辑和视听对齐的理解,因此输出的是一个连贯的序列,而不是一堆静止画面的堆叠。

四款中国模型,三条路径
要理解这为什么重要,不妨看看还有谁位居排行榜前列。到 2026 年 9 月,已有四款中国模型跻身全球视频生成的第一梯队:字节跳动的 Seedance 2.0 和 2.5、MiniMax 的 H3、阿里巴巴的 Wan 3.0,以及 HiDream 的 HD-V1。一年前,中国视频模型在主要国际基准上几乎不见踪影。如今它们已聚集在榜首附近。
它们走上这条路的方式各不相同。Seedance 依托字节跳动完整的算力、工程和产品栈。MiniMax H3 建立在庞大的模型基础和用户基础之上,并向视频延伸。Wan 3.0 嵌入阿里巴巴更广泛的 Qwen 和阿里云生态。HiDream 是其中的异类:一家没有巨头资源和分发渠道的初创公司,转而押注一种它称为原生全模态世界模型的架构,旨在让图像、视频、3D 交互和具身智能共享同一个基础。
HD-V1 支持文本、图像和视频输入,可生成 5 到 20 秒的 1080p 视频。团队称它在两个国际排行榜上表现优异,而最引人注目的说法是“世界理解”:即该模型之所以能生成更连贯的序列,是因为它对事件如何推进进行了建模。
为什么“理解”是新的前沿
当好几支团队都能达到同样的质量门槛时,竞争就转向模型对世界了解多少。分辨率和时长变成基础功能,而非差异化优势。更难的问题正是图像质量无法回答的那些:运动物体是否遵守物理规律,动作和声音是否保持同步,一个事件是否由上一个事件自然引出。
业界对同一理念还有其他叫法。竞品和更广泛的市场会谈及一致性、意图理解和稳定交付。一家中国视频公司智象未来甚至发布了视频智能体的五部分评估框架,涵盖一致性、意图、视听完整性、时间线与叙事,以及稳定交付。名称不同,目标相同:模型要值得信赖,能完成一个序列,而不只是开始一个序列。
排行榜之间并不一致
视频领域难以评判的部分原因在于,各个榜单并不一致。9 月,社区竞技场把某一系列推上榜首,对单个片段打分的人类评分者更偏爱另一个,而用使用量投票的提示词创作者又选了第三个。一份社区 Elo 快照将 Google 的 Gemini Omni 系列排在首位,Black Forest Labs 的 Flux 3 Video 是最强的开放邻近作品,字节跳动的 Seedance 2.0 和 2.5 紧随其后。相比之下,按 1 到 5 分质量量表给片段打分的人类评分者把 Seedance 2.0 排在第一,领先于 Kling、Wan,甚至它自己的后继版本。按原始使用量,Seedance 和 Google 的 Veo 3 在提示词数量上占主导,而 Wan 则占据了本地和开源细分市场。
这三组数据带来的教训是,“最佳模型”完全取决于你衡量的是什么。Veo 在无声片段人类评分中比在竞技场中排名更低,因为它的强项是原生音频和对话,而无声评分标准看不到这些。Seedance 2.5 在单片段质量上得分低于 2.0,这提醒人们:新版本在人们实际写出的提示词上并不总是更令人惊艳。任何为项目挑选工具的人,都应该在决定前多看几个榜单,并更看重与自己工作相匹配的榜单。
这一转变对创作者意味着什么
对任何真正用这些工具做东西的人来说,实际影响是“出问题的地方”变了。当模型理解事件逻辑时,失败会从显而易见的问题转向细微问题。你不再需要和瞬移的角色、朝错误方向打开的门较劲,而开始注意到更小的问题:一个动作多持续了一拍,一个反应并不来自前一句台词。这些正是人类导演本该发现的问题。
这也是中国短剧热潮已经教过的同一课。AI 现在可以生成镜头,但一集完成的作品仍然需要有人决定哪些镜头该留下、以什么顺序留下,以及为什么。模型在单帧上越来越强。但判断哪些帧重要仍然是人类的工作,而且这种状况持续的时间可能比乐观者预期的更久。
这场四方竞赛还有一个更不显眼的原因也很重要。不同公司从不同方向攻克同一个问题——这边是巨头的技术栈,那边是初创公司的架构——降低了行业对任何单一技术路径的依赖。如果世界理解最终被证明是正确的目标,那么现在不止一支团队在朝它努力。而如果它被证明是错误的目标,这个领域也已经做了对冲。
就目前而言,诚实的解读是:HD-V1 只是拥挤赛道中又一款强劲的参赛作品,其宣称尚未经过第三方测试。可以确定的是方向。赢得下一轮的模型,不会是画出最漂亮单帧的那个。而是能在二十秒内让一个故事保持连贯、不出岔子的那个。理解世界是更难的问题,而如今第一次有大量资金充足的团队同时投入其中。