PixVerse R2 将视频生成变成可以漫步其中的世界

大多数视频生成工具对你的要求都一样:描述一个场景,等待,得到一段视频,然后决定要不要留下。输出的是一个文件,每次播放都一模一样。如果你想要不同的结局,就得换一个提示词,从头再来。
PixVerse R2 于 9 月 23 日由 PixVerse 视频平台背后的公司 AIsphere 发布,它建立在一个不同的前提之上。它不返回一段固定的视频,而是生成一个持续运行的视听世界,在你与之互动的过程中始终运转。你可以用文字或图像创建一个世界,用 WASD 键移动角色,切换镜头,并输入提示词来替换角色、添加物体或改变环境。场景不会重新开始,先前的操作会保留下来,并塑造接下来发生的事。
最后这一点正是整个理念的核心。在大多数生成式视频中,每次请求都是彼此独立的;而在 R2 中,一条提示词会更新世界的状态。在与创作者 Xiaolongbao 合作打造的互动演示影片 *Zero Mark* 中,你向一个生物送出礼物,结果会根据你选了哪份礼物实时生成。给它一条龙还是一片叶子,故事就会走向不同的分支。另一位创作者 Jade Wu 则围绕一个名为 Eve 的实时数字角色构建了一段序列,Eve 在多次交流中始终保持着一致的身份和记忆。

AIsphere 将 R2 称为通用实时世界模型,并已在 world.pixverse.video 开放了面向游戏、互动影片和数字人的演示空间。R2 接续的是公司于 1 月推出的 R1。
它试图打破的取舍
实时生成一向迫使人们做出选择。小而快的模型能跟上实时互动,却做不了太多事;大而强的模型能生成更好的画面,但运行太慢,无法对任何输入作出响应。团队通常只能选一边,并接受这一局限。
R2 把这个问题分成两层。底层是一个名为 Omni Causal AR 的因果自回归主干,在短视频与长视频、多模态参考、音频和动作控制上持续训练。它沿五个维度扩展:模型、数据、任务、控制信号和时间跨度。在其之上是一个实时加速层,将同一主干蒸馏成极少步数的版本,以实现实时运行。
这一区别很重要。AIsphere 并没有单独训练一个小模型来处理交互、并接受它会更弱的事实,而是把自己能力更强的大模型蒸馏成更快的形态。两层同出一源,因此快速版本并不是从零开始学习。
配套技术则补齐了细节。动态分块处理运行在不同时间尺度上的信号,因此模型不必把缓慢的环境变化和快速的角色移动同等对待。三条记忆通道分别追踪持久的世界规则、近期的运动和物体的状态。一个“错误库”(Error Bank)会在训练中回放模型自身的失败状态。
公司报告称,在内部测试中,错误库将长时程亮度漂移指标降低了 35.8%,而块稀疏注意力在稀疏度超过 90% 时仍能几乎完好地保持画质。亮度漂移是一个不起眼却很能说明问题的指标。在长序列中,误差这种细微的累积,恰恰会打破“你正在看一个连贯场所”的错觉。
它不是什么
AIsphere 对局限相当坦诚,在这个营销通常跑在产品前面的领域里,这令人耳目一新。在严格的实时与延迟约束下,R2 单次生成的输出质量仍落后于领先的离线视频模型。如果你想要尽可能清晰的视频,依然更适合离线生成、耐心等待。
所以它的价值主张不是质量,而是连续性与响应性。模型用一部分逐帧的精致度,换取让世界持续存活并对输入作出反应的能力,而它押注的是:大量使用场景更看重后者。
这一框架也解释了 R2 在来自中国实验室及其他地区的世界模型浪潮中所处的位置。此前介绍过的 HiDream 的 HD-V1,把自己定位在离线生成中的物理一致性与叙事连贯性上。谷歌的交互式世界模型则朝着可游玩环境的方向推进。R2 的宣传最用力地拥抱“进入一个环境”这一隐喻。AIsphere 创始人兼 CEO 王长虎直言:实时交互视频并不等于世界建模的全部,但它是人们最早能体验到的路径。他预计 R2 会从创作工具演变为用户可以随时进入的环境。
游戏引擎为何重要
今年 7 月首次推出的 PixVerse 游戏引擎,如今运行在 R2 之上。对研究领域之外的人来说,这才是值得关注的部分。附着在游戏引擎上的实时世界模型,与视频生成器是完全不同的产品。它意味着精心设计的交互、存档状态,以及玩家早已从软件(而非媒体)中习以为常的那种会话持久性。
演示用例都围绕这一思路聚集:游戏、互动影片、数字人。这三种形态都是观众要做出行动的格式,也是固定视频无法提供的体验。一个记得上一轮对话的数字人,在客户服务或陪伴场景中的用处,是单次视频永远无法企及的。而一部观众的选择真正产生分支的互动影片,是传统视频流程根本无法制作的形式。
从演示空间到生产部署之间还隔着现实的差距,AIsphere 尚未披露商用时间表、定价,或一场实时 R2 会话消耗多少算力。这些数字将决定这个模型会成为平台,还是停留在演示阶段。
这次发布背后的模式
退一步看,R2 符合过去一年 AI 视频中一个清晰可辨的模式。前沿正不断从“生成更漂亮的视频”转向“在时间中维持一个连贯的事物”。无论这个事物是五分钟的叙事、在多个镜头间保持一致的角色,还是像 R2 这样在你不断推动它时仍维持自身规则的世界,都是如此。
这些其实都是同一个底层问题换了身衣服:当时间和交互不断累积时,如何让生成系统的状态保持一致。离线模型在单次渲染中逐帧解决它;R2 则要在输入持续到来的实时会话中解决它。
无论 R2 会成为被广泛使用的工具,还是资金充足的实验,它都是一个有用的标志,标示出这个品类认为下一个优势所在何处。能够在实时输入下维持一个连贯世界的公司,将占据有利位置,因为正是这种能力,把生成式视频从“你观看的东西”变成“你使用的东西”。