一张照片,一个可行走的世界:InSpatio-World 1.5 把图像变成空间

大多数图像和视频模型给你的都是一个固定画面或一段固定片段。你只能看到模型决定展示给你的内容。一家名为 InSpatio 的中国公司本月发布了一款模型,它能拿一张照片、一幅全景图或一段已有视频,把它变成一个你可以自由走动的空间。
InSpatio-World 1.5 于九月下旬在上海国际视听艺术嘉年华上正式亮相,公司也以 Apache 2.0 协议开源了代码。演示视频最能清楚地说明它有什么不同。视频从一座中国宫殿的带顶回廊内部开始。镜头向前推进,掠过一道栏杆和一组台阶,转入一个庭院。随着视角移动,原本被柱子遮住的亭台逐渐显现出来。模型生成的不是一段镜头路径既定的片段,而是一个会随着你持续探索而不断渲染的空间。

这个版本有三处变化
第一是模型接受的输入类型。早期的世界模型大多只接受单张图像。1.5 版本可以接受单张图像、一组图像、全景图或视频。这一点很重要,因为它决定了使用门槛。单张照片是消费级的起点;而多图组和已有视频,是影视或广告团队手头本来就有的素材,能接受这些输入,也就意味着能用上这个工具的人更多了。
第二是实时探索。一旦进入生成的空间,你可以持续移动视角,绕过遮挡物,抵达初始画面中并不存在的区域。每当视角改变,模型都必须补全此前不可见的场景部分,而且要与你已经看到的内容保持一致。这比生成一段好看的片段要难得多,因为模型被要求维持对一个场所的“心理模型”,而不只是一连串画面。
第三是时空一致性,这恰恰是世界模型与视频生成器之间的真正分界线。如果镜头离开一个房间又回来,房间不应该自己重新布置过。InSpatio 表示他们在 1.5 中强化了这一点,以支持更长的探索路径和更复杂的场景,而演示也反复从新角度重访同一区域,来支撑这一说法。
演示背后的数字
InSpatio 称该模型相当紧凑,参数量为 13 亿,并报告在 WorldScore-Dynamic 上取得 68.72 分,称其在所评估的实时交互方法中排名第一,帧率最高可达每秒 24 帧。这些都是公司自己的数据,独立复现仍然很少,因此应把它们看作一个起点,而非定论。
技术方案中有几个环节值得点名。对于视频输入,整个流程使用 Depth Anything 3 来估计缺失的深度以及逐帧的相机内参和外参,正是这一点让它能从并非以 3D 采集方式拍摄的素材中重建场景。而时空自回归过程则负责在视角变化时维持一个持久的世界状态,而不是每次都从头重新生成场景。
可行走的场景在哪里体现价值
最直接的用途正是演示所指的方向。在影视和广告中,机位通常在你拍摄的那一刻就被锁定了。如果想要另一个角度,就得重拍,而重拍代价高昂。世界模型让团队可以在事后继续寻找机位,从已有素材中挖出更多镜头覆盖。InSpatio 特别提到广告中的“子弹时间”(bullet time)作为直接例子:不必围绕拍摄对象同步布置一整圈相机阵列,你只需输入一组图像,就能围绕同一个对象设计出新的相机路径。
第二个用途是机器人的训练数据。具身智能的一个问题是,互联网上的视频大多是第三人称拍摄的,而机器人是以第一人称看世界的。InSpatio 表示,该模型可以拿一段操作过程的第三人称素材,预测出更接近机器人所感知的第一人称视角,并且可以从不同方向重新观察同一过程,且遮挡关系随之改变。如果这能规模化奏效,它就提供了一条路径:把现有视频转化为机器人的训练素材,而不必为每一种环境重新拍摄。
除此之外,公司还指向旅游与文化体验、数字孪生与工业仿真——在这些领域,一个像空间一样“行事”的空间,比一张看起来像空间的图片更有用。
一场拥挤的竞赛,赢的定义各不相同
InSpatio 并非唯一在追逐这一方向的公司,而且各条竞争路线对于“世界模型究竟是干什么用的”看法并不一致。有些实验室优化的是电影级输出,用一个带有叙事性的镜头运动,生成一分钟精美而一致的视频。另一些则追求交互性,优先考虑自由移动、让场景在没有固定路径的情况下作出回应的能力。还有第三类更接近游戏,想要的是把世界保存在内存中、可导航的实时引擎。
这些目标彼此拉扯。一个为电影级画质调校的世界模型,可以把算力花在一条预定好的序列上,让每一帧都好看;而为交互调校的模型必须渲染用户接下来看向的任何地方,这就会逼向速度,也逼向一种能经受任意移动的场景记忆。InSpatio-World 1.5 显然属于交互阵营,它选择一个体量很小的 13 亿参数模型,是在押注:保持实时,比赢得静态画面的选美比赛更重要。
对买家而言,真正重要的比较是与其它可导航系统的比较,而这个领域还处于早期,大多数说法都是自我报告的。像 WorldScore-Dynamic 这样的基准试图给那个难以捉摸的部分——世界在你穿行其中时是否保持一致——打出一个数字,但基准只能衡量设计者选择去衡量的东西。长距离探索中的一致性、对原始照片的还原度,以及帧率,三者彼此制约,每个系统都会做出不同的取舍。
这才是关注这次开源的真正理由。当数十位研究者用自己的输入去压测这个模型时,它在哪里站得住、在哪里会崩掉,所形成的图景会比发布演示有用得多,也能让整个领域在共同的基准上比较各种方案,而不是各自比拼精心剪辑的亮点片。
为什么开源是战略,而不是白送
InSpatio 在发布模型的同时公开了代码,并预告将推出新的 Topos-Pro 1.0 供邀请测试。原因在空间智能领域反复出现:有用的应用散布在影视、旅游、机器人和数字孪生之中,没有哪家公司能全部覆盖。公开基础能力,让研究者可以验证其边界,也让合作伙伴能在其上构建垂直层。这是一种做地基、而不是做整栋楼的方式。
风险则是早期开源发布常见的那一个。演示很惊艳,基准是自我报告的,而一个受控演示与一个能在杂乱真实世界输入上站得住脚的工具之间,往往差距很大。接下来几个月,随着独立研究者和创作者拿到代码,我们才能看清这份承诺中哪些部分能经受住他人数据的检验。