← 返回博客
Ai预计阅读 10 分钟

Reka Rho-1 将理解与生成置于同一个 KV 缓存

发布于 2026年10月6日
Reka Rho-1 将理解与生成置于同一个 KV 缓存

大多数多模态系统都是流水线。语言模型负责规划,扩散模型负责渲染,检测器负责定位,策略网络负责驱动机器人。每一次交接都有成本。状态必须被序列化、在服务之间传输,并重新编码成下一个组件期望的格式。

Reka AI 的 Rho-1 走了一条不同的路。这个 190 亿参数的模型于 10 月 5 日作为研究预览发布,在一个网络内处理文本、图像、视频和机器人动作,所有内容都以 token 形式表示在单个上下文窗口中。没有工具调用,也没有第二个模型。

演示让这种差异变得具体。用户要求生成一幅岩石岬角上红白灯塔的低空航拍视图。Rho-1 渲染了出来。用户要求给灯塔画一个框;它画了一个。用户要求把它制作成无人机飞入的动画;它从刚刚生成的图像帧生成视频。用户要求在保持相机运动完全一致的情况下加入暴风雪;它编辑了视频。最后,用户询问两个片段之间发生了什么变化,模型用文本作答。

这个序列中的每一步都依赖于模型仍然能够访问它此前生成的内容。传统流水线必须在服务之间传递图像和视频,并在每个边界重建上下文。Rho-1 将其保留在同一个注意力上下文中,这就是这条链能够保持连贯的原因。

两条流,一个缓存

该架构将每个 transformer 块划分为两个专家权重流,它们共享一次注意力操作。理解流处理语言、内部推理 token 和视觉输入,并由下一个 token 头输出离散结果。生成流使用流匹配头将连续潜在表示去噪为图像和视频。

两条流都从同一个 KV 缓存中读取。指令、此前生成的视觉内容、推理 token 和电机命令都保持可用。一个特殊 token 会发出信号,表明响应需要视觉生成,这让生成流可以从累积状态继续,而不是从头开始。

一个透明玻璃球,里面有两个独立发光的腔室,一个暖琥珀色,一个冷蓝色

该模型有意以两种格式承载信息。离散 token 处理文本和符号推理。连续表示承载图像潜在变量、视频帧、机器人动作和本体感觉。让物理信号保持连续,可以避免将关节位置和速度强行纳入离散词表所带来的精度损失。

最后一个细节让机器人控制的主张不只是营销话术。预测相机图像的同一组权重也驱动机器人运动,因为二者存在于同一个表征空间中。

从另一个方向切入生成

Reka 报告了两个变体。基础模型使用 99 个去噪步骤,生成速度中位数为实时的 0.79 倍,流式输出在大约六秒后开始。名为 Rho-1 Flash 的蒸馏版本使用八个步骤,约一秒内返回 5.3 秒的片段。Flash 编辑大约 1.1 秒重新渲染约一秒的片段。

流式接口可以从先前的潜在状态扩展片段,并在生成过程中接受新指令。在一个航拍演示中,向左倾斜和向右倾斜的命令在生成开始半秒后到达。生成的分支在分叉前共享相同的开场帧。如果这在受控演示之外也成立,那就是一项真正的能力,因为这意味着导演可以在飞行途中操控镜头,而不是从头重新生成。

为了绕开机器人训练数据短缺的问题,Reka 构建了一个逆动力学模型,从普通互联网视频中提取控制信号。它在 320 块 H100 GPU 上训练共享骨干网络约三个月,与前沿模型的训练相比规模不大。

算力方面的故事值得强调。按照前沿标准——系统动辄在数万个加速器上训练——在 320 块 H100 上训练一个 190 亿参数模型三个月只是一次小规模运行。如果 Rho-1 在这种规模下能兑现其架构承诺的哪怕一小部分,那就表明下一波多模态能力不会需要巨额资本,小型实验室仍然可以做出结构性贡献,而不是只能在算力上竞争。

这在世界模型竞赛中的位置

Rho-1 在一个拥挤的发布周中登场,这一周里有多款试图表征场景如何演变的模型。InSpatio 发布了 InSpatio-World 1.5,可将单张图像、全景图或视频转换为可导航的 4D 世界,并在实时交互方法中的一项动态场景基准上排名第一。Nvidia 开源了 Lyra 2.0,可将图像转换为可探索的 3D 环境。Google 和一批中国实验室都在同一领域工作。

Reka 的切入角度与重建派不同。那些项目构建的是一个你可以穿行其中的场景。Rho-1 试图构建一个既能描述场景、又能按请求改变场景,同时还能输出作用于场景的电机命令的模型。如果这行得通,同一个检查点就能驱动机器人并叙述机器人所见,而无需单独的策略网络或单独的视觉语言模型。

机器人方面的主张影响最大,也最缺乏验证。Reka 表示,预测相机图像的同一组权重也驱动机器人运动,并且由于机器人数据稀缺,它构建了一个逆动力学模型,从普通互联网视频中提取控制信号。如果这种方法成立,它就指向了一条绕过具身 AI 最大瓶颈的路径,即真实机器人轨迹收集成本高昂且多样性有限。如果不成立,机器人控制功能就只是一段演示片段。

这次发布还关系到这些系统如何定价。大多数多模态产品对规划、图像生成和视频生成分别收费,因为每一项都是不同的服务。一个在单个上下文窗口中完成这三者的单一模型,会改变建立在其上的任何产品的单位经济模型。这是否会体现为更低的价格,取决于统一模型服务并发请求的效率,而这正是独立测试能够揭示的。

仍然悬而未决的主张

Rho-1 的性能数据来自 Reka 的预览,目前还无法复现,因为没有公开权重或 API。硬件配置、批处理、输出设置和编译选择都可能大幅改变视频延迟,因此效率数字需要独立复现后才有意义。

该模型有一些公开承认的限制。原生视频上限为 672x384。长时程结构漂移、视频定位和编辑稳定性被公司自己描述为薄弱环节。这些同样是困扰每一个世界模型的问题,一个 190 亿参数的网络不太可能彻底解决它们。

这次发布契合了向世界模型转变的更广泛趋势,其目标是构建一个能够预测场景如何演变并根据预测采取行动的系统。Rho-1 的贡献在于架构:它主张理解与生成应当共享权重和上下文,而不是被拼接在一起。这个主张能否胜出,取决于其他实验室接下来几项研究预览的样子,也取决于 Reka 是否会交付任何第三方可以测试的东西。

相关文章