← 返回博客
Ai预计阅读 12 分钟

TwelveLabs Pegasus 1.6 将第一人称视频转化为机器人训练数据

发布于 2026年10月7日
TwelveLabs Pegasus 1.6 将第一人称视频转化为机器人训练数据

教机器人叠衣服,首先要有人观看数小时人类叠衣服的视频,然后记下每一个动作。TwelveLabs 想让人从这第二项工作中解放出来。

10月6日,这家视频智能公司发布了 Pegasus 1.6,这是一个原生支持第一人称视角视频的模型。所谓第一人称视角,是指从实际做事者的视角拍摄的画面,无论对方是在做饭、在工厂流水线上组装零件,还是在远程操作机器人。

为什么第一人称视频是一个不同的问题

与固定俯拍或第三人称摄像机视频相比,第一人称画面携带不同的空间线索和运动模式。它包含运动模糊、光线变化,以及随着佩戴者移动而出现和消失的物体。在通用视频数据上训练的模型往往处理不好这类素材。

Pegasus 1.6 的构建目标就是接收这种杂乱输入,并提取对教机器人如何移动、抓取或导航至关重要的细节。该模型直接支持五种工作流。

动作分割与标注会从原始视频中为任务、步骤、物体和手物交互生成带时间戳的标签,并映射到特定领域的分类体系。密集描述标注会生成描述性语言,用于表达空间关系、场景上下文和手物交互,目标是训练受语言条件控制的机器人策略。质量评分会在视频到达人工审核者之前,通过评估动作清晰度、取景和稳定性来过滤低质量片段。搜索与策展会通过自然语言查询,在大型视频库中呈现罕见事件和长尾场景。同意与合规标记会在视频进入下游流程之前,检测人脸、旁观者以及屏幕上或纸张上的敏感数据。

人力账

解释这款产品价值的关键数字是人工标注成本。手工标注第一人称视角画面,每1小时视频可能要耗费70到155小时的人力时间。拿一段2小时的视频来算,一名人工标注员面对的就是一个文件需要数周的工作量。

Pegasus 1.6 提供261,120 token 的上下文窗口,足以处理最长两小时的视频。访问通过 TwelveLabs API 进行,价格为每视频小时1.75美元、每百万图像输入 token 3美元、每百万输出 token 15美元,是 Pegasus 1.5 费率的两倍。

对于计划执行大规模任务的团队来说,有一个注意事项:批量分析仍由 Pegasus 1.5 处理,因此高容量批量处理尚未完全迁移到新模型。

理解与执行之间的区别

该公司 CEO Jae Lee 将眼前的机遇描述为训练基础设施。理解一个动作只是教会这个动作的一部分。Pegasus 可以描述肢体动作,并提供对轨迹的粗略理解,但它并不提供执行这些轨迹所需的全部信息。压力、触觉和精确控制仍然是另外的问题。

这是对边界的一种诚实界定,值得记住。机器人团队必须把视频衍生信息与其他数据结合起来,并构建将其转化为行动的系统。Pegasus 位于上游,为训练过程提供输入,而不是取代机器人技术栈。

一个拉丝铝制机器人夹爪正靠近浅灰色表面上的一块纯白陶瓷立方体

Lee 提供了一个处理规模的例证,他回忆称有一次运行在大约18小时内处理了相当于约17年的第一人称视频,而且没有出现失败视频。他没有说明计算资源或评估条件,因此这只是一个轶事性的吞吐量说法,而不是可复现的基准测试。该公司的技术材料描述了针对动作识别和执行手部识别的内部评估,但没有提供数值分数或与竞争对手的可复现比较。

与替代方案相比所处的位置

竞争格局覆盖机器人开发流程的多个环节。NVIDIA 的 Cosmos Curator 在数据准备方面直接重叠,通过过滤、标注和去重来完成工作,其开放工具为团队提供了托管服务之外的另一种选择。Encord 集成 NVIDIA Cosmos Reason 2 和 Embed,在标注与策展工作上展开竞争,借助基于行为的搜索为人工审核生成初步标签。Google 的 Gemini Robotics ER 2 在解释视频和跟踪任务进度方面存在重叠,不过它强调规划与协调,将运动执行交给更底层的动作模型。Black Forest Labs 和 mimic 的 FLUX-mimic 使用视频模型基础来生成机器人动作,解决的是执行而非数据准备问题。

这些工具的计费单位和产品范围各不相同,因此它们的费率并不能决定对于特定工作负载哪种最便宜。Pegasus 按视频时长计费,并按 token 对文本输出计费,这适合瓶颈在标注而非动作生成的团队。

这次发布确立了什么,又没有确立什么

Pegasus 1.6 为 TwelveLabs 的视频理解研究带来了一个具体产品,并且瞄准了一个真实瓶颈。从原始人类视频到可用的机器人训练数据,这条路径确实缓慢且昂贵,而将其中的一部分自动化,对任何构建具身 AI 的人都很重要。

仍未确定的是,这个模型是否能比现有替代方案带来显著更好的结果。此次发布没有附带第三方基准测试、覆盖整个领域的定价比较,也没有公开的客户结果。接下来最值得关注的是,机器人开发者是否会公布在实际标注工作流中使用 Pegasus 1.6 的结果。这样的证据会把讨论从发布转向评估,也只有这类证据才能证实关于节省人力的说法。

为什么人类视频是金字塔的底座

Pegasus 1.6 背后的战略建立在一个关于机器人行为知识从何而来的论点上,值得直白说明。

人们关于完成体力工作的大部分知识,从未以机器能够学习的形式被捕捉下来。厨师不假思索地调整握持方式。工人掉了工具后,通过转移重心和调整伸手范围来恢复,而这种方式没人会写下来。这些调整,正是机器人执行一个动作与完成一项任务之间的区别。

人类视频是这些调整最丰富的来源之一,而且数量极其庞大。这里的赌注是:从人类画面中提取广泛的行为知识基础,再通过遥操作演示将其适配到特定机器人上,会比为每个任务从零开始更快地造出有能力的机器。

这是一种开发战略,而不是已被证明的保证,CEO 也这么说了。更多视频并不会自动产生一个广泛通用的机器人,而把已理解的动作转化为已执行的动作,仍然是一个涉及力、触觉和控制的独立问题。

同意维度

Pegasus 1.6 支持的五种工作流中,有一种值得单独拿出来讲,因为它指向了这类业务自带的一个治理问题。同意与合规标记会在视频进入下游流程之前,检测人脸、旁观者以及屏幕上或纸张上的敏感数据。

这个功能之所以存在,是因为第一人称视频是从工作中的人这一视角拍摄的,而这种取景捕捉到的远不止任务本身。它会拍到工牌、屏幕、背景里的人脸、桌上的文件。对于以工业规模收集视频的机器人团队来说,标记这一步能防止训练流程摄入本不该摄入的素材。

将该工作流与标注类工作流并列,等于默默承认数据流程存在合规面,而且这个面很难靠人工管理。对于受监管行业的团队来说,标记能力最终可能和标注速度同样重要,因为无法筛查输入内容的流程根本无法使用。

什么能扩展,什么不能

TwelveLabs 将此次发布描述为从小型、精心整理的数据集,转向建立在真实人类经验之上的可扩展流程。坦诚的提醒是,标注环节的规模化并不会自动带来训练环节的规模化。

即使是一条快速、廉价的标注流程,其产出的数据仍然必须与机器人所需的触觉和控制信号配对,并且仍然必须适配到特定机器的具身形态上。Pegasus 1.6 消除了一个瓶颈,即标注人力,而对其他瓶颈毫无作为。这是一项有用的贡献,而非完整解决方案,受益最大的团队将是那些标注环节构成硬性约束的团队。这是否描述了大多数机器人团队,正是来自实际部署的公开结果能够回答的问题。

相关文章