← 返回博客
Ai预计阅读 11 分钟

英伟达想在毫秒内隔离一个失控的智能体

发布于 2026年10月4日
英伟达想在毫秒内隔离一个失控的智能体

英伟达本月推出了开放式智能体安全平台(Open Agent Safety Platform),由一百多家行业合作伙伴共同打造。据该公司描述,这套软硬件栈的设计目标是检测出行为异常的 AI 智能体,并在毫秒之内将其切断。

再读一遍那个数字:毫秒。整个产品其实是在论证速度,而这个论证是对的。

为什么速度就是全部要点

一个持有凭证、拥有工具访问权限的智能体,不会礼貌地失败。它在一个循环中行动,而每一步都可以很快。如果某个智能体决定删除一个存储桶、导出客户数据表,或把一份文件误发到错误的地址,损害会在人类读到告警之前就已经发生。几秒内触发的控制手段是事后尸检工具;毫秒内触发的控制手段才是安全带。

这把智能体安全重新定义成了一个运行时问题,而非政策问题。政策存在于文档和仪表盘里;运行时控制则存在于智能体行动所经过的同一条路径上,并且必须在行动提交之前做出判断。这种工程更接近断路器,而不是合规勾选框。

合作方名单本身就是战略

一百多家合作伙伴既不是凑数的零头,也不是营销上的修饰。正是这种规模,才能让一个安全层成为标准。英伟达对拥有智能体市场兴趣不大,它想要的是成为每个智能体都必须经过的那一层,就像它的 GPU 成为每个模型训练都要经过的那一层一样。如果隔离机制存在于所有人已经在使用的技术栈中,那么所有人都会默认获得它,而替代方案就变成了:你得解释自己为什么拒绝一道安全底线。

这种模式有先例。安全领域的标准很少是因为客户强烈要求才出现的,它们的出现,往往是因为某家大型厂商把它打包进了客户本来就想要的东西里,然后整个生态随之调整。

它针对的威胁

这次发布恰逢这样一个月份:各种事件不断提醒人们,毫无约束的智能体能做什么。研究人员记录到,编程助手会建议使用根本不存在的软件包——这对任何注册该名称然后坐等的人来说都是一份大礼。另一份报告发现,智能体通过公开仓库暴露了超过 13,000 张内部图片,而这些泄露源于意外而非攻击。一项针对未授权网站访问的调查发现,智能体使用了让自身活动更难被追踪的技术手段。

这些都不是什么奇异的漏洞利用。它们只是普通的智能体行为,撞上了一个从未为「能自主行动的软件」而设计的环境。隔离层并不能阻止上述每一种情况,但它能改变爆炸半径。一个失控的智能体若在毫秒内被切断,只是一份事件报告;同一个智能体若被放任一小时,就变成一份数据泄露通知。

最难的部分是定义「行为异常」

检测才是真正困难的地方。一个失控的智能体和一个高效的智能体,从外部看十分相似:两者都在快速发起调用、访问 API、搬运数据。区别在于意图,而意图无法在日志中被观察到。

因此,该平台不得不依赖各种启发式手段:权限边界、允许列表、对动作序列的异常检测,以及对单个智能体可触及范围的硬性限制。这些手段各自都以不同的方式脆弱。限制设得太紧,正当工作就会陷入停滞,而这是让安全层被关掉的最快途径;设得太松,隔离机制就永远等不到触发的那一刻,直到为时已晚。

这种张力才是真正的产品。谁都能发布一个急停开关;发布一个让支持团队愿意一直开着的急停开关则难得多,这也正是「定位」如此重要的原因。英伟达把这层东西作为基础设施来卖,而不是作为刹车片,而基础设施是团队愿意在其上继续搭建的东西。

遏制不等于预防

隔离平台是一种特定类型的控制手段,值得说清楚它做什么、不做什么。它不能阻止智能体被欺骗、被操纵,或者干脆就是判断错误;它限制的是一个错误在开始之后能走多远。

这一区别很重要,因为整个行业花了多年追逐「预防」,而预防在边缘情境上不断失手。提示词过滤能拦住明显的攻击,却漏掉精巧的那些;权限审查看起来严谨,直到某个智能体把若干被允许的动作组合成一个谁都没允许过的结果;模型对齐有帮助,但并非保证,因为模型并不是唯一的变量。

遏制承认有一部分智能体行为注定会出错,并为损害划出边界。这与一代人之前塑造网络安全的哲学如出一辙:防守方不再假设每一次入侵都能被拦下,转而假设总有一些会得逞。一旦系统假设失败必然发生,它的设计就会改变:日志记录变成持续性的,隔离成为默认设置,恢复成为反复演练过的流程,而不是一场手忙脚乱。

合作方名单也是一场治理辩论

一百家合作伙伴意味着一百套政策,而让他们就「什么算作失控行为」达成一致,会碰上一个谈判问题而非技术问题。不同行业划线的位置各不相同。医院不能让智能体在没有人类介入的情况下接触患者记录;媒体公司可能容忍智能体在草稿上拥有很大自由度,但在发布上则一点空间都不给。

如果平台试图为所有人编码一种「安全行为」的定义,它会在第一个需要不同定义的客户那里失败;如果它把一切都做成可配置的,它就变成了工具箱而非底线,而工具箱不会改变一个行业的默认行为。关于这个开放式智能体安全平台,真正有趣的问题是它偏向哪一边,而答案将体现在首次部署需要多少配置上。

有一个先例值得记住。终端检测与响应(EDR)花了数年才成为标准,而且是在一连串入侵事件让替代方案变得站不住脚之后才做到的。智能体遏制的时钟走得更快,因为智能体的扩散速度超过了围绕它们的安全工具。这些平台在入侵事件之前就已到来——这在这个领域是罕见的事,对任何及早部署它们的人来说都是个好兆头。

企业应从中得到什么

这次发布是一个信号,说明业界认为风险集中在何处,而不是让人放松的邀请函。如果一家拥有如此广泛触达能力的硬件厂商认定,毫秒级智能体遏制值得打造一个平台并集结一百家合作伙伴,那么「给智能体宽泛权限然后祈祷一切顺利」的时代正在落幕。

对今天任何部署智能体的人来说,务实的做法是梳理:一个遏制层需要了解自己环境的哪些信息?哪些动作不可逆?哪些数据绝不能外流?哪些凭证一旦被滥用会造成最大破坏?这些答案不取决于英伟达的平台,也不取决于其他任何人的平台,而它们正是任何安全层都需要的输入。平台会处理机制层面的问题,而边界仍然必须由业务本身来划定。

相关文章