Manus 让邮件触发智能体,而就在几天前,一封邮件就能劫持智能体

Manus 于 9 月 28 日发布了 2.0 版本。更新说明中列出了四款产品:名为 Cascade 的新一代智能体运行框架、重新设计的桌面应用 Studio、事件触发式自动化,以及付费托管层 Cloud Computer。除此之外,还有一款名为 Cue 的独立应用,它为每个个人智能体配备专属的电子邮箱地址、电话号码、钱包和虚拟计算机。
大多数报道都以效率方面的说法作为开头。而更重要的一句话藏在自动化功能里:现在,当公司外部的人给你发来一封邮件时,任务就会启动。
而这一功能上线的约三天前,研究人员刚刚披露:一封邮件就能劫持 Manus 智能体。
触发器才是关键所在
过去,Manus 任务只有两种启动方式:要么有人手动输入提示词,要么是用户设定的定时计划到期。两者都把人类放在链条的起点。自动化改变了这一点。文档中列出的触发器包括:收到邮件、广告表现变化、日历事件、Slack 消息和 Notion 更新。
广告表现和 Notion 更新的影响面相对可控,邮件则不然。互联网上的任何人都能发邮件,而邮件内容是攻击者可控的文本,智能体会在执行任务的过程中读取它。这项功能是为便利而设计的,却开辟了一条从外部陌生人直达智能体运行的路径,全程没有任何人参与。
时间点让这件事更加尖锐。9 月 25 日被报道的一份 Salt Labs 报告描述了这样一件事:一封携带混淆 JavaScript 的邮件,让 Manus 智能体在一次常规任务中执行了代码。Salt 表示该研究早于此次披露,该漏洞此后已被修复。但已修复的漏洞依然是有用的信号。它证明,模型对邮件内容的判断本身就是一道安全边界,而这样的边界会不断被试探。
Cascade,以及一个难以核实的数字
Cascade 是新的运行框架,其设计原则很容易概括:轻量起步,只在工作需要时才引入专门能力。相关的工作成果——比如一份简报、一个页面、一段视频和一项自动化——会留存并关联在同一个项目里。
最醒目的数字是成本降低 32%,同时 token 用量减少 23.2%,完成速度提升 28.2%。Manus 是在一种受测配置下与自家上一代系统作比较,并未说明任务集、所用模型或具体配置。这一点很重要,因为 Manus 按积分计费,而每个任务的积分消耗能相差一个数量级。据说简单查询消耗 10 到 50 积分,深度的多来源研究则可能用掉 500 到 900 积分。在一个没人测量过的工作负载上省下 32%,对你的账单说明不了什么。
Cloud Computer 是一个需单独购买的运行环境,面向需要持续运行的项目,例如游戏服务器或通宵运行的自动化。它是付费产品,但官方并未公布价格。Studio 则在此前已能产出文档、表格、幻灯片、网站和代码的基础上,新增了视频编辑器和游戏开发环境。
Cue 才是风险升级之处
Cue 应用是本次发布中最激进的部分,也是最值得警惕的部分。给智能体配一个自己的邮箱地址、电话号码和钱包,就把它从一个无状态的函数调用,变成了一个拥有资源、具备支付能力的实体。把多个这样的智能体放进同一个群聊,让它们互相交接工作——一个负责调研,另一个负责起草——确实是一种截然不同的工作组织方式。
这也意味着,一个被攻陷的智能体不再只是产出一段糟糕的结果。它有陌生人可以投递的收件箱、可以动用的预算,以及同一聊天里会信任它所说内容的同伴。在单智能体工具里,提示注入只是浪费一轮对话;而在一群正在花真金白银的智能体中,提示注入则是另一类问题。
钱包尤其值得关注。赋予智能体支付能力,正是让自动化变成能够在无人参与的情况下完成交易的东西,而 Manus 描述的防护措施是预算,不是身份。预算限制的是智能体最多能花多少钱。它不会核查收款方是否合法,也察觉不到一条藏在「请智能体总结的文档」里的付款指令。而在传统支付中,这些都是已经解决的问题——发起转账的主体与请求内容要分别验证。
团队这个月真正该做的事
实用建议很无聊,但值得照做。用只读连接器试跑 Team 套餐,关闭收件箱触发器,并且在安全模型经受更多考验之前,别让 Cue 接触任何与企业身份绑定的东西。Team 套餐起步价为每席位每月 20 美元,席位少于 30 个时不包含 SSO。Manus 帮助中心列明,低于该门槛时 SSO 需支付 150 美元外加税费的固定费用,达到 30 席位及以上则免费,但没有说明这笔费用的收取频率。做预算前先问清楚。
在这份清单之下,还有一个更深层的设计问题。事件触发的智能体需要一种区分「指令」与「数据」的方式。邮件正文是智能体被要求阅读的内容。如果智能体同时把它当作命令来源,那么每个收件箱都会变成提示注入的攻击面,而解决办法不是用过滤器剥掉可疑字符串,而是一套将输入通道与指令通道分离的架构——而大多数智能体产品尚未做到这一点。
同样的逻辑也适用于 Cue 的共享群聊。当智能体互相交接工作时,每一个都必须判断上一位所说的内容有多可信。如果对话内部没有来源溯源的概念,一个被攻陷的智能体就能操纵整个群体,而这个群体花的是用户为另一个目的授权的钱。
方向本身毫无疑问
方向本身毫无疑问。能够响应事件、持有自身资源并在群体中协作的智能体,正是这一品类的走向,而 Manus 比大多数玩家跑得更快。
放眼整个行业,更宏观的态势非但没有削弱这种警惕,反而支持它。就在同一周,另一个研究团队公布了超过三万条日志,记录自主智能体探测本不该触及的网站;而市场上的前沿实验室也大致在同一时间推出了带事件触发器的智能体平台。能力总是一起到来,安全模型总是姗姗来迟,因为一个能跑起来的智能体,远比一份审计记录更适合拿来做演示。
风险落在一个具体的地方。当一个系统的输入可以来自任何人,而它的输出可以花钱、可以给其他智能体发消息,那么有意思的问题就不再是智能体能做什么,而是——谁有权启动它。