当助手掌管办公室:Gemini、智能体与新的工作流层

10 月的第二周,Google Cloud 推出了一款它称之为“工作智能体”的东西。它的卖点并不是一个更聪明的聊天机器人,而是一套能够跨 Gmail、Drive、Docs、Sheets、Calendar 以及已接入的商业应用协调任务的系统,它借助专门的技能和持久的上下文来完成多步骤任务,而不只是回答问题。
关注度较低的那个细节,恰恰最为关键。该智能体可以跨 Google 自家模型和 Anthropic 的 Claude 模型进行编排。换句话说,Google 正在把自己推销为那个决定“哪项工作由哪个模型来做”的层,即便其中包含它并不拥有的模型。
智能体在办公室里究竟做什么
一个真正有用的智能体,并不是一个嗓音更好听的搜索框。它会阅读邮件线程、找到附件、更新正确的工作表标签页、以恰当的语气起草回复,并预订会议室。每一步都很小。价值来自于按顺序完成它们,而无需有人在四个窗口之间来回复制粘贴内容。
这正是各类企业级助手正在趋同于同一形态的原因。Google 的智能体在其生产力套件之间进行协调;微软一直把 Copilot 推向同一个位置;OpenAI 一直在构建自带桌面和浏览器环境的智能体;而 Anthropic 则一直在销售专注于编程和计算机操作的智能体。竞争不再是谁能写出最好的段落,而是哪个系统可以被信任去完成一个工作流。

为何编排层至关重要
多年来,人们的假设是:谁拥有最好的模型,谁就能赢得企业市场。这一假设正在松动。模型能力已经趋同到一定程度,采购团队不再在意哪个前沿模型领先几个百分点,而开始在意哪家厂商能把智能体接入工作本就所在的那 些系统。
如果这一判断成立,那么持久的位置就是编排层——它把请求拆解为步骤,将每个步骤路由到合适的模型,并把结果组装起来。拥有生产力套件在这里是巨大的优势,因为智能体已经拥有上下文和权限去采取行动。也正是因为拥有这一层,Google 才能从容地把部分工作路由给 Claude。如果这一层才是产品,那么底层的模型就变成了可互换的输入。
便利随之而来的治理难题
一个能读取邮件、编辑文档并安排会议的智能体,所需的权限模型远比大多数 IT 部门今天运行的访问控制要复杂得多。这就是该功能实打实的代价,也是部署停滞的地方。
面对同样的风险,微软采取了不同的路径。它一直把 AI 智能体推向 PC 本身,用执行容器来限制智能体在一台机器上能触及的范围。在本地运行智能体,是用一部分便利换取对它所触及范围的更严密边界。Google 的做法则依托云端和套件,因为数据本就存放在那里。两者都在试图回答企业买家如今会优先追问的问题:这东西究竟能接触到什么。
监管机构也在围绕同一个缺口打转。10 月 8 日,英国信息专员办公室(ICO)通报了十家 AI 开发方作出的数据保护改进承诺,并就智能体式 AI 的风险启动了证据征集。其措辞很能说明问题。当软件代用户采取行动时,围绕同意、日志记录和责任归属的问题就不再是某一家公司自己的问题了。
实践中的权限难题
想象一下智能体完成工作所需的访问清单。读取邮件线程需要邮件访问权限。找到附件需要文件访问权限。更新工作表需要该文档的编辑权限。预订会议室需要日历写入权限。每一项权限单独来看都合情合理。但合在一起,它们所描述的实体几乎能看到一个人能看到的全部内容,并能改动其中很大一部分,而传统的访问控制从来就不是为某个以机器速度自主行动的实体而设计的。
这就是标准机构发布的指南为何是现在这个样子的原因。把智能体当作低信任度的非人类身份来对待,听起来很官僚,直到你试着去写审计日志时才会改观。一个在夜间执行了上百个动作的智能体,需要有一份它触及过什么的记录、一条快速吊销其凭据的途径,以及一条规定哪些动作需要人工签核的规则。大多数组织这三样东西一样都没有,即便是那些已经在生产环境中运行智能体的组织也是如此。
令人不安的现实是,在这里,便利与控制朝着相反的方向拉扯。智能体能触及的系统越多,它就越有用,而一次失误能造成的破坏也越大。没有什么聪明的设置能化解这一取舍。只有一个决定:在放智能体出去之前(而不是之后)就界定某个具体工作流究竟该配多少访问权限。
编排带来了什么,又付出了什么代价
编排层的好处是实实在在的。把每个步骤路由到合适的模型,意味着一项常规步骤可以低成本运行,而一个需要判断的环节可以交给当下最强的模型处理。它还意味着把过去各自独立的工具统一到一个界面之下,而正是这一点省下了某个人的一下午。
代价则是一种新的厂商依赖。如果决定工作如何流转的那一层掌握在一家供应商手中,那么这家供应商就决定了使用哪些模型、以什么价格使用。Google 把部分工作路由给 Claude,是一个关于“选择”的好故事,但它同时也是 Google 在决定这种选择何时适用。让系统对买家而言变得灵活的那套结构,同样也让买家依赖于持有路由规则的那一方。
当某家套件厂商推销一个只能在自己的产品以及少数合作伙伴内完全运作的智能体时,这一点值得记住。互操作性很容易承诺,却很难验证,而这正是应该首先测试的东西。
团队究竟该做什么
从这些智能体中获得价值的团队,并不是那些在所有地方都开启它们的团队,而是那些挑选了一个狭窄、重复的工作流,只给智能体所需的最小权限,并记录每一个动作以供审查的团队。从失败代价低的地方开始。起草一份摘要是低风险的。给供应商付款则不是。
有三个习惯值得尽早养成。维护一份实时清单,记录存在哪些智能体、每个智能体能触及什么,因为这个数量增长得比任何人预想的都快。使用短期凭据,这样即便智能体被泄露或滥用,也无法永远行动下去。并在任何涉及资金转移、更改合同或联系公司外部人员的动作前,加上一道人工审批。
这些都不光鲜。但它也决定了一个智能体是能帮上一年的忙,还是只当一天的头条。
下一阶段的形态
这场前沿竞赛已经从“发布最强的模型”转向“交付能通过安全、成本和监管审查的系统”。Google 押注的是工作流集成才是优势所在。微软押注本地执行。OpenAI 押注可验证的推理。Anthropic 押注安全关键场景的部署。
无论哪一个赌注最终奏效,买家的问题都已经变了。它不再是“你的模型有多聪明”,而是“我能不能看到它做了什么、能不能限制它能做什么,以及能否负担得起每天运行它”。这个问题更乏味,但它决定了明年还装着哪些助手。
相关文章
Decagon 的 PACT 协议,想让「同意」成为一个标准
Decagon 开源了一个协议,用来验证个人智能体的身份,以及客户授予它的权限。这是管道工程,而它决定了智能体经济能不能跑起来。
AI「重逢」热潮:一场还没想好该如何感受的讨论
AI 致敬短片把逝去的公众人物带回中国荧幕,拿下数十万点赞。然后反弹来了,而它争论的是「同意」。
Apple 发布了一个开源多模态模型,却几乎没告诉任何人
苹果的这次「研究优先」式发布悄然越过了主流视野,但模型那种细粒度的视觉 grounding,透露了它的 AI 栈正走向哪里。
OpenCut 与「开源剪映」的那一刻
一款免费、MIT 许可的视频剪辑器持续冲上 GitHub 趋势榜,而它的路线图里包含一个面向 AI 智能体的 MCP server。围绕 AI 媒体的工具,正在追上模型本身。