← 返回博客
Ai预计阅读 11 分钟

智能体正在进入浏览器,独立应用该感到担忧了

发布于 2026年10月2日
智能体正在进入浏览器,独立应用该感到担忧了

Google 已在 Chrome 中加入了一个由 Gemini 驱动的浏览智能体,它能够自行完成多步骤任务:搜索、比价、填写表单、预订。虽然被包装成一项功能,但这其实是一场竞争事件,因为浏览器正是大量在线工作真正发生的地方,而一个栖身于浏览器之内的智能体,不需要说服任何人去安装任何东西。

这一举动延续了今年一直在累积的一种模式。OpenAI 推出的是一系列更聚焦的工具,包括一款翻译产品以及用于科研工作流的 Prism,而不是把所有事情都塞进一个通用助手。中国和西方的实验室一直在发布常驻式的开源智能体,它们会跨会话保留权限和记忆。这一切背后的问题是:智能体将栖身何处?而目前,浏览器正在默认赢得这场争论。

分发胜过能力

独立智能体应用面临一个与模型质量无关的难题:用户必须决定去打开它。每一项任务都始于一次选择,而一个需要做决定才能使用的工具,其使用频率必然低于一个本来就在那里的工具。嵌入浏览器的智能体则把这一点反转过来。用户工作时,它已经处于打开状态,而「想做某件事」与「事情被做完」之间的距离,被压缩成了一句提示词。

Google 在这里的杠杆,与当年让 Chrome 成为其他一切事物平台的那根杠杆是同一根。公司可以在无需下载的情况下,把一项能力推送给一个极其庞大的已装机用户群,并且可以利用它已经看到的浏览行为来改进智能体。对于一个销售独立智能体的初创公司来说,这是一个很难应对的对比。你可能拥有更好的模型,却仍然输给那个只需按一下键就能调出的对手。

反方观点是:嵌入式智能体会受限于它所栖身的界面。浏览器智能体擅长发生在浏览器标签页内的任务,而对于跨越设备、文件或消息的任务则显得笨拙。这是一个真实的限制,也正是独立智能体仍保有优势的地方。问题在于,大多数人的任务恰恰发生在浏览器标签页里,所以这份优势只适用于少数使用场景。

权限问题只会变得更糟,而非更好

嵌入智能体还会放大持久访问权限所带来的风险。今年获得关注的常驻式开源智能体,其显著特点就是在跨会话时保留权限和记忆——这既是它们有用的原因,也是它们危险的原因。一个能够读取你的邮件、查看你的日历并在网页上执行操作的智能体,距离做出你并不打算做的事,只差一次判断失误的指令,而这种错误很难撤销。

时间点上有一个耐人寻味的细节。Google 的新前沿模型 Gemini 4 Argon 首先只向一小批受信任的测试者开放,原因之一在于:一个能够发现并修补漏洞的模型,同样能够替错误的人发现漏洞。同样的逻辑也适用于消费端,只是规模更小。一个能够代替用户浏览、输入和点击的智能体,必须具备「停下来」的能力,而停下来这件事必须足够廉价。

Airbnb 的 Brian Chesky 公开表达了这一观点,他说聊天机器人并不是旅行发现、浏览或购物的最终界面。人们想要探索、比较、给房东发消息、看地图、验证身份并一起做规划,而这些大多数都装不进一个聊天窗口。他的结论是:应用将变成供外部智能体调用的数据层和行动层,Airbnb 可能会通过一个更强的 SDK 来开放其能力,并最终让其自有智能体通过 MCP 实现互操作。

这是一个与浏览器智能体不同的赌注,值得认真对待。如果 Chesky 是对的,那么获胜的平台不会是聊天机器人最吸引人的那一个,而是工具界面最清晰、最安全的那一个,因为那才是其他智能体愿意调用的东西。一个允许外部智能体在明确定义的权限下预订、取消和修改的平台,无需拥有对话本身就能收获分发。

浏览器是一道护城河,而这是把双刃剑

Chrome 的优势正是多年来让监管机构忧心忡忡的那一点:它是一个规模庞大的分发渠道。但帮助 Google 推送智能体的这份集中度,同时也让浏览器成为所有在其上构建者的单点故障。如果浏览智能体的行为、权限和条款随着浏览器更新而变化,每一个预设界面稳定的产品都必须随之调整。在别人的浏览器里构建产品,在它不便利之前都很便利——而做了这个赌注的初创公司,如今正暴露在一条它无法影响的路线图之下。

这种不对称值得点明,因为它塑造着战略。独立智能体应用要在争取注意力上逆流而上,但掌握着自己的命运。嵌入浏览器的智能体在分发上胜出,却坐在租来的地面上。Chesky 所指的 MCP 路线,正是试图同时避开这两个问题:把能力作为任何智能体都能调用的服务开放出来,让集成发生在你不必拥有的地方。它究竟会变成真正的第三条路,还是只是一个所有人都名义上支持、却没人真正投入的标准,目前仍是未知数。

最后一个变量是信任。一个在开放网络上代表个人行事的智能体,只有当这个人愿意让它这么做时才有用。这种意愿很脆弱,而且是一次一个安全的决定累积起来的。一个悄然订错航班或点错按钮的浏览器智能体,会让整个品类倒退。相比之下,服务之间相互竞争的那种分布式、带权限的模型,对个体失败会更有韧性,因为某一次集成中的单个坏角色,不会拖垮整个构想。

关于智能体栖身何处的两种理论

于是桌面上摆着两种看似合理的未来。在一种里,智能体嵌入人们已经在使用的界面中,浏览器、操作系统和消息应用成为前门。在另一种里,智能体是可互操作的服务,平台比拼的是其工具界面的质量,而不是其界面本身。两者可以同时成立,而且很可能确实会同时成立。

两种理论都认同的一点是:那种要求你打开它、并在聊天框里跟你对话的独立智能体应用,处于最弱的位置。它既不是工作发生之处的原住民,也不是供其他智能体调用的干净服务。今年守住阵地的那些产品,要么做到了聊天窗口做不到的事,要么接入了一个已有触达能力的界面。

对任何在这个领域做产品的人,务实的建议是:不要再把聊天界面当作产品本身。想清楚你是哪块界面的原住民,或者你开放的是哪套工具界面。然后让权限变得清晰易懂,因为正是这一点决定了一个平台是否让你进场。一个能力尚可但权限模型清晰的智能体,能够嵌入到一个能力更强却权限模糊的智能体永远进不去的地方。

Chrome 的自动浏览智能体并不是竞争的终点,而是竞争转移到 Google 主场的那一刻——而在主场击败某人,是件很难的事。独立智能体应用只剩下到下一轮浏览器更新之前的时间,去找出一个标签页无法复制的存在理由。

相关文章