← 返回博客
News预计阅读 9 分钟

你的 AI 代理正在致电客户支持,企业必须回应

发布于 2026年10月4日
你的 AI 代理正在致电客户支持,企业必须回应

在 10 月 1 日举办的 Decagon Dialogues 活动上,Decagon 发布了四款产品,瞄准一个大多数公司尚未开始规划的问题:当电话另一端不是真人,而是别人的 AI 代理时,会发生什么。

这四款发布分别是:搭载全新语音模型 Chord 的 Voice 3、附带配套授权协议的 Personal Agent Gateway、Agent Modules,以及名为 Duet Apprentice 的测试版。前两款最为重要,因为它们共同描述了正在变得司空见惯的对话的两端。

语音模型跨过了真人门槛

Chord 是 Decagon 首个自研语音模型,专门针对客户对话而非通用语音进行后训练。该公司对三组录音进行了盲测,每组都将一个真人与通过 Chord 运行的相同声音配对。平均而言,约 90% 的听众无法分辨哪一个是真人。

一间黑暗隔音录音棚内的录音室电容麦克风

Chord 工作方式中的两个细节比那个头条数字更有价值。该模型逐句塑造语音,在播报电话号码和确认码时放慢速度,然后恢复到对话语速。它运行在双工架构上,两层并行运作:低延迟模型负责倾听和说话,而更重的模型则在对话背后管理推理、工具调用和护栏。

这种设计体现在行为上。代理在仍在说话时处理传入音频,因此它可以在随意的“嗯哼”中继续讲下去,然后在真正被打断时让出话轮,而不是盖过来电者说话或陷入沉默。它可以在长任务期间叙述进展,并在进行中接住后续问题,而不是让来电者等待。

Decagon 表示,Chord 基于授权数据和已同意的配音人才训练,绝不使用客户拥有的数据。Voice 3 支持 70 多种语言,可检测来电者的语言,并自动切换,即使来电者在句子中间切换语言也能应对;每种语言在发布前都由母语者验证。

更棘手的问题是另一个代理

如今,一副好的合成嗓音已是基本门槛。更有趣的发布是 Personal Agent Gateway,Decagon 构建它的原因在其公告中已说明:在活动前一个月,Meta 推出了 Muse,OpenAI 推出了 dots,Instinct 开始为用户拨打电话。这些个人代理代表其所有者预订、购买、取消和谈判,并且已经在联系客户支持。

这打破了每个支持系统所基于的一个假设。提出请求的一方不一定是账户所有者,也可能不是有权批准变更的一方。

该网关通过两个部分解决这一问题。个人代理检测会在聊天和语音中标记可能的个人代理,利用来自企业和平台的信号,每家企业决定接下来发生什么以及这些代理可以访问什么。随后,一个专用的个人代理渠道与聊天、电子邮件和语音并列,配有单独的 Agent Operating Procedures,因此同一请求会根据提问者是人还是代理而遵循不同的工作流。

权限位于这些流程内部。企业定义代理可以请求哪些范围,以及工作流的哪些部分需要每个范围;缺少匹配权限的代理永远不会看到某个部分。Decagon 举的例子是一家航空公司:旅行者的个人代理请求查看和改签航班的权限,而旅行者只批准查看。代理获得行程,但没有更改行程的能力。

该协议就是 Decagon 所称的 PACT,其目的虽然狭窄,却至关重要。它让企业能够验证代理代表谁,以及那个人实际授权了什么;这是支持系统在代表某人做任何事之前必须回答的问题。

为什么这首先落在客服身上

Decagon 的客户最初使用其代理解决支持工单,而该公司表示,这些代理现在还能筛选潜在客户、引导客户入门、收取付款并发展关系。这种扩展正是个人代理问题变得紧迫而非理论化的原因。回答问题的同一个代理也可以更改订单,而这两种行为的风险状况并不相同。

德国电信数字服务传播负责人 Christian Niedworok 在该公司的公告中直白地描述了 Voice 3 的体验:这个声音听起来像是在倾听,并且让对话持续推进,而不是在处理时陷入沉默。这描述的是延迟和话轮转换,而这正是让旧式语音代理感觉机械的原因。

另外两款发布指向同一方向

Agent Modules 和 Duet Apprentice 测试版填补了运营侧。Modules 将定义好的能力打包,企业可以针对特定任务开启,这区分了通用助手与可以指向某个队列的东西。Duet Apprentice 从公司自己的维基和过去的升级案例中学习,并将这些知识保留在客户的工作区内,因此代理是基于组织自己的材料而非共享池来改进。

这两款发布都不如语音演示那样生动。它们重要的原因与网关相同。大规模部署代理的公司正在超越模型能做什么的问题,转向某个特定代理在真实工作流中被允许知道什么、说什么和改变什么的问题。

为什么语音门槛只是容易的部分

值得注意的是,90% 这个数字很快就将不再是重点。对于像支持通话这样狭窄且定义明确的任务,合成声音与真人无法区分如今已是一个已解决的问题,尚未推出此类产品的供应商很快就会推出。

仍在移动的门槛是授权。Decagon 自己的表述说明了这一点:进行预订、购买、取消和谈判的个人代理已经在联系支持,而接到这些电话的企业没有既定方式来核查代理代表谁。未经授权的请求配上完美的声音,比已验证请求配上笨拙的声音更糟糕。

这就是为什么塑造明年支持工具的是网关,而不是语音模型。这也是为什么 PACT 协议比其有限范围所暗示的更重要。当请求方是软件时,必须有人定义授权证明是什么样子,而第一个可信的定义往往会成为默认。

企业现在应该决定什么

这一转变令人不安之处在于,它迫使公司面对大多数公司一直推迟的决定:自动来电者被允许做什么,以及你如何证明它得到了授权。

在请求到来之前,有三个问题值得回答。你的系统能区分代理和真人吗?这对每个工作流都重要吗?对于你最常见的请求,个人代理需要的最小权限集是什么?当代理代表某人行事时,你会保留什么样的授权记录,谁可以检查它?

这些都不是模型问题。它们是政策问题,而正是这些问题将决定你的支持系统把传入的代理视为客户、威胁,还是系统没有类别可归的东西。Decagon 已经交付了管道。定义仍取决于另一端的各个企业。

相关文章