AssemblyAI 将实时语音延迟降至 91 毫秒。这个数字为何重要

AssemblyAI 发布了 Universal 3.6 Pro Realtime,这是其全新的流式语音识别模型。词错率降至 1.77%。在超过 1,000 段通话录音的测试中,从说话结束到最终文本输出的中位延迟为 91 毫秒。P95 延迟从 692 毫秒降至 225 毫秒。
这些看起来像是一项成熟技术上的渐进式改进。但考虑到那个发生变化的具体数字,它们更接近一次临界点事件。
为什么 91 毫秒意味着一个不同的产品
多年来,语音识别在听写场景下的准确率已经足够。限制对话式应用从来不是词错率,而是轮次转换。
人类对话依赖快速的交叠。一位说话者说完到下一位开始之间的中位间隔约为 200 毫秒,而在熟悉的对话中这个间隔会缩小,在争论中则进一步缩小。这就是任何对话系统必须容纳的时间预算。
在 P95 延迟为 692 毫秒时,语音智能体明显慢一拍。用户会去适应(他们会停顿、会重复、会抢话),交互也随之带上一种略显生硬的质感,所有人都能认出这是在跟机器说话。当 P95 为 225 毫秒时,智能体已落在人类经过思考后的回应区间内。而当中位数为 91 毫秒时,它比大多数人更快。
这就是“能当演示”的语音智能体与“能当产品”的语音智能体之间的差别。而且这一提升远不止两倍,因为分布与中位数同样重要。把 P95 从 692 毫秒降到 225 毫秒,意味着长尾(那些让对话显得支离破碎的响应)基本被消除了。
由此带来一个设计层面的后果,而它常被忽视。当识别很慢时,产品团队会用更长的轮次来补偿:智能体会等待明确的停顿,用完整的段落说话,完全避免与用户重叠。这些补偿造就了一种特定的对话风格,即便用词自然,用户也会认出它是机器人。
当识别很快时,智能体可以使用短轮次。它可以在用户还在说话时就给予回应,可以在歧义出现的那一刻、而不是等句子结束之后,插一句澄清性提问。这种对话风格只有在延迟预算允许之后才成为可能,这意味着延迟的改善解锁的是另一种交互设计,而不只是让现有设计体验更好。
此次发布还包含什么
该模型集成了实体感知的轮次检测:它能判断像电话号码或地址这样的已识别实体何时完整,而不是把标点附近的静音当作轮次结束。它还加入了背景噪声校正。
这两项功能指向同一个问题:生产环境的语音场景是嘈杂的。呼叫中心的音频里有等候音乐、键盘声、串音和口音。依赖简单静音阈值的轮次检测,会在说话者停下来思考时把话截断,也会在听起来像人声的噪声中一直保持线路开启。
实体感知检测针对的是一类具体且代价高昂的错误:把“我的号码是五五五”当作一个完整轮次的系统,会针对半截句子生成回应,用户只好从头再来。在一通电话里,这些重来就是两分钟交互与六分钟交互之间的差别。
这在智能体技术栈中的位置
时机并非巧合。就在同一周,Decagon 发布了 Voice 3 以及一个名为 PACT 的框架,目标是让客户支持为“来电者本身就是智能体”做好准备。Anthropic 一直在搭建网络验证层级。OpenAI 开放了 decisions API。智能体基础设施层正同时在各个方向上铺开,而语音是延迟预算最紧的那个界面。
语音为什么最紧:文本智能体可以慢。用户在聊天窗口里输入时,能容忍数秒的思考时间,因为这种交互模式本身就包含等待。电话里的用户则不能。超过一秒的静默会被理解为断线,用户会在系统还没处理完时就问“喂?”
这种不对称意味着,实时语音识别不是语音产品众多组件中的一个,它为产品能成为什么设定了上限。一个推理出色但识别延迟为 700 毫秒的语音智能体,就是一个慢的语音智能体,无论推理多好——因为推理永远没机会在一个干净的轮次上运行。
1.77% 的错误率代价是什么
词错率这个数字需要背景。在干净的朗读语音上,顶级模型低于 3% 已经有一段时间了。而在包含人名、账号和地址的嘈杂呼叫中心音频上,错误率历来要高得多,也正是这里,实体准确率比整体词错率更重要。
在厂商测试集上的 1.77% 错误率,并不能告诉你它在你的音频上表现如何。对采购真正重要的细节更窄:专有名词上的准确率、字母数字字符串(账号、确认码)上的准确率,以及当说话者不是被识别语言母语者时的准确率。
最后一项正是大多数生产系统失败、而大多数基准测试不去衡量的地方。口音差异产生的是系统性错误,而非随机错误;一个始终把“fifteen”听成“fifty”的识别器,不会因为取平均而被修正。AssemblyAI 的实体感知轮次检测有助于缓解下游后果,但口音语音上的转写准确率是一项独立的评估。
实际的解读
对任何做语音的人来说,这次发布改变了什么值得尝试。以对话级延迟运行的流式识别,意味着产品可以处理打断、快速往返,以及真实对话中那些重叠的轮次。那些此前技术上可行、但用起来感觉不对的应用,现在值得去做。
成本维度与延迟同样重要。这个量级的流式识别必须在通话期间持续运行,这意味着算力账单随对话时长而非转写音频时长增长。对于高并发部署,这会改变单位经济模型;在敲定一个假设“始终开启识别”的架构之前,值得先做建模。
有三件事应当测试而非假定。一是 P99 而非 P95 的延迟,因为用户记住的是最差的那 1% 轮次。二是你自己的音频上的准确率,而非厂商的基准测试集,尤其要关注人名和数字。三是打断情况下的表现,因为一个能处理干净轮次转换、却在用户抢话时卡住的系统,恰恰会在语音最重要的那些对话中失败。
还有第四项测试,大多数评估都会跳过:识别出错时会发生什么。每一个识别器都会听错,而语音产品的质量在很大程度上取决于它如何恢复——它是请求澄清,还是默默按错误转写继续,还是能识别出某串词在上下文中不合常理并要求重说。一个错误率为 1.77% 却从不察觉自身错误的模型,在实践中不如一个错误率更高但具备良好不确定性信号的模型。
更大的转变在于,语音不再是过去的瓶颈。对 2026 年末的语音产品团队而言,问题是技术栈的其余部分(推理、动作执行、错误恢复)是否足够快,能跟上一个如今以人类速度工作的“耳朵”。