← 返回博客
Ai预计阅读 9 分钟

阿里巴巴将语音智能体一分为二,随后最高降价 95%

发布于 2026年10月2日
阿里巴巴将语音智能体一分为二,随后最高降价 95%

阿里巴巴的 Qwen 团队在 2026 年 9 月最后一周发布了 Qwen-Audio-3.1,这是一个包含五个模型的音频栈,覆盖语音识别、文本转语音和实时交互。传播最快的数字是降价:实时模型大约降 85%,文本转语音约降 70%,自动语音识别最高降 95%。

这些数字很重要,因为它们出现在整个行业都在降价的一周里。微软、OpenAI 和 Anthropic 都在同一时间段发布了更便宜或重新平衡的模型,而阿里巴巴此举看起来是在音频领域刻意升级竞争。但 Qwen-Audio-3.1 更有趣的地方不是折扣,而是旗舰模型是如何构建的。

一个声音背后,是两个模型

领衔的模型是 Qwen-Audio-3.1-Realtime,一个全双工语音系统,专为需要在对话中途调用工具的语音智能体打造。

它的核心设计决策是一种拆分。Qwen 没有采用一个大型端到端系统来同时听和说,而是运行两个模型,并共享音频编码器和大语言模型骨干。一个决策模型预测是继续听、开始说、停止,还是恢复。另一个独立的生成模型负责实际语音。用大白话说,一个模型决定何时说话,另一个决定说什么。

这种拆分是对一个具体失败模式的务实回应。语音智能体最常让人觉得失灵,并不是因为它们误解了你,而是因为它们误判了时机。它们会抢话、陷入沉默,或者在你还没说完时就回答。以往的处理方式通常是把轮流发言机制硬接到一个更大的模型上,然后指望行为自然涌现。Qwen 则把“何时说话”当作一个独立的工程问题,用专门的模型来处理,与内容生成分开。该公司报告称,在一项基准测试中,针对错误说话人的回复从 0.13 降至 0.03;在另一项测试中,填充词率从 0.759 降至 0.296。它还报告了一项取舍:打断后不期望的恢复发言比例从 0.035 升至 0.130。这种披露是发布说明中很少会包含的。

该模型以托管 API 形式提供。Qwen-Audio-3.1-Realtime-Plus 通过 WebSocket 在 QwenCloud 上运行。它没有开放权重,这对任何关注 Qwen 开放图像工作的人来说都很重要,因为音频栈正作为一个封闭的托管产品来运营。

规格与定价

实时端点将文本和音频都列为输入和输出。上下文最高支持 262K token,最大输入 245K,最大输出 16K。默认吞吐限制为每分钟 60 次请求和 100,000 个 token。定价为每百万音频输入 token 6.4 美元,每百万文本输入 token 0.8 美元;文本与音频合并输出为每百万 24 美元,而输出文本完全不计费。函数调用、网页搜索、结构化输出、上下文缓存和微调均已内置。

配套模型 Qwen-Audio-3.1-ASR-Flash-Filetrans 面向长音频的离线转写。它支持热词、说话人分离、标点,以及多语言加中文方言的识别,每百万 token 输入 0.15 美元、输出 0.47 美元。对于任何曾为大规模长篇转写询过价的人来说,这都是一项曾经固定成本的大幅下降。

训练故事分为三层,Qwen 将其标记为 Think、Act 和 Speak。Think 层使用百万小时规模的配对数据,将音频模型重新锚定到源文本模型,然后应用同策略蒸馏,而不是模仿预先写好的答案。Act 层构建可执行环境,每个环境都捆绑一个工具池、一个有状态数据库和一份书面业务策略,任务首先按终止状态评分。Speak 层决定是否说话、何时说话以及如何说话。

Act 层中的细节最值得停下来想一想。评分先检查最终状态,再检查措辞,因此一个流畅的回复无法挽救一个失败的动作。对于本应做某件事、而不是聊某件事的智能体来说,这才是正确的评分方式。

为什么价格战才是真正的故事

抛开架构不谈,Qwen-Audio-3.1 是一步清晰的战略举措:阿里巴巴是在语音基础设施的成本和延迟上与 OpenAI 和谷歌赛跑,而不是在开放性上竞争。

让这一点更易理解的对比是延迟。Qwen 报告称,打断停止延迟约为 1.116 秒,而 GPT-Realtime-2 为 0.383 秒。当用户打断时停止更慢,是一个明显的弱点;而 Qwen 把它和胜绩一起公布,也说明了音频领域评测文化的现状:诚实的数字仍然是一种差异化优势。

对于构建者来说,实际影响是后端更便宜了。如果实时语音便宜 85%,识别最高便宜 95%,那么过去只留给高级套餐的语音功能,在普通产品中也将变得可行。始终在线的聆听、实时翻译,以及面向智能体的语音界面,都位于这条成本曲线的下游。当一分钟语音的成本骤降,上一季度还负担不起的产品决策,这一季度就会变得显而易见。

需要注意的是,这一点适用于每一个托管 API。你得到的是行为表现,而不是内部实现。你无法检查轮流发言模型,无法以完全可控的方式用自己的数据微调决策逻辑,也无法在自己的硬件上运行这个栈。对大多数初创公司来说,这是可以接受的取舍。对于任何正在构建以延迟特征或数据路径为产品本身的东西的人来说,这是一个值得计入成本的依赖项。

竞争背景让这一点更加鲜明。在 9 月的同一时间段,OpenAI 和 Anthropic 都发布了围绕以更低成本做更多工作的模型,微软则在其自研产品线中增加了一个流式转写模型和两个文本转语音模型。音频不再是一个小实验室可以在无人注意的情况下做到最好的安静角落。这是一个最大玩家们公开在价格和延迟上竞争的品类,对买家是好消息,对任何为语音收取溢价的人来说则是挤压。

值得关注什么

显而易见的问题是,Qwen 最终是否会开源这个技术栈的任何部分,以及这种双模型设计在真实的多轮工具调用负载下,而非基准测试条件下,表现如何。将轮流发言与内容生成拆分开来,在纸面上很优雅。当用户打断、改变主意,并在句子中途切换任务时,它是否仍然优雅,则是演示无法回答的那类问题。

就目前而言,结论更窄也更清晰。阿里巴巴把语音智能体中最让人觉得失灵的部分拿出来,给它命名,并为它配备了一个专门的模型。然后它降价,直到整个品类都变得更便宜。如果未来一年的语音产品都建立在更便宜、更可打断的语音之上,那么这次发布看起来会是原因之一。

相关文章