← 返回博客
Ai预计阅读 10 分钟

两款语音模型刚刚重设标杆:首段音频 50 毫秒,以及一个跑在笔记本 CPU 上的 99M 模型

发布于 2026年10月6日
两款语音模型刚刚重设标杆:首段音频 50 毫秒,以及一个跑在笔记本 CPU 上的 99M 模型

同一周内发布的两个语音合成成果,从相反的方向指向同一个结论。一个把延迟推进到人类几乎无法察觉的极限,另一个把体积压缩到笔记本内存能够容纳的程度。放在一起看,它们标记出文本转语音这场竞赛的焦点,已经从“听起来像真人”迅速转向“能装进某个具体的场景”。

第一个来自 Gradium,这家语音初创公司发布了一款文本转语音(TTS)模型,首段音频延迟约为 50 毫秒。该公司称这是前沿 TTS 模型中最低的延迟。第二个是 Supertonic,一个拥有 9900 万参数的开源模型,可在笔记本 CPU 上本地运行,不到一秒即可生成录音棚级音质;在该公司的测试中,它能正确读出电话号码等难处理的文本,而面对同样的输入,ElevenLabs、OpenAI 和 Gemini TTS 都失败了。

为什么“首段音频延迟”才是关键指标

对语音助手而言,真正重要的数字是第一个声音传到用户耳中需要多久,而不是整段音频渲染完要多久。一个开口前先停顿三分之一的会话式智能体,就已经让人觉得迟钝;而能做到 50 毫秒的,则能保持日常对话的节奏。正因如此,前沿模型的定价档位、实时语音模型中的打断处理,以及各家宣称的延迟数字,全都聚集在同样那零点几秒的区间里。

一个半透明的玻璃球置于深色镜面上,周围环绕着同心光环

更小的模型更容易进入这个区间,这也是老实的取舍。一个能在 CPU 上运行的 9900 万参数模型,放弃了前沿云端模型的表现力,换来的是后者给不了的东西:没有网络往返、没有按次调用成本、音频不离开设备,以及在一台本来就摆在桌上的机器上可预期的表现。

难读文本本质上是词典问题

Supertonic 关于电话号码的结果,指向一个更容易被忽视的失败点。合成模型处理普通句子游刃有余,却会在那些读法取决于上下文或惯例的字符串上绊倒。电话号码、产品名、地址和缩写经常被读得乱七八糟,这正是它们成为演示中经典翻车案例的原因。

第三个发布则从另一个角度切入。Onepin 把自己定位为合成之后的质检环节,而不是一个模型。它会把每一行生成的内容与一个约四百万词的发音词典(涵盖人名和产品名)进行比对,为自然度和准确度打分,并在不重新生成整行的前提下修正某个读错的词。对于制作长音频的团队来说,能修一个词而不是重渲一段五分钟的音频,是成本曲线上的实质性改变。

词典式做法还把原本混在一起的两项工作分开了。模型负责韵律、情感和流畅度;检查器负责那批有限的专有名词——通用模型从来就不可能稳定地读出它们。这种分工比一个只好一点点的编码器有用得多。

第四个模型展示了流式处理的门槛

Sopro V2 Turbo 是一个 120M 参数的模型,正在准备一个针对克隆音色粗糙感与断音的构建版本。它宣称在笔记本 CPU 上首段音频约 300 毫秒、真正的流式输出、采用 Apache 2.0 许可,并覆盖英语、欧洲葡萄牙语、法语和德语。其作者坦承,细弱或卡通化的音色、含噪的参考音频,以及某些分布外的说话人仍会失败,并且一直在收集这些案例。

把这四个放在一起看,前沿已经分成了几条不同的赛道。云端模型继续推进表现力和多语言覆盖;小模型占据端侧赛道,在那里,延迟、隐私和零边际成本比最后几个百分点的自然度更重要;而一个中间层正在浮现,用来兜住两条赛道各自都处理不好的错误。

下定决心前该测什么

这个品类里的延迟和体积数据几乎全由厂商自行报告,所以真正实用的测试就是用你自己的输入。拿你实际需要的文本去跑模型,包括那些让演示翻车的名称和数字。在你真正要部署的硬件上测首段音频时间,而不是在厂商的基准测试机器上测。还要确认许可证是否允许你设想的部署方式——对本地模型来说,许可证往往才是决定性的约束。

这几款发布的共同模式,和一年前的图像模型如出一辙:质量趋同之后,竞争转向模型跑在哪里、启动有多快、每次调用要多少钱。语音现在正处于这个阶段。听起来最好的模型,不如那个在用户察觉到停顿之前就已经开口的模型重要。

前沿语音模型把目光投向了别处

延迟竞赛的同时还有另一股推力,两者常被混为一谈。前沿实时模型——比如那些可以被中途打断、能在对话中调用工具、具备推理能力的语音系统——追求的是让对话感觉像在和人打电话。这需要理解意图、判断何时开口,以及应对被打断,这些问题与单纯的合成速度处在不同的难度轴上。

不过对大多数应用来说,那种高级的对话层是杀鸡用牛刀。一段视频的旁白、一段产品讲解,或一个睡前故事,需要的是发音准确、多次录制之间风格一致,以及可预测的成本。这些需求由一个小而快的模型来满足,比接了一个聊天循环的前沿系统更合适。这也是为什么端侧合成正在成为预录音频的默认选择,而云端仍然是实时对话的主场。

还有一条监管线索在拉扯同一片领域。让听众和平台能够分辨合成音频,正在成为越来越多司法辖区的要求,语音克隆也招来了自己的一波法院裁决。一个从不上传样本的本地模型可以绕开部分此类风险,而一个克隆声音的云端模型则会继承这些风险。对于要上线语音功能的团队而言,“合成在哪里运行”正在既是一个延迟决策,也是一个合规决策。

一份实用清单

用你自己的脚本测试候选模型,而不是厂商的演示文本,并把那些会让通用模型翻车的名称、缩写和数字都加进去。在你实际要使用的硬件上测首段音频时间,因为笔记本 CPU 的结果和数据中心的结果不可比。确认许可证覆盖商业用途以及你想要的部署形态,因为对开源模型来说,许可证往往就是决定选择的那条约束。还要尽早决定你是否需要在合成之后加一道质检——一个能把 95% 的词读对的模型,仍然会在对你客户至关重要的那个品牌名上栽跟头。

这四款发布单独来看都不是什么突破。放在一起读,它们展现的是一个已经不再争论合成语音是否逼真、转而按制作团队真正在意的标准进行竞争的领域:多快、多小、多便宜。这正是一个工具成熟起来的样子。

相关文章