ElevenLabs 解决了语音难题,随后抬高了“被听见”的代价

9月28日,ElevenLabs 发布了两款语音模型。Eleven v4 面向旁白叙述与预先准备好的对白;Eleven v4 Turbo 面向实时对话,推理延迟中位数接近100毫秒,首段语音输出约150毫秒。两天后,公司完成了一轮员工要约收购,估值达到220亿美元,是2月110亿美元估值标记的两倍。
这两条公告其实是同一条。当语音模型快到让人不再察觉延迟,剩下的问题就是谁听起来更像真人,而这是一个附带价格标签的产品问题。
延迟是最后一块技术挡箭牌
多年来,语音智能体一直存在一个顽固的失效模式:字句都对,节奏却不对。多出半拍的停顿,就能把一个有用的助手变成用户直接挂断的对象,而过去解决办法无非是加硬件或把句子缩短。Turbo 的数据已低于人类能察觉的阈值。约100毫秒大致相当于正常对话中一次换气的长度,这意味着延迟不再被理解为机器在思考,而开始被理解为人在斟酌。
新架构还支持超过90种语言,高于 v3 的70多种,其中有一个比数量更重要的细节:用英语录音克隆出的声音说日语时,会带自然的日语口音,而不是把源语言的口音一起拖过去。希望在多个市场本地化同一位代言人的品牌,能得到更干净的结果;而依赖角色口音的小说创作,则需要刻意做出选择,而非接受默认设定。
请求现在最多可接受10,000个字符,是此前上限的两倍。诸如 [laughs]、[whispers]、[said angrily] 之类的内联表达标签依然有效,并且可以叠加使用。即时声音克隆仍然只需约10秒音频。
从70多种语言跳到90多种,幅度其实小于克隆声音跨语言表现力的提升幅度。如今,一段录音就能为一个产品在十几个市场站台,而各个版本不会听起来像同一个人在费力模仿当地口音。对于只本地化一位代言人的公司来说,这省去了过去每种语言都要再录一次音的环节。
表现力才是赚钱的地方
Artificial Analysis 将 v4 的表现力评为第一,ElevenLabs 也表示在盲测中约有75%的听众更偏爱它。这两个数字都来自该公司或其合作伙伴,因此在有人复现测试之前,不妨把它们当作营销说辞。但方向依然有说服力。如今每家主要实验室都能生成清晰可懂的语音,差异化已经转移到:语音能否在一段长录音中持续承载语调、节奏和可辨识的人格,而不会在章节之间发生音色漂移。
商业图景从另一个角度说明了同一件事。对话智能体平台 ElevenAgents 现在贡献了 ElevenLabs 收入的55%。语音的主要卖点已不是有声书旁白,而是会说话的软件的交互层。
这一转变解释了其定价结构。通过 API 使用 Eleven v4 的价格为每1,000字符0.08美元,Turbo 为0.04美元。两者在10月12日前均有折扣,分别降至0.022美元和0.011美元。做预算时要以标准价为准,因为首发折扣是临时的,而反复修正还会增加字符数。Turbo 还有一处容易被忽略的具体限制:文本转对话 WebSocket 在 v4 上每条连接最多可接受十个已注册声音,而在 Turbo 上只能接受一个。
市场其他玩家并未原地踏步
把语音当作智能体交互层的,并非只有 ElevenLabs。9月30日,Inception Labs 推出 Mercury Voice,这是一款专为低延迟语音智能体打造的扩散语言模型,首个回答 token 的中位耗时320毫秒,发布时定价约为每分钟对话0.9美分。Suno 发布了测试版语音模型。Vercel 将微软的音频模型接入其 AI Gateway,并承诺零数据留存。
两种路线的差异在于把难点放在哪里。ElevenLabs 把语音合成当作产品本体,语言模型另行处理;Inception 则把语言模型纳入延迟预算,认为如果背后的模型要花两秒思考,再快的合成层也无济于事。两者逻辑都自洽,也会持续碰撞,因为用户体验语音智能体时,根本分不清是哪个环节慢了。
令人不安的部分
声音克隆受到强制性的本人身份验证和过滤机制的保护,后者会拦截未经授权克隆知名公众人物的行为。这是一个合理的底线,但不是解决方案。如今10秒样本就足以做出高保真克隆,而手上有别人10秒音频的人,实际上就是所有人。
还有一个任何过滤器都解决不了的二阶问题。随着表现力更强的模型越来越擅长模仿某个具体的人,声音作为验证信号的价值随之崩塌。声纹过去是弱证据,如今几乎等于没有证据。过去两年,那些把身份核验建立在“我们能识别客户的声音”之上的银行和呼叫中心,一直在悄悄放弃这一假设,而这次发布让这种放弃显得早该发生。
延迟数字的适用范围也比听起来更窄。它是在 ElevenLabs 自家的基准测试协议下测得的,且已剔除网络延迟。真实场景中的助手仍需识别请求、决定回答,并通过网络传输。Turbo 只是从一条本就有多个延迟来源的链条中去掉了一个。

这一估值真正说明了什么
八个月内估值翻倍,而且是靠3亿美元的二级市场交易而非新的一级资本,这既是对留存率的一次表态,也是对一个尚未商品化的品类的一次表态。语音模型是罕见的 AI 产品:用户能立刻察觉质量差异,并会为此转换平台。超大规模云厂商和专业竞争对手都在出货,质量差距一直在收窄。
220亿美元这个数字背后的赌注是:这一差距能维持得足够宽,从而支撑收费;而智能体平台的增长速度能持续快于原始合成价格的下跌速度。Turbo 在首发期降到每1,000字符0.011美元,说明这个赌注的后半部分更难成立。当一段声音的边际成本趋近于零,你还能卖出去的,就是别人没有的那种声音。
语音公司能撑起这样的估值,而图像和视频公司却举步维艰,还有一个结构性原因。语音智能体是持续运行的,出现在每一次通话、每一个会话中,因此用量随产品的成功而扩展,而不是随着一次性生成而波动。旁白与智能体有着不同的经济模型:前者是一个项目,后者是一台永不停歇的计量表。ElevenLabs 一直在朝后者构建,55%的收入占比说明这一策略奏效了。而明年将要回答的问题是:质量优势能否维持得足够久,让这台计量表继续转下去。
公司自己的表述也指向同一方向。发布材料主打的是表现力,而不是准确度或速度,因为后两者在几个版本之前就已不再是差异化因素。语音智能体要让人感到真实,就必须在长达四十分钟的会话中承载犹豫、强调和一致的身份,这比生成一段干净的段落要难得多。胜出的模型未必是每字符最便宜的那个,而是其输出让人无法与自己此前交谈过的人区分开来的那个——而这条标准每被跨过一次,就会再抬高一次。