ElevenLabs 解決了語音問題,接著調高了「被聽見」的價格

9 月 28 日,ElevenLabs 發布了兩款語音模型。Eleven v4 為旁白與預先寫好的對話而打造,Eleven v4 Turbo 則為即時對話設計,推論延遲中位數接近 100 毫秒,首次出聲約需 150 毫秒。兩天後,該公司完成一項員工要約收購(tender offer),估值達 220 億美元,是 2 月 110 億美元估值的兩倍。
這兩則公告其實是同一則公告。當語音模型快到讓人們不再察覺延遲,剩下的問題就是誰聽起來像真人,而這是一個帶有價格標籤的產品問題。
延遲是最後一個技術藉口
多年來,語音代理一直有個難以擺脫的失效模式:字詞正確,節奏卻不對。一個多拖了一拍的停頓,就能把有用的助理變成使用者直接掛斷的對象,而過去的解法永遠是更多硬體,或是更短的句子。Turbo 的數字落在人類可察覺的門檻之下。約 100 毫秒大約就是正常對話停頓的長度,這意味著延遲不再被解讀成機器在思考,而是開始被解讀成一個人在斟酌。
新架構也支援超過 90 種語言,高於 v3 的 70 多種,而其中有一個細節比數字本身更重要。從英文錄音複製而來的聲音,說日文時會帶著自然的日語腔調,而不是把原本的腔調一起拖過去。想讓同一位代言人跨市場在地化的品牌,能得到更乾淨的成果;而依賴角色腔調的虛構作品,則需要刻意做出選擇,而不是套用預設值。
現在每次請求最多可接受 10,000 個字元,是先前上限的兩倍。像是 [laughs]、[whispers]、[said angrily] 這類行內語氣標籤仍然可用,而且可以疊加使用。即時聲音複製(Instant Voice Clones)仍需要約 10 秒的音訊。
從 70 多種語言躍升到超過 90 種,幅度其實小於「複製聲音如何跨語言傳遞」這件事的躍進。如今單一錄音就能為十幾個市場的產品代言,而每個版本不會聽起來像同一個人在費力模仿當地腔調。對只在地化一位代言人的公司而言,這省下了一個過去每種語言都得再錄一次音的步驟。
表現力才是錢之所在
Artificial Analysis 將 v4 的表現力評為第一,ElevenLabs 也回報約 75% 的聽者在盲測中偏好它。這兩項數據都來自該公司或其合作夥伴,因此在有人重跑測試之前,不妨把它們當成行銷話術。不過方向仍然值得注意。如今每家主要實驗室都能產出清晰可辨的語音,差異化已經轉移到:這段語音能否在長篇錄音中承載語氣、節奏與可辨識的人格,而不會在章節之間走鐘。
商業面也從另一個角度印證了同一點。對話代理平台 ElevenAgents 如今占 ElevenLabs 營收的 55%。語音主要不是被當作有聲書的旁白來賣,而是被當作會說話軟體的介面層來賣。
這個轉變也解釋了價格結構。透過 API 使用 Eleven v4 每 1,000 個字元收費 0.08 美元,Turbo 則為 0.04 美元。兩者在 10 月 12 日前都有折扣,分別降至 0.022 與 0.011 美元。編預算時應該以標準費率為準,因為上市折扣是暫時的,而修正內容會增加字元數。Turbo 還有一項容易被忽略的特定限制:Text to Dialogue WebSocket 在 v4 上每條連線最多可接受十個已註冊聲音,Turbo 則只允許一個。
市場其他玩家也沒閒著
把語音視為代理介面的並不只有 ElevenLabs。9 月 30 日,Inception Labs 推出 Mercury Voice,這是專為低延遲語音代理打造的擴散語言模型,首個回答 token 的中位時間為 320 毫秒,上市時每分鐘對話定價約 0.9 美分。Suno 推出了 beta 版的語音模型。Vercel 則把微軟的音訊模型加入其 AI Gateway,並支援零資料保留。
兩者的差異在於把難題放在哪裡。ElevenLabs 把語音合成當作產品,文字建模則另外處理。Inception 則把語言模型納入延遲預算,主張如果背後的模型要想兩秒,再快的合成層也沒用。兩種做法都言之成理,而它們會持續碰撞,因為使用語音代理的人根本分不出是哪個環節慢了。
讓人不舒服的部分
聲音複製受到強制性的本人身分驗證,以及阻擋未經授權複製知名公眾人物的過濾機制所保護。這是合理的底線,但不是解決方案。如今 10 秒的樣本就足以做出高保真複製,而手上握有某人 10 秒音訊的人,實際上就是所有人。
還有一個任何過濾機制都無法處理的二階問題。當表現力豐富的模型越來越擅長聽起來像某個特定的人,聲音作為驗證訊號的價值就會崩塌。聲紋過去是薄弱的證據,如今已幾乎不構成證據。以「我們認得客戶的聲音」為基礎建立身分驗證的銀行與客服中心,兩年來一直在默默放棄這個假設,而這次發布讓這項假設的退場顯得更加刻不容緩。
延遲數字也比聽起來的範圍更窄。它是在 ElevenLabs 自家的基準測試協定上、扣除網路延遲後測得的。實際的助理仍然必須辨識請求、決定答案,再透過網路傳送出去。Turbo 只是從一條有多個延遲來源的鏈條中移除了一個。

這個估值真正在說什麼
八個月內估值翻倍,而且靠的是 3 億美元的次級市場交易、而非新的初級資本,這是在為留存率說話,也是在為一個尚未商品化的類別說話。語音模型是少見的 AI 產品:使用者能立刻察覺品質差異,並因此轉換陣營。超大規模雲端業者與專業競爭者都在出貨,而品質差距一直在縮小。
220 億美元這個數字背後的賭注是:品質差距能維持在足以收費的寬度,而且代理平台的成長速度能持續快於原始合成價格的下跌速度。Turbo 在上市期間降到每 1,000 字元 0.011 美元,說明這個賭注的後半段更難成立。當一段聲音的邊際成本趨近於零,你還能賣的,就是別人沒有的那個聲音。
還有一個結構性原因,說明為何語音公司能撐住這樣的估值,而圖像與影片公司卻很難。語音代理是持續運行的,每一次通話、每一場工作階段都在跑,因此用量會隨產品成功而放大,而不是取決於一次性的生成。旁白與代理的經濟模式不同:一個是專案,另一個是永不停轉的計量錶。ElevenLabs 朝後者布局,而 55% 的營收占比說明這個策略奏效了。接下來一年要回答的問題是:品質優勢能否撐得夠久,讓這具計量錶持續運轉。
該公司自己的敘事也指向同一方向。發布素材主打的是表現力,而非準確度或速度,因為後兩者在好幾個版本之前就不再是差異化因素。語音代理要讓人覺得真實,必須在四十分鐘的工作階段中承載猶豫、強調與一致的身分,而這比產出一段乾淨的段落要難得多。贏得這場競賽的模型未必是每字元最便宜的那個,而是其輸出讓人無法與曾經對話過的人分辨開來的那個——而這道門檻,每被跨越一次就會再往上調。