← 返回部落格
Ai預計閱讀 10 分鐘

兩款語音模型刷新標竿:首段音訊只要 50 毫秒,還有能在筆電 CPU 上運行的 99M 模型

發布於 2026年10月6日
兩款語音模型刷新標竿:首段音訊只要 50 毫秒,還有能在筆電 CPU 上運行的 99M 模型

同一週內發布的兩項語音合成成果,從相反方向指向同一個結論。一個把延遲逼到人耳幾乎無法察覺的極限,另一個則把模型尺寸縮到筆電記憶體足以容納的程度。兩者合起來,標誌出文字轉語音競賽已經從「聽起來像真人」快速轉向「能裝進特定環境」。

第一款來自 Gradium,這家語音新創公司發布了一款 TTS 模型,首段音訊的延遲約為 50 毫秒。該公司聲稱,這是前沿 TTS 模型中最低的延遲。第二款是 Supertonic,一個開源模型,擁有 9,900 萬個參數,可在筆電 CPU 上本機運行,不到一秒就能產出錄音室品質的音訊;而且在該公司的測試中,對於 ElevenLabs、OpenAI 和 Gemini TTS 在同一輸入上都失敗的電話號碼與其他困難文字,它都能正確發音。

為什麼「首段音訊延遲」才是關鍵指標

對語音助理來說,真正重要的數字是第一個聲音傳到使用者耳中之前要等多久,而不是整段音訊算完要多久。一個在開口前停頓三分之一秒的對話代理,就已經讓人覺得慢;能做到 50 毫秒的,則能維持一般來回對話的節奏。正是這個門檻,讓前沿模型的定價分層、即時語音模型的中斷處理,以及各種延遲宣稱,全都集中在同樣的零點幾秒區間。

A translucent glass sphere on a dark mirror surface with concentric rings of light

較小的模型更容易達到這個範圍,而這是個誠實的取捨。一個在 CPU 上運行的 99M 參數模型,放棄了前沿雲端模型的表情豐富度,換來的是後者給不了的東西:沒有網路往返、沒有逐次呼叫費用、音訊不離開裝置,而且在一台本來就擺在桌上的機器上表現可預測。

難處理的文字,其實是字典問題

Supertonic 在電話號碼上的結果,指向一個較不張揚的失誤。合成模型處理一般句子游刃有餘,卻會在最適讀法取決於上下文或慣例的字串上卡住。電話號碼、產品名稱、地址和縮寫經常被唸得亂七八糟,這也是它們成為經典 demo 翻車案例的原因。

第三項發布則從不同角度切入。Onepin 將自己定位為不是模型,而是合成之後的品管步驟。它會拿大約 400 萬字的發音字典,逐一檢查每一行生成內容,涵蓋人名與產品名,為自然度和準確度打分,並修正單一唸錯的字,而不必重新生成整行。對製作長音訊的團隊來說,能只修一個字、而不是重新算完五分鐘的片段,確實改變了成本曲線。

字典式做法也把原本綁在一起的兩項工作拆開。模型負責韻律、情緒和流暢度;檢查器則負責那一小群專有名詞——通用模型本來就不可能穩定唸對。這種分工,比把編碼器稍微改好一點更有用。

第四款模型展現串流標準

Sopro V2 Turbo 是一款 120M 模型,正在準備一個針對複製語音粗糙與斷裂問題的版本。它宣稱在筆電 CPU 上首段音訊約 300 毫秒、支援真正的串流、採用 Apache 2.0 授權,並涵蓋英語、歐洲葡萄牙語、法語和德語。其作者坦承,單薄或卡通化的聲音、有雜訊的參考音檔,以及一些分布外(out-of-distribution)的說話者仍然會失敗,並且一直在蒐集這些案例。

把這四項放在一起看,前沿已經分裂成幾條清楚的賽道。雲端模型持續推進表情豐富度和多語言覆蓋;小模型則占據裝置端賽道,在這裡,延遲、隱私和零邊際成本比最後幾個百分點的自然度更重要。同時,一層中介軟體正在成形,用來接住兩條賽道各自都處理不好的錯誤。

決定採用前該衡量什麼

這個領域的延遲和體積宣稱幾乎都是廠商自行回報,所以最實際的測試就是用你自己的輸入。拿你真正需要的文字去跑模型,包括那些會讓 demo 出糗的人名和數字。在你實際要部署的硬體上測量首段音訊時間,而不是在廠商的跑分機器上。還要確認授權是否允許你構想的部署方式,因為對本機模型來說,授權往往才是決定性的限制條件。

這些發布所呈現的模式,和一年前的圖像模型如出一轍:品質趨於一致之後,競爭就轉向模型在哪裡運行、啟動多快,以及每次呼叫要多少成本。語音現在正處於這個階段。聽起來最好的模型,已經不如那個能在使用者察覺到停頓之前就開口說話的模型來得重要。

前沿語音模型轉向何處

延遲競賽正在發生的同時,還有另一股不同的推進,兩者容易被混為一談。前沿即時模型,例如具備推理能力、可以被打斷、還能在對話中途呼叫工具的語音系統,追求的是能維持一場彷彿在電話上與真人交談的對話。那需要理解意圖、決定何時開口,以及處理被打斷的情況,這些是與純粹合成速度不同軸線上的難題。

不過,對大多數應用來說,先進的對話層其實是殺雞用牛刀。影片旁白、產品導覽口述,或床邊故事,需要的是良好發音、多次錄製之間風格一致,以及可預測的成本。這些需求用一款小巧快速的模型來滿足,會比用一個外掛聊天迴圈的前沿系統更好;這也是為什麼裝置端合成正成為預錄音訊的預設做法,而雲端仍是即時對話的主場。

同一領域還有一股法規力量在拉扯。在越來越多司法管轄區,要求為合成音訊加上標記,讓聽眾和平台能分辨,正逐漸成為規定;而語音複製也引來了一波自身的法院裁決。一個從不上傳樣本的本機模型,能避開其中一些風險曝露;而複製語音的雲端模型則會承接這些風險。對推出語音功能的團隊來說,合成在哪裡運行,正逐漸成為一個既關乎延遲、也關乎法遵的決定。

實用檢查清單

用你自己的腳本測試候選模型,而不是用廠商的示範文字,並且要放入那些會讓通用模型出錯的人名、縮寫和數字。在你實際會使用的硬體上測量首段音訊時間,因為筆電 CPU 的結果和資料中心的結果不能相提並論。確認授權涵蓋商業使用,以及你想要的部署型態,因為對開放模型來說,授權往往就是決定選擇的關鍵限制。還要及早決定你是否需要在合成後加一道品管,因為一個能把 95% 的字唸對的模型,仍然會在你客戶最在意的那個品牌名上出錯。

這四項發布單獨來看,都不是什麼突破。合在一起讀,它們顯示的是一個已經不再爭論合成語音聽起來真不真、而是開始在製作團隊真正在意的條件上競爭的領域:多快、多小、多便宜。這正是工具走向成熟的樣子。

相關文章