← 返回部落格
Ai預計閱讀 11 分鐘

語音代理有了自己的基準測試,而每家實驗室各贏得一項不同類別

發布於 2026年10月3日
語音代理有了自己的基準測試,而每家實驗室各贏得一項不同類別

語音助理今年不再只是展示品,而開始成為基礎設施,而這套基礎設施如今也開始被衡量。近期一項針對擬真語音代理的基準測試計畫,發現了一件值得所有在此技術上打造產品的人關注的事:沒有任何單一模型能全面稱霸。每一家領先實驗室各在一個不同的面向勝出。

根據這些結果的相關報導,xAI 的 Grok Voice Think Fast 2.0 在任務完成度上領先,也就是它真的能把被交辦的事做完。OpenAI 的 GPT-Live 1 回應最快。Google 的 Gemini 3.8 Live 在音訊嘈雜時最為穩健。三家廠商、三種不同強項,而且沒有明顯的整體贏家。

這比一般單一排行榜所呈現的畫面更誠實,也反映出這個類別仍有多年輕。語音代理不是單一能力。它必須聽得準、判斷得快、回應得自然,還要在被打斷的情況下仍能維持對話的連貫。針對其中任何一項最佳化,往往得在其他項目上付出代價。這項基準測試之所以有用,正是因為它把這些能力拆開來衡量。

微軟的三模型攻勢

微軟本週在這個領域也有所動作,推出一組面向開發者而非消費者的語音模型。核心是 MAI-Transcribe-2-Streaming,這是該公司首個即時串流語音轉文字模型,對於需要在你还沒說完話時就理解你的代理來說,這是最關鍵的一塊。該公司也更新了 MAI-Voice-2.1 系列,目標是更自然的語音,以及更短的輪替延遲——也就是你說完話到代理開始說話之間的停頓,一旦太長,對話就會顯得不自然。

這兩個問題——串流準確度與輪替延遲——正是多數語音代理在實務上崩解的地方。一個在你停止說話後才準確轉錄的模型,用於字幕沒問題。但一個想禮貌地插話、等待自然的停頓,並在沒有兩秒空檔的情況下回答的代理,需要串流輸入與快速語音生成彼此配合。把兩者都做成獨立的開發者導向模型,顯示微軟把語音視為許多產品都會建構於其上的一層,而不是單一應用程式。

該公司也讓旗下音訊模型可透過第三方 AI 閘道取用,並提供零資料保留選項,這對想要語音功能、又不願把內容送進供應商儲存空間的企業很重要——這在受監管產業中是經常出現的限制。

捕捉那一端也開始變得有趣

在對話的另一端,用來生成個人聲音與樣貌的工具則持續變得更便宜、更好用。HeyGen 近期的更新包括一套開源的即時虛擬人技術堆疊,把 OpenAI 的全雙工語音模型接進其直播虛擬人產品、一個語音複製 API,以及一項與 Kaggle 合作打造的基準測試,用來衡量 AI 生成影片實際上被產出的品質,而不只是看起來如何。

最後一項點出了這些工具在評判方式上的一個缺口。大多數生成式影片的比較都止於視覺品質。會說話的虛擬人頭像同時也是一條生產流程,而流程有它的失效模式:脣形同步飄移、忽略插話的輪替機制、讓對話感覺不對的延遲。圍繞製作品質而非外觀打造基準測試,正是這個領域一直缺少的那種衡量方式。

全雙工轉變為何重要

在這些表象之下,有一個技術轉變,若只讀產品發表資訊很容易錯過。前一代語音助理的運作方式像接力賽。你說話,系統等你停下來,轉錄,思考,生成回覆,播放。較新的全雙工模型能同時聆聽與說話,這正是讓輪替機制得以近似人類對話的關鍵,包括處理被打斷的情況。

聽起來像是互動設計上的小改變。但這是和一個笨拙地輪流發言的系統對話,與和一個你可以打斷的系統對話之間的差別。近期某次示範流傳的一個細節正好說明了這點:當雙方同時開口時,代理讓人類先說。這是小小的禮貌,而要做得對,模型必須持續聆聽,而不是等著輪到自己。

自然對話背後的工程

語音之所以比看起來更難,歸根究柢在於使用者永遠看不到的數字。兩個人在對話中的自然停頓很短,往往不到一秒,而回應拖太久的人會讓人覺得分心或沒把握。要讓 AI 代理感覺像活的,整條鏈路都得塞進類似的時間窗內:擷取音訊、在音訊抵達時就轉錄而不是等講者停下來、決定要說什麼、生成語音,然後開始播放。每個階段都會增加延遲,而這些階段加起來的預算很小。

這就是為什麼串流轉錄與輪替延遲是微軟特別強調的兩項能力。一個等到一句話結束才處理的模型可以很準確,卻仍對對話毫無用處,因為等它處理完,該回應的自然時機早就過了。串流輸入讓代理在句子還沒講完前就開始推理。快速的語音生成則讓它能回答而不出現明顯空檔。

全雙工的轉折又多加了一層。在舊式的輪替系統中,同一時間只有一方在動作:助理先聽,再說,再聽。全雙工模型可以同時做這兩件事,這讓它能處理被打斷的情況、察覺對方只是停下來思考,並優雅地讓出發言權。這既是建模問題,也同樣是互動設計問題。把技術環節做快是必要的,而決定何時停止說話,才是讓結果顯得體貼的關鍵。

資料處理這一面比較容易被忽略,但對企業採用同樣重要。語音承載的不只是文字,還包括語氣、背景噪音,以及說話者的身分,這使它比文字更難被隨意對待。這就是為什麼這些模型能透過提供不保留資料選項的閘道取用,也是這則故事的一部分。一家公司若想要語音功能,卻不能把客戶音訊送進供應商的儲存空間,就需要處理過程不留痕跡,而直到不久之前,這還是完全避開語音的一個理由。

示範與部署之間的落差

有理由保持謹慎。語音代理正被推銷為已可用於客戶支援、理賠處理與 IT 服務台,但衡量它們的基準測試才剛出現,部署案例也仍處於早期。三家領先模型在同一項測試中分占前幾名,這提醒我們「最佳語音 AI」目前還不是一個有意義的說法。正確的模型取決於你的問題是嘈雜的客服中心、必須端到端完成的任務,還是需要感覺快速自然的對話。

另一個要謹慎的地方,是每個聽起來像真人的生成式模型都會帶來的問題。一個好到能冒充人類的系統,也好到能被濫用,而同一週東京的一項法院裁定也認定,未經授權的語音複製可能侵害個人權利。技術與圍繞它的規範同時到來,這並不尋常,而且大概比另一種情況來得好。

對開發者而言,實際的結論是:別再把語音當成單一的勾選項目。依照你工作流程中的瓶頸來挑選模型——無論是嘈雜環境中的聽取、完成任務,還是快到足以感覺像活的回應速度——並預期要混用不同供應商,而不是統一採用一家。把他們區分開來的那項基準測試,比任何假裝它們可以互換的排名都更有用。

相關文章