← 返回部落格
Ai預計閱讀 10 分鐘

AssemblyAI 將即時語音延遲降至 91 毫秒。這個數字為何重要

發布於 2026年10月7日
AssemblyAI 將即時語音延遲降至 91 毫秒。這個數字為何重要

AssemblyAI 發布 Universal 3.6 Pro Realtime,這是其新的串流語音辨識模型。詞錯誤率降至 1.77%。在超過 1,000 筆通話錄音的測試中,從說話結束到最終文字輸出的延遲中位數為 91 毫秒。P95 延遲從 692 毫秒降至 225 毫秒。

這些看起來像是成熟技術的漸進式改善。但由於變動的那個具體數字,這更接近一場門檻事件。

為什麼 91 毫秒是截然不同的產品

語音辨識多年來在聽寫方面已足夠準確。對話式應用的限制從來不是詞錯誤率,而是發言輪替。

人類對話建立在快速重疊之上。一位說話者結束到下一位開始之間的中位數間隔約為 200 毫秒,而且在熟悉對話中會縮短,在爭論中又會更短。這就是任何對話系統都必須塞進去的預算。

在 P95 延遲為 692 毫秒時,語音代理會明顯落後。使用者會調整(他們停頓、重複、搶話),互動便帶上一種所有人都認得出來的、像在跟機器說話的生硬感。在 P95 為 225 毫秒時,代理落在人類經過思考後回應的範圍內。在中位數 91 毫秒時,它比大多數人都快。

這就是能用來展示的語音代理,與能當產品運作的語音代理之間的差別。而且改善遠超過兩倍,因為分布和中位數一樣重要。把 P95 從 692 降到 225,意味著尾端(那些讓對話感覺壞掉的回應)大致已被移除。

由此而來的設計後果常被忽略。當辨識很慢,產品團隊會用讓代理採取更長發言回合來補償:它等待明確停頓,用完整段落說話,完全避免與使用者重疊。這些補償會產生一種使用者認得出是機械化的特定對話風格,即使詞語很自然。

當辨識很快,代理就能使用短發言回合。它能在使用者還在說話時表示收到。它能在歧義出現的當下插入澄清問題,而不是等句子結束後才問。這種對話風格只有在延遲預算允許之後才會出現,這表示延遲改善解鎖的是另一種互動設計,而不只是讓現有互動感覺更好。

這次發布還包含什麼

該模型整合了實體感知的發言輪替偵測:它知道辨識出的實體(例如電話號碼或地址)何時完整,而不是把緊鄰標點位置的靜音當成發言回合結束。它也新增了背景噪音校正。

這兩項功能都指向同一個問題:正式環境中的語音環境很雜亂。客服中心音訊有等候音樂、鍵盤噪音、交叉談話與口音。依賴單純靜音門檻的發言輪替偵測,會在使用者停下來思考時於子句中打斷他們,也會因為聽起來像語音的噪音而讓線路一直開著。

實體感知偵測針對的是一類特定且代價高昂的錯誤:把「我的號碼是五五五」當成完整發言回合的系統,會對講一半的句子產生回應,而使用者會從頭開始。在一通電話中,這些重新開始就是兩分鐘互動與六分鐘互動的差別。

這在代理堆疊中的定位

時機並非巧合。同一週,Decagon 發表 Voice 3 以及名為 PACT 的框架,目標是讓客服準備好面對本身就是代理的來電者。Anthropic 一直在建置網路驗證分級。OpenAI 開放了決策 API。代理基礎設施層正同時朝各個方向擴建,而語音是延遲預算最緊的介面。

語音最緊的原因:文字代理可以慢。在聊天視窗打字的使用者能容忍數秒的思考時間,因為互動模式本來就包含等待。通話中的使用者則不會。超過一秒的沉默會被解讀為斷線,使用者會在系統處理完之前就說「喂?」。

這種不對稱意味著即時語音辨識不是語音產品中眾多元件之一。它決定產品能達到的上限。一個推理能力極佳但辨識延遲 700 毫秒的語音代理,就是一個慢的語音代理,無論推理多好,因為推理從來沒有機會在乾淨的發言回合上運行。

1.77% 錯誤率的代價

詞錯誤率這個數字需要背景脈絡。在乾淨的朗讀語音上,頂尖模型低於 3% 已有一段時間。在含有姓名、帳號與地址的嘈雜客服中心音訊上,錯誤率歷來高得多,而這正是實體準確度比整體詞錯誤率更重要的地方。

供應商測試集上的 1.77% 錯誤率,無法告訴你你的音訊會發生什麼事。對採購真正重要的細節更狹窄:專有名詞的準確度、英數字串(帳號、確認碼)的準確度,以及當說話者不是被辨識語言母語人士時的準確度。

最後一項是多數正式系統失敗、而多數基準未衡量的地方。口音差異產生的是系統性錯誤,不是隨機錯誤;一個一直把「fifteen」聽成「fifty」的辨識器,不會靠平均而修正。AssemblyAI 的實體感知發言輪替偵測有助於處理下游後果,但有口音語音的轉錄準確度是另一項獨立評估。

實務解讀

對任何打造語音產品的人來說,這次發布改變了什麼值得嘗試。以對話級延遲進行串流辨識,意味著產品能處理打斷、快速你來我往,以及真實對話中會出現的各種重疊發言。以前技術上可行但用起來不對勁的應用,現在值得打造。

成本面向與延遲同樣重要。這種速度的串流辨識必須在通話期間持續運行,這表示運算費用會隨通話時間增加,而不是隨轉錄音訊量增加。對高流量部署而言,這會改變單位經濟效益,值得在承諾採用假設永遠開啟辨識的架構前先試算。

有三件事應該測試而不是假設。P99 延遲,而非 P95,因為最糟的 1% 發言回合才是使用者記得的。用自己的音訊測準確度,而非供應商的基準集,並特別注意姓名與數字。以及被打斷時的行為,因為一個能處理乾淨輪替、但使用者插話時就凍住的系統,會在最需要語音的對話中失敗。

還有第四項大多評估會略過的測試:辨識出錯時會怎樣。每個辨識器都會聽錯,而語音產品的品質很大程度上取決於它如何恢復——是否要求澄清、是否默默依錯誤轉錄繼續、是否能辨識出一串詞在脈絡中不合理並再次詢問。錯誤率 1.77% 但從不偵測自身錯誤的模型,實務上不如錯誤率較高但有良好不確定性訊號的模型。

更大的轉變是,語音不再是過去那樣的瓶頸。對 2026 年底的語音產品團隊而言,問題在於堆疊其餘部分(推理、行動執行、錯誤復原)是否快到能跟上如今已具人類速度的耳朵。

相關文章