AssemblyAI 將即時語音延遲降至 91 毫秒。這個數字為何重要

AssemblyAI 發布 Universal 3.6 Pro Realtime,這是其新的串流語音辨識模型。詞錯誤率降至 1.77%。在超過 1,000 筆通話錄音的測試中,從說話結束到最終文字輸出的延遲中位數為 91 毫秒。P95 延遲從 692 毫秒降至 225 毫秒。
這些看起來像是成熟技術的漸進式改善。但由於變動的那個具體數字,這更接近一場門檻事件。
為什麼 91 毫秒是截然不同的產品
語音辨識多年來在聽寫方面已足夠準確。對話式應用的限制從來不是詞錯誤率,而是發言輪替。
人類對話建立在快速重疊之上。一位說話者結束到下一位開始之間的中位數間隔約為 200 毫秒,而且在熟悉對話中會縮短,在爭論中又會更短。這就是任何對話系統都必須塞進去的預算。
在 P95 延遲為 692 毫秒時,語音代理會明顯落後。使用者會調整(他們停頓、重複、搶話),互動便帶上一種所有人都認得出來的、像在跟機器說話的生硬感。在 P95 為 225 毫秒時,代理落在人類經過思考後回應的範圍內。在中位數 91 毫秒時,它比大多數人都快。
這就是能用來展示的語音代理,與能當產品運作的語音代理之間的差別。而且改善遠超過兩倍,因為分布和中位數一樣重要。把 P95 從 692 降到 225,意味著尾端(那些讓對話感覺壞掉的回應)大致已被移除。
由此而來的設計後果常被忽略。當辨識很慢,產品團隊會用讓代理採取更長發言回合來補償:它等待明確停頓,用完整段落說話,完全避免與使用者重疊。這些補償會產生一種使用者認得出是機械化的特定對話風格,即使詞語很自然。
當辨識很快,代理就能使用短發言回合。它能在使用者還在說話時表示收到。它能在歧義出現的當下插入澄清問題,而不是等句子結束後才問。這種對話風格只有在延遲預算允許之後才會出現,這表示延遲改善解鎖的是另一種互動設計,而不只是讓現有互動感覺更好。
這次發布還包含什麼
該模型整合了實體感知的發言輪替偵測:它知道辨識出的實體(例如電話號碼或地址)何時完整,而不是把緊鄰標點位置的靜音當成發言回合結束。它也新增了背景噪音校正。
這兩項功能都指向同一個問題:正式環境中的語音環境很雜亂。客服中心音訊有等候音樂、鍵盤噪音、交叉談話與口音。依賴單純靜音門檻的發言輪替偵測,會在使用者停下來思考時於子句中打斷他們,也會因為聽起來像語音的噪音而讓線路一直開著。
實體感知偵測針對的是一類特定且代價高昂的錯誤:把「我的號碼是五五五」當成完整發言回合的系統,會對講一半的句子產生回應,而使用者會從頭開始。在一通電話中,這些重新開始就是兩分鐘互動與六分鐘互動的差別。
這在代理堆疊中的定位
時機並非巧合。同一週,Decagon 發表 Voice 3 以及名為 PACT 的框架,目標是讓客服準備好面對本身就是代理的來電者。Anthropic 一直在建置網路驗證分級。OpenAI 開放了決策 API。代理基礎設施層正同時朝各個方向擴建,而語音是延遲預算最緊的介面。
語音最緊的原因:文字代理可以慢。在聊天視窗打字的使用者能容忍數秒的思考時間,因為互動模式本來就包含等待。通話中的使用者則不會。超過一秒的沉默會被解讀為斷線,使用者會在系統處理完之前就說「喂?」。
這種不對稱意味著即時語音辨識不是語音產品中眾多元件之一。它決定產品能達到的上限。一個推理能力極佳但辨識延遲 700 毫秒的語音代理,就是一個慢的語音代理,無論推理多好,因為推理從來沒有機會在乾淨的發言回合上運行。
1.77% 錯誤率的代價
詞錯誤率這個數字需要背景脈絡。在乾淨的朗讀語音上,頂尖模型低於 3% 已有一段時間。在含有姓名、帳號與地址的嘈雜客服中心音訊上,錯誤率歷來高得多,而這正是實體準確度比整體詞錯誤率更重要的地方。
供應商測試集上的 1.77% 錯誤率,無法告訴你你的音訊會發生什麼事。對採購真正重要的細節更狹窄:專有名詞的準確度、英數字串(帳號、確認碼)的準確度,以及當說話者不是被辨識語言母語人士時的準確度。
最後一項是多數正式系統失敗、而多數基準未衡量的地方。口音差異產生的是系統性錯誤,不是隨機錯誤;一個一直把「fifteen」聽成「fifty」的辨識器,不會靠平均而修正。AssemblyAI 的實體感知發言輪替偵測有助於處理下游後果,但有口音語音的轉錄準確度是另一項獨立評估。
實務解讀
對任何打造語音產品的人來說,這次發布改變了什麼值得嘗試。以對話級延遲進行串流辨識,意味著產品能處理打斷、快速你來我往,以及真實對話中會出現的各種重疊發言。以前技術上可行但用起來不對勁的應用,現在值得打造。
成本面向與延遲同樣重要。這種速度的串流辨識必須在通話期間持續運行,這表示運算費用會隨通話時間增加,而不是隨轉錄音訊量增加。對高流量部署而言,這會改變單位經濟效益,值得在承諾採用假設永遠開啟辨識的架構前先試算。
有三件事應該測試而不是假設。P99 延遲,而非 P95,因為最糟的 1% 發言回合才是使用者記得的。用自己的音訊測準確度,而非供應商的基準集,並特別注意姓名與數字。以及被打斷時的行為,因為一個能處理乾淨輪替、但使用者插話時就凍住的系統,會在最需要語音的對話中失敗。
還有第四項大多評估會略過的測試:辨識出錯時會怎樣。每個辨識器都會聽錯,而語音產品的品質很大程度上取決於它如何恢復——是否要求澄清、是否默默依錯誤轉錄繼續、是否能辨識出一串詞在脈絡中不合理並再次詢問。錯誤率 1.77% 但從不偵測自身錯誤的模型,實務上不如錯誤率較高但有良好不確定性訊號的模型。
更大的轉變是,語音不再是過去那樣的瓶頸。對 2026 年底的語音產品團隊而言,問題在於堆疊其餘部分(推理、行動執行、錯誤復原)是否快到能跟上如今已具人類速度的耳朵。
相關文章
Meta 正在向 Midjourney 取得圖像與影片技術授權,而背後原因很能說明一切
基準每隔一季就變動。但一個社群對什麼看起來好看的判斷不會。
Google 的 Nano Banana 2.1 是功能下放,而非旗艦之作
中階產品的發布,透露的是實驗室認為多數使用者真正需要什麼,這比旗艦發表更具參考價值。
影片廣告技術堆疊分裂成專用模型,而 Boreal-H3 說明了原因
電影級品質與迭代吞吐量是兩種不同產品,而單一生成層無法同時在兩者上領先。
OpenAI 發表了 722 項由 AI 推導出的數學成果。數學家正追問:功勞該歸誰?
證明助理檢查的是論證能否推導出來,而不是該論證是否就是某個人所想的那一個。