← 返回部落格
Ai預計閱讀 10 分鐘

微軟將部分轉錄延遲縮短至 100 毫秒。這改變了轉錄的用途。

發布於 2026年10月5日
微軟將部分轉錄延遲縮短至 100 毫秒。這改變了轉錄的用途。

2026 年 10 月 2 日,Microsoft AI 發布 MAI-Transcribe-2-Streaming,這是一款語音辨識模型,能在略超過 100 毫秒內回傳 60 種語言的部分轉錄稿。它在 Artificial Analysis 的最終與部分轉錄準確率排名中都拿下第一。導入價格為每小時音訊 0.54 美元,優惠持續到今年年底。

該公司也發布了 MAI-Voice-2.1 與 MAI-Voice-2.1-Flash,涵蓋 23 種語言與 26 個地區設定。該模型可透過 Azure Speech、Microsoft Foundry、MAI Playground、OpenRouter(ID 為 microsoft/mai-transcribe-2)、Vercel 與 Azure Voice Live 使用,LiveKit 整合則列為即將推出。

100 毫秒是一個門檻,不是基準測試上的新奇數字。它位於人類感知為即時的邊緣。低於這個數字,介面可以在對方還在說話時就做出回應,而這正是產出文件的產品與參與對話的產品之間的差別。

在青色燈光下,細緻金色網罩中的麥克風振膜極特寫

為什麼最終準確率從來不是故事的全貌

語音辨識多年來一直是成熟的類別,而排行榜大多只衡量一件事:當講者停止說話後,模型把一段完整話語轉錄得多準確。這項指標回答的是轉錄服務在乎的問題,卻沒有回答即時產品在乎的問題。

只在講者說完後才顯示文字的會議助理,只是格式化得更好的錄音機。能在文字出現時就顯示的會議助理,則可以標示目前發言者、在名字被提到的當下就把它顯示出來、在話題還在討論時觸發搜尋,並讓人在句子講到一半時往回捲動而不失去位置。這一切都取決於部分延遲,而不是最終準確率。

部分準確率是更難的問題,也是 Artificial Analysis 現在單獨追蹤的項目。在句子完成前產生穩定猜測,意味著你得先採取一種可能還得修正的詮釋。不斷修正的模型會產生閃爍的文字,這比等待更糟。過於積極定案的模型則會把錯誤留在畫面上。以部分結果排名,獎勵的是能讓過渡文字正確到讀者足以信任眼前內容的模型。

微軟宣稱在兩份榜單上都拿下第一,意味著它沒有用過渡穩定性換取最終正確性,而這正是模型換取部分速度的常見做法。這個組合才是真正的重點。

100 毫秒這個數字

串流辨識的端到端延遲是一條鏈,而不是單一數字。音訊以幀為單位抵達。端點偵測模型決定一段話可能何時結束。辨識模型產生文字。下游系統將它呈現出來。每個環節都會增加延遲,而總和決定體驗是否感覺即時。

微軟的 100 毫秒數字涵蓋模型自身的輸出,依據的是公司自己的測量與 Artificial Analysis 的排名,而非獨立的延遲稽核。真正相關的比較,是這個數字能否在即時產品所創造的條件下成立;這與單獨用碼錶計時是不同問題:多位講者、背景噪音、品質不佳的會議麥克風,以及 60 種語言同時進入同一條管線。供應商很少公布這些條件下的延遲分布,而正是這些條件決定會議產品在真實會議中是否可用。

定價結構是故事的另一半。每小時音訊 0.54 美元是持續到今年年底的導入價,這告訴你微軟預期之後會調整。策略意圖很清楚。串流轉錄是每個會議助理、客服中心分析產品與即時字幕服務的輸入層。成為 60 種語言中最便宜的快速選項,是一種通路布局;而輸入層的通路具有黏著性,因為第二個切換供應商的團隊必須針對另一套過渡行為重新打造他們的處理方式。

這會與哪些產品競爭

微軟並不是進入一片空白的領域。Deepgram、AssemblyAI 與 Speechmatics 都已在串流準確率與低延遲上建立事業,而 Google 與 Amazon 也把具競爭力的辨識功能綁進自家的雲端堆疊。現實中的買家是已經在 Azure 上運行的開發者,他們重視 MAI-Transcribe-2-Streaming 與其他 MAI 系列一同出現在 Foundry 和 OpenRouter 中,並且寧願不要為單一元件再維持第二家供應商關係。

MAI-Voice-2.1 的發布在這裡也很重要,而且這種配對是刻意的。語音辨識與語音合成是同一段對話的兩端,而同時銷售兩者的平台可以推銷單一管線:音訊輸入、轉錄稿輸出、回應合成、語音回傳。在合成端增加 23 種語言與 26 個地區設定,擴大了這條管線能作為單一產品銷售的市場數量。

快速部分結果在產品設計上改變了什麼

一旦過渡文字能在十分之一秒內抵達,過去顯得不合理的一連串介面決策就會變得平凡。

想想打斷。如果轉錄稿只有在講者停止後才定案,系統就必須等到靜默才能對所說內容採取行動,這意味著它無法在對話早已繼續前進之前回應。有了快速部分結果,系統可以在指令被說出的當下就辨識並插話,這是人們預期房間裡真人會有的行為。支援插話的語音代理取決於這一點。需要跟上快速講者、而不是落後三句話的即時字幕系統也是如此。

搜尋是第二個受益者。能在轉錄稿寫入的同時進行搜尋的會議助理,可以在專案名稱出現的當下就顯示文件,而討論還在進行。這與一小時後才產生可搜尋筆記的錄音機,是根本不同的產品。

結構化擷取是第三個。如果部分文字夠可靠,下游模型可以在會議結束前就開始閱讀,並在決策與行動項目被說出時加以標記。這裡的好處來自能在參與者還記得自己的意思時檢視輸出,而不是來自原始速度。

這些行為都提高了部分穩定性的重要性。一份每秒重寫兩三次的轉錄稿,會讓這三項功能變得惱人而非有用;這也是為什麼微軟發布中更深層的故事,是部分結果的準確率排名,而不是延遲數字本身。

有趣的風險在哪裡

轉錄準確率數字通常以總體百分比呈現,而總體百分比會掩蓋底下的分布。帶有口音的語音、句子中途轉換語言、兒童的聲音,以及非標準麥克風的表現,在不同模型之間差異極大,而這些正是即時產品最可能被使用的條件。一個平均表現強勁的模型,仍可能不適合某個客服中心,因為那裡的客戶會在句子講到一半時切換語言。

第二個風險更具策略性。一旦轉錄快到、便宜到足以持續運行,自然的下一步就是一直開著。每小時只要半美元的模型,讓持續聆聽變得可負擔,這是按分鐘計價做不到的;而持續聆聽就是對裝置附近所說一切進行環境錄音。這是資料治理決策,沒有任何準確率排行榜能替購買這項技術的團隊做出決定。

MAI-Transcribe-2-Streaming 是真正有用的基礎設施,而部分準確率排名是值得關注的部分,因為它衡量的是即時產品真正依賴的指標。尚未解決的是,供應商測得的 100 毫秒數字,能否在聲學條件糟糕、四個人同時搶話的房間裡站得住腳。這是每個買家在把生產管線交給它之前,都會私下進行的測試。

相關文章