阿里巴巴把語音代理一分為二,接著把價格砍掉最多 95%

阿里巴巴的 Qwen 團隊在 2026 年九月最後一週發布 Qwen-Audio-3.1,這是一套包含五個模型的音訊堆疊,涵蓋語音辨識、文字轉語音與即時互動。傳播最快的數字是降價幅度:即時模型降約 85%,文字轉語音降約 70%,自動語音辨識最高降 95%。
這些數字之所以重要,是因為它們正好落在整個產業都在砍價的一週。微軟、OpenAI 與 Anthropic 都在同一段時間推出更便宜或重新調整配比的模型,而阿里巴巴此舉讀起來像是刻意在音訊領域加碼。但 Qwen-Audio-3.1 更有意思的地方不是折扣,而是旗艦模型的建構方式。
一個聲音背後有兩個模型
掛頭牌的模型是 Qwen-Audio-3.1-Realtime,一套全雙工語音系統,專為需要在對話中途呼叫工具的語音代理打造。
它的核心設計決策是一次拆分。Qwen 沒有採用單一大型端到端系統同時負責聆聽與說話,而是跑兩個模型,共用同一組音訊編碼器與語言模型主幹。一個決策模型預測該繼續聽、開始說、停止,還是重新接話。另一個生成模型負責實際的語音。用白話說,一個模型決定何時開口,另一個決定要說什麼。
這個拆分是對一個具體失敗模式的務實解答。語音代理讓人覺得壞掉,通常不是因為它聽不懂你,而是因為它抓錯時機。它會搶話,或突然沉默,或在你還沒說完就回答。過去的處理方式通常是把輪流發言的能力硬接到更大的模型上,然後指望這種行為自己湧現。Qwen 則把「何時該說話」當成獨立的工程問題,給它專屬的模型,與內容生成分開處理。該公司表示,在某項基準測試上,回覆錯對象的比例從 0.13 降到 0.03;在另一項測試上,贅詞率從 0.759 降至 0.296。它同時也揭露了一項取捨:被打斷後不該接話卻接話的比例從 0.035 升到 0.130——這種資訊,發布說明裡很少見到。
這個模型以託管 API 形式提供。Qwen-Audio-3.1-Realtime-Plus 透過 WebSocket 在 QwenCloud 上運行。它沒有開放權重,這對關注 Qwen 開放圖像工作的人來說值得注意,因為這套音訊堆疊是以封閉的託管產品方式經營。
規格與定價
即時端點列出文字與音訊皆可作為輸入與輸出。上下文長度達 262K token,最大輸入 245K、最大輸出 16K。預設吞吐上限為每分鐘 60 次請求與 10 萬 token。定價為每百萬音訊輸入 token 6.4 美元、每百萬文字輸入 token 0.8 美元,文字與音訊合併輸出為每百萬 24 美元,輸出文字則完全不收費。函式呼叫、網路搜尋、結構化輸出、上下文快取與微調全都內建。
另一款搭配的模型 Qwen-Audio-3.1-ASR-Flash-Filetrans 則鎖定長音訊的離線轉錄。它支援熱詞、講者分離、標點,以及多語言與中文方言的辨識,每百萬 token 輸入 0.15 美元、輸出 0.47 美元。對於曾為大規模長篇轉錄估過價的人來說,這讓過去屬於固定成本的部分出現陡降。
訓練的部分則分為三層,Qwen 分別稱為 Think、Act 與 Speak。Think 層以百萬小時規模的配對資料,把音訊模型重新錨定到來源文字模型上,接著採用同策略蒸餾,而非模仿事先寫好的答案。Act 層建構可執行的環境,每個環境都捆綁一組工具池、一個有狀態的資料庫與一份成文的業務政策,任務評分則以最終狀態為優先。Speak 層決定是否要說、何時說、以及怎麼說。
Act 層的細節值得停下來想一想。評分會先檢查最終狀態,再檢查措辭,所以再流暢的回覆也救不回一個失敗的動作。對於一個應該實際去做事、而不是只會聊天的代理來說,這才是正確的評分方式。
為什麼價格戰才是真正的重點
把架構剝掉,Qwen-Audio-3.1 就是一個明確的策略動作:阿里巴巴在語音基礎設施的成本與延遲上與 OpenAI、Google 競速,而不是比開放程度。
讓這件事看得清楚的對照是延遲。Qwen 回報的中斷停止延遲約為 1.116 秒,而 GPT-Realtime-2 為 0.383 秒。使用者打斷時停止得比較慢,是可見的弱點,而 Qwen 選擇把它和那些勝出的數字一起公布,也說明了音訊領域基準測試文化的現況——在這裡,誠實的數字仍然是一種差異化。
對開發者來說,實際效果就是更便宜的後端。如果即時語音便宜 85%、辨識最高便宜 95%,那麼過去只保留給高階方案的語音功能,在普通產品裡也變得可行。常時聆聽、即時翻譯,以及代理的語音介面,全都位在那條成本曲線的下游。當說一分鐘話的成本崩落,上一季還負擔不起的產品決策,這一季就變得顯而易見。
但要注意的是,這適用於每一個託管 API:你拿到的是行為,不是內部。你無法檢視輪流發言的模型,無法用自己完全掌控的方式在自家資料上微調決策邏輯,也無法在自己的硬體上跑這套堆疊。對多數新創來說,這是可接受的取捨。但如果你打造的東西本身就是延遲表現或資料路徑,那就是一項該計入成本的依賴。
競爭脈絡讓這一點更清楚。在九月的同一段時間,OpenAI 與 Anthropic 都推出了以「用更低成本做更多事」為框架的模型,微軟也為自家產品線新增一個串流轉錄模型與兩個文字轉語音模型。音訊不再是個安靜的角落,讓較小的實驗室可以在沒人注意的情況下做到最好。它已經是一個最大玩家們公開在價格與延遲上競爭的類別,這對買方是好消息,對任何靠語音收取溢價的人則是壓力。
值得觀察的重點
最明顯的問題是,Qwen 最終會不會把這套堆疊的任何一部分開源,以及這個雙模型設計在真實的多輪工具呼叫負載下、而非基準測試條件下,是否還站得住。把輪流發言與內容生成拆開,在紙上很優雅。但當使用者中途打斷、改變心意、在一句話中間切換任務時,它是否依然優雅,這正是示範影片回答不了的問題。
目前為止,重點更窄也更清楚。阿里巴巴把語音代理中最讓人覺得壞掉的那一部分挑出來、替它命名,並給它一個專屬模型。然後它把價格砍到整個類別都變便宜。如果未來一年的語音產品都建立在更便宜、更能被打斷的語音之上,這次發布會是其中一個原因。