Google 的 Gemini 3.5 Live Translate 消除了停頓

即時翻譯向來是回合制的把戲。你說話,系統等你講完,思考,然後把結果唸回來。這個停頓很短,卻改變了對話的本質,因為雙方都得停下來讓機器工作。Google 全新的 Gemini 3.5 Live Translate 就是要刪掉這個停頓。
這款本月發表的模型是語音對語音的音訊模型,而不是在轉錄流程後面接上一套語音合成器。它持續聆聽,並在講者說話的同時進行翻譯,隨時判斷該等待更多上下文,還是立刻跟上以保持同步。實際使用時,它會落後講者幾秒鐘並持續輸出,因此對話不會每講一句就卡住。
Google 列出三項讓它與早期系統不同的能力。它能自行偵測超過 70 種語言,不需要事先設定語言。它保留講者的語氣、節奏與音高,因此輸出聽起來仍像那個人在說話,而不是中性的播報員。它也能在嘈雜、難以預測的音訊環境中維持表現,而這正是多數翻譯展示刻意避開的情境。
模型內建的取捨
連續翻譯帶有一種回合制系統得以避開的設計抉擇。太早翻譯一句話,會得到一個只依據一半資訊、但速度很快的答案;太晚翻譯,則會破壞即時對話的感受。Google 的模型會時時刻刻在兩者之間取得平衡,權衡多等一拍是否會改善輸出,以及落後講者更多的代價。這個決定使用者看不見,卻是結果是否堪用的關鍵。
音高與節奏的保留,在即時對話之外又開啟了第二種用途。如果一個聲音能跨越語言而不改變身分,那麼單次錄音就能變成所有支援語言的配音,這正是微軟對其新語音模型所做的承諾,也是配音業者一直緊盯這個領域的原因。只要口音與時間點抓準,輸出就不再像翻譯。
它會出現在哪裡
這次發布同時在三條路線上推出。開發者可透過 Gemini Live API 與 Google AI Studio 以公開預覽版使用。企業用戶本月可在 Google Meet 內使用私人預覽版。消費者則可在 Android 與 iOS 的 Google 翻譯應用程式中全球使用,這個受眾遠大於開發者族群,也顯示 Google 把它當成產品,而非研究展示。
開發者這一側才是真正有趣的工作所在。Live Translate 以串流方式處理音訊,因此可直接放進多語通話、會議、課堂與直播中,不必從頭打造翻譯層。包括 Agora、Fishjam、LiveKit、Pipecat 與 Vision Agents 在內的整合夥伴,已經處理好即時媒體的底層串接,這意味著開發者大多只需處理介面與產品邏輯,而不用管傳輸。
Grab 正在測試這款模型,用來解決一個明確且可衡量的問題。司機與乘客往往不講同一種語言,而上車地點的交接正是溝通不良代價最高的時刻。Grab 每月處理超過 1,000 萬通語音通話,因此即使只是小幅改善也值得投入。
為什麼連續翻譯勝過回合制
延遲只是回合制與連續翻譯差異的一部分。回合制系統需要一個句子結束的訊號,這在照稿演示中很容易,在真實語音中卻很困難——人們會話說到一半停住、重講、插話,甚至講到一半就換語言。等待清楚界線的系統,不是錯過界線,就是延後回應。持續生成的系統則能一路跟著講者走完這些狀況。
這樣的設計也改變了輸出的用途。如果翻譯晚幾秒抵達,而且用的是講者自己的聲音,你就可以在會議中一直開著它,讓它像環境音一樣播放,而不必去讀字幕。字幕要求你去看,音訊則要求你去聽。對於重視眼神接觸的對話而言,聽著對方用你的語言繼續說話,與盯著他們臉下方冒出的文字,是截然不同的體驗。
語氣與音高的保留,作用比聽起來更大。保留原講者抑揚頓挫的翻譯語音,承載著平板合成語音會丟失的資訊:猶豫、強調,以及一句玩笑和一句威脅之間的差別。把這些都抹去的機器翻譯,可能技術上準確,卻仍誤判了意圖。
一週內門檻被推進兩次
Live Translate 問世的這個月,語音領域相當擁擠。微軟在 10 月 1 日推出三款模型,其中包括 MAI-Transcribe-2-Streaming,它在僅僅 100 毫秒多一點就開始產生文字,支援 60 種語言並可在其間自動切換;以及 MAI-Voice-2.1,能說 26 個地區的 23 種語言,並在轉換語言時維持單一聲音身分。Sota Labs 發布了 Saydi,一款涵蓋超過 68 種語言的會議助理,透過瀏覽器擴充功能接入 Google Meet、Zoom 與 Teams。
把這些拼在一起,競爭的輪廓就很清楚。微軟把耳朵與嘴巴當成兩個獨立零件賣,由開發者自行組裝。Google 則推出一個同時處理對話兩個方向的單一模型,並先推到消費者面前。雙方都在壓低首次音訊延遲,也雙雙把跨語言一致的聲音當作主打特色,因為那正是讓翻譯通話感覺像通話的關鍵。
仍然困難的地方
語言涵蓋數字容易公布,卻難以驗證。一款能偵測 70 多種語言的模型,並不代表能把每一種都翻得一樣好,差異會出現在專業詞彙、慣用語與人名上。Google 翻譯自身的歷史在這裡很有啟發性:這項產品上市已二十年,每月處理超過一兆個字詞,卻仍在人類口譯員視為理所當然的語境判斷上吃力。
更難的問題是同意與身分。一款能在你不會的語言中重現你聲音的模型很好用,同時也是讓人替你說出你沒說過的話的工具。微軟把聲音複製鎖在審核與同意檢查之後。Google 尚未公布 Live Translate 的對應細節,而 Meet 內的私人預覽顯示,他們仍在摸索界線該劃在哪裡。
還有音訊會被如何處理的問題。一個存在於會議中的即時翻譯層會看到所有說過的話,這讓一項工具變成了紀錄。這些音訊會保留多久、誰能查詢,以及是否會用於訓練下游任何東西,都是企業買家在啟用之前會問的問題。
這些都擋不住這個轉變。翻譯連續不斷地運作、用講者自己的聲音、在你口袋裡本來就有的手機上進行,讓這項功能從「你得另外打開的東西」變成「它就一直開著」。停頓曾是機器在場的最後一個明顯跡象。Google 只是讓它變成可有可無。