谷歌 Gemini 3.5 实时翻译:消除对话中的停顿

实时翻译一直是一种“轮流发言”式的把戏。你说话,系统等你讲完,思考片刻,再把结果念出来。这个停顿很短,却改变了对话的性质,因为双方都得停下来等机器干活。谷歌全新的 Gemini 3.5 Live Translate 就是为删掉这个停顿而生的。
这款本月发布的模型是语音到语音的音频模型,而不是在转录流水线上外挂一个语音合成器。它持续聆听,随着说话人一路译出内容,并在每一刻判断:是再等一点上下文,还是立刻输出以保持同步。实际使用中,它落后说话人几秒钟并持续跟进,因此对话不会每说一句就卡住。
谷歌列出了让它区别于早期系统的三项能力。它能自行识别 70 多种语言,无需事先配置语言设置。它保留说话人的语气、节奏和音高,因此输出听起来仍然像本人在说话,而不是一个中性的播音员。并且在嘈杂、不可预测的音频环境中依然稳健——而这恰恰是大多数翻译演示会回避的场景。
模型内置的取舍
连续翻译带来一个轮次式系统所回避的设计选择。过早翻译一句话,得到的是建立在半截信息之上的快速答案;过晚翻译,又会破坏实时对话的感觉。谷歌的模型每时每刻在两者之间权衡:再等一拍能否改善输出,与进一步落后于说话人的代价,孰轻孰重。这个决策对用户不可见,却决定了结果是否好用。
音高与节奏的保留,在实时对话之外又开启了一个用例。如果一种声音能跨语言传递而不改变其身份,那么一段录音就能变成所有支持语言的配音版本——这正是微软为其新语音模型所许下的承诺,也是配音行业一直密切关注这一领域的原因。把口音和节奏处理到位,输出就不再像翻译。
它出现在哪里
此次发布同时在三条线上推进。开发者可以通过 Gemini Live API 和 Google AI Studio 以公开预览版的形式使用。企业用户本月可在 Google Meet 中体验私有预览版。普通消费者则可在 Android 和 iOS 的 Google Translate 应用中全球范围内使用——这个受众规模远大于开发者群体,也表明谷歌把它当作产品而非研究演示来对待。
开发者这一侧才是真正有趣的工作所在。Live Translate 以流的方式处理音频,因此可以直接接入多语言通话、会议、课堂和直播,无需从零搭建翻译层。包括 Agora、Fishjam、LiveKit、Pipecat 和 Vision Agents 在内的集成伙伴已经完成了实时媒体的底层管道,这意味着开发者主要处理界面和产品逻辑,而不必操心传输。
Grab 正在针对一个具体且可衡量的问题测试该模型。司机和乘客常常语言不通,而上车点的交接环节恰恰是沟通失误代价最高的地方。Grab 每月处理超过 1000 万次语音通话,因此哪怕这些通话只有小幅改善,也值得去争取。
为什么连续翻译优于轮次式翻译
延迟只是轮次式翻译与连续翻译之间差异的一部分。轮次式系统需要一个句子结束的信号,这在脚本化的演示中很容易,在真实语音中却很难——人们会话说半截、重新表述、插话,甚至说到一半切换语言。等待清晰边界的系统,要么错过这个边界,要么延迟回复。而持续生成的系统则能全程跟上说话人。
这种设计也改变了输出的用途。如果翻译比说话人晚几秒、并且用的是说话人自己的声音,你就可以在会议中一直开着它,让它作为环境音频持续播放,而不必去读字幕。字幕要求你去看,音频则让你去听。在那些眼神交流很重要的对话里,一边听对方用自己的语言继续说下去,一边保持对视,与看着文字在他们脸下方滚动出现,是两种完全不同的体验。
语气和音高的保留所起的作用比听起来更大。一段保留原说话人抑扬顿挫的翻译语音,承载着平淡合成语音所丢失的信息:犹豫、强调、玩笑与威胁之间的区别。把这些都剥离掉的机器翻译,可能技术上准确,却在意图上出错。
一周之内,基准线被抬高了两次
Live Translate 落地的这个月,语音领域格外拥挤。微软在 10 月 1 日发布了三款模型,其中包括 MAI-Transcribe-2-Streaming,它在 100 毫秒多一点的时间内就开始输出文本,支持 60 种语言并可在其间自动切换;还有 MAI-Voice-2.1,能用 23 种语言覆盖 26 个地区,并在切换语言时保持同一声音身份。Sota Labs 发布了 Saydi,一款覆盖 68 种以上语言的会议助手,通过浏览器扩展接入 Google Meet、Zoom 和 Teams。
把这些拼在一起,竞争格局就很清楚了。微软把“耳朵”和“嘴”作为独立部件出售,由开发者自行组装。谷歌则交付一个同时处理对话双向的单一模型,并率先推向消费者。两者都在压低首次音频输出延迟,也都在把跨语言一致的声音作为主打卖点,因为这正是让翻译通话感觉像通话的关键。
仍然困难的地方
语言覆盖数量容易公布,却难以验证。一个能识别 70 多种语言的模型,并不意味着它对所有这些语言的翻译水平都一样,差异会体现在专业词汇、习语和人名上。谷歌自家 Translate 的历史很有参考价值:这款产品上市二十年,每月处理超过一万亿词,却仍然在人类译员视为理所当然的语境理解上力不从心。
更难的问题是同意与身份。一个能用你不会说的语言复现你声音的模型,既是有用的工具,也可能被用来让你说出你没说过的话。微软对声音克隆设置了审批和同意核查。谷歌尚未公布 Live Translate 的同等细节,而 Meet 内的私有预览也说明,它仍在摸索这条界线该划在哪里。
还有音频去向的问题。一个嵌在会议里的实时翻译层会看到所有被说出的内容,这就把工具变成了记录。这些音频保留多久、谁能查询、是否会用于训练下游模型,都是企业买家在启用之前会问的问题。
这些都阻止不了这一转变。翻译持续运行、用说话人自己的声音、跑在已经在你口袋里的手机上,这让该功能从“你需要单独打开的东西”变成“一直都在的东西”。那个停顿曾是机器在场的最后一个明显标志。谷歌刚刚把它变成了可选项。