← ブログに戻る
Ai読了目安 13 分

GoogleのGemini 3.5 Live Translateが会話の間をなくす

公開日 2026年10月7日
GoogleのGemini 3.5 Live Translateが会話の間をなくす

ライブ翻訳はこれまでずっとターン制の芸当だった。あなたが話し、システムはあなたが話し終えるのを待ち、考えてから結果を読み返す。その間はわずかだが、会話を変えてしまう。なぜなら、両者とも機械に仕事をさせるために止まるからだ。Googleの新しいGemini 3.5 Live Translateは、その間を消すために作られている。

今月発表されたこのモデルは、合成器を後付けした文字起こしパイプラインではなく、音声対音声のオーディオモデルだ。継続的に聞き取り、話者が話すそばから翻訳し、より多くの文脈を待つか、同期を保つために今進むかを瞬間ごとに判断する。実際には話者を数秒遅れで追いかけながら動き続けるので、文ごとに会話が止まることはない。

Googleは、以前のシステムと一線を画す3つの能力を挙げている。まず、事前に言語設定を構成しなくても、70以上の言語を自動で検出する。次に、話者の口調、ペース、ピッチを保つので、出力は中立的なアナウンサーではなく、話している本人のように聞こえる。そして、多くの翻訳デモが避けるような騒がしく予測不能な音声でも耐える。

モデルに織り込まれたトレードオフ

継続的な翻訳には、ターン制システムが避ける設計上の選択が伴う。文を早すぎる段階で翻訳すれば、情報の半分だけで作られた速い答えになり、遅すぎればライブ会話の感覚が壊れる。Googleのモデルは、一拍待つことで出力が良くなるかと、話者からさらに遅れるコストを天秤にかけ、瞬間ごとに両者のバランスを取る。この判断はユーザーには見えず、結果が使えると感じられるかどうかを左右する核心だ。

ピッチとペースの保持は、ライブ会話に加えてもう一つのユースケースを生む。声がアイデンティティを変えずに言語をまたげるなら、1つの録音が対応するすべての言語の吹き替えになる。これはMicrosoftが新しい音声モデルに掲げた約束と同じであり、吹き替え業者がこの領域を注視してきた理由でもある。アクセントとタイミングを正しく取れれば、出力は翻訳のように聞こえなくなる。

どこで使われるのか

このリリースは同時に3つのトラックで展開されている。開発者はGemini Live APIとGoogle AI Studioを通じてパブリックプレビューとして利用できる。企業ユーザーは今月、Google Meet内でプライベートプレビューを利用できる。消費者はAndroidとiOSのGoogle翻訳アプリで世界中で利用でき、これは開発者セグメントよりはるかに大きなオーディエンスであり、Googleがこれを研究デモではなく製品として扱っている証拠だ。

興味深い作業が横たわるのは開発者側だ。Live Translateは音声をストリームとして処理するため、翻訳レイヤーをゼロから作らなくても、多言語通話、会議、クラス、ライブ配信に組み込める。Agora、Fishjam、LiveKit、Pipecat、Vision Agentsなどの統合パートナーがすでにリアルタイムメディアの配管を済ませているので、開発者はトランスポートではなく、主にインターフェースとプロダクトロジックを扱うことになる。

Grabは、具体的で測定可能な問題に対してこのモデルをテストしている。運転手と乗客は共通の言語を持たないことが多く、乗車地点での受け渡しは、誤解が高くつくまさにその場面だ。Grabは月に1,000万件以上の音声通話を扱っているため、それらの通話が少しでも改善する価値は追いかけるに値する。

なぜ継続型がターン制に勝るのか

レイテンシは、ターン制翻訳と継続型翻訳の違いの一部にすぎない。ターン制システムは文が終わったという信号を必要とする。それは台本のあるデモでは簡単だが、現実の話し言葉では難しい。人は途中で声を濁らせ、言い直し、口を挟み、思考の途中で言語を切り替える。きれいな境界を待つシステムは、境界を見逃すか、返答を遅らせるかのどちらかになる。継続的に生成するシステムなら、そのすべてを通して話者を追いかけられる。

その設計は、出力の目的も変える。翻訳が数秒遅れで、しかも話者本人の声で届くなら、会議中もつけっぱなしにして、字幕を読む代わりに環境音のように流しておける。字幕は見ることを求めるが、音声は聞くことを求める。アイコンタクトが重要な会話では、相手が話し続ける間、その人を自分の言語で聞くのは、相手の顔の下にテキストが現れるのを見るのとは違う体験だ。

口調とピッチの保持は、聞こえ以上に大きな役割を果たしている。元の話者の抑揚を保つ翻訳音声は、平板な合成音声が失う情報を運ぶ。ためらい、強調、冗談と脅しの違いなどだ。それをそぎ落とした機械翻訳は、技術的には正確でも、意図については間違っていることがある。

一週間で最低ラインが二度動いた

Live Translateは、音声分野が混み合う月に登場した。Microsoftは10月1日に3つのモデルを出荷した。その中には、100ミリ秒強でテキストを生成し始め、60言語を自動切り替えで扱うMAI-Transcribe-2-Streamingや、26ロケールにわたり23言語を話し、言語を変えても単一の声のアイデンティティを保つMAI-Voice-2.1が含まれる。Sota LabsはSaydiをリリースした。これは68以上の言語をカバーする会議アシスタントで、ブラウザ拡張を通じてGoogle Meet、Zoom、Teamsに接続する。

部品を並べてみると、競争の形は明らかだ。Microsoftは耳と口を別々の部品として売り、開発者が組み立てる。Googleは会話の双方向を担う単一モデルを提供し、まず消費者に届けている。どちらも初回音声のレイテンシを下げようとしており、どちらも言語をまたいで一貫した声を目玉機能にしている。それが、翻訳された通話を通話らしく感じさせるからだ。

まだ難しいこと

言語カバレッジの数字は公表するのは簡単で、検証するのは難しい。70以上の言語を検出するモデルでも、すべてを同等にうまく翻訳するわけではなく、違いは専門用語、慣用句、固有名詞に表れる。Google自身の翻訳の歴史はここで示唆に富む。この製品は20年間市場にあり、月に1兆語以上を処理しているが、それでも人間の通訳者が当然視する文脈には苦戦する。

より難しい問題は同意とアイデンティティだ。自分が話さない言語で自分の声を再現するモデルは便利であると同時に、自分が言っていないことを言わせる道具にもなる。Microsoftは音声クローニングを承認と同意確認の後ろに制限している。GoogleはLive Translateについて同等の詳細を公表しておらず、Meet内でのプライベートプレビューは、まだ線引きを模索していることを示唆している。

音声がどうなるかという問題もある。会議の中に入り込むライブ翻訳レイヤーは、話されたことをすべて見聞きする。つまり、便利なツールが記録になってしまう。その音声がどれだけ保持され、誰が検索でき、下流で何かの学習に使われるのかは、企業の購入者が導入前に必ず尋ねる質問だ。

それでもこの変化は止まらない。話者本人の声で、すでにポケットにあるスマートフォン上で、継続的に動く翻訳は、この機能をわざわざ開くものから、ただオンになっているものへと移す。あの間は、機械がその場にいることを示す最後の明白なサインだった。Googleはそれを任意にしたのだ。

関連記事