← ブログに戻る
Ai読了目安 15 分

AssemblyAI、リアルタイム音声のレイテンシを91ミリ秒に短縮。この数字が重要な理由

公開日 2026年10月7日
AssemblyAI、リアルタイム音声のレイテンシを91ミリ秒に短縮。この数字が重要な理由

AssemblyAIは新しいストリーミング音声認識モデル「Universal 3.6 Pro Realtime」を発表した。単語誤り率は1.77%まで低下。1,000件を超える通話録音でのテストでは、発話終了から最終テキスト出力までのレイテンシ中央値は91ミリ秒だった。P95レイテンシは692ミリ秒から225ミリ秒に低下した。

これらは成熟した技術に対する漸進的な改善に見える。しかし、動いた具体的な数字のゆえに、どちらかといえば閾値となる出来事に近い。

なぜ91ミリ秒は別の製品を意味するのか

音声認識は何年も前からディクテーションには十分な精度を持っている。会話アプリケーションの制約は、単語誤り率ではなかった。それはターンテイキングだった。

人間の会話は速いオーバーラップで進む。話者が話し終えてから次が話し始めるまでの間隔の中央値は約200ミリ秒で、その間隔はよく知った者同士の会話では縮み、言い争いではさらに縮む。これが、あらゆる会話システムが収まらなければならない予算である。

P95レイテンシが692ミリ秒の場合、音声エージェントは明らかに遅れている。ユーザーは適応し(間を置き、繰り返し、システムに被せて話す)、やり取りには、誰もが機械と話していると分かる、ややぎこちない性質が生まれる。P95が225ミリ秒なら、エージェントは思慮深い人間の応答の範囲内に収まる。中央値91ミリ秒なら、ほとんどの人間より速い。

これが、デモとして機能する音声エージェントと、製品として機能する音声エージェントの違いである。そして改善は2倍をはるかに超える。中央値と同じくらい分布が重要だからだ。P95を692から225に削減することは、裾(会話が壊れていると感じさせた応答)がほぼ取り除かれたことを意味する。

これに伴う設計上の帰結があり、しばしば見落とされる。認識が遅いとき、製品チームはエージェントに長いターンを取らせることで補う。つまり、はっきりした間を待ち、完全な段落で話し、ユーザーとのオーバーラップを一切避ける。こうした補償は、言葉が自然であってもユーザーがロボット的だと認識する特定の会話スタイルを生む。

認識が速いとき、エージェントは短いターンを使える。ユーザーがまだ話している間に相づちを打てる。曖昧さが生じた瞬間に、文が終わってからではなく、確認の質問を挟める。この会話スタイルは、レイテンシ予算がそれを許して初めて利用可能になる。つまり、レイテンシの改善は、現在の設計の感触を単に良くするのではなく、異なるインタラクション設計を解き放つ。

このリリースに含まれるその他のもの

このモデルはエンティティ認識型のターン検出を統合している。電話番号や住所など、認識されたエンティティが完了した時点を把握し、句読点に隣接する沈黙をターンの終わりとして扱わない。また、背景ノイズ補正も追加している。

どちらの機能も同じ問題を指している。つまり、本番の音声環境は乱雑だということだ。コールセンターの音声には保留音楽、キーボード音、かぶせ話、訛りがある。単純な無音閾値に依存するターン検出は、話者が考えるために間を置くたびに節の途中で遮断し、音声のように聞こえるノイズの間は回線を開いたままにする。

エンティティ認識型検出は、特定の、そして高コストな種類のエラーに対処する。「私の番号は5 5 5」を完全なターンとして扱うシステムは、半分しか終わっていない文に対して応答を生成し、ユーザーはやり直すことになる。通話全体では、こうしたやり直しが2分のやり取りと6分のやり取りの差になる。

これがエージェントスタックのどこに位置づけられるか

このタイミングは偶然ではない。同じ週に、DecagonはVoice 3と、自らがエージェントである発信者に備えてカスタマーサポートを整えることを目的としたPACTと呼ばれるフレームワークを発表した。Anthropicはサイバー検証の階層を拡充してきた。OpenAIはdecisions APIを公開した。エージェント基盤レイヤーはあらゆる方向で同時に構築されつつあり、音声はレイテンシ予算が最も厳しいインターフェースである。

音声が最も厳しい理由は、テキストエージェントは遅くてもよいからだ。チャットウィンドウに入力するユーザーは数秒の思考時間を許容する。やり取りのモデルに待つことがすでに含まれているからだ。電話中のユーザーは許容しない。1秒を超える沈黙は切断として受け取られ、システムが処理を終える前にユーザーは「もしもし?」と言う。

この非対称性は、リアルタイム音声認識が音声製品における多数の構成要素の一つではないことを意味する。それは製品が何になり得るかの上限を定める。優れた推論と700ミリ秒の認識レイテンシを持つ音声エージェントは、推論がどれほど優れていても、遅い音声エージェントである。推論はきれいなターンで走る機会を決して得られないからだ。

1.77%の誤り率が意味するコスト

単語誤り率の数字には文脈が必要だ。クリーンな朗読音声では、トップモデルはしばらく前から3%を下回っている。名前、口座番号、住所を含むノイズの多いコールセンター音声では、誤り率は歴史的にずっと高く、そこでは集計的な単語誤り率よりもエンティティ精度が重要になる。

ベンダーのテストセットでの1.77%という誤り率は、あなたの音声で何が起きるかを教えてくれない。調達で重要な詳細はもっと狭い。固有名詞の精度、英数字文字列(口座番号、確認コード)の精度、そして話者が認識対象言語のネイティブスピーカーでない場合の精度である。

最後のものは、ほとんどの本番システムが失敗し、ほとんどのベンチマークが測定しない領域である。訛りの多様性はランダムではなく系統的な誤りを生む。「fifteen」を一貫して「fifty」と聞き取る認識器は、平均化では修正されない。AssemblyAIのエンティティ認識型ターン検出は下流の帰結には役立つが、訛りのある音声の文字起こし精度は別の評価である。

実践的な見方

音声を構築する者にとって、このリリースは何に取り組む価値があるかを変える。会話レベルのレイテンシでのストリーミング認識は、製品が割り込み、素早いやり取り、実際の会話に含まれる種類のオーバーラップするターンに対処できることを意味する。以前は技術的には可能でも使うと違和感があったアプリケーションが、今や構築する価値を持つ。

レイテンシと並んでコストの側面も重要だ。この速度でのストリーミング認識は通話中に継続的に実行する必要があり、つまり計算コストは文字起こしされた音声ではなく会話時間に比例して増える。大量展開では、これはユニットエコノミクスを変える。常時オンの認識を前提とするアーキテクチャにコミットする前にモデル化する価値がある。

前提とせずにテストすべき三つのこと。P95ではなくP99のレイテンシ。ユーザーが覚えているのは最悪の1%のターンだからだ。ベンダーのベンチマークセットではなく自分の音声での精度。特に名前と数字に注意を払う。そして割り込み時の挙動。きれいなターンテイキングは処理できても、ユーザーが被せて話すと固まるシステムは、音声が最も重要となるまさにその会話で失敗するからだ。

ほとんどの評価が飛ばす四つ目のテストがある。認識が誤ったときに何が起きるかである。あらゆる認識器は何かを聞き間違える。音声製品の品質は、それがどう回復するかに大きく依存する。確認を求めるか、誤った文字起こしのまま黙って進むか、文脈上あり得ない単語列を識別して再度尋ねることができるか。1.77%の誤り率でも自分の誤りを決して検出しないモデルは、実践では、より高い誤り率でも優れた不確実性シグナルを持つモデルより役に立たない。

より大きな変化は、音声がもはやかつてのようなボトルネックではないことだ。2026年後半の音声製品チームにとっての問いは、スタックの残り(推論、アクション実行、エラー回復)が、人間の速度で動くようになった耳に追いつけるほど速いかどうかである。

関連記事