Microsoft、部分文字起こしのレイテンシを100ミリ秒に短縮。文字起こしの目的が変わる。

2026年10月2日、Microsoft AIはMAI-Transcribe-2-Streamingを発表した。これは60言語にわたり、100ミリ秒強で部分文字起こしを返す音声認識モデルだ。最終文字起こしと部分文字起こしの両方の精度でArtificial Analysisの首位に立つ。導入価格は音声1時間あたり0.54ドルで、年末まで適用される。
同社はまた、MAI-Voice-2.1とMAI-Voice-2.1-Flashを発表した。これらは23言語、26ロケールをカバーする。このモデルはAzure Speech、Microsoft Foundry、MAI Playground、OpenRouter(ID: microsoft/mai-transcribe-2)、Vercel、Azure Voice Liveから利用可能で、LiveKit統合は近日提供とされている。
100ミリ秒はベンチマークの珍しい数字ではなく、しきい値だ。それは人が瞬時と知覚する境界に位置する。これを下回ると、インターフェースは誰かがまだ話している間に応答できる。そしてそれが、文書を生成する製品と会話に参加する製品の違いである。

最終精度だけではすべてを語れなかった理由
音声認識は何年も前から成熟したカテゴリーであり、リーダーボードは主に一つのことだけを測ってきた。話者が話し終えた後、完了した発話をモデルがどれだけ正確に文字起こしするか、という点だ。この指標は文字起こしサービスが気にする問いに答える。しかし、ライブ製品が気にする問いには答えない。
話者が話し終えた後にしか単語を表示しない会議アシスタントは、整形機能が優れたレコーダーにすぎない。単語が到着するたびに表示する会議アシスタントは、現在の発言者を強調し、名前が言及された瞬間にそれを表示し、話題がまだ議論されているうちに検索をトリガーし、誰かが文の途中でスクロールバックしても位置を失わないようにできる。これらはすべて、最終精度ではなく部分遅延に依存している。
部分精度はより難しい問題であり、Artificial Analysisが現在別途追跡しているのはこれだ。文が完成する前に安定した推測を生成するということは、後で修正しなければならないかもしれない解釈にコミットすることを意味する。頻繁に修正するモデルはちらつくテキストを生成し、それは待つよりも悪い。あまりに積極的にコミットするモデルは画面上に誤りを残す。部分文字起こしのランキングは、読者が見ているものを信頼できるほど十分に暫定テキストを正確に生成するモデルを評価する。
Microsoftが両方のボードで首位を主張していることは、暫定の安定性を最終的な正確さと引き換えにしていないことを意味する。それはモデルが部分的な速度を手に入れる通常の方法だ。その組み合わせこそが、実際の発表内容である。
100ミリ秒という数字
ストリーミング認識におけるエンドツーエンド遅延は、単一の数値ではなく連鎖である。音声はフレーム単位で到着する。エンドポインティングモデルが発話が終了した可能性がある時点を判断する。認識モデルがテキストを生成する。下流システムがそれをレンダリングする。各リンクが遅延を加え、合計が体験がライブに感じられるかどうかを決める。
Microsoftの100ミリ秒という数値は、独立した遅延監査ではなく、同社自身の測定とArtificial Analysisでの順位に基づく、モデル自身の出力を対象としている。関連する比較は、ライブ製品が生み出す条件下でこの数値が維持されるかどうかであり、それは単独のストップウォッチ測定とは別の問いだ。複数の話者、背景ノイズ、質の悪い会議用マイク、そして同じパイプラインに到着する60言語といった条件である。ベンダーがそれらの条件下での遅延分布を公表することはまれであり、それこそが会議製品が実際の会議で使えるかどうかを決める。
価格構造は話のもう半分だ。音声1時間あたり0.54ドルは年末までの導入価格であり、Microsoftがそれを変更することを見込んでいることがわかる。戦略的意図は明らかだ。ストリーミング文字起こしは、あらゆる会議アシスタント、コールセンター分析製品、ライブキャプションサービスの入力レイヤーである。60言語で最安の高速オプションであることは流通戦略であり、入力レイヤーにおける流通は粘着性がある。なぜなら、2番目にプロバイダーを切り替えるチームは、異なる暫定挙動のセットに合わせて処理を再構築しなければならないからだ。
何と競合するか
Microsoftは空の分野に参入しているわけではない。Deepgram、AssemblyAI、Speechmaticsはいずれもストリーミング精度と低遅延でビジネスを築いており、GoogleとAmazonは競争力のある認識を自社のクラウドスタックにバンドルしている。現実的な買い手は、すでにAzure上で運用しており、MAI-Transcribe-2-Streamingが他のMAIファミリーとともにFoundryやOpenRouterに登場することを評価し、1つのコンポーネントのために2つ目のベンダー関係を維持したくない開発者である。
MAI-Voice-2.1の発表もここで重要であり、その組み合わせは意図的だ。音声認識と音声合成は同じ会話の両端であり、両方を販売するプラットフォームは単一のパイプラインを提案できる。音声を入力し、トランスクリプトを出力し、応答を合成し、音声を返す。合成側で23言語と26ロケールを追加することで、そのパイプラインを1つの製品として販売できる市場の数が広がる。
高速な部分文字起こしが製品設計に与える変化
暫定テキストが0.1秒以内に到着するようになると、以前は不合理だった一連のインターフェース上の決定が普通になる。
中断を考えてみよう。文字起こしが話者の停止後にしか確定しないなら、システムは発言内容に基づいて行動する前に沈黙を待たなければならない。つまり、会話がすでに先に進んでしまうまで応答できない。高速な部分文字起こしがあれば、システムはコマンドが発話された瞬間にそれを認識して割り込める。それは、部屋にいる人間に人々が期待する行動だ。バージインをサポートする音声エージェントはこれに依存している。高速な話者に3文遅れずについていく必要があるライブキャプションシステムも同様だ。
検索は2番目の受益者だ。文字起こしが書かれている最中にそれを横断検索できる会議アシスタントは、プロジェクト名が出た瞬間に、議論がまだ進行中に文書を提示できる。それは、1時間後に検索可能なノートを生成するレコーダーとは根本的に異なる製品だ。
構造化抽出は3番目だ。部分テキストが十分に信頼できるなら、下流モデルは会議が終わる前にそれを読み始め、決定事項やアクションアイテムが発話された時点でタグ付けできる。ここでの利点は、生の速度ではなく、参加者がまだ意図を覚えているうちに出力をレビューできることから生まれる。
これらの行動はそれぞれ、部分的な安定性の重要性を高める。1秒に2、3回も書き換わる文字起こしは、3つの機能すべてを有用ではなく煩わしいものにする。だからこそMicrosoftの発表のより深い話は、レイテンシの数値そのものではなく、部分文字起こしでの精度順位なのだ。
興味深いリスクの所在
文字起こし精度の数値は通常、集計されたパーセンテージとして報告され、その集計値は下にある分布を隠す。アクセントのある話し方、文中での言語間コードスイッチング、子どもの声、非標準のマイクでの性能はモデル間で大きく異なり、それらはまさにライブ製品が最も使われやすい条件だ。強い平均値を示すモデルでも、顧客が文の途中で言語を切り替える特定のコールセンターにとっては間違った選択であり得る。
2つ目のリスクはより戦略的だ。文字起こしが継続的に実行できるほど高速で安価になると、自然な次のステップは常時実行だ。1時間0.5ドルのモデルは、分単位の価格モデルでは難しかった方法で常時リスニングを手頃にする。そして常時リスニングとは、デバイスの近くで話されたすべてを周囲の録音することだ。これはデータガバナンスの決定であり、精度リーダーボードがこの製品を購入するチームに代わって下すものではない。
MAI-Transcribe-2-Streamingは本当に有用なインフラであり、部分精度のランキングは注目に値する部分だ。なぜなら、それはライブ製品が実際に依存する指標を測っているからだ。未解決なのは、ベンダーが測定した100ミリ秒という数値が、音響の悪い部屋で4人が互いに話をかぶせる状況でも維持されるかどうかだ。それは、買い手が本番パイプラインを投入する前に、非公開で実行するテストである。
関連記事
Step 5はバージョン番号を4つ飛ばしてオープンモデル2位に着地した。だが誰もAPIを叩いていない
ベンチマークの順位は、作り手がモデルを評価するために使うシグナルだ。呼び出し量は、使い手が実際に使うことで生み出すシグナルだ。
Gemini Omni 1.1 Flash、4つのリクエストを連結して40秒のショットに。ワークフローこそが製品だ。
Googleは、価格設定にレビューゲートを組み込んだ制作パイプラインを投入した。
Synthesiaは10年をかけてアバターを録画してきた。今度は、アバターに話し返してもらおうとしている。
人が自発的に繰り返す研修ツールは、誰かに割り当てられてこなすツールとは別物だ。
文章を書くことを拒否するモデルが、今や1日1兆トークンを処理している
はるかに優れたインターフェースを備えた分類器。ソフトウェアがすでに構造化してほしかった作業に向けたもの。