アリババは音声エージェントを二つに分割し、価格を最大95%削減した

アリババのQwenチームは2026年9月の最終週にQwen-Audio-3.1をリリースした。音声認識、テキスト読み上げ、リアルタイム対話をカバーする5モデル構成のオーディオスタックである。最も速く拡散した数字は値下げ幅だった。リアルタイムモデルが約85%オフ、テキスト読み上げが約70%オフ、自動音声認識に至っては最大95%オフである。
これらの数字が重要なのは、業界全体が値下げに動いた週に重なったからだ。マイクロソフト、OpenAI、Anthropicがいずれも同じ時期により安価な、あるいはバランスを再調整したモデルを投入しており、アリババの動きはとりわけ音声領域における意図的なエスカレーションと読める。しかしQwen-Audio-3.1でより興味深いのは割引ではない。フラッグシップモデルがどう作られているかだ。
一つの声の裏に二つのモデル
看板モデルはQwen-Audio-3.1-Realtimeで、会話の途中でツールを呼び出す必要がある音声エージェント向けに作られた全二重(フルデュプレックス)音声システムである。
その中心的な設計判断は「分割」だ。聞き取りと発話を担う単一の大規模エンドツーエンドシステムの代わりに、Qwenは音声エンコーダと言語モデルのバックボーンを共有する二つのモデルを動かす。判断モデルが、聞き続けるか、話し始めるか、止めるか、再開するかを予測する。実際の発話は別の生成モデルが担う。平たく言えば、一方がいつ話すかを決め、もう一方が何を話すかを決める。
この分割は、ある特定の失敗に対する実用的な答えだ。音声エージェントが壊れていると感じられるのは、多くの場合、あなたを誤解しているからではなく、タイミングを誤っているからだ。話を遮る、黙り込む、あるいはこちらが話し終える前に答えてしまう。これまでの対処法は、より大きなモデルにターンテイキングを継ぎ足し、その挙動が自然に現れることを期待するというものだった。Qwenは「いつ話すか」を、コンテンツ生成とは切り離された独自のエンジニアリング課題として扱い、専用のモデルを与えている。同社によれば、あるベンチマークでは話者を間違えた応答が0.13から0.03に減少し、別のベンチマークではフィラーワード率が0.759から0.296に低下した。同時にトレードオフも報告しており、割り込み後の不要な再開率は0.035から0.130に上昇している。これはリリースノートがほとんど含まない種類の開示である。
このモデルはマネージドAPIとして提供される。Qwen-Audio-3.1-Realtime-PlusはQwenCloud上でWebSocket経由で動作する。オープンウェイトは存在しない。Qwenのオープンな画像分野の取り組みを追っている人にとってこれは重要で、音声スタックはクローズドなマネージド製品として運営されているからだ。
スペックと価格
リアルタイムエンドポイントは、テキストと音声の両方を入力および出力として扱う。コンテキストは262Kトークンまで、最大入力245K、最大出力16K。デフォルトのスループット上限は毎分60リクエスト、10万トークン。価格は音声入力が100万トークンあたり6.4ドル、テキスト入力が100万トークンあたり0.8ドル、テキストと音声を合わせた出力が100万トークンあたり24ドルで、出力テキストには一切課金されない。関数呼び出し、ウェブ検索、構造化出力、コンテキストキャッシュ、ファインチューニングはすべて組み込みである。
伴走するモデルであるQwen-Audio-3.1-ASR-Flash-Filetransは、長尺音声のオフライン文字起こしを対象とする。ホットワード、話者分離、句読点、複数言語に加えて中国語の方言の認識をサポートし、価格は100万トークンあたり入力0.15ドル、出力0.47ドル。大規模な長尺文字起こしのコストを見積もったことがある人なら、かつては固定費だったものが急激に下がったことがわかるだろう。
トレーニングの話は三つの層に整理されており、QwenはこれをThink、Act、Speakと呼んでいる。Think層は、数百万時間規模のペアデータを使って音声モデルをソースのテキストモデルに再アンカリングし、あらかじめ書かれた答えを模倣するのではなくオンポリシー蒸留を適用する。Act層は実行可能な環境を構築し、それぞれがツールプール、ステートフルなデータベース、記述されたビジネスポリシーを束ね、タスクはまず終端状態で採点される。Speak層は、話すかどうか、いつ話すか、どのように話すかを決める。
Act層のこの細部こそ、少し立ち止まって考える価値がある。採点は文言を確認する前に結果の状態を確認するため、流暢な返答で失敗したアクションを救うことはできない。雑談するのではなく何かをすることを期待されたエージェントを評価する正しい方法である。
なぜ価格競争こそが本題なのか
アーキテクチャを取り除いてしまえば、Qwen-Audio-3.1は明確な戦略的動きである。アリババは開放性ではなく、音声インフラのコストとレイテンシでOpenAIやGoogleと競争しているのだ。
これを読み解く鍵となる比較がレイテンシだ。Qwenは割り込み時の停止レイテンシが約1.116秒であると報告しており、GPT-Realtime-2の0.383秒と対比される。ユーザーが割り込んだときに停止するのが遅いのは明らかな弱点であり、Qwenが勝利と並べてこれを公表した事実は、音声領域のベンチマーク文化の現状を物語っている。そこでは、正直な数字が依然として差別化要因なのだ。
開発者にとって実用的な効果は、より安価なバックエンドである。リアルタイム音声が85%安くなり、認識が最大95%安くなるなら、これまでプレミアム層に限定されていた音声機能が普通の製品でも実現可能になる。常時聞き取り、ライブ翻訳、エージェント向けの音声インターフェースは、すべてそのコスト曲線の下流にある。話した1分のコストが崩壊すれば、前四半期には手が届かなかった製品判断が、今四半期には自明になる。
ただし、これはすべてのマネージドAPIに当てはまる注意点である。手に入るのは挙動であり、内部ではない。ターンテイキングモデルを検査することも、自分のデータで意思決定ロジックを完全に制御できる形でファインチューニングすることも、スタックを自前のハードウェアで動かすこともできない。ほとんどのスタートアップにとって、これは許容できるトレードオフだ。レイテンシ特性やデータ経路そのものが製品であるようなものを作っている人にとっては、コストに織り込むべき依存関係である。
競争環境がこの点を際立たせる。同じ9月の期間に、OpenAIとAnthropicはいずれもより低コストでより多くの処理を行うことを前面に出したモデルを投入し、マイクロソフトは自社ラインにストリーミング文字起こしモデルと二つのテキスト読み上げモデルを追加した。音声はもはや、小さなラボが誰にも気づかれずに最高になれる静かな一角ではない。最大手が価格とレイテンシで公然と競うカテゴリであり、買い手にとっては良いニュース、音声にプレミアムを課している側にとっては締め付けである。
注目すべき点
明らかな疑問は、Qwenが最終的にこのスタックの一部をオープンソース化するのかどうか、そして二モデル設計がベンチマーク条件ではなく実際のマルチターンのツール呼び出し負荷の下でどこまで耐えるかである。ターンテイキングをコンテンツから切り分けるのは、紙の上ではエレガントだ。ユーザーが割り込み、気が変わり、文の途中でタスクを切り替えたときにそれがエレガントであり続けるかどうかは、デモが答えてくれない種類の問いである。
今のところ、結論はもっと狭く、より明確だ。アリババは音声エージェントの中で最も壊れていると感じられていた部分を取り上げ、名前を与え、専用のモデルを割り当てた。そしてカテゴリ全体が安くなるまで価格を下げた。今後一年の音声製品が、より安価で、より割り込み可能な音声の上に築かれるなら、このリリースはその理由の一つとして見られるだろう。
関連記事
Step 5はバージョン番号を4つ飛ばしてオープンモデル2位に着地した。だが誰もAPIを叩いていない
ベンチマークの順位は、作り手がモデルを評価するために使うシグナルだ。呼び出し量は、使い手が実際に使うことで生み出すシグナルだ。
Gemini Omni 1.1 Flash、4つのリクエストを連結して40秒のショットに。ワークフローこそが製品だ。
Googleは、価格設定にレビューゲートを組み込んだ制作パイプラインを投入した。
Microsoft、部分文字起こしのレイテンシを100ミリ秒に短縮。文字起こしの目的が変わる。
100ミリ秒を下回ると、文字起こし製品は誰かがまだ話している間に応答できる。
Synthesiaは10年をかけてアバターを録画してきた。今度は、アバターに話し返してもらおうとしている。
人が自発的に繰り返す研修ツールは、誰かに割り当てられてこなすツールとは別物だ。