← ブログに戻る
Ai読了目安 15 分

ElevenLabsは音声を解決し、そして「聞かれること」の値段を上げた

公開日 2026年10月3日
ElevenLabsは音声を解決し、そして「聞かれること」の値段を上げた

9月28日、ElevenLabsは2つの音声モデルを公開した。Eleven v4はナレーションと台本のある対話のために設計されている。Eleven v4 Turboはライブ会話向けで、推論レイテンシの中央値は100ミリ秒前後、最初の発話までは約150ミリ秒だ。その2日後、同社は従業員向けのテンダーオファーを完了し、企業価値は220億ドル——2月時点の110億ドルから倍増した。

この2つの発表は、実は同じ1つの発表だ。音声モデルが人々に遅延を意識させないほど高速になれば、残る問いは「誰が本物らしく聞こえるか」であり、それは値札の付いたプロダクトの問いである。

レイテンシは最後の技術的な言い訳だった

音声エージェントには、何年も前から頑固な失敗の型がある。言葉は正しいのに、タイミングがずれている。一拍長すぎる沈黙は、役に立つアシスタントを、ユーザーが電話を切ってしまう何かに変えてしまう。そしてその修正は、いつもより多くのハードウェアか、より短い文だった。Turboの数値は、人間が気づく閾値を下回っている。100ミリ秒前後というのは、通常の会話の間(ま)とほぼ同じ長さだ。つまり遅延は、機械が考えているようには読まれなくなり、人が考えを巡らせているように読まれ始める。

新しいアーキテクチャは90以上の言語に対応し、v3の70以上から増えている。ただし、数よりも重要な細部がある。英語の録音からクローンした声は、元のアクセントを引きずるのではなく、自然な日本語のアクセントで日本語を話す。単一のスポークスパーソンを複数市場向けにローカライズするブランドは、よりクリーンな結果を得られる。登場人物のアクセントに依存するフィクションでは、デフォルト任せではなく意図的な選択が必要になる。

リクエストは最大1万文字まで受け付けるようになり、以前の上限の2倍になった。[laughs]、[whispers]、[said angrily] といったインラインのデリバリータグは引き続き機能し、重ねて使うこともできる。インスタント・ボイスクローンは、依然として約10秒の音声を必要とする。

70数言語から90以上への増加は、クローンした声がそれらをまたいでどう通用するかの変化に比べれば小さい。1つの録音で、十数の市場にまたがる製品の顔を務められるようになり、どのバージョンも同じ人物が地元のアクセントを無理に真似ているようには聞こえない。スポークスパーソンを1人だけローカライズする企業にとって、それは言語ごとに2回目の収録を必要としていた工程を1つ消し去る。

表現力こそが金になる場所

Artificial Analysisはv4を表現力で1位にランク付けし、ElevenLabsはブラインドテストで約75%の聴取者がv4を好んだと報告している。どちらの数値も同社かそのパートナーによるものなので、誰かがテストを再実行するまではマーケティング資料として扱うべきだ。それでも、方向性は雄弁に語っている。今や主要なラボはどれも明瞭な音声を生成できる。差別化要因は、長い録音を通じて、章ごとに声が揺らぐことなく、トーンやペース、認識できるパーソナリティを音声が運べるかどうかに移った。

商業的な状況も、別の角度から同じことを示している。会話エージェント向けプラットフォームのElevenAgentsは、今やElevenLabsの売上の55%を占める。音声は、主にオーディオブックのナレーションとして売られているのではない。話すソフトウェアのインターフェース層として売られているのだ。

この変化が価格体系を説明する。API経由でEleven v4は1,000文字あたり0.08ドル、Turboは0.04ドル。どちらも10月12日まで割引され、それぞれ0.022ドルと0.011ドルになる。予算を立てる際に基準にすべきは通常料金のほうだ。ローンチ割引は一時的であり、修正を加えると文字数が増えるからだ。Turboにはもう1つ、見落としやすい制約がある。Text to Dialogue WebSocketは、v4では1接続あたり最大10の登録済みボイスを受け付けるが、Turboでは1つだけだ。

市場の他のプレイヤーも立ち止まってはいない

音声をエージェントのインターフェースとして扱っているのはElevenLabsだけではない。9月30日、Inception LabsはMercury Voiceを発表した。低レイテンシの音声エージェント向けに特化して作られた拡散言語モデルで、最初の回答トークンまでの時間の中央値は320ミリ秒、ローンチ時の価格は会話1分あたり約0.9セントだ。Sunoは音声モデルをベータ版で出荷した。Vercelはマイクロソフトの音声モデルを、データ保持ゼロで自社のAI Gatewayに追加した。

両者のアプローチは、難しい部分をどこに置くかで異なる。ElevenLabsは合成を製品そのものとして扱い、言葉のモデル化は別に行う。Inceptionは言語モデルをレイテンシの予算に組み込み、背後にあるモデルが考えるのに2秒かかるなら、高速な合成層は役に立たないと主張する。どちらも筋は通っており、そして衝突し続けるだろう。音声エージェントを体験しているユーザーには、どのコンポーネントが遅かったのか分からないからだ。

心地よくない部分

クローニングは、所有者の本人確認の義務化と、著名な公人に対する無断クローンをブロックするフィルターによって守られている。それは妥当な下限であって、解決策ではない。今や高忠実度のクローンには10秒のサンプルで十分であり、誰かの音声を10秒持っている人の数は、事実上すべての人に等しい。

どのフィルターも対処しない二次的な問題がある。表現力豊かなモデルが特定の人物のように聞こえることに長けるほど、検証シグナルとしての声の価値は崩壊する。声紋はかつて弱い証拠だったが、今やほとんど証拠にならない。顧客の声を認識しているという前提で本人確認を組み立ててきた銀行やコールセンターは、2年前から静かにその前提を引退させてきたが、今回のリリースでその引退は待ったなしとなった。

レイテンシの数値も、聞こえるほど広い話ではない。それはElevenLabs自身のベンチマーク手順で、ネットワーク遅延を除いて測定されている。実際のアシスタントは、依然としてリクエストを認識し、回答を決定し、ネットワークを越えてそれを届けなければならない。Turboが取り除くのは、いくつもの遅延源がある連鎖のうちの1つにすぎない。

暗く磨かれた表面の上、湾曲したガラス管を通って進む光の穏やかな波形。ティールに温かな琥珀色のハイライト

このバリュエーションが本当に語っていること

8か月でバリュエーションを倍にすること——しかも新規のプライマリー資本ではなく3億ドルのセカンダリー売却で——は、リテンションと、まだコモディティ化していないカテゴリーについての声明だ。音声モデルは、ユーザーが品質を即座に認識し、そのために乗り換える、珍しいAI製品である。ハイパースケーラーも専門の競合もこぞって製品を出しており、品質の差は縮まってきている。

220億ドルという数字の背後にある賭けは、その差が対価を取れるほど広いままであり続け、エージェントプラットフォームが生の合成価格の下落よりも速く成長し続けるというものだ。Turboがローンチ時に1,000文字あたり0.011ドルへと動いたことは、その賭けの後半のほうが難しいことを示唆している。声の限界費用がゼロに近づけば、まだ売れるものは、他に誰も持っていない声である。

また、画像や動画の企業が苦戦するなかで音声企業がこのようなバリュエーションを維持できるのには、構造的な理由がある。音声エージェントは、あらゆる通話、あらゆるセッションで継続的に動く。だから利用量は、単発の生成ではなく、製品の成功に応じてスケールする。ナレーションとエージェントは経済性が異なる。一方はプロジェクトであり、もう一方は止まらないメーターだ。ElevenLabsは後者に向けて構築してきた。そして売上の55%という数字が、その戦略が機能したことを示している。次の1年が答える問いは、その品質の優位性が、メーターが回り続けるのに十分な長さ生き残るかどうかだ。

同社自身の位置づけも同じ方向を指している。ローンチ資料は、正確さや速度ではなく表現力を前面に出している。その2つはいくつかのリリース前から差別化要因ではなくなったからだ。音声エージェントが本物らしく感じられるためにやらねばならないのは、40分のセッションを通じて、ためらい、強調、一貫したアイデンティティを運ぶことであり、それはきれいな段落を生成するよりも難しい目標だ。それを勝ち取るモデルは、必ずしも1文字あたり最も安いものではない。人々が、以前話したことのある人物と区別がつかない出力を出すモデルだ。そしてそれは、超えられるたびに上がっていく基準である。

関連記事