Sunoがついに話す、そして自前のサウンドトラックを携える

10月1日、SunoはWeb、iOS、Androidの全ユーザーを対象に、Speechのパブリックベータを公開した。アイデアや詩、すでに書いた台本を入力し、その下に重ねたい声と音楽のムードを指定する。Speechはその2つを1つのトラックとして返してくれる。
Sunoの最高製品責任者ジャック・ブロディは発表の中で、これを声と音楽を1つのまとまりあるトラックとして同時生成する初のオーディオモデルだと説明した。この位置づけが製品のすべてだ。合成音声を作るツールは数多くあり、音楽を作るツールも数多い。ここでの売りは、リズムとムードが生成されると同時に意味に合わせられることで、後からエディターで無理やりつなぎ合わせるのではない。アマチュアのポッドキャストのイントロがみんな息絶えるのは、まさにその後付けの編集工程である。
仕組みは意図的にシンプルだ。シンプルモードでは「嵐を前に船員を奮い立たせる船長」のような自然言語のプロンプトを受け取り、スピーチと楽曲の両方を生成する。アドバンストモードでは正確な台本を入力し、声の性別、声のスタイル、ペース、各生成にどれだけ多様性を持たせるかを調整できる。きれいなナレーションだけが欲しい場合は、音楽を完全にオフにするトグルもある。ベータ版では1回の生成は約8分までに制限されている。
ここでベータが意味するもの
Sunoはこの製品の現状について、異例なほど率直だ。ブロディのメモによれば、イギリス英語のアクセントが時折オーストラリアまでさまよい出て戻ってくることがあり、劇的なポーズは非常に劇的になりすぎることがあるという。この種の開示はローンチ記事では本来もっとあってしかるべきだが珍しく、音声モデリングがまだどの段階にあるかを物語っている。
同社は対応言語も挙げていない。つまり英語以外での性能は、試してみるまで検証されていない。Sunoの既存ユーザーがグローバルであることを考えれば、スピーチ機能のローンチで言語リストがないのは見落としではなくシグナルだ。音声クローニングは英語でも難しく、より豊かな声調体系を持つ言語ではさらに難しい。Sunoは多くを約束できる前に出荷している。
価格ティア、生成回数の上限、音声の商業利用権についても何も語られなかった。それらはプラン詳細に記載されており、Sunoのこれまでの経緯を踏まえれば、Speechをクライアントワークで使おうと考えている人は注意深く読むべきだ。
ライセンスへの転換
Sunoのこの1年は、スクレイピングから契約へという緩やかな転換だった。9月9日には、Warner Music Group、BMG、Believeと共同で構築した音楽モデル世代であるv6をリリースした。ファミリーは3つに分かれる。旗艦モデルのv6、ProおよびPremier加入者向けの探索志向のv6-wild、そして全員向けのv6-miniだ。Sunoによれば、v6は平易な言葉を使って既存曲の一部を編集し、複数のソースから1回のリクエストでマッシュアップを作成し、音声を分離して新しいビートを構築し、テキスト、音声、画像、動画から音楽を生成し、曲全体を作り直さずに1行の歌詞を書き換えられる。v6の展開に伴い、同社は旧モデルを廃止し、プラットフォームを完全に新世代へ移行させる計画だ。
これは本物の機能向上であり、同時に法務戦略でもある。ライセンス契約はSunoを被告からパートナーへと変える。同社が構築中だと語るオプトインのアーティスト体験、つまりアーティストが参加を選び報酬を得る仕組みは、訴えられるのをやめたい企業の形そのものだ。
訴訟は止まっていない。Sony MusicとUniversal Music Groupは著作権侵害でSunoを訴え、2026年9月には、より古い、侵害の疑いがあるモデルを使って合成音声を生成し、新しいモデルの学習に使うという「モデルロンダリング」の告発で訴訟を拡大した。これはスクレイピングした楽曲で学習したという主張よりも鋭い。企業がクリーンアップしたと述べた後も続く侵害の連鎖を描写しているからだ。
一方、CEOのMikey ShulmanはSpeechローンチと同じ日にBloombergへ、Sunoは直近で報告した200万加入者と3億ドル収益を大きく超えていると語った。それほどの規模の企業がスピーチへ進出するのは、単に機能を追加している以上のことをしている。1つのサブスクリプションの下に生成オーディオツールのポートフォリオを築き、顧客が離れる理由を減らそうとしているのだ。
これが仕事を圧縮する相手
新しいツールについて適切な問いは、それが何をするかではなく、誰の仕事を置き換えるかだ。Sunoが1か月の非公開テストで報告した用途から判断すると、4つのグループがすぐに影響を受ける。
ショートフォーム動画のクリエイターは最も明白に適合する。音楽的なシグネチャーのイントロ、セグメント間のトランジション、締めのスティング。かつては作曲家と録音セッションを必要とした素材が、今では1回の生成で出てくる。この圧縮は現実だ。以前の制作工程には、人間がトラックを台本に合わせるという厄介なステップがあり、そのステップが今はモデルの中に入っている。
ポッドキャスターにも同様の恩恵がある。オリジナル音楽を下に敷いたナレーション付きセグメントは、2つの問題だったのが1つになった。音楽オフのトグルがあれば、クライアントが必要とするときにクリーンな読み上げを用意できる。
3つ目のグループはそれほど明白ではなく、おそらくより大きい。Sunoが報告したテスト事例は、個人的・半個人的なコンテンツに強く傾いている。友人のテキストメッセージの劇的な朗読、壮大なスコア付きのボイスノート、ガイド付き瞑想、激励の言葉、チーム自身の子どものための寝かしつけの物語などだ。これはSunoの楽曲生成ツールがたどったのと同じパターンである。制作ツールになる前に、誕生日や内輪ネタの定番になった。同社はSpeechも同じ路線に位置づけ、このカテゴリーを「クリエイティブ・エンターテインメント」と呼んでいる。
競合はすでにこの分野にいる。ElevenLabsは2023年以降、音声合成を支配してきた。Adobeにはテキスト読み上げツールがあり、Google DeepMindは10年間スピーチに取り組んでいる。Sunoの強みは音声品質ではない。ベータ版の注意書きが示すように、それは先行各社に後れを取っている。強みは組み合わせだ。1つのプロンプト、1回のテイクで、話し言葉と、すでに互いに合ったオリジナル音楽が得られる。
未解決の部分
Sunoの製品ストーリーと法務ストーリーの間の隔たりこそ、ここが面白くなるところだ。Speechはプラットフォームが作れるものを広げるが、同時にプラットフォームが作ったとして非難されうるものも広げる。ユーザーが選んだスタイルでナレーションを生成する音声ツールは、なりすましに近い。また、スピーチと一緒に音楽を生成するモデルは、音楽側ですでに争われている学習データに関するあらゆる疑問を引き継ぐ。
Sunoのこれまでの答えは、契約と開示だ。レーベルと契約し、アップロードされた音声と歌詞のスクリーニングを追加し、支払いを伴うアーティストのオプトインを約束した。これはほとんどの生成オーディオ企業がしてきたことより多い。しかし確定した答えでもない。モデルロンダリングの主張がもし成り立つなら、それはSuno自身の学習履歴の内部、周縁ではなく中心にある問題を描写しているからだ。
Speechがうまくやるのは、かつて2人の専門家とセッション予約を必要としたステップをなくすことだ。それがしないのは、その背後にあるモデルが、同社が今そうだと語る方法で構築されたのかどうかを解決することだ。この2つの問いは並行して走り続け、そのうち製品を使えば答えが出るのは1つだけである。