VibeVoiceは半分しかオープンソース化しなかった——失われた半分こそが教訓

MicrosoftのVibeVoiceリポジトリにはMITライセンスが付与され、約55,000のスターが集まり、その説明文は約束事のように読める。すなわち、オープンソースのフロンティア音声AIだ。だが実際にそこに含まれているのは、モデルが懸念を抱くほど強力になったとき「オープンソース」が何を意味するのかという教訓である。
この話は二つの方向に進む。一方ではリポジトリは成長を続け、残された部分は本当に役に立つ。もう一方では、最も高性能な部分が消えた。2025年9月、MicrosoftはVibeVoice-TTSの推論コードをリポジトリから削除した。同社がプロジェクトの意図に反すると述べた使われ方を人々がしているのを発見した後である。そのモデルの重みは依然としてHugging Face上にある。しかしそれを動かすコードはない。今日その特定のモデルを使いたい人は、自力で何とかするしかない。
この決定は2026年におけるリポジトリの使われ方のすべてを形作っており、どんなベンチマークよりも示唆に富む。
実際に中に入っているもの
現在の目玉はVibeVoice-ASRだ。70億パラメータの音声認識モデルで、最大60分の音声を一度に文字起こしできる。単に言葉を書き留めるだけではない。誰が、いつ、何を話したかを返し、話者ラベルとタイムスタンプを備えた構造化出力を生成する。50以上の言語を言語フラグなしで扱い、カスタムホットワードも受け付けるので、想定される人名や専門用語を渡して、それらをめちゃくちゃに書き換えるのをやめさせられる。
その中核の周りには、いくつかの縮小版が用意されている。音声がまだ届いている間にテキストをチャンク単位で出力するストリーミングASR版もあり、録音全体を待てない場合に役立つ。GPUなしのCPUで動作するBitNetビルドもあり、約1.58GBに圧縮されている。このサイズのモデルとしては驚くべきことだ。さらにVibeVoice-Realtime-0.5Bがある。小型のストリーミング音声合成モデルで、最初の音声に約200~300ミリ秒で到達する。プリセット音声を備え、特筆すべきは音声クローニングがないことだ。

7.5Hzの仕掛け
このファミリーを束ねる技術的な着想は、異常に低いフレームレートで動作する音声トークナイザーだ。毎秒7.5フレームである。ほとんどの音声トークナイザーは50Hz以上で動作する。低いレートが重要なのは、同じコンテキストウィンドウにはるかに多くの音声を収められるからだ。1秒あたりのトークンが少なければ、モデルのメモリにより多くの秒数が収まるため、1回のパスで1時間の会話全体をカバーできる。
低いフレームレートは通常、忠実度を犠牲にするが、VibeVoiceは2段階の設計でこれを解決している。言語モデルが意味論を担当し、何が話され、誰が話しているかを決め、拡散ヘッドが細かな音響的ディテールを生成する。トークナイザーは、拡散ヘッドがその役割を果たせるだけの音声品質を保てばよい。これはきれいな分業であり、このモデルが長いウィンドウと細部を同時に両立できる理由である。
作れるものと作れないもの
音声を扱う人にとって、VibeVoiceの使える半分は十分に大きい。話者ラベル付きの会議の文字起こし、ポッドキャストの話者分離、誰がいつ何を言ったかを知る必要があるインタビューのワークフロー、ライブアプリケーション向けのストリーミング認識、そして控えめなハードウェアで動くアシスタント向けの軽量な音声——これらすべてが今日手の届くところにある。特にCPUビルドは、専用GPUのないマシンで認識を実行する道を開く。これはコスト面でも、GPUが乏しい場所への展開という面でも重要だ。
使えない半分は、VibeVoiceを有名にした部分である。オリジナルのVibeVoice-TTSは、最大4人の異なる話者で最大90分の音声を合成でき、ICLR 2026で口頭発表論文として採択された本物の研究的進歩だった。その機能こそ、今日リポジトリから実行できないものである。有名なバージョンは、実際には撤回されたバージョンだったのだ。
スペクトラムとしてのオープンソース
VibeVoiceの事例は、業界が好んで語る整った物語を複雑にする。一方には、オープンと呼ばれるモデルがある。つまり重みがダウンロード可能ということだ。もう一方には、クローズドと呼ばれるモデルがある。VibeVoiceはその中間に位置する。重みはオープンで、ライセンスは寛容で、そして最も有望なモデルを実際に使うのに必要なコードは消えている。推論コードなしで重みを公開することは中間的な道であり、賭け金が大きくなるにつれて、より高性能なモデルが落ち着く先かもしれない。
実用上の厄介な点もある。このリポジトリは自らを完成品ではなく研究フレームワークと説明しているので、期待もそれに合わせるべきだ。その名前でPyPIからインストールできる公式のPythonパッケージは存在せず、同名のパッケージはMicrosoftのプロジェクトではない。またMicrosoftは、モデルは研究用であり、さらなるテストなしに商用利用することは推奨しないと述べている。ライセンス自体は寛容であるにもかかわらず、だ。これはライセンスだけ読んでREADMEを飛ばしたチームが驚く類のギャップである。
だが、これによってこのリリースが失敗になるわけではない。ASRモデルは強力で、ストリーミング版は役に立ち、CPUビルドは本当に巧妙だ。しかしこれは、「オープンソース」が今や幅広い取り決めを包含しており、その具体的な取り決めがラベルよりも重要だということを思い出させる。TTS機能を必要とするチームは、プロジェクトを計画する前に、その後ではなく、知っておくべきだ。
問う価値のある問い
VibeVoiceが提起する正直な問いは、コードを削除することが誤用への正しい対応なのかどうかだ。重みは依然としてそこにあるので、そのモデルを実行しようと決意した人は何とか方法を見つけられる。一方で、与えられたライセンスの下でコードを責任を持って使ったかもしれない人々は、それへのアクセスを失った。これが、高性能なモデルが広まるにつれてあらゆるラボが直面する緊張関係である。ツールを制限すれば、不注意なユーザーよりも慎重なユーザーのほうにより多くの不便を強いることになり、ツールを開放すれば、ある程度の誤用が起こることを受け入れることになる。
Microsoftは中間を選んだ。役に立つ音声認識の成果はオープンに保ち、よりリスクの高い合成コードは撤回した。他のラボは異なる判断をするだろうし、ユーザーは見出しを信じるのではなく、細かい但し書きを読み続けなければならない。VibeVoiceを研究する価値があるのは、それが珍しいからではなく、技術が成熟するにつれて、より多くのリリースがどのように構成されるかの予告編だからである。
オープンモデルの上に構築する人にとっての教訓は、コミットする前に確認することだ。使いたい重みに、それを動かすコードが付属しているかを確認する。ライセンスとREADMEの両方を読む。両者は食い違うことがあるからだ。依存する予定のバージョンが1年後も保守可能かどうかを確かめる。どれも胸躍るものではないが、プロジェクトを始めて6か月後に、必要だったモデルの半分がそもそも公開されていなかったと気づくよりは、はるかに安くつく。VibeVoiceは、「オープンな重み」と「使える」の違いを見逃しようがないものにすることで、この分野に恩恵をもたらした。
関連記事
Decagon の PACT プロトコルは「同意」を標準にしようとしている
Decagon は、個人エージェントの身元と、顧客が与えた権限を検証するプロトコルをオープンソース化した。地味な配管だが、エージェント経済が機能するかを決める。
AI「再会」ブーム:まだどう感じるべきか決めきれない中国の議論
AI の追悼動画が亡くなった著名人を中国の画面に連れ戻し、数十万の「いいね」を集めた。そして反発が来た。争点は「同意」だった。
Apple はオープンなマルチモーダルモデルを公開し、ほとんど誰にも知らせなかった
研究優先のこのリリースは主流の視野を静かにすり抜けたが、細粒度の視覚グラウンディングは Apple の AI スタックの行き先を語っている。
OpenCut と「オープンソース版 CapCut」の瞬間
無料で MIT ライセンスの動画編集アプリが GitHub のトレンドを上り続け、ロードマップには AI エージェント向けの MCP サーバーが含まれる。AI メディアを囲む道具がモデルに追いつきつつある。