← ブログに戻る
Ai読了目安 13 分

Bilibili、Apache-2.0の下で150言語対応の翻訳モデルファミリーをオープンソース化

公開日 2026年10月2日
Bilibili、Apache-2.0の下で150言語対応の翻訳モデルファミリーをオープンソース化

BilibiliのIndex LLMチームは9月30日、AlibabaのQwen3.5を基盤に構築された多言語翻訳モデルファミリー「Index-Translate」を公開した。テキストモデルは中国語と英語を含む150言語をカバーし、Apache-2.0ライセンスの下、Hugging FaceとModelScopeで2B、9B、35B-A3Bサイズで公開されている。最後のサイズはまだプレビュー段階であり、技術レポート、GitHub上のコード、オンラインデモも合わせて公開されている。

動画プラットフォーム発の翻訳モデルファミリーは、二度見する価値がある。プラットフォームが実際に何を必要としているかを物語っているからだ。Bilibiliは字幕文化が根強く、言語の壁を越えるコンテンツへの需要が高まる中国の動画コミュニティである。そうした企業にとって、翻訳は副次的なプロジェクトではなくインフラだ。

単なる翻訳モデルにとどまらない理由

わかりやすい点は言語数で、これは多いが前例がないわけではない。Index-Translateを際立たせているのは、翻訳そのものではない部分にどれだけ工学的な作り込みがなされているかだ。

モデルは、用語、書式、そして変更してはならないコンテンツに関する指示に従う。プロジェクトページの例では、9BモデルがJSON形式のゲームメンテナンス通知を韓国語に翻訳する際、その構造、星記号、ユーザーが保持を求めたハッシュタグを維持した。控えめに聞こえるかもしれない。しかし、実際のローカライゼーションパイプラインを運用したことがある人なら、そうではないとわかる。マークアップ、プレースホルダー、製品名、法的定型文、インライン書式は、機械翻訳が最も頻繁に壊す箇所であり、その後のクリーンアップが、自動化で節約できるはずだった時間を食いつぶす場所である。

3つのブランチと、それが重要な理由

このファミリーは同じ多言語基盤を3つの専門方向へ拡張しており、このブランチこそが今回のリリースを本当に興味深いものにしている。

Index-Echoは、元話者の声の特徴を保った翻訳字幕または吹き替え音声を生成する。パッケージ化されたSpeech-to-Speechリリースは、中国語から英語、スペイン語、日本語への変換と、その逆方向に対応している。声を保持する吹き替えは、音声認識、翻訳、声のクローニング、音声合成が交差する難問であり、各段階で誤差が蓄積する。ある声が別の言語でも同じ人物のように聞こえるかどうかは、視聴者が受け入れる吹き替えになるか、途中で切ってしまう吹き替えになるかの差である。

Index-Homuraは、翻訳を目標の音節数に近づけるよう調整する。これは吹き替えと字幕の制約だが、ほとんどの翻訳システムは完全に無視している。動く口や固定された字幕枠に言葉を合わせる場合、完璧に正確でも40パーセント長すぎる翻訳は失敗した翻訳である。意味を保ちながら長さを制約することは、研究モデルと制作チームが使えるツールを分ける、まさに狭く実践的な問題だ。

Index-NativeLongは、Index-NailongというモデルIDで公開されており、文書全体を翻訳し、文書をまたいで参照の一貫性を保つ。文書レベルの一貫性は、もう一つのよくある失敗に対処する。つまり、各文が孤立して翻訳された結果、2ページ目と9ページ目で同じ用語が別々に訳されてしまう問題だ。マニュアル、契約書、長文コンテンツにとって、その不一致はスタイルの好みではなく正確性の問題である。

オープンライセンスの選択と、それが示すもの

研究専用や非商用ライセンスではなくApache-2.0の下で公開することは、重大な決断である。これは、これらのモデルを商用利用で基盤にできることを意味し、開発元のプラットフォームと競合する製品であっても可能だ。これは広く寛容な姿勢であり、今回のサイクルでモデルを公開する中国のラボの間では、ますますデフォルトになっている。

このパターンはここ1か月ずっと見られている。9月には複数の中国チームがテキスト、画像生成、動画、翻訳にわたるオープンウェイトモデルをリリースし、共通する糸は寛容さだった。ここではMIT、そこではApache-2.0、重みはレンタルではなくダウンロード可能。戦略的論理は一貫している。オープンウェイトはAPIだけよりも速くエコシステムの採用を築き、採用は次世代製品で報われるような開発者の引力を生む。

ゼロから学習するのではなくQwen3.5を基盤にすることも、示唆的である。Qwenは、かつて西洋でLlamaがそうだったように、多くの中国製モデルリリースにとって共有基盤に近い存在になっている。複数の独立したチームが1つのベースモデルに収束すると、そのベースは事実上の標準となり、彼らを差別化する作業はスタックの上流、Index-Translateが含むような専門ブランチへと移っていく。

ローカライゼーションは動画制作の静かなコストセンターの一つであり、品質を損なわずに自動化するのは難しかった。字幕と吹き替えはそれぞれ独自の制約を課し、それらを無視するパイプラインは、人間が行単位で修復しなければならない出力を生む。声を保持する吹き替えと音節数制約付き翻訳を汎用テキストモデルと一緒にパッケージ化することで、このリリースはその修復工程を直接狙っている。それが工程をなくすのか、単に縮小するのかは実際のローカライゼーションワークフローでしか明らかにならないが、意図は読み取れる。機械の出力を十分に使えるレベルに近づけ、人間の仕事を書き直しではなくレビューにすることだ。

中国国外にとっての意味

中国のエコシステムの外にいるチームにとって、実際的な帰結はアクセスだ。音声と文書のブランチを備え、寛容なライセンスで提供される150言語の翻訳ファミリーは、ダウンロードしてローカルで実行でき、製品にローカライゼーションを組み込む誰にとっても本当に有用な資産である。特に、プライバシーやコストの理由から原文をホスト型APIに送信できない場合にそうだ。

音声ブランチは、動画に携わる人なら特に注目に値する。声を保持する吹き替えと音節数制約付き翻訳は、自動ローカライゼーションが視聴に耐えるものを生むか、各行を人間が修正しなければならないものを生むかを決める2つの能力だ。両方をApache-2.0ライセンスの下で扱えるモデルは、これまで吹き替え予算が必要だった動画コンテンツを、小規模チームがローカライズする障壁を下げる。

注意点は、新しいリリースにいつも付きまとうものだ。公開されたベンチマークはモデルを構築したチームによるもので、独立した評価には時間がかかる。35B-A3Bのプレビューは完成したモデルと同じではない。そして寛容なライセンスだからといって、特定の言語ペアや領域にとって自動的に最良の選択になるわけではない。それは自分のコンテンツで試す必要がある。

明確なのは方向性だ。翻訳は、単一の開かれたタスクではなく、制約付きの指示追従タスクの集合として再構築されつつあり、勝つモデルは、字幕、吹き替え、文書構造という厄介な現実を尊重するものになる。Index-Translateは、まさにそうした現実をよく狙った一撃であり、自由に基盤として使える。

関連記事