← ブログに戻る
Ai読了目安 14 分

言語と視覚のための一つのフレームワーク:Horizonの16億パラメータオープンモデル

公開日 2026年10月4日
言語と視覚のための一つのフレームワーク:Horizonの16億パラメータオープンモデル

華中科技大学、北京交通大学、Horizon Roboticsの論文が、新規性があるとは思えないほど基本的に聞こえるものを提案している。それは、言語と画像を同じ種類のものとして扱う単一モデルだ。

このフレームワークはMultimodal Flow、略してMF-1と呼ばれ、完全にオープンだ。最大バージョンは16億パラメータで、1500億の事前学習トークンで訓練されている。GenEvalでは82.8、DPG-Benchでは75.3を記録し、小規模なモデルをはるかに大規模なマルチモーダルシステムと並べる位置づけにしている。

ひと言でいえば

ほとんどのマルチモーダルモデルは組み立て品だ。テキストモデルと画像モデル、あるいは言語バックボーンに別個の視覚コンポーネントをボルトで留め、離散トークンや別々のエンコーダを通して表現をやり取りする。MF-1はそうしない。テキストと画像を共有埋め込み空間で一緒にモデル化し、Flow Matchingを両者のための単一の生成目的関数およびサンプリング手順として使う。

暗闇の中で曲がる透明なガラスのリボン、暖色と寒色に照らされて

そこが興味深い主張だ。モダリティ間の境界で翻訳するのではなく、モデルは言語と視覚が根本的に異なる対象ではない一つの連続表現上で動作する。著者らは、これが現在の主流である離散的およびハイブリッドなアプローチの弱点を回避すると論じている。

もしこれが持ちこたえれば、報酬は汎用性だ。言語モデリング、視覚理解、画像生成、編集、動画シーケンスを扱う単一のフレームワークは、専門家のパイプラインよりも訓練、拡張、推論がはるかに単純だ。また、他のモダリティ、つまり順序付けられた連続ブロックとして表現できるあらゆる入力が、再設計なしに同じ構造に収まる未来を指し示している。

優雅さを超えてこれを望む実用的な理由がある。新しいモダリティをシステムにボルトで留めるたびに、維持すべき新しいインターフェースと、エラーが蓄積する新しい場所が生まれる。視覚エンコーダを言語モデルに連結すると、画像は言語モデルが理解できるトークンに要約されなければならず、その要約は情報を失う。共有表現は翻訳ステップを飛ばし、そこでは多くの微妙な品質がマルチモーダルシステムから漏れ出る。

クレジットに載った名前

著者リストの一つの詳細は再注目に値する。著者には、Horizon Roboticsの創業者で、かつてBaiduのディープラーニング取り組みのアーキテクトだった余凱(Yu Kai)と、共同創業者の黄暢(Huang Chang)がいる。責任著者は華中科技大学Vision Labの王興剛(Wang Xinggang)だ。

余の名前が論文に載るのは日常的ではない。彼は2016年以降、ほとんど発表していない。当時は自然場景におけるテキスト検出を統一する初期の試みに参加していた。言語と視覚を統一する論文に今再登場するのは、業界がそれを重要にする計算資源とデータを持つ瞬間に、10年前に取り組んだ問題へ意図的に戻ってきたように読める。

以前の講演で彼に帰せられた示唆的な一節がある。VLA、VLM、エンドツーエンド、ワールドモデルといったバズワードは、技術的というより商業的に意味を持つことが多く、真剣なチームは概ね似たことをしている、というものだ。それらのカテゴリのいくつかを一つの生成フレームワークに折りたたむ論文は、その見方と一致する。ラベルは根底にあるメカニズムより重要でないという主張だ。

なぜ小さくオープンであることが重要なのか

競争力のあるスコアを出す16億パラメータモデルは、他のラボから出てくる小規模モデルが注目されるのと同じ理由で注目に値する。パラメータ当たりの能力は、何がローカルで動き、何がスマートフォンで動き、小さなチームが何をファインチューニングできるかを決める指標だ。

1500億の訓練トークンもフロンティア基準では控えめで、このアプローチが力技ではなく効率的であることを示唆する。その効率性がより大規模でも生き残るかは未解決の問題だ。うまく振る舞う小規模モデルは手法について何かを語るが、すべてを語るわけではない。

ここでオープンウェイトが重要なのは特定の理由からだ。統一生成フレームワークは、他の人々がそれを拡張し、著者らが試さなかったモダリティでテストし、共有表現の上に構築できるなら最も役立つ。クローズド版なら興味深い論文だろう。オープン版はツールだ。

ベンチマークがカバーしないもの

GenEvalとDPG-Benchは、モデルがプロンプトをどれだけ忠実に画像へ変換するかを測る。それらは、統一表現がテキストと画像を一緒に推論するモデルの能力を改善するかについては何も言わない。それが実際の主張だ。モデルは、二つのモダリティをたまたま数値形式を共有する別々のサブシステムとして扱いながら、画像忠実度で良いスコアを出すこともあり得る。著者らはこのギャップを認識しており、論文の本当の主張はアーキテクチャにあり、スコアにはない。この研究を評価する人にとって正しい問いは、共有表現が両方のモダリティを同時に必要とするタスクでの振る舞いを変えるかどうかであり、まさにそれをベンチマークは測っていない。

正直な未知の点

モダリティを一つの空間に統合するのは強い主張であり、強い主張は精査を招く。ベンチマークスコアは本物だが、それらは画像生成忠実度を測るのであって、共有表現が実際に、枠組みが示唆するようにモダリティを横断してモデルの推論を助けるかどうかを測るものではない。良いGenEvalの数値を得ても、なおテキストと画像を埋め込み空間の隣人として扱い、真に同じ素材として扱わないモデルであることはあり得る。

もう一つの未知はスケールだ。連続的な統一表現は歴史的に理論上は魅力的で実践上は頑固だった。訓練信号が離散的な設定より安定化しにくいことがあるからだ。16億パラメータでの成功は心強いが、まだ決定的ではない。

次に指し示す先

明らかな拡張は動画と音声で、どちらも連続信号であり、したがって連続表現に基づくフレームワークに自然に適合する。著者らはこれに言及し、順序付けられた連続ブロックとして表現できるあらゆるモダリティを対象としてよいとしている。もしアプローチが持ちこたえれば、報酬は、チームが元の著者らが触れなかったモダリティへ拡張できる単一のパイプラインだ。これがここでのオープンウェイトの約束だ。完成品ではなく、他者が自分の問題に合わせて曲げられる基盤である。

より大きな全体像

これを注目に値するものにしているのは、モデルよりも方向性だ。この分野は何年もかけて、別々のテキストシステムと視覚システムの間にますます精巧な橋を架けてきた。MF-1は、橋は不要であり、言語と画像を互いに異質なものとして扱うのをやめ、同じ土台でモデル化するのが正しい動きだという賭けだ。

もしその賭けが正しければ、実用的な結果は最高の意味で退屈だ。一つのフレームワーク、一つの訓練目的、一つのツールセットを、次に必要とするどんなモダリティにも適用する。もし間違っていても、それはこの領域に長い歴史を持つチームによるよく管理された実験であり、検証できるようオープンに公開されている。

いずれにせよ、興味深いのは、この問題を10年間見てきた人々が今、再び取り組むことを選び、巨大なモデルではなくオープンで小規模なモデルで行うことを選んだ点だ。その組み合わせは通常、欠けていたのは規模ではなく手法だと誰かが信じているシグナルだ。

関連記事