Xiaomi、フロンティアと並ぶオムニモーダルモデルを出荷、学習レシピも公開

ある携帯電話会社が9月22日にAIモデルをリリースし、見出しの数字は46だった。これはArtificial Analysis Intelligence IndexにおけるXiaomiのMiMo-V2.6 Proのスコアであり、同社によればリリース時点でオープンソースモデルが記録した最高値だという。
MiMo-V2.6には2つのバージョンがある。Proは大規模な方で、Flashは高速な方だ。Xiaomiによれば、ProはほとんどのエージェントベンチマークでClaude Opus 5やGPT-5.6 Solと同等の性能を発揮し、コーディング、コンピュータ操作、3D推論、創造的タスクの改善を挙げている。これらのモデルはオムニモーダルであり、つまり1組の重みでテキスト、画像、その他の入力を扱う。また、スケールされた強化学習で訓練されており、この部分が能力とリリース形式の両方を説明する。
実際にダウンロードに含まれていたもの
ほとんどのオープンウェイトのリリースは重みを渡して終わりだ。MiMo-V2.6は重み、技術レポート、強化学習環境、学習コードを提供する。Xiaomiは、ライセンスページと順番待ちリストのあるモデルハブを経由させず、4つすべてを自社サイトで公開した。
RL環境が含まれていることが意味のある違いだ。重みがあればモデルを実行できる。環境があれば再訓練できる。ラボが訓練に使った環境を公開するとき、それは振る舞いが何であるかだけでなく、どうやってその振る舞いを得たかを伝えている。結果を再現したい人、あるいは独自の報酬シグナルでモデルをファインチューニングしたい人にとって、環境こそが実際の成果物だ。
また、それはリリースした企業にとって公開コストを高める。環境を公開すると訓練シグナルの形が露出し、それはチェックポイントというよりレシピに近い。競合他社はそれを読んで1年分の試行錯誤を飛ばせる。Xiaomiは、採用と信頼性の利益がそれを上回ると判断したようだ。
なぜデバイス企業がフロンティア研究を行うのか
Xiaomiは、たまたま携帯電話を売っている研究ラボではない。逆であり、その方向性はオムニモーダルモデルが何に役立つかに表れている。
画面を読み取り、写真を理解し、インターフェースを操作し、音声会話で答えられるアシスタントにとって、携帯電話は自然な住処だ。コンピュータ操作、3D推論、創造的生成は、その視点からすると抽象的なベンチマークではない。誰かが手に持っているデバイスで、しばしば遅い接続とバッテリーを守りながら動かなければならないシステムの構成要素だ。能力のためのPro層と遅延のためのFlash層に分かれたモデルファミリーは、研究上の決定であると同時にデバイスロードマップの決定でもある。
重みを公開することには2つの目的がある。公の場でモデルを改善してくれる研究者を採用すること、そして能力の主張がそうでなければ信用に基づいて受け入れられる市場で、自社の立場に下限を設けることだ。自分でダウンロードして評価できるモデルは、マーケティングをあまり必要としない。Xiaomiは、公表された結果の上に全評判を置くラボと開発者の関心を争っている。
オムニモーダルが実際に意味するもの
このラベルは特定のエンジニアリング上の主張を覆っている。1つのモデルが、各入力タイプを別々の専門家に振り分けるのではなく、共有表現を通じて複数種の入力を扱うという主張だ。携帯電話では、代替案が複数のモデルを動かしてその出力をつなぎ合わせることになり、メモリと遅延の両方が携帯端末では乏しいため、これは重要だ。XiaomiのFlash層も同じ理由で存在する。フラッグシップで1秒で答えるモデルも、ミッドレンジデバイスや車内では使えないことがある。そのため、このファミリーは1回のリリースというより、能力と遅延の曲線上の2点だ。

訓練手法が残りを説明する。スケールされた強化学習とは、モデルが次のトークンを予測するようにだけ訓練されるのではなく、報酬シグナルに対して最適化されることを意味し、業界全体で最近のエージェント性能の跳躍を支えたアプローチだ。また、環境が重みと同じくらい重要である理由でもある。報酬シグナルは、それを生み出す環境と同じくらいしか良くならない。したがって、環境を公開することは、結果を公開するより手法を公開することに近い。
デバイスが流通チャネルである
Xiaomiの強みは、ユーザーに到達するために開発者エコシステムを必要としないことだ。数千万人にハードウェアを出荷しており、携帯電話アシスタント内で動くモデルは、モデルハブが1年で到達するより多くの人に四半期で到達する。だからこそリリース形式は寛大なのだ。重みとレシピは、失うライセンス収入が比較的小さく、そうでなければベンチマークのスクリーンショットからモデルを判断する研究コミュニティからの信頼を買う。
リスクは強みと同じだ。携帯電話アシスタントは毎回動作するかどうかで評価され、20回に1回タスクに失敗するエージェントは、チャットウィンドウでは迷惑であり、支払い、写真、メッセージも扱うデバイス内では負債となる。能力ベンチマークはそのギャップを測らないし、46という複合スコアも測らない。
同じ火曜日、他に3つのリリース
タイミングは示唆に富む。9月22日、Xiaomiのモデルは、Alibabaが9月20日にオープンウェイト化し同日の雲栖大会で発表したAlibabaのQwen-Image-2.1、そしてTencent Cloud APIで2K画像1枚あたり0.15元のプロ向け画像モデルTencentのHy Image 3.5プレビューと並んで登場した。Unitreeは同じ期間を使い、6,500ドルからで22自由度の器用なロボットハンドDex5-Sを発表した。
Alibabaはまた、このカンファレンスでQwen3.8-MaxがArtificial Analysisのエージェントリーダーボードで1位、フロントエンドプログラミングのCodeArenaで1位だと主張し、Qwen4が訓練中で、後継モデルは5兆から10兆パラメータを計画していると述べた。Qwen-Image責任者は、チームの目標はパラメータ数を最大化することではなくタスク完了のコストを下げることだと指摘した。これはMiMoの2層構造が行っているのと同じトレードオフだ。
これらの発表はどれも調整されたものではなく、すべて同じ方向を指していた。この秋の中国AIにおける競争上の問いは、フロンティア級のモデルが存在するかどうかではない。そのうちどれだけを手元に置けるかだ。
ベンチマークの注意点
46のような数字は、その背後にある指標に完全に依存しており、Artificial AnalysisのIntelligence Indexは複数ある複合指標の1つにすぎない。Claude Opus 5やGPT-5.6 Solとの比較はXiaomiが行ったもので、Xiaomiが選んだベンチマークに基づいており、「ほとんどのエージェントベンチマーク」という表現は、結果の表の方がよりうまく果たせる役割を担っている。特にエージェントベンチマークはスキャフォールディングに敏感で、同じモデルでも周囲のものによってスコアが大きく変わりうる。
この主張を単なるマーケティング以上にしているのはダウンロードだ。46を疑う人は誰でも、モデルを実行し、レポートを読み、Xiaomiが提供した環境で再訓練できる。それはリーダーボードのスクリーンショットより厳しいテストであり、企業が結果と一緒にレシピを公開することを選んだからこそ可能なのだ。