← ブログに戻る
Ai読了目安 15 分

中国の新しいオープンモデルはエージェント基盤となるよう訓練されている

公開日 2026年10月3日
中国の新しいオープンモデルはエージェント基盤となるよう訓練されている

先週、中国の研究所から発表された3つのモデルには、パラメータ数の一覧として読むと見落としがちな共通の設計本能がある。いずれも会話が得意になるように作られたものではない。

それらはエージェントが動作する基盤そのものになるように作られている。これは別の目標であり、目的がより優れたチャットボットだと思い込んでいると、そこから導かれる訓練上の選択は奇妙に見える。

タスクとそれを取り巻く世界を訓練する

最も明確な例は、9月29日に智智イノベーション研究所(ZhiZhi Innovation Research Institute)が公開したIQuest-Q1だ。総パラメータ数3,200億、アクティブ150億のスパースなMixture-of-Expertsモデルで、コンテキストウィンドウは524,288トークン。そのアーキテクチャは、訓練手法に比べれば特筆すべきものではない。

人間の会話の文字起こしや静的な指示セットでファインチューニングする代わりに、チームはタスクとそれが行われる環境を一緒に合成した。次にモデルは複数の異なるエージェントスキャフォールドにまたがって訓練された。各スキャフォールド固有のツールとコンテキスト管理はそのままにし、学習シグナルとしてはモデル自身の誤りだけを扱った。ハーネスが教訓になってしまうことは許されなかった。その後、4つの専門モデルがマルチティーチャー・オンポリシー蒸留によって1つに統合された。

これが重要なのは、エージェントを作る誰もが遭遇したことのある問題があるからだ。ベンチマークで高スコアを出すモデルでも、自分のツールで包むと崩壊することがある。他人のハーネスの癖を学習してしまっているからだ。ハーネスを固定したままスキャフォールドをまたいで訓練することは、その特定の失敗を攻撃する。報告されている結果は、自然言語からリポジトリへのタスクでClaude Opus 5のすぐ後ろに付けるモデルであり、得意であることが奇妙で、まさにコーディングエージェントに必要なものだ。

同じステップで見て決める

2つ目のリリースは、同じ目標への異なる道を取る。同じ日、上海AI研究所はShusheng Mingjue(書生・明覚)と呼ばれる意思決定モデルを0.8B、2B、4Bの3サイズで発表した。意図的に小さい。

設計原則は、知覚と意思決定を別々の段階にしてはならないというものだ。ほとんどのエージェントスタックは、スクリーンショットを撮り、それを視覚モデルに渡して説明を得て、その説明をプランナーに渡して行動する。各ホップはレイテンシを増やし、詳細を失う。Mingjueはネイティブな視覚知覚と指示追従を融合させ、モデルが画面を見て一度のパスで判断を下せるようにする。研究所は、意思決定品質でJevや同等のオープンモデルを上回ると報告している。動的な環境内で行動しなければならないエージェントにとって、サイズが要点だ。4Bモデルはループの近くで実行でき、320Bモデルにはできない。

100万トークンに到達するためにアテンション層を削除する

3つ目のリリースは、アーキテクチャ上最も攻撃的だ。北京の研究所NaiveAIによるNaive N0.5 Flashは、総パラメータ数3,090億、アクティブパラメータ155億のMixture-of-Expertsモデルで、XiaomiのMiMo-V2.5をベースにしている。100万トークンのコンテキストをネイティブにサポートし、MITライセンスで提供される。

興味深いのは、何を取り除いたかだ。このモデルはスライディングウィンドウアテンションとDeepSeekのスパースアテンションをハイブリッドで使用し、フルアテンション層を一切持たない。標準的なTransformerのアテンションは系列長に対して二次関数的にスケールするため、長いコンテキストは歴史的に高コストだった。フルアテンションを取り除くことは、長い系列内の有用な情報は構造化されたスパース性を通じて到達できるという賭けであり、それが成り立てば、エージェントが一度に視野に収められるものが変わる。100万トークンは、おおよそ大規模リポジトリ、または長時間の作業セッション分の履歴を、切り詰めずに保持できる量だ。

小規模リリースも同じ方向を指す

このパターンはこれら3つ以外にも現れている。清華大学のPuro-2Bは約4,400ドルで訓練され、15のタスクで平均してより大きなQwenモデルを上回る。ある通信研究所は、文書理解ベンチマークで首位となった1.2Bの文書解析モデルTeleOCRをリリースした。スタンフォード大学とNVIDIAは、推論ではなく埋め込みのアラインメントによって最良の候補行動を選ぶ対照的検証器を公開し、同等の判定モデルに比べて大幅な高速化を報告している。

それらはすべて、ユーザーの目的地ではなく、エージェント内のコンポーネントだ。候補行動を安価に順位付けする検証器、文書を解析する小型モデル、何をクリックするかを決める極小モデル。部品は専門化し、小さくなっていく一方で、セッション全体のコンテキストを保持する1つのモデルは非常に大きくなる。

誰も解決していない評価の問題

このすべてを貫く穴がある。エージェント基盤モデルのベンチマークは、依然としてほとんどがチャットボット評価からの借用であり、間違ったものを測っている。モデルは推論テストで高スコアを出しても、エージェントの基盤としては貧弱であり得る。重要な特性はセッション全体でしか現れないからだ。コンテキストが劣化するまでに何ターン経過するか、失敗したツール呼び出しが適切に再試行されるか、モデルが元の目標を見失ったことに気づくか。

ここで報告されている数値のほとんどは研究所自身によるもので、彼らが定義を手伝ったベンチマーク上でのものだ。自然言語からリポジトリへのタスクでIQuest-Q1が「Claude Opus 5のすぐ後ろ」というのはベンダー比較だ。Mingjueが「Jevを上回る」というのはベンダーの主張だ。Naive N0.5 Flashにフルアテンションがないのは検証が容易なアーキテクチャ上の事実であり、その実用的な帰結はまだ大規模には測定されていない。だからといって方向性が間違っているわけではない。正直な現状は、3つの興味深い設計があり、エージェントが6時間動き続けたときにどれが持ちこたえるかについての独立した証拠はほとんどない、ということだ。

そのギャップは認識され始めている。独立したグループは、コード生成ではなく本番サービングを対象とし、モデル安全性ではなくエージェントハイジャックを対象とするベンチマークを構築してきた。これは、業界が間違った層を測定してきたことを自覚していることを示唆する。それらが成熟するまで、このようなリリースから得られる有用なシグナルはスコアではない。訓練手法だ。エージェントの既知の失敗モードに対処する手法のほうが、リーダーボードに対処する数値よりも本物である可能性が高いからだ。

このシフトには、見落としがちなもう1つの帰結がある。重要なモデルが大きな目的地ではなく小さなコンポーネントになるなら、研究所の優位性は最大のモデルを持つことからではなく、部品をどう組み合わせるかを知ることから生まれるようになる。高速な意思決定モデル、安価な文書パーサー、検証器を訓練し、それらを控えめなハードウェアで動くループに配線できるチームは、単一の巨大チェックポイントでは太刀打ちできないものを持っている。これは別種の競争であり、スケーリングよりもシステムズエンジニアリングに近い。今月登場したリリースは、少なくともいくつかの中国チームがすでにそちらへ方向転換したことを示唆している。

2年間、オープンウェイト競争は、無料モデルがフロンティアチャットボットにどれだけ近づけるかで測られてきた。その枠組みは効力を失いつつある。チャット品質はベースラインになり、ソフトウェアが機能するかを決める問いは別の土台へ移った。コンテキストが劣化するまでに何ターンかかるか、モデルがループ内でどれだけ速く行動できるか、他人のツール群に投入されることにどれだけ耐えられるか。

それらの問いに答えるモデルは、多くのリーダーボードで勝つことはないだろう。それらは、チャットボットがすでに役目を終え、実際に作業を進める必要があるときに、開発者がどれを手に取るかという、より目立たない競争で勝つ。その競争は今週、誰かを会話で感心させようとはしていない3つのリリースの中で、静かに繰り広げられた。

関連記事