Ant GroupのLing 3.1 Flash、560Bパラメータのうち25Bをアクティブ化してスコア41を達成

--- title: Ant GroupのLing 3.1 Flash、560Bパラメータのうち25Bをアクティブ化してスコア41を達成 meta_title: Ling 3.1 Flashは560Bパラメータを25Bのコストで動かす meta_description: Ant GroupのLing 3.1 Flashは、総パラメータ560Bのうち25BのアクティブパラメータでIntelligence Indexスコア41を記録し、スパースMoEがどこまで伸びるかを示している。 ---
Ant GroupのAntLingAGIは10月6日にLing 3.1 Flashを公開した。際立つ数字は、総計560Bのうち、モデル実行時に実際に発火する25Bのパラメータだ。
同モデルはArtificial Analysis Intelligence Indexで41を記録し、前世代から明確な進歩を遂げている。評価ではエージェント能力が最も改善の鋭い領域として挙げられており、これは企業の購入者が最も重視し始めているカテゴリだ。
アーキテクチャこそが主張だ
Ling 3.1 FlashはMixture-of-Expertsモデルだ。総計560Bのパラメータを保持するが、トークンあたり約25Bのみをアクティブ化し、最大100万トークンのコンテキストウィンドウをサポートする。
その比率こそが売り込みのすべてだ。同等の能力を持つ密な(dense)モデルは、生成するトークンごとにすべてのパラメータを動かす必要がある。各トークンを少数のエキスパートのサブセットにルーティングすることで、スパースモデルははるかに少ない計算量で同等の出力を実現する。トレードオフはメモリだ。560Bのパラメータすべては依然としてどこかに常駐している必要があり、個々のフォワードパスではその大半が遊休状態にある。

実用的な帰結は、チームが重みを保持できるハードウェアを持っていれば、同じ品質レベルで密なモデルと同等のものの数分の一のコストで提供できるモデルだということだ。これは今年のフロンティア級オープンウェイト公開の大半を牽引してきたのと同じエンジニアリングの物語であり、興味深い指標が総パラメータ数からアクティブパラメータ数へと移った理由でもある。
ベンチマークがカバーする範囲
Ant Groupは一連の評価結果を公開した。GDPVal-AA v2.1でElo 1673、FrontierSWEで75.16、HealthBenchで65.35、そしてDesign ArenaではモバイルアプリケーションとSVG生成で最上位付近にランクインしている。
41というIntelligence Indexのスコアが見出しであり、これによって同モデルははるかに大規模なラボのリリースと同列に並ぶ。Ant Groupはフルモデルをオープンソース化すると述べており、ドキュメントはすでに公開されている。その間、2週間の無料トライアルが実施されている。
エンジニアリングの実演はスコアよりも雄弁だ
Ant Groupは3つの実施例も説明しており、これらはリーダーボードよりも意図された用途について多くを語っている。
第一に、Luaからx86へのコンパイラをゼロから構築し、182件のテストのうち178件に合格した。これは、モデルが大規模な仕様を頭に保持し、多数のファイルにわたって内部的に一貫したコードを生成し、全体を通じてエッジケースを追跡しなければならないタスクだ。この作業は、長文コンテキストの扱いが弱いモデルには過酷だ。
第二に、大規模なPythonコードベースの型チェックを高速化すること。これは新規開発ではなく保守タスクであり、実際のエンジニアリング時間の大半はここに費やされる。既存リポジトリの型の関係性について推論できるモデルは、新しい関数を書くモデルとは違った形で有用だ。
第三に、ブラウザ、ローカルファイル、ターミナルツールを連携させるデスクトップエージェントの構築。マルチツールのオーケストレーションはエージェント作業の現在のフロンティアであり、ベンチマークの跳躍が指し示す能力でもある。
これら3つはいずれも企業による報告であり、独立に再現されたものではない。特に182件のテストのコンパイラに関する主張は外部による検証が必要だ。テストに合格することは、そのテストが代表的である場合にのみ意味を持つからだ。一般的な構文を処理し、珍しいケースで失敗するコンパイラでも、モデルと同じ週に書かれたテストスイートでは良いスコアを出せる。
ここにはより広いパターンも見て取れる。中国のラボは、ベンチマークスコアではなくエンジニアリングの実演を主要なマーケティング手段としてますます活用している。ベンチマークは曖昧になり、実演は具体的だからだ。トレードオフは、実演が問題空間を通る一つの軌跡を示すだけで、結果の分布については何も示さないことだ。
より長い弧:中国のオープンウェイトが繰り返していること
Ling 3.1 Flashは、今年を通じて保たれてきたパターンに当てはまる。中国のラボは、西側のどのラボも追随できていないペースで、寛容なライセンスのフロンティア規模のオープンウェイトを公開しており、生の規模ではなく効率で競っている。
この文脈は率直に述べておく価値がある。これらのモデルのいずれかを稼働させる開発者は推論スタックを自ら保有することになり、トークン単位のAPIコストがかからず、データが建物の外に出ず、サードパーティがモデルの変更時期を決めることもない。プライバシー上の制約があるチームや、予測可能だが重いワークロードを抱えるチームにとって、それは実際の金額に見合う価値がある。
Victor Taelinは今月、Artificial Analysisのランキングのトップ25にオープンモデルが一つも残っていないと指摘し、最良のXiaomiのMiMoは26位にとどまっている。Intelligence Indexで41というLing 3.1 Flashの数値は順位ではなく知能スコアであり、この2つの数値は異なるものを測っている。そして最高のオープンモデルと最高のクローズドモデルの間の隔たりは依然として現実のものだ。変わったのは、その隔たりが、オープンモデルがそもそもその仕事をこなせるかどうかではなく、ポイントで測られるようになったことだ。
モデルを選ぶ人にとってこれが意味するもの
パラメータ比よりも重要な3つの考慮点がある。
ライセンスとデプロイ条件。Ant Groupはモデルがオープンになると述べているが、商用利用が無制限かどうかを左右するのは具体的なライセンスだ。「オープンウェイト」と「寛容なライセンス」が同じではないのに互換的に使われることがいかに多いかを考えれば、本番環境で依存する前に条件を注意深く読む価値がある。同じ注意は、リリースに先立って公開されたドキュメントにも当てはまる。それは義務ではなく能力について述べたものだ。
コンテキストウィンドウの主張。100万トークンは大きな数字だが、実際に使えるコンテキストは通常、宣伝されているよりも短い。モデルがウィンドウ全体にわたって品質を維持するのか、それともかなり手前で劣化するのかが、長文ドキュメントや大規模リポジトリの作業における有用性を決める問いだ。Ant Group自身の長文コンテキストの実演は、モデルが大きな入力を扱えることを示唆しているが、これもまたベンダーによるテストだ。
メモリ要件。560BのスパースモデルはノートPCで動かせるものではない。アクティブパラメータの話が減らすのはトークンあたりの計算量であり、重みの占有量ではない。セルフホストを計画する人は、アクティブ数ではなく総数に合わせてハードウェアを見積もるべきだ。この区別は人々をしばしばつまずかせる。25Bパラメータをアクティブ化すると説明されるモデルは、いざロードしようとするまでは小さく聞こえる。その時点では、560Bの全体がどこかに収まらなければならない。
実用的なサポートの疑問もある。頻繁にリリースするラボのモデルは置き換えられていくものであり、チームは移行パスを計画すべきだ。Ant Groupのリリース頻度を考えれば、Ling 3.2やLing 4は数ヶ月の問題であり、能力面では良いことだが、あるバージョンを前提にファインチューンやデプロイスクリプトを組んだ人にとっては厄介だ。
Ling 3.1 Flashは、着実にリリースを続けてきたラボによる有能なリリースだ。本当のニュースは構造的なものだ。今や25Bアクティブのモデルが、はるかに大規模な密なシステムと堂々と同列に並べるようになった。これはスパースMoEの研究系統全体が唱えてきた主張であり、ベンチマークがようやくそれを裏付け始めている。
関連記事
Google FlowとAdobe Firefly、AI動画をチャットボックスの外へ
基盤モデルの品質は十分に収束し、差別化要因はモデルを取り巻くものへと移った。
Google、Nano Banana 2.1の出力価格を半額にし、最も弱い機能を修正
最も重要な詳細は機能リストの外にあり、それは価格です。
Vida、AIエージェントの課金を利用量ではなく成果で請求へ
利用量ベース課金は、ベンダーの収益をエージェントがより長く時間をかけることと一致させる。成果ベースの価格設定はそれを逆転させる。
DecagonのVoice 3とPACT、顧客対応を「電話の向こう側にいるエージェント」に備えさせる
サポートシステムは何十年もかけて人間の行動をモデル化してきた。今や、入ってくるリクエストの一部は人間のために行動する機械だ。