← ブログに戻る
Ai読了目安 10 分

アリババ、30Bマルチモーダルをオープンソース化:30億アクティブパラメータでGPT-5-Miniに真っ向勝負

公開日 2026年10月4日
アリババ、30Bマルチモーダルをオープンソース化:30億アクティブパラメータでGPT-5-Miniに真っ向勝負

10月4日、アリババクラウドの通義千問(Qwen)チームはQwen3-VL-30B-A3BのInstruct版とThinking版を一度に公開し、FP8量子化重みも添えた。同じ場で、さらに一回り大きいQwen3-VL-235B-A22BのFP8版も投入した。公式が出した成績はきわめて直接的で、STEM推論、視覚的質問応答、OCR文字認識、動画理解、Agentタスクという5つの方向でGPT-5-MiniとClaude 4-Sonnetに対抗し、一部項目では上回っている。

本当に立ち止まって見る価値があるのは、名前の中にある「A3B」の文字列だ。

30Bの外殻、3Bの食欲

Qwen3-VL-30B-A3Bの総パラメータ数は300億だが、各推論で実際に計算に参加するのは約30億だけだ。これは典型的な混合エキスパート(MoE)アーキテクチャである。モデル内部に大量のエキスパートを用意し、1つのトークンを処理するたびに最も適したごく一部だけを選んで働かせ、残りは待機させる。

長い台の上に並んだ濃い色のガラスブロックの列。ごく少数だけが内側から暖かな光を放っている

会社に例えるとより直感的だ。全社員3万人の会社でも、個別プロジェクトではそのうち適任の専門家3000人だけを招集し、残りは待機を続ける。能力の備蓄は3万人級でも、個別プロジェクトの人件費は3000人分に近い。

この構造がもたらす利点は実用的だ。VRAM使用量と推論速度は30Bよりはるかに小さいdenseモデルに近く、能力の上限は30B級の底力を保っている。ローカルまたはプライベート環境でマルチモーダル能力を動かしたいチームにとって、これはまさにここ数年で最も揃えにくかった組み合わせだ。クローズドソースのフラッグシップに対抗できる効果を持ちながら、VRAMを満載にしたカードを必要としない。

なぜこの5方向で成績を出したのか

公式が対抗先として選んだ方向は、まさにマルチモーダル導入が最も集中する戦場だ。

OCRは文書デジタル化、証憑認識、スクリーンショットからの文字抽出といった必須ニーズ。動画理解はショート動画時代のコンテンツ制作の入口であり、動画を理解できる者こそ、動画を検索可能・編集可能な素材に変えられる。Agentはモデルに理解させるだけでなく行動もさせるもので、今年の業界でほぼ全員が賭けている本命筋だ。STEMとVQAは教育、研究、産業向け品質検査といった高価値シーンの入場券である。

アクティブパラメータがわずか30億のモデルが、これら複数のラインでクローズドソースのフラッグシップと渡り合えること自体、どの単一スコアよりもはるかに示唆的だ。能力密度がさらに再圧縮されていることを示している。同じ効果に必要な計算資源は下がり、あるいは同じ計算資源で得られる能力は上がっている。

オープンソースというカードが狙うのはデプロイコスト

通義は今回、1つのバージョンだけを出したわけではない。Instructは通常の指示追従と質疑応答向け、Thinkingは先に考えてから答える推論経路、FP8重みは限られたVRAMにモデル全体を収めたい人向けに用意された。

3バージョンを同時に投入したことは、同じ1つのことを指す。マルチモーダルを「クラウドAPI呼び出し」から「自分でデプロイできる」ものへ押し出すということだ。一度、重みをダウンロードでき、量子化でき、プライベートサーバーで動かせるようになれば、調達の論理は変わる。これまで企業は100万トークンあたりいくらかを計算していたが、今はもう一つの選択肢が加わり、自社GPUを100万トークンあたりに按分していくらかを計算する。利用量が多いチームにとって、後者のほうがしばしば割安で、しかもデータが社内ネットワークから出ない。

これも中国のオープンソースモデルが過去1年で最も安定して攻めてきた方向だ。もはや単に誰のパラメータが大きいか、ベンチマーク順位が高いかを競うのではなく、より多くの人により低いハードルでモデルを使ってもらえるかを競う。能力差が許容範囲まで縮まると、価格と入手しやすさが本当の勝敗を分ける要因になる。

オープンソースのもう一つの側面

重みが公開されるとは、誰でもダウンロードし、ファインチューニングし、二次配布できるということだ。利点はエコシステムの拡大が極めて速いこと。量子化版、業界向けファインチューニング版、エッジデバイス適応版がすぐにコミュニティで生まれる。リスクも同じく明確だ。モデルが公開元の視界から離れ、どこでどう使われるかを公開元はほとんど制約できない。

開発者にとっては、むしろ選択権が自分たちの手に移る。自分のコンプライアンス境界を理解し、データを国外に持ち出せるか、二次配布のライセンス条項を把握しなければならない。オープンソースは道具を渡すと同時に、責任も渡す。

次に注目すべきこと

この5方向での比較は出発点にすぎない。マルチモーダルモデルが本番環境で定着できるかを本当に決めるのは、あるベンチマークのスコアであることはほとんどなく、何十ラウンドも連続するタスクで突然失速しないか、実際の文書、実際の動画、実際の乱雑な入力下での安定性だ。

30億アクティブパラメータという道が今後も伸び続けられるかは、次世代のエキスパートのルーティング効率、学習データ品質、ポストトレーニング戦略にかかっている。この道が通れば、書き換わるのはあるベンチマークだけでなく、業界全体の「どれだけ大きいモデルなら十分か」という暗黙の前提だ。

能力がフラッグシップに迫るモデルが、その運用コストをフラッグシップのわずかな端数で済ませられるなら、本当に希少なのはもはや計算資源ではなく、それで何をすべきか考え抜ける人だ。

関連記事