阿里巴巴開源 30B 多模態:30 億活化參數,正面叫陣 GPT-5-Mini

10 月 4 日,阿里雲通義千問團隊一次放出了 Qwen3-VL-30B-A3B 的 Instruct 與 Thinking 兩個版本,並附帶 FP8 量化權重,同場還上了更大一號的 Qwen3-VL-235B-A22B 的 FP8 版本。官方給的成績單很直接:在 STEM 推理、視覺問答、OCR 文字辨識、影片理解和 Agent 任務這五個方向上,對標 GPT-5-Mini 和 Claude 4-Sonnet,部分項目還要更好。
真正值得停下來看的,是名字裡那串 A3B。
30B 的外殼,3B 的胃口
Qwen3-VL-30B-A3B 的總參數量是 300 億,但每次推論真正參與計算的,只有大約 30 億。這是典型的混合專家(MoE)架構:模型內部準備了大量專家,每次處理一個 token,只挑出最合適的一小撮來幹活,其餘的按兵不動。

把它想成一家公司會更直觀。全公司三萬名員工,但每個具體專案只需要抽調其中三千名對口的專家,剩下的人繼續待命。公司的能力儲備是三萬人級別的,具體一個專案的人力成本卻接近三千人。
這個結構帶來的好處很實際。顯示記憶體佔用和推論速度更接近一個遠小於 30B 的稠密模型,而能力上限仍然保留了 30B 級別的底子。對需要在本地或私有環境裡跑多模態能力的團隊來說,這正好是過去幾年最難湊齊的組合:既要有能對標閉源旗艦的效果,又不能要求一張堆滿顯示記憶體的卡。
成績單為什麼要按這五個方向發
官方挑出來對標的方向,恰好是多模態落地最密集的戰場。
OCR 是文件數位化、票據辨識、截圖取字這類剛需。影片理解是短影音時代的內容生產入口,誰能看懂影片,誰就能把影片轉成可檢索、可編輯的素材。Agent 是讓模型不止看懂、還能動手,這是今年業內幾乎所有人都在押的主線。STEM 與 VQA 則是教育、科研、工業質檢這些高價值場景的門票。
一個活化參數只有 30 億的模型,能在這幾條線上跟閉源旗艦較勁,這件事本身比任何單項分數都更有訊號意義。它說明能力密度還在被重新壓縮:同樣的效果,需要的算力在下降;或者說,同樣的算力,能換來的能力在上升。
開源這張牌,打的是部署成本
通義這一輪沒有只放一個版本。Instruct 面向常規的指令跟隨與問答,Thinking 走的是先想後答的推論路徑,FP8 權重則是給那些想在有限顯示記憶體裡塞進整套模型的人準備的。
三個版本一起上,指向的是同一件事:把多模態從「雲端 API 呼叫」推向「可以自己部署」。一旦權重能下載、能量化、能在私有伺服器上跑起來,採購邏輯就會變。過去企業算的是每百萬 token 多少錢,現在多了一個選項,算的是自有顯卡攤到每百萬 token 多少錢。對用量大的團隊,後者的帳往往更划算,而且資料不出內網。
這也是國產開源模型過去一年最穩定的進攻方向。不再單純比誰的參數更大、榜單更高,而是比誰能讓更多人以更低的門檻把模型用起來。當能力差距被壓到可接受的範圍,價格和可取得性就變成了真正的勝負手。
開源的另一面
權重公開,意味著任何人都能下載、微調、二次分發。好處是生態擴張極快,量化版、行業微調版、邊緣裝置適配版會很快在社群裡長出來。風險也同樣明確:模型離開了發布方的視線,被用在哪裡、怎麼用,發布方幾乎無從約束。
對開發者來說,這反而把選擇權推到了自己手裡。你要清楚自己的合規邊界,清楚資料能不能出境,清楚二次分發的授權條款。開源把工具交給你,同時也把責任交給你。
接下來看什麼
這五個方向的對標只是起點。真正決定一個多模態模型能不能在生產裡站住的,很少是某一項基準的分數,而是它在連續幾十輪任務裡會不會突然出包,是它在真實文件、真實影片、真實混亂輸入下的穩定性。
30 億活化參數這條路能不能持續往上走,取決於下一代的專家調度效率、訓練資料品質和後訓練策略。如果這條路走得通,被改寫的就不只是某個榜單,而是整個行業對「需要多大模型才夠用」的預設假設。
一個能力接近旗艦的模型,如果執行成本只有旗艦的一個零頭,那麼真正稀缺的,就不再是算力,而是想清楚該拿它做什麼的人。