阿里巴巴开源 30B 多模态:30 亿激活参数,正面叫板 GPT-5-Mini

10 月 4 日,阿里云通义千问团队一次性放出了 Qwen3-VL-30B-A3B 的 Instruct 与 Thinking 两个版本,并附带 FP8 量化权重,同场还上了更大一号的 Qwen3-VL-235B-A22B 的 FP8 版本。官方给的成绩单很直接:在 STEM 推理、视觉问答、OCR 文字识别、视频理解和 Agent 任务这五个方向上,对标 GPT-5-Mini 和 Claude 4-Sonnet,部分项目还要更好。
真正值得停下来看的,是名字里那串 A3B。
30B 的壳,3B 的胃口
Qwen3-VL-30B-A3B 的总参数量是 300 亿,但每次推理真正参与计算的,只有大约 30 亿。这是典型的混合专家(MoE)架构:模型内部准备了大量专家,每次处理一个 token,只挑出最合适的一小撮来干活,其余的按兵不动。

把它想成一家公司会更直观。全公司三万名员工,但每个具体项目只需要抽调其中三千名对口的专家,剩下的人继续待命。公司的能力储备是三万人级别的,具体一个项目的人力成本却接近三千人。
这个结构带来的好处很实际。显存占用和推理速度更接近一个远小于 30B 的稠密模型,而能力上限仍然保留了 30B 级别的底子。对需要在本地或私有环境里跑多模态能力的团队来说,这正好是过去几年最难凑齐的组合:既要有能对标闭源旗舰的效果,又不能要求一张堆满显存的卡。
成绩单为什么要按这五个方向发
官方挑出来对标的方向,恰好是多模态落地最密集的战场。
OCR 是文档数字化、票据识别、截图取字这类刚需。视频理解是短视频时代的内容生产入口,谁能看懂视频,谁就能把视频转成可检索、可编辑的素材。Agent 是让模型不止看懂、还能动手,这是今年行业内几乎所有人都在押的主线。STEM 与 VQA 则是教育、科研、工业质检这些高价值场景的门票。
一个激活参数只有 30 亿的模型,能在这几条线上和闭源旗舰掰手腕,这件事本身比任何单项分数都更有信号意义。它说明能力密度还在被重新压缩:同样的效果,需要的算力在下降;或者说,同样的算力,能换来的能力在上升。
开源这张牌,打的是部署成本
通义这一轮没有只放一个版本。Instruct 面向常规的指令跟随与问答,Thinking 走的是先想后答的推理路径,FP8 权重则是给那些想在有限显存里塞进整套模型的人准备的。
三个版本一起上,指向的是同一件事:把多模态从「云端 API 调用」推向「可以自己部署」。一旦权重能下载、能量化、能在私有服务器上跑起来,采购逻辑就会变。过去企业算的是每百万 token 多少钱,现在多了一个选项,算的是自有显卡摊到每百万 token 多少钱。对用量大的团队,后者的账往往更划算,而且数据不出内网。
这也是国产开源模型过去一年最稳定的进攻方向。不再单纯比谁的参数更大、榜单更高,而是比谁能让更多人以更低的门槛把模型用起来。当能力差距被压到可接受的范围,价格和可获得性就变成了真正的胜负手。
开源的另一面
权重公开,意味着任何人都能下载、微调、二次分发。好处是生态扩张极快,量化版、行业微调版、边缘设备适配版会很快在社区里长出来。风险也同样明确:模型离开了发布方的视线,被用在哪里、怎么用,发布方几乎无从约束。
对开发者来说,这反而把选择权推到了自己手里。你要清楚自己的合规边界,清楚数据能不能出境,清楚二次分发的许可条款。开源把工具交给你,同时也把责任交给你。
接下来看什么
这五个方向的对标只是起点。真正决定一个多模态模型能不能在生产里站住的,很少是某一项基准的分数,而是它在连续几十轮任务里会不会突然掉链子,是它在真实文档、真实视频、真实混乱输入下的稳定性。
30 亿激活参数这条路能不能持续往上走,取决于下一代的专家调度效率、训练数据质量和后训练策略。如果这条路走得通,被改写的就不只是某个榜单,而是整个行业对「需要多大模型才够用」的默认假设。
一个能力接近旗舰的模型,如果运行成本只有旗舰的一个零头,那么真正稀缺的,就不再是算力,而是想清楚该拿它做什么的人。