9月国产开源生图模型接连放招:商汤、蚂蚁、书生都坐不住了

刚过去的这个 9 月,国产 AI 生图有个不太起眼但挺关键的变化:开源。短短一周里,商汤、蚂蚁、上海人工智能实验室的书生团队先后放出开源生图模型,把原本只在闭源大厂手里攥着的能力,摆到了桌面上。这件事的影响,可能比某一款新模型上线要大得多。
三家的牌面,各自是什么
商汤 SenseNova U1.5 Lite,9 月 8 日开源,是一个 8B 规模的生图模型。它的卖点是 4K 直出,官方口径是"比肩闭源大模型"。8B 这个体量很关键,它意味着普通开发者手里的显卡也带得动,不用一上来就奔着 12G、24G 显存去。
蚂蚁的 6B 统一图像模型,9 月 6 日开源。它走的是一条更"省事"的路:文本生成和指令编辑合在一个模型里。换句话说,你既能让它从零画一张图,也能给它一张图让它"把背景换掉""把颜色调亮",不用切两个模型。更少见的是,蚂蚁把训练配方也全公开了。开源模型不少,但把训练细节摊开的,不多。
书生 InternLumina-U2,9 月 3 日发布,是一个视觉大模型,主打图像理解和生成统一,权重会开放。它的定位更偏"一个模型既看得懂图、又能画图",这在需要让模型先理解一张参考图、再照着改的场景里,比纯生成模型更有优势。

为什么开源这件事值得单独说
很多人可能觉得,开源模型离普通用户很远,反正我又不训练模型。但真正的影响链条是这样的:开源模型会变成各种免费工具的地基。
一个独立开发者,或者一个小团队,没钱买大厂 API,又想给自己的产品加生图功能,怎么办?答案就是去 Hugging Face 拉一个开源模型,本地或者租个便宜 GPU 跑起来。商汤 8B、蚂蚁 6B 这种体量,恰好就是"能塞进一台消费级机器"的区间。开源模型越多、越小、越强,能被普通人搭起来的免费生图方案就越多。
反过来看,这也是国产模型对 Stable Diffusion、Flux 这些老牌开源路线的一种回应。过去一说开源生图,默认就是 Stable Diffusion 生态。现在国产选手开始往里挤,而且带的是中文理解、中文字体渲染这些本土优势,这对中文用户是实打实的增量。
开源之后,拼的是什么
开源不是终点,而是起点。一个模型开源了,能不能用起来,还取决于三件事。
第一是生态。模型光有权重不够,得有配套的推理工具、LoRA 训练脚本、WebUI 支持。Stable Diffusion 之所以到今天还是很多人的默认选择,靠的不是某一个版本,而是它身后那一大圈工具链。
第二是中文能力。国产模型最大的差异化,就在中文提示词理解和中文文字渲染上。这是海外开源模型长期没做好的地方,也是国产开源模型最该咬住的地方。
第三是商业化路径。开源模型怎么赚钱,一直是道难题。商汤、蚂蚁、书生这些玩家,开源大概率不是做慈善,而是想通过开源把生态养起来,再靠企业服务、云 API、定制化去变现。对用户来说,这意味着免费的东西会越来越多,但"免费"和"持续维护"之间能不能划等号,得边走边看。
还有个背景值得补一句:这一波开源潮,恰好踩在海外开源生态有些青黄不接的节点上。Stable Diffusion 已经很久没有真正意义上的大版本更新,Flux 又迟迟没有放出完整的开源权重。国产模型这时候把 6B、8B 这种"能塞进家用机器"的体量开源出来,等于在对方喘气的空当里,把中文开源生图的地基先打了下来。
对普通创作者的实际意义
落到具体的人身上,这些开源模型带来的变化是:生图这件事的成本,还在继续往下走。
以前你想稳定地用 AI 生图做点正经东西,要么订阅一个工具,要么按张数付 API 费。开源模型多了之后,出现了一批免费的、本地跑的方案。虽然这些方案普遍有门槛,得会装环境、会调参数,但门槛本身也在被社区一点点磨平。
我的判断是,短时间内,普通创作者依然用网页工具最省心。但如果你正在做一个小产品、一个小应用,需要把生图能力嵌进去,那这一波开源模型的密度和体量,值得你重新看一眼。至少,之前"国产没有好用的开源生图模型"这个说法,从 9 月开始已经不成立了。
相关文章
中国 AI 图像模型正在海外赢得拥趸,华盛顿也在关注
这种采用首先是技术性的,其次才是政治性的。开发者下载有效的东西,而目前有效的东西越来越多来自中国实验室。
预测市场正在就AI图像押注什么
真金白银正在押注谁将赢得AI图像。OpenAI在静态图上领先,MiniMax在视频上领先,而开源模型是无人定价的变数。
Qwen-Image 2.1 对比 Nano Banana 2.0:7B 开源模型已逼近谷歌
一个 70 亿参数的开源模型如今在阿里基准上领先于谷歌的 Nano Banana 2.0,并在其他方面都近在咫尺。
中国图像模型正在走向全球,而本月讨论风向变了
中国图像模型正在走向全球。基准测试、评论区和华盛顿的讨论本月如何发生变化。