Flux 3 与 Imagen 4 登陆 Replicate,图像模型货架愈发拥挤

10 月 1 日,Black Forest Labs 和 Google 双双在 Replicate 上线了新的图像模型。Black Forest Labs 发布了 Flux 3,用于文生图和图像编辑,支持最多十张参考图。Google 则上线了四款模型:主打速度与成本的 Imagen 4 fast、主打细节的 Imagen 4 ultra、面向价格敏感场景的 Imagen 3 fast,以及追求顶级输出质量的 Imagen 3。这些模型都可以通过你已经在用的同一套 API 调用。
标题读起来像是一次模型发布。实际上它更像是一则分发公告。这些模型此前都已存在于别处。变化在于,只要拥有一个 Replicate token 的开发者,如今无需注册 Black Forest Labs 账号、也不必搭建 Google Cloud 项目,就能调用它们。
十张参考图究竟能带来什么
值得停下来细想的那个数字,是 Flux 3 的十张参考图。一年前,图像编辑意味着一张输入图片加一句文字指令。十张参考图改变了你可以要求模型做的事情。你可以给它一张产品图、来自第二张图的纹理、来自第三张图的配色方案,以及来自第四张图的人脸,然后要求生成一个同时尊重所有这些元素的构图。
这正是整个市场一直在竞相追逐的能力。Nano Banana Pro 最多可融合十四张图像和五个人物。GPT Image 2.5 Sunburst 通过在不干扰其他区域的情况下修改某一区域,登顶 Artificial Analysis 编辑榜。Seedream 5.0 在编辑需要现实世界参考时会调用实时网络搜索。竞争的分界线已经从“第一张图看起来多好”,转移到了“模型在第十次编辑时还能多好地听从指令”。

对于在这些工具之上构建产品的人来说,参考图数量比基准测试分数是更有用的规格指标。它告诉你,你能把多少控制权交到用户手上。只接受一张参考图的模型,适合做一个文生图按钮。能接受十张参考图的模型,则适合一款设计工具——用户可以从一个已审核素材的文件夹里拼装品牌物料。
Google 的四款模型其实是两个档位
Google 的阵容看起来像四次发布。仔细看名字就会发现,它其实是按成本一分为二的两款模型。Imagen 4 fast 和 Imagen 4 ultra 运行的是同一次生成,一个为廉价调优,一个为细节调优。Imagen 3 fast 和 Imagen 3 也是如此。fast 版本并不是真正意义上的更差模型。它们是同一个模型配上更低的算力预算,以更低的价格出售。
这是销售图像生成的一种合理方式,同时也暗示了成本究竟落在哪里。当 fast 档与 ultra 档之间唯一的差别只是模型被允许“思考”多久时,模型本身已经不再是产品。算力成了产品,而模型只是消耗算力的那个东西。
对于正在决定生产环境中跑什么的团队来说,这会改变权衡方式。问题不在于这四款哪个最好,而在于你的用例实际需要哪个质量档位——因为在一个只需要 fast 的用例上为 ultra 付费,等于白白烧钱,却不会改善任何用户能察觉的东西。
登上平台这件事本身值多少
值得把“某个模型登陆 Replicate 为什么算新闻”说清楚。Replicate 出租的是托管推理。开发者注册一次,拿到一个 token,就能通过同一套接口调用目录中的任何模型。对 Black Forest Labs 和 Google 而言,上架意味着触达那些绝不会为单个模型单独注册账号的开发者,并向平台支付费用以换取这份触达。
这就是开放模型厂商被迫接受的交易。公开权重,技术爱好者就能运行它们,对任何人都没有成本,实验室也拿不到任何收入。上架到托管平台,受众就扩大到那些只想要一个端点和一张月度账单的人,但中间商要抽成,而且模型会在选择器里与一打竞品并排摆放。
另一条路是直接售卖访问权,这正是闭源模型的做法,也是大多数实验室无法规模化做到的。于是,托管平台就成了中立地带:开源与闭源模型在这里争夺同一个开发者,在同一页面上被评判。一个手握好权重的小实验室,如今可以与 Google 的发布同台亮相——这究竟是良性竞争,还是一场商品化竞赛,取决于你站在哪一边。
对买方而言,这带来一个实际后果。你今天选中的模型,可以通过你早已熟悉的接口访问,这使得切换成本很低、试验很便宜。但这也意味着你选中的模型大概率并不特别,因为同一个货架对所有人开放。
当天还有哪些动静
同一天还涌现出一大批较小的发布。Cloudflare 将图像-文本-转文本模型 Clef 放上了 Hugging Face。ISTA-DASLab 发布了 Qwen3.8 Flash 的 GGUF 构建版本,这主要对本地运行模型的人有意义。Vercel 的 AI Gateway 新增了一个名为 Laya 的决策模型,它通过概率分数为支持请求和智能体工作流做路由,10 月底前免费使用;同时还加入了 Microsoft 的音频模型和来自 Browserbase 的搜索工具。Google 为 Gemini Live 加入了实时视觉辅助功能,其开发过程有盲人和低视力用户参与。
这些都不会单独改变一条图像流水线。但它们合在一起,显示出平台厂商正在往哪个方向推。Replicate、Vercel 和 Hugging Face 都在争夺“开发者挑选模型的地方”这一位置,而它们的竞争方式是让目录更宽、计费更简单。模型实验室从中受益,因为通过平台分发,正是小实验室触达那些绝不会单独签约的开发者的方式。
这就是每个开放模型厂商都面临的取舍。公开权重、让社区去运行,成本为零,触达技术爱好者。或者上架托管平台,触达那些想要端点和账单的开发者,触达更多人,但要把一部分收入交给平台。Flux 3 上了 Replicate,这说明 Black Forest Labs 想要第二类受众,且愿意为此分账。
如果你正在选型,这意味着什么
这一切的实际影响是:货架拥挤,标签越来越难读。四款 Imagen 模型、一次 Flux 发布,以及一长串社区构建版本,全都在争夺流水线中的同一个位置。真正重要的差异,比营销话术所暗示的要窄得多。
在做出选择之前,有三件事值得核查。模型接受多少张参考图,因为这决定了控制力的上限。许可证是否允许商业使用,这也是 Apache-2.0 与非商用构建的分水岭。以及模型是否在你实际部署的地方可用——因为一个你无法使用的好模型,等于一个不能用的模型。
这些都不光鲜,也都不会出现在发布稿里。但恰恰是这些,决定了在发布会过去六个月之后,一个模型能否真正在产品中跑得起来。