FLUX 3 Image:边界框、4K 输出,以及作为配置文件的布局

Black Forest Labs 于 10 月 1 日发布 FLUX 3 Image,补齐了 FLUX 3 家族中的图像组件。该模型可通过公司的 API 和 Playground 使用,10 月 8 日前享五折首发优惠,并承诺在未来几周内开放权重。
三个主打卖点分别是原生 4K 输出、元素级布局控制和区域保持编辑。这三者都值得逐一拆解,因为第三项所承担的分量远超营销话术所暗示的。
网格取代了文字描述
FLUX 3 Image 接受附加在提示词之后的 JSON 边界框数组,坐标基于归一化的 0–1000 网格表示。每个元素包含一个 ID、一段文字描述,以及一个格式为 [y_min, x_min, y_max, x_max] 的框。模型随后将该元素放置在这个框内,且与输出分辨率无关。
这正是本次发布的核心所在,也是布局指定方式的一次真正转变。在大多数文生图工作流中,空间排布是用自然语言描述的(“瓶子放在左侧三分之一处,一只手从右侧伸入”),模型把它当作一种软性偏好来理解。其结果是输出分布通常落在描述附近,有时则不然。
坐标网格移除了这一解释环节。你不再是在描述布局并寄希望于模型,而是在直接声明布局。对于在布局工具中工作的设计师来说,这对应着一个既有的心智模型。对于需要生成数百张产品图、且模特位置必须一致的流水线而言,它把一个审美问题变成了一个配置问题。
任何坐标系统都伴随着一个前提:框本身并不告诉模型里面该放什么,而一段指错对象的描述会被自信地渲染在错误的位置上。几何上的精确并不会自动带来语义上的精确。
无需放大步骤的 4K
FLUX 3 Image 在多种宽高比下可原生生成最高 5,456 × 3,072 像素(约 1,680 万像素)的图像,无需超分辨率处理。
大多数图像模型的原生上限在 1024 到 2048 像素左右,更大的尺寸则依靠事后放大来处理。这对屏幕投放来说没问题,但用于印刷物料、电商主图和大幅面展示时就越来越别扭——在这些场景中,后处理步骤往往恰好抹掉了那些让高分辨率得以成立的纹理细节。
以 4K 生成还改变了工作流需要验证的内容。放大器是一个独立的环节,有其自身的失效模式;去掉一个环节,也就去掉了一类质检工作。原生输出在满尺寸下是否真的站得住脚——而不只是没有明显瑕疵——只有实际动手测试才能得出结论。
区域编辑与像素一致性声明
第三项功能是局部编辑:只重新生成指定的边界框区域,框外的一切保持不变。Black Forest Labs 报告称,编辑后有 67.8% 到 89.7% 的像素保持逐位完全相同。
这个区间相当宽,而跨度本身就携带信息。下限意味着未触碰区域存在明显的漂移;上限则接近真正的蒙版编辑。某次编辑落在何处,很可能取决于被重新生成的区域对周围施加了多大约束——光线溢出、阴影和接触边缘都会产生压力,迫使邻近像素为保持连贯而改变。
尽管如此,愿意公布像素一致性数字本身就是有意义的举动。迭代式图像编辑中的漂移问题,两年来一直是针对扩散编辑的核心抱怨:每一轮修改都会劣化你已经满意的部分,直到你放弃并从头重来。一个能够量化自身保留程度的模型,至少把目标说清楚了。
FLUX 3 Image 还在单次请求中最多接受十张参考图,并根据提示词和边界框布局来摆放主体。这种组合(多张参考图加上声明的摆放位置)正是该模型开始显得不像图像生成器、而更像一个后端接有生成能力的合成工具的地方。
十张参考图还引出了一个问题:“参考”到底是用来做什么的。在当前大多数工作流中,参考图意味着风格迁移:给模型一个视觉风格,它去近似它。而把每个被参考的主体摆放到一个声明的框内,是一个更窄、也更机械化的承诺。它说的是:这个物体,放在这里。模型在负载之下(十个主体、4K 画布、相互重叠的框)是否兑现这一点,属于那种会在生产使用中暴露、而非在发布博文里体现的问题。
值得留意的训练细节
藏在技术细节里的信息:FLUX 3 Image 使用 Black Forest Labs 的 Self-Flow 架构,在图像、视频和音频数据上联合训练。FLUX 3 基座是一个覆盖这三种模态的多模态流模型,图像模型只是它的一个侧面。
这对如何解读路线图很重要。如果图像、视频和音频共享同一套训练底座,那么“几周内开放权重”的承诺就超出了本次发布本身,它指向的是一个将建立在同一基座之上的模型家族,也指向一家把自己定位为 Google 和 OpenAI 闭源多模态技术栈的开放权重替代者的公司。
这也解释了发布顺序。Black Forest Labs 先发布了 FLUX 3 的视频和音频组件,最后才发布静态图像模型。对于一家声誉建立在图像生成之上的公司来说,在视频模型之后才发布图像模型是个奇怪的顺序——除非图像模型是在共享基座上最难做对的那一个。边界框控制或许与其说是一项功能,不如说是针对三模态联合训练给细粒度空间保真度所造成影响的一种变通方案。
值得关注什么
就目前而言,更务实的解读要狭窄一些。FLUX 3 Image 是一款付费 API 产品,它带来了此前需要合成步骤才能实现的布局控制、省去放大器的原生分辨率,以及附带公开保真度数字的区域编辑。这些是否真的优于其他方案,是个基准测试问题,而基准测试正是未来几周独立评测要做的事。
权重开放之后,有三件事值得追踪。第一,边界框 API 是否会原样保留在开源版本中,还是变成仅限 API 的功能——若如此,付费层级与免费层级之间就会出现一道实质性分界。第二,社区微调能否在更小的硬件上达到同样的布局精度,或者说这种坐标行为是否依赖模型规模。第三,像素一致性数字能否在独立复现中成立,还是会证明只是在有利编辑条件下的最佳情况测量。
更宏观的信号,是发布说明中几乎一带而过的那句话:图像生成的竞争已经从“单张输出能多惊艳”转向“第一百张输出是否和第一张一致”。布局网格、区域保持和像素一致性指标,都是对这个问题的回答。它们都不能让图像变得漂亮,但能让图像变得可复现。