FLUX 3 Image 把图像生成变成了一份布局文件

Black Forest Labs 于 10 月 1 日发布了 FLUX 3 Image,大多数报道都先提分辨率:原生输出最高可达 4K,约 1680 万像素,无需在流程中加入放大模型。这确实是一次真正的升级。但这也是这次发布中最没意思的部分。
真正值得翻文档的是输入格式。FLUX 3 Image 不想要一段描述加一个愿望。它要的是一张表。
每个元素都有一个地址
一次生成请求就是一个由元素组成的 JSON 数组。每个元素都有一个唯一 ID、一个以 `[y_min, x_min, y_max, x_max]` 表示的边界框(基于归一化的 0 到 1000 网格),以及一段用自然语言说明该位置应该放什么的描述。背景块覆盖整张画布。产品位于 `[400, 200, 950, 800]`。Logo 放在左上角。场景提示词仍然存在,但现在它只是若干输入之一,而不再是完整的需求说明。
这个网格与分辨率无关。同一份布局 JSON 在 768 像素宽或原生 4K 下都会渲染出相同的构图,这意味着你在廉价草稿上测试的布局,就是最终昂贵成品上的布局。
这听起来像是个便利功能。但在实践中,它改变了谁能调用这个模型。BFL 设计元素表的方式,使语言模型可以依据一行简要说明和目标宽高比来写出它。智能体不必再把意图翻译成散文然后听天由命。它可以像排布电子表格一样排布图像,而元素 ID 会作为句柄保留下来,供它在后续轮次中引用。

还有一个更省钱的后果。由于网格与分辨率无关,布局可以以 768 像素进行验证,成本只是零头,然后以 4K 渲染并保持构图不变。迭代和最终交付不再因预算而互相冲突,这对任何需要基于同一模板制作几十张图像的人来说都很重要。
像素锁定与漂移问题
编辑遵循同样的逻辑。你指定一个源边界框和一个目标边界框,选择要移动、替换或移除的元素,而该区域之外的像素理应完全留在原位。BFL 自己的测量显示,未触及区域达到 67.8% 到 89.7% 的比特级一致保真度,具体范围取决于编辑有多复杂。
诚实之处在于措辞。发布演示承诺编辑“不会改变任何其他像素”。API 文档则说未触及的像素“通常”保持不变,而且 BFL 承认编辑可能会超出指定框。边界伪影是真实存在的。任何要把这项功能放入流水线的团队,都应该建立验收测试,而不是轻信演示。
尽管如此,它与普通修复(inpainting)之间的差距并不小。传统修复即使在被告知不要动的区域也会留下细微漂移。一次编辑之后,没人会注意到。但经过十步审批循环之后,背景已经偏移,字体已经变软,构图也不再匹配客户三轮之前签字确认的内容。正是这种累积让长编辑链无法使用,而边界框要阻止的正是这一点。
创作者们实际发现了什么
一位创作者在 Midjourney、Ideogram 4.5 和 FLUX 3 Image 上运行了相同的编辑指令,并发布了一份很有用的对比。在一项测试中,要求将服装重新着色为粉色丝绸,带有白色花朵和蛋奶黄色蝴蝶结,然后要求对面部和手部进行微距特写;Midjourney 处理了特写,但漏掉了白色花朵和准确的色调。Ideogram 4.5 匹配了服装变化,不过微距镜头中的光照看起来不太对。FLUX 3 Image 匹配了服装变化,并因特写中的光照和上下文而受到称赞。在另一项测试中,它把对细小柱子的编辑限制在预期对象上,而另外两者则把变化扩散得更远。
一个创作者的帖子不是基准测试。把它当作一个信号,说明模型在哪些方面强:看起来是在精细细节的指令遵循,而不是广泛的风格化。
边界框解决不了什么
放置和漂移是两个问题,而不是全部问题。框告诉模型某个东西应该放在哪里。它不告诉模型这个事物应该长什么样,也无法阻止参考元素在放置后改变风格。那些要针对三十种不同背景生成同一个产品的团队,仍然必须保持产品本身一致,而这项工作存在于参考图像和提示词中,而不是坐标中。
文本渲染是另一个未缝合的缺口。BFL 自己的演示图像来自人类精心策划的提示词。布局模型能否可靠地在小框内以特定字体放置清晰可读的文字,是另一个问题,而发布材料并没有回答它。对于杂志排版和电商工作——这正是本次发布瞄准的受众——这个细节决定是否会被采用。
结构化输入也不会让模型在美学方面变得不那么像个黑箱。你可以指定 Logo 放在左上角。你无法指定构图应该让人感觉平静。
没人写进标题的权衡
边界框比直接输入“把背景变成蓝色”需要更多前期设置。你必须知道东西该放在哪里。对于一次性的图像,这种开销可能不值得。但对于要在二十张产品照片上重新生成同一布局的流水线,或者必须把 Logo 放在可靠位置的智能体来说,它很快就能回本。
发布定价在 10 月 8 日前打五折:768 像素图像约 0.0205 美元,4K 最高约 0.3035 美元,包含参考图和提示词,失败的生成不收费。商业自托管权重可通过联系 BFL 获取,并承诺在未来几周推出开放权重版本。
参考图处理本身就值得一提。单次调用最多接受 10 张参考图像,而且可以告诉每个元素它来自哪张参考图以及它应该放在哪里。仅 10 张参考图并不稀奇。10 张参考图各自映射到画布上的特定框,这是一种用现有素材组装构图的工作流,比起提示词的工作方式,它更接近设计师的工作方式。再结合布局网格,这个模型开始看起来不那么像画家,而更像一个有主见的合成师。
更大的图景是,图像 API 多年来一直围绕一个问题进行优化:图片看起来有多好?FLUX 3 Image 增加了第二个智能体更关心的问题。你能定位图片的某一部分、修改它,并让其他一切保持不变吗?一旦答案是肯定的,图像生成就不再是老虎机,而开始表现得像一个可以编辑的文件。
这一区别正是为什么与 Midjourney 和 Ideogram 的对比没有乍看起来那么重要。那些模型竞争的是新生成的图片有多美,而且它们仍然非常擅长这一点。BFL 竞争的是生成图像能否被当作具有稳定区域的文档来处理,这是一场不同的竞赛,也会有不同的赢家。第一场竞赛已接近尘埃落定,第二场才刚刚开始,而这大致就是一项基础设施押注想要处于的位置。