FLUX 3 Image:バウンディングボックス、4K出力、そして設定ファイルとしてのレイアウト

Black Forest Labsは10月1日にFLUX 3 Imageをリリースし、FLUX 3ファミリーの画像コンポーネントが完成した。同社のAPIとPlaygroundで利用可能で、10月8日まで50%の導入割引が適用され、今後数週間以内にオープンウェイト版をリリースすることも約束されている。
主要な3つの主張は、ネイティブ4K出力、要素レベルのレイアウト制御、そして領域保持編集だ。それぞれを分解して検討する価値がある。なぜなら3つ目は、マーケティングが示唆する以上に多くの役割を担っているからだ。
グリッドが文章による記述を置き換える
FLUX 3 Imageは、プロンプトに付加されたバウンディングボックスのJSON配列を受け取る。座標は正規化された0〜1000のグリッドで表現される。各要素にはID、テキストによる記述、そして [y_min, x_min, y_max, x_max] 形式のボックスが与えられる。モデルはその要素を、出力解像度とは無関係に、そのボックスの中に配置する。
これが今回のリリースの中心となる部分であり、レイアウトの指定方法における真の転換点だ。ほとんどのテキストtoイメージのワークフローでは、空間的な配置は自然言語(「左3分の1にボトル、右から手が入ってくる」)で記述され、モデルはそれを緩やかな選好として解釈する。結果として得られる出力は分布をなし、通常は記述の近くに着地するが、そうでないこともある。
座標グリッドは解釈のステップを取り除く。もはやレイアウトを記述して願うのではなく、レイアウトを宣言するのだ。レイアウトツールで作業するデザイナーにとって、これは既存のメンタルモデルにそのまま対応する。すべて同じ位置にモデルを配置する必要がある数百枚の商品写真を生成するパイプラインにとっては、美的な問題を設定の問題に変える。
どのような座標系にもつきものの注意点がある。ボックスはその中に何が入るかをモデルに伝えるものではなく、誤ったオブジェクトを指定した記述は、自信を持って誤った場所に描画される。幾何学的な精度が、そのまま意味論的な精度を生むわけではない。
アップスケール工程なしの4K
FLUX 3 Imageは、複数のアスペクト比にわたり、最大5,456×3,072ピクセル(約16.8メガピクセル)を、超解像処理なしでネイティブに生成する。
ほとんどの画像モデルはネイティブで1024〜2048ピクセル程度が上限で、それ以上は後からアップスケーリングで対応してきた。これはスクリーン配信には問題ないが、印刷物、ECのヒーロー画像、大判ディスプレイでは次第に扱いにくくなる。こうした用途では、後処理の工程が、その解像度を正当化するまさにテクスチャのディテールを平滑化して消してしまう傾向があるからだ。
4Kで生成することは、ワークフローが検証すべき対象も変える。アップスケーラーは独自の故障モードを持つ別個の工程であり、その工程を除けばQCのカテゴリが一つ減る。ネイティブ出力が、明らかなアーティファクトを避けているだけでなく、原寸で耐えうるかどうかは、実際に手を動かしてテストしなければ結論は出ない。
領域編集とピクセル同一性の主張
3つ目の機能は部分編集だ。指定したバウンディングボックス領域だけを再生成し、その外側は一切変更しない。Black Forest Labsによれば、編集後も67.8〜89.7%のピクセルがビット単位で同一のまま保たれるという。
この幅は広く、そのばらつき自体が情報を語っている。下限は、手をつけていない領域にも相応のドリフトが生じることを示唆し、上限は真のマスク編集に近い。個々の編集がどのあたりに収まるかは、再生成された領域が周囲をどれだけ拘束するかに依存するのだろう。光の回り込み、影、接触エッジはすべて、整合性を取るために隣接ピクセルを変更しようとする圧力を生む。
それでも、ピクセル同一性の数値を公表すること自体は有用な動きだ。反復的な画像編集におけるドリフト問題は、この2年間、拡散モデルによる編集に対する中心的な不満であり続けてきた。改訂を重ねるたびに、満足していた部分が劣化し、最終的には諦めて最初からやり直すことになる。どれだけ保持できるかを数値化したモデルは、少なくとも目標を明示している。
FLUX 3 Imageはまた、1回のリクエストで最大10枚の参照画像を受け付け、プロンプトとバウンディングボックスのレイアウトに従って被写体を配置する。この組み合わせ(複数の参照画像+宣言された配置)によって、モデルは画像生成器というよりも、生成バックエンドを備えたコンポジットツールのように見え始める。
10枚の参照画像は、「参照」が何のためにあるのかという問いも提起する。現在のほとんどのワークフローでは、参照画像はスタイル転送を意味する。見た目をモデルに与えれば、それを近似してくれる。参照された各被写体を宣言されたボックスの中に配置するというのは、より狭く、より機械的な約束だ。「このオブジェクトを、ここに」と言っている。モデルが高負荷時(10の被写体、4Kキャンバス、重なり合うボックス)にそれに従うかどうかは、ローンチ記事ではなく、実運用の中で明らかになる類のことだ。
注目に値するトレーニングに関する記述
技術的な詳細の中に埋もれているが、FLUX 3 ImageはBlack Forest LabsのSelf-Flowアーキテクチャを用い、画像・動画・音声のデータを統合的に学習している。FLUX 3のベースは3つのモダリティすべてをカバーするマルチモーダルなフローモデルであり、画像モデルはその一面にすぎない。
これはロードマップの読み方に関わってくる。画像・動画・音声が学習基盤を共有しているなら、「数週間以内にオープンウェイト」という約束は今回のリリースを超えて広がり、同じベース上に構築されるモデルファミリーを指し、GoogleやOpenAIのクローズドなマルチモーダルスタックに対するオープンウェイトの対抗軸として自らを位置づける企業について語っている。
これは順序についても説明を与える。Black Forest LabsはFLUX 3の動画と音声のコンポーネントを先に投入し、静止画モデルを最後に投入した。画像生成で評判を築いた企業にとって、動画モデルの後に画像モデルをリリースするのは奇妙な順序だ。ただし、共有ベース上で画像モデルを正しく仕上げるのが最も難しい場合を除いては。バウンディングボックスによる制御は、機能というよりも、3モダリティにまたがる統合学習が細やかな空間忠実度に及ぼす影響への回避策なのかもしれない。
注目すべき点
現時点での実用的な見方は、より限定的だ。FLUX 3 Imageは有料API製品であり、これまでコンポジット工程を必要としたレイアウト制御、アップスケーラーを不要にするネイティブ解像度、そして公表された忠実度の数値を伴う領域編集を備えている。それらが代替手段より優れているかどうかはベンチマークの問いであり、ベンチマークこそが今後数週間の独立系テストの目的だ。
ウェイトが公開されたら、3つの点を追う価値がある。第一に、バウンディングボックスAPIがオープンリリースでもそのまま残るのか、それともAPI専用機能になるのか。後者なら、有料プランと無料プランの間に意味のある線引きが生じることになる。第二に、コミュニティのファインチューニングが、より小さなハードウェアでも同じレイアウト精度に到達できるのか、それとも座標の挙動がスケールに依存するのか。第三に、ピクセル同一性の数値が独立した再現で持ちこたえるのか、それとも有利な編集における最良ケースの測定値にすぎないと判明するのか。
より大きなシグナルは、リリースノートがほとんど何気なく述べている点だ。画像生成における競争は、1枚の出力がいかに印象的かという段階から、100枚目の出力が1枚目と一致するかどうかへと移った。レイアウトグリッド、領域保持、ピクセル同一性の指標は、いずれもその問いへの答えだ。それらはいずれも美しい画像を作るものではない。再現可能な画像を作るものなのだ。
関連記事
MetaがMidjourneyの画像・動画技術をライセンス、その理由は示唆に富む
ベンチマークは四半期ごとに動く。何が見た目に良いかについてのコミュニティの判断は動かない。
AssemblyAI、リアルタイム音声のレイテンシを91ミリ秒に短縮。この数字が重要な理由
音声の制約は単語誤り率ではなかった。それはターンテイキングだった。
GoogleのNano Banana 2.1はフラッグシップではなく機能追加リリースだ
ミッドティアのリリースは、ラボが大多数のユーザーに実際に何が必要だと考えているかを教えてくれる。それはフラッグシップよりも有用なシグナルだ。
動画広告スタックは専門特化型へと分裂した——Boreal-H3が示すその理由
シネマティックな品質と反復のスループットは別の製品であり、一つの生成レイヤーが両方で先頭に立つことはできない。