← ブログに戻る
Ai読了目安 14 分

FLUX 3 Imageは画像生成をレイアウトファイルに変えた

公開日 2026年10月3日
FLUX 3 Imageは画像生成をレイアウトファイルに変えた

Black Forest Labsは10月1日にFLUX 3 Imageをリリースし、ほとんどの報道は解像度をトップに置いた。ネイティブ出力は最大4K、約1,680万画素、アップスケーラーを介さない。それは確かなアップグレードだ。だが、今回のリリースで最も面白くない点でもある。

ドキュメントを読む価値があるのは入力フォーマットだ。FLUX 3 Imageが求めているのは、段落と願望ではない。表だ。

すべての要素にアドレスが与えられる

生成リクエストは要素のJSON配列だ。各要素は一意のID、正規化された0〜1000のグリッド上で`[y_min, x_min, y_max, x_max]`として書かれるバウンディングボックス、そこに何が属するかの平易な言葉による説明を持つ。背景ブロックはキャンバス全体に広がる。商品は`[400, 200, 950, 800]`に位置する。ロゴは左上隅にある。シーンプロンプトは依然として存在するが、今やブリーフ全体ではなく、複数ある入力の1つにすぎない。

グリッドは解像度に依存しない。同じレイアウトJSONは、幅768ピクセルでもネイティブ4Kでも同じ構図をレンダリングする。つまり、安いドラフトでテストしたレイアウトが、高価な最終版でも得られるレイアウトになる。

それは便利機能のように聞こえる。実際には、誰がモデルを呼び出せるかを変える。BFLは、言語モデルが1行のブリーフと目標のアスペクト比から要素テーブルを書けるように設計した。エージェントは意図を散文に翻訳して、うまくいくことを祈る必要がない。スプレッドシートをレイアウトするように画像をレイアウトでき、要素IDは後のターンで参照できるハンドルとして残る。

木製の机の上に、均等なグリッドになるようにテープで留められた白紙の紙。いくつかのマス目に小さな抽象的なオブジェクトが置かれている

より安く済むという帰結もある。グリッドが解像度に依存しないため、レイアウトは768ピクセルでわずかなコストで検証でき、その後、構図を保ったまま4Kでレンダリングできる。反復作業と最終納品が予算を巡って争わなくなる。これは、同じテンプレートで何十枚もの画像を制作する人にとって重要だ。

ピクセルロックとドリフト問題

編集も同じ論理に従う。ソースのバウンディングボックスとターゲットのバウンディングボックスを指定し、移動、置換、削除する要素を選ぶと、その領域外のピクセルはまったく同じ位置にとどまるはずだ。BFL自身の測定では、未変更領域は67.8〜89.7%のビット単位で同一の忠実度で、その範囲は編集の複雑さに依存する。

正直なのは文言のほうだ。ローンチデモは「他のどのピクセルも変えずに」編集できると約束している。APIドキュメントは、未変更のピクセルは「一般に」変わらないと述べ、BFLは編集が指定ボックスを超えて広がる可能性があることを認めている。境界のアーティファクトは現実に存在する。これをパイプラインに組み込むチームは、デモを信じるのではなく受け入れテストを構築すべきだ。

それでも、通常のインペインティングとの比較はそれほど接戦ではない。従来のインペインティングは、そのままにしておくよう指示された領域でさえ微妙なドリフトを残す。1回の編集なら誰も気づかない。10段階の承認サイクルを経ると、背景はずれ、タイポグラフィはぼやけ、構図はクライアントが3ラウンド前に承認したものともう一致しない。この蓄積が長い編集チェーンを使いものにならなくするものであり、バウンディングボックスが止めようとしているのはまさにそこだ。

クリエイターが実際に見つけたもの

Midjourney、Ideogram 4.5、FLUX 3 Imageで同じ編集指示を実行したクリエイターが、有益な比較を投稿した。衣類を白い花とカスタードイエローのリボンが付いたピンクのシルクに色替えし、次に顔と手のマクロクローズアップを求めるテストで、Midjourneyはクローズアップを扱えたが、白い花と正確な色合いを外した。Ideogram 4.5は衣類の変更には合致したが、マクロショットの照明はずれて見えた。FLUX 3 Imageは衣類の変更に合致し、クローズアップの照明とコンテキストが称賛された。別のテストでは、FLUX 3 Imageは細い列の編集を意図したオブジェクトに限定したが、他の2つは変更をより広く広げた。

あるクリエイターのスレッドはベンチマークではない。モデルがどこに強いかについてのシグナルとして扱うべきで、強みは広範なスタイライズよりも細部の指示追従にあるようだ。

バウンディングボックスが解決しないこと

配置とドリフトは2つの問題であって、すべての問題ではない。ボックスはモデルに何かがどこへ行くかを伝える。そのものがどう見えるべきかは伝えず、参照要素が配置後にスタイルを変えるのを止めもしない。1つの商品を30種類の異なる背景に対して生成するチームは、依然として商品自体の一貫性を保たなければならず、その作業は座標ではなく参照画像とプロンプトにある。

テキストレンダリングももう1つの未解決の継ぎ目だ。BFL自身のデモ画像は、人間がキュレーションしたプロンプトから生まれている。レイアウトモデルが読みやすい文字を小さなボックス内に、特定のフォントで確実に配置できるかは別問題であり、ローンチ資料はそれに答えていない。このリリースが狙う読者である雑誌レイアウトやeコマースの仕事にとって、採用を決めるのはその細部だ。

また、構造化された入力があっても、美学に関してモデルがブラックボックスでなくなるわけではない。ロゴを左上隅に置くよう指定することはできる。構図が静けさを感じさせるべきだと指定することはできない。

誰も見出しに入れなかったトレードオフ

バウンディングボックスは「背景を青にして」と入力するより設定の手間がかかる。物がどこに行くべきかを知らなければならない。単発の画像なら、そのオーバーヘッドはおそらく割に合わない。同じレイアウトを20枚の商品写真全体で再生成するパイプラインや、ロゴを信頼できる場所に配置しなければならないエージェントなら、すぐに元が取れる。

ローンチ価格は10月8日まで50%オフだ。768ピクセル画像が約0.0205ドル、4Kが最大0.3035ドルで、参照とプロンプト込み、失敗した生成には課金されない。商用のセルフホスト用ウェイトはBFLに問い合わせることで利用でき、オープンウェイト版は今後数週間で提供すると約束されている。

参照の扱いはそれ自体で特筆に値する。1回の呼び出しで最大10枚の参照画像を受け付け、各要素にはどの参照から来てどこに属するかを指定できる。参照10枚だけなら珍しくない。10枚の参照がそれぞれキャンバス上の特定のボックスに対応するとなると、既存アセットから構図を組み立てるワークフローであり、プロンプトの働き方というよりデザイナーの働き方に近い。これをレイアウトグリッドと組み合わせると、モデルは画家というより、意見を持ったコンポジターのように見え始める。

より大きな視点では、画像APIは何年もの間、1つの問いを中心に最適化されてきた。画像はどれだけ良く見えるか? FLUX 3 Imageは、エージェントがより気にする第2の問いを追加する。画像の一部を指定して変更し、それ以外をそのままにできるか? 答えがイエスになれば、画像生成はスロットマシンであることをやめ、編集可能なファイルのように振る舞い始める。

この違いがあるため、MidjourneyやIdeogramとの比較は最初に思えるほど重要ではない。それらのモデルは、新しい画像がどれだけ美しいかを競っており、その点では依然として非常に優れている。BFLは、生成された画像を安定した領域を持つドキュメントとして扱えるかどうかを競っており、それは別のコンテストであり、勝者も異なる。最初のコンテストはほぼ決着がつき、2つ目は始まったばかりだ。インフラへの賭けはおおよそそこを狙う。

関連記事