← ブログに戻る
Ai14 分

一度に10枚の参照画像:AI画像編集は単発ショットから合成へ移行

公開日 2026年9月27日
一度に10枚の参照画像:AI画像編集は単発ショットから合成へ移行

長い間、AI画像編集といえば、参照画像1枚と指示1つだった。モデルに写真を見せ、変更点を伝え、結果を得る。それで多くのことはカバーできたが、人が実際に画像をどう考えるか、つまり複数の素材を1つに組み合わせるという視点が欠けていた。

Qwen-Image 2.1は参照画像の数を最大10枚に引き上げる。モデルは6枚の別々のポートレートを1枚の集合写真に統合したり、モデル、シャツ、靴、バッグ、帽子からそれぞれ1枚ずつ参照して完全なコーディネートを組み立てたりできる。これは単一画像編集とは異なる種類のタスクであり、実務で常に発生する種類のタスクだ。

実用的なケースを考えてみよう。ブランドがキャンペーン画像に自社製品3点をシーン内に配置したいと考え、各製品を別々の写真で提供する。結婚式の写真家が複数のショットを1枚にまとめたい。ファッション販売者がカタログのパーツから完全なルックを組み立てて見せたい。キャラクターデザイナーが12種類のバリエーションを通して顔を一貫させたい。単一参照編集では、1枚ずつ供給し、モデルがそれ以外を一貫して保つことを期待しながら、再生成とパッチを繰り返すしかない。マルチ参照編集なら、パーツをモデルに供給して構成させることができる。

難しいのは常に計算面だった。参照画像が増えればトークンが増え、トークンが増えれば通常は生成が遅くなりメモリも増える。10枚の参照を素朴にモデルへ供給し、拡散プロセスの各ステップで再エンコードすれば、コストは爆発し、データセンターGPU以外では使えない機能になる。Qwenのアプローチは混合粒度アテンション方式だ。テキスト指示にはトークンレベルの因果マスクが適用され、画像生成にはチャンクレベルのマスクが適用される。KVキャッシュ再利用方式により、参照画像と指示は一度計算すれば、各ステップで再計算する代わりに静的コンテキストとしてステップ間で再利用できる。

複数の独立した参照画像が1枚の完全なコーディネート画像に合成される

考え方は至ってシンプルだ。生成中に参照が変わらないなら、毎ステップで再エンコードする理由はない。一度計算してキャッシュし、実際に変化する部分に計算資源を割く。これは見出しにはならないが、機能がコンシューマーハードウェアで実際に使えるかどうかを決める種類のエンジニアリングだ。仕様表の「10枚の参照に対応」と、実用上の「タイムアウトせずに10枚の参照に対応」の違いは、まさにこの種のキャッシュにある。

2枚から10枚への飛躍は、単に数字が大きくなっただけではない。何を記述できるかが変わる。単一画像編集はバリエーション、つまり同じ画像を変化させたものを生む。マルチ画像編集は組み合わせ、つまりパーツから組み立てられた新しい画像を生み、組み合わせには多くの商業的価値が宿る。製品写真、集合ポートレート、ルックブック、シーン構成、アセット群からのストーリーボード——モデルが複数の入力を同時に保持し、それらがどう合わさるかを推論できるようになると、これらすべてが開ける。

これは画像モデルのより広い方向性も示している。初期のモデルはテキストto画像だった。シーンを記述すれば画像が得られる。次に画像to画像編集が来た。画像を与え、変更を記述する。今や最前線はコンポジション、つまりモデルに多くの入力を供給し、それらがどう組み合わさるかを推論させることだ。これは、ゼロから記述するのではなくパーツから組み立てる人間のデザイナーの働き方に近く、生成器というより協働者に近い振る舞いをするモデルへと向かっている。

プライバシーとコントロールの観点も注目に値する。モデルが10枚の参照から構成できるとき、ユーザーは入力のコントロールを保つ。製品を記述してモデルが正確に描画することを期待する代わりに、実際の製品写真を供給する。人物を記述する代わりに、適用される同意の境界内で、その人の実画像を供給する。マルチ参照編集は、ある意味でグラウンデッド生成への一歩であり、モデルはテキスト記述から幻覚を生むのではなく、実在のアセットに固定される。

まだ実際の限界はある。1枚の画像内の複数人物間での同一性保持は依然として気難しく、参照を多く供給するほど、モデルがそれらの属性を混同する可能性が高まる。間違った体に間違った顔、間違った物体に間違った色。10枚という上限は一歩であり、解決済みの問題ではない。入力数が増えるにつれて失敗モードは奇妙になっていく。チームは高速化のエンジニアリングを明らかにやり遂げているが、品質面の作業は進行中だ。

ローカル編集コントロールも同じパッケージの一部だ。円を描いたり、注釈をペイントしたり、別のマスク画像を渡したりして、他に触れずに1つの領域に編集を絞り込める。マルチ参照入力と組み合わせると、これは本格的なコンポジションツールのように見え始める。かつてグラフィックスエディタでレイヤーを必要としたものが、今や1つのモデルへの参照と指示のセットとして表現できる。

クリエイティブツールを作る人にとって、教訓は明快だ。次の差別化の波は「より良い単一画像」ではない。「モデルが一度にいくつのものを保持して組み合わせられるか、そして変更点をどれだけ精密に伝えられるか」だ。10枚の参照が現在の答えだ。それは長く10枚のままではいない。

これを囲むより広い枠組みがある。何年もの間、AI画像生成の約束は「記述すれば手に入る」だった。その約束はカジュアルな用途では機能したが、プロフェッショナルには十分に機能しなかった。プロは白紙の記述から始めることはまれだからだ。彼らはアセットから始める。製品写真、参照画像、ブランドガイドライン、一貫性を保たねばならない顔。マルチ参照編集への動きは、根底ではその現実への譲歩だ。モデルは、ユーザーが記述できることからではなく、ユーザーがすでに持っているものから始めるよう教えられている。

だからこそエンジニアリングが重要だ。10枚の参照をコンテキスト内に保持し、それらを明確に区別し続けることは、1枚を保持する大規模版にすぎないのではない。それは別の問題であり、1つの顔を覚えることと、集合写真で見分けられるほど10人を覚えることの違いだ。Qwenが説明するチャンクレベルマスキングとKVキャッシュ再利用は、その問題を解くための具体的な技術であり、機能が実用で機能するかデモだけで終わるかを決める種類の詳細だ。

商業的含意は直接的だ。マルチ参照編集が解き放つワークフロー、製品コンポジット、集合ポートレート、ルックブック、ブランドアセット生成は、現在、ツールであれ労働であれ、人々がお金を払っているものだ。モデルがそれらを十分にうまくできるなら、価値はコンポジットの人的労働から、モデルが保持し組み合わせる能力へと移る。これは実際の経済的転換であり、だからこそこの機能は、ベンチマーク向きの機能以上に、業界が実際にどこへ向かうかを見るべきものだ。

見落としがちなクリエイティブな側面もある。マルチ参照編集は「プロンプティング」の意味を変える。10枚の参照を供給するユーザーは記述を書いているのではなく、セットをキュレーションしている。何を含め、何を省くかを選んでいる。それはプロンプトエンジニアリングよりもアートディレクションに近く、AI画像制作における創造行為が言語と同じくらい選択と組み合わせに関わる未来を指し示す。その意味で、10枚参照の上限は、ユーザーを依頼者ではなくディレクターとして扱う画像モデルへの最初の本物の一歩だ。

関連記事