← ブログに戻る
Ai読了目安 17 分

アリババ、平坦な画像を編集可能なレイヤーに分解するモデルをオープンソース化

公開日 2026年10月6日
アリババ、平坦な画像を編集可能なレイヤーに分解するモデルをオープンソース化

アリババのQwenチームは10月上旬にQwen-Image-LayeredをModelScopeとHugging Faceで公開し、商用利用を許可するライセンスを付与した。10月2日の中国語版発表では、ネイティブなPhotoshopスタイルのレイヤー理解と編集を備えた初の画像モデルだと説明している。この主張は吟味する価値がある。というのも、その背後にある仕組みは、ほとんどの画像エディタが目指してきたものとは異なるからだ。

生成画像を編集する標準的な方法は、領域を選択してその内部を再生成することだ。インペインティングはこの方式で動作する。前日にリリースされたFLUX 3 Imageも同様で、モデルが触れてよいピクセルを正確に定義するバウンディングボックスを使う。このアプローチには既知の弱点がある。モデルはレイヤーとは何かを理解していない。矩形領域とプロンプトを見て、穴を埋めるだけだ。

Qwen-Image-Layeredは異なる表現から出発する。完成した画像を一連のRGBAレイヤーに分解し、各レイヤーはフル解像度で独自の透明性を持つ。オブジェクトは1つのレイヤーになり、テキストは別のレイヤー、背景はさらに別のレイヤーになる。レイヤーを移動したり、色を変更したり、差し替えたりしてから、スタックを再合成できる。これを測定可能にしているのが訓練目的だ。モデルは、再合成すると入力画像を再現するレイヤーを生成することを学ぶため、分解品質に直接スコアが付く。

淡い石板の上に少しずらして重ねられた3枚の薄いすりガラス板

なぜこれはセグメンテーションとは別の問題なのか

画像をオブジェクトにセグメンテーションするのは古いタスクであり、モデルはしばらく前から得意としてきた。レイヤー分解はより特定のものを求める。出力は編集プリミティブとして使えなければならず、つまり各レイヤーにはクリーンなアルファエッジ、正しい重なり順、そして2つのレイヤーに同時に現れるピクセルの二重計上がないことが必要だ。

これらの失敗モードはどちらもよくある。壁の前に立つ人物を切り抜いた場合、素朴なセグメンテーションでは、そのレイヤーを削除したときに人物のゴーストが残る。壁のレイヤーは、人物が壁を遮っていることを学習していなければならず、人物の背後で壁がどう見えたかを再構成する必要がある。これはラベリングの問題ではなく生成の問題であり、RGBA表現が重要な理由でもある。各レイヤーは独自のアルファチャンネルを持つため、モデルはどのレイヤーが何を所有するかをピクセル単位で決定しなければならない。

中国語のレポートは、これを実現する2つのアーキテクチャを挙げている。専用設計のRGBA-VAEエンコーダーと、レイヤーレベルの3D位置エンコーディングだ。興味深いのは後者である。レイヤーが深さ方向に積み重なるなら、モデルは各レイヤーがスタック内のどこにあるかの概念を必要とし、それを位置エンコーディングが提供する。

「ゼロドリフト」という主張

売り文句は、編集によってほとんどドリフトが起きないというものだ。1つのレイヤーを変更しても、それ以外はそのまま留まる。

ドリフトは、生成画像を編集したことがある人なら誰でも知っている失敗だ。背景の差し替えを依頼すると、モデルは少し違う顔、違う色合いのシャツ、あるいは移動した影を返してくる。拡散ベースの編集はすべて、これがある程度伴う。モデルが依頼した以上に多くのものを再生成するからだ。AdobeのLightroomの新しいPrompt to Edit機能はまさにこの問題を抱えており、写真家がそれを警戒する理由でもある。

レイヤーモデルは、この問題を構造的に回避する。編集していないオブジェクトが別個のRGBAレイヤーとして存在し、編集が別のレイヤーにしか触れないなら、触れられていないレイヤーは再生成されるのではなくコピーされる。ドリフトはモデルの性質ではなく、コンポジターのバグになる。

これは、どのインペインティング手法よりもクリーンな保証であり、ここでベンチマークの数値ではなくアーキテクチャの選択が本題である理由だ。

実際の作業にとって変わること

3つのワークフローが短くなる。

既存アセットの再利用。バナーに埋め込まれた商品写真を、誰かがクリッピングパスをトレースすることなく取り出して再利用できる。レイヤーはすでにアルファ付きで存在している。

透明出力。デフォルトでRGBAレイヤーを出力するモデルは、通常動作の副産物として透明PNGを生成できる。これにより、現在はセグメンテーションモデルか手動マスキングのどちらかを必要とする工程がなくなる。

バッチバリエーション。マスター画像がレイヤーのスタックであれば、チームは1つのレイヤーを差し替えて再合成するだけでバリエーションを再生成できる。画像の残りは変更されず、これはブランドガイドラインが商品以外のすべてを固定している場合に重要だ。

4つ目はそれほど明白ではない。レイヤーは構造化データだ。名前付きRGBAコンポーネントのスタックは、フラットなビットマップよりもはるかにクリーンにエディタや自動パイプラインに流し込める。これにより、モデルは目的地ではなくコンポーネントとして有用になる。

限界はどこにあるか

このモデルは画像を分解する。レイヤーが何と呼ばれるべきかは知らず、意図も推論しない。散らかった机の写真を分割するように頼むと、結果はオブジェクトをうまく分離しつつ、照明を下手に分離するかもしれない。半透明の素材は難しいケースだ。コップ一杯の水は、おそらく同時に複数のレイヤーに属すると言えるからだ。

反射や影についても、深度順序は曖昧なままになる。壁に落ちる影はオブジェクトの性質だが、それは背景レイヤー上に存在し、その境界のどちら側に置くかを決めるのは、モデルが教えられずに行わなければならない判断だ。

これらのどれも、このリリースの重要性を下げるものではない。むしろ、完成したツールではなく基盤にしてくれる。

なぜレイヤー形式は、より優れたインペインターよりも普及しやすいのか

過去2年間、画像モデルの競争は同じコースで行われてきた。世代ごとにインペインティングは鮮明になり、プロンプト追従性は向上し、明らかなアーティファクトは減少した。

そのコースには限界があり、それは構造的なものだ。インペインターがどれほど良くなっても、インタラクションモデルは同じままだ。ユーザーが領域を定義し、モデルがそれを埋め、ユーザーが結果を判断する。品質は向上するが、ワークフローは変わらない。証拠は、モデルの世代をまたいで同じ不満が繰り返し現れること、つまり局所編集がどこか別の場所に変更を生むという点だ。

レイヤーは品質指標ではなくワークフローを攻める。画像がスタックになれば、作業単位は選択範囲ではなくレイヤーになり、ユーザーはコンポーネントを直接操作する。これはデザイナーが30年間専用ツールで行ってきた方法であり、画像モデルがそれをしなかった理由は、その表現が利用できなかったからだ。

その表現を構築するのは高コストだ。モデルは、ほとんどがレイヤー分解を含まないデータから、オクルージョン、深度順序、アルファを学習しなければならない。だからこそ、予測されたスタックから入力画像を再構成するという訓練目的が、この設計の要となる部分なのだ。

このアプローチが機能すれば、影響はアリババ自身の製品を超えて及ぶ。レイヤースタックを受け入れるコンポジションツールは、以前は人間がマスクを切る必要があったパイプラインに組み込める。分解データを提供するストック画像ライブラリは、フラットなJPEGを提供するものより価値が高くなる。モデルはその連鎖の最初のピースであり、エコシステムにはまだ残りが揃っていない。

競争環境

レイヤー分解はアリババ独自のものではない。Ant GroupのMing-Imageは関連する立場をとり、デザインをフラットな画像ではなくレイヤー化されたコンポジションとして生成する。Stabilityなどは、ワークフローの一部を近似するセグメンテーションモデルを出荷してきた。異なるのは、RGBAレイヤーをネイティブ出力形式として採用するというコミットメントと、誰でも実行できる重みを公開するという決定だ。

その最後の選択は、アイデアがどれだけ速く広がるかに重要だ。画像ツール市場は2年間かけて「領域を選択し、変更を記述する」インタラクションに収束してきたが、根底にある表現が変わらなかったという単純な理由で、結果の品質は頭打ちになっている。ビットマップではなく編集可能なスタックをエコシステムに渡すことは、ベンチマーク表に現れる前に他の人々の製品に現れる種類の転換だ。

注目すべきは、コンポジションツールがレイヤースタックを入力形式として受け入れ始めるかどうか、そしてエディタが分解を修復作業ではなくプロジェクトの最初のステップとして扱い始めるかどうかだ。ベンチマークスコアは副次的な問題である。

関連記事