← ブログに戻る
Ai読了目安 14 分

Ant GroupのMing-Imageはフラットな画像ではなくレイヤーでデザインする

公開日 2026年10月2日
Ant GroupのMing-Imageはフラットな画像ではなくレイヤーでデザインする

ほとんどの画像モデルは、1枚の画像がどれだけ美しいかで評価される。Ant Groupは9月22日に2つのモデルをリリースし、別の基準での評価を促している。見終わったあとに、返ってきたものをまだ編集できるかどうか、という基準だ。

AntのinclusionAIラボは、Ming-Image-0.1-DesignとMing-Image-0.1-Design-LayerをHugging Faceで公開した。どちらも60億パラメータで、MITライセンスの下にある。このライセンスはここでは通常以上に重要だ。企業が事前に何も交渉せずに出力を商用利用できるからだ。この2つは写真ではなくデザイン作業を対象としている。インターフェース画面、インフォグラフィック、ポスター、そして文字が実際に読めなければならないようなレイアウトだ。

小さな文字は、オープンな画像モデルがたいてい崩れるところだ。Ming-Image-0.1-Designはテキストを含めた構図全体を生成し、RGBAファイルを書き出せるので、背景は平坦な白い矩形ではなく透明になる。モデルカードでは2048×2048、速さを求めるなら1024×1024を、サンプリングステップ12、CFGスケール1.0で推奨している。拡散モデルとしては12ステップは少ない。重みをロードしてしまえば、出力は速い。標準のdiffusersライブラリで動作し、サービングにはvLLM-Omniをサポートする。

2つ目のモデルのほうが面白い。Ming-Image-0.1-Design-Layerは、完成したフラットなデザインを受け取り、何枚に分けたいかを指定するレイヤープランに従って、透明なレイヤーに分割し直す。出来上がるものは、単一のフラットなPNGというより、作業中のデザインファイルに近い。

フラットなグラフィックデザインが5つの透明なパネルに分かれ、3次元空間に積み重なり、それぞれが異なる視覚要素を保持している

その差が、ほとんどの画像モデルが本物のデザイン作業に踏み込めない理由だ。クライアントが見出しを移動し、ロゴを差し替えたいと思った場合、フラットなPNGでは全体を再生成することになり、キャンバス上の他のすべてがそれに巻き込まれる。レイヤーがあれば、変えたい1点だけを変更できる。AntはこれをCrelloテストセットで評価し、復元された各レイヤーが色と形においてどれだけ近いかを測定している。

Antが公表しなかった数値

引用できる数値はない。モデルカードはArtificial AnalysisのUI/UXデザインリーダーボードとCrelloの結果を指しているが、どちらもチャート画像として示されているだけだ。本文に数値はなく、競合他社の名前もない。このリリースからは、Ming-Image-0.1-DesignがQwen-ImageやSeedream、あるいは商用モデルと比べてどうなのかは分からないし、どちらの主張も自分で評価を再実行しない限り確認できない。

ハードウェアのガイダンスにもギャップがある。Antは6Bモデルを80 GiBのVRAMを搭載した単一のCUDA GPUで検証したが、これはパラメータ数から想像されるよりはるかに余裕のある構成だ。24 GBのコンシューマー向けカードについてのガイダンスはカードにない。まさにそうしたカード向けに作られたコミュニティの量子化が数時間で登場したにもかかわらず、だ。INT4、INT8、FP8、GGUF、ComfyUIビルドはすべて同じ日に現れた。

この最後の点は、しばらく考えてみる価値がある。モデルラボが80 GiBの要件を公表し、コミュニティはその3分の1のサイズのカードでモデルを動かすことで応じる。公式の数値はAntがテストした内容を説明しているのであって、モデルが必要とするものを説明しているわけではない。導入を検討するチームは、検証済み構成を出発点として扱い、量子化ビルドが自分のハードウェアで実際にどう動くかを確認すべきだ。

レイヤーがワークフローを変える理由

デザイン作業は、完成した画像の連続ではない。修正の連続だ。クライアントはドラフトを見て、見出しを大きく、背景をクールな色にと求め、次にロゴは反対側に置くべきだと決める。そうした要求はどれも小さい。フラットな画像では、どれも高くつく。1つの要素を変えることが、他のすべての箇所ですでに承認された構図を再生成することを意味するからだ。

レイヤー出力はそれを逆転させる。デザインが別々のパーツとして存在していれば、修正はそれに関するパーツだけに触れ、残りはそのままにできる。時間単位で請求する代理店にとって、その違いはマージンに現れる。個人デザイナーにとっては、そのツールが手作業より速いかどうかに現れる。

レイヤーがもう1つ功を奏するのは引き渡しの場面だ。フラットなPNGは行き止まりだ。下流で調整が必要な人は一からやり直すことになる。レイヤーファイルは、デザインチームがすでに使っているツールに移すことができる。これは、ワークフローの脇に座るAIツールと、ワークフローに加わるAIツールの違いだ。

これが属する編集競争

Antは空白の領域に出荷しているわけではない。画像市場全体で、編集はモデルの優劣が分かれる場になっている。GPT Image 2.5 Sunburstは編集リーダーボードの頂点に立ち、その兄弟であるFlareがすぐ後を追う。Nano Banana Proはファインチューニングなしでidentity lock(同一性固定)を実現する簡単なルートであり続け、最大14枚の画像と5人の人物をブレンドする。Seedream 5.0は編集とライブWeb検索を組み合わせており、編集に実際の参照が必要なときに役立つ。オープン側では、FLUX.1 Kontextが自分で実行するレイアウト保持編集を扱い、Qwen-Image-Editがオープンウェイトの編集ランキングをリードしている。

そうしたフィールドに対して、Ming-Imageは狭い賭けをしている。汎用的な編集の競技場で勝とうとしているわけではない。テキストの多いデザインが、特化型モデルを支えられるほど大きな市場セグメントであり、レイヤー分解は汎用モデルがわざわざ作ろうとしない機能だ、という賭けだ。デモリールに映えないからである。

その賭けには歴史がある。オープンな画像モデルは2年間フォトリアリズムを追い続け、オープンウェイトとクローズドウェイトの品質差はかなり縮まった。縮まらなかったのは、画像を生成するモデルとアセットを生成するモデルの差だ。画像は、見た目が正しければ完成だ。アセットは、誰かに渡して変更できるときに完成だ。Ming-Imageは2つ目のカテゴリを狙っている。それはローンチ記事で示すのがより難しく、火曜日の午後に手元にあるとより役立つものだ。

これは実際に誰のためのものか

デザインアセットを大量に制作し、その中のテキストが判読可能でなければならないなら、今すぐ試す価値がある。ソーシャルカード、広告バリエーション、社内デッキを量産する小さなマーケティングチームが最も明確な適合例であり、MITライセンスはあなたと商用利用の間に何の条件も置かない。

私ならレイヤーモデルから始める。レイヤー出力は、あなたの既存の画像ツールがほぼ確実にできないことだからだ。ここにある他のすべて、つまり読みやすい文字を描画するテキスト・トゥ・イメージモデルには競合がいる。完成したフラットなデザインを受け取り、編集可能なファイルを返す能力には競合がいない。

最初に実行する価値のあるテストは、英語以外の言語での小さなサイズのテキスト描画だ。このクラスのモデルがたいてい失敗するのはそこであり、今回のリリースはそれについて何も述べていない。多言語タイポグラフィは、ほとんどの実際のデザイン作業の背後にある隠れた要件であり、ラテン文字だけをうまく扱えるモデルは天井のあるモデルだ。

もしあなたの出力がタイポグラフィ的ではなく写真的なら、これらは当てはまらない。Ming-Imageは、美しい人物や風景を描画するモデルと競おうとしているわけではない。狙っているのはデザインの地味な半分、つまりポスターに見出しを正しい位置に置く必要があり、商品カードに人間が読める価格が必要な部分だ。その半分は、それを真剣に受け止めるモデルをしばらく待っていた。

関連記事