通義万相 Qwen-Image 2.1 オープンソース:7Bの小型モデルが透過画像と10枚画像編集をどうコンシューマー向けGPUに収めたのか

9月20日、アリババのQwenチームはQwen-Image 2.1をオープンソースプラットフォームに公開した。ニュースが伝わると、Bilibiliでは統合パッケージの動画がその日のうちに増え始め、タイトルの多くに同じフレーズが添えられていた。最低6GBのVRAMで動く——。「GPU食い」というレッテルを貼られがちだったテキストto画像の分野にとって、この数字自体がニュースだ。
多くの人は一見すると、Qwen-Image 3.0の後に登場した新世代だと考えるだろう。だが違う。Qwenは今年7月にQwen-Image 3.0を予告し、4500トークンの超長いプロンプトをサポートすると謳っていたが、それはあくまでプレビューで、重みもベンチマークも公開されなかった。2.1は2.0系オープンソース路線の正統な後継であり、視覚生成部分は依然として32層のSingle-Stream DiT、パラメータ数7Bで、2月に発表された2.0と同じ軽量アーキテクチャを保っている。
本当に意外なのはパラメータではなく機能だ。今回の3つのアップグレードを並べて見ると、同じ方向を指している。画像生成ツールを「驚くべきデモ」の段階で止めず、実際の制作フローに入り込ませることだ。
第一はネイティブの透過画像だ。以前、アルファチャンネル付きPNGを生成するには専用モデルが必要で、Qwenは昨年12月に専用のQwen-Image-Layeredをリリースしていた。2.1は透過画像機能を統一モデルに統合し、1つのプロンプトで通常画像とRGBAを切り替えられ、透過レイヤーも直接編集できる——表情を変えても背景は透明のまま、あるいは写真から被写体を切り抜いて素材として使える。EC画像やUI素材を作る人にとって、この一手間の往復がかなり省ける。
第二に、参照画像が数枚から10枚に増えた。2.0の頃はマルチ画像編集が少数入力に限られていたが、2.1では6枚の異なる人物画像を1枚の集合写真に合成したり、モデル、服、靴、バッグ、帽子の画像をそれぞれ1枚ずつ使って全身コーディネートを組み上げたりできる。実装には混合粒度のアテンション機構を採用している。テキストはトークン単位の因果マスク、画像生成はチャンク単位のマスクを通し、さらにKVキャッシュを再利用することで、参照画像と指示を一度だけ計算して繰り返し使い回す。要するに、エンジニアリングの力で「画像が増えると遅くなる」という問題を抑え込んでいる。
第三に、局所編集の細分化だ。現在は円を描く、注釈を塗る、あるいはマスク画像を1枚別途アップロードすることで、修正指示をある小さな領域に限定し、画面の他の部分には手を加えずに済む。対応タスクもパノラマ画像、インフォグラフィック、絵コンテへと広がっている。

ただし、今回のオープンソース化にはこれまでにない条件が付いている。Qwen-Image 2.1はQwen Research Licenseを採用しており、研究と評価のみが許可され、商用利用には別途有償ライセンスの交渉が必要だ。これはアリババの最近のオープンソースプロジェクトの多くが採っているApache 2.0路線とは異なり、Z-ImageやIdeogram 4.0のような完全に寛容なオープンウェイトモデルとも距離を置いている。受託案件やプロダクトに使いたいチームにとって、ライセンスはGPUのハードルよりも先に確認すべきものだ。
中国語圏コミュニティの反応は「動く」という点に集中している。Bilibiliでは一部のUP主(投稿者)がワンクリック統合パッケージを作っており、解凍してすぐ使える、最低6GBのVRAM、バッチ画像生成と画像編集に対応といった点を売りにしている。コメント欄では有料ツールと比較する声もよく見られる。この感情には背景がある。過去2年、最も高性能な画像生成モデルの多くはAPIとサブスクリプションの壁の向こうに置かれ、ローカルで動くものはたいていワンランク劣っていた。Qwen-Image 2.1はちょうどその交差点に立っている——小規模でオープンソース、しかも性能はクローズドソースの競合と比較される。だからこそ「有料ツールを圧倒する」という言説が広がる土壌があるのだろう。たとえその言葉自体に疑問符を付ける必要があるとしても。
客観的に見れば、Qwen-Image 2.1の価値は誰かを「圧倒する」ことではなく、透過画像、マルチ画像編集、局所制御といったデザイナーが日々行っている作業を、コンシューマー向けGPUで動く小型モデルに詰め込んだ点にある。実際の納品段階になると、AI生成画像は使えるまでに何が足りないのか?人物は切り抜きが必要、素材は文字を修正、商品の配置は調整、パッケージの文字やボトルの形状は一緒に変わってはいけない。2.1はまさにこうした「ラストワンマイル」を狙っている。一部の有料ツールを本当に置き換えられるかは、タイトルに何が書かれているかではなく、使う人がそれで何をしたかで決まる。
少なくともオープンソースコミュニティの盛り上がりを見る限り、答えは楽観寄りだ。7Bの小型モデルと6GBのカードがあれば、「使える画像生成モデルをローカルで動かす」ことは苦労から解凍してダブルクリックするだけに変わった。これが業界全体に与える影響は、一度のベンチマークスコアよりも長く続くかもしれない。
関連記事
一度に10枚の参照画像:AI画像編集は単発ショットから合成へ移行
単一画像編集はバリエーションを作る。マルチ画像編集は組み合わせを作る。一度に10枚の参照が、私たちのプロンプトと構成の仕方をどう変えるか。
ネイティブ透過は、AI画像における最も有用な新機能として静かに登場した
誰もがリアリズムを求めます。デザイナーは透明な背景を求めます。ネイティブなアルファチャンネル生成が、実際のワークフローを変える静かな機能である理由。
AlibabaのQwen-Image 2.1が、オープンモデルライセンスをめぐる議論を一変させた
技術仕様は印象的だが、本当の話題はライセンスだ。Qwen-Image 2.1はApache 2.0を捨てて研究ライセンスを採用し、細かい但し書きがかつてなく重要になっている。
AI画像と本物の写真、まだ見分けられますか?正直な答えは「ノー」です。
手がかりは消え、検出ツールは信頼できない。AI画像を見抜くことへの正直な答えは「無理」であり、解決策はあなたの目より上流にあります。