← ブログに戻る
News13 分

Qwen-Image 2.1 vs Nano Banana 2.0:7BのオープンモデルがGoogleのすぐ背後に迫る

公開日 2026年9月27日
Qwen-Image 2.1 vs Nano Banana 2.0:7BのオープンモデルがGoogleのすぐ背後に迫る

アリババは9月20日にQwen-Image 2.1をリリースし、それ以来ベンチマークをめぐる議論の様相は一変した。重みをダウンロードできる70億パラメータの画像生成モデルが、アリババ自身のランキングでGoogleのNano Banana 2.0を上回り、独立系のリーダーボードでも二度見されるほど肉薄している。リリースに関するHacker Newsのスレッドは1日で700ポイント以上、コメントは200件近くを集め、このカテゴリにどれほどの注目が溜まっていたかがうかがえる。

数字、そしてそれが重要な理由

アリババのQwen-Image-Benchで、新モデルは60.28を記録し、Nano Banana 2.0の59.82を上回る。これは0.5ポイントの優位であり、技術的な主張というよりもシグナルとして重要だ。つまりアリババは、自らが超えるべきベンチマークとしてGoogleを名指ししたことになる。パラメータ数がより少ない唯一のオープンウェイトモデルであるMeituanの6B LongCat-Imageは約54ポイントで後塵を拝している。参考までに、OpenAIのGPT Image 2.5 Sunburstは67でアリババのチャート首位に立ち、Muse Imageは62.34で、いずれもクローズドだ。

人間同士のブラインド投票を行うAI Arenaは、より控えめな結果を示している。Nano Banana 2.0はElo 1260でQwen-Image 2.1の1228を上回り、GPT Image Sunburstが1423で首位、Museが1276で続く。この勝負でオープンモデルはまだ勝っていない。しかし、Image Edit ArenaとText-to-Image Arenaの両方で全オープンウェイトモデル中1位にランクされており、これは多くの人が実際に気にしているカテゴリだ。Qwen自身はこれを「ナンバーワンのオープンソースモデル」と表現したが、その限定的な主張については、独立系データがそれを裏付けている。

本当に光る点

透明性は誰もが口にする特徴だ。Qwen-Image 2.1はRGBA画像をネイティブに出力するため、透過背景をプロンプトで指定すれば、背景除去ツールをもう一度通すことなくクリーンな切り抜きが得られる。ステッカー販売者、プリント・オン・デマンドのショップ、あるいはアセットをより大きなデザインに合成する人にとって、これは実質的な工程削減になる。また、このモデルは透過レイヤーをフラット化せずに編集できる。これまでは専用のレイヤー対応モデルが必要だった。

最大10枚の参照画像を使った編集ももう一つの目玉だ。人物の写真と衣類の写真を数枚与えると、その人物がその服を着た画像を合成する。6枚のポートレートを集合写真に統合する。10枚の家具画像を1つの部屋に組み上げる。編集する領域の指定方法は3通りある。色付きの円を描く、領域を塗りつぶす、あるいは元画像と別途マスクを渡す。元のピクセルを上書きしたくない場合に使うのはマスク方式だ。

次に、そこそこのハードウェアでの速度。早期利用者によれば、RTX 4090で1メガピクセル画像が約5秒、50シリーズのカードで約25秒、64GBのシステムRAMを積んだRTX 3060で2K画像がおよそ50秒だ。Hacker Newsのあるコメンターは4090で1MP画像を約5秒で変換したと述べている。r/StableDiffusionのあるユーザーは5070または5080で1MP画像が約25秒だったと報告しつつ、編集が最も遅い操作であり、参照画像を積み増すとレイテンシが目に見えて悪化すると指摘した。クラウド並みに速いわけではないが、言い訳にならない程度には速い。

レンダリング中の画像サムネイルの隣に置かれたストップウォッチ。ローカル生成の速度を象徴している

ライセンスの落とし穴

ここがコミュニティを二分した部分だ。以前のQwen画像モデルはApache 2.0で提供され、ファインチューニングして何を作っても販売できた。Qwen-Image 2.1は研究用途限定ライセンスで提供され、アリババとの別途契約なしに重みを商用利用することを禁じている。HNのスレッドはこの曖昧さで盛り上がり、アリババのアカウントが介入して明確にした。重みは制限されるが、それを用いて生成した画像は商用利用を含めてユーザーのものだ、と。

この区別は小さく聞こえるが、非常に重要だ。クライアント、製品、あるいは自分のプロジェクト向けに画像を生成したいだけなら問題なく、アリババは出力にライセンス上の義務は生じないと確認している。モデルをファインチューニングして再配布したい場合は、交渉のテーブルに着く側になる。ほとんどの人は前者に属するため、反発は大きかったが最終的には収まった。

より広い効率性の議論

ここで興味深いのは生のスコアではない。効率性だ。Qwen-Image 2.1は、何倍もの規模を持ち完全にクローズドなモデルに数Eloポイント差まで迫っている。このジェネレータは32層のSingle-Stream DiTを備え、Qwen3-VL 8Bのテキストエンコーダでプロンプトを読み取り、2K(最大2752×2752ピクセル)でネイティブに描画する。効率性の面では、アーキテクチャの蒸留とよりクリーンな学習データが、スケールが必要だと誰もが思い込んでいたギャップの大半を埋められることを証明している。

これは、マーケティング資料では決して示せない形でサブスクリプションモデルに圧力をかける。コンシューマー向けGPUが数秒でスタジオ品質の出力を描画できるなら、「最高の画像を生成します」は月額を払う理由として十分ではなくなる。GoogleとOpenAIは依然として最も難しい意味的・空間的推論タスクでリードしており、ブラインド評価は彼らに優位を与え続けている。Qwen-Image 2.1はそのギャップを埋めたわけではない。ただ、日常業務の大部分にとってそのギャップがなくてもよいものだと感じさせた。そしてそれは、どんな単一のベンチマークスコアよりも大きな変革だ。

コミュニティの実践的な評価

ベンチマーク論争だけでは限界がある。より地に足のついたシグナルは、実際に自分で動かした人が何を報告するかであり、今週の報告は驚くほど一貫している。r/StableDiffusionでは、あるユーザーがQwen-Image 2.1とKrea 2を比較した192枚の生成画像の並列比較を投稿し、テキスト生成や人体構造といったカテゴリ別に分類した。結論としては、オープンモデルは構造面で健闘したが、5090でデノイザーを載せるために量子化テキストエンコーダでやりくりする必要があった。

別のユーザーは32GBメモリのM1 Max MacBook Proでモデルを動作させ、ネイティブのApple Siliconランタイムを使って512×512の画像を約24秒で生成した。デスクトップ基準では遅いが、Nvidiaのハードウェアに縛られないことを証明しており、多くのカジュアルユーザーにとって重要だ。さらに別のユーザーは、マスク、アノテーション、アウトペインティング、OpenPoseのポーズ参照を追加したFooocus風のローカルスタジオを構築し、称賛ではなく率直な批判を求めた。

最も熱狂を集めたのは編集機能だ。ある投稿は、LoRAを一切使わずにキャラクター設定シートを生成し、モデルの参照画像編集を使ってポーズや衣装をまたいでキャラクターの一貫性を保ったと述べている。以前はファインチューニング済みモデルの山と大量の手作業によるクリーンアップが必要だった。単一の7Bモデルがそれをそのまま実現することこそ、ほとんどのベンチマークチャートが捉えていない静かなる注目点だ。

次に注目すべきこと

初期結果はまだ固まっていない。Qwenは自前のベンチマークを構築しており、プロンプトやカテゴリ別スコアを公開していないため、社内の数値は測定というより主張に近い。独立系のAI Arenaの数値のほうが信頼でき、やや辛口だ。現時点での正直な見方は、Qwen-Image 2.1は入手可能な中で最高のオープンウェイト画像モデルであり、クローズドのトップからは確かに一段下がり、かつ小規模でオープンなものが競争力を持ち得ることを示す本物の証拠だ、というものだ。今後数週間の独立系テストが、Nano Banana 2.0に対する0.5ポイントの優位が持続するものなのか、それともベンチマークの都合の良い一部分に過ぎなかったのかを明らかにするだろう。

関連記事