Qwen Image 2.1:7BのオープンウェイトモデルがNano Banana 2.0に肉薄する理由

アリババがQwen Image 2.1をひっそりと公開したとき、主要な数字は目立たないものに見えた。70億パラメータ。オープンウェイト。また一週間、また一つのモデル。だがベンチマークが出ると、Tom's Hardwareのレポートは、この小型モデルがいくつかの画像ベンチマークでGoogleのNano Banana 2.0を上回り、OpenAIやMetaの製品とも競合し続けていると主張した。Qwen公式ブログ記事に関するHacker Newsのスレッドは739ポイントと約200件のコメントを集めたが、これは日常的なモデルリリースには得られない種類のトラフィックだ。
何かが起きている。ここで起きていることは解き明かす価値がある。なぜなら興味深いのは、誰がリーダーボードの頂点に立つかというよりも、画像生成がどこへ向かっているかだからだ。
小型モデル、侮れない出力
パラメータ数こそが本題だ。最先端の画像モデルの多くは数百億パラメータに位置する。競争力のあるベンチマークを示す7Bモデルは、自前のハードウェアで推論する人々の計算を変える。RTX 5090なら、何も量子化せずに完全なBF16デノイザーを実行できる。M1 Maxと32 GBメモリを搭載したMacBook Proでは、ある開発者がApple Silicon上でネイティブにテキストから画像生成と画像編集を動作させ、512x512の出力におよそ24秒かかった。そしてデモをr/StableDiffusionに投稿した。これはノートPC上のデータセンター性能ではない。最高のクローズドシステムに匹敵するとされるモデルを、動画編集用に買ったマシンで趣味人が動かしているのだ。
コミュニティによる移植は数日以内に続いた。誰かがTensorSharpにQwen-Image 2.1サポートを追加し、GGUF量子化とLoRA設定、生成を数ステップに短縮する高速なドラフト版も含めた。別の開発者は、マスク、注釈、アウトペインティング、OpenPose参照、スケッチを入力とするFooocus風のGradioスタジオを構築した。パターンは繰り返される。ウェイトがオープンであれば、公式チームが手を付けないツール群をエコシステムが作るのだ。
ベンチマークへの懐疑は健全
もちろん、ベンダーのベンチマークは疑ってかかるべきであり、Hacker Newsのコメント投稿者たちは期待を裏切らなかった。いつもの注意点が当てはまる。ベンチマークの選定が重要であり、プロンプトセットが重要であり、「Nano Bananaに勝つ」はどのタスクを測るかに大きく依存する。Qwen Image 2.1とKrea 2を192枚の画像で横並び比較し、カテゴリ別に並べて公開したものは、プレスリリースよりもこうした議論を決着させる群衆検証のまさに典型だ。これを実施した人物は、メモリ予算に収めるためテキストエンコーダをNF4に量子化せざるを得なかった。これはベンチマーク条件と実際の構成のギャップを物語っている。
テキスト描画は最も注目される能力の一つであり続けており、Qwenモデルが歴史的に英語だけでなくCJK文字でも強みを発揮してきた領域だ。編集はもう一つの戦線だ。Qwenの編集モードでLoRAなしに生成したキャラクターデザインシートを示すr/StableDiffusionの投稿が注目を集めたのは、そのワークフローにかつては大量のファインチューンと週末丸ごとのComfyUI配線が必要だったからだ。
なぜこれが一つのモデルを超えて重要なのか
ここには二つの大きな潮流が見える。第一に、オープンウェイトコミュニティに新しい既定ができた。長い間、ローカル生成といえばStable Diffusionの派生やFluxの変種であり、最もマシなチェックポイントを常に探し回るものだった。Qwen Image 2.1はモダンな編集能力を内蔵してそのエコシステムに収まり、ツールはほぼ即座に続いた。第二の潮流は地理的なものだ。「中国のAIモデルが世界的な人気で急上昇——ワシントンは懸念」と題された別のr/singularityスレッドが議論を積み上げたのは、まさにこのようなモデルが、ベンダーが委託したものではなくユーザー自身が実施する嗜好テストの上位に何度も入るからだ。
今、日常使いのモデルを選ぶ人にとって、実用的な見方は単純だ。ホスト型APIから絶対最高の編集品質を得たいなら、クローズドのトップ勢は依然としてその価格に見合う。自分で実行し、ファインチューンし、量子化し、許可を求めずに自分のパイプラインに組み込みたいなら、この7Bの挑戦者は無視しにくい。そして単に興味があるだけなら、ウェイトはHugging Faceにある。2年前のノートPCで24秒というのは、最初の実験として越えるべきハードルが低いということだ。
編集という新たな戦場
最も影響の大きい機能は、テキストから画像生成ですらない。編集だ。以前の画像モデルは、修正を別個の問題として扱っていた。この領域をインペイントし、ControlNetを配線し、継ぎ目が消えることを願う。Qwen Image 2.1は編集をネイティブモードとして扱う。描くモデルと同じモデルが描き直せる。r/StableDiffusionに出回ったあるデモは、LoRAも参照リギングもなしに生成されたキャラクターデザインシート、つまり同じキャラクターのポーズや衣装をまたいだ複数の一貫したビューを示していた。一年前にそのワークフローを試した人なら、そのコストを知っている。キャラクターごとのファインチューン、何時間ものマスク描き、そして角度ごとにずれる結果だ。
編集は商業的価値が集中する場所でもある。マーケティングチームが欲しいのは画像ではない。自分たちの画像を調整したものだ。背景を差し替えた商品写真。見出しを別言語で再生成したポスター。ネイティブ編集はそのパイプラインを圧縮し、それが今やダウンロード可能なモデルに存在するという事実は、APIに決して金を払わない人々にもその圧縮が届くことを意味する。

コミュニティのツール群はこれを反映している。TensorSharp移植版は初日から編集設定を同梱しており、後付けの追加ではない。Fooocus風スタジオはマスク、注釈、アウトペインティング、ポーズ参照を一級の入力として公開している。移植する人々が編集をボーナスではなく中核機能として扱うとき、それは市場が何を重要と考えるかに投票しているのだ。
コミュニティは実際にどう主張を検証するか
ベンダーのベンチマークは、誰かが再現するまではマーケティングだ。それゆえ今月より興味深かったのは、群衆による成果物だった。同一プロンプトで生成しカテゴリ別に並べた、Qwen対Krea 2の192枚比較は、実際に議論を決着させる形式だ。これはブラインド味覚テストと同じ美点を持つ。誰のランキングも、それに触れて無傷ではいられない。一方のモデルが圧倒するカテゴリも一目でわかり、両方が失敗するカテゴリも同様だ。
Hacker Newsは見出しを額面通りに受け取ることを拒み、その役割を果たした。リリーススレッドとTom's Hardware投稿のコメント欄は、いつもの弱点を突いた。どのベンチマークスイートか、誰のプロンプトセットか、テスト分布の外では何が起きるのか。その懐疑はオープンウェイトコミュニティの免疫系であり、そこで生き残った主張が重みを持つ理由だ。Qwen Image 2.1の評判は現在、アリババの数字よりもむしろ、何百人もの人が実行し、そのほとんどが屈辱的なスレッドを投稿しなかったという事実の上に築かれている。
「十分に良い」とオープンの経済学
モデル品質を超えたビジネス上の読み方がある。ホスト型画像生成の価格は最先端に対して設定され、最先端は運用コストが高い。電気代ほどのコストで最先端の品質の大半を提供する7Bモデルは、顧客が許容する支払額を変える。また、開発者が何の上に構築するかも変える。安定したウェイトを持つオープンモデルは、API契約を交渉したり非推奨化を恐れたりすることなく、固定し、ファインチューンし、製品内で出荷できる。
この最後の点は強調に値する。業界がちょうど実例を示したからだ。OpenAIは8月末に単独製品としてのDALL·Eを終了し、画像生成をChatGPT Imagesに統合した。技術的には何も失われなかったが、古いインターフェース上に構築されたすべての統合は、他者のスケジュールで移行を迫られた。オープンウェイトはそんなメールを送ってこない。
これらはQwen Image 2.1を世界最高の画像モデルにするものではない。より破壊的とさえ言える何か、つまり普通の人が完全に所有できる最良の画像モデルにするのだ。リーダーボードの議論はいずれにせよ次のリリース、そのまた次で決着する。所有権の移行こそが持続する部分だ。
内面化すべきもう一つはペースだ。あるr/PromptEngineeringの投稿者が最近数えたように、一か月で20以上の画像モデルがリリースされるということは、あらゆる「最高モデル」という主張の賞味期限が週単位であることを意味する。Qwen Image 2.1は、小さくオープンなものが大きくクローズドなものを赤面させることを示す現在の証拠だ。一か月もすれば、興味深い問いは何がこれに取って代わるかになる。
関連記事
中国のAI画像モデルが海外でファンを獲得、ワシントンも注視
採用はまず技術的で、政治的なものは二の次だ。開発者は機能するものをダウンロードする。そして今、それはますます中国のラボのものになっている。
予測市場はAI画像の何に賭けているのか
本物のお金が、AI画像で誰が勝つかに賭けている。OpenAIは静止画でリードし、MiniMaxは動画でリードし、オープンモデルは誰も織り込んでいないワイルドカードだ。
Qwen-Image 2.1 vs Nano Banana 2.0:7BのオープンモデルがGoogleのすぐ背後に迫る
70億パラメータのオープンモデルが、アリババのベンチマークでGoogleのNano Banana 2.0を上回り、それ以外の場でもすぐ手の届く位置にいる。
中国の画像モデルが世界へ、そして今月、議論は変わった
中国の画像モデルが世界へ広がっている。今月、ベンチマーク、コメント欄、ワシントンがどう変わったか。