← ブログに戻る
Ai読了目安 13 分

画像モデル軍拡競争:Midjourney、Nano Banana、そしてオープンウェイトの静かな台頭

公開日 2026年10月1日
画像モデル軍拡競争:Midjourney、Nano Banana、そしてオープンウェイトの静かな台頭

AI画像生成から数か月離れていると、戻ってきたときの風景はほとんど見分けがつかないほど変わっている。大手はバージョンを変え、かつての消費者向けの寵児は引退し、オープンウェイトの分野は大幅に強化された。2026年秋の現状はこうなっている。

MidjourneyはV8に移行し、V8.2が7月にデフォルトになった。依然として、生の能力よりもアートディレクションを目的とするときに人々が手に取るツールであり、人間のディレクターのようにムードとライティングを解釈するモデルだ。アップスケーリングなしのネイティブ2K出力、プロンプト読解の向上、そして選んだ画像から好みを学習するパーソナライゼーションシステム。トレードオフは変わっていない。無料枠はなく、3件の著作権訴訟が係争中で、テキストレンダリングは改善したものの複雑なタイポグラフィでは依然として信頼できない。

GoogleのNano Bananaは最も混乱した道のりをたどった。オリジナルは2026年2月にGemini 3.1 Flashを基盤とするNano Banana 2へ静かに置き換えられ、Geminiアプリのデフォルトになった。旧Gemini 2.5 Flash Imageは非推奨化が進み、10月2日に停止する。コミュニティでの愛称は、Nano Bananaが単独の製品ではないという事実を隠している。それはGeminiに組み込まれた画像生成であり、チャットインターフェースを求めるか専用ツールを求めるかによって、便利にも、もどかしくもなる。強みは本物だ。コンテキストを記憶するマルチターン編集、そして最大5人の人物と14個のオブジェクトを編集を通じて一貫させられることが検証されている。

あるコミュニティガイドが言うように、Nano Bananaのコツは、各参照画像に1つの役割を与えることだ。1つはアイデンティティ用、1つはポーズ用、1つはスタイル用。すべてを1つの参照に詰め込むと出力が濁る。これはほとんどのプロンプトの小技よりも重要な小さな規律であり、分野全体でマルチ参照編集の背後にあるのと同じ原則だ。

OpenAIのGPT Image系は最大16枚の参照画像を使ったインストラクション・スコープ編集を推し進めており、新しいSunburstとFlareのバリアントは、57モデルで3000万票以上を集めたLMArena画像編集アリーナのトップに位置している。xAIのGrok Imagine Image 2.0は、正確な編集と鮮明なテキストレンダリングを売りにし、以前のディープフェイク騒動でガードレールの見直しを迫られた後、実運用向けの選択肢として自らを位置づけている。

長期的に最も重要な物語はオープンウェイトで起きている。Black Forest LabsのFLUX.2は、編集可能な高解像度オープンモデルの分野でトップに立ち、速度向けのklein 4Bバリアントとturboバリアントを備える。Z-Image、Qwen-Image、Ideogram 4.0がApache-2.0ライセンスの選択肢を補完し、Ideogramのオープンウェイトのレンダリング品質は開発者からトップクラスと評されている。ライセンスが真の差別化要因になった。FLUX.2 devは非商用だが、FLUX.2 klein、Z-Image、Qwen-ImageはApache 2.0の下で商用利用を許可している。ベースモデルの選択は今やベンチマークではなくライセンスから始まる。

ライセンスの点は強調に値する。多くの人がつまずくのはそこだからだ。2つのモデルがベンチマークで同じスコアを取りながら、出力で何を許されるかは雲泥の差がありうる。クライアント向けにファインチューニングしてデプロイできるモデルは、研究にしか使えないわずかに優れたモデルよりも価値がある。オープンの分野はまさにこの線で分かれ、商用利用可能な層(Apache 2.0または同等)でエコシステムが実際に構築されている。

そのすべての根底にある変化は、編集が生成に取って代わってフロンティアになったことだ。1年前は、テキストから最も写実的な画像を描けるのは誰かという競争だった。今では誰にでもできる。新しい競争は、すべてを再生成せずに1つのことを変えられるのは誰か、100枚の画像を通してキャラクターを維持できるのは誰か、ポスターに鮮明で正確なテキストを載せられるのは誰かだ。勝っているモデルは、初回生成の驚きではなく、反復のために最適化されたものだ。

ハードウェアの話はこれと並行して進んでいる。オープンモデルは7Bクラスのモデルが消費者向けGPUで動くほど小さくなり、コミュニティはターミナルに触れたくない人々にローカル生成を約束するワンクリック統合パックで応えた。「6GBカードで動く」というベンチマークは、どのリーダーボードスコアと同じくらいマーケティング的な主張になった。それが、モデルが珍品かツールかを決めるからだ。

一貫性についての考え方にも静かな変化がある。それは真の戦場になった。1枚の美しい画像を描くモデルは最低条件にすぎない。同じキャラクターを100枚の画像で、あるいは同じ製品を十数アングルで描けるモデルが、実際のワークフローで居場所を得る。参照ベースのアプローチ、つまりキャラクターの画像を1枚から14枚添付してモデルに再現させる方法は、素早い出発点だ。LoRAトレーニング、つまり自分で厳選した画像で微調整した小さなアダプターは、参照がずれるときのより重いハンマーだ。トレードオフは制御とセットアップ時間であり、正直な答えは、安定した顔を保証する方法はないということだ。だから真剣なクリエイターはコミットする前に固定のショットリストでテストする。

このカテゴリは、一般向けに有用な語彙も生み出した。マルチターン編集とは、モデルが自分が何をしたかを記憶し、あなたと一緒に反復することを意味する。インストラクション・スコープ編集とは、何を変えるかを正確に指示でき、残りはそのままにすることを意味する。マルチ参照合成とは、複数の画像を入力し、それぞれに役割を伝えることを意味する。これらはどれも珍しいものではない。今や標準機能であり、モデルは存在するかどうかではなく、どれだけうまく実行するかで競っている。

今日ツールを選ぶ人にとって、正直なアドバイスは変わっていないし、おそらく変わらないだろう。モデルを仕事に合わせることだ。美しさならMidjourney、Googleエコシステム内でのマルチターン編集ならNano Banana、インストラクション・スコープの制作編集ならGPT ImageかGrok、制御、データ所在地、永久に保持できるファインチューニング済みキャラクターが必要ならオープンウェイト。1つのモデルがすべての正解である時代は静かに終わり、誰も本当には発表しなかった。それに取って代わったのは、正解が何を作りたいかによって完全に変わる市場であり、最も成功するのは単一の勝者を追うのをやめて選ぶことを学んだ人々だ。

これらすべての変化を通じて唯一の定数は、差別化要因が生の画質ではなく、その周りのワークフローになったことだ。一貫性、編集可能性、ライセンスの明確さ、すでに使っているツールとの統合。それこそが、モデルが日々の仕事に現れるか、決して見返さない印象的なデモのフォルダに眠るかを実際に決める。軍拡競争は現実だが、勝者は最高のベンチマークのモデルではない。人々が実際に働く方法に合うモデルであり、それは測定がより難しく、何が定着するかのはるかにより良い予測因子だ。

関連記事