9月国産オープンソース画像生成モデルが相次ぎ仕掛ける:商湯、アント、書生も黙っていられない

ちょうど終わったこの9月、国産AI画像生成に、あまり目立たないが非常に重要な変化があった。オープンソース化だ。わずか1週間のうちに、商湯(SenseTime)、アント(Ant)、上海人工知能研究所の書生(InternLM)チームが相次いでオープンソースの画像生成モデルを公開し、これまでクローズドな大手だけが握っていた能力をテーブルに載せた。この出来事の影響は、特定の新モデルが1つ登場することよりはるかに大きいかもしれない。
3社の持ち札はそれぞれ何か
商湯 SenseNova U1.5 Liteは、9月8日にオープンソース化された8B規模の画像生成モデルだ。売りは4K直接出力で、公式は「クローズドな大規模モデルに匹敵する」としている。8Bというサイズは重要で、一般の開発者が手持ちのGPUでも動かせることを意味し、最初から12GBや24GBのVRAMを用意する必要はない。
アントの6B統一画像モデルは、9月6日にオープンソース化された。より「手間が少ない」道を選んでおり、テキスト生成と指示による編集を1つのモデルに統合している。つまり、ゼロから画像を描かせることも、「背景を入れ替えて」「色を明るくして」と既存画像を編集させることも、モデルを切り替えずにできる。さらに珍しいのは、アントが学習レシピもすべて公開したことだ。オープンソースモデルは多いが、学習の詳細を開示するところは少ない。
書生 InternLumina-U2は、9月3日に発表された視覚大規模モデルで、画像理解と生成の統合を主軸とし、重みは公開される予定だ。位置づけは「画像を理解でき、かつ画像を描ける1つのモデル」という方向に寄っており、参照画像をまず理解させてからそれに沿って修正するようなシーンでは、純粋な生成モデルより優位性がある。

なぜオープンソース化を単独で取り上げる価値があるのか
多くの人は、オープンソースモデルは一般ユーザーとは縁遠く、どうせ自分はモデルを学習しないと思っているかもしれない。しかし実際の影響の連鎖はこうだ。オープンソースモデルは、さまざまな無料ツールの土台になる。
独立系開発者や小さなチームが、大手のAPIを買う予算はないが、自分のプロダクトに画像生成機能を加えたい場合、どうするか。答えは、Hugging Faceからオープンソースモデルを取得し、ローカルまたは安価なGPUを借りて動かすことだ。商湯の8B、アントの6Bというサイズは、まさに「一般消費者向けマシンに収まる」範囲にある。オープンソースモデルが増え、小さく、強くなるほど、一般の人が組み立てられる無料の画像生成ソリューションは増える。
見方を変えれば、これは国産モデルによる、Stable DiffusionやFluxといった老舗オープンソース路線への応答でもある。従来、オープンソースの画像生成といえば、デフォルトでStable Diffusionエコシステムだった。今、国産プレイヤーがそこに割って入り、しかも中国語の理解や中国語フォントの描画といったローカルな強みを持ち込んでいる。これは中国語ユーザーにとって確実な価値の上乗せだ。
オープンソース化の先で問われるもの
オープンソース化は終点ではなく、始点だ。モデルがオープンソース化されても、実際に使えるかどうかは3つの要素にかかっている。
1つ目はエコシステムだ。モデルには重みだけでは不十分で、推論ツール、LoRA学習スクリプト、WebUI対応がセットで必要になる。Stable Diffusionが今でも多くの人にとってデフォルトの選択肢であり続けるのは、特定のバージョンではなく、その背後にある大きなツールチェーンのおかげだ。
2つ目は中国語能力だ。国産モデルの最大の差別化は、中国語プロンプトの理解と中国語テキストの描画にある。ここは海外のオープンソースモデルが長らく苦手としてきた領域であり、国産オープンソースモデルが最も食らいつくべき部分でもある。
3つ目は商業化の道筋だ。オープンソースモデルをどう収益化するかは、ずっと難しい課題だ。商湯、アント、書生といったプレイヤーは、慈善ではなく、オープンソースを通じてエコシステムを育て、その後エンタープライズサービスやクラウドAPI、カスタマイズでマネタイズしようとしている可能性が高い。ユーザーにとっては、無料のものがますます増えることを意味するが、「無料」と「継続的なメンテナンス」がイコールになるかは、進みながら見極める必要がある。
もう1つ背景を補足すると、このオープンソース化の波は、海外のオープンソースエコシステムがやや停滞気味のタイミングに重なった。Stable Diffusionは本当の意味での大型バージョンアップが長らくなく、Fluxは完全なオープンソースの重みをなかなか公開していない。国産モデルはこのタイミングで、6Bや8Bという「家庭用マシンに収まる」サイズをオープンソース化し、相手が息継ぎをしている隙に、中国語オープンソース画像生成の土台を先に築いた形だ。
一般クリエイターにとっての実際の意味
具体的な個人に落とし込むと、これらのオープンソースモデルがもたらす変化は、画像生成のコストが引き続き下がっているということだ。
以前は、AI画像生成を安定して使い、まともなものを作るには、ツールをサブスクするか、枚数に応じてAPI料金を払う必要があった。オープンソースモデルが増えたことで、無料でローカル実行できる選択肢がいくつか現れた。これらの手段には一般に導入ハードルがあり、環境構築やパラメータ調整が必要だが、そのハードル自体もコミュニティによって少しずつ低くなっている。
私の見立てでは、短期的には一般クリエイターは依然としてWebツールを使うのが最も手間がかからない。しかし、小さなプロダクトや小さなアプリを作っていて、画像生成機能を組み込みたいなら、今回のオープンソースモデルの密度とサイズは、あらためて確認する価値がある。少なくとも「国産には使えるオープンソース画像生成モデルがない」という言い方は、9月以降はもはや成り立たない。
関連記事
ChatGPT Images 2.5はより高速、より高精細、そしてついにスケッチが可能に
Images 2.5はレイテンシを最大50%削減し、スケッチ機能を追加、複数ターンの編集を安定化。何が変わったのか、誰が注目すべきか。
腾讯混元がAI画像生成を映像制作の現場へ:HyImage 3.5プレビュー版を試す
HyImage 3.5 previewはブラインドテストで約30%向上、5枚の参照画像と2K出力に対応。WorkRallyに導入され『行镖』で実戦投入。本記事ではその能力と利用経路を解説する。
2026年9月版 最高のAI画像生成ツールランキング
GPT Image 2.5、Midjourney V8.2、Nano Banana 2、Flux 2ほかを、価格と仕事別のおすすめ付きでランキング。
MicrosoftのMAI-Image-2.6がGPT Image 2に静かに迫っている
Microsoftの挑戦モデルがElo差を21ポイントに縮めた。MAI-Image-2.6の台頭がAI画像市場に意味するもの。