← ブログに戻る
Ai読了目安 11 分

オープンソース画像生成がコンシューマー向けGPU1枚に収まる:Hunyuan DiTがハードルを6GB VRAMまで引き下げ

公開日 2026年10月4日
オープンソース画像生成がコンシューマー向けGPU1枚に収まる:Hunyuan DiTがハードルを6GB VRAMまで引き下げ

この1年、オープンソースのテキスト画像生成のアップデートは、ほぼ画質を中心に回ってきた。文字がより鮮明なもの、光と影がより写真らしいものが、ランキング上位に長く居座る。ところがこの10月、風向きが少し変わった。コミュニティの議論の焦点は「どの画像がより美しいか」ではなく、「自分のこのGPUで、いったい動くのか」に移っている。

6GB VRAMというラインは、苦労して突破された

テンセントのHunyuanテキスト画像生成大規模モデル(Hunyuan DiT)が最近発表した中で、最も実用的なのは「小VRAM版」をオープンソース化したことだ。公式によれば、6GBのVRAMで動かせる。この数字の重みは、オープンソースの画像生成を使ったことがある人なら分かるはずだ。これまでローカルでまともなテキスト画像生成を動かそうと思えば、16GB VRAMがほぼ最低ラインで、8GBはぎりぎり、6GBは門前払いだった。

暗い台の上に置かれた緑色の回路基板、冷たい青い光が整然と並んだ黒いチップをなぞる

周辺対応も追いついてきた。このバージョンはLoRAやControlNetといったプラグインもDiffusersライブラリに適合させ、KohyaのGUIへの対応も追加した。コミュニティにおけるKohyaの役割は、「自分のLoRAを訓練する」をコマンドラインのハードルから引きずり出し、数回のマウスクリックで済む作業に変えることだ。それが組み込まれたということは、「モデルに自分の画風を覚えさせたい」という道が平らになったことを意味する。

同時に、Hunyuan DiT本体は1.2版にアップグレードされ、公式が挙げる改善点は画面のテクスチャと構図に集中している。この2つはまさに、オープンソースモデルが長く批判されてきた点だ。細部が増えるとぼやけ、構図が複雑になると散らかる。

もう1つのニュースは見落とされやすいが、非常に重要だ。テンセントはHunyuanのタグ付けモデル「Hunyuan Captioner」もオープンソース化した。タグ付けモデルはLoRA訓練の最初の工程であり、まず機械に各素材を読み取り可能な説明文へと分解させなければ、訓練の話にはならない。これまでこの工程は、クローズドソースのAPIを使うか、品質にばらつきのある代替品を使うしかなかった。これがオープンソース化されたことで、ローカル訓練チェーンはまた1つ、外部サービスへの依存を減らした。

オープンソースモデルが動き始めた後、コミュニティは「修復」に忙しい

Hunyuan側の進展は道を広げるようなものだが、コミュニティは別の路線にパッチを当てている。Qwen-Image 2.1がオープンソース化されると大量の二次創作が生まれ、それに伴って集中的な修正の波が訪れた。

比較的代表例はQwen-Image-2.1-viggle-turboだ。7.26GB、6ステップ推論、int8量子化で、キャラクター設定画を素早く出力するためによく使われ、さらに676MBのtexture-fix VAEを組み合わせてテクスチャを補う。別の作者によるFix v2.0は、Qwen特有のノイズと雑然とした細部を取り除き、しかも構図はほとんど動かさないと主張している。さらにOpinionated版は画面がよりシャープだが、その代償として画面がわずかに移動する。作者はこれを、RES4LYFから派生したres_2m_ncサンプラー一式とパッケージして公開した。

こうしたパッチは些細に聞こえるが、1つのことを物語っている。オープンソースモデルが実運用に入ると、本当に使い勝手を決めるのは、たいてい公開当日のバージョンではなく、その後の数週間にコミュニティが修正を書く気があるかどうかだ。

コミュニティには、そのまま真似できるパラメータも蓄積されている。Qwen 2.1にLoRAを読み込んだ後、CFGは2.0から3.0、40ステップ、サンプラーはres_multistepまたはbetaを使うという提案があった。別の人物はLoRAなしの2.0MP標準ワークフローを実行し、新版Qwen画像モデルは以前はクローズドソースモデルでしか見なかったMidjourney的な雰囲気を出したと語っている。

速度面でも明らかな進展がある。Krea 2 Turboの2ステップ蒸留LoRAチェックポイントは、1024x1024のデノイズ時間を76.4秒から19.3秒へ、およそ4倍に短縮した。代償として細部の質感は教師モデルの0.97~1.09倍にとどまるが、ネイティブTurboの2ステップが0.40~0.65倍であることを思えばはるかに良い。ただしクローズアップ系の画面表現が最も良く、大きな場面はまだ少し物足りない。

ついでに埋められた小さな欠け

メインストリームのモデル以外にも、コミュニティで少数派ながら評価が安定しているオープンソースモデルが、少しずつ弱点を埋めている。AnimaのAesthetic v1.1とOne Obsession v4は、よくスタイル化された出力に使われる。ユーザーは、スタイルが指示に従い、プロンプトが書きやすく、シードを固定してプロンプトを変えれば一貫性のあるバリエーションが得られ、短いテキストも描画できると称賛している。弱点もまた正直だ。複数キャラクターの同時描写と長文は依然として苦手で、コミュニティはAnima 2を待っている。

Krea 2については、「シードが違っても似たように見える」という不満が集中した。そこで誰かが、LoRAを追加せず、モデル専用ノードも入れない方法を編み出した。ComfyUIのテキストエンコーダ(例えばQwen3VL 4B)をLLMとして再利用してプロンプトを拡張し、プロンプトシードを粗調整ノブ、サンプリングシードを微調整ノブとして扱う。こうした「泥臭い方法」はすぐ広まり、公式ドキュメントよりも実際の問題を解決してくれることが多い。

ハードルが下がった後、競われるものは何か

これらの動きをまとめて見ると、方向性は明確だ。オープンソース画像生成はもはや「どれだけ似せて描けるか」だけに答えるのではなく、別の2つの問いに答え始めている。自分が買えるマシンで動くのか、そして自分の意図どおりに正確に変更できるのか。

HunyuanがVRAMを6GBまで抑え、タグ付けモデルをオープンソース化したのは、最初の問いに答えるものだ。Qwenコミュニティの一連の修正と高速化LoRAは、2つ目の問いの中の「正確に変更する」と「速く動かす」に答えるものだ。2つの路線は無関係に見えて、行き着く先は同じだ。生成という行為をデモから日常へと移すこと。

普通のクリエイターにとって、これはおそらくここ1年で最も実質的な変化だ。1枚の画像のために計算資源を借りる必要もなければ、スタイルを変えるために環境一式を入れ直す必要もない。数年前の中位GPU1枚と、コミュニティが積み上げてきたツールチェーンがあれば、まともな作品群を作るには十分だ。

本当に縮まったのは、「試してみたい」から「実際に作り始める」までの距離だ。

関連記事