← ブログに戻る
Ai読了目安 18 分

40ステップではなく4ステップ:蒸留はいかにしてオープン画像モデルをコンシューマー向けGPUに押し込んでいるか

公開日 2026年10月6日
40ステップではなく4ステップ:蒸留はいかにしてオープン画像モデルをコンシューマー向けGPUに押し込んでいるか

高性能なオープン画像モデルとコンシューマー向けグラフィックスカードの間のギャップは、ここ数か月にわたって縮まり続けている。その仕組みは、ノイズ除去ステップの削減にある。かつてノイズを画像に変えるのに40回のパスを必要としたモデルも、適切なアダプターを装着すれば、4回、6回、あるいは8回でそこに到達できるようになった。

10月初旬の2つのリリースが、その最前線を再び、互いに逆の方向から押し進めた。蒸留の学習方法を根本から見直す研究論文と、そのアイデアを広く使われているオープンモデルに適用した実運用向けLoRAだ。

DMADは分布マッチングを分類問題に変える

その論文はDMAD、すなわちDistribution Matching as Adversarial Distillation(敵対的蒸留としての分布マッチング)の略称で、テキサスA&M大学とByteDanceの研究者によるものだ。10月1日に初公開され、蒸留におけるよく知られたコストに取り組んでいる。

標準的なレシピはこうだ。教師モデルが多くのステップをかけて高品質なサンプルを生成する。生徒モデルは、同じ分布を1~4ステップで近似しなければならない。生徒を導くために、生徒の現在の分布に適合し続ける補助拡散モデルを学習させ、教師のスコアと生徒のスコアの差分を使って生徒を更新する。問題は、生徒が変化し続けるため、補助モデルもそれを追い続けなければならないことだ。メモリと計算量が膨らんでいく。

DMADは目的関数を分類として書き直す。共有の特徴バックボーンの上に2つの識別器ヘッドを置く。1つは実データと生徒のサンプルを分離する。もう1つは教師のサンプルと生徒のサンプルを分離する。最適条件下では、識別器の出力スコアは対数密度比に対応し、つまり生徒は識別器スコアから導かれる線形な目的関数に沿って更新できる。別個の補助スコアモデルは不要になる。

2つ目の要素は、ノイズレベルに依存した監督だ。教師はあるノイズレベルでは実分布に近いが、別のレベルでは明らかにずれている。DMADは、最初の識別器ヘッドで実サンプルと教師サンプルの経験的スコア差を測定し、それに応じて生徒の学習を再重み付けする。これにより、教師が最も弱いノイズレベルでは、生徒が教師のバイアスを引き継ぐ度合いが小さくなる。これは「教師は常に正しい」という仮定を、測定可能なものへと変換する。

結果は3つのスケールにわたる。ImageNetでの画像分類学習において、1ステップの64x64生成はFID 1.04に達した。FIDは生成分布が実分布からどれだけ異なるかを測る指標で、低いほど良い。

実運用版はすでに出荷されている

同じアイデアは、論文ではなくLoRAアダプターを通じてユーザーの手に届く。Alibaba PAIはHugging FaceでQwen-Image-2.1-Fun-Acc-LoRAsを公開し、並列デコーディング蒸留を適用して、テキストから画像生成と指示ベースの編集の両方で、推論を教師の40回のニューラル関数評価から4回に削減した。アダプターはrank 64、network alpha 64のBF16で、モデルカードにはDiffusersとVideoX-Fun向けのクイックスタートスクリプトが用意されている。

モデルカードはトレードオフについて率直だ。密集した小さな文字は教師と比べて劣化し、画像編集はわずかにぼやけたり暗くなったりする。細かい文字の段落があるポスターには、4ステップは適した道具ではない。文字が短く大きく、SNSサイズの画像であれば、適している。

2つ目のアダプターは品質面でさらに踏み込む。Qwen-Image-2.1 Turbo v0.2.1は、rank 128、6ステップのLoRAで約648メガバイト。ベースのフローマッチングモデルの長い確率フローODEを、1.0から0.25まで走るシグマスケジュールに圧縮する。6ステップは中間的な設定だ。ディテールを保持するのに十分なパス数でありながら、高速を保てるだけの少なさでもある。

コミュニティによる蒸留が、はしごの残りを埋めている。Viggleのturboアダプターは4ステップを目標とする。PrunaAIのアダプターは5または8ステップを目標とする。どちらも作業途中であることを正直に認めており、Prunaの注記によれば、低ステップ版はマルチリファレンス合成、顔の入れ替え、複数の制約を伴う編集において、まだベースモデルに匹敵しないという。

Krea 2 Turboはライセンスにおいて異なる道を選んだ。その2ステップと4ステップの蒸留アダプターは現在、Comfy Cloud、ローカルComfyUI、Apple MLX向けのApache-2.0のComfyUIワークフローとともに提供され、ステップの自動切り替えに対応する。ワークフロー層におけるApache-2.0は、法務レビューなしでその上に製品を構築したいと考える誰にとっても重要だ。

実際にこれを動かす人にとって何が変わるのか

実用的な効果は、同じハードウェアでより多くの画像を生成できるようになり、重要となる設定が変わることだ。Qwen 2.1に関するコミュニティのスレッドでは、LoRAを読み込んだ状態でCFG 2.0~3.0、40ステップが推奨されており、約676メガバイトのテクスチャ修正用VAEも併用される。一方で、LoRAなしの2.0メガピクセルでの標準ワークフローが、以前のオープンモデルではめったに到達できなかった描画品質を生み出すようになった、という報告もある。

正直に読めば、低ステップ蒸留はトレードオフであり、ただで得られるものではない。テキストの忠実度、編集の精度、マルチリファレンスの一貫性が最初に犠牲になる。これらは解決するのに最も多くのパスを必要とするタスクだからだ。単一の明確な被写体に対するプロンプト追従性は、良好に保たれる。

1枚の緑の葉を4回並べ、フィルムグレインとノイズが順に増えていく様子

これは、単一の設定というよりワークフローを示唆している。4ステップで下書きし、望む構図を選び、選んだフレームをフルステップ数で再レンダリングする。蒸留アダプターは探索を安価にし、最終パスはフル品質のまま残す。

研究がアダプターを超えて付け加えるもの

ユーザーがダウンロードするLoRAは、この取り組みの可視的な末端にすぎないが、DMAD論文は、次世代のアダプターがなぜより良くなるはずなのかを説明している。旧来のレシピでは、生徒の移り変わる分布を追跡するために常時稼働する補助モデルが必要で、そのオーバーヘッドは学習ステップごとに増大した。目的関数を2つの識別器として切り直すことで補助モデルが不要になり、同じGPU予算でより強力な生徒を学習できるようになる。

より長持ちする貢献は再重み付けのアイデアだ。教師を一律に正しいものとして扱うことは、蒸留された生徒の良さを制限する仮定である。教師の最も悪い瞬間に合わせて学習された生徒は、その誤りを引き継いでしまうからだ。教師が実データからどこで乖離するかを測定し、その領域を低く重み付けするのは汎用的な手法であり、動画拡散、音声、そして推論コスト削減のために蒸留が使われるあらゆる生成モダリティに転用できるはずだ。

蒸留アダプターで十分かどうかをどう判断するか

判断はタスクの種類に帰着する。低ステップアダプターは、単一被写体で照明が明確な大判の構図をうまく扱う。多くのパスを必要とするものには苦戦する。小さな文字の段落、細かなタイポグラフィ、複数のリファレンスにわたって同一性を保持しなければならない編集、複数の制約を一度に積み重ねる指示などだ。これらはまさにモデルカードが警告しているケースであり、その警告はベンダーを問わず一貫している。

もう1つの変数はライセンスだ。これらのアダプターの一部は研究用、あるいはその他の制限された条件を伴っており、商用利用の可否がモデルカードで常に明確になっているわけではない。Alibaba PAIのリリースはライセンスを「その他」と記載しており、商用条件は示されていない。つまり製品に導入するチームは、出荷前に宿題をこなす必要がある。KreaのApache-2.0ワークフローは例外であり、その寛容さは、その上に商用サービスを構築しようとする誰にとっても重要になるだろう。

進む方向は明らかだ。オープン画像モデルは、人々がすでに持っているハードウェアに圧縮されつつあり、その圧縮は公開の場で、重み、モデルカード、明記された制限とともに進んでいる。この開放性自体が有用である。買い手がコミットする前にトレードオフを判断できるからだ。クローズドなベンダーは、アップデートで品質を落とし、それを速度改善と呼ぶことができる。弱点を名指ししたモデルカードとともに公開されたアダプターには、それはできない。

何を測定すべきかに関する注記

この分野の速度に関する主張は大げさになりやすい。ステップ数はレイテンシの入力の1つにすぎないからだ。解像度、バッチサイズ、サンプラー、1プロンプトあたりに生成する画像枚数は、どれも見出しのステップ数が示唆するよりもはるかに大きく実時間を変える。ミッドレンジのカードで高解像度の4ステップアダプターは、同じハードウェアで下書き解像度の40ステップ実行よりも遅くなることがある。

買い手にとって重要な比較は、実際に必要な品質で、実際に所有しているハードウェア上での、1分あたりの画像枚数だ。モデルカードがその数値を報告することはほとんどないため、ローカルで測定するしかない。アダプターはその測定を安価にする。それが本当の利点だ。4ステップは、4ステップで十分だったかどうかを教えてくれる実験を実行するのに十分な速さである。

次に注目すべきこと

アダプターと論文は同じ方向を指している。オープン画像モデルの推論コストは下がり続けており、新しい蒸留のたびに、コンシューマー向けカードとレンタルしたアクセラレーターの間のギャップが縮まる。追跡する価値のある問いは、次のラウンドのアダプターがテキスト描画とリファレンス忠実度のギャップを埋めるのか、それともそれらの限界が低ステップ生成そのものに作り込まれていることが判明するのか、だ。それが決着するまでは、ステップ数をいくつかあるダイヤルの1つとして扱い、実際に所有しているハードウェアで1分あたりの画像枚数を測定するのが賢明な姿勢である。

関連記事