← ブログに戻る
Ai読了目安 14 分

2.6億パラメータの画像モデルが、同じブロックをループさせて6.5倍の競合を破った

公開日 2026年10月6日
2.6億パラメータの画像モデルが、同じブロックをループさせて6.5倍の競合を破った

新しい論文が、テキストから画像を生成するモデルをスケールさせる別の方法を提案しており、その結果は人々が二度見するような数字だ。各デノイジングステップ内で共有されたTransformerブロックのセットを繰り返し実行することで、新しいパラメータを追加するのではなく、2億6000万パラメータのモデルが、約4.9倍少ない計算量で、6.5倍大きい競合モデルを上回ったと報告されている。この技術はLooped Diffusion Transformerと呼ばれ、その背景にある考え方は、機械学習のほかの分野でも見られるほど古い。

原理は深さ方向の重み共有だ。標準的な画像モデルは、より多くのブロックを積み重ねることで強くなり、各ブロックが独自のパラメータを持つ。ループモデルは、単一のデノイジングステップ内でより小さなブロック群を繰り返し実行するため、画像が完成する前に同じ重みがより多くの仕事をする。計算量はループ回数とともに増えるが、パラメータ数は一定のままであり、これはモデルをどこで動かすかを考える人にとって計算の前提を変える。

パラメータがどこにあるかが重要な理由

パラメータ数と計算量は通常一緒に語られるが、それらが制約するものは異なる。パラメータはモデルが占めるメモリ量を決め、しばしば、人が実際に所有するハードウェアに収まるかどうかを左右する。計算量は、1回の生成にかかる時間と、サービス提供にかかるコストを決める。

ループ回数をパラメータと引き換えにする設計は、2つ目の制約を無視せずに1つ目の制約に対処しようとする。報告された4.9倍の計算量削減は、このベンチマークではこのトレードオフが有利であることを示唆するが、論文の結果は出荷済みチェックポイントの結果と同じではない。また、ループ構造の学習安定性は以前の研究でも繰り返し懸念されてきた。

オープン画像モデルの競争は今やフットプリントが焦点だ

このタイミングは重要だ。オープン画像コミュニティはこの1年、別の軸で競争してきたからだ。メモリフットプリントが明示的な目標となり、どれだけ少ないVRAMで動くかが宣伝され、サンプリングステップ数を削減する蒸留技術も登場した。ステップを減らすアプローチとパラメータを減らすアプローチは、同じパイプラインの両端から問題に挑む。Looped Diffusion Transformerはパラメータ側に位置する。

スタンフォードNLPの関連成果も同様の方向に進んでいる。UniEvo-VLと呼ばれる手法は、単一のモデルが教師と生徒の両方を務めるオン・ポリシー自己蒸留を用いて、外部の教師モデルなしにQwenベースの画像モデルのGenEvalスコアを0.747から0.808へ引き上げた。一貫するテーマは同じだ。より大きなモデルを学習させるのではなく、与えられたモデルからより多くの能力を引き出す。

それは単なる研究上の好みではない。オープンウェイトのテキストから画像へのリーダーボードのトップは、控えめな規模のモデルが密集している。Qwen-Image-2.1が約1,036 Eloで首位に立ち、70億パラメータの生成コンポーネントを持ち、FLUX.2 devやHunyuanImage 3.0 Instructを上回っている。最高のオープンモデルでも、1,197付近に位置するOpenAIのGPT Image 2.5 Sunburstには大きく及ばない。もし規模の面で最先端が手の届かないところにあるなら、効率化の工夫が小規模ラボが会話にとどまる方法になる。

正直な留保事項

第一に、見出しの比較は単一のベンチマークにすぎない。6.5倍大きい競合が1つの評価でループモデルに負けたからといって、この技術がどこでも勝つわけではなく、画像品質はプロンプトやサンプラーの選択に非常に敏感なことで知られている。第二に、この分野の自己申告の勝利は、独立したテストでは小さくなる傾向があり、特に推論が同一のハードウェアと設定で実行されていない場合はそうだ。第三に、ループ化は学習の単純さを推論効率と引き換えにし、ループ回数を誤って設定したときの失敗モードは発表概要からは明らかでない。

注目すべき点

ループ型や重み共有型の設計が、論文だけでなく公開される重みに現れるかどうか、また計算量削減が、アテンションコストが支配的になる高解像度でも維持されるかどうかに注目してほしい。次のオープンリリースの後でリーダーボードを注視しよう。パラメータの下限を下げる技術は、同じ効率帯に複数の新モデルが同時に登場する形で現れる傾向があるからだ。

この一連の研究から得られるより広い教訓は、画像生成におけるスケーリングの議論が成熟したということだ。パラメータを追加する手法は今も有効だ。しかし、より活発な研究は、与えられたモデルにより少ないリソースでより多くをさせるところにあり、それはデータセンターよりも先にノートPCに届く種類の進歩だ。

ループ化が新たな支持を得ている古いアイデアである理由

深さ方向の重み共有は新しいものではない。何年も前のリカレントネットワークや、独自の層を積み重ねるのではなく層のブロックを再利用するいくつかの言語モデルに見られる。それが今、拡散モデルにとって興味深い理由は、生成プロセスの構造にある。画像の生成は多くのデノイジングステップを経て行われ、各ステップはすでにネットワーク全体を実行している。1つのステップ内でループさせることは第2の反復軸を加えることを意味し、計算量の倍率と品質の向上をある程度独立に調整できる。

トレードオフは現実のものだ。重みを再利用すると学習は難しくなる。すべてのループからの勾配が同じパラメータを通って逆伝播しなければならず、ループを過度に激しく行うモデルは細部を失う可能性がある。報告された結果は、論文が調整する余裕のある特定のループ回数を用いている。出荷済みチェックポイントは、幅広いユーザーからのプロンプト全体で機能しなければならず、それはより厳しいテストだ。

コミュニティがベンチマーク以上に気にする実用的な理由もある。流通しているほぼすべてのオープン画像モデルは、どれだけ少ないVRAMで済むかによって部分的に評価されている。それらを動かす人々はクラスタではなく、1台か2台のコンシューマー向けGPUを使っているからだ。品質を比例して損なうことなくパラメータの下限を下げる設計は、まさにその層に響く。そしてその層は今や、どの技術が採用されるかを形作るほど大きい。

効率化の軍拡競争には2つの戦線がある

「効率」として一括りにされる2つのレバーを分けて考えると役に立つ。デノイジングの回数を減らすステップ蒸留は、主に生成時間と画像あたりのコストを削減する。ループ設計が狙うパラメータ削減は、主にメモリとダウンロードサイズを削減する。モデルは高速で大きくも、低速で小さくもあり得て、最適な組み合わせはマシンによって異なる。

過去1年のオープン画像リリースは第1のレバーを強く推し進め、対話的に動かすことを意図したものでは4ステップや2ステップの変種が標準になった。第2のレバーはよりゆっくり進んでおり、だからこそパラメータ効率に関する成果が際立つ。もしこれが持ちこたえるなら、蒸留サンプラーと組み合わされ、収まるほど小さく、使えるほど速いモデルが生まれるだろう。それは、オンデバイス画像生成の話がしばらく向かってきた方向とおおむね一致する。

もちろん、1本の論文だけでは何も保証されない。しかし方向性は明確であり、1枚の画像を生成するために行列に並んで待ったことがある人にとって、その見返りは具体的だ。

関連記事