PixelUMM、あらゆるビジュアルAIモデルが依存する2つのコンポーネントを排除

10月1日、CongWei1230の名で公開している開発者がPixelUMMをリリースした。エンコーダ不要のマルチモーダルモデルで、画像と動画の理解および生成をピクセル空間で直接扱う。コードと学習済みの重みは公開されている。興味深いのは、このモデルが何を含んでいないかだ。
ここ数年で作られたビジュアルAIシステムのほとんどは、2つのコンポーネントを共有している。変分オートエンコーダ(VAE)が画像をコンパクトな潜在表現に圧縮し、生成モデルは生のピクセルではなくその圧縮された空間で動作する。また別に、ビジョントランスフォーマー(ViT)が画像をパッチに変換し、言語モデルがそれを推論できるようにする。PixelUMMはどちらも捨てる。生成に使われる潜在空間と、理解に使われるパッチエンコーダを取り除き、ピクセルを直接処理する。
これはアーキテクチャに関する主張であり、なぜ他のほぼ全員がこれらのコンポーネントを維持してきたのかを理解する価値がある。
2つのコンポーネントが果たしていた役割
VAEは生成を手頃なコストで実現するために存在する。1024×1024の3チャンネルの写真は約300万個の数値になる。各ステップで300万個の値に対して拡散プロセスを回すのは高コストなので、VAEが画像をより小さな潜在グリッドに圧縮し、モデルはそこでノイズ除去を行う。トレードオフは、VAEが損失を伴うボトルネックを持ち込むことだ。細部のディテールや正確なテキスト描画は圧縮の過程で情報を失いやすく、初期の画像モデルが小さな文字を苦手とした理由の一つでもある。
ViTは理解を可能にするために存在する。言語モデルはトークンを消費するので、ViTは画像をトークンのように見えるパッチ埋め込みの系列に変換する。これがマルチモーダルモデルが画像についての質問に答えられる仕組みだ。トレードオフは、パッチのグリッドが固定されているため、パッチの境界にある情報が乱れうることにある。

PixelUMMの賭けは、両方を捨てることで、理解と生成を1つのフレームワークに統合し、それぞれのコンポーネントが生み出すアーティファクトを避けられるというものだ。
なぜこれが難しいのか
ピクセルレベルの拡散は以前から提案されており、そのたびに計算コストの問題に突き当たってきた。潜在モデルが128×128の潜在グリッドのノイズ除去を行うなら、ピクセルモデルは1024×1024の画像グリッドのノイズ除去を行うことになり、1ステップあたりの位置数はおよそ64倍になる。系列長は爆発し、アテンションのコストは系列長の二乗で増える。その結果、中程度の品質向上のためにほとんどの研究機関が払わないような学習と推論のコストになる。
エンコーダ不要の理解には別の問題がある。生のピクセル上で直接推論するようモデルを学習させるということは、事前学習済みの視覚エンコーダから出発するのではなく、視覚的特徴をゼロから学ばなければならないということだ。これは回復すべき大量の教師信号を意味し、その利点がコストを上回るかは自明ではない。
PixelUMMは、アーキテクチャのシンプルさと忠実さに計算コストを払う価値があるという賭けだ。公開された重みが、それを評価するための証拠になる。ドルあたりの品質で勝てるかどうかは、リリース記事ではなく、実際に動かす人々によって決まる未解決の問いだ。これはアーキテクチャ提案の通常のライフサイクルである。誰かがベンチマークを取るまでは興味深く、その後は有用か、忘れられるかだ。
本当に新しい部分
このリリースが注目に値するのは、統合という主張だ。画像と動画の本番スタックの多くは、別々に設計された部品を寄せ集めて作られている。ある目的のために学習されたVAE、別の目的のための拡散トランスフォーマー、さらに別のための視覚エンコーダ。それらの間の接続はすべて、学習時と運用時で挙動が異なりうる場所であり、エラーが積み重なる場所でもある。
生成と理解を同じ表現で扱う単一のフレームワークは、そうした接続を取り除く。もし機能すれば、マルチモーダルパイプラインのデバッグは簡単になる。表現が1つ、故障モードの集合も4つではなく1つになるからだ。
データに関する話もある。決して圧縮しないモデルは圧縮によるアーティファクトを引き継がないので、原理的には、別途のリファインメント段階なしに、テキストや細かなテクスチャを含む正確なディテールを保つことができる。これは、小さな誤りが致命的になる文書、UI、製品画像のパイプラインを構築する誰にとっても重要だ。
タイミングは偶然ではない
PixelUMMが登場した同じ週に、いくつかの商用システムがディテール保持を目玉機能として打ち出した。Black Forest Labsは4K出力とピクセルを保持する領域編集を備えたFLUX 3 Imageを出荷し、GoogleのImagen 4の各バリアントはホスト型プラットフォームで利用可能になった。市場は明らかに、ユーザーが持っていたものを保ちながら、ユーザーが変更を求めた部分だけを変えるモデルを評価している。
ピクセル空間での生成は、そうした製品が産業エンジニアリングで答えているのと同じ問いに対する研究者の答えだ。商用の道は潜在アーキテクチャの上に解像度と編集コントロールを載せる。研究の道は潜在アーキテクチャを取り除き、その代償を計算コストで払う。どちらも、生成されたディテールが精査に耐える地点に到達しようとしており、同じユーザーによって評価される。
なぜ今これを公開したのか
このリリースは、オープンなエコシステムが今どこにあるかについてのコメントでもある。2年間、オープンモデルのコミュニティは主に規模で競ってきて、より多くのデータで学習した、より大きなモデルを次々と公開してきた。その競争は本当に有能なシステムを生み出した一方で、非常に似通ったアーキテクチャも大量に生み出した。ほとんどが同じ潜在拡散の設計と同じ視覚エンコーダの系統を使っているからだ。
エンコーダ不要のモデルを公開することは、サイズではなく構造で競う方法だ。最大手の研究所よりも学習データに多くを費やすより、別のアーキテクチャを試す方が安くつき、うまくいけばより有用な貢献になる。既存の設計を拡大するだけのコミュニティは1つのアプローチに収束する。代替案を試すコミュニティは、より多くの選択肢を生かし続ける。
それが好意的な読み方であり、おそらく正しい。公開された重みはこのアプローチに公平に審判される機会を与える。それはほとんどのアーキテクチャ提案が得られないものだ。
何が成功と見なされるか
重みは公開されているので、テストは安く実行でき、偽装するのは難しい。
テキストのレンダリングを見てほしい。エンコーダ不要の生成は、同じ予算の潜在モデルよりも小さな文字をうまく扱えるはずだ。そうでなければ、計算コストを受け入れる理由がない。
単一のコンシューマー向けアクセラレータ上でのメモリとレイテンシを見てほしい。そこそこの画像を生成するのにデータセンターのハードウェアが必要なら、それは研究用の成果物にとどまる。ハイエンドのワークステーション向けカードで実用的な速度で動くなら、ツールになる。
動画の経路を見てほしい。このリリースは画像と動画の統合的な扱いを主張しており、計算コストの議論が最も厳しく効くのは動画だ。時間方向の系列長がすべてを掛け算で増やすからである。ピクセル空間で生成された信頼に足る短いクリップは、このアプローチにとって最も強い証拠になるだろう。
結果は混ざったものになると予想される。新しいアーキテクチャはたいていそうであり、最初の公開ベンチマークが全体像を語ることはまれだ。このようなリリースが重要なのは、現行設計の前提を明示するからであり、その前提はあまりに長く確定事項として扱われてきたので、誰かが直接検証するのを見るのは有益だ。