← ブログに戻る
Ai読了目安 11 分

Iris-3B は VAE なしでピクセルを直接生成する

公開日 2026年10月11日
Iris-3B は VAE なしでピクセルを直接生成する

人気のある画像生成器はほぼすべて、内部の仕組みが同じだ。ピクセルを直接描くのではなく、まず変分オートエンコーダ(VAE)と呼ばれる部品で画像をより小さな抽象的表現に圧縮し、その圧縮空間で生成し、ピクセルへ戻す。この二段構えは効率的で、小さな不具合の多くもここから来る。細かな文字はにじみ、細い線は波打ち、往復の途中で細部が失われる。

2026年10月、Speridlabs という小さなチームが Iris-3B を公開した。30 億パラメータのモデルで、その往復を丸ごと省き、ピクセルを直接生成する。重みは Apache 2.0 で公開され、全体は flow-matching transformer で構築されている。今月最大でもっとも派手な画像モデルではないが、示していることの意味ではもっとも興味深い一つかもしれない。

VAE を省く意味

VAE は生成を安くするために存在する。圧縮された潜在空間で作業すれば必要な計算を大きく削れるので、ほぼすべての拡散モデルがそれを使う。代償は、エンコーダが生成が始まる前に情報を捨て、デコーダがそれを推測して戻すことだ。低解像度では見えないが、高解像度や、文字が密でエッジが正確な画像では、生成器が細部の周りによく出す「にじみ」として現れる。

ピクセル空間で生成すれば、このボトルネックは消える。圧縮の段階が何も失わないからだ。代償は、はるかに大きな値の格子で作業することになり、それが高くつくという点だ。Iris-3B の主張は、十分に小さいのでその費用を許容範囲に収められるというものだ。実務で成り立つかはコミュニティが試すことになるが、方向は明快だ。効率が上がるほど、VAE の画質上の代償を受け入れる理由は弱くなる。

{{INLINE1}}

第二の仕掛け:生成事前分布を視覚タスクに使う

Iris-3B のより異例な点は、他にも仕事をするということだ。モデルは生成の事前分布を、細部が重要な視覚タスク、具体的には深度推定と画像復元に応用する。要するに、画像を作るよう訓練されたモデルに、画像から情報を取り出させることもできる。物体がどれだけ遠いかを推定したり、劣化した写真をきれいにしたりする。

これは意義ある組み合わせだ。より広い流れを指しているからだ。かつて生成と理解は別の問題、別のモデルとされた。最近それらは統合されつつある。もっともらしい画像を出せるシステムは、場面がどう構成され、光がどう落ち、物体が空間でどう関係するかをすでに深く理解している。その理解を分析タスクに使い回すほうが、タスクごとに専用モデルを訓練するより安い。

flow matching とは何か

Iris-3B は flow-matching transformer に基づく。この考え方は名前より分かりやすい。以前の画像モデルは、画像に少しずつランダムノイズを加えて消していく過程を逆に学び、生成時はそれを逆向きに走らせて、段階的にノイズを除去して画像を浮かび上がらせる。flow matching はもっと直接的な道を取る。ノイズから画像へのほぼまっすぐな経路を学び、うねる経路を学ばない。理論上、少ないステップと少ない計算で良い結果に届く。

これはピクセル空間モデルにとって特に重要だ。生のピクセルで作業するのは高コストで、それを抑える通常の手段は各ステップを効率化することだ。まっすぐな経路はステップ数を減らし、それが 30 億パラメータのモデルでも、本来は VAE の近道でしか抑えられない作業に挑める理由の一つになっている。設計と規模はセットであり、どちらか一方では足りない。

独立したテストがこの取引の損得を決める。ピクセル空間の生成が潜在空間の生成と同等のコストで並ぶなら、VAE は既定ではなく選択肢になる。ならないなら、Iris-3B は「壁はどこにあるか」を示す有用なデータ点であり続ける。

小さなオープンモデルは何の役に立つのか

Iris-3B はどのリーダーボードでも巨人を上回らない。30 億パラメータは商業リーダーの一部にすぎず、そのサイズの汎用モデルは最も難しいプロンプトで負ける。その基準で裁くと本質を外す。

この規模のオープンモデルは三つの方法で居場所を得る。すでに持っているハードウェアで動くので、画像ごとの課金も、社外に出るデータもない。狭い用途に微調整でき、そこでは小さなモデルが大きなモデルに勝つことが多い。企業の製品写真で専用に訓練したモデルは、その特定の仕事で汎用モデルを打ち負かす。そして検査可能で、出力がどこから来たかを説明する必要のあるチームにとって重要だ。

これら三つを同時に可能にするのが Apache 2.0 という細部だ。寛容なライセンスがあれば、スタートアップは条件交渉も将来の価格変更の心配もなく Iris-3B の上に製品を作れる。自分の設計を広めたい研究チームにとって、それは関連性へ至る最短の道だ。モデルはベンチマークに勝つ必要はない。他の誰かが使って作るものになればいい。

すべてのオープン公開に当てはまる注意

すべてのオープンモデルに当てはまる注意が一つあり、Iris-3B も例外ではない。寛容なライセンスが覆うのは重みであって、訓練データでも出力でもない。商業的に届けるつもりのチームは、何から学んだモデルなのか、生成された画像にどんな権利が付くのかを依然として考える必要がある。これはライセンスが答えられない法的問題であり、すべてのオープンモデルが突きつける同じ問いだ。自分でモデルを動かす自由は現実的で価値があるが、責任からの自由と同じではない。

より大きな絵

2026年10月の画像分野は上から見れば混雑している。Nano Banana 2.1、GPT Image 2.5、FLUX 3、Seedream 5.0 が最近の更新を出し、最前線の進歩はごく小さな差で測られる。その下で、より興味深い動きは設計にある。ピクセル空間生成は、最初の拡散モデル以来ずっと続いてきた前提に疑問を投げる。作る前に圧縮しなければならない、という前提だ。そして小さなオープンモデルは、アイデアを分野全体に広める最速の方法は、それを手放すことだと証明し続けている。

Iris-3B は脚注で終わるかもしれないし、他の誰かが真似する版になるかもしれない。いずれにせよ、提起する二つの問いは注視に値する。損失のある中間段階なしに全細部で画像を生成できるか、そして一つのモデルが作りながら分析できるか。答えが「できる」になれば、次世代の画像ツールは前世代とは違う土台の上に建つ。

関連記事