← 返回博客
Ai预计阅读 9 分钟

Iris-3B:一个不用 VAE 就直接生成像素的图像模型

发布于 2026年10月11日
Iris-3B:一个不用 VAE 就直接生成像素的图像模型

几乎所有流行的图像生成器在底层逻辑上是一样的。它不直接画像素,而是先用一个叫变分自编码器(VAE)的组件把图像压缩成更小的抽象表示,在那个压缩空间里生成,再解码回像素。这种两步设计很高效,很多小毛病也来自这里。细小的文字被糊掉,细线抖动,细节在一次往返中被丢失。

2026 年 10 月,一个叫 Speridlabs 的小团队发布了 Iris-3B,一个 30 亿参数的模型,干脆跳过了这次往返,直接生成像素。权重以 Apache 2.0 许可开放,整体基于 flow-matching transformer 构建。它不是这个月最大或最耀眼的图像模型,但就它透露的信息而言,可能是最有意思的一个。

跳过 VAE 为什么重要

VAE 的存在是为了让生成变便宜。在压缩后的潜空间里工作,能把所需算力砍掉一大截,这就是几乎每个扩散模型都用它的原因。代价是:编码器在生成开始之前就丢掉了一部分信息,解码器得把它猜回来。在低分辨率下这种损失看不见,在高分辨率或者文字密集、边缘精确的图像上,它就表现为生成器在小细节周围常有的那种糊。

在像素空间里生成,就移除了这个瓶颈,因为没有任何压缩步骤会丢东西。代价是你现在要在一个大得多的数值网格上做事,这很贵。Iris-3B 的主张是:它足够小,可以把这份开销控制在可承受范围内。这在实践中是否成立,要由社区去测,但方向很清楚:随着效率提升,接受 VAE 质量代价的理由会越来越弱。

{{INLINE1}}

第二个花招:把生成先验用于视觉任务

Iris-3B 更不寻常的地方在于它还做别的事。模型把它的生成先验应用到对细节敏感的视觉任务上,包括深度估计和图像修复。说白了,一个被训练来产出图像的模型,也可以被要求从图像里恢复信息:估计物体有多远,或者把一张退化的照片清理干净。

这是个有意义的组合,因为它指向一个更广的趋势。曾经,生成和理解被当成两个问题、两套模型。近来它们在合并。一个能产出可信图像的系统,已经对场景如何结构、光如何落、物体在空间里如何相互关联理解得很深。把这份理解复用给分析任务,比给每个任务单独训一个模型更便宜。

flow matching 在说什么

Iris-3B 基于 flow-matching transformer,这个概念比名字好懂。更早的图像模型通过一步步逆转「给图片加随机噪声直到图像消失」的过程来学习,生成时再把这个过程倒着跑一遍,逐步去噪直到图像浮现。flow matching 走得更直接。它学的是从噪声到图像的一条近乎笔直的路,而不是一条蜿蜒的路,理论上需要更少的步数、更少的算力就能得到好结果。

这一点对像素空间模型尤其重要。在原始像素上工作很贵,而控制这份成本的常规办法就是让每一步都高效。更直的路意味着更少的步数,这也是一个 30 亿参数模型能尝试这种、原本靠 VAE 捷径才能控制开销的任务的原因之一。架构选择与模型规模是配套的,单靠任何一个都不够。

独立测试会决定这笔交易是否划算。如果像素空间生成能和潜空间生成在相近成本下打平,VAE 就不再是默认选项,而是一个选择。如果不能,Iris-3B 仍然是一个关于「墙在哪里」的有用数据点。

一个小的开放模型到底是干什么用的

Iris-3B 不会在任何榜单上盖过那些巨头。30 亿参数只是商业领头羊的一小部分,这个规模的通用模型在最难的提示上一定会输。用那个标准来评判它,就错过了重点。

这个量级的开放模型靠三种方式挣到自己的位置。它们能跑在人们已经拥有的硬件上,所以没有按张计费,也没有数据离开大楼;它们能针对一个狭窄任务做微调,而这往往是小模型胜过大型模型的地方,一个专门在某公司产品摄影上训练过的模型,在那个具体任务上会打败通用模型;它们可被检视,这对需要解释输出从哪来的团队很重要。

Apache 2.0 许可正是让这三件事同时成立的那个细节。一个宽松许可意味着创业公司可以在 Iris-3B 之上搭产品,不必谈判条款,也不必担心未来的价格变动。对一个想让自己的架构被采用的研究团队来说,这是通往相关性最快的路。模型不必赢下榜单,它要做的是那个别人用来搭建的东西。

一个适用于每个开放模型发布的提醒

有一个提醒适用于每个开放模型,Iris-3B 也不例外。宽松许可覆盖的是权重,不是训练数据,也不是输出。打算商业化交付的团队仍要考虑模型从什么数据里学来、以及一张生成的图附着什么权利。这是许可回答不了的法律问题,也是每个开放模型都会提出的同一个问题。自己跑模型的能力是真实而有价值的自由,但它不等于免于责任。

更大的图景

2026 年 10 月的图像领域从顶部看很拥挤。Nano Banana 2.1、GPT Image 2.5、FLUX 3 和 Seedream 5.0 都发布了近期更新,前沿上的进步是用很小的边际来衡量的。而在底下,更有意思的动向是架构层面的。像素空间生成质疑了一个自第一批扩散模型以来一直成立的假设:你必须先压缩,才能创造。而开放的小模型不断证明,把一个想法扩散到整个领域的最快方式,是把它送出去。

Iris-3B 可能最终只是一条脚注,也可能成为别人去抄的那个版本。无论如何,它提出的两个问题值得关注:你能不能在没有任何有损中间步骤的情况下全细节生成图像,以及一个模型能不能既创造又分析。如果答案变成「能」,下一代图像工具将建立在与上一代不同的地基上。

相关文章