PixelUMM 抛弃了每个视觉 AI 模型都依赖的两个组件

10 月 1 日,一位以 CongWei1230 为名发布的开发者发布了 PixelUMM,这是一个无编码器的多模态模型,可直接在像素空间中处理图像和视频的理解与生成。代码和训练权重均已公开。有趣之处在于这个模型不包含什么。
过去几年构建的大多数视觉 AI 系统都共有两个组件。变分自编码器将图像压缩为紧凑的潜在表示,生成模型在这个压缩空间中工作,而不是直接处理原始像素。另外,视觉 Transformer 将图像转换为可供语言模型推理的图像块。PixelUMM 把两者都去掉了。它移除了用于生成的潜在空间和用于理解的图像块编码器,直接处理像素。
这一主张是架构层面的,值得理解为什么其他几乎所有方案都保留了这些组件。
这两个组件原本在做什么
VAE 的存在是为了让生成变得可负担。一张 1024×1024、具有三个颜色通道的照片大约有三百万个数值。每一步都对三百万个值运行扩散过程成本高昂,因此 VAE 将图像压缩到更小的潜在网格,模型在那里去噪。代价是 VAE 引入了一个有损瓶颈。精细细节和精确文本渲染在压缩中常常丢失信息,这也是早期图像模型难以处理小字号文字的原因之一。
ViT 的存在是为了让理解成为可能。语言模型消费 token,而 ViT 将图像转换为一系列看起来像 token 的图像块嵌入。多模态模型正是借此回答关于图片的问题。代价是图像块网格是固定的,图像块边界处的信息可能会变得混乱。

PixelUMM 的押注是:通过同时去掉两者,它可以在一个框架中统一理解与生成,并避免每个组件引入的伪影。
为什么这很难
像素级扩散此前已被提出,并反复遭遇算力问题。如果潜在模型对 128×128 的潜在网格去噪,像素模型则要对 1024×1024 的图像网格去噪,每一步的位置数量大约是其 64 倍。序列长度急剧膨胀,注意力成本随序列长度的平方增长,结果就是训练和推理账单高到大多数实验室不愿为中等质量提升买单。
无编码器的理解则有另一个问题。训练模型直接基于原始像素进行推理,意味着模型必须从头学习视觉特征,而不是从预训练的视觉编码器开始。这需要恢复大量监督信息,而且收益是否超过成本并不明显。
PixelUMM 押注的是,架构上的简洁性和保真度值得付出这些算力。已发布的权重就是评估它的证据。它能否在单位美元质量上胜出仍是未决问题,最终会由实际运行它的人来判定,而不是由发布帖决定。这就是架构提案的正常生命周期:在有人做基准测试之前很有趣,之后要么有用,要么被遗忘。
真正新的部分
这次发布值得关注之处在于其统一性主张。大多数图像和视频的生产级技术栈都是由分别设计的部分拼装而成:一个 VAE 为一种目的训练,一个扩散 Transformer 为另一种目的,一个视觉编码器又为第三种目的。它们之间的每个衔接处,都可能出现训练与部署行为不一致,也是误差累积的地方。
一个在同一表示中处理生成与理解的单一框架消除了这些衔接。如果它能奏效,调试多模态流水线会变得更简单,因为只有一种表示和一套故障模式,而不是四套。
此外还有数据层面的意义。一个从不压缩的模型不会继承压缩伪影,因此原则上可以在没有单独精修阶段的情况下保留精确细节,包括文字和精细纹理。对于构建文档、UI 或产品图像流水线的人来说,这一点很重要,因为那里的小错误就会导致不可用。
时机并非偶然
PixelUMM 发布的那一周,几个商业系统正好将细节保留作为主打特性。Black Forest Labs 推出了支持 4K 输出和像素保留式区域编辑的 FLUX 3 Image,Google 的 Imagen 4 变体也登陆了托管平台。市场显然在奖励那些保留用户原有内容、只改变用户要求改变之处的模型。
像素空间生成是研究者对同一个问题的回答,而那些产品则用工业工程来回答。商业路线在潜在架构之上增加分辨率和编辑控制。研究路线则去掉潜在架构,并用算力来买单。两者都试图达到生成细节经得起审视的程度,并将由同一批用户来评判。
为什么现在有人发布这个
这次发布也是对开放生态现状的一种评论。两年来,开放模型社区主要在规模上竞争,发布越来越大、用更多数据训练的模型。这种竞争确实产生了真正有能力的系统,但也产生了大量非常相似的架构,因为它们几乎都使用相同的潜在扩散设计和相同的视觉编码器家族。
发布一个无编码器模型,是在结构而非规模上竞争的方式。尝试不同架构比在训练数据上比最大实验室花更多钱更便宜,而且如果成功,也会是更有用的贡献。只扩大现有设计的社区会收敛到一种方法。测试替代方案的社区则能让更多选择存活下来。
这是善意的解读,而且很可能是正确的解读。已发布的权重让这一方法得到了公正的听证机会,这比大多数架构提案得到的待遇要好。
什么才算成功
权重已经公开,因此测试成本很低,也很难造假。
看文字渲染。无编码器生成在同一预算下应比潜在模型更好地处理小字号文字,否则就没有理由接受这样的算力成本。
看单张消费级加速器上的内存和延迟。如果模型需要数据中心硬件才能生成一张普通的图像,那它就仍只是研究产物。如果它能在高端工作站显卡上以有用速度运行,它就会成为一种工具。
看视频路径。发布声明称统一处理图像和视频,而视频正是算力问题最尖锐的地方,因为时间序列长度会把一切成倍放大。一段在像素空间中生成的、可信的短视频,将是这一方法最有力的证据。
预计结果会好坏参半。新架构通常如此,而首批公开基准测试很少能说明全部问题。这样的发布之所以重要,是因为它让现有设计的假设变得明确,而这些假设被当作定论已经太久了,有人直接测试它们是件有用的事。