← 返回博客
Ai预计阅读 10 分钟

语言与视觉的统一框架:地平线的 16 亿参数开放模型

发布于 2026年10月4日
语言与视觉的统一框架:地平线的 16 亿参数开放模型

一篇来自华中科技大学、北京交通大学和地平线的论文提出了一个听起来几乎太过基础、以至于算不上新颖的想法:用同一个模型,把语言和图像当作同一种东西来处理。

该框架名为 Multimodal Flow,简称 MF-1,完全开源。其最大版本拥有 16 亿参数,在 1500 亿预训练 token 上训练。在 GenEval 上得分 82.8,在 DPG-Bench 上得分 75.3,让一个规模适中的模型跻身于远比它庞大的多模态系统之列。

一句话概括其思路

大多数多模态模型都是拼装体:一个文本模型加一个图像模型,或是一个语言主干网络外挂独立的视觉组件,通过离散 token 或独立编码器来回传递表示。MF-1 不这么做。它在一个共享嵌入空间中对文本和图像统一建模,并用 Flow Matching 作为二者唯一的生成目标和采样流程。

一条透明玻璃带在黑暗中蜿蜒,被暖光与冷光照亮

这才是真正有意思的主张。模型不是在某个边界上为不同模态做翻译,而是在一个连续的表示上运作——在那里,语言和视觉并非本质上不同的对象。作者认为,这绕开了当前主流的离散方案与混合方案的弱点。

如果这一点成立,回报就是通用性。一个同时处理语言建模、视觉理解、图像生成、编辑和视频序列的框架,在训练、扩展和推理上都比一堆专家模块拼成的流水线简单得多。它还指向一种未来:其他模态——任何能被表示为有序连续块的输入——无需重新设计就能纳入同一结构。

想要这个东西,除了优雅之外还有很实际的理由。你每往系统上外挂一种新模态,就多了一个需要维护的接口,也多了一处错误会累积的地方。把视觉编码器接到语言模型上,意味着图像必须先被概括成语言模型能理解的 token,而这个概括过程会丢失信息。共享表示跳过了翻译这一步,而多模态系统里大量细微的质量损耗恰恰发生在那里。

署名里的那个名字

作者名单里有一个细节值得多看一眼。作者中包括余凯——地平线创始人、曾担任百度深度学习架构的负责人——以及联合创始人黄畅。通讯作者是华中科技大学视觉实验室的王兴刚。

余凯出现在一篇论文的作者名单上并不寻常。自 2016 年他参与早期统一自然场景文字检测的尝试之后,这些年他极少发表论文。如今他重新出现,而且是在一篇关于统一语言与视觉的论文上,读起来像是一次刻意的回归——回到他十年前研究过的问题,而此刻行业恰好拥有了让它变得重要的算力和数据。

他早前一次演讲中有一句话很能说明问题:VLA、VLM、端到端、世界模型这些热词,在商业上的意义往往大于技术上的意义,而认真的团队做的事情其实大同小异。一篇把其中若干类别收拢进同一个生成框架的论文,与这种看法是一致的。它主张的是:标签没有底层机制重要。

小和开放才是重点

一个 16 亿参数却成绩有竞争力的模型之所以值得注意,理由和其他实验室推出的小模型一样:单位参数的能力,决定了什么能跑在本地、什么能跑在手机上、以及一个小团队养得起对什么做微调。

1500 亿训练 token 按前沿标准看也算克制,这说明该方法是高效的,而不是靠蛮力堆出来的。这种效率能否在更大规模上保持,是尚未解答的问题。一个小模型表现良好能说明某种方法的一些东西,但不是全部。

开放权重在这里有特定意义。一个统一的生成框架,只有在别人能扩展它、能在作者没试过的模态上测试它、能在共享表示之上继续构建时,才最有用。闭源版本会是一篇有趣的论文;开放版本才是一件工具。

基准测试没有覆盖的部分

GenEval 和 DPG-Bench 衡量的是模型把提示词转成图像的忠实程度。它们完全无法说明这个统一的表示是否提升了模型对文本和图像联合推理的能力——而那才是真正的论点。一个模型完全可能在图像保真度上得分很高,却依旧把两种模态当作只是碰巧共用一种数字格式的两套独立子系统。作者清楚这个缺口,论文真正的论证活在架构里,而不在分数上。对任何评估这项工作的人来说,正确的问题是:在需要同时用到两种模态的任务上,共享表示是否改变了模型的行为——而这恰恰是基准测试没有测量的东西。

诚实的未知数

把多种模态统一到一个空间里是一个很强的主张,而强主张会招来审视。基准分数是真实的,但它们衡量的是图像生成保真度,而不是共享表示是否真如这套框架所暗示的那样,帮助模型跨模态推理。很可能你拿到一个漂亮的 GenEval 数字,模型却依然把文本和图像当作嵌入空间里的邻居,而非真正同质的材料。

另一个未知数是规模。连续的统一表示在历史上一直理论诱人、实践顽固,因为其训练信号往往比离散方案更难稳定。一次 16 亿参数的成功令人鼓舞,但还不足以下定论。

下一步指向哪里

显而易见的延伸是视频和音频——二者都是连续信号,因此天然适合建立在连续表示之上的框架。作者对此有所暗示,把任何能表示为有序连续块的模态都划入可尝试范围。如果这条路走得通,回报就是一条流水线,团队可以把它扩展到原作者从未碰过的模态。这正是开放权重在此处的承诺:不是一件成品,而是一个别人可以按自己问题去弯折的基础。

更大的图景

让这件事值得关注的地方,与其说是这个模型,不如说是这个方向。这个领域花了多年时间,在彼此分离的文本系统和视觉系统之间搭建越来越精致的桥梁。MF-1 押注的是这些桥梁根本没必要——正确的做法是别再让语言和图像互为异类,而是把它们放在同一个基点上建模。

如果这个赌注押对了,实际后果会以最好的方式显得无聊:一个框架、一个训练目标、一套工具,套用到你接下来需要的任何模态上。如果押错了,它仍是一个来自长期深耕该领域团队的、执行良好的实验,并且是公开发布的,可以被检验。

无论哪种结果,有意思的地方在于:那些盯着这个问题看了十年的人,选择在现在再次发起冲击,并且选择用一个开放的、小的模型,而不是一个巨大的模型。这种组合通常是一个信号——有人相信,一直缺失的是方法,而不是规模。

相关文章