← 返回博客
Ai预计阅读 10 分钟

InternLumina-U2 将文本、图像、视频和 3D 集成到一个 16B 模型中,并发布两套权重

发布于 2026年10月5日
InternLumina-U2 将文本、图像、视频和 3D 集成到一个 16B 模型中,并发布两套权重

统一多模态模型通常要做出取舍:它们覆盖许多任务,但哪个都不擅长。InternLumina-U2 试图在较小的参数预算下检验这一假设,而它的发布方式所透露的战略信息,不亚于其架构本身。

InternLM 在 Hugging Face 上以 Apache 2.0 许可证发布了该模型。这是一个 16B 参数的专家混合模型,每个 token 激活 1B 参数,写作 16B-A1B。它将稀疏骨干网络与基于名为 AToken 的技术构建的 8 码本全离散视觉表示相结合,并在单个模型中处理文本问答、文本到图像生成、图像理解、图像编辑、视频理解和 3D 理解。

有意思的细节在任务列表之下:此次发布包含分别面向华为昇腾 NPU 和 NVIDIA GPU 的独立检查点。

统一模型实际为你节省了什么

统一化的理由在于维护成本。一个既要理解图像又要生成图像的产品团队,通常要运行一个用于理解的模型和另一个用于生成的模型,然后维护两条推理路径、两套提示词和两个升级周期。将理解和生成整合到一个框架中,可以消除部分这类开销;而将同一框架扩展到视频和 3D,会进一步放大这种收益。

实现方式很关键。全离散视觉表示意味着图像被 token 化为若干学习到的码本,这里是八个,基于 AToken 构建。这将图像和视频理解推进为一种更接近语言模型已经知道如何处理的 token 流的形式,也正是这一点让单个骨干网络能够跨越如此多的模态。

由透明玻璃单元格组成的方形网格,泛着冷蓝色光,其中有一个是暖色

统一方法能否在这个规模上匹敌专用模型,仍是未决问题。Apache 2.0 消除了法律摩擦,但宽松许可证并不能回答:单个 1B 激活参数路径生成的图像,是否与专门构建的图像模型一样好。技术报告标注为“即将发布”,目前可用的基准测试是初步的且由公司自行报告。在独立评估出炉之前,这一主张尚未得到证实。

为什么双硬件检查点比看起来更重要

同时发布昇腾和 NVIDIA 检查点,是对部署的声明,而不是便利之举。

中国 AI 实验室一直在尖端芯片获取受限的环境下进行构建,应对方式就是针对能获得的硬件进行激进优化。发布既能在华为昇腾 NPU 上运行、也能在 NVIDIA GPU 上运行的权重,意味着中国境外的团队可以从 NVIDIA 硬件起步,之后迁移到昇腾而无需更换模型。这也意味着已经运行在昇腾上的中国国内企业可以采用该模型,而无需购买新的加速器。

这比听起来更低的切换成本。硬件决策具有黏性,而一个同时尊重两种技术栈的模型,消除了原本会让团队留在当前供应商处的一道障碍。对于在任意一侧已有基础设施的企业来说,这次发布与其说是关于基准测试,不如说是关于它能否嵌入到已经上架的设备中。

背景让这一点更加清晰。中国实验室越来越多地通过发布开放权重来竞争,而不仅仅是销售闭源 API,其战略逻辑是双向的。开放权重比闭源端点更快地传播采用和标准制定影响力。它们也让国内硬件厂商能够指出在其芯片上运行良好的真实模型,当替代方案是在真空中证明时,这一点很有用。

与更严格许可证的对比

一个有用的对比是另一个近期开放的图像模型。Qwen-Image-2.1 发布了一个 7B 检查点,统一了文本到图像生成和编辑,生成带 alpha 通道的原生 RGBA 输出,并最多接受 10 张参考图像。它在两个 Artificial Analysis 排行榜上位列开放权重模型第一。不过,其权重是在严格的非商业许可证下发布的,这意味着商业项目必须通过官方 API 使用。

InternLumina-U2 则以 Apache 2.0 走了另一条路。这使它可直接用于商业产品,并将其置于不同的竞争位置:这些是企业无需进行许可谈判就能合法构建其上的权重,即使它们没有登上排行榜榜首。

值得理解的架构选择

两个设计决策承载了大部分分量。

第一个是稀疏专家混合骨干网络。总参数 16B,每个 token 仅激活 1B,推理成本取决于激活集而非完整模型。这正是让广泛的多任务模型在服务成本上可负担的原因,因为对于任何给定输入,网络中有很大一部分处于闲置状态。

第二个是离散视觉表示。基于 AToken 的 8 码本方案,既是一项建模决策,也是一项压缩决策。更少、组织更好的码本意味着每一步需要预测的视觉信息更少,这在激活参数量较小、无法靠算力换取质量时很有帮助。

这两个选择本身都不新颖。赌注在于,将它们在这个规模上结合起来,能产生一个真正跨模态有用的模型,而不是一个会被从实际工作中分流走的“样样通”。

为什么发布形式本身就是信息

任务列表雄心勃勃,但对于任何决定要基于什么构建的人来说,发布形式携带了更多信号。有三个选择格外突出。

第一个是规模。以当前开放权重竞赛的标准来看,一个总参数 16B、激活参数 1B 的模型很小;前沿实验室正在发布 744B 甚至 2.8 万亿参数的模型。一个能在易获得的硬件上低成本运行的小模型,与一个需要集群的大模型是不同的产品。它瞄准的是无法靠花钱买来能力、需要能经济地提供服务的东西的团队。

第二个是许可证。Apache 2.0 是一种宽松许可证,允许无需谈判即可商业使用;对于决定能否在模型之上发布产品的企业来说,这比基准分数更重要。分数高但许可证限制严格的模型,是只能通过 API 路由使用的模型;许可证宽松的模型,则是可以嵌入的模型。

第三个是模态组合。大多数名为“统一”的模型只覆盖文本和图像。将视频和 3D 理解加入同一框架,才让这个词名副其实,同时也是风险所在,因为一个小的激活参数集要服务的模态越多,分摊到各模态上的容量就越稀薄。

综合来看,这次发布读起来更像是对部署现实的押注,而非对排行榜位置的押注:小到足以服务,宽松到足以发布,广泛到足以取代流水线中的多个模型。

值得关注什么

三件事将决定这次发布如何被评判。技术报告发布时,应包含完整的基准表格,而这些数字需要独立复现后才能有分量。第二,统一路径在生成方面是否站得住脚,因为专用模型在这一领域拥有最强的在位优势。第三是硬件。如果昇腾检查点在实践中被证明具有竞争力,双硬件发布就会成为一种模板,更多中国实验室将默认发布能同时运行在两种技术栈上的权重。

目前,这次发布最好被理解为一份意图声明。中国的实验室正在同时围绕开放权重、硬件灵活性和宽松许可证展开竞争,而 InternLumina-U2 将这三者放在了一张模型卡中。

相关文章