NVIDIA 的 Kumo Tabular 是在从未存在过的数据上训练的

9 月 29 日,NVIDIA 发布了 Kumo Tabular,这是一系列开源基础模型,专为一种 AI 热潮基本上一直忽视的数据类型而构建。把一张已填写部分行的表格交给其中任一模型,它就能预测其余部分,而且无需针对每个数据集进行训练。不同寻常之处不在于它能做什么,而在于它是用什么训练的。
Kumo Tabular 完全是在人造表格上预训练的。NVIDIA 通过从结构因果模型(structural causal models)中采样来生成这些表格,这类模型用数学方式描述变量之间如何相互影响。该模型从未见过客户数据集,也从未见过它之后将被测试的基准表格。这是一个刻意的选择,也使这次发布有别于通常的模型构建方式。
为什么表格数据一直是盲区
世界上大部分商业数据都存在于表格中。电子表格、数据库、CRM 导出文件、财务账簿、医疗记录:归根结底都是行和列。大语言模型在文本方面表现出色,在图像和视频方面也越来越强,但表格一直是一个顽固的缺口。语言模型可以把表格当作文本来阅读,但这并不等同于理解列与列之间的关系,而后者才是表格数据预测真正需要的。
传统方法是为每个数据集训练一个单独的模型。这样做可行,但速度慢,而且难以迁移。每张新表格都需要自己的训练过程、自己的调优、自己的维护。一个面向表格的基础模型——能够查看任意表格并在几乎无需额外训练或完全无需额外训练的情况下进行预测——一直是个显而易见的目标,却很难实现,因为表格在结构上差异极大,而且往往规模小、杂乱且敏感。

合成数据的理由
使用合成表格进行训练可以同时解决几个问题。首先是隐私。真实的商业表格往往包含个人或机密信息,这使得大规模用来训练很棘手,围绕其发布模型也有风险。而从生成数据中学习的模型完全绕开了这个问题。
其次是数据污染。如果你用之后要测试的同类数据进行训练,你的基准分数可能反映的是记忆,而不是真正的能力。由于只在合成表格上训练,Kumo Tabular 不可能记住任何基准数据行,因为模型构建时这些行都不存在。从表面上看,这使其报告的结果比大多数结果更干净。
第三是通用性。通过从因果模型中采样,NVIDIA 让训练数据涵盖多种不同的底层关系。一个见过变量之间许多不同影响方式的模型,比起主要只见过一小部分结构的模型,更有机会处理好它从未遇到过的表格。这个赌注是否会有回报,才是这次发布背后的真正问题。
结果及其意义
NVIDIA 表示,Kumo Tabular 在 TabArena 上排名第一,这是一个面向表格预测的公开基准。它还报告称,该模型的预测速度比 LimiX-2 快约 17 倍;LimiX-2 是清华大学一个团队此前推出的表格基础模型。速度方面的说法值得权衡,因为推理成本往往决定一个模型是否会被采用。一个稍微更好但慢得多的模型,在需要持续进行预测的生产流程中很难说得过去。
如果这些数字在外部测试中站得住脚,实际效果就是表格预测方式的转变。团队无需为每个数据集训练一个新模型,而是可以使用一个现成模型,需要时稍作微调,就能在几秒内得到预测。这与文本领域发生过的跃迁相同:通用模型在大多数任务中取代了定制模型。这也会把表格带入 AI 其余部分如今所运行的同一套工作流程中。
风险所在
仅使用合成数据进行训练有一个真实弱点,而这正是其优势的镜像。真实表格的杂乱方式,可能是生成表格所没有的。数据会被输错,列的含义会随时间变化,缺失值就藏在眼皮底下,变量之间的关系也不总是像因果模型所编码的那样干净。如果 Kumo Tabular 是从一个过于整洁的世界中学习的,那么它可能恰恰在最需要发挥作用的地方栽跟头:现实中存在的那些有缺陷的表格。
基准测试和实际部署之间也存在常见的差距。赢得 TabArena 是一个有意义的信号,但这并不能证明该模型在某个特定难题上会击败一个经过良好调优的专用模型。拥有高价值预测任务的团队在切换之前,仍应使用自己的数据,将 Kumo Tabular 与当前方法进行对比测试,就像测试任何新工具一样。
一个不那么显眼的担忧是可解释性。当你为每个数据集训练模型时,你通常更了解它是如何得出结论的。通用基础模型更像一个黑箱,而在金融、保险或医疗等受监管的决策中,无论准确率如何,黑箱都可能一开始就行不通。该模型在这些场景中的价值,将取决于它能否被足够好地解释,以满足那些必须签字批准它的人。
为什么一家图像和语言公司要做这件事
值得注意的是这是谁发布的。NVIDIA 的声誉建立在训练 AI 的芯片之上,并且越来越多地建立在围绕这些芯片的软件之上。一个表格基础模型很符合这一图景。大多数企业 AI 项目从未达到炫目的演示阶段,因为困难的部分通常是电子表格上那些枯燥的预测,而不是聊天机器人。为这个枯燥的部分发布一个强大、开源、快速的模型,是让整个 AI 技术栈更有用的一种方式,而这反过来又会维持对其底层硬件的需求。
对买家来说,也有一个务实角度。中小企业很少拥有能够为每个数据集训练模型的数据科学团队。一个开箱即用的基础模型,任何团队都能下载并运行,这降低了使用预测的门槛。这与把语言 AI 从研究上的新奇事物变成默认工具的同一股动力:模型变得足够通用,以至于你不再需要成为专家才能从中受益。表格是等待这一时刻的最后一个大类,而这次发布是在论证,这个时刻可能已经不远了。
目前,Kumo Tabular 为这个领域多年来一直追问的问题提供了一个具体答案:单个模型能否处理它从未见过的表格?它声称可以,而且只用了从未存在过的数据训练;这要么是一项值得注意的进展,要么只是基准测试的假象,而区别将在未来几个月人们把它用在真实电子表格上时显现出来。那才是真正重要的测试,而且现在已经开始。
相关文章
Decagon 的 PACT 协议,想让「同意」成为一个标准
Decagon 开源了一个协议,用来验证个人智能体的身份,以及客户授予它的权限。这是管道工程,而它决定了智能体经济能不能跑起来。
AI「重逢」热潮:一场还没想好该如何感受的讨论
AI 致敬短片把逝去的公众人物带回中国荧幕,拿下数十万点赞。然后反弹来了,而它争论的是「同意」。
Apple 发布了一个开源多模态模型,却几乎没告诉任何人
苹果的这次「研究优先」式发布悄然越过了主流视野,但模型那种细粒度的视觉 grounding,透露了它的 AI 栈正走向哪里。
OpenCut 与「开源剪映」的那一刻
一款免费、MIT 许可的视频剪辑器持续冲上 GitHub 趋势榜,而它的路线图里包含一个面向 AI 智能体的 MCP server。围绕 AI 媒体的工具,正在追上模型本身。