← 返回部落格
Ai預計閱讀 10 分鐘

NVIDIA 的 Kumo Tabular 是用從未存在過的資料訓練出來的

發布於 2026年10月11日
NVIDIA 的 Kumo Tabular 是用從未存在過的資料訓練出來的

9 月 29 日,NVIDIA 發布了 Kumo Tabular,這是一系列開放基礎模型,專為一種在 AI 熱潮中大多被忽略的資料類型而打造。只要把一張填好部分列項的表格交給這類模型,它就能預測其餘內容,完全不需要針對個別資料集進行訓練。真正不尋常的地方不在於它能做什麼,而在於它是用什麼訓練出來的。

Kumo Tabular 完全以人工表格進行預訓練。NVIDIA 透過從結構因果模型(structural causal models)取樣來生成這些表格,這類模型是以數學方式描述變數之間如何互相影響。這個模型從未見過任何客戶資料集,也從未見過它日後將接受測試的基準表格。這是刻意做出的選擇,也讓這次發布與一般模型建立的慣常做法截然不同。

為什麼表格資料一直是盲區

全球大多數的商業資料都存在表格裡。試算表、資料庫、CRM 匯出檔、財務帳冊、醫療紀錄:一路下來全都是列與欄。大型語言模型在文字上表現卓越,在圖像與影片上也越來越擅長,但表格始終是個難以突破的缺口。語言模型可以把表格當成文字來讀,但那和真正理解各欄位之間的關係並不相同,而後者才是表格資料預測真正需要的東西。

傳統做法是為每個資料集訓練一個獨立模型。這行得通,但速度慢,而且無法通用。每張新表格都需要自己的一次訓練、自己的調校、自己的維護。一個能適用於各種表格的基礎模型——只要看任何一張表就能預測,幾乎或完全不需要額外訓練——一直是顯而易見的目標,卻難以達成,因為表格在結構上差異極大,而且往往規模小、雜亂又敏感。

A grid of abstract table cells, some filled and some glowing in prediction

合成資料的論據

以合成表格進行訓練,一次解決了好幾個問題。首先是隱私。真實的商業表格往往包含個資或機密資訊,這讓大規模訓練變得很棘手,也讓圍繞這類資料發布模型充滿風險。以生成資料學習的模型則完全避開了這個問題。

其次是資料污染。如果你用日後測試所用的同類資料來訓練,基準分數反映的可能是記憶,而不是真正的能力。由於只以合成表格訓練,Kumo Tabular 不可能記住任何基準表格中的列,因為模型建立時這些資料根本還不存在。表面上看,這讓它所公布的結果比大多數模型更乾淨。

第三是通用性。透過從因果模型取樣,NVIDIA 讓訓練資料涵蓋了各種不同的底層關係。相較於大多只見過狹隘結構切片的模型,一個見識過變數之間許多不同影響方式的模型,更有機會處理它從未遇過的表格。這項賭注是否奏效,正是這次發布背後的真正問題。

成果,以及它們代表什麼

NVIDIA 表示 Kumo Tabular 在 TabArena 這個公開的表格預測基準上排名第一。它同時宣稱,該模型的預測速度比 LimiX-2 快約 17 倍;LimiX-2 是清華大學團隊較早推出的表格基礎模型。速度這項說法值得仔細衡量,因為推論成本往往才是決定一個模型是否被採用的關鍵。在持續不斷執行預測的生產流程中,一個稍微好一點卻慢很多的模型很難說得過去。

如果這些數字在外部測試下站得住腳,實際影響就是表格預測的做法將出現轉變。團隊不必再為每個資料集訓練新模型,而是可以直接取用同一個現成模型,必要時稍作微調,幾秒內就能得到預測。這與文字領域曾發生的躍進如出一轍——通用模型在大多數工作上取代了客製模型——而這將把表格帶進目前其他 AI 領域所運行的那套工作流程。

風險所在

純合成資料訓練有個真實的弱點,而這正是其優勢的鏡像。真實表格的雜亂程度,是生成表格可能沒有的。資料會輸入錯誤、欄位含義會隨時間改變、缺失值就藏在眼前,而變數之間的關係也不總是因果模型所編碼的那種乾淨關係。如果 Kumo Tabular 是從一個過於整齊的世界學來的,它可能恰恰在最需要發揮作用的地方跌跤:現實中那些有缺陷的表格。

此外還有基準測試與實際部署之間那道常見的落差。在 TabArena 奪冠是有意義的訊號,但這並不證明該模型在特定困難問題上能勝過一個調校良好的專用模型。手上有重要預測任務的團隊,在轉換之前仍應用自己的資料,把 Kumo Tabular 與現行做法互相比較,就像測試任何新工具一樣。

另一個較少被提起的疑慮是可解釋性。當你為每個資料集訓練模型時,通常更清楚它是如何得出答案的。通用基礎模型則更像一個黑箱,而在金融、保險或醫療等受監管的決策場景中,無論準確度多高,黑箱都可能一開始就行不通。這類情境下,這個模型有多大價值,取決於它能否被解釋得夠清楚,讓必須簽核放行的人滿意。

為什麼一家圖像與語言公司要做這件事

值得留意的是,這件事是誰做的。NVIDIA 的聲譽建立在訓練 AI 的晶片之上,而且越來越也建立在圍繞這些晶片的軟體上。一個表格基礎模型正好符合這幅圖像。大多數企業 AI 專案從來沒能做出令人驚豔的展示,因為真正困難的部分通常是試算表上那些枯燥的預測,而不是聊天機器人。為這個枯燥的部分推出一款強大、開放又快速的模型,是讓整個 AI 堆疊更有用的一種方式,而這又會回過頭來維持對底層硬體的需求。

對買方來說也有一個務實的角度。中小企業很少有資料科學團隊能為每個資料集訓練模型。一個開箱即用、任何團隊都能下載執行的基礎模型,降低了使用預測的門檻。同樣的動力曾把語言 AI 從研究上的新奇玩意變成預設工具:模型變得足夠通用,以至於你不再需要是專家才能從中受益。表格是等待這一刻到來的最後一個大型類別,而這次發布是在主張:這一刻可能已經不遠。

就目前而言,Kumo Tabular 為這個領域問了多年的問題提供了一個具體答案:單一模型能否處理它從未見過的表格?它聲稱可以,而且只以從未存在過的資料訓練而成——這要不是一項值得注目的進展,就是一個基準測試的假象,而兩者的差別,將在接下來幾個月人們拿它試用於真實試算表時顯現出來。那才是真正重要的考驗,而它現在就開始了。

相關文章