← 블로그로
Ai약 11 분 읽기

NVIDIA의 Kumo Tabular는 존재한 적 없는 데이터로 학습됐다

게시일 2026년 10월 11일
NVIDIA의 Kumo Tabular는 존재한 적 없는 데이터로 학습됐다

9월 29일, NVIDIA는 Kumo Tabular를 공개했다. 이는 AI 붐이 대부분 외면해 온 한 종류의 데이터를 위해 만들어진 오픈 파운데이션 모델 제품군이다. 이 모델 중 하나에 일부 행이 채워진 표를 주면, 데이터셋별 학습 없이 나머지를 예측한다. 특이한 점은 이 모델이 하는 일이 아니다. 무엇으로 학습됐는가이다.

Kumo Tabular는 전적으로 인공적인 표 데이터로 사전 학습됐다. NVIDIA는 변수들이 서로에게 영향을 주는 방식을 수학적으로 기술한 구조적 인과 모델에서 샘플링해 이러한 표를 생성했다. 이 모델은 고객 데이터셋을 본 적이 없고, 나중에 테스트될 벤치마크 표도 본 적이 없다. 이는 의도적인 선택이며, 이번 릴리스를 일반적인 모델 구축 방식과 구분 짓는다.

테이블 형식 데이터가 사각지대였던 이유

세계 비즈니스 데이터 대부분은 표에 존재한다. 스프레드시트, 데이터베이스, CRM 내보내기, 재무 원장, 의료 기록까지, 끝까지 행과 열로 이루어져 있다. 대규모 언어 모델은 텍스트에서 뛰어나고 이미지와 비디오에서 점점 더 좋아지고 있지만, 표는 고질적인 격차로 남아 있었다. 언어 모델은 표를 텍스트로 읽을 수 있지만, 이는 테이블 형식 데이터 예측이 실제로 요구하는 열 간의 관계를 이해하는 것과 같지 않다.

전통적인 접근법은 각 데이터셋마다 별도의 모델을 학습시키는 것이다. 이는 효과가 있지만 느리고, 다른 곳에 적용하기 어렵다. 새 표마다 자체 학습 실행, 자체 튜닝, 자체 유지보수가 필요하다. 어떤 표든 보고 추가 학습이 거의 또는 전혀 없이 예측할 수 있는 표용 파운데이션 모델은 명백한 목표였지만 도달하기 어려운 목표였다. 표는 구조가 엄청나게 다양하고, 종종 작고 지저분하며 민감하기 때문이다.

추상적인 표 셀 그리드, 일부는 채워져 있고 일부는 예측 중 빛난다

합성 데이터를 택한 이유

합성 표로 학습하면 여러 문제를 한 번에 해결할 수 있다. 첫째는 프라이버시다. 실제 비즈니스 표에는 종종 개인 정보나 기밀 정보가 포함되어 있어, 대규모로 학습하기도 어렵고 모델을 공개하기에도 위험하다. 생성된 데이터로 학습한 모델은 이 문제를 완전히 비켜 간다.

둘째는 오염이다. 나중에 테스트할 데이터와 같은 종류의 데이터로 학습하면, 벤치마크 점수가 진짜 실력이 아니라 암기를 반영할 수 있다. 합성 표로만 학습한 Kumo Tabular는 어떤 벤치마크 행도 암기할 수 없다. 모델이 만들어질 당시 그 행들이 존재하지 않았기 때문이다. 표면적으로 이는 보고된 결과를 대부분보다 더 깨끗하게 만든다.

셋째는 일반성이다. 인과 모델에서 샘플링함으로써 NVIDIA는 학습 데이터에 다양한 기저 관계를 부여했다. 변수들이 서로에게 영향을 줄 수 있는 여러 방식을 본 모델은, 구조의 좁은 일부만 주로 본 모델보다 한 번도 접한 적 없는 표를 다룰 가능성이 더 크다. 이 베팅이 성과를 낼지는 이번 릴리스의 진짜 질문이다.

결과와 그 의미

NVIDIA는 Kumo Tabular가 테이블 형식 예측을 위한 공개 벤치마크인 TabArena에서 1위를 차지했다고 밝혔다. 또한 이 모델이 칭화대학교 팀이 만든 초기 테이블 형식 파운데이션 모델인 LimiX-2보다 약 17배 빠르게 예측한다고 보고했다. 속도 주장은 따져볼 가치가 있다. 추론 비용이 종종 모델의 사용 여부를 결정하기 때문이다. 조금 더 낫지만 훨씬 느린 모델은 예측이 끊임없이 실행되는 프로덕션 파이프라인에서 정당화하기 어렵다.

이 수치가 외부 테스트에서도 유지된다면, 실질적인 효과는 테이블 형식 예측이 이루어지는 방식의 전환이다. 데이터셋마다 새 모델을 학습시키는 대신, 팀은 바로 사용할 수 있는 하나의 모델을 쓰고 필요하면 가볍게 미세 조정해 몇 초 만에 예측을 얻을 수 있다. 이는 텍스트에서 일어난 것과 같은 도약이다. 대부분의 작업에서 범용 모델이 맞춤형 모델을 대체했고, 이로써 표도 나머지 AI가 현재 돌아가는 것과 같은 워크플로에 들어오게 될 것이다.

위험은 어디에 있는가

합성 데이터로만 학습하는 데는 실제 약점이 있으며, 이는 강점의 거울상이다. 실제 표는 생성된 표가 아닐 수 있는 방식으로 지저분하다. 데이터는 잘못 입력되고, 열은 시간이 지나며 의미가 바뀌고, 결측값은 눈앞에 숨어 있으며, 변수 간 관계가 항상 인과 모델이 인코딩할 법한 깔끔한 관계는 아니다. Kumo Tabular가 지나치게 정돈된 세계에서 학습했다면, 가장 일해야 할 바로 그곳, 즉 현실에 존재하는 결함 있는 표에서 넘어질 수 있다.

벤치마크와 배포 사이의 흔한 격차도 있다. TabArena에서 우승하는 것은 의미 있는 신호이지만, 특정 어려운 문제에서 잘 튜닝된 좁은 모델을 이긴다는 증거는 아니다. 가치 있는 예측 과제를 가진 팀은 전환하기 전에 자체 데이터로 현재 접근법과 Kumo Tabular를 비교 테스트해야 한다. 어떤 새 도구든 테스트하듯이 말이다.

더 조용한 우려는 해석 가능성이다. 데이터셋마다 모델을 학습시키면, 모델이 답에 도달하는 방식을 더 잘 아는 경우가 많다. 범용 파운데이션 모델은 더 블랙박스에 가깝고, 금융, 보험, 의료의 규제 대상 의사결정에서는 정확도와 무관하게 블랙박스가 애초에 논외가 될 수 있다. 그러한 환경에서 이 모델의 가치는 승인해야 하는 사람들을 만족시킬 만큼 충분히 설명될 수 있는지에 달려 있을 것이다.

이미지·언어 기업이 왜 이 일을 하는가

누가 이것을 내놓았는지 주목할 가치가 있다. NVIDIA의 명성은 AI를 학습시키는 칩과, 점점 더 그 주변 소프트웨어에 기대고 있다. 테이블 형식 파운데이션 모델은 그 그림에 들어맞는다. 대부분의 기업 AI 프로젝트는 화려한 데모에 도달하지 못한다. 어려운 부분은 보통 챗봇이 아니라 스프레드시트에서의 지루한 예측이기 때문이다. 그 지루한 부분을 위해 강력하고 개방적이며 빠른 모델을 내놓는 것은 전체 AI 스택을 더 유용하게 만드는 방법이며, 이는 다시 그 아래에서 돌아가는 하드웨어 수요를 유지시킨다.

구매자에게는 실용적인 측면도 있다. 중소기업은 데이터셋마다 모델을 학습시킬 데이터 과학 팀을 거의 갖추지 못한다. 별도 설정 없이 바로 작동하고, 어느 팀이든 다운로드해 실행할 수 있는 파운데이션 모델은 예측을 사용하는 장벽 자체를 낮춘다. 이는 언어 AI를 연구적 호기심에서 기본 도구로 만든 것과 같은 역학이다. 모델이 충분히 범용화되어 더 이상 전문가가 아니어도 혜택을 볼 수 있게 된 것이다. 표는 그 순간을 기다리는 마지막 큰 범주이며, 이번 릴리스는 그 순간이 가까울 수 있다는 주장이다.

현재로서 Kumo Tabular는 이 분야가 수년간 물어온 질문에 대한 구체적인 답이다. 하나의 모델이 한 번도 본 적 없는 표를 다룰 수 있는가? 존재한 적 없는 데이터로만 학습하고서 그럴 수 있다는 주장은 주목할 만한 진전이거나 벤치마크 아티팩트이며, 그 차이는 사람들이 실제 스프레드시트에서 시험해 보는 앞으로 몇 달 안에 드러날 것이다. 그것이 중요한 테스트이며, 지금 시작된다.

관련 글