← Volver al blog
Aiaprox. 7 min de lectura

El Kumo Tabular de NVIDIA se entrenó con datos que nunca existieron

Publicado 11 oct 2026
El Kumo Tabular de NVIDIA se entrenó con datos que nunca existieron

El 29 de septiembre, NVIDIA lanzó Kumo Tabular, una familia de modelos fundacionales abiertos creados para un tipo de datos que el auge de la IA ha ignorado en gran medida. Dale a uno de estos modelos una tabla con algunas filas completadas y predecirá el resto, sin necesidad de entrenamiento por conjunto de datos. La parte inusual no es lo que hace. Es con lo que fue entrenado.

Kumo Tabular se preentrenó por completo con tablas artificiales. NVIDIA las generó mediante muestreo de modelos causales estructurales, que son descripciones matemáticas de cómo las variables se influyen entre sí. El modelo nunca vio un conjunto de datos de clientes, y nunca vio las tablas de benchmark con las que después se probaría. Es una elección deliberada, y separa este lanzamiento de la forma habitual en que se construyen los modelos.

Por qué los datos tabulares han sido el punto ciego

La mayor parte de los datos empresariales del mundo vive en tablas. Hojas de cálculo, bases de datos, exportaciones de CRM, libros contables financieros, registros médicos: filas y columnas, hasta el fondo. Los modelos de lenguaje grandes son notables con el texto y cada vez mejores con imágenes y video, pero las tablas han sido una brecha obstinada. Un modelo de lenguaje puede leer una tabla como texto, pero eso no es lo mismo que entender las relaciones entre columnas, que es lo que realmente requiere la predicción sobre datos tabulares.

El enfoque tradicional consiste en entrenar un modelo separado para cada conjunto de datos. Eso funciona, pero es lento y no se traslada. Cada tabla nueva necesita su propia ejecución de entrenamiento, su propio ajuste, su propio mantenimiento. Un modelo fundacional para tablas, uno que pueda mirar cualquier tabla y predecir con poco o ningún entrenamiento adicional, ha sido un objetivo obvio pero difícil de alcanzar, porque las tablas varían enormemente en estructura y a menudo son pequeñas, desordenadas y sensibles.

Una cuadrícula de celdas de tabla abstractas, algunas llenas y otras brillando en predicción

El caso de los datos sintéticos

El entrenamiento con tablas sintéticas resuelve varios problemas a la vez. El primero es la privacidad. Las tablas empresariales reales a menudo contienen información personal o confidencial, lo que las vuelve incómodas para entrenar a escala y arriesgadas a la hora de lanzar un modelo en torno a ellas. Un modelo que aprendió de datos generados evita eso por completo.

El segundo es la contaminación. Si entrenas con el mismo tipo de datos con los que luego pruebas, tus puntuaciones de benchmark pueden reflejar memorización en lugar de habilidad genuina. Al entrenar solo con tablas sintéticas, Kumo Tabular no puede haber memorizado ninguna fila de benchmark, porque ninguna de ellas existía cuando se construyó el modelo. A primera vista, eso hace que los resultados reportados sean más limpios que la mayoría.

El tercero es la generalidad. Al muestrear de modelos causales, NVIDIA le dio a los datos de entrenamiento un conjunto diverso de relaciones subyacentes. Un modelo que ha visto muchas formas diferentes en que las variables pueden influirse entre sí tiene más probabilidades de manejar una tabla que nunca ha encontrado que uno que vio principalmente una porción estrecha de estructuras. Si esa apuesta da sus frutos es la verdadera pregunta detrás del lanzamiento.

Los resultados, y lo que significan

NVIDIA dice que Kumo Tabular ocupa el primer lugar en TabArena, un benchmark público para la predicción tabular. También informa que el modelo predice aproximadamente 17 veces más rápido que LimiX-2, un modelo fundacional tabular anterior de un equipo de la Universidad de Tsinghua. Vale la pena sopesar la afirmación sobre la velocidad, porque el costo de inferencia suele ser lo que decide si se usa un modelo. Un modelo que es un poco mejor pero mucho más lento es difícil de justificar en un pipeline de producción donde las predicciones se ejecutan constantemente.

Si los números se mantienen bajo pruebas externas, el efecto práctico es un cambio en cómo se hace la predicción tabular. En lugar de entrenar un modelo nuevo por conjunto de datos, los equipos podrían usar un modelo listo para usar, ajustarlo ligeramente si es necesario y obtener predicciones en segundos. Ese es el mismo salto que ocurrió en el texto, donde un modelo general reemplazó a uno personalizado para la mayoría de las tareas, y traería las tablas al mismo flujo de trabajo en el que ahora se ejecuta el resto de la IA.

Dónde están los riesgos

El entrenamiento solo con datos sintéticos tiene una debilidad real, y es la imagen espejo de su fortaleza. Las tablas reales son desordenadas de maneras en que las generadas pueden no serlo. Los datos se ingresan mal, las columnas cambian de significado con el tiempo, los valores faltantes se ocultan a plena vista y las relaciones entre variables no siempre son las limpias que codificaría un modelo causal. Si Kumo Tabular aprendió de un mundo demasiado ordenado, puede tropezar exactamente donde más necesita funcionar: las tablas defectuosas que existen en la práctica.

También está la brecha habitual entre un benchmark y un despliegue. Ganar TabArena es una señal significativa, y no es prueba de que el modelo superará a un modelo especializado bien ajustado en un problema difícil específico. Los equipos con una tarea de predicción valiosa aún deberían probar Kumo Tabular contra su enfoque actual con sus propios datos antes de cambiar, de la misma manera en que probarían cualquier herramienta nueva.

Una preocupación más silenciosa es la interpretabilidad. Cuando entrenas un modelo por conjunto de datos, a menudo sabes más sobre cómo llega a sus respuestas. Un modelo fundacional general es más una caja negra, y para decisiones reguladas en finanzas, seguros o medicina, una caja negra puede ser inviable independientemente de la precisión. El valor del modelo en esos entornos dependerá de si se puede explicar lo suficientemente bien como para satisfacer a las personas que tienen que darle el visto bueno.

Por qué una empresa de imagen y lenguaje está haciendo esto

Vale la pena notar quién lanzó esto. La reputación de NVIDIA se basa en los chips que entrenan IA y, cada vez más, en el software que los rodea. Un modelo fundacional tabular encaja en ese panorama. La mayoría de los proyectos empresariales de IA nunca llegan a una demo llamativa, porque la parte difícil suele ser la predicción aburrida en una hoja de cálculo, no el chatbot. Lanzar un modelo sólido, abierto y rápido para esa parte aburrida es una forma de hacer que todo el stack de IA sea más útil, lo que a su vez mantiene la demanda del hardware que se ejecuta por debajo.

También hay un ángulo pragmático para los compradores. Las pequeñas y medianas empresas rara vez tienen equipos de ciencia de datos para entrenar un modelo por conjunto de datos. Un modelo fundacional que funciona listo para usar, uno que cualquier equipo puede descargar y ejecutar, reduce la barrera para empezar a usar la predicción. Esa es la misma dinámica que llevó a la IA de lenguaje de ser una curiosidad de investigación a una herramienta por defecto: los modelos se volvieron lo suficientemente generales como para que ya no necesitaras ser un especialista para beneficiarte de ellos. Las tablas son la última gran categoría que espera ese momento, y este lanzamiento es un argumento de que el momento puede estar cerca.

Por ahora, Kumo Tabular es una respuesta concreta a una pregunta que el campo se ha hecho durante años: ¿puede un solo modelo manejar tablas que nunca ha visto? La afirmación de que puede, entrenado solo con datos que nunca existieron, es un avance notable o un artefacto de benchmark, y la diferencia aparecerá en los meses en que la gente lo pruebe en hojas de cálculo reales. Esa es la prueba que importa, y comienza ahora.

Artículos relacionados