← Retour au blog
AiEnviron 8 min de lecture

Kumo Tabular de NVIDIA a été entraîné sur des données qui n'ont jamais existé

Publié le 11 oct. 2026
Kumo Tabular de NVIDIA a été entraîné sur des données qui n'ont jamais existé

Le 29 septembre, NVIDIA a publié Kumo Tabular, une famille de modèles de fondation ouverts conçus pour un type de données que l'essor de l'IA a largement ignoré. Donnez à l'un de ces modèles un tableau avec quelques lignes remplies, et il prédit le reste, sans nécessiter d'entraînement par jeu de données. La partie inhabituelle n'est pas ce qu'il fait. C'est sur quoi il a été entraîné.

Kumo Tabular a été pré-entraîné entièrement sur des tableaux artificiels. NVIDIA les a générés en échantillonnant à partir de modèles causaux structurels, qui sont des descriptions mathématiques de la façon dont les variables s'influencent mutuellement. Le modèle n'a jamais vu de jeu de données client, et il n'a jamais vu les tableaux de benchmark sur lesquels il serait ensuite testé. C'est un choix délibéré, et cela distingue cette publication de la manière habituelle dont les modèles sont construits.

Pourquoi les données tabulaires ont été le point aveugle

La plupart des données d'entreprise mondiales vivent dans des tableaux. Feuilles de calcul, bases de données, exports CRM, registres financiers, dossiers médicaux : des lignes et des colonnes, jusqu'au bout. Les grands modèles de langage sont remarquables pour le texte et de plus en plus bons pour les images et la vidéo, mais les tableaux ont été une lacune tenace. Un modèle de langage peut lire un tableau comme du texte, mais ce n'est pas la même chose que de comprendre les relations entre les colonnes, ce qui est exactement ce que la prédiction sur des données tabulaires exige.

L'approche traditionnelle consiste à entraîner un modèle distinct pour chaque jeu de données. Cela fonctionne, mais c'est lent et cela ne se transpose pas. Chaque nouveau tableau nécessite sa propre phase d'entraînement, son propre réglage, sa propre maintenance. Un modèle de fondation pour les tableaux, capable d'examiner n'importe quel tableau et de prédire avec peu ou pas d'entraînement supplémentaire, a été un objectif évident mais difficile à atteindre, car les tableaux varient énormément en structure et sont souvent petits, désordonnés et sensibles.

Une grille de cellules de tableau abstraites, certaines remplies et d'autres brillantes en prédiction

L'argument des données synthétiques

L'entraînement sur des tableaux synthétiques résout plusieurs problèmes à la fois. Le premier est la confidentialité. Les tableaux d'entreprise réels contiennent souvent des informations personnelles ou confidentielles, ce qui les rend difficiles à utiliser pour l'entraînement à grande échelle et risqués pour la publication d'un modèle. Un modèle qui a appris à partir de données générées contourne entièrement ce problème.

Le deuxième est la contamination. Si vous vous entraînez sur le même type de données que celui sur lequel vous testez ensuite, vos scores de benchmark peuvent refléter une mémorisation plutôt qu'une compétence réelle. En s'entraînant uniquement sur des tableaux synthétiques, Kumo Tabular ne peut avoir mémorisé aucune ligne de benchmark, car aucune d'entre elles n'existait lorsque le modèle a été construit. À première vue, cela rend les résultats rapportés plus propres que la plupart.

Le troisième est la généralité. En échantillonnant à partir de modèles causaux, NVIDIA a donné aux données d'entraînement un ensemble diversifié de relations sous-jacentes. Un modèle qui a vu de nombreuses façons différentes dont les variables peuvent s'influencer mutuellement a plus de chances de traiter un tableau qu'il n'a jamais rencontré qu'un modèle qui n'a vu qu'une tranche étroite de structures. Savoir si ce pari porte ses fruits est la vraie question derrière cette publication.

Les résultats, et ce qu'ils signifient

NVIDIA affirme que Kumo Tabular se classe premier sur TabArena, un benchmark public pour la prédiction tabulaire. Il rapporte également que le modèle prédit environ 17 fois plus rapidement que LimiX-2, un modèle de fondation tabulaire antérieur d'une équipe de l'Université Tsinghua. L'affirmation de vitesse mérite d'être pesée, car le coût d'inférence est souvent ce qui détermine si un modèle est utilisé. Un modèle un peu meilleur mais beaucoup plus lent est difficile à justifier dans un pipeline de production où les prédictions tournent en permanence.

Si les chiffres résistent à des tests externes, l'effet pratique est un changement dans la façon dont la prédiction tabulaire est effectuée. Au lieu d'entraîner un nouveau modèle par jeu de données, les équipes pourraient utiliser un modèle prêt à l'emploi, l'affiner légèrement si nécessaire et obtenir des prédictions en quelques secondes. C'est le même bond qui s'est produit dans le texte, où un modèle général a remplacé un modèle personnalisé pour la plupart des tâches, et cela amènerait les tableaux dans le même flux de travail que le reste de l'IA utilise aujourd'hui.

Où se situent les risques

L'entraînement uniquement sur des données synthétiques a une véritable faiblesse, et c'est l'image miroir de sa force. Les tableaux réels sont désordonnés d'une manière que les tableaux générés ne sont peut-être pas. Les données sont mal saisies, les colonnes changent de signification au fil du temps, les valeurs manquantes se cachent à la vue de tous, et les relations entre les variables ne sont pas toujours les relations propres qu'un modèle causal encoderait. Si Kumo Tabular a appris d'un monde trop ordonné, il pourrait trébucher exactement là où il a le plus besoin de fonctionner : les tableaux imparfaits qui existent en pratique.

Il y a aussi l'écart habituel entre un benchmark et un déploiement. Gagner TabArena est un signal significatif, et ce n'est pas la preuve que le modèle battra un modèle étroit bien réglé sur un problème difficile spécifique. Les équipes ayant une tâche de prédiction précieuse devraient toujours tester Kumo Tabular par rapport à leur approche actuelle sur leurs propres données avant de changer, de la même manière qu'elles testeraient tout nouvel outil.

Une préoccupation plus discrète est l'interprétabilité. Lorsque vous entraînez un modèle par jeu de données, vous savez souvent mieux comment il parvient à ses réponses. Un modèle de fondation général est davantage une boîte noire, et pour les décisions réglementées en finance, assurance ou médecine, une boîte noire peut être un obstacle rédhibitoire quelle que soit la précision. La valeur du modèle dans ces contextes dépendra de sa capacité à être expliqué suffisamment bien pour satisfaire les personnes qui doivent l'approuver.

Pourquoi une entreprise d'images et de langage fait cela

Il vaut la peine de remarquer qui a publié cela. La réputation de NVIDIA repose sur les puces qui entraînent l'IA et, de plus en plus, sur le logiciel qui les entoure. Un modèle de fondation tabulaire s'inscrit dans ce tableau. La plupart des projets d'IA en entreprise n'atteignent jamais une démo tape-à-l'œil, car la partie difficile est généralement la prédiction ennuyeuse sur une feuille de calcul, pas le chatbot. Publier un modèle fort, ouvert et rapide pour cette partie ennuyeuse est un moyen de rendre toute la pile d'IA plus utile, ce qui à son tour maintient la demande pour le matériel qui la fait fonctionner.

Il y a aussi un angle pragmatique pour les acheteurs. Les petites et moyennes entreprises ont rarement les équipes de science des données pour entraîner un modèle par jeu de données. Un modèle de fondation qui fonctionne immédiatement, que n'importe quelle équipe peut télécharger et exécuter, abaisse la barrière à l'utilisation de la prédiction tout court. C'est la même dynamique qui a fait passer l'IA linguistique d'une curiosité de recherche à un outil par défaut : les modèles sont devenus suffisamment généraux pour que vous n'ayez plus besoin d'être un spécialiste pour en bénéficier. Les tableaux sont la dernière grande catégorie en attente de ce moment, et cette publication est un argument que ce moment est peut-être proche.

Pour l'instant, Kumo Tabular est une réponse concrète à une question que le domaine se pose depuis des années : un seul modèle peut-il gérer des tableaux qu'il n'a jamais vus ? L'affirmation selon laquelle il le peut, entraîné uniquement sur des données qui n'ont jamais existé, est soit une avancée notable, soit un artefact de benchmark, et la différence apparaîtra dans les mois à venir lorsque les gens l'essaieront sur de vraies feuilles de calcul. C'est le test qui compte, et il commence maintenant.

Articles associés