NVIDIA publie Kumo Tabular, des modèles de fondation ouverts pour données tabulaires qui prédisent de nouvelles lignes en une seule passe
NVIDIA a publié Kumo Tabular, une famille de modèles de fondation tabulaires destinés à la classification et à la régression. Comme TabPFN ou TabICL, le modèle reçoit en contexte des lignes étiquetées et prédit de nouvelles lignes en une seule passe avant, sans entraînement, sans réglage d'hyperparamètres ni ingénierie des variables. Il existe en trois tailles, Small, Medium et Large, de 28 à 215 millions de paramètres, et s'utilise via la bibliothèque open source structured-data-models (SDM). Les poids sont distribués sous licence OpenMDW-1.1, qui autorise l'usage commercial, et le code SDM est sous Apache-2.0 (Python 3.11+, PyTorch 2.7+, GPU CUDA). Le modèle est un Transformer à attention par colonnes, par lignes et en contexte. Les valeurs numériques et catégorielles passent par des caractéristiques de Fourier apprises, sans imputation des valeurs manquantes. Quatre jetons [CLS] résument chaque ligne, et la tête de sortie produit des probabilités de classes ou 999 quantiles en régression, soit une prédiction ponctuelle assortie d'une incertitude. Une température d'attention croissant avec le logarithme du nombre de clés, apprise par tête, garde l'attention précise sur les grandes tables.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Les performances sont notables. Avec ses réglages par défaut, Kumo Tabular se classe premier sur TabArena avec un Elo de 1950, et tourne 17 fois plus vite que LimiX-2 sur une seule RTX 6000 Pro. Il prend aussi la première place sur BeyondArena (Elo de 1418, score d'« improvabilité » de 7,78 %) et sur TALENT (rangs moyens de 6,67 en exactitude, 3,98 en log-loss et 4,22 en RMSE). Sur ScoringBench, les versions Large et Medium occupent les deux premières places. Les trois tailles se situent sur le front de Pareto entre précision et temps d'inférence. Pour les entreprises, c'est la perspective d'obtenir, sans aucun entraînement, des résultats supérieurs aux approches classiques sur des données tabulaires, qui restent le format dominant en finance, santé, industrie ou marketing, avec un déploiement commercial permis par la licence.
Le modèle est pré-entraîné uniquement sur des tables synthétiques générées par des modèles causaux structurels : graphes causaux aléatoires reliant des variables cachées par des relations linéaires, de petits réseaux de neurones, des arbres ou des processus gaussiens, avec valeurs manquantes, catégories à forte cardinalité, cibles à queue lourde et doublons contradictoires. L'entraînement a suivi trois étapes, comme TabICLv2, avec un contexte passant de 1 024 à 60 000 lignes et jusqu'à 100 colonnes. Small, Medium et Large ont vu environ 35, 71 et 137 millions de tables artificielles, avec des modèles distincts pour la classification et la régression. NVIDIA annonce la publication prochaine de la recette d'entraînement et des générateurs de données. Le modèle affronte TabICLv2 (Inria SODA), TabPFN-3 (Prior Labs), LimiX-2 (Stable AI, 400 millions de paramètres) et TabFM de Google Research (environ 1,64 milliard de paramètres). La bibliothèque SDM regroupe aussi TabICLv2, TabFM et KumoRelational pour les données multi-tables, ce qui positionne NVIDIA comme plateforme commune des modèles tabulaires.
Les équipes françaises et européennes peuvent utiliser ces modèles sous licence commerciale ouverte, et le modèle se mesure à TabICLv2 de l'Inria, un laboratoire français.