Aller au contenu principal
LLMs · Actu ·

NVIDIA publie Kumo Tabular, des modèles de fondation ouverts pour données tabulaires qui prédisent de nouvelles lignes en une seule passe

NVIDIA a publié Kumo Tabular, une famille de modèles de fondation tabulaires destinés à la classification et à la régression. Comme TabPFN ou TabICL, le modèle reçoit en contexte des lignes étiquetées et prédit de nouvelles lignes en une seule passe avant, sans entraînement, sans réglage d'hyperparamètres ni ingénierie des variables. Il existe en trois tailles, Small, Medium et Large, de 28 à 215 millions de paramètres, et s'utilise via la bibliothèque open source structured-data-models (SDM). Les poids sont distribués sous licence OpenMDW-1.1, qui autorise l'usage commercial, et le code SDM est sous Apache-2.0 (Python 3.11+, PyTorch 2.7+, GPU CUDA). Le modèle est un Transformer à attention par colonnes, par lignes et en contexte. Les valeurs numériques et catégorielles passent par des caractéristiques de Fourier apprises, sans imputation des valeurs manquantes. Quatre jetons [CLS] résument chaque ligne, et la tête de sortie produit des probabilités de classes ou 999 quantiles en régression, soit une prédiction ponctuelle assortie d'une incertitude. Une température d'attention croissant avec le logarithme du nombre de clés, apprise par tête, garde l'attention précise sur les grandes tables.

2 min de lecturePertinence 63

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Les performances sont notables. Avec ses réglages par défaut, Kumo Tabular se classe premier sur TabArena avec un Elo de 1950, et tourne 17 fois plus vite que LimiX-2 sur une seule RTX 6000 Pro. Il prend aussi la première place sur BeyondArena (Elo de 1418, score d'« improvabilité » de 7,78 %) et sur TALENT (rangs moyens de 6,67 en exactitude, 3,98 en log-loss et 4,22 en RMSE). Sur ScoringBench, les versions Large et Medium occupent les deux premières places. Les trois tailles se situent sur le front de Pareto entre précision et temps d'inférence. Pour les entreprises, c'est la perspective d'obtenir, sans aucun entraînement, des résultats supérieurs aux approches classiques sur des données tabulaires, qui restent le format dominant en finance, santé, industrie ou marketing, avec un déploiement commercial permis par la licence.

Le modèle est pré-entraîné uniquement sur des tables synthétiques générées par des modèles causaux structurels : graphes causaux aléatoires reliant des variables cachées par des relations linéaires, de petits réseaux de neurones, des arbres ou des processus gaussiens, avec valeurs manquantes, catégories à forte cardinalité, cibles à queue lourde et doublons contradictoires. L'entraînement a suivi trois étapes, comme TabICLv2, avec un contexte passant de 1 024 à 60 000 lignes et jusqu'à 100 colonnes. Small, Medium et Large ont vu environ 35, 71 et 137 millions de tables artificielles, avec des modèles distincts pour la classification et la régression. NVIDIA annonce la publication prochaine de la recette d'entraînement et des générateurs de données. Le modèle affronte TabICLv2 (Inria SODA), TabPFN-3 (Prior Labs), LimiX-2 (Stable AI, 400 millions de paramètres) et TabFM de Google Research (environ 1,64 milliard de paramètres). La bibliothèque SDM regroupe aussi TabICLv2, TabFM et KumoRelational pour les données multi-tables, ce qui positionne NVIDIA comme plateforme commune des modèles tabulaires.

Impact France / UEChamp produit par Le Fil IA

Les équipes françaises et européennes peuvent utiliser ces modèles sous licence commerciale ouverte, et le modèle se mesure à TabICLv2 de l'Inria, un laboratoire français.

À lire ensuite

01NVIDIA lance Nemotron 3 Embed, une collection d'embeddings ouverts dont le modèle 8B se classe premier sur RTEB37MarkTechPostLLMs 02Le réglage fin des modèles Amazon Nova pour une extraction précise des données d'e-mails35AWS ML BlogLLMs 03Anthropic n'est pas le meilleur pour le service client, selon de nouvelles données43The Information AILLMs 
Dossier · NVIDIASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.