Aller au contenu principal
Infrastructure · Actu ·

NVIDIA Vera Rubin NVL72 affiche les meilleures performances au premier passage de MLPerf Inference v6.1

NVIDIA a publié le 16 septembre 2026 les résultats de MLPerf Inference v6.1, marquant les débuts de son système Vera Rubin NVL72. Dans cette première soumission préliminaire, la plateforme affiche un débit jusqu'à 3,7 fois supérieur au GB300 NVL72 sur le modèle Qwen3-VL, et jusqu'à 2,5 fois supérieur sur DeepSeek-R1 avec la bibliothèque TensorRT-LLM. Une soumission distincte de 288 GPU répartis sur quatre racks GB300 NVL72 a atteint une efficacité de mise à l'échelle de 99%, le débit croissant de façon quasi linéaire. Les optimisations logicielles de la v6.1 ont par ailleurs apporté jusqu'à 1,6 fois plus de performance que la v6.0, et le cloud provider Nebius a lui aussi soumis des résultats préliminaires pour Vera Rubin NVL72.

2 min de lecturePertinence 53

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de NVIDIA AI Blog. Lire l'article original →

Ces gains pèsent directement sur l'économie de l'inférence : un débit plus élevé signifie davantage de tokens générés par rack, donc plus d'utilisateurs servis et de revenus, à coût par token réduit. L'efficacité de mise à l'échelle quasi linéaire garantit que chaque GPU ajouté apporte une capacité proportionnelle, sans ressources superflues. Les optimisations logicielles continues permettent de tirer davantage de valeur du matériel déjà déployé, un enjeu majeur face à l'envolée des coûts d'infrastructure IA. Pour les entreprises qui arbitrent leurs achats, performance, efficacité de mise à l'échelle et rythme logiciel deviennent ainsi des critères déterminants, d'autant que la montée des agents IA impose de nouveaux standards de mesure.

Ces résultats reposent sur une conception conjointe du matériel et du logiciel : les Tensor Cores et le Transformer Engine de Vera Rubin accélèrent le prefill et le décodé, tandis que la précision NVFP4 réduit l'empreinte mémoire des poids et du cache KV avec une perte de qualité minimale. Les soumissions ont largement utilisé le disaggregated serving et le parallélisme d'experts à grande échelle, techniques clés pour les modèles à mélange d'experts comme DeepSeek-R1 et Qwen3-VL, rendues efficaces par l'interconnexion NVLink Switch de sixième génération, dix fois plus rapide et trois fois moins latente que l'Ethernet classique. L'ensemble illustre la stratégie de fongibilité de plateforme de NVIDIA, où une même infrastructure exécute tout type de modèle, de l'entraînement à l'inférence. MLPerf Inference, benchmark maintenu par le consortium MLCommons, reste l'un des rares points de comparaison indépendants dans une concurrence croissante sur les infrastructures d'IA.

Impact France / UEChamp produit par Le Fil IA

Le fournisseur cloud européen Nebius a soumis des résultats préliminaires pour Vera Rubin NVL72, signe d'une disponibilité potentielle de cette infrastructure pour des acteurs cloud actifs en Europe.

À lire ensuite

01Jusqu'à 30x plus de puissance par watt : NVIDIA Vera Rubin NVL72 fixe une nouvelle norme d'efficacité pour les agents IA40NVIDIA AI BlogInfrastructure 02NVIDIA Vera Rubin améliore la performance par watt et réduit le coût par token pour ses partenaires dans le monde46NVIDIA AI BlogInfrastructure 03Sommet sur l'infrastructure IA : NVIDIA présente les avancées de Vera Rubin et DSX pour optimiser les tokens par watt46NVIDIA AI BlogInfrastructure 
Dossier · NVIDIASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.