Aller au contenu principal
Infrastructure · Actu ·

Jusqu'à 30x plus de puissance par watt : NVIDIA Vera Rubin NVL72 fixe une nouvelle norme d'efficacité pour les agents IA

NVIDIA a dévoilé de nouvelles données de performance montrant que ses systèmes Vera Rubin NVL72 offrent jusqu'à 30 fois plus de débit par mégawatt que les systèmes GB300 NVL72 actuels sur les charges de travail d'IA agentique. Ces mesures s'appuient sur AgentX, un protocole de test développé par le cabinet d'analyse SemiAnalysis, qui reproduit des sessions réelles de codage agentique avec croissance de contexte, appels d'outils et création de sous-agents. Les tests couvrent plusieurs modèles agentiques, dont Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 et DeepSeek V4 Pro. Sur ce dernier modèle, les GB300 NVL72 affichaient déjà jusqu'à 15 fois plus de débit par mégawatt que l'architecture Hopper, et les Vera Rubin NVL72 poussent cet avantage jusqu'à 30 fois. NVIDIA annonce aussi un coût par million de tokens jusqu'à 35 fois inférieur à celui des GB300 NVL72, grâce notamment à la technologie de gestion d'énergie DSX MaxLPS, qui permet de déployer jusqu'à 40 % de GPU supplémentaires dans une même enveloppe de mégawatts. Ces résultats préliminaires sont en cours de validation par SemiAnalysis et n'incluent pas encore les performances du CPU Vera pour les appels d'outils. Selon des données d'OpenRouter citées par NVIDIA, les charges agentiques consomment déjà 15 fois plus de tokens qu'une simple requête de chat classique.

2 min de lecturePertinence 53
Source

Résumé et traduction réalisés par Le Fil IA à partir de NVIDIA AI Blog. Lire l'article original →

Cette efficacité énergétique compte parce que les agents IA fonctionnent très différemment d'un chatbot standard. Là où une conversation ou un résumé de document mobilise typiquement entre 1 000 et 8 000 tokens, un agent qui enchaîne recherches, appels d'outils et sous-agents peut accumuler plusieurs centaines de milliers de tokens de contexte avant de produire une réponse. Pour les centres de données contraints par leur capacité électrique, le débit par mégawatt détermine directement le chiffre d'affaires possible, tandis que le coût par token conditionne la marge dégagée sur cette activité. Un gain de 30 fois sur l'efficacité permet donc de faire tourner des agents en continu, à grande échelle, sur l'ensemble des usages professionnels, du développement logiciel au service client en passant par la recherche approfondie, sans multiplier d'autant la facture énergétique.

Ces annonces s'inscrivent dans la cadence accélérée de renouvellement matériel de NVIDIA, qui enchaîne les générations d'architectures, de Hopper à Blackwell (GB300) puis à Vera Rubin, avec à chaque étape une conception poussée conjointement au niveau du matériel et du logiciel. L'entreprise précise que les optimisations logicielles continues devraient encore améliorer les performances des plateformes GB300 NVL72 et Vera Rubin NVL72 dans les mois à venir. Cette course à l'efficacité par watt reflète l'essor rapide de l'IA agentique en production dans l'industrie, où la demande en tokens explose et où la disponibilité d'électricité devient un facteur limitant aussi critique que la puissance de calcul elle-même.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE, si ce n'est un gain d'efficacité énergétique potentiel pour les data centers européens qui adopteront ces puces a terme.

À lire ensuite

01NVIDIA Vera Rubin maximise l'intelligence par dollar pour les charges post-entraînement, une métrique clé pour l'IA à base d'agents32NVIDIA AI BlogInfrastructure 02Performance par watt : la métrique clé pour l'efficacité des infrastructures d'IA36NVIDIA AI BlogInfrastructure 03NVIDIA Vera Rubin améliore la performance par watt et réduit le coût par token pour ses partenaires dans le monde46NVIDIA AI BlogInfrastructure 
Dossier · Agents IASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.