Avec Groq 3 LPX en pleine production, NVIDIA étend Vera Rubin à l'inférence pour agents
NVIDIA a annoncé ce mardi 24 août, lors de la conférence Hot Chips à Palo Alto, la mise en production complète de sa puce Groq 3 LPX, intégrée à la plateforme Vera Rubin NVL72 pour accélérer l'inférence des systèmes d'IA agentique. Selon un benchmark d'Artificial Analysis mené sur le modèle open source Gemma 4 31B, la puce génère 3 400 tokens par seconde sur des contextes longs de 100 000 tokens, soit quatre fois plus vite que la meilleure alternative du marché. Nebius devient le premier cloud à adopter Groq 3 LPX, via son offre Token Factory, tandis que CoreWeave déploie en production Spectrum-X Multiplane, un réseau reliant plusieurs racks Vera Rubin. SpaceXAI, de son côté, a annoncé l'utilisation des processeurs NVIDIA Vera pour son IA agentique, des centres de données terrestres jusqu'à ses satellites en orbite.
Résumé et traduction réalisés par Le Fil IA à partir de NVIDIA AI Blog. Lire l'article original →
Cette annonce illustre un basculement de l'industrie de l'IA, où l'entraînement des modèles cède la place à l'inférence comme principal poste de dépense et de différenciation. Les agents IA génèrent davantage de tokens, traitent des contextes bien plus longs et collaborent entre eux pour résoudre des tâches complexes, ce qui impose une infrastructure optimisée pour le débit, la latence et le coût par token, pas seulement pour la puissance de calcul brute. En intégrant calcul, réseau et inférence dans une architecture unique, NVIDIA cherche à réduire le coût de génération des tokens pour les entreprises qui déploient des assistants de code, des agents conversationnels ou des applications temps réel à grande échelle. Pour des clouds comme Nebius et CoreWeave, cela représente un avantage compétitif direct: proposer une inférence plus rapide et moins chère devient un argument commercial aussi important que la qualité des modèles.
Cette approche, que NVIDIA appelle la conception extrême (extrême codesign), consiste à concevoir simultanément le calcul, le réseau et l'accélération d'inférence plutôt que d'optimiser chaque composant séparément, et structure désormais toute la feuille de route de la plateforme Vera Rubin. L'annonce survient alors que la concurrence sur les puces d'inférence s'intensifie, portée par la demande croissante pour des agents capables de raisonner sur de longues séquences et d'utiliser des outils externes, des usages beaucoup plus gourmands que la simple génération de texte court. Le choix de SpaceXAI d'étendre ces processeurs jusqu'à ses satellites en orbite illustre l'ambition de NVIDIA de dépasser les seuls centres de données terrestres. À mesure que d'autres clouds suivront l'exemple de Nebius et CoreWeave, la bataille sur le coût et la vitesse de génération des tokens devrait s'intensifier dans les prochains mois.
Nebius, cloud européen base a Amsterdam, devient le premier a adopter cette puce via son offre Token Factory, donnant aux entreprises européennes un accès a une inférence agentique plus rapide et moins couteuse.