De l'entraînement à la production, NVIDIA et CoreWeave bouclent la chaîne pour l'IA à base d'agents
CoreWeave a annoncé cette semaine, lors de sa conférence Fully Connected à San Francisco, la disponibilité des systèmes NVIDIA Vera Rubin NVL72 équipés du réseau Ethernet Spectrum-X 102.4T sur son cloud. Cognition, le laboratoire derrière l'ingénieur logiciel d'IA Devin, est le premier client à faire tourner des charges de production sur cette plateforme. CoreWeave proposera aussi le NVIDIA Vera, présenté comme le premier processeur conçu pour les agents d'IA, et lance CoreWeave Forge, un environnement connecté pour entraîner, évaluer et améliorer modèles et agents. Les premiers racks Vera Rubin NVL72 de production ont été reçus plus tôt ce mois-ci. Cognition a ensuite comparé ses performances d'inférence à une base GB200 NVL72, avec des tâches tirées de FrontierCode résolues par des agents. Résultat : jusqu'à 4,8 fois plus de débit total de jetons pour les charges d'inférence SWE-2. CoreWeave a monté en quelques jours un cluster de production pour Cognition, exploitable via CoreWeave Kubernetes Service, SUNK, Mission Control, Sandboxes et Inference. Un rack Vera y regroupe 128 CPU et 11 264 coeurs, soit plus de 11 000 environnements simultanés à raison d'un coeur chacun. Les tests annoncent des démarrages de bacs à sable d'agents plus de trois fois plus rapides.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de NVIDIA AI Blog. Lire l'article original →
Pour Cognition, ces gains se traduisent par une génération de code plus rapide en temps réel et un raisonnement multi-étapes plus réactif dans Devin. Le codage agentique est une charge exigeante, avec des contextes longs, une forte concurrence et des volumes de jetons où le coût par jeton détermine ce que l'entreprise peut livrer, explique Silas Alberti, membre de l'équipe fondatrice. Plus largement, l'IA agentique sollicite l'infrastructure dans deux directions : servir des agents demande du calcul à faible latence à grande échelle, tandis que leur amélioration par post-entraînement exige des milliers d'environnements isolés fonctionnant en parallèle. La capacité d'exécuter de nombreux environnements à la fois, tout en gardant des performances régulières, devient donc un critère central, que cible le processeur Vera. Pour les clients, disposer du calcul GPU, du CPU et des outils d'évaluation sur une seule plateforme simplifie la boucle entre entraînement et production.
Cette annonce prolonge près d'une décennie de co-ingénierie entre NVIDIA et CoreWeave, dont le cloud dédié à l'IA continue de rentabiliser les investissements sur plusieurs générations de matériel. Ian Buck, vice-président de NVIDIA pour l'hyperscale et le calcul haute performance, rappelle que les GPU V100 de CoreWeave exécutent encore des charges clients près de dix ans après le lancement de Volta, alors même que Vera Rubin entre en production. L'argument vise aussi les inquiétudes sur la durée de vie économique des GPU, un enjeu majeur pour les fournisseurs de cloud qui financent des infrastructures coûteuses. CoreWeave se positionne ainsi parmi les premiers fournisseurs à livrer Vera Rubin à des clients, dans une course où l'accès rapide aux nouvelles générations de puces fait la différence. La suite dépendra de la confirmation des résultats de Cognition sur d'autres charges et de l'arrivée du processeur Vera dans le cloud de CoreWeave.
Pas d'impact direct sur la France/UE