Comment les GPU NVIDIA accélèrent GPT-6 Astra d'OpenAI à très grande vitesse
GPT-6 Astra Ultrafast, le nouveau mode d'OpenAI exécuté sur les GPU NVIDIA Blackwell, est disponible dès maintenant dans l'API d'OpenAI ainsi que pour les utilisateurs éligibles de ChatGPT Work et de Codex. Grâce à des optimisations d'inférence qui exploitent les capacités de l'architecture Blackwell, Ultrafast génère des jetons jusqu'à 8 fois plus vite que le mode Astra Standard. Les développeurs peuvent l'utiliser dès aujourd'hui via l'API, un guide dédié détaillant l'accès, la tarification et la mise en œuvre. Philippe Tillet, responsable de l'inférence chez OpenAI, explique que l'investissement de NVIDIA dans les outils et la documentation a permis aux modèles de l'entreprise de devenir exceptionnellement performants pour programmer les GPU Blackwell et Rubin. Selon lui, Astra peut transformer ce savoir en noyaux de calcul très performants, qui rendent le matériel NVIDIA attractif sur toute la frontière entre latence, débit et coût.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de NVIDIA AI Blog. Lire l'article original →
L'enjeu est concret pour les développeurs. Une génération plus rapide raccourcit les cycles d'édition, de test et de débogage des agents de programmation, réduit le temps d'attente entre deux appels d'outils et rend les applications interactives plus réactives. Le gain compte surtout parce qu'il se répète à chaque étape d'un flux de travail : un agent écrit du code, utilise un outil, vérifie le résultat puis décide de la suite. Ultrafast place ainsi les capacités d'Astra dans ces boucles sensibles au temps. Pour OpenAI, cela signifie aussi pouvoir servir des réponses utiles au moment précis où les développeurs en ont besoin, sans sacrifier la qualité du modèle.
Les performances ne cessent pas de progresser après le déploiement. OpenAI utilise ses propres modèles pour affiner le logiciel d'inférence qui tourne sur les GPU NVIDIA, en tirant parti de la programmabilité de la plateforme pour tester et appliquer des améliorations. Uday Ruddarraju, directeur technique du calcul chez OpenAI, indique que ces modèles internes ont servi à optimiser l'inférence, et que cette programmabilité a permis de livrer l'accélération derrière Astra Ultrafast. Cette approche permet de réutiliser la même infrastructure pour l'entraînement, l'inférence et l'apprentissage par renforcement à mesure que les modèles évoluent. Les équipes peuvent ainsi réaffecter leurs ressources de calcul quand la demande change, améliorer le taux d'utilisation et éviter de surdimensionner chaque charge de travail. Le dispositif illustre la boucle de plus en plus étroite entre modèles de pointe et matériel qui les fait tourner.
Pas d'impact direct sur la France/UE