Comparatif d'inférence de petits LLM sur SageMaker AI : G7 face à G5 et G6
Amazon Web Services a publié début septembre 2026 une étude comparative détaillée sur les performances d'inférence de modèles de langage sur SageMaker AI, opposant ses nouvelles instances G7 (dotées de GPU NVIDIA Blackwell RTX PRO 4500) aux générations précédentes G5 (A10G) et G6 (L4 et L40S). Deux cas d'usage ont été testés. Le premier déploie Qwen3-Coder-30B, un modèle Mixture-of-Experts de 30 milliards de paramètres destiné aux assistants de codage d'entreprise, sur des instances ml.g5.12xlarge, ml.g6.12xlarge et ml.g7.12xlarge via le conteneur DJL Large Model Inference d'AWS. Fait notable, les configurations G5 et G6 mobilisent chacune quatre GPU pour 96 Go de mémoire cumulée, tandis que G7 se contente de deux GPU pour seulement 64 Go. Le second cas d'usage porte sur NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4, un modèle destiné au raisonnement, à la synthèse et aux tâches agentiques, testé sur G6, G6e (L40S, 192 Go) et G7 via le serveur d'inférence vLLM, en s'appuyant sur la fonctionnalité Generative AI Inference Recommendations de SageMaker qui automatise le choix de configuration selon le débit, le coût et la latence. Ces résultats ont une portée directe pour les entreprises qui déploient des grands modèles de langage en production à grande échelle, où chaque génération de GPU peut réduire la latence, augmenter le débit et diminuer le coût par token traité. L'enseignement central de cette étude est que les instances G7 parviennent à égaler, voire dépasser, les performances de prix et de latence des générations antérieures tout en utilisant deux fois moins d'accélérateurs et une mémoire GPU totale inférieure. Pour les équipes techniques qui opèrent des copilotes de développement, des assistants conversationnels d'entreprise ou des systèmes agentiques, cela signifie la possibilité de réduire l'empreinte matérielle et donc la facture cloud sans sacrifier la qualité de service, un arbitrage particulièrement sensible à mesure que les modèles de type Mixture-of-Experts, plus économes en calcul actif malgré leur taille nominale élevée, se généralisent dans les déploiements commerciaux. Cette publication s'inscrit dans la course permanente entre fournisseurs cloud et fabricants de puces pour optimiser le rapport performance-coût de l'inférence, alors que les architectures Blackwell de NVIDIA commencent à irriguer les catalogues d'instances des grands fournisseurs comme AWS après leur déploiement initial sur les charges d'entraînement. La fonctionnalité SageMaker AI Generative AI Inference Recommendations illustre aussi une tendance plus large: automatiser le choix d'infrastructure pour des équipes qui ne veulent plus arbitrer manuellement entre dizaines de combinaisons de GPU, de formats de quantification et de piles logicielles comme vLLM. À mesure que des modèles comme Qwen3-Coder ou la gamme Nemotron de NVIDIA se diversifient, ces benchmarks comparatifs devraient devenir un outil récurrent pour guider les décisions de déploiement, avec la question de la disponibilité et du coût réel des instances G7 à grande échelle comme prochain point d'attention pour les entreprises clientes d'AWS.
















































