Amazon SageMaker Inference : bilan des lancements depuis le début de 2026
Amazon a détaillé le bilan des nouveautés apportées en 2026 à Amazon SageMaker AI pour l'inférence de modèles d'intelligence artificielle générative, avec treize fonctionnalités lancées depuis janvier. Le service propose deux façons de déployer des modèles: les endpoints managés, où AWS gère entièrement l'infrastructure GPU et la mise à l'échelle, et SageMaker HyperPod Inference, qui donne un contrôle natif Kubernetes sur des clusters GPU dédiés. Sept lancements concernent les endpoints managés, dont les recommandations d'inférence automatisées annoncées en avril 2026, la prise en charge de l'API compatible OpenAI, la mise en cache de conteneurs, l'observabilité renforcée et l'inférence asynchrone à charge utile intégrée. Six autres, comme l'opérateur simplifié, le cache KV hiérarchisé ou la séparation du préremplissage et du décodage, ciblent HyperPod. L'outil de recommandations, en particulier, remplace un processus qui prenait auparavant deux à trois semaines de tests manuels sur plus de mille combinaisons d'instances et de conteneurs: le client indique un modèle et un objectif (coût, latence ou débit), et SageMaker filtre les instances compatibles, applique des techniques comme le décodage spéculatif EAGLE 3.0, puis valide les performances via les outils de benchmark NVIDIA AIPerf. Sur le modèle GPT-OSS-20B, cette optimisation a permis de doubler le débit en tokens par seconde à latence de requête égale, sans coût supplémentaire pour les utilisateurs, y compris ceux disposant de réservations de capacité ML.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Ces annonces répondent à un problème très concret pour les entreprises qui déploient des grands modèles de langage: les poids peuvent peser des dizaines à centaines de gigaoctets, les temps de démarrage à froid s'étendent parfois sur plusieurs minutes, la capacité GPU reste rare, et les outils de supervision classiques ne mesurent pas les signaux propres à l'inférence générative comme le délai avant le premier token. En automatisant le choix d'instance et la configuration, et en facturant à l'instance plutôt qu'au token, SageMaker vise à réduire le temps de mise en production de plusieurs semaines à quelques heures, tout en abaissant les coûts d'exploitation pour les équipes qui n'ont pas d'expertise interne en optimisation de modèles. Le choix entre les deux offres permet aussi de couvrir des besoins très différents, des startups cherchant une mise en service rapide aux organisations exigeant un contrôle fin au niveau des nœuds, des frameworks ou des images machine pour des architectures multi-cloud.
Ce rythme de publication illustre la course des grands fournisseurs cloud, Amazon en tête face à Microsoft Azure et Google Cloud, pour équiper leurs plateformes d'outils spécifiques à l'inférence générative plutôt que de s'appuyer sur des infrastructures de calcul génériques. Amazon mise sur l'intégration entre entraînement et service via HyperPod et sur la compatibilité avec l'écosystème Kubernetes existant des entreprises pour se différencier des offres d'inférence facturées au token proposées par des fournisseurs de modèles spécialisés, tout en continuant d'ajouter des capacités tout au long de l'année.
Les entreprises européennes utilisant AWS pourraient bénéficier de ces optimisations de couts et de latence pour leurs déploiements d'IA générative, mais aucune entité ou réglementation française ou européenne n'est directement concernée.