Amazon lance SageMaker HyperPod Inference Gateway
Amazon a présenté SageMaker HyperPod Inference Gateway, un nouveau composant Kubernetes conçu pour optimiser le routage des requêtes vers les modèles de langage déployés sur des clusters GPU. Ce système s'installe comme un addon managé unique sur Amazon EKS, au-dessus de l'infrastructure HyperPod existante, sans nécessiter de modification du code applicatif ni des serveurs de modèles. Selon AWS, il permet de réduire la latence du premier token de jusqu'à 82 %, avec un exemple cité où un utilisateur de chatbot attendant auparavant 4,4 secondes voit désormais sa réponse commencer en moins de 800 millisecondes. L'architecture repose sur deux niveaux: un premier niveau, disponible dès maintenant sous le nom d'addon amazon-sagemaker-hyperpod-inférence (version v2.0.0-eksbuild.1), combine trois composants open source issus du projet Gateway API Inference Extension, à savoir Envoy Gateway pour terminer le trafic HTTPS, un Body-Based Router qui identifie le modèle demandé dans chaque requête compatible OpenAI, et un Endpoint Picker qui choisit le pod le mieux adapté en analysant en temps réel des métriques Prometheus comme le taux d'utilisation du cache KV, la profondeur des files d'attente ou la présence d'adaptateurs LoRA déjà chargés en mémoire. Un second niveau, appelé Global Inference Router et prévu prochainement, doit ajouter une coordination multi-cluster et multi-région avec bascule automatique, limitation globale du débit et arbitrage des coûts.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette annonce répond à un problème économique concret pour les entreprises qui exploitent des LLM à grande échelle: les équilibreurs de charge Kubernetes classiques, fondés sur des algorithmes round-robin ou least-connections, ignorent totalement l'état interne des GPU. Résultat, des requêtes s'accumulent derrière des pods déjà saturés pendant que d'autres capacités restent inutilisées, ce qui provoque des pics de latence lors des montées de trafic et oblige les entreprises à surprovisionner leur parc GPU, ressource particulièrement coûteuse, pour compenser cette inefficacité. En rendant le routage sensible à l'état réel des GPU, HyperPod Inference Gateway promet une utilisation plus homogène et prévisible des ressources, donc une réduction des dépenses d'infrastructure sans sacrifier l'expérience utilisateur, un enjeu central pour toute application conversationnelle ou générative soumise à des exigences de réactivité.
Ce lancement s'inscrit dans la stratégie plus large d'AWS visant à simplifier l'exploitation d'infrastructures d'inférence à grande échelle, un domaine où la concurrence entre fournisseurs cloud s'intensifie à mesure que les entreprises déploient des modèles génératifs en production. En s'appuyant sur des standards ouverts comme le Gateway API Inference Extension plutôt que sur une solution propriétaire fermée, AWS cherche aussi à faciliter l'adoption par les équipes déjà familières de l'écosystème Kubernetes. L'arrivée annoncée du Global Inference Router, avec ses capacités de bascule inter-cluster et d'arbitrage des coûts, laisse entrevoir une extension progressive de l'offre vers une gestion d'inférence véritablement distribuée à l'échelle mondiale, un axe que d'autres acteurs du cloud et de l'orchestration GPU devraient probablement chercher à développer à leur tour.
Pas d'impact direct sur la France/UE