Déployer des modèles Hugging Face sur Amazon SageMaker AI avec des agents de codage
AWS a publié une méthode pour déployer des modèles Hugging Face sur Amazon SageMaker AI à l'aide d'agents de codage comme Kiro et Claude Code, combinés à six compétences open source diffusées par Hugging Face Skills. Pour tester l'intérêt de ces compétences, les équipes ont demandé à Kiro, avec Auto ou Claude Fable 5, et à Claude Code, avec Opus 4.8, de déployer le petit modèle Qwen3-0.6B sur un point de terminaison temps réel. Sans les compétences installées, les deux agents ont choisi le conteneur Text Generation Inference, une version trop ancienne pour l'architecture de Qwen3, ce qui a fait échouer le contrôle de santé de l'endpoint et provoqué plusieurs redéploiements ratés, chacun facturant du temps GPU, avant un basculement vers vLLM. Un second test sur un modèle multimodal de diffusion à mixture d'experts, sorti quelques semaines plus tôt, a échoué plus silencieusement encore, sans erreur explicite. Une fois les six compétences installées, en Python et via l'AWS CLI, les mêmes agents choisissent vLLM d'emblée, récupèrent l'image de conteneur correcte dans le catalogue AWS Deep Learning Containers, configurent l'autoscaling et des alarmes CloudWatch, et vérifient la suppression complète du point de terminaison.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette différence est concrète : un agent non guidé peut produire des déploiements fragiles, coûteux ou silencieusement défaillants, chaque tentative avortée facturant des heures de GPU. Le problème s'aggrave avec les modèles récents, dont les exigences de déploiement, par exemple le besoin de vLLM plutôt que de TGI pour les derniers modèles Qwen, ne figurent pas encore dans les données d'entraînement des agents. Selon les auteurs, ces échecs viennent d'un manque de connaissances à jour, pas d'un défaut de raisonnement : l'agent planifie et débogue correctement, mais ignore des faits opérationnels qui évoluent plus vite que les modèles eux-mêmes. En encodant ce savoir dans des fichiers de compétences éditables, AWS et Hugging Face transforment des décisions manuelles, disparates, en un processus reproductible de quelques heures.
Cette initiative reflète une tendance plus large en MLOps : documenter explicitement les bonnes pratiques opérationnelles pour les agents de codage plutôt que de compter sur la mémoire d'un grand modèle de langage, dont la date de coupure exclut forcément les architectures les plus récentes. Les acteurs impliqués sont AWS, via SageMaker AI et son catalogue AWS Deep Learning Containers, Hugging Face avec sa bibliothèque Hugging Face Skills, et les agents Kiro et Claude Code, appuyés respectivement sur les modèles Claude Fable 5 et Claude Opus 4.8 d'Anthropic. Les compétences couvrent aussi la mise à l'échelle vers zéro, l'inférence serverless ou asynchrone, la transformation par lots et l'import vers Amazon Bedrock, et devraient s'étendre à mesure que les moteurs d'inférence évoluent plus vite que les modèles.
Les équipes techniques européennes utilisant Amazon SageMaker et les modèles Hugging Face peuvent adopter ces compétences pour fiabiliser leurs déploiements, sans impact réglementaire spécifique a la France ou l'UE.