OutilsAWS ML Blog2h

Des workflows guidés par agents pour accélérer la personnalisation de modèles dans Amazon SageMaker AI

Résumé IASource uniqueImpact UE

Amazon a lancé une expérience agentique intégrée dans SageMaker AI pour simplifier radicalement la personnalisation des modèles de langage. Jusqu'ici, adapter un modèle fondation à un cas d'usage métier exigeait de maîtriser des techniques comme le Supervised Fine-Tuning (SFT), le Direct Preference Optimization (DPO) ou le Reinforcement Learning Verifiable Rewards (RLVR), de naviguer entre des APIs fragmentées et des formats de données spécifiques à chaque modèle, et de gérer des cycles d'expérimentation qui s'étiraient sur plusieurs mois. Désormais, un développeur peut décrire son cas d'usage en langage naturel, et l'agent de codage prend en charge l'ensemble du parcours: définition du problème, préparation des données, sélection de la technique d'entraînement, évaluation de la qualité du modèle, puis déploiement vers Amazon Bedrock ou un endpoint SageMaker AI. Amazon Kiro, l'agent de développement logiciel d'Amazon, est préconfiguré par défaut dans l'environnement JupyterLab de SageMaker AI Studio, avec complétion de code, débogage assisté et support interactif. Les agents compatibles avec le protocole ACP (Agent Communication Protocol), dont Claude Code d'Anthropic, peuvent également être intégrés et bénéficier des mêmes fonctionnalités. La version 4.1 ou supérieure de SageMaker AI Distribution est requise, ainsi qu'un rôle IAM avec la politique gérée AmazonSageMakerFullAccess.

Le coeur du dispositif repose sur des "Skills", des modules d'instructions préconçus et modulaires qui encapsulent l'expertise AWS et data science sur l'ensemble du cycle de personnalisation. Lorsqu'un développeur décrit son besoin, l'agent active automatiquement les Skills pertinents, qui le guident à travers la validation des données, la configuration des hyperparamètres et l'évaluation du modèle via des métriques LLM-as-a-Judge. Chaque étape génère des notebooks directement exécutables, entièrement modifiables et réutilisables dans des workflows existants. Un avantage opérationnel concret: les Skills réduisent la consommation de tokens tout en augmentant la précision des réponses, car l'agent dispose d'un contexte spécialisé plutôt que de connaissances génériques. Les organisations peuvent personnaliser ces Skills pour les aligner sur leurs standards de gouvernance, leurs outils internes et leurs pratiques d'équipe, résolvant ainsi un problème récurrent avec les assistants de codage généralistes qui ne reproduisent pas de manière fiable les conventions maison.

L'annonce s'inscrit dans une dynamique plus large où la personnalisation des modèles devient le principal levier de différenciation concurrentielle, tous les acteurs ayant accès aux mêmes modèles fondations publics. Amazon positionne SageMaker AI comme une plateforme bout-en-bout pour les équipes qui veulent exploiter leurs données propriétaires sans assembler elles-mêmes une chaîne d'outils dispersés. La prise en charge du protocole ACP ouvre la voie à un écosystème d'agents tiers, signalant une stratégie d'interopérabilité plutôt que de verrouillage. Les prochaines étapes naturelles incluent l'extension de ce type d'expérience agentique à d'autres phases du cycle MLOps, comme la surveillance des modèles en production ou la gestion des dérives de données.

Impact France/UE

Les équipes data européennes utilisant AWS SageMaker AI peuvent accélérer leurs projets de fine-tuning de modèles fondation sans expertise MLOps avancée, réduisant les délais de personnalisation sur données propriétaires.

Dans nos dossiers

Anthropic Claude Code Agents IA

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1AWS ML Blog

Amazon SageMaker AI accélère les appels d'outils des agents autonomes avec la personnalisation de modèles sans serveur

Amazon a introduit une fonctionnalité de personnalisation de modèles sans serveur dans SageMaker AI, permettant aux équipes d'améliorer drastiquement les capacités d'appel d'outils des agents IA sans gérer d'infrastructure GPU. Dans un cas concret publié début avril 2026, des ingénieurs ont affiné le modèle Qwen 2.5 7B Instruct en utilisant la technique RLVR (Reinforcement Learning with Verifiable Rewards) et ont obtenu une amélioration de 57% du score de qualité des appels d'outils sur des scénarios inédits, c'est-à-dire des outils que le modèle n'avait jamais vus lors de l'entraînement. La méthode repose sur un principe simple : le modèle génère huit réponses candidates par prompt, une fonction de récompense vérifie lesquelles sont correctes, et l'algorithme GRPO (Group Relative Policy Optimization) renforce les comportements qui surpassent la moyenne du groupe. SageMaker AI prend en charge les familles de modèles Amazon Nova, Llama, Qwen et DeepSeek, avec un suivi des métriques via MLflow intégré. L'enjeu est concret : les agents IA en production échouent fréquemment lors des appels d'outils, qu'il s'agisse d'halluciner des fonctions inexistantes, de passer des paramètres incorrects, ou de déclencher une action là où ils devraient demander une clarification. Ces erreurs bloquent le déploiement en production et détruisent la confiance des utilisateurs. La nouvelle approche serverless d'Amazon supprime l'obstacle opérationnel majeur que représentait jusqu'ici le fine-tuning par renforcement : achat de GPU, orchestration mémoire entre les phases de rollout et d'entraînement, infrastructure de récompenses, gestion des checkpoints. Les équipes peuvent désormais se concentrer sur leurs données, leur modèle et leur fonction de récompense, le reste étant géré par la plateforme. Le fine-tuning supervisé classique (SFT) montre ses limites pour ce type de tâche : il nécessite des exemples étiquetés pour chaque comportement souhaité, mais peine à généraliser la prise de décision entre appeler un outil, demander des informations supplémentaires, ou refuser d'agir. RLVR contourne ce problème en exploitant la nature vérifiable des appels d'outils : soit le modèle a appelé la bonne fonction avec les bons paramètres, soit non. Cette objectivité binaire rend l'appel d'outils particulièrement adapté à l'apprentissage par renforcement. Amazon positionne cette offre dans un marché de l'IA agentique en forte croissance, où des acteurs comme Google (Vertex AI), Microsoft (Azure ML) et des startups spécialisées se disputent les équipes qui cherchent à industrialiser des agents fiables, avec un accès simplifié via SageMaker Studio et un compte AWS standard.

OutilsActu

1 source

2AWS ML Blog

Créer des agents Strands avec les modèles SageMaker AI et MLflow

Amazon Web Services a publié un guide technique détaillant la construction d'agents d'intelligence artificielle en combinant trois de ses outils : le SDK open source Strands Agents, les endpoints de modèles Amazon SageMaker AI, et la plateforme d'observabilité MLflow hébergée sur SageMaker Serverless. Le SDK Strands, à approche pilotée par le modèle, permet de créer un agent fonctionnel en quelques lignes de code en associant un modèle de langage, un prompt système et un ensemble d'outils. Les modèles sont déployés via SageMaker JumpStart, un hub machine learning qui permet d'évaluer et de sélectionner rapidement des modèles de fondation selon des critères de qualité et de responsabilité prédéfinis. L'intégration de MLflow permet ensuite de tracer les appels d'agents, de versionner les modèles et d'implémenter des tests A/B entre plusieurs variantes de modèles pour en évaluer les performances à l'aide de métriques objectives. Cette architecture répond à un besoin concret des grandes entreprises qui ne peuvent pas se contenter des services de modèles entièrement gérés : contrôle précis sur les instances de calcul, politiques de mise à l'échelle, configuration réseau compatible avec les architectures de sécurité existantes, et conformité en matière de résidence des données. Là où Amazon Bedrock simplifie l'accès aux modèles de fondation en masquant l'infrastructure, SageMaker AI laisse à l'organisation la maîtrise de l'endroit et de la manière dont l'inférence se produit, ce qui est décisif pour les secteurs réglementés comme la finance ou la santé. La couche MLflow ajoute une dimension industrielle : les équipes peuvent comparer les performances de différents modèles dans des conditions réelles, réduire les coûts en sélectionnant le modèle le plus efficace pour chaque tâche, et maintenir un historique d'expériences exploitable dans le temps. La publication de ce guide s'inscrit dans une course plus large pour capter les déploiements d'agents IA en production. AWS répond ainsi à la demande croissante des équipes MLOps qui veulent bénéficier de la commodité du cloud tout en conservant une maîtrise fine de l'infrastructure, une position souvent impossible avec les APIs gérées de type Bedrock ou OpenAI. Strands Agents, rendu open source par Amazon, concurrence directement des frameworks comme LangChain ou CrewAI, avec l'avantage d'une intégration native dans l'écosystème AWS. L'accent mis sur les tests A/B et l'évaluation continue des agents signale que le secteur entre dans une phase de maturité : il ne s'agit plus seulement de faire fonctionner un agent, mais de le mesurer, le comparer, et l'améliorer de façon systématique en production.

UECette architecture de déploiement d'agents avec contrôle fin sur la résidence des données répond aux exigences du RGPD, la rendant pertinente pour les secteurs réglementés européens comme la finance et la santé.

OutilsOutil

1 source

3AWS ML Blog

Amazon Nova Act accélère la livraison logicielle grâce à l'automatisation des tests par agents

Amazon a lancé Nova Act, un service AWS conçu pour automatiser les tests d'assurance qualité (QA) dans les pipelines de livraison logicielle. Contrairement aux frameworks traditionnels qui s'appuient sur des sélecteurs CSS, des identifiants d'éléments ou des références structurelles pour naviguer dans les interfaces, Nova Act utilise un modèle de compréhension visuelle et le langage naturel — exactement comme le ferait un utilisateur humain. La solution s'accompagne de QA Studio, une interface de référence incluant un frontend web, une API et une CLI, construite sur une infrastructure serverless AWS. Les équipes peuvent y créer des suites de tests via un assistant de parcours utilisateur, déclencher des exécutions à la demande, les planifier ou les intégrer directement dans leurs pipelines CI/CD. L'ensemble s'appuie sur Amazon Bedrock AgentCore Browser pour la prévisualisation en direct et AWS Secrets Manager pour la saisie sécurisée des données sensibles. L'enjeu est considérable pour les équipes produit et engineering. Dans les organisations actuelles, les critères d'acceptance sont définis par les product managers en langage métier, implémentés par les développeurs, puis retranscrits en code d'automatisation — souvent par ces mêmes développeurs. Ce fossé entre ceux qui comprennent les besoins utilisateurs et ceux qui maintiennent les tests crée une dette technique permanente : chaque refactoring d'interface ou ajustement de layout casse des dizaines de tests, même quand les fonctionnalités restent intactes. Nova Act supprime ce goulot d'étranglement en permettant à n'importe quel membre de l'équipe — y compris des non-développeurs — de rédiger et maintenir des tests en langage naturel. Quand un designer déplace un bouton ou qu'un développeur restructure un composant React, les tests s'adaptent automatiquement sans intervention manuelle. Cette annonce s'inscrit dans une course plus large des grands fournisseurs cloud à proposer des agents capables d'interagir avec des interfaces graphiques. OpenAI avec Operator, Anthropic avec Computer Use, et désormais AWS avec Nova Act ciblent tous le même marché : remplacer les scripts d'automatisation fragiles par des agents visuels autonomes. Pour AWS, l'intégration native dans l'écosystème Bedrock et les services managés représente un avantage compétitif face aux solutions standalone. Le marché du test logiciel automatisé pèse plusieurs milliards de dollars et souffre d'un taux d'échec élevé des projets d'automatisation traditionnels — souvent abandonnés après quelques mois faute de ressources pour maintenir les scripts. Si Nova Act tient ses promesses de résilience aux changements UI, il pourrait redistribuer significativement les cartes dans ce secteur et accélérer l'adoption de l'approche "shift-left" où les tests sont écrits dès la définition des exigences.

UELes équipes engineering européennes utilisant AWS peuvent intégrer Nova Act dans leurs pipelines CI/CD, mais aucun impact réglementaire ou institutionnel direct sur la France ou l'UE.

OutilsOutil

1 source

4AWS ML Blog

Créer des fonctions de récompense efficaces avec AWS Lambda pour personnaliser Amazon Nova

Amazon Web Services propose une méthode concrète pour personnaliser ses modèles de langage Amazon Nova grâce à AWS Lambda comme moteur d'évaluation. L'approche repose sur le Reinforcement Fine-tuning (RFT), une technique d'apprentissage par renforcement qui se distingue du traditionnel Supervised Fine-tuning (SFT) : là où le SFT exige des milliers d'exemples annotés avec des raisonnements détaillés, le RFT apprend à partir de signaux d'évaluation appliqués aux réponses finales du modèle. Concrètement, une fonction Lambda reçoit les réponses générées par Nova lors de l'entraînement, les évalue selon plusieurs critères (exactitude, sécurité, formatage, concision) et retourne un score numérique, généralement compris entre -1 et 1. Les scores élevés renforcent les comportements positifs ; les scores faibles les découragent. Ce cycle se répète des milliers de fois pour affiner progressivement le modèle, avec Amazon CloudWatch qui surveille la distribution des scores en temps réel. L'intérêt de cette architecture est double, technique et économique. Sur le plan technique, elle permet de définir des systèmes de récompense multi-dimensionnels qui capturent des critères de qualité nuancés, réduisant ainsi le risque de "reward hacking", ces situations où un modèle exploite des raccourcis pour maximiser son score sans réellement progresser sur les objectifs visés. Un cas typique serait une réponse de service client qui doit simultanément être précise, empathique, concise et conforme à l'identité de la marque : autant de critères difficiles à couvrir avec des exemples annotés. Sur le plan économique, Lambda s'adapte automatiquement à la charge d'entraînement sans qu'une équipe ait à gérer une infrastructure dédiée, rendant la personnalisation de modèles fondamentaux accessible à des développeurs sans expertise approfondie en machine learning. Cette publication s'inscrit dans une concurrence intense entre les grands fournisseurs cloud pour démocratiser la personnalisation des grands modèles de langage. Google, Microsoft et AWS se disputent les entreprises qui souhaitent adapter des modèles fondamentaux à leurs cas d'usage métier sans repartir de zéro. Amazon Nova, lancé fin 2024, représente l'offensive d'AWS sur ce marché avec une gamme de modèles positionnés sur le rapport performance/coût. En proposant une intégration native entre RFT, Lambda et CloudWatch, AWS cherche à réduire la friction technique qui freine encore l'adoption en entreprise. Deux variantes coexistent selon les besoins : RLVR (Reinforcement Learning via Verifiable Rewards) pour les tâches à réponses objectivement vérifiables comme du code ou des calculs, et RLAIF (Reinforcement Learning via AI Feedback) pour des évaluations plus subjectives. Les prochaines étapes logiques seront l'extension de ces outils à d'autres modèles Nova et une intégration plus poussée avec les pipelines MLOps existants sur AWS.

OutilsOutil

1 source