Aller au contenu principal
Metis d'Alibaba réduit les appels d'outils IA redondants de 98 % à 2 %, avec une meilleure précision
RechercheVentureBeat AI · 2 min de lecture

Metis d'Alibaba réduit les appels d'outils IA redondants de 98 % à 2 %, avec une meilleure précision

Source originale ↗·

Des chercheurs d'Alibaba ont publié un cadre d'apprentissage par renforcement appelé HDPO (Hierarchical Decoupled Policy Optimization), conçu pour entraîner des agents IA à mieux décider quand utiliser des outils externes et quand s'appuyer sur leurs propres connaissances. Appliqué à leur modèle multimodal Metis, ce framework réduit les appels d'outils redondants de 98 % à seulement 2 %, tout en améliorant la précision sur les benchmarks de référence du secteur. L'enjeu est concret : les agents IA actuels ont tendance à invoquer systématiquement des utilitaires externes comme la recherche web ou l'exécution de code, même lorsque la question posée ne le nécessite pas. Chaque appel inutile crée un goulet d'étranglement de traitement séquentiel, alourdit les coûts d'API et injecte du bruit dans le contexte du modèle, ce qui dégrade la qualité du raisonnement final.

Ce problème touche directement les entreprises qui déploient des agents IA en production : des systèmes techniquement capables deviennent lents et coûteux à opérer, sans que cela se traduise par de meilleures réponses. Les approches précédentes tentaient de corriger ce comportement en combinant précision et efficacité dans un seul signal de récompense, mais cette conception créait un dilemme d'optimisation insoluble. Une pénalité trop forte sur l'usage des outils rend le modèle trop conservateur et nuit à sa précision sur les tâches complexes, tandis qu'une pénalité trop faible ne change rien au comportement. Pire, ce signal mélangé crée une ambiguïté sémantique : une réponse incorrecte sans aucun appel d'outil pouvait obtenir la même récompense qu'une réponse correcte avec un usage excessif.

HDPO résout ce paradoxe en séparant les deux objectifs dans des canaux d'optimisation indépendants. Le canal de précision maximise la justesse des réponses sur l'ensemble des rollouts, tandis que le canal d'efficacité minimise les appels superflus. Les deux signaux ne sont combinés qu'à la dernière étape du calcul de la perte, et surtout, l'efficacité reste conditionnelle à la précision : une réponse incorrecte n'est jamais récompensée simplement parce qu'elle a été rapide ou économe en appels. Cette décorrélation offre au modèle des gradients d'apprentissage propres pour chaque objectif, sans interférence. Alibaba s'inscrit dans une course intense au développement d'agents IA fiables et économiques, où la maîtrise du coût opérationnel est devenue aussi stratégique que la performance brute. HDPO représente une avancée méthodologique qui pourrait influencer la façon dont l'ensemble de l'industrie entraîne ses agents à instrumenter le monde extérieur avec discernement plutôt qu'automatisme.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Nouveau framework IA d'Alibaba : évite de charger tous les outils, réduit l'usage de tokens de 99%
1VentureBeat AI 

Nouveau framework IA d'Alibaba : évite de charger tous les outils, réduit l'usage de tokens de 99%

Des chercheurs d'Alibaba ont développé SkillWeaver, un framework conçu pour résoudre le problème du routage d'outils dans les systèmes d'IA d'entreprise, où un agent peut disposer de centaines de compétences différentes et se retrouver incapable de choisir la bonne à chaque étape d'une tâche. Le système construit un graphe d'exécution pour chaque requête complexe et sélectionne les compétences adaptées à chaque nœud, via trois étapes baptisées Decompose, Retrieve et Compose. Les chercheurs y associent une technique appelée Skill-Aware Decomposition (SAD), qui utilise une boucle de rétroaction permettant à l'agent de récupérer et de vérifier itérativement les outils candidats, au lieu de les choisir en une seule fois comme le font la plupart des frameworks concurrents. Dans leurs expériences, cette approche de récupération et de routage a permis de réduire la consommation de tokens de plus de 99% par rapport à une méthode naïve exposant l'agent à l'intégralité de la bibliothèque d'outils, tout en améliorant sensiblement la précision des résultats. Pour les équipes qui construisent des agents IA en entreprise, l'enjeu est concret : exposer un LLM à une bibliothèque d'outils entière consomme rapidement des centaines de milliers de tokens et sature les limites de contexte, ce qui rend les architectures actuelles difficiles à faire passer à l'échelle. C'est particulièrement critique pour les écosystèmes construits autour du Model Context Protocol (MCP), où des agents orchestrent de façon autonome de multiples outils pour exécuter des opérations métier en plusieurs étapes, comme télécharger un jeu de données, le transformer, puis générer des rapports visuels. Selon les auteurs, le principal enseignement pour les praticiens est que la granularité du découpage des tâches constitue le véritable goulot d'étranglement pour une récupération d'outils précise, plus que la taille de la bibliothèque elle-même. Ce travail répond à une limite structurelle des approches existantes, qu'il s'agisse de récupération par API, de correspondance documentaire ou de structures hiérarchiques : elles traitent le routage comme un problème de sélection d'une seule compétence par étape, alors que les requêtes réelles sont par nature compositionnelles. Une demande classique comme "télécharger le jeu de données, le transformer et créer des rapports visuels" ne peut être satisfaite par un seul outil ; elle nécessite de décomposer la tâche, puis d'enchaîner un client API, un processeur de données et un outil de visualisation dans un plan cohérent. SkillWeaver formalise cette étape finale sous la forme d'un graphe orienté acyclique (DAG), qui cartographie les dépendances entre sous-tâches et permet, lorsque c'est possible, une exécution en parallèle des étapes indépendantes.

💬 99% de tokens en moins, ça sent le chiffre marketing calibré pour le titre. Le vrai enseignement est ailleurs : c'est la granularité du découpage des tâches qui bloque le routage d'outils, pas la taille de la bibliothèque, ce qui inverse pas mal d'hypothèses des équipes qui bricolent leurs agents MCP en ce moment. Bonne nouvelle sur le papier, mais reste à voir si ça tient avec des centaines d'outils réels en prod et pas juste sur un benchmark maison.

RecherchePaper
1 source
Reinforced Agent : retour d'information à l'inférence pour les agents à appel d'outils
2Apple Machine Learning 

Reinforced Agent : retour d'information à l'inférence pour les agents à appel d'outils

Des chercheurs ont publié une étude acceptée au cinquième atelier sur la génération, l'évaluation et les métriques du langage naturel, dans le cadre de la conférence ACL 2026, portant sur une nouvelle approche appelée Reinforced Agent. Leur travail s'attaque à un problème précis : les agents LLM capables d'appeler des outils externes (API, bases de données, fonctions) sont habituellement évalués sur trois critères, le choix du bon outil, la précision des paramètres transmis, et la reconnaissance du périmètre d'action. Or, ces évaluations interviennent systématiquement après l'exécution, une fois l'erreur déjà commise. L'équipe propose d'intégrer un agent évaluateur spécialisé directement dans la boucle d'exécution, au moment même de l'inférence, pour corriger le tir en temps réel. L'enjeu est considérable pour les systèmes d'agents autonomes en production. Lorsqu'un agent commet une erreur de sélection d'outil ou transmet de mauvais paramètres, les méthodes actuelles ne peuvent que constater le problème après coup, puis corriger via du prompt engineering ou du réentraînement, deux processus lents et coûteux. Un retour d'information en temps réel permettrait de réduire drastiquement les erreurs en cascade, particulièrement critiques dans des environnements où chaque appel d'outil a des effets concrets, comme la modification de données ou le déclenchement de transactions. Cette recherche s'inscrit dans une tendance forte de l'IA en 2025-2026 : faire passer les agents d'une logique réactive à une logique corrective en cours d'exécution. Des acteurs comme Anthropic, OpenAI et Google investissent massivement dans l'architecture multi-agents, où la supervision entre agents devient un levier clé de fiabilité. L'approche Reinforced Agent ouvre la voie à des systèmes capables d'auto-audit dynamique, une brique essentielle pour déployer des agents dans des environnements critiques et à haute responsabilité.

RecherchePaper
1 source
Alibaba renforce son IA médicale avec un nouvel outil de détection précoce du cancer colorectal
3SCMP Tech 

Alibaba renforce son IA médicale avec un nouvel outil de détection précoce du cancer colorectal

Alibaba Group a dévoilé mardi un nouveau modèle d'intelligence artificielle baptisé Coca, développé par son laboratoire de recherche Damo Academy, capable de détecter les cancers colorectaux à un stade précoce à partir de scanners CT sans contraste. Testé sur plus de 27 000 examens, le modèle a permis d'identifier cinq cas de cancer colorectal qui avaient été manqués par des radiologistes humains, affichant ainsi une sensibilité supérieure à celle des spécialistes pour cette tâche précise. Cette avancée représente un enjeu médical considérable : le cancer colorectal est l'un des cancers les plus meurtriers au monde, et son pronostic s'améliore drastiquement lorsqu'il est détecté tôt. Un outil capable de réduire les faux négatifs dans l'analyse de scanners de routine pourrait alléger la charge cognitive des radiologistes, accélérer les diagnostics et potentiellement sauver des vies, notamment dans les systèmes de santé où le volume d'examens dépasse la capacité humaine disponible. Alibaba s'inscrit avec Coca dans une stratégie plus large de déploiement de l'IA médicale, un secteur où les géants technologiques chinois investissent massivement pour rivaliser avec des acteurs comme Google Health ou Microsoft. La Chine fait face à une pression démographique et sanitaire croissante, avec des taux de cancer colorectal en hausse, ce qui rend ces outils particulièrement stratégiques. Coca s'appuie sur les scanners CT non contrastés, des examens courants et moins coûteux que leurs homologues avec produit de contraste, ce qui élargit son potentiel de déploiement à grande échelle dans des contextes hospitaliers variés.

RecherchePaper
1 source
L'ajustement fin du RAG peut réduire silencieusement la précision de récupération de 40 %, mettant les pipelines à base d'agents en danger
4VentureBeat AI 

L'ajustement fin du RAG peut réduire silencieusement la précision de récupération de 40 %, mettant les pipelines à base d'agents en danger

Des chercheurs de Redis ont publié une étude révélant qu'affiner les modèles d'embeddings pour améliorer la précision d'un système RAG peut réduire silencieusement la qualité de récupération générale jusqu'à 40 %. Le papier, intitulé "Training for Compositional Sensitivity Reduces Dense Retrieval Generalization", a été conduit par Srijith Rajamohan, responsable de la recherche en IA chez Redis, et ses coauteurs. L'équipe a testé ce qui se produit lorsqu'on entraîne un modèle d'embedding à détecter des phrases quasi-identiques mais de sens opposé, par exemple une négation qui inverse complètement la signification d'une phrase. Résultat : cette sensibilité compositionnelle améliore effectivement la précision ciblée, mais détruit la capacité du modèle à récupérer correctement des documents sur des sujets variés qu'il n'a pas appris à traiter spécifiquement. La dégradation atteint 8 à 9 % sur les petits modèles, et jusqu'à 40 % sur un modèle d'embedding de taille intermédiaire actuellement utilisé en production dans de nombreuses entreprises. Les conséquences sont particulièrement sévères pour les pipelines agentiques, où une erreur de récupération ne renvoie pas seulement une mauvaise réponse mais déclenche une cascade d'actions incorrectes en aval. Rajamohan résume le problème central : une forte similarité sémantique ne garantit pas une correspondance exacte d'intention. Les modèles d'embeddings compressent une phrase entière en un seul point dans un espace vectoriel à haute dimension, ce qui fonctionne bien pour la correspondance thématique large, mais échoue quand deux phrases aux mots presque identiques ont des significations opposées. En affinant le modèle pour éloigner ces phrases structurellement différentes, on lui retire l'espace vectoriel qu'il utilisait pour la récupération générale. Les deux objectifs se disputent les mêmes dimensions. L'étude note également que certaines erreurs, notamment les confusions de liaisons grammaticales (quel modificateur s'applique à quel mot dans un contrat, par exemple), ne s'améliorent presque pas avec cet entraînement ciblé, précisément là où une erreur coûte le plus cher. Ce qui rend le problème difficile à diagnostiquer, c'est que les métriques d'évaluation mesurent uniquement la tâche entraînée, pas la régression sur la récupération générale. Elle n'apparaît qu'en production. Les solutions habituelles, comme la recherche hybride combinant embeddings et mots-clés, ou le passage à un modèle plus grand, ne règlent pas le problème architectural sous-jacent. Rajamohan est explicite : "On ne peut pas s'en sortir par la taille." La recherche suggère que les équipes enterprise doivent choisir explicitement entre précision compositionnelle et généralisation large, plutôt que d'optimiser pour l'une en ignorant l'impact sur l'autre. L'enjeu dépasse le seul RAG classique, car les architectures agentiques qui prolifèrent en 2025 et 2026 amplifient chaque erreur de récupération en décision opérationnelle.

UELes entreprises européennes déployant des pipelines RAG agentiques en production sont exposées à ce risque de dégradation silencieuse et doivent revoir leur stratégie d'évaluation des embeddings.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic