Aller au contenu principal
OutilsMicrosoft Research · 2 min de lecture

Orchard : un framework open source pour l'IA à base d'agents à grande échelle

Source originale ↗·

Microsoft a dévoilé Orchard, un framework open source destiné à la recherche sur l'IA agentique à grande échelle et à moindre coût. Son composant central, Orchard Env, est un service d'environnement réutilisable, bâti sur Kubernetes, capable de créer, gérer et supprimer des milliers de composants isolés en parallèle pour entraîner et évaluer des agents. Cette même infrastructure prend en charge des agents dédiés au développement logiciel, à la navigation web et à l'assistance personnelle, et permet de les entraîner directement dans de véritables environnements de déploiement comme Codex, OpenClaw et ZeroClaw. Pour illustrer cette approche, Microsoft publie trois recettes d'entraînement spécialisées, Orchard-SWE, Orchard-GUI et Orchard-Claw, accompagnées des données d'entraînement et des méthodes d'évaluation utilisées pour les construire. Le résultat le plus marquant vient d'Orchard-SWE, qui atteint 69,7% sur le benchmark SWE-bench Verified, un score qui grimpe à 73% grâce à un reclassement par modèle de valeur, avec seulement environ 3 milliards de paramètres actifs, se rapprochant ainsi de systèmes de pointe utilisant des modèles plus de dix fois plus volumineux.

Cette annonce répond à un obstacle bien connu de la recherche en IA agentique: construire des systèmes à l'état de l'art exige généralement une infrastructure propriétaire, des bacs à sable sur mesure, des pipelines d'entraînement fermés et des jeux de données inaccessibles à la majorité des chercheurs. En rendant Orchard Env indépendant de tout framework d'entraînement spécifique et compatible avec plusieurs types de tâches sans modification, Microsoft entend démocratiser l'accès à ces outils. Les équipes de recherche peuvent ainsi introduire de nouveaux benchmarks, agents ou algorithmes d'entraînement sans reconstruire leur infrastructure depuis zéro, ce qui pourrait accélérer considérablement les progrès collectifs dans un domaine jusqu'ici dominé par quelques acteurs disposant de ressources massives.

Le contexte plus large est celui d'une bascule rapide de l'IA, qui passe de simples systèmes de questions-réponses statiques à des agents autonomes capables de planifier, raisonner et agir dans des environnements complexes et multi-étapes, que ce soit pour corriger des bugs dans du code, naviguer sur le web pour un utilisateur ou gérer des calendriers et des e-mails. Un défi technique majeur reste que les agents les plus performants fonctionnent rarement comme de simples modèles isolés: ils s'appuient sur des harnais sophistiqués tels que Claude Code, Codex ou OpenClaw, qui gèrent le raisonnement multi-tours, l'usage d'outils et les connexions à des systèmes externes, un niveau de complexité que les outils d'entraînement ouverts peinent habituellement à prendre en charge.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Vercel lance Eve, un framework open source pour créer des agents IA
1InfoQ AI 

Vercel lance Eve, un framework open source pour créer des agents IA

Vercel a lancé Eve, un framework open-source conçu pour construire, déployer et opérer des agents IA en production. Présenté par la plateforme américaine spécialisée dans le déploiement frontend, Eve repose sur une structure de projet basée sur le système de fichiers pour organiser les différents composants d'un agent : instructions, outils, compétences, sous-agents, canaux de communication et tâches planifiées. Les développeurs peuvent ainsi définir le comportement de leurs agents de manière déclarative, sans avoir à écrire l'intégralité de la plomberie technique sous-jacente. L'enjeu est significatif pour les équipes d'ingénierie qui peinent à passer de la phase de prototype à la mise en production d'agents IA fiables. En standardisant la structure d'un projet agentique, Eve réduit la quantité d'infrastructure à implémenter manuellement, un frein majeur à l'adoption en entreprise. Pour Vercel, cela représente aussi un moyen naturel d'ancrer l'exécution des agents sur sa propre plateforme cloud, transformant un outil open-source en point d'entrée vers ses services commerciaux. La sortie d'Eve s'inscrit dans une course effrénée entre fournisseurs d'infrastructure pour capter les workloads IA. Des acteurs comme AWS, Google Cloud et des startups spécialisées comme LangChain ou CrewAI proposent déjà des solutions concurrentes pour orchestrer des agents. Vercel, dont la réputation s'est construite sur la simplicité de déploiement pour les applications Next.js, tente de répliquer cette expérience développeur dans l'univers des agents autonomes, un marché en pleine structuration où la facilité d'usage restera un avantage décisif.

UELes équipes de développement européennes peuvent adopter Eve pour accélérer la mise en production d'agents IA, mais l'exécution reste ancrée sur l'infrastructure cloud américaine de Vercel.

OutilsOutil
1 source
2AWS ML Blog 

Simulateur d'outils : tests à grande échelle pour agents IA

Amazon Web Services a lancé ToolSimulator, un framework de simulation d'outils propulsé par des LLM, intégré au SDK Strands Evals. Disponible dès maintenant, cet outil permet aux développeurs de tester en profondeur les agents IA qui dépendent d'API externes, de bases de données ou de services MCP, sans jamais déclencher d'appels réels. Concrètement, un développeur qui teste un agent de réservation de vols peut simuler des recherches, des confirmations et des annulations avec des données réalistes et cohérentes, sans envoyer de vraie requête à une compagnie aérienne. L'installation se résume à une commande pip install strands-evals, et aucun compte AWS n'est requis pour exécuter les simulations localement. L'enjeu est considérable pour les équipes qui industrialisent des agents IA. Tester contre des API en production expose des données personnelles, risque de déclencher des actions irréversibles comme l'envoi d'e-mails ou la modification de bases de données, et se heurte aux limites de débit qui rendent impraticable le passage à l'échelle sur des centaines de scénarios de test. Les mocks statiques, l'alternative habituelle, s'avèrent insuffisants dès qu'un agent enchaîne plusieurs appels dont le deuxième dépend de l'état laissé par le premier. ToolSimulator résout ce problème en maintenant un état partagé cohérent entre les appels successifs : une écriture affecte les lectures suivantes, exactement comme dans un système réel. Les schémas de réponse peuvent être imposés via des modèles Pydantic, ce qui garantit la validité structurelle des sorties simulées et permet de détecter les bugs d'intégration tôt dans le cycle de développement. Ce lancement s'inscrit dans la montée en maturité de l'outillage autour des agents IA autonomes, un segment en pleine explosion depuis l'essor des modèles capables d'utiliser des outils externes. AWS positionne Strands Evals comme une réponse aux besoins des équipes qui passent du prototype à la production : l'absence de cadre de test robuste est aujourd'hui l'un des principaux freins à ce passage. ToolSimulator rejoint un écosystème d'évaluation d'agents qui comprend déjà des solutions comme LangSmith d'Anthropic ou les environnements de sandbox d'OpenAI, mais mise sur l'intégration native avec le SDK Strands et la génération adaptative de réponses par LLM plutôt que sur des templates figés. La prochaine étape naturelle sera d'étendre ces capacités aux workflows MCP complexes et aux agents multi-modaux, à mesure que les cas d'usage en production se diversifient.

OutilsOutil
1 source
L'approche open-source d'OpenSeeker vise à briser le monopole des données pour les agents de recherche IA
3The Decoder 

L'approche open-source d'OpenSeeker vise à briser le monopole des données pour les agents de recherche IA

OpenSeeker s'impose comme une alternative crédible aux agents de recherche IA propriétaires, en démontrant qu'il est possible d'atteindre des performances compétitives avec des ressources drastiquement réduites. Entraîné sur seulement 11 700 points de données en une seule passe d'entraînement, ce modèle open-source rivalise avec des solutions développées par des géants comme Alibaba. L'enjeu dépasse la simple performance technique : le secteur des agents de recherche IA souffre d'une concentration des données d'entraînement entre les mains d'un nombre restreint d'acteurs disposant de ressources massives. En rendant publics ses données, son code et son modèle, OpenSeeker remet en question ce monopole de fait et ouvre la voie à une recherche reproductible et accessible à la communauté scientifique. Le fait marquant reste l'efficacité remarquable obtenue avec 11 700 exemples d'entraînement seulement, un chiffre infime comparé aux ensembles de données massifs habituellement requis pour ce type de système, tout en ne nécessitant qu'une seule exécution d'entraînement. Cette sobriété méthodologique contraste fortement avec les approches dominantes et suggère que la qualité des données prime sur leur quantité brute. Cette publication s'inscrit dans une tendance plus large de démocratisation des agents IA capables de recherche autonome, un domaine jusqu'ici dominé par des laboratoires disposant de budgets considérables. Si ces résultats se confirment à plus grande échelle, OpenSeeker pourrait devenir une référence de base pour les équipes souhaitant développer des agents de recherche sans dépendance aux pipelines de données propriétaires.

OutilsPaper
1 source
Vercel lance Eve, un framework open-source d'agents IA où chaque agent correspond à un répertoire de fichiers
4MarkTechPost 

Vercel lance Eve, un framework open-source d'agents IA où chaque agent correspond à un répertoire de fichiers

Vercel a publié eve, un framework open source sous licence Apache-2.0, disponible en tant que package npm, destiné à la création, l'exécution et le déploiement d'agents d'intelligence artificielle en production. L'entreprise affirme faire déjà tourner plus d'une centaine d'agents sur ce même framework. Son principe central repose sur une approche dite "filesystem-first" : un agent est modélisé comme un répertoire de fichiers sur disque, chaque fichier correspondant à une capacité précise. Le plus petit agent fonctionnel ne requiert que deux fichiers, un pour définir le modèle utilisé (par exemple anthropic/claude-opus-4.8) et un fichier instructions.md servant de prompt système. Les fonctionnalités embarquées incluent l'exécution durable avec points de reprise automatiques, un environnement sandboxé pour le code généré par l'agent, un mécanisme d'approbation humaine pour les actions sensibles, et des connexions sécurisées vers des services tiers comme Slack, GitHub, Snowflake, Salesforce, Notion ou Linear. Un même agent peut être exposé simultanément sur plusieurs canaux, qu'il s'agisse de HTTP, Slack, Discord, Teams, Telegram ou Twilio, à partir d'une seule définition. Ce lancement répond à un problème récurrent dans les équipes qui développent des agents : chaque projet recrée from scratch la même infrastructure de base, gestion des sessions, sandboxing, approbations, connexions API. Eve standardise cette structure sous forme d'une convention de répertoires stricte, éliminant le code répétitif et réduisant le temps de mise en production. Les développeurs ajoutent une capacité en déposant simplement un fichier dans le bon sous-répertoire ; le framework détecte et intègre automatiquement ces ajouts lors du build, sans enregistrement manuel. La durabilité des sessions, qui survivent aux crashs et aux redéploiements en reprenant exactement là où elles s'étaient arrêtées, réduit considérablement la charge opérationnelle pour les équipes gérant des agents à grande échelle. Eve s'inscrit dans un mouvement plus large visant à industrialiser le déploiement d'agents IA, une étape que la plupart des équipes traversent encore de façon artisanale. En open-sourçant son framework interne, Vercel adopte une stratégie comparable à celle qu'il avait employée avec Next.js : proposer une couche d'abstraction susceptible de devenir un standard de facto, tout en restant étroitement liée à son infrastructure pour les déploiements en production. La concurrence est dense dans cet espace, avec LangGraph, CrewAI, AutoGen et le récent Agent Development Kit de Google ciblant tous le même besoin. L'approche "répertoire comme contrat" d'eve se distingue par sa lisibilité et sa convention forte, plus proche de la philosophie Next.js que des frameworks d'orchestration classiques. Les suites probables incluent une adoption croissante dans les équipes utilisant déjà Vercel, et une intégration plus poussée avec Vercel AI Gateway pour le routage multi-modèle.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic