Aller au contenu principal
Outils · Outil ·

Microsoft dévoile le code de son agent de test unitaire multilingue, avec un taux de réussite de 92,1% vs 78,9% pour Copilot standard

Microsoft a rendu open source code-testing-generator, un agent polyglotte capable d'écrire des tests unitaires puis de vérifier lui-même qu'ils fonctionnent. L'outil est distribué via le plugin dotnet-test, intégré au dépôt dotnet/skills sous licence MIT. Contrairement à une simple invite du type "génère des tests unitaires", qui laisse en suspens le choix du framework, l'emplacement des fichiers et les assertions à utiliser, cet agent commence par explorer le dépôt de code avant d'écrire quoi que ce soit, puis planifie, rédige, exécute et contrôle les tests produits. Sur un benchmark interne de Microsoft portant sur 152 tâches issues de dépôts réels, l'agent a complété 140 tâches (92,1%), contre 120 (78,9%) pour GitHub Copilot standard utilisant le même modèle et les mêmes prompts, soit 63% d'échecs en moins. L'écart se concentre sur les prompts vagues: 79 tâches réussies sur 89 (88,8%) contre 59 (66,3%) pour Copilot. Sur 63 prompts détaillés, les deux obtiennent un score quasi identique (96,8%). Sur 15 tâches ciblant un diff de pull request précis, l'agent réussit les 15, contre zéro pour Copilot. Fait notable, l'agent génère 2,3% de tests en moins (6 963 contre 7 129) pour une couverture de code quasiment identique (72,4% contre 72,2%), en 359 secondes en moyenne contre 380.

2 min de lecturePertinence 41

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette avancée cible un point faible concret des assistants de codage actuels: leur incapacité à combler l'ambiguïté d'une consigne sans connaître les conventions propres à un projet. Pour les équipes de taille moyenne et les startups, qui manquent souvent de temps pour documenter leurs pratiques de test, l'agent effectue ce travail de recherche contextuelle à leur place. Les grandes entreprises, notamment dans les secteurs réglementés comme la finance, la santé, l'assurance ou le secteur public, peuvent l'adapter à leurs frameworks internes pour combler leur dette de tests sur du code legacy, renforcer la couverture avant une mise en production, ou harmoniser les conventions dans des monorepos multilingues. Comme il s'agit d'une définition d'agent exécutée localement, et non d'un service hébergé, le code ne quitte jamais l'environnement de l'utilisateur.

Ce projet s'inscrit dans une évolution plus large des outils de codage assistés par IA, qui passent d'une génération de texte en une seule passe à des agents capables de vérifier leur propre travail, notamment via une forme allégée de test de mutation et une confirmation que les tests sont bien détectés par la commande de test du dépôt. Porté par l'équipe .NET de Microsoft, l'outil a aussi été testé avec Claude Opus 4.8 (43 tâches réussies sur 45, contre 35 pour Copilot) et GPT-5.5 (41 sur 45, contre 36), montrant sa portabilité entre modèles. Sur le benchmark externe plus exigeant SWE Atlas, l'agent atteint 16 réussites sur 44, contre 12 pour Copilot, laissant présager une adoption progressive par d'autres éditeurs d'outils de développement.

Impact France / UEChamp produit par Le Fil IA

Les équipes de développement françaises et européennes peuvent librement adopter cet outil open source sous licence MIT pour renforcer leur couverture de tests, sans impact réglementaire ou institutionnel direct.

Notre lecture

Ce qui compte ici, ce n'est pas le score, c'est la méthode : l'agent explore le dépôt avant d'écrire une ligne, au lieu de balancer des tests génériques qui ignorent tes conventions maison. Et les vrais chiffres sont là où on les attend : sur les consignes vagues (88,8% contre 66,3%) et sur un diff de PR précis (15 sur 15, zéro pour Copilot standard). Reste que ça tourne en local, donc pas de souci de fuite de code, et que l'écart s'écrase dès que le prompt est déjà bien écrit, ce qui en dit long sur ce que ces agents compensent réellement : notre flemme de documenter, pas un manque d'intelligence du modèle.

À lire ensuite

01Microsoft teste des agents IA similaires à OpenClaw pour 365 Copilot50The Verge AIOutils 02Microsoft veut tuer le casse-tête des IA avec une seule application Copilot42Le Big DataOutils 03Le futuriste IA de Microsoft explique comment il utilise Copilot et les problèmes concrets que les entreprises résolvent avec des agents48VentureBeat AIOutils 
Dossier · MicrosoftSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.