
Voici la traduction :

Une équipe de chercheurs de Microsoft, de la Shanghai Jiao Tong University, de la Tongji University et de la Fudan University a présenté SkillOpt, un système d'optimisation qui entraîne un document de compétence en langage naturel pendant que le modèle cible reste figé. Un modèle optimiseur analyse des exécutions notées et propose des modifications bornées (ajout, suppression, remplacement), qu'un jeu de validation distinct n'accepte que si le score s'améliore strictement. Le résultat est un fichier unique, best_skill.md, que les chercheurs ont ensuite testé dans trois configurations de transfert. Sur le benchmark SpreadsheetBench, une compétence entraînée sur GPT-5.4 conserve 82% du gain obtenu en interne lorsqu'elle est déployée sur GPT-5.4-mini (le score passe de 36,1 à 45,5, contre 47,5 pour un entraînement direct), mais seulement 16% sur GPT-5.4-nano. Sur LiveMath, la compétence transférée sur GPT-5.4-nano atteint même 28,8 points, dépassant le résultat obtenu par un entraînement direct sur ce modèle (27,2). Le test le plus marquant concerne le passage entre environnements d'exécution: sur GPT-5.5, une compétence optimisée dans Codex, appliquée telle quelle à Claude Code, fait grimper le score SpreadsheetBench de 22,1 à 81,8, un résultat qui dépasse légèrement les 80,4 points obtenus par Claude Code en s'entraînant lui-même.
Cette portabilité change la manière dont les compétences des agents IA pourraient être développées et diffusées. Au lieu de ré-entraîner un module distinct pour chaque modèle ou chaque interface, une organisation pourrait produire une seule compétence textuelle et la réutiliser sur des variantes plus petites, moins coûteuses à faire tourner, ou sur un environnement d'exécution différent, sans perte majeure de performance dans les cas favorables. Le point faible identifié est tout aussi instructif: les compétences purement procédurales (inspection d'un fichier, vérification de formules, mise en forme) voyagent bien d'un système à l'autre, alors que les compétences qui reposent sur un raisonnement mathématique complexe restent largement attachées à leur environnement d'entraînement, avec des taux de rétention qui chutent à 10% ou 30% selon le sens du transfert entre Codex et Claude Code.
Le mécanisme qui rend ce transfert possible tient à un détail d'implémentation: les trois modes d'exécution testés, à savoir le dialogue direct, Codex et Claude Code, lisent tous le même format de fichier best_skill.md, ce qui crée un contrat commun entre des outils autrement très différents dans leur gestion des commandes et des fichiers. Les chercheurs ont aussi testé un transfert entre benchmarks mathématiques, d'OlympiadBench vers Omni-MATH, avec des gains plus modestes mais positifs sur toutes les tailles de modèles GPT-5.4 testées, jusqu'à +3,7 points sur la version complète. L'étude reste cependant circonscrite: aucun transfert entre familles de modèles différentes, comme de GPT vers Qwen, n'a été évalué, ce qui laisse ouverte la question de savoir si ces gains se généralisent au-delà de l'écosystème testé.
Micro-audits qui s'améliorent tout seuls, tant qu'on reste dans la même famille de modèles : c'est déjà solide. Le détail qui compte, c'est que les trois modes lisent le même fichier best_skill.md, un contrat texte commun là où chaque outil gère ses commandes différemment, d'où le transfert qui marche. Mais la limite est nette : dès que ça touche du raisonnement mathématique complexe, la compétence reste collée à son environnement d'entraînement (rétention à 10-30% dans le pire sens), donc on est loin d'une compétence universelle, plutôt d'un bon plan pour les tâches procédurales répétitives.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




