METR introduit un nouveau critère pour déterminer quand les agents IA deviennent plus coûteux que les humains
METR, l'organisation de recherche spécialisée dans l'évaluation des capacités des systèmes d'intelligence artificielle, a présenté une nouvelle métrique baptisée "horizon de dépense" (expenditure horizon), conçue pour déterminer à partir de quel moment un agent IA devient plus coûteux qu'un humain pour résoudre un problème donné. Contrairement aux indicateurs habituels qui mesurent la durée des tâches qu'un agent peut accomplir, cette métrique traduit directement la performance en dollars, en comparant le coût de calcul consommé par l'agent au coût équivalent d'une main-d'œuvre humaine. METR a testé cette approche sur le NanoGPT speedrun, un défi consistant à optimiser le plus rapidement possible l'entraînement d'un modèle de type GPT, et les premiers résultats se sont révélés décevants pour les agents IA actuels.
Cette métrique s'inscrit dans un débat plus large sur la rentabilité réelle des agents IA en entreprise. Si les modèles progressent régulièrement sur des bancs d'essai mesurant l'autonomie ou la durée des tâches, la question du coût effectif reste largement ignorée alors qu'elle conditionne l'adoption concrète de ces outils par les entreprises. Un agent capable de résoudre un problème mais dont le coût en calcul dépasse celui d'un ingénieur humain n'a, économiquement, guère d'intérêt pour une organisation.
METR reconnaît toutefois que sa métrique comporte des angles morts, notamment parce qu'elle capture mal certains types de tâches ou de gains de productivité indirects. L'organisation souligne aussi que la génération de modèles la plus récente pourrait rebattre les cartes, les coûts de calcul et les performances évoluant rapidement. Cette initiative rejoint les efforts d'acteurs comme OpenAI ou Anthropic pour mieux quantifier l'impact économique réel de leurs systèmes.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



