Aller au contenu principal
La foire à la saucisse des benchmarks IA… peut-on leur faire confiance ?
LLMsNext INpact · 2 min de lecture

La foire à la saucisse des benchmarks IA… peut-on leur faire confiance ?

Source originale ↗·

Les benchmarks utilisés par les géants de l'IA générative pour vanter les performances de leurs modèles sont-ils fiables ? Une enquête a passé au crible plus d'une dizaine de communiqués et billets de blog publiés par OpenAI et Anthropic, les deux éditeurs de ChatGPT et Claude, ainsi que les annonces de Moonshot AI pour son modèle Kimi K3 et de Qwen pour 3.8-Max. Ces déclarations ont été comparées aux résultats indépendants d'Artificial Analysis, société spécialisée dans l'évaluation des modèles de langage. Le cas de SWE-bench Pro illustre bien le problème. Ce benchmark, développé par Scale AI en 2025, est souvent présenté comme la version avancée de SWE-bench, lancé en 2023 par des chercheurs de Princeton et Stanford, mais il s'agit en réalité d'un outil distinct. SWE-bench Pro se décompose en trois ensembles de tâches aux conditions très différentes : un Public Set de 731 tâches réparties sur 11 dépôts de code, un Held-out Set de 858 tâches sur 12 dépôts, et un Commercial ou Private Set de 276 tâches sur 18 dépôts.

Cette fragmentation change tout dans l'interprétation des scores. Le Public Set repose sur des données librement accessibles, ce qui permet aux entreprises d'optimiser leurs modèles dessus, volontairement ou non, un peu comme des annales d'examen. Le Private Set, lui, confronte les modèles à des données inédites, plus proches d'un examen final réel. Le Held-out Set fonctionne comme un contrôle surprise mené par Scale AI elle-même. Or, quand une entreprise annonce un score « SWE-bench Pro » sans préciser sur quel sous-ensemble il a été obtenu, la comparaison entre modèles concurrents perd une grande partie de son sens, alors même que ces chiffres sont abondamment repris dans la communication marketing et par la presse spécialisée pour établir des classements de performance entre modèles.

Cette opacité méthodologique s'inscrit dans un contexte plus large de course aux annonces entre laboratoires d'IA, où chaque nouvelle génération de modèle doit démontrer qu'elle surpasse la précédente et la concurrence. Les mêmes protocoles de test, appliqués aux mêmes données parfois tenues secrètes, produisent des résultats différents selon qui les exécute et dans quelles conditions. Ce constat fait écho à des travaux antérieurs montrant à quel point la composition des données d'entraînement peut influencer en profondeur les résultats obtenus sur ces batteries de tests. Face à cette multiplication des benchmarks maison ou tiers, la vigilance s'impose pour quiconque cherche à évaluer objectivement les capacités réelles d'un modèle d'IA générative, plutôt que de se fier aux chiffres bruts mis en avant par les éditeurs eux-mêmes.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Les meilleurs agents IA pour le développement logiciel : classement par benchmarks
1MarkTechPost 

Les meilleurs agents IA pour le développement logiciel : classement par benchmarks

En l'espace d'un an et demi, les agents de codage IA sont passés du simple complètement automatique à des systèmes entièrement autonomes capables de lire des issues GitHub, naviguer dans des bases de code multi-fichiers, écrire des correctifs, exécuter des tests et ouvrir des pull requests sans qu'un humain tape une seule ligne. Début 2026, environ 85 % des développeurs déclarent utiliser régulièrement une forme d'assistance IA pour coder. Le marché s'est structuré en quatre grandes familles : les agents terminaux, les IDE natifs IA, les ingénieurs autonomes hébergés dans le cloud, et les frameworks open source permettant de choisir librement son modèle. Chaque outil se réclame du meilleur, mais les benchmarks invoqués pour le prouver ne mesurent pas toujours les mêmes choses, et certains ont perdu toute crédibilité. Le coup de tonnerre est venu le 23 février 2026, quand l'équipe Frontier Evals d'OpenAI a annoncé qu'elle cessait de publier ses scores sur SWE-bench Verified, le benchmark de référence du secteur depuis mi-2024. Ce test soumet des agents à 500 vraies issues GitHub tirées de dépôts Python populaires, en mesurant leur capacité à comprendre le problème, naviguer le code, générer un correctif et valider les tests, sans intervention humaine. L'audit d'OpenAI a porté sur 138 des problèmes les plus difficiles, répartis sur 64 sessions indépendantes : 59,4 % présentaient des cas de test fondamentalement défectueux ou insolubles, exigeant par exemple des noms de fonctions précis absents de l'énoncé. Plus grave encore, les auditeurs ont constaté que les trois grands modèles frontière, GPT-5.2, Claude Opus 4.5 et Gemini 3 Flash, étaient capables de reproduire mot pour mot les solutions de référence à partir du seul identifiant de tâche, confirmant une contamination systématique des données d'entraînement. La conclusion d'OpenAI est sans appel : les progrès mesurés sur SWE-bench Verified ne reflètent plus d'améliorations réelles dans le développement logiciel. OpenAI recommande désormais SWE-bench Pro comme successeur. Ce nouveau benchmark contient 1 865 tâches réparties en trois sous-ensembles : 731 tâches publiques, 858 tâches en set caché, et 276 tâches commerciales issues de 18 bases de code propriétaires de startups. Les scores y sont nettement plus bas qu'en Verified : lorsque Scale AI avait évalué les modèles frontière avec un scaffold unifié SWE-Agent, le meilleur résultat n'atteignait pas 25 % (GPT-5 à 23,3 %). Les chiffres publiés aujourd'hui par les labs sont bien supérieurs grâce à des harness optimisés : OpenAI annonce GPT-5.5 à 58,6 % sur le set public, Anthropic revendique 64,3 % pour Claude Opus 4.7, et Google affiche 54,2 % pour Gemini 3.1 Pro. La difficulté à comparer ces résultats, obtenus avec des configurations très différentes, illustre le défi central du marché en 2026 : choisir son agent de codage exige désormais de décrypter les benchmarks autant que les fonctionnalités.

UELes développeurs français et européens utilisant des agents de codage IA doivent recalibrer leurs critères de sélection face à l'invalidité confirmée du benchmark SWE-bench Verified et adopter SWE-bench Pro comme nouvelle référence comparative.

💬 Le coup de balai sur SWE-bench Verified était attendu, mais que les modèles reproduisent les solutions mot pour mot depuis l'identifiant de tâche, c'est quand même un niveau au-dessus. SWE-bench Pro repart à 23% avec un scaffold unifié, ce qui donne une image plus juste de là où on en est vraiment. Les 58-64% qu'annoncent les labs maintenant, c'est avec leurs propres harness optimisés, donc compare qui peut.

LLMsOutil
1 source
Claude Fable 5 d'Anthropic domine les nouveaux benchmarks du secteur, à prix fort
2The Decoder 

Claude Fable 5 d'Anthropic domine les nouveaux benchmarks du secteur, à prix fort

Anthropic occupe la première place des six nouveaux indices sectoriels lancés par Artificial Analysis, qui évaluent les performances des modèles d'intelligence artificielle dans la finance, le droit et la médecine. Son modèle Claude Fable 5 devance tous ses concurrents sur ces nouveaux classements, mais cette suprématie a un prix élevé. Dans l'indice Strategy & Ops, une tâche unique coûte 3,48 dollars avec Fable 5, soit plus de cent fois le tarif pratiqué par DeepSeek V4 Pro, facturé à seulement 0,03 dollar pour la même opération. Or l'écart de score entre les deux modèles ne s'élève qu'à 12 points, un différentiel de performance jugé minime au regard du fossé tarifaire. Cette disparité relance le débat sur la rentabilité des modèles les plus puissants du marché face à des alternatives nettement moins coûteuses mais presque aussi performantes. Pour les entreprises qui déploient l'IA à grande échelle, notamment dans des secteurs sensibles comme la finance ou le droit, le choix du modèle ne se limite plus à la seule qualité des résultats : le rapport coût-performance devient un critère déterminant. Un gain marginal de précision ne justifie pas toujours une facture multipliée par cent, surtout lorsque les volumes de requêtes sont importants et que les marges d'erreur restent comparables entre les deux solutions. Ces nouveaux indices d'Artificial Analysis s'inscrivent dans une tendance plus large de benchmarking spécialisé par secteur, alors que les entreprises cherchent des repères fiables pour choisir leurs modèles d'IA en fonction de cas d'usage précis plutôt que de scores génériques. La concurrence entre laboratoires occidentaux comme Anthropic et des acteurs chinois comme DeepSeek illustre la diversification croissante du marché, où la course à la performance brute cède progressivement la place à des arbitrages économiques plus fins. Reste à savoir si Anthropic ajustera sa politique tarifaire pour Fable 5 face à cette pression concurrentielle, ou si l'entreprise misera sur un positionnement premium assumé pour les usages professionnels les plus critiques.

💬 Le prix affiché par Anthropic dit tout sur sa stratégie: viser les boîtes qui ne regardent pas à la dépense tant que l'erreur coûte plus cher que le modèle. Douze points d'écart pour cent fois le prix, en droit ou en finance, DeepSeek V4 Pro gagne ce match sur le papier. Reste que sur ces métiers-là, une réponse fausse peut coûter un contrat entier, donc le vrai calcul n'est pas dans le benchmark mais dans la sinistralité de chaque boîte.

LLMsPaper
1 source
L’IA de Google se lance à son tour dans la chasse aux failles de sécurité
3Next INpact 

L’IA de Google se lance à son tour dans la chasse aux failles de sécurité

Google a dévoilé une nouvelle génération de modèles Gemini, dont un modèle spécialisé en cybersécurité baptisé Gemini 3.5 Flash Cyber, conçu pour détecter, vérifier et corriger des failles de sécurité dans le code logiciel. Ce modèle sera intégré à CodeMender, un agent qui fait travailler plusieurs instances du modèle avant de produire un rapport commun. Son accès reste toutefois restreint à des gouvernements et à des partenaires jugés fiables, à l'image de ce que pratiquent déjà Anthropic avec son projet Glasswing (modèle Mythos 5) et OpenAI avec son programme Trusted Access for Cyber (modèle GPT-5.5-Cyber). Sur le benchmark CyberGym, les performances de Gemini 3.5 Flash Cyber seraient proches de ses rivaux, GPT-5.5-Cyber conservant une légère avance. Parallèlement, Google lance deux modèles à destination du grand public et des développeurs : Gemini 3.6 Flash, qui remplace Gemini 3.5 Flash pour les tâches courantes de programmation, d'analyse de documents et de génération de rapports, facturé 1,5 dollar par million de jetons en entrée et 7,5 dollars en sortie ; et Gemini 3.5 Flash Lite, pensé pour des tâches simples exécutées en grand nombre, au tarif de 0,30 dollar en entrée et 2,50 dollars en sortie, avec un débit annoncé de 350 jetons par seconde. La restriction d'accès imposée à Gemini 3.5 Flash Cyber illustre un dilemme central de l'IA appliquée à la sécurité informatique : un outil capable de repérer et corriger des vulnérabilités peut tout aussi bien servir à les exploiter. En limitant la distribution à des acteurs de confiance, Google cherche à maximiser le bénéfice défensif tout en réduisant le risque qu'un tel modèle tombe entre de mauvaises mains. Pour les entreprises, l'argument mis en avant autour de Gemini 3.6 Flash, une consommation de jetons 17 % inférieure à son prédécesseur selon l'index Artificial Analysis, répond à une préoccupation grandissante : le coût de l'IA agentique, qui dans certains cas dépasse désormais celui de la main-d'œuvre humaine. Un modèle qui accomplit la même tâche en moins d'étapes de raisonnement et avec moins d'appels à des outils externes devient un argument commercial à part entière, autant qu'une prouesse technique. Cette annonce s'inscrit dans une course effrénée entre laboratoires d'IA, où Google tente de rattraper Anthropic et OpenAI sur le terrain spécifique de la cybersécurité tout en consolidant sa gamme générale face à des concurrents comme Grok 4.5 de SpaceXAI, Muse Spark 1.1 de Meta, GPT-5.6 Sol ou Kimi K3, avec lesquels Gemini 3.6 Flash est directement comparé sur le rapport qualité prix. Google a par ailleurs confirmé que Gemini 3.5 Pro, son futur modèle haut de gamme, est déjà testé par des partenaires sans date de lancement public, tandis que Gemini 4, la prochaine génération majeure, reste toujours en phase d'entraînement.

LLMsOpinion
1 source
GPT-5.5 pulvérise les benchmarks : une vraie boucherie pour la concurrence !
4Le Big Data 

GPT-5.5 pulvérise les benchmarks : une vraie boucherie pour la concurrence !

OpenAI a lancé GPT-5.5 le 23 mars 2026, soit à peine six semaines après GPT-5.4, confirmant un rythme de déploiement qui tient en haleine toute l'industrie. Le nouveau modèle se distingue sur plusieurs fronts : écriture et correction de code, recherche en ligne, analyse de données, création de documents et de feuilles de calcul, mais aussi interaction directe avec les logiciels et enchaînement d'outils pour mener une tâche à son terme. En développement front-end, il repère et corrige bugs visuels et incohérences d'interface avec une fluidité remarquée. Sur les benchmarks, les chiffres sont nets : GPT-5.5 atteint 82,7 % sur Terminal-Bench 2.0, qui mesure la capacité à exécuter des tâches réelles dans un terminal comme le ferait un développeur, dépassant notamment Claude Opus 4.7 d'Anthropic. Il affiche 58,6 % sur SWE-Bench Pro, dédié à l'ingénierie logicielle, et enregistre un gain de 3,7 points sur HealthBench Professional par rapport à son prédécesseur. En matière de vitesse, les tâches complexes de programmation s'exécutent jusqu'à 40 % plus rapidement qu'avec GPT-5.4. Au total, le modèle domine 14 benchmarks commerciaux, avec des scores particulièrement élevés en économie via GDPval à 84,9 % et en cybersécurité via CyberGym à 81,8 %. Ces résultats positionnent GPT-5.5 comme le modèle de référence actuel pour les usages professionnels intensifs, notamment en développement logiciel et en automatisation de tâches complexes. Un gain de vitesse de 40 % sur la programmation n'est pas anodin : pour les équipes qui utilisent ces modèles en production, cela se traduit directement en économies de temps et en réduction des coûts d'inférence. La domination sur Terminal-Bench 2.0 est particulièrement significative, ce test étant conçu pour simuler des conditions proches du travail réel d'un ingénieur, là où d'autres benchmarks restent plus académiques. Le léger retard sur SWE-Bench Pro face à certains concurrents sur le raisonnement pur nuance néanmoins le tableau et rappelle qu'aucun modèle ne rafle encore tous les usages. Cette sortie s'inscrit dans une période de compétition intense entre OpenAI, Anthropic et Google, où les cycles de mise à jour se sont drastiquement raccourcis. Six semaines entre deux versions majeures illustre une course à l'armement qui ne laisse plus de répit aux équipes concurrentes. OpenAI consolide ainsi sa position dominante en ciblant précisément les cas d'usage professionnels et les pipelines d'automatisation, là où la vitesse et la fiabilité d'exécution comptent autant que le raisonnement pur. La concurrence dispose toutefois de modèles plus spécialisés qui conservent l'avantage sur certains segments, et les prochaines réponses d'Anthropic et Google sont attendues dans les semaines à venir.

UELes équipes tech européennes utilisant ces modèles pour le développement logiciel et l'automatisation bénéficieront d'un gain de vitesse de 40 % sur les tâches complexes de programmation.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic