Anthropic dit écraser OpenAI sur un test d’IA : GPT reprend la main avec une simple option
Alors qu'Anthropic communiquait sur des scores historiques obtenus par son modèle Claude Opus 5, OpenAI a réagi presque aussitôt en ajustant deux paramètres de configuration sur GPT-5.6 Sol, un modèle déjà existant, ce qui a suffi à repasser devant Claude sur le même test. Cette bascule ne provient pas d'un nouvel entraînement ni d'une nouvelle architecture, mais d'une simple modification du "harnais", c'est-à-dire de l'environnement logiciel qui entoure le modèle lors de l'évaluation, ce qui a permis à OpenAI de reprendre la tête du classement quelques jours seulement après l'annonce d'Anthropic.
Cet épisode illustre un problème de fond pour l'industrie de l'IA, à savoir la fiabilité des benchmarks utilisés pour comparer les modèles entre eux. Si un simple réglage de paramètres externes au modèle suffit à inverser un classement présenté comme le reflet des capacités brutes d'une IA, la valeur communicative de ces scores devient discutable pour les entreprises, développeurs et investisseurs qui s'appuient dessus pour choisir un modèle ou évaluer les progrès du secteur. Cela relance aussi la question de la transparence méthodologique : sans détail sur la configuration exacte utilisée, deux résultats affichant le même score peuvent ne pas mesurer la même chose.
Cette séquence s'inscrit dans une rivalité de plus en plus frontale entre Anthropic et OpenAI, où chaque annonce de score record est scrutée puis potentiellement contestée par le concurrent dans la foulée. Les benchmarks sont devenus un argument marketing central dans la course aux grands modèles de langage, ce qui pousse les deux entreprises à optimiser non seulement leurs modèles mais aussi la façon dont ils sont évalués. Ce cycle d'annonces et de contre-annonces devrait se poursuivre à mesure que de nouvelles versions, comme celles évoquées pour Claude et GPT, continueront de sortir à un rythme soutenu.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




