Aller au contenu principal
LLMs · Opinion ·

Anthropic dit écraser OpenAI sur un test d’IA : GPT reprend la main avec une simple option

Alors qu'Anthropic communiquait sur des scores historiques obtenus par son modèle Claude Opus 5, OpenAI a réagi presque aussitôt en ajustant deux paramètres de configuration sur GPT-5.6 Sol, un modèle déjà existant, ce qui a suffi à repasser devant Claude sur le même test. Cette bascule ne provient pas d'un nouvel entraînement ni d'une nouvelle architecture, mais d'une simple modification du "harnais", c'est-à-dire de l'environnement logiciel qui entoure le modèle lors de l'évaluation, ce qui a permis à OpenAI de reprendre la tête du classement quelques jours seulement après l'annonce d'Anthropic.

1 min de lecturePertinence 36
Source

Résumé et traduction réalisés par Le Fil IA à partir de Frandroid. Lire l'article original →

Cet épisode illustre un problème de fond pour l'industrie de l'IA, à savoir la fiabilité des benchmarks utilisés pour comparer les modèles entre eux. Si un simple réglage de paramètres externes au modèle suffit à inverser un classement présenté comme le reflet des capacités brutes d'une IA, la valeur communicative de ces scores devient discutable pour les entreprises, développeurs et investisseurs qui s'appuient dessus pour choisir un modèle ou évaluer les progrès du secteur. Cela relance aussi la question de la transparence méthodologique : sans détail sur la configuration exacte utilisée, deux résultats affichant le même score peuvent ne pas mesurer la même chose.

Cette séquence s'inscrit dans une rivalité de plus en plus frontale entre Anthropic et OpenAI, où chaque annonce de score record est scrutée puis potentiellement contestée par le concurrent dans la foulée. Les benchmarks sont devenus un argument marketing central dans la course aux grands modèles de langage, ce qui pousse les deux entreprises à optimiser non seulement leurs modèles mais aussi la façon dont ils sont évalués. Ce cycle d'annonces et de contre-annonces devrait se poursuivre à mesure que de nouvelles versions, comme celles évoquées pour Claude et GPT, continueront de sortir à un rythme soutenu.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Microsoft dévoile sept modèles d’IA maison pour s’émanciper d’OpenAI et partir chasser sur les terres d’Anthropic et de Google52FrandroidLLMs 02Meta veut combler son retard sur Anthropic et OpenAI en matière de code39The Information AILLMs 03Mistral mise sur l'IA sur mesure pour concurrencer OpenAI et Anthropic dans l'entreprise48TechCrunch AILLMs 
Dossier · OpenAISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.