Aller au contenu principal
LLMs · Actu ·

Opus 5 d'Anthropic devance largement Fable 5 et GPT-5.6 Sol sur le benchmark conçu pour mesurer l'intelligence réelle

Claude Opus 5, le nouveau modèle d'Anthropic, a obtenu un score de 30,2 % sur ARC-AGI-3, un benchmark conçu pour mesurer l'intelligence réelle plutôt que la simple mémorisation de motifs. Ce résultat représente près du quadruple du précédent record de 7,8 %, détenu jusque là par GPT-5.6 Sol. Selon les concepteurs du test, Opus 5 a formulé de manière autonome des équations de réflexion pour résoudre certaines énigmes, un comportement qu'ils n'avaient jamais observé chez un autre modèle. Ils l'attribuent à un raisonnement logique nettement plus solide que celui de ses concurrents.

1 min de lecturePertinence 49
Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cet écart de performance est significatif car ARC-AGI a justement été conçu pour être résistant au bachotage et aux approches par force brute qui permettent souvent aux modèles de gonfler artificiellement leurs scores sur d'autres benchmarks. Un saut aussi net suggère qu'Opus 5 dispose de capacités de raisonnement abstrait et d'adaptation à des problèmes inédits bien supérieures à celles de la génération précédente, ce qui intéresse directement les entreprises cherchant des systèmes capables de résoudre des tâches complexes sans exemples préalables, au-delà de la simple génération de texte ou de code.

ARC-AGI a été créé pour évaluer la fluidité cognitive des modèles, c'est-à-dire leur capacité à généraliser à partir de peu d'exemples, contrairement aux benchmarks classiques que les grands modèles finissent par saturer une fois entraînés dessus. Les versions précédentes de ce test avaient mis en évidence les limites persistantes des grands modèles de langage face au raisonnement véritablement nouveau. La progression rapide d'Anthropic, dans une course où OpenAI occupait jusqu'ici la tête avec GPT-5.6 Sol, relance la compétition entre laboratoires sur ce terrain précis, considéré par beaucoup comme un indicateur plus fiable du chemin vers une intelligence artificielle générale.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Quadrupler le record sur un benchmark pensé justement pour résister au bachotage, ça ne s'explique pas par un peu plus de données ou un prompt mieux tourné. Le signal fort, c'est qu'Opus 5 invente ses propres équations pour résoudre les énigmes, un raisonnement qui n'était écrit nulle part dans son entraînement. Bon, sur le papier ça sent l'AGI qui approche, mais ARC-AGI teste des puzzles abstraits, pas la gestion d'un vrai projet client, donc je garde deux doigts de prudence avant de crier victoire.

À lire ensuite

01Claude Opus 5 d'Anthropic coûte moins cher que Fable 5 et l'égale ou le dépasse sur la plupart des benchmarks48The DecoderLLMs 02Surprise : GPT-5.5 devance Claude Fable 5 sur le benchmark Agents' Last Exam50VentureBeat AILLMs 03Anthropic lance Claude Opus 4.8 : amélioration modeste mais concrète, devant GPT-5.5 sur la plupart des benchmarks48The DecoderLLMs 
Dossier · AnthropicSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.