Aller au contenu principal
LLMs · Actu ·

GPT-6.1 Sol à 2 $/10 $ le million de tokens bouscule le rapport coût-performance, tandis que Sonnet 5.5 entre 3e à l'Agent Arena

OpenAI a dévoilé GPT-6.1 Sol, un modèle facturé 2 dollars par million de tokens en entrée et 10 dollars en sortie, contre 10 et 50 dollars pour Astra, son modèle haut de gamme. Selon les résultats annoncés, Sol devance GPT-6 Sol de 6,4 points sur DeepSWE v1.1 et Opus 5.5 de 2,2 points sur AutomationBench. Dans le classement Agent Arena, la version Sol [Max] entre à la 5e place avec un coût médian de 0,56 dollar par tâche. C'est 39 % de moins que GPT-6 Sol, pour un score supérieur de 1,52 point, et 81 % de moins qu'Astra, pour un écart de seulement 1,04 point. Anthropic occupe désormais les trois premières places : Sonnet 5.5 [Max] débute 3e et prend la première place de la catégorie Chat, mais à 2,74 dollars par tâche contre 1,58 dollar pour Opus 5.5 (2e), ce qui l'écarte de la frontière de Pareto. Sur WebDev, Sonnet se place à 2 points de GPT-6 Astra [Max] avec un coût inférieur de 80 %. Gemini 4 Argon [High] prend la tête du Text Arena. Du côté des modèles ouverts, MiMo-V2.6-Pro et Flash se classent 5e et 9e, et Step 5 Preview de StepFun, doté d'une fenêtre de 1 million de tokens, est 7e sur Vals à 2,54 dollars par tâche.

2 min de lecturePertinence 57

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de Latent Space. Lire l'article original →

L'enjeu se déplace du score brut vers le rapport coût-performance. Pour les équipes qui déploient des agents de code ou d'automatisation, un modèle qui reste à environ un point d'Astra pour cinq fois moins cher change l'arbitrage économique, surtout quand les tâches s'enchaînent par milliers. Le style de raisonnement compte aussi : Design Arena, qui a lu 324 résumés de réflexion, constate qu'Astra hésite environ vingt fois plus souvent qu'Opus 5.5, lequel tranche tôt dans quatre résumés sur cinq. Les évaluations indépendantes, comme WeirdML v3, jugent Sol très économe en tokens, proche d'Astra mais avec un pic de performance plus bas. Ces résultats restent partiels et, pour une part, issus des éditeurs eux-mêmes. Les rumeurs d'un Claude Fable 5.5 attendu la semaine prochaine, supposé supérieur à un « Astra 6.1 » retardé pour des raisons de sécurité, ou d'un « GPT-6 Astra Lite » qui serait en fait Sol, n'ont aucune confirmation.

En parallèle, l'inférence locale de modèles de décision progresse. llama.cpp a ajouté un point d'accès /v1/systemone pour exécuter ces modèles, notamment avec Kev-4B-GGUF, tandis que Perplexity affirme que son pplx-décider-v1-27b atteint 85,7 % de moyenne sur 11 benchmarks, devant Jev, et que les modèles Clef arrivent sur Ollama. Certains observateurs y voient simplement une nouvelle étiquette pour des classifieurs zéro-shot. D'autres publications complètent le tableau : webAI propose TwIL-LM3-Pro, un modèle de 3,66 milliards de paramètres issu de Granite 4.2, à peu près équivalent à Qwen3-8B en logique formelle, mais sous licence non commerciale. Reka a publié sous Apache 2.0 un modèle de dynamique inverse entraîné sur des jeux vidéo, capable d'extraire des actions motrices et de caméra dans de vraies vidéos. Cette effervescence confirme la compétition serrée entre OpenAI, Anthropic, Google et les acteurs ouverts, où le prix devient un argument aussi décisif que la performance.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Z.ai lance GLM-5.2 : contexte de 1 million de tokens, deux niveaux d'effort de raisonnement, sans benchmarks au lancement43MarkTechPostLLMs 02Le vrai prix de Gemini 3.1 à 3.8 : coût, tokens et performances face à nos prompts51Next INpactLLMs 03Meta AI lance Muse Spark 1.3, un modèle de code à base d'agents plus économe en appels d'outils et en tokens que 1.242MarkTechPostLLMs 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.