GPT-6 Astra, GPT-6.1 Sol, Gemini 4 Argon et Claude Fable 5.1 : quel modèle de pointe pour quelle tâche ?
Anthropic, OpenAI et Google DeepMind ont lancé quatre modèles de pointe en trente jours. Claude Fable 5.1 est sorti le 1er septembre, GPT-6 Astra le 3 septembre, puis GPT-6.1 Sol (29 septembre) et Gemini 4 Argon (annoncé le 30 septembre) en fin de mois. Argon n'est accessible que via le programme Fairwind. OpenAI a par ailleurs annulé GPT-6.1 Astra le 28 septembre, après son échec à des tests internes de périmètre et d'autorisation, si bien que GPT-6 Astra reste son modèle phare. Astra et Fable 5.1 partagent le même tarif catalogue, 10 dollars en entrée et 50 dollars en sortie par million de jetons. Sol et Argon sont facturés à un cinquième de ce prix (2 et 10 dollars), mais celui d'Argon est promotionnel et doublera ensuite. Le cache d'Astra coûte 1,00 dollar par million de jetons, soit quatre fois Fable 5.1 (0,25) et dix fois Sol (0,10). Les fenêtres de contexte avoisinent le million de jetons pour tous, et seul Argon dépasse la limite de 128 000 jetons de sortie, avec un million. Aucun des quatre n'est en poids ouverts.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Aucun modèle ne domine partout, et les écarts de prix comptent plus que ceux de performance. Selon les chiffres publiés par Google, Argon mène sur DeepSWE v1.1 (77,9 % contre 74,1 % pour Astra et 67,4 % pour Fable 5.1) et sur l'indice Vals (68,9 %). Astra l'emporte sur FrontierSWE v2 (65,5 %) et OSWorld-2.0 (72,6 % contre 69,2 %). Sur Terminal-Bench 4.0, les trois sont à égalité à environ un point près, et Opus 5.5, hors comparaison, est en tête. Pour la correction de vulnérabilités, Argon et Astra font jeu égal à 68 %, devant Fable 5.1 (58 %). Ces chiffres viennent des éditeurs. OpenAI affirme que Sol égale Astra sur DeepSWE pour environ un cinquième du coût, et reste à 2,1 points sur OSWorld 2.0 pour environ un septième du coût par tâche. Les mesures indépendantes d'Artificial Analysis sont moins favorables à Astra : 61 sur son indice d'intelligence, soit 5 points de moins que Fable 5.1, qui mène aussi sur les agents de code (70 contre 67). Sur ARC-AGI-2, Astra obtient 95 % contre 90 %. Pour les agents, qui renvoient à chaque étape prompts système, schémas d'outils et historique, le coût du cache pèse lourd. À tarif identique, la facture réelle diffère aussi : Artificial Analysis chiffre Fable 5.1 à 9,18 dollars par tâche contre 4,72 dollars pour Astra, soit environ 1,9 fois plus, ce qui reflète un volume de jetons consommés plus élevé plutôt que des tarifs différents.
Ce comparatif illustre un marché où la course ne se joue plus seulement sur les scores bruts. Les laboratoires se différencient par la structure tarifaire : surcoût au-delà de 272 000 jetons chez OpenAI (20 dollars en entrée, 75 en sortie pour Astra), tarif unique jusqu'à un million de jetons chez Anthropic, prix d'appel temporaire chez Google. Le choix d'un modèle dépend donc de la charge de travail, de la part de contexte répété et de la consommation de jetons, plus que du classement d'un test. Le retrait de GPT-6.1 Astra rappelle en outre que les validations de sécurité peuvent bloquer un lancement, même chez un acteur qui enchaîne les sorties. Les prochains mois diront si l'accès restreint d'Argon s'élargit et si son tarif doublé reste compétitif face à Sol.
Pas d'impact direct sur la France/UE
Quatre modèles de pointe en trente jours, et aucun ne gagne partout : le classement des benchmarks ne dit plus quel modèle choisir. Ce qui décide, c'est la structure de facturation, entre cache à 1 dollar chez Astra et 0,25 chez Fable, ou prix d'appel d'Argon qui doublera. Pour un agent qui renvoie son historique à chaque étape, ça pèse plus que quatre points de score. Bon, sur le papier Sol à un cinquième du prix a l'air imbattable, mais les chiffres viennent des éditeurs, donc reste à voir si ça tient en prod.