[AINews] Gemini 4 Argon : la réponse de GDM à Astra/Fable, avec 1M de tokens en sortie
Google DeepMind a dévoilé Gemini 4 Argon, son premier modèle plus gros qu'un Flash depuis Gemini 3.1 Pro en février, conçu pour le code, le travail de connaissance en entreprise et la cyberdéfense. L'accès est pour l'instant limité aux utilisateurs gouvernementaux et aux défenseurs cyber de confiance du programme Fairwind, Google promettant d'affiner ses garde-fous avant d'ouvrir aux développeurs, aux entreprises et au grand public « dès que possible ». Selon Google, Argon prend la première place sur 13 des 19 benchmarks publiés face à GPT-6 Astra et Claude Opus 5.5, avec 77,9 % sur DeepSWE contre 74,2 % pour Opus 5.5 et 74,1 % pour Astra. La limite de sortie atteint 1 million de tokens contre 64 000 auparavant, grâce à la fonction expérimentale Long Decode Continuation, qui met en pause les longues réponses et les reprend sur plusieurs appels d'API. Vals mesure toutefois un maximum de 262 000 tokens, tandis qu'Artificial Analysis a atteint le million via cette fonction. Le tarif standard est de 4 dollars par million de tokens en entrée et 20 dollars en sortie, ramené à 2 et 10 dollars par une remise d'introduction de 50 % sans date de fin annoncée, avec 95 % de réduction sur les entrées en cache.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de Latent Space. Lire l'article original →
Les évaluations indépendantes confirment une position de tête, avec des nuances. Artificial Analysis donne à Argon 53 à son Intelligence Index, à égalité avec GPT-6 Astra et devant GPT-6.1 Sol (52). Au prix remisé, une tâche coûte 1,99 dollar contre 3,26 pour Astra, mais 3,98 dollars au tarif standard : l'économie vient du prix et non de l'efficacité, Argon consommant en moyenne 62 000 tokens de sortie par tâche contre 27 000 pour Astra. Le modèle prend la tête de l'AutomationBench-AA (77,5 %) mais n'obtient que 57 % sur Terminal Bench 4, derrière Sonnet 5.5, Opus 5.5 et Astra. Son taux d'hallucination de 15 % sur AA-Omniscience, contre 51 % pour Astra, s'accompagne d'une précision moindre (50 % contre 63 %). Vals le place premier de son indice à 68,9 %, avec 30 applications parfaites sur Vibe Code Bench contre 25 pour Opus 5. Il est aussi premier du Text Arena (1525) mais huitième du Code Arena WebDev.
Ces résultats comptent d'abord pour Google, qui était attendu au tournant après plusieurs versions Flash incrémentales et le remaniement de sa direction le mois dernier. Les déploiements internes en donnent une idée concrète : des agents Argon auraient libéré plus de 300 TiB de mémoire de centres de données et migreraient plus de 800 000 lignes de code noyau C/C++ vers Rust. Ils ont aussi remplacé 32 000 lignes de code SIMD d'un décodeur vidéo par du Rust sûr, rendant le portage existant 2,7 fois plus rapide à sortie identique. Google affirme enfin que des boucles d'agents internes ont contribué à résoudre la conjecture CK.
Ce lancement s'inscrit dans une course où OpenAI et Anthropic occupaient seuls, depuis plusieurs mois, le segment des modèles de pointe avec les familles Astra et Fable. Le choix d'une ouverture graduelle, d'abord via la cybersécurité, reflète la prudence croissante des laboratoires face aux capacités offensives de ces systèmes. Reste à voir si Argon tiendra ses promesses une fois ouvert au public, certains observateurs se montrant sceptiques sur la portée des chiffres annoncés.
Pas d'impact direct sur la France/UE