Google DeepMind dévoile Gemini 4 Argon, avec 1 million de tokens en sortie pour le code, le travail intellectuel et la cyberdéfense
Google DeepMind a dévoilé Gemini 4 Argon, son nouveau modèle de pointe et le premier de la génération Gemini 4. Conçu pour l'ingénierie logicielle de longue haleine, le travail intellectuel en entreprise (droit, finance) et la cyberdéfense, il peut produire jusqu'à 1 million de tokens en une seule réponse, contre 64 000 pour les modèles Gemini précédents. Le tarif de lancement est de 2 dollars par million de tokens en entrée et 10 dollars en sortie, avec une remise de 95 % sur les tokens en cache (0,10 dollar), avant un passage à 4 et 20 dollars. Sur les benchmarks comparés à GPT-6 Astra, Claude Opus 5.5 et Claude Fable 5.1, Argon domine 12 tests sur 18 et partage la première place sur un autre. Il atteint 77,9 % sur DeepSWE v1.1 (Opus 5.5 : 74,2 %, GPT-6 Astra : 74,1 %), 68,9 % sur le Vals Index, 51,3 % sur AutomationBench (Opus 5.5 : 42,5 %), 19,6 % sur le Harvey Legal Agent Benchmark (GPT-6 Astra : 5,4 %) et 91,7 % sur LVBench. Il reste derrière sur FrontierSWE v2 (55,0 % contre 65,5 % pour GPT-6 Astra), Terminal-Bench 4.0 (57,4 % contre 66,4 % pour Opus 5.5) et OSWorld-2.0 (69,2 % contre 72,6 %). Google n'a pas précisé la taille de la fenêtre de contexte en entrée.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Pour les développeurs, la sortie d'un million de tokens permet de mener de gros chantiers de refactorisation ou de rédiger de longs rapports sans fractionner le travail en plusieurs échanges, là où Claude Opus 5.5, Claude Fable 5.1 et GPT-6 Astra plafonnent à 128 000 tokens. Le coût reste un paramètre : une sortie complète revient à 10 dollars au tarif d'introduction, 20 ensuite. Selon Artificial Analysis, Argon égale GPT-6 Astra sur son Intelligence Index pour 60 % du coût par tâche, avec les prix remisés. En cybersécurité, Google a entraîné le modèle à trouver, valider et corriger seul des failles critiques. Il atteint 68 % sur CWE-bench v1, à égalité pour la première place, même si les modèles concurrents y sont évalués dans leurs propres environnements d'agents. Wiz l'utilise déjà via son initiative Scan for Good et a découvert une vulnérabilité critique dans un logiciel de santé employé par des hôpitaux du monde entier, que les précédents modèles de pointe n'avaient pas repérée, selon Google.
Google adopte un déploiement progressif. Le groupe participe au processus volontaire d'accès préalable des modèles proposé par le gouvernement américain, recueillera les retours de testeurs et ajustera ses garde-fous avant une diffusion élargie. Les défenseurs de confiance et les équipes internes reçoivent le modèle sans garde-fous cyber. Quatre chantiers de protection sont en cours : défenses contre les usages malveillants (cyber, risques CBRN) avec surveillance des activations dans le cadre du Frontier Safety Framework, résistance aux injections de prompt indirectes (où Argon mène le benchmark de Gray Swan), surveillance des désalignements dans le raisonnement et les actions, avec arrêt possible de l'exécution, et bacs à sable isolés pour les entraînements et évaluations à risque. En interne, des milliers d'employés utilisent déjà Argon : ses agents ont libéré plus de 300 TiB dans les centres de données (500 TiB à 1 PiB attendus), remplacé 32 000 lignes de code SIMD dans le portage Rust de libgav1, dont le décodeur tourne 2,7 fois plus vite à résultat identique, et migrent des bases de code C/C++.
Pas d'impact direct sur la France/UE