Gemini 3.6 Flash de Google vise a reduire les couts de tokens pour les agents en entreprise
Google a dévoilé cette semaine deux nouveaux modèles Gemini destinés à réduire les coûts et la latence des agents IA en entreprise : Gemini 3.6 Flash et Gemini 3.5 Flash-Lite, accompagnés d'une variante restreinte baptisée Gemini 3.5 Flash Cyber. Selon la documentation développeur de Google, 3.6 Flash génère 17% de tokens de sortie en moins que la version précédente 3.5 Flash, une baisse qui atteint jusqu'à 65% sur certains tests synthétiques comme le benchmark DeepSWE de Datacurve. Son tarif s'établit à 1,50 dollar par million de tokens en entrée et 7,50 dollars en sortie. Sur DeepSWE, le taux de réussite grimpe à 49% contre 37% pour son prédécesseur ; sur MLE Bench, le score passe de 49,7% à 63,9% ; et sur le test GDPval-AA v2 de Google, qui mesure des tâches de travail réelles plutôt que des exercices de code, 3.6 Flash atteint 1421 points contre 1349. Des entreprises comme Figma, Harvey et Hebbia utilisent déjà le modèle, respectivement pour accélérer les itérations de prototypage, traiter des documents juridiques et analyser des documents financiers bruts incluant graphiques et structures complexes. Google a aussi intégré un outil d'usage d'ordinateur directement dans l'API Gemini, avec un score OSWorld-Verified de 83% contre 78,4% auparavant.
Cette annonce répond à une contrainte économique concrète : un agent logiciel autonome qui tourne des milliers de fois par heure ne peut pas se permettre de générer des tokens superflus, chaque token supplémentaire ajoutant coût et délai à des workflows de production. Les équipes qui construisent des agents en arrière-plan, plutôt que de simples interfaces conversationnelles, privilégient le débit et la rapidité avant la taille du modèle. En proposant Gemini 3.5 Flash-Lite à seulement 0,30 dollar par million de tokens en entrée et 2,50 dollars en sortie, avec une vitesse de 350 tokens par seconde, Google permet aux entreprises de router les tâches simples vers un modèle économique et de réserver les modèles plus coûteux aux raisonnements complexes à plusieurs étapes.
Cette stratégie s'inscrit dans une course plus large entre fournisseurs de modèles pour dominer le marché des agents d'entreprise, un segment jugé plus lucratif que les interfaces de chat grand public. Google précise que Gemini 3.5 Pro reste en phase de test chez des partenaires avant un lancement complet, tandis que le pré-entraînement de la prochaine architecture Gemini 4 est déjà en cours. La variante Gemini 3.5 Flash Cyber, elle, vise un problème spécifique : les scanners automatisés détectent aujourd'hui des vulnérabilités plus vite que les équipes de sécurité ne peuvent les corriger, et ce modèle restreint est conçu pour valider et corriger le code concerné.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




