Aller au contenu principal
LLMs · Actu ·

Gemini 3.6 Flash de Google vise a reduire les couts de tokens pour les agents en entreprise

Google a dévoilé cette semaine deux nouveaux modèles Gemini destinés à réduire les coûts et la latence des agents IA en entreprise : Gemini 3.6 Flash et Gemini 3.5 Flash-Lite, accompagnés d'une variante restreinte baptisée Gemini 3.5 Flash Cyber. Selon la documentation développeur de Google, 3.6 Flash génère 17% de tokens de sortie en moins que la version précédente 3.5 Flash, une baisse qui atteint jusqu'à 65% sur certains tests synthétiques comme le benchmark DeepSWE de Datacurve. Son tarif s'établit à 1,50 dollar par million de tokens en entrée et 7,50 dollars en sortie. Sur DeepSWE, le taux de réussite grimpe à 49% contre 37% pour son prédécesseur ; sur MLE Bench, le score passe de 49,7% à 63,9% ; et sur le test GDPval-AA v2 de Google, qui mesure des tâches de travail réelles plutôt que des exercices de code, 3.6 Flash atteint 1421 points contre 1349. Des entreprises comme Figma, Harvey et Hebbia utilisent déjà le modèle, respectivement pour accélérer les itérations de prototypage, traiter des documents juridiques et analyser des documents financiers bruts incluant graphiques et structures complexes. Google a aussi intégré un outil d'usage d'ordinateur directement dans l'API Gemini, avec un score OSWorld-Verified de 83% contre 78,4% auparavant.

2 min de lecturePertinence 50

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de AI News. Lire l'article original →

Également couvert par VentureBeat AI.

Cette annonce répond à une contrainte économique concrète : un agent logiciel autonome qui tourne des milliers de fois par heure ne peut pas se permettre de générer des tokens superflus, chaque token supplémentaire ajoutant coût et délai à des workflows de production. Les équipes qui construisent des agents en arrière-plan, plutôt que de simples interfaces conversationnelles, privilégient le débit et la rapidité avant la taille du modèle. En proposant Gemini 3.5 Flash-Lite à seulement 0,30 dollar par million de tokens en entrée et 2,50 dollars en sortie, avec une vitesse de 350 tokens par seconde, Google permet aux entreprises de router les tâches simples vers un modèle économique et de réserver les modèles plus coûteux aux raisonnements complexes à plusieurs étapes.

Cette stratégie s'inscrit dans une course plus large entre fournisseurs de modèles pour dominer le marché des agents d'entreprise, un segment jugé plus lucratif que les interfaces de chat grand public. Google précise que Gemini 3.5 Pro reste en phase de test chez des partenaires avant un lancement complet, tandis que le pré-entraînement de la prochaine architecture Gemini 4 est déjà en cours. La variante Gemini 3.5 Flash Cyber, elle, vise un problème spécifique : les scanners automatisés détectent aujourd'hui des vulnérabilités plus vite que les équipes de sécurité ne peuvent les corriger, et ce modèle restreint est conçu pour valider et corriger le code concerné.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Google lance Gemini 3.7 Flash pour le code et les agents, avec 50% de reduction au lancement48VentureBeat AILLMs 02Google publie Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber, un tier Flash moins cher et plus efficace en tokens pour les charges de travail à base d'agents41MarkTechPostLLMs 03Gemini 3.5 Flash veut réduire les coûts IA des entreprises49Le Big DataLLMs 
Dossier · GeminiSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.