Aller au contenu principal
Gemini 3.5 Flash intègre le contrôle de l’ordinateur en natif : voici ce que ça change
LLMsLe Big Data2sem· 2 min de lecture

Gemini 3.5 Flash intègre le contrôle de l’ordinateur en natif : voici ce que ça change

Source originale ↗·

Google a annoncé le 24 juin 2026 l'intégration native du contrôle d'ordinateur directement dans Gemini 3.5 Flash, son modèle rapide et économique. Concrètement, le modèle peut désormais analyser une capture d'écran, identifier les éléments affichés, puis enchaîner des actions : cliquer sur un bouton, saisir du texte au clavier, faire défiler une page, ouvrir une application. Il fonctionne dans trois environnements : navigateur web, applications de bureau et applications mobiles. Sur le benchmark OSWorld-Verified, Gemini 3.5 Flash atteint un score de 78,4 %, ce qui le place devant plusieurs modèles concurrents selon les chiffres publiés par Google. Des partenaires comme Browserbase, Browser Use et UiPath ont salué l'équilibre entre rapidité, coût et fiabilité du système.

Ce qui change en profondeur, c'est la consolidation des capacités au sein d'un seul modèle. Jusqu'ici, le contrôle d'ordinateur était réservé à un modèle distinct baptisé Gemini 2.5 Computer Use. Les développeurs devaient donc orchestrer plusieurs modèles selon les tâches : recherche, appels d'API, interaction avec les interfaces. Avec Gemini 3.5 Flash, tout cohabite dans une même plateforme, ce qui simplifie radicalement la construction d'agents autonomes. Un agent pourra désormais réserver un billet, parcourir des documents contractuels, exécuter des tests logiciels ou agréger des informations depuis plusieurs applications, sans changement de contexte ni surcharge d'infrastructure. Pour les équipes de développement, c'est une réduction significative de la complexité architecturale, et potentiellement une accélération du passage à des automatisations ambitieuses dans des secteurs comme l'administration, le juridique ou la qualité logicielle.

Cette évolution s'inscrit dans une course industrielle autour des agents IA capables d'agir dans le monde réel, pas seulement de converser. OpenAI avec Operator, Anthropic avec Computer Use et Microsoft avec des intégrations dans Copilot avancent sur le même terrain. Google, en intégrant cette capacité à son modèle le plus déployé par les développeurs, cherche à imposer Gemini comme la plateforme d'agent de référence. La question de la sécurité reste centrale : un modèle qui manipule un ordinateur peut être détourné par des contenus malveillants. Google affirme avoir entraîné Gemini 3.5 Flash à résister aux attaques par injection de prompt, et propose aux entreprises deux garde-fous supplémentaires : une validation humaine obligatoire avant toute action sensible ou irréversible, et une interruption automatique en cas de détection d'injection indirecte. Ces protections réduisent le risque sans l'éliminer, et les conditions de déploiement responsable restent largement à définir à l'échelle de l'industrie.

Impact France/UE

L'intégration native du contrôle d'ordinateur dans un modèle grand public comme Gemini 3.5 Flash accélère la disponibilité d'agents IA autonomes pour les entreprises européennes, soulevant des questions de conformité avec l'AI Act pour les déploiements dans des secteurs sensibles comme l'administration ou le juridique.

💬 L'analyse de Mathieu

Ce qui change vraiment, c'est pas le contrôle d'ordinateur en lui-même (ça existait déjà dans Gemini 2.5 Computer Use), c'est que ça tient maintenant dans le modèle rapide et pas cher. Tu n'orchestres plus plusieurs modèles selon les tâches : tout cohabite au même endroit, ce qui rend enfin les agents autonomes viables pour des équipes sans budget infra démesuré. Reste à voir si les garde-fous contre l'injection de prompt tiennent vraiment quand c'est exposé en prod.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Google intègre le contrôle d'écran directement dans Gemini 3.5 Flash
1The Decoder 

Google intègre le contrôle d'écran directement dans Gemini 3.5 Flash

Google a intégré nativement la fonctionnalité "Computer Use" directement dans Gemini 3.5 Flash, son modèle rapide disponible via l'API Gemini. Cette capacité permet au modèle de percevoir l'écran d'un ordinateur, d'un navigateur ou d'un appareil mobile, et d'en prendre le contrôle de façon autonome pour accomplir des tâches. Sur le benchmark de référence OSWorld, qui évalue la capacité des modèles à naviguer et interagir avec des interfaces graphiques réelles, Gemini 3.5 Flash obtient un score de 78,4, le plaçant au même niveau que GPT-5.5 d'OpenAI. Pour les développeurs, cette intégration ouvre la voie à des agents capables d'automatiser des workflows complexes sans infrastructure supplémentaire : tests logiciels, automatisation de tâches bureautiques, navigation web pilotée par l'IA. En inscrivant le contrôle d'ordinateur directement dans le modèle plutôt que comme une surcouche externe, Google réduit la friction technique et rend ces capacités accessibles à un plus grand nombre d'équipes, y compris celles sans expertise spécialisée en IA agentique. La fonctionnalité "Computer Use" a été popularisée en octobre 2024 par Anthropic avec Claude, avant qu'OpenAI ne propose des capacités similaires avec GPT-4o. Google entre maintenant dans cette course avec un avantage différenciant : l'intégration native dans un modèle déjà massivement adopté pour sa rapidité et son faible coût. L'enjeu est considérable, car la capacité à orchestrer des agents autonomes opérant des logiciels existants représente l'une des prochaines frontières économiques de l'IA générative, et les trois grands acteurs se disputent désormais ce segment à armes presque égales.

UELes développeurs et entreprises françaises et européennes peuvent intégrer des capacités d'automatisation agentique directement via l'API Gemini 3.5 Flash, sans infrastructure supplémentaire, abaissant la barrière technique à l'adoption des agents IA.

LLMsOpinion
1 source
OpenAI met à jour GPT-5.5 Instant : voici qu’est-ce que ça change
2Le Big Data 

OpenAI met à jour GPT-5.5 Instant : voici qu’est-ce que ça change

OpenAI a déployé le 24 juin 2026 une nouvelle mise à jour de GPT-5.5 Instant, le modèle par défaut de ChatGPT. Il s'agit de la troisième évolution majeure depuis le lancement du modèle le 5 mai 2026, après des versions précédentes axées sur la réduction des erreurs et la clarté des réponses. Cette fois, l'entreprise vise explicitement à rendre les échanges "plus fun" et plus naturels. La mise à jour est d'abord accessible aux abonnés payants, avant un déploiement progressif vers les utilisateurs de la version gratuite. Concrètement, le modèle améliore sa capacité à identifier l'intention derrière une question, à maintenir la continuité d'une conversation sur plusieurs échanges, à gérer des requêtes contenant plusieurs contraintes simultanées, et à intégrer les corrections apportées par l'utilisateur sans simplement répéter la même réponse. Ces ajustements ciblent les usages les plus fréquents de ChatGPT, qui ne sont pas les démonstrations techniques mais les besoins du quotidien : planifier un voyage, comparer des produits, rédiger un message délicat ou clarifier ses idées. Pour des dizaines de millions d'utilisateurs qui interagissent avec ChatGPT plusieurs fois par semaine, une meilleure compréhension du contexte et des contraintes change directement la qualité de l'expérience. Le fait que le modèle réagisse mieux aux corrections est particulièrement significatif : cela réduit les allers-retours frustrants où l'IA ignore les précisions apportées et répète son raisonnement initial, un défaut régulièrement reproché aux assistants conversationnels. Derrière ces améliorations se profile une architecture nouvelle baptisée "Dreaming", qui permettrait au modèle de construire progressivement un profil de l'utilisateur au fil des conversations pour mieux adapter ses réponses. OpenAI s'engage depuis le début 2026 dans une cadence de mises à jour soutenue sur GPT-5.5 Instant, son modèle le plus utilisé, ce qui reflète une stratégie claire : maintenir ChatGPT comme standard de référence face à la concurrence directe de Google Gemini, Anthropic Claude et des assistants intégrés dans les systèmes d'exploitation comme Copilot de Microsoft. La bataille ne se joue plus uniquement sur les benchmarks de raisonnement, mais sur la fluidité perçue au quotidien, un terrain où la différence entre modèles devient de plus en plus difficile à mesurer objectivement pour l'utilisateur final.

LLMsOpinion
1 source
Gemini 3.5 Flash veut réduire les coûts IA des entreprises
3Le Big Data 

Gemini 3.5 Flash veut réduire les coûts IA des entreprises

Google a lancé Gemini 3.5 Flash lors de sa conférence I/O 2026, le 19 mai 2026, en le positionnant comme son modèle propriétaire le plus économique à ce jour. Le tarif annoncé est de 1,50 dollar par million de jetons, une réduction significative pensée pour les entreprises qui déploient des agents IA à grande échelle. En parallèle, Google a dévoilé plusieurs nouveaux produits : Gemini Spark, un agent personnel capable d'agir en arrière-plan dans Gmail, Docs, Sheets et Slides pour compiler des informations, organiser des événements ou mettre à jour des tableaux en temps réel ; Omni Flash ; et AntiGravity 2.0, une nouvelle version de sa plateforme multi-agents. Sundar Pichai, PDG de Google, a déclaré que certaines organisations ont déjà consommé leur budget annuel de jetons alors que l'année est à peine entamée, soulignant l'urgence du problème. L'enjeu est directement financier pour les directions IT. À mesure que les agents IA s'intègrent dans les outils métiers, les volumes de jetons consommés explosent et les coûts dépassent les budgets prévus. Gemini 3.5 Flash cible précisément ces usages quotidiens à grande échelle, là où des économies de quelques centimes par million de jetons peuvent représenter des millions de dollars pour un grand groupe. L'intégration native avec Google Workspace est présentée comme un levier supplémentaire : en limitant le recours aux API externes, elle réduit mécaniquement la facture. Le modèle économique devient ainsi aussi déterminant que les performances techniques, notamment pour convaincre les entreprises de franchir le pas de l'industrialisation de l'IA au-delà des preuves de concept. Cette offensive tarifaire de Google s'inscrit dans une dynamique de marché plus large. Anthropic a récemment baissé les tarifs de Claude Opus 4.6, et la montée en puissance des modèles open source comme Qwen d'Alibaba accentue la pression sur les grands acteurs. Les performances des modèles propriétaires commençant à converger, le prix s'impose comme un facteur différenciant majeur pour fidéliser les clients entreprises. Google cherche ainsi à tenir tête à OpenAI et Anthropic sur le segment de l'IA agentielle, un marché où la viabilité économique conditionne désormais l'adoption massive. La prochaine étape sera de voir si cette baisse tarifaire suffit à convaincre les grandes organisations de standardiser leurs workflows autour de l'écosystème Google, ou si la concurrence répondra rapidement avec des ajustements similaires.

UELes entreprises européennes déployant des agents IA à grande échelle sur Google Workspace pourraient réduire significativement leurs coûts de jetons grâce à ce nouveau tarif.

LLMsOpinion
1 source
Gemini 3.5 Flash pourrait être assez rapide pour que l'IA générative devienne vraiment utile
4Ars Technica AI 

Gemini 3.5 Flash pourrait être assez rapide pour que l'IA générative devienne vraiment utile

Google a présenté Gemini 3.5 Flash lors de sa conférence I/O 2026, avec un déploiement immédiat sur une large gamme de produits maison. Le modèle succède aux branches 3.0 et 3.1 publiées au cours de l'année écoulée, et Google affirme une fois de plus que sa nouvelle version Flash surpasse le modèle Pro de la génération précédente. Tulsee Doshi, directrice senior de la gestion produit pour Gemini, a précisé que les innovations de Gemini 3.5 Flash sont intégrées dans de multiples produits Google, et que ce lancement n'est qu'un début. Ce qui distingue ce modèle de ses prédécesseurs, selon Google, c'est l'équilibre inédit qu'il atteint entre puissance et efficacité. Gemini 3.5 Flash offrirait un niveau d'intelligence comparable aux meilleurs modèles du marché tout en étant suffisamment économe pour rendre viables les tâches agentiques complexes à grande échelle. Concrètement, cela signifie que des workflows automatisés impliquant plusieurs étapes, de nombreux appels au modèle et un traitement intensif pourraient désormais s'exécuter à un coût et une vitesse acceptables pour un déploiement en production. C'est précisément ce qui avait freiné l'adoption massive des agents IA jusqu'ici. Depuis un an, Google suit une cadence soutenue de mises à jour alternant entre modèles Flash et Pro, chaque nouvelle version Flash étant présentée comme plus performante que le Pro précédent. Cette progression rapide reflète une compétition acharnée avec OpenAI, Anthropic et Meta, tous engagés dans une course à l'efficacité pour rendre l'IA générative économiquement viable à l'échelle industrielle. Le fait que Google intègre Gemini 3.5 Flash directement dans ses produits grand public, plutôt que de le réserver à l'API, suggère une confiance accrue dans la maturité du modèle et une volonté de différencier ses services face à des concurrents qui misent sur des intégrations similaires.

UELes développeurs et entreprises européennes utilisant l'API Gemini bénéficieront de coûts réduits pour les workflows agentiques complexes, sans impact réglementaire ou institutionnel direct.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic