Aller au contenu principal

Google Cloud· sujet

199 articlesmis à jour le 20 juillet 2026

Suivi de l'actualité IA de Google Cloud : Vertex AI, modèles Gemini, infrastructure, annonces et déploiements pour les entreprises.

Hub d'actualité sur Google Cloud, agrégé en continu depuis 72 sources éditoriales. Pour les analyses long-form, voir /analyses.

Le pouls du sujet · 30 derniers jours

données Le Fil IA
26 46%
articles (vs 30j préc.)
3.1%
de la couverture IA
Souvent associé à

Mesuré sur notre corpus de 50+ sources, fenêtre glissante de 30 jours. Part de voix = part des articles IA de la période mentionnant Google Cloud. Voir le Baromètre IA complet

À retenir · 30 derniers jours

Google Cloud occupe une place particulière dans la course à l'IA : ce n'est ni un laboratoire de modèles pur, ni un simple hébergeur. C'est l'endroit où Google transforme sa recherche (Gemini, DeepMind) en produits que les entreprises peuvent réellement déployer. Le trio TPU maison, modèles Gemini intégrés et offre cloud managée lui donne un avantage rare : maîtriser toute la chaîne, du silicium à l'API facturée à l'usage.

Pour un décideur, c'est ce qui compte au quotidien. Google Cloud est l'un des trois fournisseurs (avec AWS et Azure) où se jouent les vrais choix d'infrastructure IA : sur quel cloud entraîner, où faire tourner l'inférence, comment respecter les contraintes de localisation des données en Europe. Vertex AI, Gemini Enterprise et les briques d'agents y sont les outils concrets que les équipes techniques manipulent, au-delà des annonces de keynote.

Sa position durable tient à cette intégration verticale et à une base installée massive (Workspace, Search, Android) qui sert de terrain de déploiement naturel pour ses modèles.

Dans ce hub, on suit la trajectoire de fond : capacité des TPU face aux GPU Nvidia, montée en puissance de Vertex et des agents, tarification de l'inférence et garanties de souveraineté pour les clients européens.

Analyses long-form sur Google Cloud

Quand un sujet mérite un format long, c'est ici.

Toute l'actualité Google Cloud

Flux automatique. Articles classés par pertinence, agrégés en continu.

1VentureBeat AI OutilsOutil

L'écart de contexte en IA : les entreprises ont un problème de confiance, pas de recherche, et la plupart n'ont pas encore la solution

Une enquête menée par VentureBeat auprès de 101 entreprises de plus de 100 salariés, réalisée en juin 2026 dans le cadre de sa série Pulse Research, révèle que 57% des organisations ont vu leurs agents IA produire des réponses confiantes mais fausses au cours des six derniers mois, un problème directement lié à un contexte métier manquant ou incohérent. Plus de la moitié d'entre elles disent que l'incident s'est reproduit plusieurs fois. La génération augmentée par récupération, ou RAG, reste la principale source de contexte pour les agents, citée par 38% des entreprises, davantage que toute autre méthode. Côté outils, les solutions de récupération natives des grands fournisseurs dominent déjà le marché : le file search d'OpenAI est utilisé par 40% des entreprises et Vertex AI Search de Google par 38%, devançant les bases de données vectorielles spécialisées qui avaient pourtant défini cette catégorie technologique ces dernières années. L'échantillon, composé pour l'essentiel d'entreprises de taille moyenne (31% comptent entre 251 et 1000 salariés, 31% entre 101 et 250), inclut des répondants à fort pouvoir de décision, puisque 46% sont décideurs finaux et 26% occupent un rôle de recommandation ou d'influence sur les achats. Ce décalage entre l'assurance affichée par les agents et la fiabilité réelle de leur socle de données, que l'étude nomme le "context gap", n'est pas anecdotique. Avec le RAG comme source de contexte dominante, toute lacune ou incohérence dans la récupération d'information se traduit mécaniquement par des erreurs habillées de l'autorité apparente de l'agent, un risque particulièrement sensible pour des secteurs comme la santé (11% de l'échantillon) ou la finance, où une réponse erronée mais formulée avec assurance peut avoir des conséquences opérationnelles ou réglementaires. Face à ce constat, 58% des entreprises interrogées disent déjà exploiter, ou être en train de construire, une couche sémantique gouvernée censée fiabiliser l'accès des agents aux données internes, mais cette infrastructure reste, pour la majorité d'entre elles, encore hors production. Le marché montre par ailleurs une tension entre les intentions affichées et les usages réels. Si les entreprises anticipent une généralisation de la récupération hybride d'ici fin 2026 (34% des réponses), une majorité relative de 36% affirme vouloir conserver des outils spécialisés indépendants plutôt que de tout consolider chez un seul fournisseur, alors même que 57% prévoient de changer de fournisseur ou d'en ajouter un dans l'année à venir. Autrement dit, les achats penchent vers les solutions natives d'OpenAI ou de Google, tandis que le discours stratégique continue de vanter l'indépendance technologique. Menée en un seul cycle trimestriel sans possibilité de comparaison mensuelle, et reposant sur un échantillon volontaire de taille modeste, cette étude doit être lue comme un signal directionnel sur l'état de confiance des entreprises envers leurs agents IA, plutôt que comme une mesure statistique définitive.

1 source
2VentureBeat AI 

Une IA juge désormais chaque action des agents de Rubrik, selon sa responsable IA à VB Transform 2026, mais personne n'a vérifié si elle juge juste

Rubrik, entreprise cotée en bourse spécialisée dans la sécurité des données, a dévoilé lors d'un entretien à VB Transform 2026 à Menlo Park que ses agents IA internes fonctionnent désormais en "mode YOLO", sans validation humaine préalable, sous la surveillance d'une seconde intelligence artificielle chargée d'arbitrer chaque action. Dev Rishi, directeur général de l'IA chez Rubrik, a raconté qu'à une table ronde de RSSI organisée par le responsable de la sécurité informatique d'Anthropic, les quatorze participants avaient tous levé la main pour confirmer disposer de politiques de gouvernance IA écrites, mais que la question suivante, sur leur application concrète, avait déclenché des rires gênés. Chez Rubrik, le fondateur et directeur technique a poussé à activer ce mode autonome pour les agents, remplaçant l'approbation humaine par SAGE, le Semantic AI Governance Engine, un moteur intégré à Rubrik Agent Cloud qui analyse l'intention sémantique de chaque action et la valide ou la rejette selon des règles rédigées en langage naturel. Cette décision fait suite à l'échec du mode manuel: lors du déploiement pilote de Claude Code et Cowork, chaque commande devait être validée individuellement par l'employé, générant un fil Slack de 120 messages de contestation, les développeurs comparant l'exercice à cliquer aveuglément sur les conditions d'utilisation d'iTunes. Cette bascule illustre un problème plus large: selon une étude Rubrik Zero Labs menée en avril auprès de plus de 1 600 responsables IT et sécurité, environ 80% d'entre eux constatent que la surveillance et la validation des actions des agents prennent plus de temps que ce que ces agents sont censés faire gagner. Une recherche VentureBeat Pulse présentée le même jour à la conférence confirme ce constat: deux tiers des entreprises, soit 66%, autorisent déjà ou préparent activement un déploiement en production sans aucune revue humaine. Pour Rishi, l'enjeu n'est plus de savoir si un agent peut agir seul, mais s'il le doit, une distinction qu'il juge trop souvent négligée par les organisations pressées d'automatiser. Rishi a rejoint Rubrik via le rachat de Predibase, la startup d'infrastructure d'IA générative qu'il codirigeait jusqu'en juin 2025, après un passage chez Google sur l'équipe à l'origine de Vertex AI et un rôle de premier product manager chez Kaggle, dont il a accompagné la croissance d'un à dix millions d'utilisateurs. Diplômé de Harvard en informatique, il a mené près de 200 entretiens avec des clients issus du Global 2000 durant ses trois premiers mois et demi chez Rubrik, découvrant que le principal frein à la rentabilité des projets d'IA n'était ni le coût ni la latence, mais l'incapacité à obtenir une validation sécurité et risque, un constat qui a directement motivé la conception de SAGE, dont l'efficacité réelle n'a toutefois pas encore été mesurée de façon indépendante.

SécuritéActu
1 source
Google Cloud remplace RAG et embeddings par un agent de mémoire continue sur Gemini 3.1 Flash-Lite
3MarkTechPost 

Google Cloud remplace RAG et embeddings par un agent de mémoire continue sur Gemini 3.1 Flash-Lite

Je remarque que le texte source contient, après les premiers paragraphes factuels, du code JavaScript d'un widget de démonstration interactif (variables SAMPLES, CONS, etc.) qui n'est pas du contenu éditorial, je l'ignore et me base uniquement sur les faits réels de l'article. Google Cloud a publié un nouvel exemple dans son dépôt generative-ai baptisé Always-On Memory Agent, un agent de référence conçu pour traiter la mémoire comme un processus permanent plutôt que comme une simple réponse ponctuelle. Contrairement à la majorité des agents conversationnels actuels, qui traitent une requête puis oublient tout le contexte, ce système tourne en continu, vingt-quatre heures sur vingt-quatre, sous la forme d'un agent d'arrière-plan. Il s'appuie sur le Google ADK (Agent Development Kit) et sur le modèle Gemini 3.1 Flash-Lite, choisi pour sa faible latence et son coût réduit, deux critères essentiels pour un traitement continu en tâche de fond. Fait notable, l'architecture se passe entièrement de base de données vectorielle et d'embeddings : c'est le modèle de langage lui-même qui lit, analyse et écrit une mémoire structurée directement dans une base SQLite. Cette approche change la manière dont un agent IA peut retenir et exploiter l'information sur la durée. Plutôt que de dépendre d'une recherche par similarité vectorielle (la méthode RAG classique), le système construit une compréhension qui évolue dans le temps, y compris pendant les périodes d'inactivité, sans qu'aucune requête ne soit envoyée. Pour les entreprises qui déploient des assistants IA destinés à accompagner des utilisateurs sur plusieurs semaines ou mois, cela représente une piste concrète pour réduire les coûts d'infrastructure liés aux bases vectorielles tout en gagnant en cohérence : l'agent peut citer précisément les identifiants des souvenirs qu'il utilise pour justifier ses réponses, ce qui renforce la traçabilité et la confiance dans les résultats produits. Sur le plan technique, l'architecture repose sur un orchestrateur qui distribue chaque requête entre trois sous-agents spécialisés, chacun disposant de ses propres outils de lecture et d'écriture sur la base de mémoire. L'IngestAgent traite les contenus entrants grâce aux capacités multimodales de Gemini, en extrayant résumé, entités, thématiques et un score d'importance, qu'il consigne dans une table de mémoires. Le ConsolidateAgent, lui, se déclenche automatiquement toutes les trente minutes par défaut : à la manière d'un cycle de sommeil, il relit les mémoires non consolidées, identifie des liens entre elles et rédige une synthèse accompagnée d'un insight clé. Enfin, le QueryAgent répond aux questions en s'appuyant sur l'ensemble des mémoires et des synthèses déjà produites. Ce projet s'inscrit dans une tendance plus large du secteur, où plusieurs acteurs cherchent à dépasser les limites du RAG traditionnel pour donner aux agents IA une mémoire véritablement persistante et évolutive.

💬 Sur le papier, se passer complètement des embeddings et de la base vectorielle, ça fait gagner en coûts d'infra et en traçabilité (l'agent peut citer précisément quel souvenir justifie sa réponse). Le vrai move, c'est de faire porter la mémoire par le LLM lui-même plutôt que par une couche de recherche externe : ça change la nature du problème, on passe d'une recherche de similarité à une compréhension qui se consolide dans le temps, façon cycle de sommeil toutes les trente minutes. Reste à voir si SQLite + trois sous-agents tient la charge sur des mois d'usage réel, pas juste sur une démo GitHub.

OutilsOutil
1 source
Google temporise avec Gemini 3.5 Pro : le lancement aurait été repoussé
4Le Big Data 

Google temporise avec Gemini 3.5 Pro : le lancement aurait été repoussé

Google prendrait plusieurs mois de retard sur le lancement de Gemini 3.5 Pro, son modèle d'intelligence artificielle le plus avancé. Présenté officiellement lors de la conférence Google I/O en mai 2026, ce modèle devait initialement arriver dès le mois de juin. Deux mois plus tard, aucune sortie publique n'a eu lieu. Selon un rapport de Bloomberg publié le 16 juillet 2026 par les journalistes Davey Alba et Julia Love, les résultats obtenus pendant l'entraînement du modèle n'auraient pas satisfait les équipes internes, en particulier sur les tâches liées au codage informatique. Une source proche du dossier évoque des résultats jugés "décevants". Face à ce constat, Google aurait lancé fin juin une nouvelle phase d'entraînement accompagnée d'une mise à jour des données utilisées, revoyant ainsi une partie du développement entre la présentation de mai et la date de lancement initialement prévue. L'entreprise n'a pas confirmé publiquement ces informations, mais a reconnu tester Gemini 3.5 Pro ainsi qu'une version améliorée de Gemini Flash et d'autres modèles auprès de partenaires sélectionnés, sans communiquer de nouvelle date de sortie. Ce retard illustre à quel point le développement logiciel assisté par IA est devenu un terrain de bataille stratégique entre les grands acteurs du secteur. OpenAI multiplie les annonces autour de GPT-5.6, Anthropic avance avec Claude Fable 5, tandis que xAI et Mistral cherchent eux aussi à imposer leurs assistants de codage. Pour Google, l'enjeu est d'autant plus sensible que l'entreprise utilise déjà massivement l'IA en interne : en avril 2026, le PDG Sundar Pichai indiquait que près de 75 % du nouveau code produit par ses équipes était généré avec l'aide de l'IA, contre environ 50 % quelques mois plus tôt. Un lancement raté de Gemini 3.5 Pro sur le codage exposerait donc Google à une contradiction difficile à assumer face à ses concurrents comme face à ses propres usages internes. Ce paradoxe s'explique aussi par une organisation interne encore fragmentée. Plusieurs équipes développent leurs propres outils d'IA pour le code, notamment Google DeepMind, Vertex AI et Android Studio, et l'unification de ces solutions reste un chantier en cours. Certains ingénieurs maison resteraient par ailleurs prudents face à une dépendance excessive au code généré automatiquement. Dans ce contexte, retarder la sortie de Gemini 3.5 Pro peut décevoir les utilisateurs qui l'attendaient depuis mai, mais ce choix vise avant tout à éviter un lancement raté qui aurait fragilisé la position de Google dans la course à l'IA générative appliquée au développement logiciel.

💬 Google temporise avec Gemini 3.5 Pro parce que les résultats sur le codage n'étaient pas au niveau, et ça en dit long : quand un labo repousse son propre modèle phare deux mois après l'avoir présenté sur scène, c'est que le gap avec la concurrence sur le code s'est révélé plus large que prévu en interne. Pichai qui annonce 75% de code généré par IA chez Google, et son propre modèle de référence qui coince sur cette tâche précise, ça fait une drôle de dissonance. Bonne nouvelle quand même : ils testent en vrai avant de sortir un truc à moitié cuit, plutôt que de lâcher un Gemini 3.5 Pro à la Bard.

LLMsActu
1 source
L'écart de contexte de l'IA en entreprise : un problème de confiance, pas de recherche d'information
5VentureBeat AI 

L'écart de contexte de l'IA en entreprise : un problème de confiance, pas de recherche d'information

Le paysage de l'infrastructure RAG (retrieval-augmented generation) en entreprise traverse une crise de confiance, selon une étude menée par VentureBeat Pulse Research auprès de 101 entreprises en juin 2026. Cette enquête révèle que 57% des organisations ont constaté, au cours des six derniers mois, que leurs agents IA produisaient des réponses confiantes mais erronées, directement liées à un contexte métier manquant ou incohérent, et plus de la moitié d'entre elles ont vécu ce problème à plusieurs reprises. La récupération d'informations (retrieval) constitue déjà la principale source de contexte pour 38% des entreprises interrogées, davantage que toute autre approche. Fait notable, les outils de récupération natifs des grands fournisseurs, comme le file search d'OpenAI (40%) et Vertex AI Search de Google (38%), devancent désormais toutes les bases de données vectorielles spécialisées qui ont pourtant défini cette catégorie technologique. Une majorité de 58% des entreprises construisent déjà, ou ont déjà mis en place, une couche sémantique gouvernée censée résoudre ce problème, mais pour la plupart, cette infrastructure n'est pas encore opérationnelle en production. Ce décalage, que les auteurs de l'étude nomment le "context gap", a des répercussions concrètes sur la fiabilité des systèmes d'IA déployés en entreprise. Quand les agents conversationnels s'appuient sur des données de récupération incomplètes ou incohérentes, ils continuent de répondre avec la même assurance apparente, ce qui rend leurs erreurs particulièrement dangereuses car elles passent pour des faits vérifiés. Pour les équipes techniques et les décideurs, cela signifie que la sophistication apparente d'un agent IA ne garantit en rien la fiabilité de ses réponses, et que la gouvernance des données devient aussi critique que la performance du modèle lui-même. L'étude révèle aussi un paradoxe stratégique: alors que 34% des entreprises anticipent une domination du retrieval hybride d'ici fin 2026, une pluralité de 36% affirme vouloir conserver des outils autonomes best-of-breed plutôt que de tout centraliser chez un seul fournisseur, et 57% prévoient de changer ou d'ajouter un fournisseur dans l'année à venir. Cette tension entre les préférences déclarées et les usages réels illustre les enjeux plus larges qui traversent actuellement le secteur de l'IA d'entreprise. Les organisations achètent massivement des solutions natives proposées par les grands fournisseurs de modèles, tout en revendiquant un attachement à l'indépendance technologique, un signe que le marché n'a pas encore tranché entre commodité et contrôle. L'échantillon de l'étude, concentré sur les entreprises de taille moyenne (entre 101 et 1000 salariés pour 62% des répondants), avec une forte proportion de décideurs (46% ont l'autorité finale d'achat), donne une lecture directionnelle plutôt qu'une mesure précise du marché. Le secteur technologique domine l'échantillon (20%), suivi par la santé (11%). Reste à voir si les entreprises parviendront à combler ce fossé de confiance avant que la dépendance croissante aux agents IA ne transforme ces erreurs silencieuses en incidents coûteux.

OutilsActu
1 source
Grok Build envoyait des dépôts vers le cloud sans le consentement des développeurs
6Next INpact 

Grok Build envoyait des dépôts vers le cloud sans le consentement des développeurs

Le 10 juillet 2026, le chercheur en sécurité connu sous le pseudonyme Cereblab a documenté un comportement problématique de Grok Build, l'assistant en ligne de commande dédié au code développé par xAI, l'entreprise d'Elon Musk. En installant un proxy réseau pour surveiller les échanges de sa machine, il a constaté que sur un dossier de travail de 12 Go, 5,1 Go de données non manipulées durant la session en cours avaient été envoyées vers un bucket hébergé sur Google Cloud, sans consentement préalable. Parmi les fichiers transférés figurait un fichier .env contenant des variables sensibles, notamment des clés d'accès à des interfaces de programmation, envoyé sans caviardage automatique des secrets. Le chercheur a identifié deux canaux distincts : un canal « modèle » limité à 192 ko de données pour les traitements, et un canal « stockage » ayant chargé les 5,1 Go restants. Même en demandant explicitement à l'outil de ne lire aucun fichier, l'envoi d'un lot complet vers Google Cloud a persisté. En reproduisant l'expérience avec Claude Code d'Anthropic, Codex d'OpenAI et Gemini de Google, Cereblab n'a constaté aucun transfert de données comparable. Cette découverte soulève une inquiétude majeure pour les développeurs qui utilisent des assistants IA en ligne de commande sur du code sensible ou propriétaire : la confiance placée dans ces outils repose sur l'hypothèse que les fichiers ne quittent la machine locale que pour les traitements strictement nécessaires. Un fichier .env exposé sans filtrage peut suffire à compromettre des clés API, des accès à des bases de données ou des identifiants cloud, avec des conséquences potentiellement coûteuses pour les entreprises concernées. Le fait que le comportement ait persisté même après une instruction explicite de ne rien lire renforce le doute sur le niveau de contrôle qu'un utilisateur peut réellement exercer sur ces agents. Plusieurs développeurs ont confirmé sur les réseaux sociaux avoir observé le même phénomène, notamment via la commande cat ~/.grok/logs/unified.jsonl | grep repo_state.upload, qui permet de vérifier si un dépôt a été téléchargé à son insu. Face à la controverse, xAI a réagi le 14 juillet en désactivant côté serveur le chargement automatique des dépôts, via un paramètre disablecodebaseupload réglé sur true, et en ajoutant une commande /privacy testée par Cereblab, qui s'est révélée être un simple réglage de conservation des données plutôt qu'un véritable blocage de l'envoi. La veille, sur X, l'entreprise avait affirmé qu'aucune donnée n'était conservée pour les clients ayant opté pour un fonctionnement sans rétention (ZDR), et que l'activation du nouveau paramètre supprimait les données déjà synchronisées. Elon Musk a minimisé la portée de l'incident tout en promettant, par précaution, la suppression de toutes les données précédemment envoyées. L'examen de la dernière version de Grok Build montre toutefois que la fonction d'envoi reste intégrée au client : xAI n'a pas supprimé cette capacité, mais s'est contenté d'en modifier la politique d'activation côté serveur, laissant ouverte la possibilité d'une réactivation future sans que les utilisateurs en soient nécessairement informés.

UELes developpeurs francais et europeens utilisant Grok Build s'exposent a une fuite de leurs cles API et secrets stockes dans des fichiers .env, sans qu'aucune entreprise francaise ne soit directement citee dans l'incident.

💬 Un CLI qui balance 5 Go de ton dépôt vers Google Cloud sans prévenir, .env et clés API compris, moi j'appelle plus ça un bug de confidentialité qu'un simple couac. xAI a coupé le chargement automatique côté serveur, mais le code d'envoi reste planqué dans le client : ils ont fermé le robinet sans retirer le tuyau. Selon Le Fil IA, tant qu'un éditeur ne supprime pas la fonction elle-même, un paramètre désactivé aujourd'hui peut se rallumer demain sans que tu en saches rien.

SécuritéActu
1 source
Samsung mise sur Gemini Enterprise : Google Cloud accélère l’essor de l’IA agentique en entreprise
7Le Big Data 

Samsung mise sur Gemini Enterprise : Google Cloud accélère l’essor de l’IA agentique en entreprise

Google Cloud et Samsung Electronics ont annoncé le déploiement mondial de Gemini Enterprise auprès des employés de la division Device eXperience (DX) du groupe sud-coréen, celle qui pilote les smartphones Galaxy, les téléviseurs et l'électroménager. Présenté par Google Cloud comme le plus important déploiement d'IA d'entreprise jamais réalisé en Corée, cet accord installe l'application comme point d'accès unifié aux bases de connaissances internes de Samsung, dispersées jusqu'ici sur plusieurs plateformes. Concrètement, les salariés pourront rechercher, synthétiser et exploiter ces informations sans naviguer manuellement d'un système à l'autre. Ruth Sun, présidente de Google Cloud Korea, décrit l'objectif comme le passage d'une simple amélioration de productivité à une véritable intelligence opérationnelle, l'IA devenant un outil intégré aux processus métier plutôt qu'un assistant de rédaction. L'ensemble fonctionnera dans un environnement Google Cloud dédié exclusivement à la division DX, afin de garder les données sensibles dans un périmètre contrôlé. Cette annonce marque une bascule stratégique pour l'industrie de l'IA en entreprise. Depuis deux ans, les fournisseurs ont surtout vendu des chatbots capables de répondre à des questions ou de résumer des documents. Avec ce partenariat, Google Cloud pousse Samsung vers l'étape suivante, celle des agents IA autonomes, capables de consulter plusieurs sources, d'enchaîner des raisonnements et de déclencher des actions dans différents systèmes informatiques. Pour un groupe de la taille de Samsung, cela représente un test grandeur nature de la capacité de l'IA agentique à transformer réellement des workflows internes, au-delà de l'effet vitrine. Pour les autres grandes entreprises qui observent le marché, ce déploiement sert de cas d'usage de référence pour juger si l'IA agentique tient ses promesses en conditions réelles, tout en répondant à une préoccupation partagée par tous les grands groupes : exploiter un patrimoine documentaire volumineux sans perdre la maîtrise des données sensibles. Le projet s'inscrit dans la stratégie plus large de Google autour de Vertex AI et de ses outils Agent Builder, qui visent à démocratiser la création d'agents IA au sein des entreprises. Le partenariat prévoit ainsi une plateforme combinant des outils low-code et no-code, destinés aux équipes RH, marketing ou conformité pour construire leurs propres assistants sans compétences de programmation avancées, et un environnement plus complet pour les ingénieurs souhaitant concevoir des modèles personnalisés. Cette approche traduit une volonté de sortir la création d'agents IA du seul giron des équipes techniques. Reste à voir comment ce déploiement à grande échelle chez Samsung se traduira concrètement dans les mois à venir, et s'il incitera d'autres géants industriels, notamment en Asie, à suivre une trajectoire similaire face à la concurrence de Microsoft et d'autres fournisseurs cloud sur ce même terrain de l'IA agentique.

BusinessActu
1 source
Marché entreprise : les acteurs de l’IA misent sur des ingénieurs placés chez le client
8Next INpact 

Marché entreprise : les acteurs de l’IA misent sur des ingénieurs placés chez le client

Microsoft et Amazon ont annoncé coup sur coup la création de divisions dédiées au Forward Deployed Engineering (FDE), c'est-à-dire au placement direct d'ingénieurs IA chez leurs clients entreprise. Chez Microsoft, cette nouvelle entité baptisée Microsoft Frontier Company doit mobiliser 2,5 milliards de dollars d'investissement et réunir 6 000 experts métier et ingénieurs. Selon Judson Althoff, CEO de Microsoft Commercial Business, elle doit devenir « l'organisation d'ingénierie la plus importante, compétente et orientée vers l'obtention de résultats concrets et mesurables pour les clients », chargée de co-concevoir et déployer des systèmes d'IA à grande échelle avec les entreprises clientes. De son côté, Amazon Web Services a annoncé plus tôt dans la semaine sa propre division Forward Deployed Engineering, avec un investissement de 1 milliard de dollars. OpenAI avait ouvert le bal dès le mois de mai en rachetant l'ESN Tomoto pour créer The OpenAI Deployment Company, financée par 19 investisseurs pour plus de 4 milliards de dollars. Une semaine auparavant, Anthropic avait dévoilé un dispositif comparable, en s'associant à des acteurs financiers pour bâtir une structure commerciale où ses ingénieurs travaillent aux côtés d'intégrateurs partenaires afin d'accélérer le déploiement de projets fondés sur les modèles Claude, sans que le montant investi soit précisé. Google Cloud a lui aussi annoncé début juin son intention de recruter massivement sur ce créneau. Cette course au FDE traduit un changement de modèle économique pour les géants de l'IA, qui ne se contentent plus de vendre des accès API ou du cloud mais placent désormais des compétences humaines directement dans les équipes de leurs clients pour garantir des résultats métiers concrets. Pour les entreprises, cela promet des déploiements plus rapides et mieux adaptés à leurs cas d'usage réels, mais soulève aussi la question du contrôle : Microsoft insiste ainsi sur sa capacité à proposer des modèles OpenAI, Anthropic, Microsoft AI ou open source « sans jamais perdre le contrôle au profit d'un acteur unique », signe que la crainte d'un enfermement chez un fournisseur unique est bien présente chez les clients. Le concept de FDE a été popularisé par Palantir, qui en a fait une marque de fabrique jusque dans des contrats sensibles, à l'image de la DGSI française, où la société française ChapsVision vient justement de lui souffler le contrat en mettant en avant cette même approche de proximité terrain. Face à la difficulté persistante des entreprises à transformer leurs projets d'IA en résultats mesurables, les hyperscalers et laboratoires d'IA généralisent désormais cette méthode, ouvrant une nouvelle guerre des talents autour des ingénieurs de déploiement.

UELa societe francaise ChapsVision illustre cette dynamique en remportant face a Palantir le contrat de la DGSI grace a une approche similaire de deploiement d'ingenieurs sur le terrain.

💬 Microsoft, Amazon, Google, OpenAI, Anthropic : tout le monde envoie ses ingénieurs bosser directement chez le client, et ça dit tout du vrai problème de l'IA en entreprise. Ce n'est plus une histoire d'accès API, c'est une guerre de service après-vente à coups de milliards, parce que sans quelqu'un sur place pour faire tourner le truc, les projets IA restent des PowerPoint. Et ce qui devrait alerter les DSI, c'est que ChapsVision vient de piquer le contrat de la DGSI à Palantir avec exactement la même recette : la vraie bataille n'est plus le modèle, c'est qui a les mains dans le cambouis.

BusinessOpinion
1 source
Dans l’ombre de Mythos et Fable ressuscités, la Chine progresse rapidement
9Next INpact 

Dans l’ombre de Mythos et Fable ressuscités, la Chine progresse rapidement

Anthropic a annoncé le 30 juin le retour de Mythos 5, suivi de Fable 5 dès le 1er juillet, mettant fin à un épisode de trois semaines qui a fragilisé l'entreprise face à la concurrence chinoise des modèles à poids ouvert. Les faits remontent au 9 juin 2026, date de lancement de Claude Fable 5, version publique et encadrée de l'architecture Mythos, tandis que Mythos 5, dépourvue de ces garde-fous, restait réservée aux organisations vérifiées via le programme Glasswing. Trois jours plus tard, le 12 juin, le secrétaire au Commerce Howard Lutnick a adressé à Anthropic une directive de contrôle des exportations exigeant la suspension immédiate de l'accès aux deux modèles pour tout ressortissant étranger dans le monde, y compris les propres employés étrangers de l'entreprise. Incapable de filtrer ses utilisateurs par nationalité en temps réel, Anthropic a coupé l'accès sur Claude.ai, son API, AWS Bedrock, Google Cloud et Microsoft Foundry. Le 26 juin, Washington a autorisé un retour partiel de Mythos 5 pour une centaine d'organisations liées aux infrastructures critiques et à la cyberdéfense, laissant Fable 5 hors service jusqu'à ce 1er juillet. Cet épisode illustre la fragilité des positions commerciales face à des décisions politiques soudaines : des centaines de millions d'utilisateurs à travers le monde se sont retrouvés privés d'accès du jour au lendemain, et les entreprises clientes de l'API ou des plateformes cloud partenaires ont dû composer avec plusieurs semaines d'incertitude. Pendant ce temps, les modèles chinois à poids ouvert ont continué de progresser, profitant du retrait temporaire d'un concurrent majeur. L'image d'Anthropic sort également écornée, des rumeurs de surveillance d'utilisateurs chinois étant venues s'ajouter à la confusion entourant cette affaire. Le fond du dossier reste flou. Selon Anthropic, la lettre reçue ne détaillait pas la menace précise pour la sécurité nationale, mais l'entreprise a compris que le gouvernement avait eu vent d'une méthode permettant de contourner les protections de Fable 5, en lui demandant par exemple d'analyser une base de code donnée pour en corriger les failles. Des rumeurs, invérifiables, ont même évoqué un modèle capable de mettre à mal les défenses de la NSA. Anthropic conteste la proportionnalité de la mesure, rappelant que des tests menés avec le gouvernement américain, l'AISI britannique et des tiers n'avaient révélé aucun jailbreak universel, et que le niveau de capacité en cause était comparable à celui de GPT-5.5 d'OpenAI. L'épisode relance ainsi le débat sur l'équilibre entre sécurité nationale et compétitivité de l'industrie américaine de l'IA face à la Chine.

UELes entreprises et developpeurs europeens utilisant l'API Claude via AWS Bedrock, Google Cloud ou Microsoft Foundry ont subi plusieurs semaines de coupure d'acces a Mythos 5 et Fable 5, sans qu'aucune decision reglementaire europeenne n'en soit la cause.

💬 Ce qui frappe, c'est la vitesse à laquelle une boîte peut se retrouver à genoux à cause d'une lettre de Washington, pas d'un bug ou d'un concurrent. Anthropic a coupé l'accès à Fable 5 dans le monde entier pendant trois semaines sur simple injonction, pendant que les modèles chinois à poids ouvert avançaient tranquillement. Le vrai enseignement de cet épisode : la sécurité nationale américaine est en train de devenir un facteur de compétitivité aussi déterminant que la puissance des modèles eux-mêmes, et ça peut jouer contre les boîtes américaines autant que pour elles.

RégulationReglementation
1 source
FactSet s’allie à Google Cloud pour intégrer l’IA à ses services financiers
10Le Big Data 

FactSet s’allie à Google Cloud pour intégrer l’IA à ses services financiers

FactSet, l'éditeur américain de données et d'outils financiers, annonce un partenariat stratégique avec Google Cloud pour intégrer les modèles Gemini à sa plateforme FactSet Workstation. L'accord s'articule autour de trois axes principaux. D'abord, l'intégration de la Gemini Enterprise Agent Platform doit permettre à FactSet de lancer une nouvelle génération d'agents financiers capables d'assister les professionnels dans leurs recherches et leurs analyses, en s'appuyant sur les fonctionnalités de recherche avancée et les capacités multimodales de Google. L'ajout de Google Ground doit également élargir les sources d'information exploitées par les outils d'IA de FactSet. Ensuite, sur le plan technique, FactSet enrichira Gemini Enterprise grâce à sa plateforme MCP et à son système de partage d'agents, dans la continuité d'une précédente collaboration avec Google DeepMind, afin d'assurer une interopérabilité fluide entre FactSet Workstation et les outils Google Cloud. Enfin, les deux entreprises développeront conjointement des agents spécialisés dédiés aux opérations de portefeuille, au conseil en fusions-acquisitions et à la finance d'entreprise. FactSet ajoute par ailleurs Google Cloud à son portefeuille de fournisseurs cloud existants, une décision motivée par le renforcement de la résilience et de l'évolutivité de sa plateforme. Pour les banques, sociétés de gestion d'actifs et équipes de finance d'entreprise, cette alliance vise concrètement à accélérer et fiabiliser des tâches aujourd'hui chronophages, comme la recherche documentaire, l'analyse de portefeuille ou la préparation de dossiers de fusion-acquisition. L'enjeu central pour ces institutions n'est pas seulement la vitesse d'exécution mais la traçabilité des données utilisées: dans un secteur soumis à des exigences réglementaires strictes, une réponse générée par IA doit pouvoir être vérifiée et documentée jusqu'à sa source. En misant sur son expertise historique de fournisseur de données financières combinée à l'infrastructure et aux modèles génératifs de Google, FactSet cherche à se positionner comme un intermédiaire de confiance entre les capacités brutes de l'IA générative et les contraintes de conformité du monde financier. Ce partenariat illustre une tendance plus large dans l'industrie: les grands fournisseurs de données financières, à l'image de Bloomberg ou S&P Global, cherchent tous à intégrer l'IA générative sans sacrifier la fiabilité qui constitue leur valeur ajoutée historique. Google Cloud, de son côté, poursuit son offensive dans la finance après sa collaboration avec Google DeepMind, cherchant à démontrer que ses modèles Gemini peuvent s'insérer dans des environnements professionnels exigeants. Sanoke Viswanathan, PDG de FactSet, a souligné que l'intelligence artificielle transforme en profondeur la manière dont les professionnels de la finance travaillent, laissant entrevoir un déploiement progressif de ces agents spécialisés dans les mois à venir.

BusinessActu
1 source
Créer un assistant de recherche sur les protéines avec Amazon Bedrock AgentCore
11AWS ML Blog 

Créer un assistant de recherche sur les protéines avec Amazon Bedrock AgentCore

Amazon Web Services a publié un guide technique détaillant la construction d'un assistant conversationnel dédié à la recherche sur les protéines, baptisé "protein research copilot", reposant sur Amazon Bedrock AgentCore. Le système permet aux chercheurs de soumettre des requêtes en langage naturel, par exemple "Trouve 10 peptides similaires au peptide du virus de la dengue LPAIVREAI", et d'obtenir automatiquement des résultats de similarité structurelle accompagnés d'une synthèse scientifique générée par IA. L'architecture s'appuie sur le SDK Strands Agents pour orchestrer trois outils spécialisés au sein d'un agent unique : un parseur de requêtes, un moteur de recherche vectorielle, et un summariseur. Les embeddings protéiques sont calculés via le modèle ESM-C 300M déployé comme endpoint serverless sur Amazon SageMaker AI, puis comparés par similarité cosinus dans une base Amazon Aurora PostgreSQL avec l'extension pgvector. L'interface utilisateur tourne sur AWS Fargate via Streamlit, et le modèle de langage central est Claude Sonnet 4.6 d'Anthropic, accessible via l'API Bedrock Converse. Ce type d'outil répond à un problème concret dans les laboratoires de biologie computationnelle : la recherche manuelle de peptides structurellement similaires parmi des milliers de séquences est lente, sujette aux erreurs, et exige une expertise pointue pour interpréter les résultats. En automatisant l'ensemble du pipeline, de la formulation de la question à la synthèse des résultats, le copilote réduit drastiquement le temps passé sur des tâches répétitives et rend la recherche accessible à des profils moins spécialisés en bioinformatique. Le pattern "LLM-as-parser" utilisé pour extraire des paramètres structurés depuis du langage naturel est directement réutilisable dans d'autres domaines scientifiques où les données sont complexes et la formulation des requêtes peu standardisée. Cette publication s'inscrit dans la stratégie d'AWS de positionner Bedrock AgentCore comme plateforme de référence pour déployer des agents IA en production, face à des concurrents comme Google Vertex AI ou Microsoft Azure AI Studio. Le secteur biotech et pharmaceutique représente une cible prioritaire : la recherche sur les épitopes viraux, le dataset utilisé ici est celui de l'IEDB (Immune Epitope Database), est au coeur du développement de vaccins et de thérapies antivirales. Le modèle ESM-C, développé par EvolutionaryScale, est l'un des modèles de langage protéique les plus performants du moment. Le déploiement complet est estimé entre 30 et 45 minutes, mais implique des coûts sur Bedrock, SageMaker, Aurora Serverless v2 et Fargate qu'AWS invite explicitement à consulter avant de lancer l'infrastructure. Les prochaines étapes naturelles seraient l'intégration de bases de données protéiques publiques comme UniProt ou PDB, et l'extension à d'autres types de molécules biologiques.

UECet outil développé par AWS peut bénéficier aux chercheurs en biologie computationnelle en France et dans l'UE en automatisant la recherche de peptides structurellement similaires, améliorant ainsi l'efficacité et rendant ces tâches moins spécialisées.

AutrePaper
1 source
Réseaux autonomes : Nokia embarque les agents IA Gemini de Google Cloud
12Le Big Data 

Réseaux autonomes : Nokia embarque les agents IA Gemini de Google Cloud

Nokia a annoncé le 22 juin 2026 l'intégration des modèles Gemini de Google Cloud au sein de son Nokia Assurance Center, la plateforme logicielle utilisée par les opérateurs télécoms pour superviser et optimiser leurs infrastructures réseau. Le cœur du dispositif repose sur six agents IA spécialisés, chacun dédié à une fonction précise du cycle d'exploitation : coordination centrale, analyse des alarmes, identification des causes racines, interprétation des indicateurs de performance et recommandation d'actions correctives. Développés à partir de l'Agent Development Kit (ADK) de Google Cloud et de la plateforme Gemini Enterprise Agent, ces agents promettent des gains de 50 à 80 % sur les délais de traitement des incidents réseau. Le déploiement s'appuie sur des outils standards comme Kubernetes et Google Cloud Storage, sans nécessiter d'infrastructure propriétaire supplémentaire. L'enjeu est considérable pour les opérateurs télécoms, qui gèrent quotidiennement des milliers d'événements techniques et peinent à distinguer les incidents critiques du bruit de fond. En permettant aux agents d'analyser simultanément plusieurs sources d'information grâce aux capacités de raisonnement multimodal de Gemini, Nokia vise à faire basculer les opérateurs d'une logique de supervision réactive vers une gestion proactive : anticiper les pannes et les corriger avant qu'elles n'affectent les utilisateurs finaux. Ce passage à l'autonomie opérationnelle réduit mécaniquement les coûts d'exploitation, diminue la dépendance aux interventions humaines de routine et améliore la fiabilité des infrastructures, un argument de poids dans un secteur où chaque minute d'interruption de service représente des pertes directes pour les opérateurs. Cette annonce s'inscrit dans une relation déjà établie entre Nokia et Google Cloud, que les deux groupes approfondissent à mesure que l'IA agentique mûrit techniquement. Nokia, équipementier historique en difficulté de repositionnement face aux concurrents asiatiques, mise sur l'intelligence artificielle pour différencier sa suite logicielle et fidéliser une base de clients opérateurs soumis à une pression tarifaire croissante. Google Cloud, de son côté, cherche à imposer Gemini comme socle applicatif dans les environnements industriels critiques, un marché où AWS et Microsoft Azure sont également très actifs. L'architecture multi-agents représente une étape vers le concept de réseau autonome, un objectif de long terme de l'industrie télécoms où le réseau se configure, se répare et s'optimise seul. Les prochaines étapes devraient voir ces six agents s'étendre à d'autres modules de la plateforme Nokia, avec des annonces attendues lors des grands salons télécoms de la seconde moitié de 2026.

UENokia, équipementier finlandais, intègre des agents IA directement dans la plateforme utilisée par les opérateurs télécoms européens, avec un impact potentiel concret sur leurs coûts d'exploitation réseau et la fiabilité de leurs infrastructures.

OutilsOpinion
1 source
DICT et Google Cloud déployent l’IA et la cybersécurité dans l’État philippin
13Le Big Data 

DICT et Google Cloud déployent l’IA et la cybersécurité dans l’État philippin

Le ministère philippin des Technologies de l'information et de la communication (DICT) a annoncé en juin 2026 une extension majeure de son partenariat avec Google Cloud, portant sur le déploiement de l'intelligence artificielle dans les administrations publiques et le renforcement de la cybersécurité nationale. Le programme prévoit d'équiper plus de 200 000 fonctionnaires d'outils basés sur Gemini Enterprise sur les 18 prochains mois, avec une première vague de 50 000 agents publics déjà ciblés. Ces outils sont accessibles via l'eMarketplace gouvernemental, lancé au premier trimestre 2026. En parallèle, le Bureau de la cybersécurité du DICT a constitué une alliance interministérielle de cyberdéfense reposant sur Google Cloud Cybershield, une plateforme combinant renseignement sur les menaces, analyse par Gemini et expertise de Mandiant, hébergée au sein du National Security Operations Center. À fin juin 2026, 90 agences gouvernementales devaient être couvertes par ce dispositif, contre 56 déjà formées au moment de l'annonce. L'impact de cette initiative est particulièrement concret pour un archipel de plus de 7 000 îles où l'accès aux services publics reste inégal. Les agents conversationnels en cours de déploiement permettront aux citoyens d'obtenir des réponses dans leur langue locale sur des procédures aussi diverses que la création d'entreprise, les services de santé ou les aides en cas de catastrophe naturelle, sans avoir à naviguer entre plusieurs administrations. Pour les fonctionnaires, l'IA accélère la recherche documentaire, l'analyse de dossiers et la coordination interministérielle, réduisant la friction bureaucratique qui ralentit traditionnellement l'action publique. Sur le volet cybersécurité, la centralisation de la surveillance au sein du NSOC renforce la résilience des infrastructures critiques à mesure que les services publics se numérisent, un enjeu d'autant plus sensible que les Philippines accueillent les sommets de l'ASEAN tout au long de l'année 2026. Ce partenariat s'inscrit dans une dynamique plus large de numérisation accélérée des États d'Asie du Sud-Est, où Google Cloud multiplie les accords avec les gouvernements pour positionner ses outils au cœur des réformes administratives. Pour les Philippines, le programme « AI Agents for the Public Sector » représente un pari sur la capacité de l'IA à compenser les déficits d'infrastructure humaine dans un pays où la dispersion géographique complique la prestation de services uniformes. La réussite du déploiement dépendra en grande partie de l'adoption réelle par les fonctionnaires et de la robustesse de la connectivité dans les régions isolées, deux défis que le DICT reconnaît implicitement en faisant du développement d'infrastructures adaptées à l'ère de l'IA un troisième axe de la collaboration. Si les résultats sont au rendez-vous, ce modèle philippin pourrait servir de référence pour d'autres gouvernements cherchant à industrialiser rapidement leur transition vers l'IA publique.

InfrastructureOpinion
1 source
SAP et Google Cloud déploient une architecture commerciale à base d'agents autonomes
14AI News 

SAP et Google Cloud déploient une architecture commerciale à base d'agents autonomes

SAP et Google Cloud ont annoncé une expansion significative de leur partenariat pour déployer une architecture commerciale dite "agentique", capable d'automatiser les opérations marketing et de vente au détail à grande échelle. Ce rapprochement s'appuie sur un constat tiré des propres recherches de SAP : 78 % des entreprises jugent l'intelligence artificielle indispensable à la fidélisation client en 2026. Pourtant, moins de deux entreprises sur cinq partagent réellement leurs données client entre leurs plateformes d'expérience client (37 %) ou leurs CRM (39 %). Pour combler ce fossé structurel, les deux groupes ont conçu une architecture unifiée connectant données, IA, engagement et opérations commerciales. Au cœur du dispositif : l'adoption par SAP Commerce Cloud du Universal Commerce Protocol, un standard d'échange de données entre détaillants, prestataires de paiement et agents logiciels autonomes. Ce protocole permet à des agents IA d'exécuter de façon indépendante l'intégralité d'un parcours d'achat, de la recherche initiale au traitement de la transaction jusqu'à la résolution après-vente. SAP Commerce Cloud intègre par ailleurs les capacités de Google Gemini pour alimenter un assistant shopping en langage naturel, accessible via chat, voix ou texte, qui conserve le contexte tout au long de la session d'achat. L'impact concret se mesure d'abord à l'élimination de pannes récurrentes dans les systèmes commerciaux actuels. Aujourd'hui, un client qui clique sur un email promotionnel, ouvre l'application mobile et tombe sur un message "rupture de stock" lors du paiement vit une expérience typique des infrastructures fragmentées. Les agents de support, privés d'une vue unifiée, ne peuvent résoudre les problèmes efficacement. L'architecture commune de SAP et Google vise précisément ces points de rupture : le système reconnaît instantanément l'utilisateur et son contexte sur toutes les propriétés numériques, sans ressaisie d'informations. Les recommandations produits intègrent en temps réel les niveaux de stock, les données comportementales et les campagnes marketing actives, garantissant à la fois la pertinence et la disponibilité physique des articles suggérés. Ce partenariat s'inscrit dans une compétition accélérée entre les grands éditeurs ERP et les plateformes cloud pour capter les budgets d'IA entreprise. La base technique repose sur SAP Business Data Cloud Connect pour Google BigQuery, avec des flux de données bidirectionnels en mode "zero-copy" : les données restent en place plutôt que d'être dupliquées, réduisant les coûts de stockage et la latence réseau. BigQuery ingère des variables en temps réel comme les conditions météorologiques, la localisation et les taux d'interaction publicitaire. SAP prévoit également de faire remonter les catalogues marchands directement dans Gemini et Google Search, notamment via l'AI Mode, ouvrant un nouveau canal de découverte produit sans que les détaillants n'aient à reconstruire leur infrastructure existante.

UESAP étant une entreprise européenne (allemande) et leader mondial des ERP, ce partenariat agentique avec Google Cloud impacte directement les retailers et entreprises françaises et européennes utilisant SAP Commerce Cloud pour automatiser leurs opérations commerciales.

💬 Le chiffre qui tue dans cette annonce, c'est pas les agents autonomes, c'est que 37% des boîtes partagent vraiment leurs données client entre plateformes. SAP et Google partent du problème structurel, pas de la promesse IA, et c'est pour ça que c'est solide. Le Universal Commerce Protocol est à surveiller : si ce standard s'impose, les agents auront enfin une fondation technique pour tenir en prod, pas juste en démo.

OutilsOutil
1 source
Amazon Bedrock AgentCore est disponible en production : passez d'une idée à un agent opérationnel en quelques minutes
15AWS ML Blog 

Amazon Bedrock AgentCore est disponible en production : passez d'une idée à un agent opérationnel en quelques minutes

Amazon a annoncé le 18 juin 2026 la disponibilité générale d'AgentCore Harness, une nouvelle couche d'infrastructure de sa plateforme Bedrock conçue pour déployer des agents IA en production en quelques minutes. Le service repose sur deux appels API, CreateHarness pour définir un agent, InvokeHarness pour l'exécuter, et s'appuie sur les six primitives déjà disponibles en préversion depuis avril : Runtime, Memory, Gateway, Browser, Identity et Observability. L'agent tourne dans un environnement isolé doté d'un système de fichiers et d'un shell, peut lire des fichiers, exécuter des commandes et écrire du code. Il conserve la mémoire des utilisateurs et des conversations entre sessions, navigue sur le web, appelle des outils via MCP ou Gateway, et chaque étape est automatiquement tracée vers CloudWatch. Le problème qu'AgentCore Harness cherche à résoudre n'est pas la conception de l'agent, c'est tout ce qui l'entoure. Monter un prototype en local prend une après-midi ; le passer en production explose le volume de travail : concurrence, isolation, gestion des identités, état distribué, mise à l'échelle. Et ce coût se répétait à chaque nouveau cas d'usage, chaque changement de modèle, chaque nouvel outil. Le Harness absorbe ce câblage en tant qu'abstraction gérée, ce qui le transforme en quelque chose qu'on configure plutôt que quelque chose qu'on construit. Pour les équipes qui expérimentent plusieurs modèles ou cherchent à optimiser le rapport prix-performance, la fonctionnalité la plus attendue est la capacité à changer de fournisseur de modèle en cours de session sans perdre le contexte conversationnel. La compatibilité multi-modèles est au coeur de l'offre. Bedrock supporte déjà Anthropic Claude, Amazon Nova, Meta Llama, DeepSeek, Qwen, Cohere et Mistral, et vient d'intégrer OpenAI GPT-5.5 et GPT-5.4. Le service s'étend également à l'API OpenAI directe, Google Gemini, et via LiteLLM à Vertex, Azure OpenAI et d'autres. Cette ouverture reflète une tendance de fond : les grandes plateformes cloud se positionnent non plus comme fournisseurs d'un seul modèle, mais comme couches d'orchestration universelles. Amazon rejoint ainsi Microsoft Azure AI Foundry et Google Vertex AI dans la course aux plateformes d'agents prêtes pour la production. La prochaine étape sera de voir si cette abstraction tient sous la charge réelle et si les équipes adoptent le catalogue de compétences AWS plutôt que de continuer à construire leurs propres outils.

UELes équipes européennes développant des agents IA peuvent adopter cette infrastructure gérée pour réduire la charge opérationnelle liée au déploiement en production, mais aucune entreprise ou réglementation française ou européenne n'est directement impliquée.

OutilsOpinion
1 source
HSBC étend son partenariat bancaire IA avec Google Cloud
16AI News 

HSBC étend son partenariat bancaire IA avec Google Cloud

HSBC et Google Cloud ont annoncé lors du Google Cloud Summit London 2026 un partenariat pluriannuel visant à déployer l'intelligence artificielle à grande échelle dans les opérations mondiales de la banque britannique. L'accord porte sur la gestion de patrimoine, la détection des crimes financiers et les outils d'aide à la décision interne. HSBC travaillera directement avec les équipes d'ingénierie de Google Cloud et de Google DeepMind pour développer des solutions basées sur les modèles Gemini et la plateforme Gemini Enterprise Agent. La banque prévoit de couvrir plus de 200 cas d'usage de l'IA sur les deux prochaines années, certaines initiatives étant susceptibles de générer chacune plus de 100 millions de dollars, soit en revenus directs, soit en gains d'efficacité. En matière de lutte contre la criminalité financière, HSBC s'appuie déjà sur un système développé conjointement avec Google, appelé Dynamic Risk Assessment, lancé en pilote en 2021 et capable de détecter deux à quatre fois plus de crimes financiers que les méthodes précédentes. Avec le nouveau partenariat, la banque espère intervenir deux fois plus vite lorsqu'un risque est détecté, sur un volume de près d'un milliard de transactions surveillées chaque mois. L'ampleur de ce virage vers l'IA est considérable pour une institution de la taille de HSBC, qui compte déjà plus de 600 cas d'usage actifs incluant la fraude, la cybersécurité, le service client et l'analyse de risques. En interne, plus de 20 000 développeurs utilisent des assistants de codage, avec un gain d'efficacité de 15 % mesuré sur le temps de développement. Un outil d'aide à la décision déployé auprès de milliers d'employés a réduit la préparation des réunions clients de plusieurs heures à quelques minutes. Au total, 85 % des employés de HSBC auraient déjà accès à des outils d'IA générative, selon CIO Dive. Ces chiffres illustrent une transformation opérationnelle profonde qui touche aussi bien les fonctions front-office que les processus réglementaires et administratifs. Ce partenariat s'inscrit dans une stratégie d'accélération que HSBC mène depuis plusieurs années. En décembre 2025, la banque avait déjà signé un accord pluriannuel avec Mistral AI pour accéder à ses modèles commerciaux, destinés à l'analyse financière, la traduction multilingue et le prototypage. En mars 2026, HSBC a nommé David Rice au poste nouvellement créé de Chief AI Officer, effectif le 1er avril, signal clair d'une gouvernance IA centralisée au plus haut niveau. Plus largement, le secteur bancaire est en pleine transformation : selon un rapport 2026 du Cambridge Centre for Alternative Finance, 71 % des acteurs du secteur adoptent l'IA générative et 52 % l'IA agentique. HSBC, avec plus de 600 applications déjà hébergées sur Google Cloud, est l'une des banques les mieux positionnées pour tirer parti de cette vague, à condition de maintenir la supervision humaine que son PDG Georges Elhedery place au centre de sa vision.

UEHSBC, banque systémique active en France et dans l'UE, déploie l'IA agentique à grande échelle dans ses opérations bancaires européennes, ce qui pourrait établir un modèle de référence pour la conformité au règlement européen sur l'IA (AI Act) dans le secteur financier.

💬 Ce que tu ne vois pas dans le titre, c'est que la transformation est déjà faite. 85 % des employés de HSBC ont accès à l'IA générative maintenant, le système antifraude détecte deux à quatre fois plus de crimes que les méthodes classiques sur un milliard de transactions par mois, c'est du solide. À ce niveau de déploiement, la question n'est plus de savoir si les grandes banques vont adopter l'IA, mais pourquoi les autres n'en sont pas encore là.

BusinessOpinion
1 source
AWS prépare une nouvelle génération d’agents IA d’entreprise
17Le Big Data 

AWS prépare une nouvelle génération d’agents IA d’entreprise

Amazon Web Services a dévoilé une série d'annonces autour de sa plateforme Bedrock et de plusieurs nouveaux services destinés à accélérer l'intégration des agents IA dans les environnements d'entreprise. Les évolutions touchent quatre domaines principaux : l'accès à la connaissance, l'automatisation des processus métier, la sécurité applicative et le développement logiciel. Bedrock AgentCore s'enrichit notamment de connecteurs vers SharePoint, Confluence, Google Drive et Amazon S3, mais aussi d'une capacité de navigation web directement intégrée au périmètre sécurisé du client. Un mécanisme d'accès aux contenus sous licence est également prévu, permettant aux fournisseurs de données de monétiser leur usage par les agents. Sur le terrain de la gouvernance, les équipes peuvent désormais analyser les erreurs récurrentes, tester différentes configurations et renforcer la protection contre les injections de prompt via Bedrock Guardrails. L'assistant métier Amazon Quick reçoit des capacités de gestion autonome de tâches, avec une vue unifiée regroupant échanges, rendez-vous et actions en attente, et s'ouvre à de nouveaux partenaires comme Adobe, Figma, Shopify, Snowflake et WhatsApp. Ces annonces marquent un changement de paradigme dans la façon dont AWS positionne l'IA en entreprise : il ne s'agit plus d'outils de question-réponse, mais d'agents capables d'agir de façon autonome sur des workflows réels. Pour les équipes de développement, AWS Continuum automatise l'identification et la correction des vulnérabilités logicielles, tandis qu'AWS Transform surveille en continu les dépôts de code pour détecter les composants vieillissants et proposer des pull requests correctives. AWS DevOps Agent élargit quant à lui son périmètre à la validation pré-production et à la génération automatique de scénarios de test. L'environnement de développement piloté par agents Kiro devient accessible sur iPhone. Ce virage vers l'automatisation concrète représente un enjeu majeur pour les directions techniques et les DSI, qui doivent désormais évaluer comment déléguer des pans entiers de leur chaîne de valeur à des systèmes autonomes. Ces évolutions s'inscrivent dans une compétition intense entre les grands fournisseurs de cloud pour capter les budgets IA des entreprises. AWS répond ainsi aux offres de Microsoft Copilot et de Google Vertex AI, qui avancent sur des territoires similaires. Le nouveau service AWS Context, qui construit automatiquement une représentation des liens entre données d'entreprise pour les rendre exploitables par les agents, illustre la volonté d'AWS de résoudre la fragmentation de l'information dans les grandes organisations, un problème structurel que ni les outils de recherche classiques ni les premiers chatbots d'entreprise n'ont su régler. La capacité à monétiser les données premium via les agents ouvre par ailleurs un nouveau marché pour les éditeurs de contenu, dont les modalités de valorisation restent encore à définir dans un cadre réglementaire et contractuel qui n'en est qu'à ses débuts.

UELes DSI français et européens opérant sur AWS peuvent dès maintenant évaluer le déploiement d'agents autonomes sur leurs workflows internes, dans un cadre de sécurité (Bedrock Guardrails, protection anti-injection) potentiellement aligné avec les exigences de l'AI Act.

💬 AWS Context est probablement l'annonce la plus sous-estimée du lot : construire automatiquement la carte des liens entre données d'entreprise, c'est ce que ni SharePoint ni Elastic n'ont réussi à faire depuis vingt ans. Le vrai enjeu ici, c'est pas les agents, c'est qui détient le graphe de connaissance de l'organisation. Azure l'avait compris avant tout le monde avec le Microsoft Graph, AWS vient de rattraper son retard, bon, presque.

OutilsOutil
1 source
Amazon Bedrock AgentCore : des agents plus informés et capables d'apprentissage continu
18AWS ML Blog 

Amazon Bedrock AgentCore : des agents plus informés et capables d'apprentissage continu

Amazon a annoncé cette semaine de nouvelles fonctionnalités pour Bedrock AgentCore, sa plateforme de développement d'agents IA, avec pour objectif de combler l'écart entre la puissance théorique des modèles de langage et leurs performances réelles en production. La mise à jour introduit trois couches d'accès à la connaissance : la Managed Knowledge Base, un outil de recherche web natif, et un accès à des données payantes. La Managed Knowledge Base permet désormais aux agents de se connecter directement aux sources de données internes des entreprises, SharePoint, Google Drive, Confluence, S3 et wikis internes, sans que les équipes techniques aient à construire leurs propres pipelines d'ingestion. Amazon gère le stockage vectoriel, les modèles d'embeddings et de reranking, ainsi que les questions de scalabilité. Au cœur de ce système se trouve un retriever agentique qui va bien au-delà du RAG classique : il planifie des requêtes croisées sur plusieurs bases de connaissance, relie des concepts connexes entre documents, et évalue les résultats intermédiaires avant de répondre. L'outil Web Search, lui, s'appuie sur la même infrastructure de recherche qui propulse Alexa+, Amazon Quick Suite et Kiro, et renvoie des extraits optimisés pour la densité d'information par token. Ces ajouts répondent à un problème concret et coûteux pour les entreprises déployant des agents IA : un modèle aussi performant soit-il reste inutile s'il ne peut pas accéder au document où se trouve la réponse. Un agent de service client incapable d'atteindre la politique de remboursement stockée dans SharePoint, un agent de recherche limité à ses données d'entraînement, un conseiller financier privé de données de marché en temps réel, tous sont des cas réels qui freinent le déploiement en production. La Managed Knowledge Base élimine plusieurs mois d'ingénierie préalable, tandis que le Web Search maintient les données dans l'environnement sécurisé AWS du client, un point critique pour les secteurs réglementés comme la finance ou la santé. Cette annonce s'inscrit dans la compétition intense entre fournisseurs cloud pour s'imposer comme plateforme de référence pour les agents IA d'entreprise. AWS, Google Cloud avec Vertex AI et Microsoft avec Azure AI Foundry se disputent le même marché : les équipes qui veulent déployer des agents capables d'agir réellement sur des données métier, pas seulement générer du texte. Amazon capitalise ici sur son infrastructure de recherche existante et son écosystème de services cloud pour offrir une intégration verticale que les solutions tierces ont du mal à concurrencer. La promesse d'amélioration continue via des boucles de rétroaction en production, mentionnée dans l'annonce, suggère qu'AgentCore ambitionne de devenir non seulement un outil de déploiement mais une plateforme d'optimisation itérative des agents dans la durée.

UELes entreprises européennes des secteurs réglementés (finance, santé) peuvent adopter ces fonctionnalités, les données restant dans l'environnement AWS sécurisé du client, ce qui simplifie la conformité réglementaire.

💬 Le vrai goulot d'étranglement pour les agents en prod, c'est jamais le modèle, c'est l'accès aux données d'entreprise. Avec AgentCore, Amazon efface plusieurs mois d'ingénierie RAG maison (SharePoint, Confluence, S3 gérés nativement) et garde les données dans son cloud sécurisé. AWS joue ici son principal atout : l'intégration verticale que ni Google ni Microsoft ne peuvent répliquer aussi facilement.

OutilsOutil
1 source
Google Cloud automatise les opérations de planification urbaine avec l'IA générative
19AI News 

Google Cloud automatise les opérations de planification urbaine avec l'IA générative

Le gouvernement britannique a déployé deux outils d'intelligence artificielle développés avec Google Cloud pour automatiser le traitement des demandes de permis de construire dans l'ensemble des collectivités locales d'Angleterre. Le ministère du Logement, des Communautés et des Gouvernements Locaux (MHCLG) et le département pour la Science, l'Innovation et la Technologie (DSIT) ont annoncé ces déploiements lors du Google Cloud Summit London. L'outil "Extract", construit en interne par des ingénieurs gouvernementaux à l'aide des modèles Gemini de Google DeepMind, a été étendu à toutes les collectivités anglaises après des essais dans plus de 20 autorités locales. Un second système baptisé "Augmented Planning Decisions" (APD) est quant à lui encore en phase de prototype. Extract analyse des milliers de pages de documents PDF historiques non structurés et les convertit en bases de données numériques exploitables en quelques minutes, éliminant environ 255 heures de saisie manuelle par collectivité et par an. L'enjeu est considérable : les demandes de particuliers, comme les extensions ou les conversions de combles, représentent près de 70 % des dossiers de permis déposés chaque année au Royaume-Uni. Chacune nécessite que les agents d'urbanisme passent des heures à croiser des documents réglementaires régionaux, des archives historiques et des fichiers PDF épars. Cette surcharge administrative retarde directement les grands projets d'infrastructure et de développement commercial. L'objectif affiché du gouvernement est de réduire de 50 % les délais de décision sur ces dossiers courants, libérant ainsi du temps pour les projets les plus complexes. Le système APD va plus loin : il pré-traite les dossiers entrants, identifie les lacunes d'information, extrait les données géographiques, évalue la conformité aux règles d'urbanisme nationales et locales, et synthétise les observations du public en signalant les objections ou précédents juridiques pertinents. Ces déploiements s'inscrivent dans la stratégie britannique visant à construire 1,5 million de logements neufs d'ici 2029, un objectif que les engorgements administratifs des collectivités locales compromettaient sérieusement. Pour garantir la sécurité des données civiques sensibles traitées par ces outils, le gouvernement a hébergé les modèles Gemini sur l'infrastructure Google Cloud dans un environnement cloisonné, avec des contrôles actifs contre les attaques par injection de prompts et des protocoles stricts de souveraineté des données. Lila Ibrahim, directrice de la préparation à l'IA chez Google DeepMind, a souligné que ces outils ont été "co-créés directement avec les collectivités pour résoudre de vrais goulets d'étranglement". Cette initiative pourrait servir de modèle à d'autres pays cherchant à moderniser leurs administrations publiques via l'IA générative, dans un contexte où la pression sur le logement et la bureaucratie ralentissent les décisions dans de nombreuses démocraties européennes.

UECe déploiement britannique pourrait inspirer des initiatives similaires dans les collectivités locales françaises et européennes confrontées aux mêmes engorgements administratifs dans le traitement des permis de construire.

💬 255 heures de saisie par collectivité économisées, c'est modeste sur le papier, mais multiplié par toutes les mairies d'Angleterre, c'est là que les 1,5 million de logements promis deviennent moins irréalistes. Ce que Google et le gouvernement britannique ont compris, c'est que l'IA n'a pas besoin de remplacer l'urbaniste pour débloquer le système, il suffit qu'elle digère les PDF à sa place. La France a exactement les mêmes boulets.

OutilsOutil
1 source
HSBC et Google Cloud scellent un partenariat pour l’IA bancaire
20Le Big Data 

HSBC et Google Cloud scellent un partenariat pour l’IA bancaire

HSBC et Google Cloud ont annoncé le 17 juin 2026, lors du Google Cloud Summit de Londres, un partenariat pluriannuel destiné à accélérer le déploiement de l'intelligence artificielle dans l'ensemble des activités du groupe bancaire britannique. L'accord prévoit le déploiement de plus de 200 nouveaux cas d'usage de l'IA en deux ans, en s'appuyant sur les modèles Gemini et la plateforme Gemini Enterprise Agent de Google DeepMind. HSBC héberge déjà plus de 600 applications sur Google Cloud et identifie parmi ses projets prioritaires plusieurs initiatives susceptibles de générer chacune plus de 100 millions de dollars de revenus supplémentaires ou de gains d'efficacité. La collaboration impliquera les équipes d'ingénierie de Google Cloud et de Google DeepMind pour co-développer des outils sur mesure adaptés aux contraintes du secteur financier. Ce partenariat marque un tournant dans la maturité de l'IA bancaire : les investissements ne sont plus justifiés par l'innovation en tant que telle, mais par leur impact mesurable sur la performance opérationnelle et financière. Les trois axes stratégiques annoncés illustrent cette logique. D'abord, la gestion de patrimoine hyper-personnalisée, qui permettra à des milliers de conseillers financiers de proposer des recommandations contextualisées en temps réel, répondant aux attentes de clients habitués aux standards des grandes plateformes numériques. Ensuite, la lutte contre la criminalité financière : HSBC traite près d'un milliard de transactions par mois et estime pouvoir intervenir deux fois plus rapidement après détection d'un risque grâce aux systèmes agentiques, réduisant ainsi les pertes potentielles tout en renforçant la conformité réglementaire. Enfin, des assistants décisionnels internes visent à améliorer l'efficacité opérationnelle des équipes à l'échelle mondiale. Ce rapprochement s'inscrit dans une tendance lourde qui voit les grandes banques mondiales nouer des alliances stratégiques avec les hyperscalers pour ne pas être distancées par des concurrents plus agiles. Google Cloud, qui multiplie les partenariats dans la finance, positionne Gemini comme la colonne vertébrale des systèmes bancaires de prochaine génération. Pour HSBC, déjà engagé dans une transformation numérique de grande ampleur depuis plusieurs années, ce partenariat représente une montée en puissance significative après une phase d'expérimentation. La banque affirme vouloir conserver l'expertise humaine au cœur de la décision, un positionnement qui répond autant aux exigences réglementaires des marchés où elle opère qu'aux attentes de ses clients institutionnels et privés. Les prochains mois permettront de vérifier si ces ambitions se traduisent en déploiements concrets à l'échelle annoncée.

UEHSBC dispose d'opérations bancaires significatives en France et dans l'UE ; ce partenariat accélère la transformation IA d'un acteur systémique mondial présent sur les marchés européens et exerce une pression concurrentielle sur les grandes banques de la zone euro pour qu'elles accélèrent leur propre feuille de route IA.

BusinessOpinion
1 source
Google Cloud soutient l’ambition de superintelligence d’Ineffable Intelligence
21Le Big Data 

Google Cloud soutient l’ambition de superintelligence d’Ineffable Intelligence

Ineffable Intelligence, startup londonienne fondée par David Silver, le chercheur britannique à l'origine d'AlphaGo, a annoncé lors du Google Cloud Summit London 2026 un partenariat stratégique avec Google Cloud pour soutenir le développement de son projet de superintelligence. Cette alliance intervient dans la foulée d'une levée de fonds de 1,1 milliard de dollars, la plus importante jamais réalisée par une startup européenne spécialisée dans l'IA. Concrètement, Ineffable Intelligence déploiera sur l'infrastructure Google Cloud l'un des plus grands clusters A5X au monde, équipé de GPU NVIDIA Vera Rubin NVL72, pour entraîner ce qu'elle appelle un « super-apprenant » : une intelligence artificielle capable d'acquérir des connaissances par l'expérience directe, en continu, plutôt qu'à partir de vastes ensembles de données précompilées. L'enjeu dépasse largement le simple choix d'un prestataire cloud. Les systèmes fondés sur l'apprentissage par renforcement continu imposent des contraintes d'infrastructure radicalement différentes des modèles génératifs classiques : ils génèrent, évaluent et exploitent en temps réel des flux d'expériences, ce qui exige non seulement une puissance de calcul considérable, mais aussi une interconnexion ultra-performante entre GPU, réseau à haut débit et stockage optimisé. Google Cloud se positionne précisément sur cette architecture intégrée, présentée comme un avantage décisif pour les laboratoires les plus exigeants. Pour l'industrie, ce partenariat marque une étape dans la compétition entre hyperscalers pour capter les projets d'IA les plus ambitieux, où l'infrastructure devient un levier de différenciation aussi important que les algorithmes eux-mêmes. David Silver, figure emblématique du domaine depuis sa contribution décisive à AlphaGo chez DeepMind, a quitté Google pour fonder Ineffable Intelligence avec l'ambition explicite de développer des systèmes capables de dépasser les capacités humaines dans des domaines comme les sciences, les mathématiques ou la technologie. L'approche par apprentissage par renforcement qu'il défend s'inscrit dans une tradition de recherche distincte des grandes entreprises qui misent sur la mise à l'échelle de modèles de langage entraînés sur du texte. Le choix de Google Cloud comme partenaire est une décision stratégique pour les deux parties : Ineffable Intelligence bénéficie d'une infrastructure de premier rang à grande échelle, tandis que Google utilise ce partenariat comme vitrine pour démontrer la maturité de son offre IA à une période où la concurrence entre Azure, AWS et Google Cloud pour attirer les laboratoires de recherche de pointe n'a jamais été aussi intense. La levée de 1,1 milliard confirme que le projet est pris très au sérieux par les investisseurs, même si l'horizon d'une superintelligence opérationnelle reste indéfini.

UELa levée record d'1,1 milliard de dollars par Ineffable Intelligence, startup londonienne fondée par le chercheur britannique à l'origine d'AlphaGo, s'impose comme un signal fort pour l'écosystème européen de l'IA, confirmant sa capacité à générer des laboratoires de recherche de niveau mondial capables de rivaliser avec les géants américains.

💬 David Silver quitte Google pour lever 1,1 milliard et retourner entraîner ses modèles sur... l'infra Google. Le serpent qui se mord la queue, mais version superintelligence. Ce qui m'intéresse vraiment là-dedans, c'est l'approche : de l'apprentissage par renforcement continu plutôt que du scaling de LLM sur texte, c'est une vraie bifurcation par rapport à ce que font OpenAI ou Anthropic. Reste à voir si ça donne quelque chose en dehors des jeux de plateau.

BusinessOpinion
1 source
Google Cloud lance l'Open Knowledge Format (OKF), spécification Markdown neutre pour fournir du contexte aux agents IA
22MarkTechPost 

Google Cloud lance l'Open Knowledge Format (OKF), spécification Markdown neutre pour fournir du contexte aux agents IA

Google Cloud a présenté l'Open Knowledge Format (OKF), une spécification ouverte et neutre vis-à-vis des fournisseurs, destinée à standardiser la manière dont les agents d'intelligence artificielle accèdent au contexte interne des organisations. En version 0.1, OKF représente la connaissance sous forme de répertoires de fichiers markdown accompagnés d'un en-tête YAML. Chaque concept, qu'il s'agisse d'une table de base de données, d'une métrique, d'un runbook ou d'une API, est décrit dans un fichier unique dont le chemin constitue son identifiant. Les champs structurés réservés sont minimalistes : type, title, description, resource, tags et timestamp. Le résultat est un bundle entièrement lisible sur GitHub, transportable en tarball, et ne nécessitant ni SDK, ni service tiers, ni schéma propriétaire. Ce format s'attaque à un problème concret qui plombe les déploiements d'agents IA en entreprise : la dispersion du contexte interne. Quand un agent doit répondre à la question "comment calculer les utilisateurs actifs hebdomadaires depuis notre flux d'événements ?", il doit assembler la réponse depuis des catalogues de métadonnées aux API incompatibles, des wikis d'équipe, des drives partagés et des commentaires de code. Chaque éditeur propose aujourd'hui son propre schéma de knowledge graph, rendant la connaissance non portable entre produits et organisations. Avec OKF, un wiki produit par une équipe peut être consommé directement par un agent différent sans traduction, éliminant le travail dupliqué que chaque développeur d'agents accomplit aujourd'hui depuis zéro. L'idée sous-jacente a été formulée par Andrej Karpathy dans un gist publié en avril 2026, où il soulignait que les LLM sont particulièrement adaptés à la maintenance de wikis structurés : ils ne s'ennuient pas, n'oublient pas de mettre à jour les références croisées, et peuvent éditer de nombreux fichiers en une seule passe. Le pattern existait déjà sous diverses formes, des vaults Obsidian connectés à des agents de code aux fichiers AGENTS.md et CLAUDE.md devenus conventions courantes, en passant par les dépôts "métadonnées as code". Aucun de ces formats ne s'interopérait. OKF tente de devenir la couche de standardisation manquante. La spécification étant ouverte et délibérément sans friction technique, son adoption dépendra de la capacité de la communauté à converger autour de ces conventions avant que d'autres éditeurs ne proposent leurs propres alternatives propriétaires.

UELes entreprises européennes déployant des agents IA peuvent adopter ce format ouvert pour structurer leur contexte interne sans dépendance à un éditeur propriétaire américain.

OutilsOutil
1 source
Google Cloud lance un format ouvert pour convertir des documents épars en fichiers Markdown destinés aux agents IA
23The Decoder 

Google Cloud lance un format ouvert pour convertir des documents épars en fichiers Markdown destinés aux agents IA

Google Cloud a lancé l'Open Knowledge Format (OKF), un nouveau standard destiné à transformer la documentation organisationnelle éparpillée en fichiers Markdown structurés avec frontmatter YAML. L'objectif : rendre la connaissance interne des entreprises portable et directement exploitable par des agents d'intelligence artificielle. La spécification, délibérément minimaliste, propose un cadre commun pour unifier des contenus aujourd'hui dispersés entre wikis, bases de données, outils SaaS et documents PDF. L'enjeu est considérable pour les entreprises qui déploient des agents IA en interne. Actuellement, ces agents peinent à accéder à la connaissance organisationnelle parce qu'elle ne respecte aucun format unifié. OKF résout ce problème structurel en imposant une couche de standardisation légère : chaque document devient un fichier texte lisible à la fois par un humain et par un LLM, avec des métadonnées explicites permettant aux agents de comprendre le contenu, sa portée et sa pertinence sans transformation préalable. La démarche de Google Cloud s'inscrit dans un mouvement intellectuel récent : Andrej Karpathy, chercheur emblématique passé par Tesla et OpenAI, avait popularisé ce concept sous l'appellation "LLM Wiki", plaidant pour des bases de connaissances conçues nativement pour les modèles de langage. En formalisant cette intuition sous forme de standard ouvert, Google Cloud cherche à s'imposer comme référence dans l'écosystème des agents d'entreprise, un marché en forte croissance où la qualité et l'accessibilité de la connaissance structurée sont devenues des avantages concurrentiels décisifs.

UELes entreprises et administrations européennes déployant des agents IA peuvent adopter ce standard ouvert pour structurer leur documentation interne et améliorer l'interopérabilité de leurs systèmes de gestion des connaissances.

💬 Le vrai goulot d'étranglement des agents IA en entreprise, c'est jamais le modèle, c'est la connaissance éparpillée dans 14 outils différents. Karpathy avait nommé le truc il y a un moment, Google vient juste de le mettre en costume corporate avec un nom de standard. Reste à voir combien d'éditeurs SaaS vont jouer le jeu, parce qu'un format ouvert sans adoption, c'est juste un PDF de plus.

OutilsOpinion
1 source
Extraire des données dynamiquement avec des pipelines à la demande et par lots
24AWS ML Blog 

Extraire des données dynamiquement avec des pipelines à la demande et par lots

Amazon Web Services propose une architecture de traitement intelligent de documents combinant deux modes d'inférence sur sa plateforme Bedrock : un pipeline à la demande, capable de traiter un document en quelques secondes, et un pipeline de traitement par lots, conçu pour absorber des volumes massifs à moindre coût. La solution s'appuie sur des modèles de langage large (LLM) pour extraire automatiquement des données structurées depuis des PDF numérisés ou des fichiers texte, y compris des documents aux formats hétérogènes. Le cas d'usage illustratif est parlant : un client disposant de plusieurs centaines de millions de baux fonciers au format PDF scanné, avec de nouveaux documents s'ajoutant chaque jour, peut désormais traiter ce backlog sans intervention humaine. Techniquement, chaque requête peut spécifier dynamiquement l'identifiant du modèle LLM, l'identifiant du prompt et sa version, ces paramètres étant récupérés depuis Amazon Bedrock Prompt Management au moment de l'exécution. Le pipeline temps réel repose sur une file SQS FIFO qui déclenche une fonction AWS Lambda : celle-ci récupère le PDF depuis S3, convertit chaque page en image PNG, compose le message à envoyer au LLM, puis stocke le résultat dans une table DynamoDB. Le pipeline batch, lui, regroupe les requêtes en un seul job d'inférence asynchrone sur Bedrock, ce qui réduit significativement les coûts. L'enjeu concret est double : vitesse et économie. Les entreprises qui traitent des documents sensibles au facteur temps, comme des contrats ou des formulaires réglementaires, peuvent utiliser le mode à la demande et obtenir un résultat en quelques secondes. Pour les traitements différés, les grands volumes ou les migrations de données historiques, le mode batch réduit la facture d'inférence tout en libérant les équipes de toute supervision manuelle. La capacité à configurer le modèle et le prompt au niveau de chaque document est particulièrement significative : elle permet d'utiliser la même infrastructure pour des types de documents très différents, sans redéploiement ni modification du pipeline, simplement en changeant les paramètres de la requête entrante. Cette solution s'inscrit dans une tendance de fond : l'automatisation de l'extraction d'information dans les secteurs très documentés, notamment l'immobilier, le droit, la finance et l'assurance, où des décennies de paperasse physique ou numérisée constituent un gisement de données encore inexploité. Amazon Bedrock, lancé en disponibilité générale en 2023, monte en puissance comme couche d'abstraction pour l'inférence LLM dans les entreprises, concurrençant directement les offres de Microsoft Azure AI et de Google Vertex AI. La gestion centralisée des prompts via Bedrock Prompt Management répond à un besoin croissant de gouvernance et de traçabilité des invocations IA en production, particulièrement dans les contextes réglementés. La prochaine étape logique pour AWS sera d'intégrer des capacités d'évaluation automatique de la qualité d'extraction directement dans ces pipelines.

UEAWS Bedrock étant disponible dans des régions européennes, les entreprises françaises et européennes des secteurs immobilier, juridique et financier peuvent déployer ces pipelines d'extraction documentaire en conservant leurs données sur l'infrastructure cloud européenne.

OutilsOutil
1 source
Apple détaille ses cinq nouveaux modèles d’IA et admet à demi-mot ses ratés
25Next INpact 

Apple détaille ses cinq nouveaux modèles d’IA et admet à demi-mot ses ratés

À l'occasion de la WWDC 2026, Apple a présenté la troisième génération de ses modèles d'IA maison, les Apple Foundation Models (AFM 3), qui alimenteront Apple Intelligence sous iOS 27 et les autres systèmes d'exploitation en version 27. La famille compte cinq modèles distincts : deux fonctionnent directement sur l'appareil, AFM 3 Core (3 milliards de paramètres) et AFM 3 Core Advanced (20 milliards de paramètres, mais n'en activant dynamiquement qu'1 à 4 milliards selon les requêtes), et trois dans le cloud, AFM 3 Cloud pour les tâches courantes, ADM 3 Cloud pour la génération et l'édition d'images, et AFM 3 Cloud Pro pour le raisonnement complexe et les outils agentiques. Ce dernier tourne sur des serveurs NVIDIA hébergés dans Google Cloud, une infrastructure étendue au système Private Cloud Compute d'Apple. Les modèles reposent sur une base Gemini de Google, conformément à l'accord conclu entre les deux entreprises en janvier 2026. Pour profiter du modèle local le plus puissant, il faut un iPhone Air, un iPhone 17 Pro, un Mac M3 ou un iPad M4 avec au moins 12 Go de RAM, l'iPhone 17 standard, limité à 8 Go, est exclu. Cette annonce est importante à plusieurs égards. Sur le plan technique, la méthode d'activation dynamique des paramètres d'AFM 3 Core Advanced est une innovation notable : elle permet à Apple de faire tourner un modèle de 20 milliards de paramètres en puisant dans la mémoire flash plutôt que dans la RAM, contournant ainsi les limites physiques des appareils mobiles. Concrètement, cela se traduit par un Siri plus expressif, des voix personnalisables et une dictée vocale améliorée. Mais au-delà des performances annoncées, l'aveu implicite d'Apple est révélateur : en ne comparant plus ses nouveaux modèles aux benchmarks sectoriels standardisés utilisés l'an dernier face à GPT-4o ou Gemma, la firme de Cupertino semble reconnaître discrètement que la génération précédente était en deçà des attentes, ce que le retard du nouveau Siri et les critiques répétées autour d'Apple Intelligence avaient déjà largement signalé. Cette troisième génération d'AFM s'inscrit dans un contexte de rattrapage accéléré pour Apple, qui accuse un retard structurel sur ses rivaux en matière d'IA générative. L'accord avec Google pour baser ses modèles sur Gemini, combiné à l'utilisation de GPU NVIDIA dans le cloud, marque une dépendance rare pour une entreprise qui a bâti son identité sur la maîtrise totale de sa chaîne technologique, du silicium au logiciel. Apple se retrouve ainsi tributaire de deux de ses principaux concurrents stratégiques. La question qui se pose désormais est celle de la durabilité de ce positionnement : soit Apple accélère le développement de ses propres modèles fondamentaux, soit elle consolide ces partenariats, au risque de perdre encore davantage de souveraineté sur la couche IA, qui deviendra centrale dans tous ses produits.

UELes millions d'utilisateurs européens d'appareils Apple seront directement concernés par le traitement de leurs données via l'infrastructure Google Cloud sous iOS 27, soulevant des questions de conformité RGPD pour Apple Intelligence.

💬 La partie la plus révélatrice, c'est le silence sur les benchmarks. L'an dernier ils s'y comparaient fièrement, cette année le tableau de chasse a disparu, et tout le monde a compris le message. Baser ses modèles sur Gemini et faire tourner le tout sur des GPU NVIDIA dans Google Cloud, c'est peut-être le chemin le plus rapide, mais c'est le genre de dépendance qu'Apple a passé vingt ans à éviter, et là ils la construisent vis-à-vis de deux rivaux directs.

LLMsOpinion
1 source
☕️ Microsoft bloque Claude Fable 5 en interne à cause de la rétention des données
26Next INpact 

☕️ Microsoft bloque Claude Fable 5 en interne à cause de la rétention des données

Microsoft a intégré Claude Fable 5 d'Anthropic à GitHub Copilot et à sa plateforme Azure Foundry pour le développement d'applications IA, mais a bloqué l'accès au modèle pour ses propres employés dans les versions internes de ces outils. La raison : une politique de rétention des données incompatible avec les exigences internes de l'éditeur. Anthropic conserve en effet les requêtes et les réponses générées par Fable 5 pendant 30 jours, une durée qui peut s'étendre à deux ans en cas de suspicion d'usage malveillant. Ce délai existe parce que Fable 5 repose sur la même architecture que Mythos, le modèle à capacités avancées d'Anthropic, même s'il en est une version bridée : toute question touchant à la cybersécurité, la biologie, la chimie ou la distillation de modèles IA est automatiquement redirigée vers Opus 4.8, plus restreint. Pour les utilisateurs individuels de Claude.ai ou de l'application mobile, cette rétention de 30 jours est déjà la norme et ne change rien. En revanche, pour les entreprises qui accèdent à Claude via la console professionnelle, Amazon Bedrock, Google Cloud Agent ou Foundry avec le mode Zero Data Retention activé, c'est une rupture nette. Ce mode, proposé par Anthropic à certains clients enterprise, garantissait jusqu'ici qu'aucune donnée n'était conservée après traitement. Fable 5 ne supporte plus cette garantie, ce qui expose potentiellement des données sensibles, des informations confidentielles ou des propriétés intellectuelles aux conditions de rétention d'Anthropic. L'équipe juridique de Microsoft évalue actuellement les implications de ce changement, sans calendrier de résolution annoncé. Le cas illustre une tension structurelle croissante dans l'adoption des LLM de pointe par les grandes entreprises : plus les modèles sont puissants et soumis à des exigences de surveillance réglementaire, plus les conditions d'utilisation deviennent contraignantes pour les clients professionnels. D'autres organisations utilisant Fable 5 via ces mêmes canaux pourraient se retrouver dans la même situation que Microsoft, ce qui pourrait freiner l'adoption enterprise du modèle malgré ses performances.

UELes entreprises européennes utilisant Claude Fable 5 via Azure Foundry, Amazon Bedrock ou Google Cloud Agent perdent la garantie Zero Data Retention, créant un risque concret de non-conformité RGPD pour les données professionnelles sensibles.

💬 Le Zero Data Retention, c'était l'argument qui faisait craquer les directions juridiques. Anthropic le retire avec Fable 5 parce que le modèle partage une base avec Mythos et qu'ils veulent surveiller les requêtes sensibles, la logique est là, mais ça va freiner l'adoption enterprise bien plus sûrement que n'importe quel mauvais benchmark. Pour les boîtes européennes qui bossent sous RGPD, c'est pas une friction, c'est un mur.

LLMsOpinion
1 source
Créer un assistant de réparation d'équipements alimenté par l'IA avec Amazon Bedrock AgentCore
27AWS ML Blog 

Créer un assistant de réparation d'équipements alimenté par l'IA avec Amazon Bedrock AgentCore

Amazon Web Services a publié un tutoriel détaillé présentant la construction d'un assistant de réparation d'équipements agricoles propulsé par l'IA, en s'appuyant sur son service Amazon Bedrock AgentCore. L'assistant est conçu pour permettre aux techniciens de terrain de diagnostiquer des pannes de machines lourdes, d'identifier les pièces nécessaires et d'accéder aux procédures de réparation approuvées par les fabricants, le tout via un langage naturel. Techniquement, la solution repose sur plusieurs briques AWS : le runtime AgentCore associé au Strands Agents SDK, le modèle de fondation Amazon Nova 2 Lite pour l'inférence, une Knowledge Base Bedrock pour la génération augmentée par récupération (RAG), et AgentCore Memory pour la persistance des conversations entre sessions. Le frontend React est hébergé sur AWS Amplify, tandis qu'Amazon Cognito gère l'authentification des utilisateurs. Les données de documentation, manuels constructeurs, catalogues de pièces, guides de réparation, sont indexées dans Amazon S3, interrogées via Amazon OpenSearch Serverless pour la recherche vectorielle, avec Amazon Titan Embeddings pour la correspondance sémantique. Les tickets d'intervention sont stockés dans Amazon DynamoDB. La portée concrète de cet outil est significative pour un secteur où chaque heure d'immobilisation d'une machine pendant les récoltes peut se chiffrer en milliers d'euros de pertes. Aujourd'hui, un technicien envoyé sur site sans la bonne pièce doit souvent repartir, revenir, et multiplier les déplacements, allongeant le temps d'arrêt de manière coûteuse. En permettant un diagnostic précis en amont, avec accès instantané aux manuels techniques du fabricant et aux nomenclatures de pièces, l'assistant réduit ce cycle. La mémoire inter-sessions d'AgentCore est particulièrement utile : le technicien peut reprendre une conversation là où il l'avait laissée, sans répéter le contexte de la panne à chaque nouvelle interaction. Cette publication s'inscrit dans la stratégie agressive d'AWS pour imposer Bedrock AgentCore comme plateforme de référence pour le déploiement d'agents IA en production. Lancé en 2025, AgentCore vise à simplifier l'hébergement, la mémoire et l'observabilité des agents, des points de friction majeurs dans les projets IA réels. La concurrence est vive : Vertex AI de Google, Azure AI Foundry de Microsoft, et des frameworks open-source comme LangGraph cherchent tous à capter ce marché. En publiant des cas d'usage sectoriels concrets, ici l'agritech, après d'autres dans la santé ou la finance, AWS tente de démontrer la maturité opérationnelle de sa plateforme face à des besoins métier exigeants. La prochaine étape logique pour ce type de solution serait l'intégration de données IoT temps réel issues des capteurs des machines, pour passer du diagnostic assisté au diagnostic prédictif.

UELes développeurs et entreprises agritech européens peuvent s'appuyer sur ce tutoriel pour construire des assistants de maintenance similaires adaptés au parc de machines agricoles de l'UE.

OutilsOutil
1 source
Anthropic lâche enfin son IA Mythos… mais sous un autre nom
28Le Big Data 

Anthropic lâche enfin son IA Mythos… mais sous un autre nom

Anthropic a officiellement lancé le 9 juin 2026 Claude Fable 5, un modèle d'intelligence artificielle qui n'est autre qu'une version publique de Mythos 5, son système jugé trop sensible pour être diffusé librement il y a deux mois. Les performances du modèle sont remarquables : sur SWE-Bench Pro, le benchmark de référence en ingénierie logicielle, Fable 5 atteint 80,3 %, contre 69,2 % pour Claude Opus 4.8, 58,6 % pour GPT-5.5 et 54,2 % pour Gemini 3.1 Pro. L'écart se creuse encore sur FrontierCode Diamond, un test d'évaluation des capacités de programmation avancée, où Fable 5 obtient 29,3 % contre 13,4 % pour Opus 4.8. Le modèle a également réussi à terminer Pokémon Rouge Feu en se basant uniquement sur des captures d'écran, sans carte ni outils de navigation, une prouesse que les générations précédentes ne pouvaient accomplir sans assistance externe. Le modèle est accessible via l'API Claude, Claude Code, ainsi que sur AWS, Google Cloud et Microsoft Foundry, à 10 dollars par million de tokens en entrée et 50 dollars en sortie. Ce lancement marque une avancée significative dans la course aux agents autonomes capables de produire du code de qualité professionnelle, avec un avantage technique mesurable sur les principaux concurrents. Pour les développeurs et les entreprises, Fable 5 représente un saut qualitatif réel sur les tâches longues et complexes, là où l'écart de performance avec les autres modèles est le plus prononcé. La décision de rendre le modèle accessible aux abonnés Pro, Max, Team et Enterprise sans surcoût jusqu'au 22 juin illustre une stratégie d'adoption agressive, avant une bascule vers un système de crédits dédiés. Son tarif de sortie, deux fois supérieur à celui d'Opus, le positionne néanmoins parmi les modèles les plus onéreux du catalogue Anthropic. La prudence initiale d'Anthropic autour de Mythos n'a pas disparu pour autant : Fable 5 embarque des systèmes de surveillance en temps réel qui redirigent automatiquement vers Claude Opus 4.8 les requêtes touchant à des domaines sensibles, notamment la cybersécurité offensive, la biologie, la chimie ou la reproduction de modèles d'IA. Ce filtrage ne concerne cependant que moins de 5 % des conversations, selon l'entreprise. La version originale, Mythos 5, reste quant à elle réservée à un cercle restreint d'organisations sélectionnées dans le cadre du programme Project Glasswing. Ce modèle à deux vitesses illustre la tension croissante entre la compétition commerciale qui pousse à publier les modèles les plus puissants et la pression réglementaire et éthique qui incite à en limiter l'accès, une dynamique qui devrait s'intensifier à mesure que les capacités des agents autonomes progressent.

UELes développeurs et entreprises en France et en UE bénéficient d'un accès immédiat à un modèle de codage nettement plus performant, susceptible d'accélérer les projets de développement logiciel, sans impact réglementaire ou institutionnel direct.

💬 80 % sur SWE-Bench Pro, c'est plus une nuance, c'est l'argument qui fait basculer. Mythos était jugé trop risqué pour sortir en février, il s'appelle maintenant Fable 5 avec un filtre temps réel sur bio, cyber offensif et compagnie, ce qui couvre moins de 5 % des cas selon Anthropic. Le vrai frein, c'est le prix de sortie : 50 dollars le million de tokens, à réserver aux tâches longues où l'écart se voit vraiment.

LLMsOpinion
1 source
NVIDIA intègre le calcul confidentiel pour renforcer le Private Cloud Compute d'Apple
29NVIDIA AI Blog 

NVIDIA intègre le calcul confidentiel pour renforcer le Private Cloud Compute d'Apple

Apple vient d'annoncer lors de sa conférence annuelle WWDC 2026 l'extension de son infrastructure Private Cloud Compute (PCC) au-delà de ses propres centres de données, vers Google Cloud. Pour sécuriser cette expansion, Apple s'appuie désormais sur les GPU NVIDIA avec Confidential Computing, notamment les puces Blackwell de dernière génération. Ces GPU servent à l'inférence confidentielle côté serveur pour les Apple Foundation Models, des modèles d'IA propriétaires développés conjointement par Apple et Google à partir des technologies qui sous-tendent la famille Gemini. C'est la première fois qu'Apple intègre explicitement du matériel NVIDIA dans l'architecture de sécurité matérielle de PCC, un système conçu pour traiter des requêtes d'intelligence artificielle sensibles sans exposer les données des utilisateurs. Cette collaboration soulève un enjeu fondamental pour l'IA à grande échelle : comment traiter des données personnelles dans le cloud sans sacrifier ni la performance ni la confidentialité. Le Confidential Computing de NVIDIA répond à cette contrainte en isolant les charges de travail dans des environnements d'exécution sécurisés, en chiffrant les flux de communication entre composants, et en permettant une attestation à distance, un mécanisme cryptographique qui permet au logiciel de vérifier que l'infrastructure n'a pas été compromise avant d'y envoyer des données sensibles. Concrètement, cela signifie que personne, y compris les ingénieurs d'Apple, de Google ou de NVIDIA, ne peut accéder aux conversations ou données des utilisateurs pendant le traitement. Pour des centaines de millions d'utilisateurs Apple qui activent des fonctions Apple Intelligence impliquant du traitement cloud, cette garantie est directement opérationnelle. Cette annonce s'inscrit dans une tendance de fond : à mesure que les expériences d'IA hybrides combinent traitement sur l'appareil et inférence serveur, la pression sur la chaîne de confiance s'intensifie. Apple avait fait de la confidentialité de PCC une promesse centrale depuis l'introduction d'Apple Intelligence, mais ses centres de données propriétaires limitaient sa capacité à monter en puissance. Le recours à Google Cloud, avec des GPU Blackwell sécurisés, lui permet de scaler sans renoncer à cette promesse. Pour NVIDIA, c'est une validation de son positionnement sur la sécurité de l'IA, un segment encore peu exploité mais stratégique face à des régulations croissantes sur les données personnelles. L'intégration de ces trois acteurs majeurs, Apple, Google et NVIDIA, autour d'un standard commun de confidentialité computationnelle pourrait accélérer l'adoption de ce type d'architecture dans l'ensemble de l'industrie.

UEL'architecture de confidentialité computationnelle décrite pourrait devenir un standard pour les entreprises européennes soumises au RGPD cherchant à déployer l'IA dans le cloud sans compromettre la protection des données personnelles.

💬 Apple qui sous-traite sa confidentialité à Google Cloud, c'est un paradoxe savoureux. Mais le Confidential Computing de NVIDIA change la lecture : l'attestation à distance garantit que même les ingénieurs des trois boîtes ne touchent pas aux données pendant l'inférence, c'est pas du branding, c'est de la cryptographie. Reste à voir si ça tient à l'échelle, mais sur le papier c'est le template qu'on attendait pour que l'IA cloud passe enfin le test RGPD.

Les agents IA embarqués se heurtent à une limite mémoire, qu'Apple contourne avec sa nouvelle architecture
30VentureBeat AI 

Les agents IA embarqués se heurtent à une limite mémoire, qu'Apple contourne avec sa nouvelle architecture

Apple a annoncé lors de la WWDC26 sa troisième génération de modèles de fondation, la famille AFM 3, développée en collaboration avec Google. Cette famille comprend cinq modèles : deux fonctionnant en local sur l'appareil et trois hébergés côté serveur, dont AFM 3 Cloud Pro, dédié aux tâches agentiques complexes et s'exécutant sur des GPU Nvidia dans Google Cloud. La pièce maîtresse de l'annonce est AFM 3 Core Advanced, un modèle de 20 milliards de paramètres conçu pour tourner directement sur les appareils Apple, et dont l'architecture rompt radicalement avec les contraintes habituelles de l'IA embarquée. Plutôt que de stocker l'ensemble des poids du modèle en mémoire vive (DRAM), Apple les place en mémoire flash NAND, la même technologie utilisée pour le stockage interne des iPhone et Mac. Un petit modèle auxiliaire prédit, à partir du prompt, quels "experts" charger depuis la flash vers la RAM avant de générer la réponse. Le nombre de paramètres actifs varie ainsi entre 1 et 4 milliards selon la complexité de la tâche, tous puisés dans le réservoir de 20 milliards stocké en flash. Cette approche lève un verrou fondamental qui bridait l'IA on-device depuis ses débuts : la capacité limitée de la DRAM contraint aujourd'hui les modèles embarqués à quelques milliards de paramètres au maximum, très loin des capacités des modèles cloud. En déplaçant le stockage vers la flash et en ne chargeant en RAM que les experts pertinents pour chaque requête, Apple ouvre la voie à des modèles locaux sensiblement plus puissants, sans dépendance permanente au réseau. Pour les développeurs d'applications, cela signifie potentiellement accéder à des capacités de raisonnement et d'outil use jusqu'ici réservées au cloud, tout en conservant les garanties de confidentialité du Private Cloud Compute d'Apple. La contrainte technique centrale que l'architecture contourne est celle de la bande passante flash-vers-RAM : dans un modèle Mixture of Experts classique, le routeur sélectionne des experts différents à chaque token généré, une cadence bien trop rapide pour la NAND. Apple résout ce problème en effectuant le routage une seule fois par prompt, chargeant un ensemble fixe d'experts pour toute la génération de la réponse. Awni Hannun, chercheur chez Anthropic et ancien scientifique chez Apple, a salué l'approche sur X tout en soulignant son caractère "exotique par rapport aux standards actuels". Des zones d'ombre demeurent cependant : selon Marco Abis, développeur du profileur Ziraph pour Apple Silicon, la documentation d'Apple ne précise ni la consommation énergétique, ni la bande passante mémoire, ni le comportement thermique du modèle, ni les conditions dans lesquelles une requête locale est silencieusement redirigée vers le cloud.

UELa fonctionnalité de traitement on-device avec garanties de confidentialité intégrées facilite potentiellement la conformité RGPD pour les développeurs européens déployant des applications IA sur appareils Apple.

LLMsOpinion
1 source
IBM et Google Cloud veulent accélérer l’adoption de l’IA dans les entreprises
31Le Big Data 

IBM et Google Cloud veulent accélérer l’adoption de l’IA dans les entreprises

IBM et Google Cloud ont annoncé le 4 juin 2026 une expansion significative de leur partenariat stratégique, avec le lancement d'une Google Cloud Practice dédiée au sein d'IBM Consulting. Cette nouvelle entité regroupe des milliers de consultants IBM certifiés Google Cloud ainsi que des équipes d'ingénierie spécialisées, avec pour mission d'accompagner les grandes organisations dans le déploiement d'agents IA à l'échelle industrielle. Concrètement, les deux groupes combinent la plateforme Gemini Enterprise Agent de Google Cloud avec l'expertise sectorielle d'IBM Consulting pour couvrir huit domaines prioritaires : banque, assurance, administrations publiques, télécommunications, énergie, commerce de détail, cybersécurité et sciences de la vie. Les consultants IBM pourront désormais concevoir, déployer et gérer directement des agents IA sur l'infrastructure Google Cloud, en s'appuyant sur des composants préconfigurés et des méthodologies éprouvées. L'enjeu est de résoudre l'un des blocages les plus coûteux de l'industrie : la difficulté à transformer les projets pilotes en déploiements opérationnels rentables. De nombreuses entreprises ont expérimenté l'IA sans parvenir à en extraire une valeur concrète à grande échelle, faute d'intégration avec les systèmes critiques existants et de garanties suffisantes en matière de gouvernance et de conformité réglementaire. En proposant un cadre commun avec des agents sectoriels préconstruits, IBM et Google entendent réduire drastiquement le délai entre la conception et la mise en production, tout en permettant aux organisations d'automatiser des processus métiers complexes sans multiplier les développements sur mesure. Pour les secteurs fortement réglementés comme la finance ou la santé, la promesse est d'intégrer l'IA aux flux de travail existants tout en respectant les contraintes légales et sécuritaires. Cette initiative s'inscrit dans une tendance de fond qui voit les grands acteurs du cloud et du conseil former des alliances de plus en plus intégrées pour capter le marché de l'IA d'entreprise, estimé à plusieurs milliards de dollars. IBM, qui a repositionné une large partie de sa stratégie autour du conseil en transformation numérique depuis la cession de son activité infrastructure à Kyndryl en 2021, cherche à capitaliser sur sa présence dans les grandes entreprises pour distribuer les technologies de ses partenaires cloud. Google Cloud, de son côté, intensifie la mise en marché de Gemini via des alliances avec des intégrateurs disposant d'une relation de confiance établie avec les directions générales et les DSI. La prochaine étape attendue sera la mise sur le marché effective de ces agents sectoriels et les premiers retours de déploiements en production, qui conditionneront la crédibilité commerciale de cette alliance face à des concurrents comme Microsoft et Accenture ou AWS et Deloitte.

UELes secteurs prioritaires visés, banque, assurance et administrations publiques, sont au cœur de l'économie française et européenne, et ce cadre commun d'agents IA devra se conformer à l'AI Act et au RGPD, ce qui en fait un cas d'usage directement pertinent pour les DSI européens.

💬 Le vrai problème des pilotes IA qui restent des pilotes, IBM et Google s'y attaquent enfin avec du concret. Des milliers de consultants certifiés, des agents préconstruits par secteur, un cadre commun qui évite de tout recoder à chaque client, c'est le genre d'approche qui peut débloquer des grands comptes paralysés depuis deux ans sur les mêmes questions de conformité. Reste à voir ce que ça donne en prod, parce que Microsoft et Accenture ne regardent pas ça les bras croisés.

BusinessOpinion
1 source
IA d’entreprise : Snowflake et Anthropic renforcent la gouvernance des modèles IA
32Le Big Data 

IA d’entreprise : Snowflake et Anthropic renforcent la gouvernance des modèles IA

Snowflake et Anthropic ont annoncé le 2 juin 2026, lors du Snowflake Summit 2026, un renforcement significatif de leur partenariat autour de l'IA d'entreprise. Concrètement, les modèles Claude d'Anthropic s'intègrent désormais plus profondément dans Snowflake Cortex AI, notamment pour alimenter Snowflake Cortex Code et Snowflake Intelligence. L'objectif est de permettre aux organisations de déployer des agents IA directement dans leur environnement de données existant, sans avoir à externaliser ou déplacer des données sensibles. Des entreprises comme Block, Indeed, Carvana, Notion ou eSentire utilisent déjà cette combinaison en production. Christian Kleinerman, EVP Product chez Snowflake, a indiqué que Snowflake Cortex Code serait devenu le produit à la croissance la plus rapide de toute l'histoire du groupe. L'enjeu central de ce partenariat est la gouvernance : les entreprises des secteurs réglementés, finance, santé, cybersécurité, retail, ne peuvent pas déployer l'IA sur des données critiques sans garanties fortes en matière de sécurité, de conformité et de traçabilité. En combinant la couche de gouvernance et de contrôle d'accès de Snowflake avec les capacités de raisonnement de Claude, les deux groupes proposent une architecture où le modèle devient une extension native de la plateforme data de l'entreprise plutôt qu'un outil externe. Cela change concrètement le profil de risque de l'IA générative pour les décideurs : Block automatise ainsi des workflows de conformité pour Square et Cash App, eSentire automatise des analyses SOC de niveau 1 pour libérer ses analystes humains des tâches répétitives, et Carvana optimise ses opérations logistiques et financières grâce à cette architecture. Ce renforcement s'inscrit dans la continuité d'un accord élargi signé fin 2025, qui avait déjà permis l'intégration native de Claude dans Cortex AI sur les principaux clouds. Le marché de l'IA d'entreprise est en train de basculer d'une phase d'expérimentation vers des déploiements opérationnels à grande échelle, et plusieurs acteurs, Microsoft avec Azure OpenAI, Google avec Vertex AI, AWS avec Bedrock, se livrent une concurrence intense pour capter cette demande. Snowflake, en tant que plateforme data indépendante du cloud, joue une carte différente : celle de la neutralité et de la gouvernance centralisée. Anthropic, de son côté, accélère sa distribution en entreprise via des partenariats stratégiques plutôt que par une offre cloud propriétaire. Les prochaines étapes du partenariat devraient porter sur l'extension de Claude Marketplace au sein de l'écosystème Snowflake, ouvrant la porte à un modèle de distribution plus large pour les modèles d'Anthropic dans les environnements data d'entreprise.

UELes entreprises européennes des secteurs réglementés (finance, santé, cybersécurité) disposent d'une architecture permettant de déployer Claude directement dans leur environnement de données existant, sans externaliser de données sensibles, un argument clé pour la conformité RGPD.

OutilsOpinion
1 source
Amazon Bedrock AgentCore Gateway étend sa prise en charge du protocole MCP
33AWS ML Blog 

Amazon Bedrock AgentCore Gateway étend sa prise en charge du protocole MCP

Amazon a annoncé cette semaine une extension significative des capacités d'AgentCore Gateway, son service de passerelle centralisée pour le protocole MCP (Model Context Protocol) au sein d'Amazon Bedrock. Les nouvelles fonctionnalités couvrent notamment la prise en charge étendue des schémas d'outils MCP, l'intégration des primitives MCP prompts et ressources, la découverte dynamique de serveurs MCP à l'exécution, la gestion de sessions pour les interactions temps réel, un mécanisme d'élicitation permettant des demandes d'entrée en cours d'exécution, et un échange de jetons OAuth 2.0 pour l'authentification déléguée. Ces ajouts s'appliquent à un service qui sert déjà de point d'entrée unique entre les serveurs MCP d'une organisation et les clients qui les consomment, en centralisant la gestion des identifiants, l'observabilité et la connectivité sécurisée. L'enjeu est directement opérationnel pour les équipes engineering en entreprise. Sans passerelle centralisée, chaque serveur MCP déployé, qu'il gère les contrats pour l'équipe juridique, les données financières ou les incidents opérationnels, doit gérer indépendamment ses propres mécanismes d'authentification, de contrôle d'accès et de journalisation. Cela multiplie les délais d'approbation, fragmente la visibilité sur l'usage des outils et oblige les équipes sécurité à auditer chaque serveur séparément. AgentCore Gateway réduit ce fardeau en laissant chaque équipe se concentrer sur la logique métier de son serveur MCP, tandis que la passerelle prend en charge tout le reste : agrégation des capacités, politiques d'accès basées sur les ressources, isolation réseau via AWS PrivateLink, logs d'audit centralisés, et guardrails déterministes via AgentCore Policy. MCP, le protocole lancé par Anthropic fin 2024 pour standardiser la façon dont les agents IA interagissent avec des outils et services externes, a rapidement été adopté par les grands acteurs du cloud, dont AWS, Microsoft et Google. Amazon intègre AgentCore Gateway dans son écosystème Bedrock, qui concurrence directement Azure AI et Google Cloud Vertex AI dans la course aux infrastructures d'agents IA en entreprise. La montée en puissance des architectures multi-agents, où plusieurs modèles coopèrent en orchestrant des dizaines d'outils, rend ce type de couche de gouvernance centrale de plus en plus stratégique. Les prochaines étapes probables incluent une intégration plus poussée avec les outils d'identité AWS IAM et une extension du support aux agents tiers via les flux OAuth 2.0 maintenant disponibles dans la passerelle.

InfrastructureOpinion
1 source
Workday et Google Cloud déploient des agents IA pour les RH et la finance
34Le Big Data 

Workday et Google Cloud déploient des agents IA pour les RH et la finance

Workday et Google Cloud ont annoncé le 29 mai 2026 une extension significative de leur partenariat, visant à intégrer les agents IA de Workday directement dans Gemini Enterprise, la suite collaborative de Google. Concrètement, l'agent Sana Self-Service de Workday s'imbrique désormais dans l'environnement Google que les collaborateurs utilisent au quotidien. Un salarié peut ainsi consulter son solde de congés, récupérer un bulletin de paie ou soumettre une demande d'absence sans jamais ouvrir l'interface Workday. Les managers gagnent eux aussi en autonomie : approbation de feuilles de temps, lancement d'évaluations de performance, accès aux objectifs d'équipe, tout cela depuis une interface conversationnelle unique. Côté finance, les utilisateurs peuvent interroger les politiques de dépenses et initier des démarches administratives sans changer d'outil. L'annonce confirme par ailleurs que Gemini devient le modèle d'IA par défaut de Sana dans Workday, remplaçant les solutions précédemment utilisées. L'enjeu est considérable pour les grandes organisations, qui souffrent depuis des années d'une fragmentation logicielle coûteuse : les équipes jonglent quotidiennement entre suites RH, ERP financiers, outils collaboratifs et plateformes analytiques pour accomplir des tâches souvent élémentaires. En ancrant les agents directement dans les outils de travail existants, Workday et Google Cloud cherchent à éliminer ces frictions et à accélérer l'exécution des processus métiers. Pour les directions RH et financières, qui manipulent des données sensibles soumises à des réglementations strictes, l'intégration apporte aussi les capacités de raisonnement avancé, le support multimodal et le traitement multilingue de Gemini, tout en maintenant les garde-fous métier, les règles d'approbation et les contrôles de conformité propres à Workday. Ce rapprochement s'inscrit dans une tendance de fond qui voit les grands éditeurs de logiciels d'entreprise transformer leurs plateformes en orchestrateurs d'agents IA. Workday, qui gère les ressources humaines et les finances de milliers de grandes entreprises mondiales, dispose d'un levier stratégique majeur : ses données métier structurées, longtemps cloisonnées dans ses interfaces propriétaires. En ouvrant ces données aux agents via Gemini, l'éditeur américain positionne sa plateforme comme un nœud central des architectures multi-agents qui émergent dans les grands groupes. Pour Google Cloud, faire de Gemini le moteur par défaut de Sana représente une victoire commerciale et un signal fort envoyé à l'ensemble de l'écosystème enterprise, dans un marché où Microsoft, avec Copilot intégré à Office 365 et Dynamics, exerce une pression concurrentielle intense. Les prochaines étapes du partenariat devraient porter sur l'orchestration de workflows plus complexes, impliquant plusieurs agents agissant en coordination sur des processus bout-en-bout.

UELes grandes entreprises françaises et européennes utilisant Workday et Google Workspace pourraient réduire la fragmentation logicielle de leurs équipes RH et finance grâce à cette intégration.

OutilsOutil
1 source
L'IA dans le développement de jeux vidéo : comment elle transforme l'industrie
35AI News 

L'IA dans le développement de jeux vidéo : comment elle transforme l'industrie

L'intelligence artificielle s'est imposée comme un pilier du développement de jeux vidéo. Selon une enquête de Google Cloud, 90% des développeurs intègrent déjà l'IA dans leur travail quotidien, et sur Steam, 7 818 titres ont déclaré utiliser l'IA en 2025, soit une hausse de 681% par rapport à l'année précédente. Concrètement, cette intégration traverse toutes les étapes de la production. Ubisoft a développé Ghostwriter, un outil génératif qui rédige des premières ébauches de dialogues pour les personnages non-joueurs, libérant les scénaristes des tâches de pur volume. Chez Tencent, l'outil Hunyuan3D-PolyGen génère des assets 3D de niveau professionnel avec des gains d'efficacité supérieurs à 70% selon les artistes. Meta a présenté WorldGen, capable de produire un environnement 3D navigable à partir d'une simple description textuelle en cinq minutes, directement compatible avec Unity et Unreal. Du côté du contrôle qualité, EA déploie des agents d'apprentissage par renforcement pour tester ses jeux de manière autonome, pendant que Square Enix a annoncé son intention d'automatiser 70% de son processus de QA et de débogage d'ici 2027, en partenariat avec l'Université de Tokyo. L'impact opérationnel est déjà mesurable. Selon Andreessen Horowitz, la création de concept art qui nécessitait trois semaines se ramène désormais à une heure grâce aux outils génératifs. La génération vocale via des plateformes comme ElevenLabs permet de localiser un jeu dans plusieurs langues à une vitesse que les pipelines d'enregistrement traditionnels ne peuvent pas égaler. Pour les jeux navigateur, des outils comme FRVR AI permettent à n'importe quel utilisateur de générer un jeu jouable depuis une simple description. Ce nivellement de l'accès change la structure du marché : des développeurs sans formation artistique ou technique approfondie peuvent désormais atteindre le stade du prototype fonctionnel et publier sur des plateformes comme Poki, dont le modèle publicitaire offre une monétisation immédiate. L'enjeu n'est plus seulement l'efficacité des grands studios, mais la démocratisation de la création vidéoludique à une échelle sans précédent. Cette transformation s'accélère dans un secteur qui fait face depuis des années à des cycles de production longs et coûteux. L'émergence des grands modèles de langage a rendu possible ce que les systèmes procéduraux classiques ne pouvaient pas accomplir : maintenir une cohérence narrative dans des univers générés dynamiquement, comme le démontre le cadre de recherche PANGeA. Mais l'expansion n'est pas sans friction. L'afflux de titres de faible qualité générés par IA sur Steam en 2025 a soulevé des questions sur les standards minimaux dans un environnement où produire du contenu devient quasi gratuit. Les syndicats d'acteurs vocaux et les guildes de scénaristes négocient encore les conditions dans lesquelles l'IA peut générer des dialogues ou cloner des voix. Ces négociations, combinées aux questions de propriété intellectuelle sur les assets générés, dessinent les contours du prochain débat structurant pour une industrie qui pèse plusieurs centaines de milliards de dollars à l'échelle mondiale.

UEUbisoft, entreprise française leader mondial du jeu vidéo, intègre déjà l'IA générative dans ses studios via Ghostwriter, tandis que les syndicats européens de doubleurs et scénaristes négocient des garde-fous face à l'automatisation des dialogues et au clonage vocal.

💬 681% de hausse sur Steam, c'est pas une stat, c'est un signal d'alarme autant qu'une opportunité. Ce qui m'intéresse vraiment là-dedans, c'est pas les grands studios qui gagnent du temps sur les assets, c'est le mec seul qui peut maintenant aller jusqu'au prototype jouable sans équipe. Reste que l'inondation de slop sur Steam, ça va forcer une curation que la plateforme n'a jamais vraiment assumée.

OutilsOutil
1 source
Les meilleurs modèles de synthèse vocale en 2026 : comparaison par benchmarks
36MarkTechPost 

Les meilleurs modèles de synthèse vocale en 2026 : comparaison par benchmarks

La synthèse vocale par intelligence artificielle a connu une accélération spectaculaire en 2026, au point que la frontière entre voix humaine et voix synthétique est devenue difficile à percevoir. Les deux références de l'industrie pour comparer ces modèles sont le classement Artificial Analysis Speech Arena, qui attribue un score ELO basé sur les préférences humaines en aveugle, et le TTS Arena de Hugging Face, qui fonctionne sur le même principe de vote A/B. Au 30 mai 2026, le top 5 de l'Artificial Analysis Speech Arena est occupé par Gemini 3.1 Flash TTS de Google, Realtime TTS-2 d'Inworld (en Research Preview), Sonic 3.5, Realtime TTS 1.5 Max et Fun-Realtime-TTS-Preview. Parmi les acteurs les plus remarquables, Inworld AI, un laboratoire fondé par des anciens de Google et DeepMind, a lancé TTS-1.5 le 21 janvier 2026, suivi de Realtime TTS-2 plus tard dans l'année. Son modèle propose deux niveaux : Mini, optimisé pour la latence avec un temps avant premier audio inférieur à 130 millisecondes au 90e percentile, et Max, sous 250 millisecondes. La tarification va de 25 dollars par million de caractères pour le Mini jusqu'à 5 dollars en offre Enterprise. Google DeepMind, de son côté, a publié Gemini 3.1 Flash TTS le 15 avril 2026, accessible via l'API Gemini, AI Studio et Vertex AI. Ces évolutions ont des implications directes pour les développeurs et les entreprises qui intègrent la voix dans leurs produits. Une latence sous les 100 millisecondes est désormais atteignable pour certains systèmes temps réel, ce qui rend les agents vocaux réellement utilisables dans des contextes grand public, comme le service client automatisé ou les jeux vidéo. Inworld revendique 30 % de plage expressive supplémentaire et 40 % de stabilité en plus par rapport à sa génération précédente, deux critères critiques pour des applications qui ne peuvent se permettre ni monotonie ni erreurs de prononciation. Les tarifs agressifs, notamment l'offre Enterprise à 5 dollars le million de caractères, signalent une course vers la commoditisation du TTS, similaire à ce que le marché des LLM a vécu entre 2023 et 2025. La comparaison entre modèles reste néanmoins complexe, car aucun benchmark ne capture l'ensemble des dimensions pertinentes. La qualité perçue, le taux d'erreur de caractères mesuré par méthode aller-retour (transcription ASR puis comparaison avec l'entrée), la latence de queue et la couverture linguistique obéissent à des logiques distinctes. Inworld couvre 15 langues pour TTS-1.5 mais plus de 100 pour TTS-2, tandis que les classements ELO fluctuent d'une semaine à l'autre. L'enjeu pour les équipes produit est d'identifier l'axe non négociable de leur application, qu'il s'agisse de la latence pour un assistant vocal ou de la fidélité phonétique pour un usage éditorial, avant de choisir leur fournisseur dans un marché qui reste en recomposition permanente.

💬 Le TTS vit ce que les LLM ont traversé entre 2023 et 2025. 5 dollars le million de caractères en Enterprise chez Inworld, Gemini Flash TTS qui s'installe en tête des classements, la course vers la commoditisation est enclenchée et ça va aller vite. La vraie nouveauté, c'est la latence sous 100ms qui rend enfin les agents vocaux utilisables en vrai, pas juste en démo.

CréationOutil
1 source
[AINews] Anthropic lève 965 milliards en Série H et publie Opus 4.8 et Dynamic Workflows/ultracode
37Latent Space 

[AINews] Anthropic lève 965 milliards en Série H et publie Opus 4.8 et Dynamic Workflows/ultracode

Anthropic a annoncé le 28 mai 2026 une levée de fonds de 65 milliards de dollars dans le cadre de sa Série H, valorisant l'entreprise à 965 milliards de dollars après dilution. Le tour a été mené par Altimeter, Dragoneer, Greenoaks et Sequoia, avec 15 milliards supplémentaires apportés par des hyperscalers dont Amazon. Simultanément, la startup a révélé que son chiffre d'affaires annualisé dépasse désormais 47 milliards de dollars, contre 9 milliards seulement en décembre 2025. Cette même journée, Anthropic a lancé Claude Opus 4.8, présenté comme une mise à jour substantielle d'Opus 4.7 intégrant un meilleur jugement, plus d'honnêteté sur ses propres limites et une capacité de travail autonome prolongée, au même prix. L'entreprise a également introduit en préversion de recherche les Dynamic Workflows dans Claude Code, un système d'orchestration capable de planifier des tâches complexes et de déployer simultanément des centaines de sous-agents en parallèle. Ces annonces placent Anthropic, au moins provisoirement, devant OpenAI sur les principaux indicateurs de valorisation et de revenus. L'ampleur de la croissance est spectaculaire : multiplier par cinq un chiffre d'affaires annualisé en cinq mois est sans précédent dans l'industrie technologique. La fonctionnalité Dynamic Workflows illustre concrètement ce que cette puissance financière finance : Jarred Sumner, créateur du runtime JavaScript Bun, a utilisé l'outil baptisé ultracode pour réécrire 750 000 lignes de code de Zig vers Rust en six jours, un projet qui aurait nécessité des mois de travail humain. Opus 4.8 s'impose également comme le modèle de référence sur la quasi-totalité des benchmarks économiquement pertinents, dépassant notamment Gemini 3.5 Flash et les modèles GPT-5.5 d'OpenAI sur les tâches de codage longue durée. Les évaluations indépendantes confirment une amélioration significative par rapport à 4.7, particulièrement sur les tâches agentiques et les travaux de connaissance à long horizon. Anthropic s'est longtemps positionné comme l'alternative responsable à OpenAI, avec une croissance explosive portée par les déploiements enterprise et l'usage grand public de Claude. L'investissement massif d'Amazon, qui avait déjà engagé plusieurs milliards dans des tours précédents, ancre la startup dans l'écosystème cloud d'AWS, tandis que la présence de Sequoia et d'Altimeter signal un appétit institutionnel pour une introduction en bourse à terme. Les Dynamic Workflows sont d'ores et déjà disponibles sur toutes les offres commerciales : Max, Team, Enterprise, API, ainsi que sur Bedrock, Vertex AI et Foundry. La prochaine étape sera de confirmer si cette valorisation de près de 1 000 milliards se justifie par une monétisation durable ou si elle reflète avant tout l'euphorie du cycle actuel autour de l'IA générative.

UEL'émergence de systèmes IA capables d'automatiser des centaines de milliers de lignes de code en quelques jours va intensifier le débat au Parlement européen sur les seuils de régulation de l'AI Act et les mesures de protection des travailleurs du secteur technologique.

💬 Le chiffre qui m'a arrêté c'est pas la valorisation, c'est le revenu. 9 milliards en décembre, 47 en mai : multiplier par cinq en cinq mois, t'as beau chercher, ça n'a pas de précédent dans la tech. Et quand Jarred Sumner migre 750 000 lignes de code en six jours avec ultracode, là on comprend pourquoi les investisseurs remettent des chèques à neuf chiffres sans sourciller.

Anthropic lance Claude Opus 4.8 : workflows dynamiques, mode rapide moins cher et limite de 1 000 sous-agents
38MarkTechPost 

Anthropic lance Claude Opus 4.8 : workflows dynamiques, mode rapide moins cher et limite de 1 000 sous-agents

Anthropic a lancé Claude Opus 4.8 accompagné de deux nouvelles fonctionnalités pour Claude Code : les workflows dynamiques et une mise à jour du mode rapide. Les workflows dynamiques permettent d'orchestrer des centaines de sous-agents en parallèle via un script JavaScript que Claude génère automatiquement à partir d'une description de tâche. Un runtime exécute ce script en arrière-plan, libérant la fenêtre de contexte de Claude des résultats intermédiaires, qui restent stockés dans des variables du script. Chaque exécution est plafonnée à 16 agents simultanés et 1 000 agents au total. La fonctionnalité est disponible sur les plans Max, Team et Enterprise (désactivée par défaut sur Enterprise), ainsi que via l'API Claude, Amazon Bedrock, Vertex AI et Microsoft Foundry, à partir de la version 2.1.154 de Claude Code. En parallèle, le mode rapide pour Opus 4.8 est annoncé trois fois moins cher que pour Opus 4.7 (facturé 30/150 dollars par million de tokens en entrée/sortie), tout en offrant des vitesses de génération 2,5 fois supérieures. Les deux fonctionnalités sont disponibles en aperçu de recherche. Pour les développeurs confrontés à des migrations ou des audits de grande envergure, les workflows dynamiques élargissent considérablement ce qu'un agent peut accomplir en une seule session. Anthropic illustre le potentiel avec l'exemple de Jarred Sumner, qui a porté le runtime Bun du langage Zig vers Rust en 11 jours : environ 750 000 lignes de Rust générées, 99,8 % du test suite existant passé, avec des centaines d'agents travaillant en parallèle et deux réviseurs par fichier. La logique adversariale intégrée, où certains agents produisent des résultats et d'autres les réfutent jusqu'à convergence, vise une qualité inaccessible en un seul passage. Un job interrompu reprend là où il s'était arrêté dans la même session, les agents terminés retournant leurs résultats en cache. Le mode rapide répond à un besoin distinct : conserver la qualité Opus pour le débogage interactif et l'itération rapide, sans subir les délais habituels des grands modèles. Ces annonces s'inscrivent dans la course à l'agent autonome que se livrent Anthropic, OpenAI et Google depuis début 2025. Après avoir repositionné Claude Code comme plateforme de développement, Anthropic fait de l'orchestration multi-agents une fonctionnalité centrale de son offre. Le plafond de 1 000 agents par exécution et le statut d'aperçu de recherche des deux fonctionnalités témoignent d'une prudence réelle face à l'inflation des coûts en tokens, puisqu'une seule exécution peut générer des milliers d'appels. Le mode rapide, financé par des crédits d'utilisation séparés du forfait inclus, envoie un signal commercial clair : Anthropic cherche à monétiser la vitesse comme axe différenciant, là où ses concurrents misent davantage sur le prix. Les prochaines étapes probables incluent une stabilisation tarifaire et une extension des workflows vers des interfaces no-code, à mesure qu'Anthropic affine les garde-fous nécessaires à une adoption plus large.

UELa réduction de prix du mode rapide (3 fois moins cher que pour Opus 4.7) bénéficie directement aux développeurs européens utilisant Claude Code via l'API ou les plateformes cloud.

LLMsOpinion
1 source
Claude Opus 4.8 est désormais disponible sur AWS
39AWS ML Blog 

Claude Opus 4.8 est désormais disponible sur AWS

Anthropic a annoncé la disponibilité de Claude Opus 4.8, son modèle le plus avancé de la gamme Opus, sur Amazon Bedrock et sur la Claude Platform déployée sur AWS. Ce lancement permet aux équipes de développement d'intégrer le modèle directement dans leurs environnements AWS existants, tout en bénéficiant des garanties de sécurité entreprise, de résidence régionale des données et de la scalabilité d'infrastructure propres à Amazon. Pour les cas d'usage ne nécessitant pas de résidence régionale, le modèle est également accessible via la plateforme native d'Anthropic hébergée sur AWS. Techniquement, l'accès se fait via le SDK Anthropic avec l'identifiant de modèle us.anthropic.claude-opus-4-8, ou via les API Invoke et Converse d'Amazon Bedrock. Ce qui distingue Opus 4.8 de ses prédécesseurs, c'est sa capacité à maintenir un plan d'action sur plusieurs étapes successives, à suivre ce qui a été accompli et ce qui reste à faire, et surtout à se recorriger lorsqu'un blocage survient plutôt que de simplement s'arrêter sur une erreur. Pour les équipes qui automatisent des tâches longues et complexes, cette stabilité se traduit concrètement par moins de variance dans les sorties, moins de cycles de révision manuelle, et une supervision réduite des pipelines en production. En développement logiciel, le modèle est conçu pour naviguer dans de vraies bases de code, planifier avant d'éditer, et conserver le contexte sur des sessions prolongées. Les cas d'usage industriels ciblés incluent la recherche d'investissement et l'analyse de résultats financiers, la rédaction de contrats et de mémoires juridiques, la synthèse de littérature scientifique et de soumissions réglementaires en sciences du vivant, ainsi que l'analyse de menaces et la réponse à incident en cybersécurité. Ce lancement s'inscrit dans une stratégie de partenariat approfondi entre Anthropic et AWS, qui s'est notamment matérialisée par un investissement d'Amazon pouvant atteindre quatre milliards de dollars dans Anthropic. La disponibilité sur Bedrock est stratégique pour Anthropic, qui cherche à s'imposer comme fournisseur de référence pour les déploiements en entreprise, face à la concurrence directe d'OpenAI via Azure et de Google DeepMind via Vertex AI. Opus 4.8 représente le haut de gamme de la nouvelle génération Claude 4, une famille de modèles qui comprend également Sonnet 4.6 et Haiku 4.5, chacun positionné sur un équilibre différent entre performance et coût d'inférence. La prochaine étape pour Anthropic sera probablement d'élargir la disponibilité régionale du modèle sur Bedrock, et d'affiner ses capacités dans les domaines où la régulation de l'IA évolue rapidement.

UELes entreprises européennes peuvent déployer Claude Opus 4.8 sur Amazon Bedrock avec résidence régionale des données, facilitant la conformité RGPD pour les cas d'usage en production.

LLMsActu
1 source
Construire des systèmes multi-agents LangGraph serverless et scalables sur AWS avec Amazon Bedrock AgentCore
40AWS ML Blog 

Construire des systèmes multi-agents LangGraph serverless et scalables sur AWS avec Amazon Bedrock AgentCore

Amazon Web Services a présenté une architecture de référence pour déployer des systèmes multi-agents d'IA générative à grande échelle sur AWS, en combinant LangGraph, AWS Lambda, AWS Step Functions et les deux nouveaux services Amazon Bedrock AgentCore Memory et AgentCore Observability. L'approche repose sur une infrastructure entièrement serverless : les agents LangGraph sont packagés dans des conteneurs Docker exécutés sur Lambda, ce qui permet une montée en charge automatique sans gestion d'infrastructure. Pour illustrer le concept, AWS décrit un système concret de révision de campagnes marketing orchestrant trois agents spécialisés en parallèle, un agent "persona reviewer" qui évalue la résonance du contenu auprès de différents profils démographiques, un agent "validator" qui vérifie la conformité juridique et les chartes de marque, et un agent "finalizer" qui synthétise les retours en recommandations actionnables. Une interface React permet aux utilisateurs de télécharger leurs documents et de consulter les résultats en temps réel. Ce type d'architecture répond à un problème concret que rencontrent les entreprises en production : les agents IA performants en démo s'effondrent souvent sous la charge réelle, perdent le contexte entre les sessions et restent des boîtes noires difficiles à déboguer. AgentCore Memory résout la question de la mémoire en offrant à la fois un contexte conversationnel à court terme et une base de connaissances persistante entre sessions. AgentCore Observability capture quant à lui chaque invocation avec ses entrées et sorties LLM, la latence, et les métriques de chaîne d'outils sur l'ensemble des composants distribués. Pour les équipes en charge de systèmes critiques, c'est un changement de paradigme : il devient possible d'auditer exactement comment un agent a raisonné, quelle décision il a prise à quelle étape, et pourquoi. Cette publication s'inscrit dans une accélération visible chez AWS pour proposer une pile complète d'IA agentique cloud-native, face à la concurrence de Google (Vertex AI Agents) et Microsoft (Azure AI Foundry). LangGraph, développé par LangChain, s'impose progressivement comme standard de facto pour l'orchestration d'agents grâce à son modèle d'exécution en graphe orienté qui rend le flux de contrôle déterministe, parallélisable et conditionnel. L'intégration native avec Lambda et Step Functions est particulièrement stratégique pour les charges de travail "bursty" typiques des agents IA, où la demande est imprévisible et les coûts d'une infrastructure dédiée permanente seraient prohibitifs. La prochaine étape logique pour AWS sera d'étendre ces patterns à des workflows plus complexes impliquant des boucles de feedback humain et des agents à longue durée de vie, un segment encore largement inexploré en production.

InfrastructureActu
1 source
Créer des agents multi-locataires avec Amazon Bedrock AgentCore
41AWS ML Blog 

Créer des agents multi-locataires avec Amazon Bedrock AgentCore

Amazon a lancé Bedrock AgentCore, un service managé et serverless conçu pour permettre aux éditeurs de logiciels SaaS de déployer des applications agentiques en environnement multi-tenant sur AWS. Le service offre des primitives pour héberger des agents et des serveurs MCP (Model Context Protocol), avec une gestion intégrée des identités, de la mémoire, de l'observabilité et des évaluations. Le coeur de son architecture repose sur des microVMs isolées par session: chaque session client obtient son propre environnement d'exécution éphémère, avec un système de fichiers persistant propre, sans le coût ni la latence d'une machine virtuelle complète. Le contexte du tenant transite via des en-têtes HTTP personnalisés, portant l'identifiant du tenant, son niveau de service, ses préférences régionales et ses droits d'accès aux outils, ce qui permet à l'agent d'adapter dynamiquement son comportement sans logique de routage codée en dur. Cette approche répond directement au fossé qui sépare un prototype fonctionnel d'un déploiement en production dans un contexte SaaS. Les architectes d'applications agentiques devaient jusqu'ici résoudre manuellement six problèmes distincts: l'isolation des tenants, la propagation de leur identité, l'observabilité par tenant, l'isolation des données, l'attribution des coûts et la mitigation du "noisy neighbor" (un tenant monopolisant les ressources au détriment des autres). AgentCore propose trois patterns d'isolation, appelés Silo, Pool et Bridge, chacun offrant un compromis différent entre protection stricte et mutualisation des coûts. Pour les éditeurs gérant des centaines ou des milliers de clients sur une même plateforme, cette capacité à choisir un modèle d'isolation par segment tarifaire change concrètement l'équation économique et de conformité. Le lancement s'inscrit dans une course des grands fournisseurs cloud à imposer leurs infrastructures agentiques comme standard de facto pour la prochaine génération d'applications IA. AWS fait face à la concurrence directe de Google avec Vertex AI Agent Builder et de Microsoft avec Azure AI Agent Service, tous trois cherchant à capter les équipes d'ingénierie qui passent de l'expérimentation à la production. L'article publié par AWS est le premier d'une série, ce qui suggère que d'autres composants d'AgentCore (évaluation, fine-tuning par tenant, facturation granulaire) seront détaillés dans les prochaines semaines. La question centrale pour les équipes SaaS reste le degré de lock-in accepté en échange de la simplicité opérationnelle qu'offre un service pleinement managé.

UELes éditeurs SaaS européens construisant sur AWS peuvent exploiter les patterns d'isolation et les préférences régionales d'AgentCore pour satisfaire les exigences de résidence des données imposées par le RGPD.

OutilsOpinion
1 source
Amazon SageMaker AI prend en charge l'API compatible OpenAI
42AWS ML Blog 

Amazon SageMaker AI prend en charge l'API compatible OpenAI

Amazon a annoncé ce mois-ci que SageMaker AI supporte désormais une API compatible avec celle d'OpenAI pour ses endpoints d'inférence en temps réel. Concrètement, les développeurs qui utilisent le SDK OpenAI, LangChain ou le framework Strands Agents peuvent désormais router leurs appels vers des modèles hébergés sur SageMaker AI en changeant uniquement l'URL de l'endpoint. Plus besoin de client personnalisé, de wrapper SigV4, ni de réécriture de code. Les endpoints SageMaker exposent un chemin /openai/v1 qui accepte les requêtes au format Chat Completions et renvoie les réponses du conteneur telles quelles, y compris en streaming. L'authentification repose sur des tokens bearer à durée limitée (jusqu'à 12 heures), générés à partir des credentials AWS existants via le SDK Python SageMaker, sans clé API supplémentaire. Ce changement simplifie radicalement l'intégration de SageMaker dans les stacks d'IA existantes. Pour les équipes qui orchestrent des agents multi-LLM via une gateway (comme Bifrost, mentionnée par Giorgio Piatti, ingénieur ML chez Caffeine.AI), SageMaker devient un fournisseur interchangeable sans adaptation technique. Les cas d'usage sont nombreux : workflows agentiques tournant entièrement sur de l'infrastructure dédiée en compte AWS, hébergement multi-modèles sur un seul endpoint via les inference components (par exemple Llama pour les tâches générales, un Mistral fine-tuné pour un domaine métier, et un petit modèle de classification), ou encore déploiement de modèles open source fine-tunés sans toucher au code applicatif existant. Pour les entreprises soumises à des contraintes de souveraineté des données ou de conformité, c'est un gain concret : elles peuvent utiliser les mêmes frameworks standardisés OpenAI tout en gardant les modèles dans leur propre compte AWS. Cette annonce s'inscrit dans une bataille plus large pour capter les workloads d'inférence IA en entreprise. Le standard OpenAI s'est imposé de facto comme protocole universel pour les LLMs, et les grands fournisseurs cloud (AWS, Google, Azure) cherchent à réduire les frictions pour attirer des équipes déjà investies dans cet écosystème. Amazon avait déjà investi massivement dans Bedrock et SageMaker, mais l'adoption restait freinée par les incompatibilités d'API qui forçaient les migrations de code. En adoptant la compatibilité OpenAI directement au niveau de SageMaker AI, AWS ferme cet écart et concurrence frontalement des solutions comme Azure OpenAI Service ou les endpoints Vertex AI de Google. Le notebook d'exemple avec Qwen3-4B (modèle d'Alibaba disponible sur Hugging Face) illustre aussi l'ouverture vers les modèles open source, un segment en forte croissance face aux modèles propriétaires.

UELes entreprises européennes soumises aux contraintes RGPD et de souveraineté des données peuvent désormais utiliser les frameworks OpenAI standard tout en maintenant leurs modèles dans leur propre infrastructure AWS hébergée en région européenne.

💬 C'est le genre de truc qui semble anodin et qui change tout en pratique. Changer juste l'URL pour basculer d'OpenAI vers SageMaker, sans toucher au code, c'est exactement ce que les équipes enterprise attendaient pour switcher sans se battre avec leur DSI. Bon, ça reste AWS, donc la facture peut vite grimper, mais pour les boîtes avec des contraintes de souveraineté data, l'argument est solide.

OutilsOpinion
1 source
Google I/O 2026 : Les rumeurs disaient vrai, Gemini 3.5 débarque et va tout balayer
43Le Big Data 

Google I/O 2026 : Les rumeurs disaient vrai, Gemini 3.5 débarque et va tout balayer

Lors de la conférence Google I/O du 19 mai 2026, le géant de Mountain View a officiellement lancé la série Gemini 3.5, avec en tête de cortège le modèle Flash 3.5, disponible immédiatement dans le monde entier. Présenté par le PDG Sundar Pichai comme le modèle le plus puissant jamais développé par Google, Gemini 3.5 Flash est désormais le modèle par défaut dans l'application Gemini, dans le mode IA de Google Search, ainsi que dans Google AI Studio et Android Studio via l'API Gemini. Sur les benchmarks publiés par l'entreprise, il atteint 76,2 % sur Terminal-Bench 2.1 contre 70,3 % pour Gemini 3.1 Pro, et 1656 points sur GDPval-AA Elo en tâches agentiques contre 1314 pour son prédécesseur. Google affirme également qu'il génère jusqu'à quatre fois plus de tokens par seconde que des modèles concurrents comparables, tout en coûtant deux à trois fois moins cher dans certains scénarios. Ce lancement redistribue les cartes dans la course aux modèles de langage. Un modèle dit "Flash", habituellement positionné sur la vitesse et l'économie plutôt que la performance brute, surpasse ici le modèle Pro de la génération précédente sur presque tous les tests significatifs, y compris le codage et les tâches agentiques. Google revendique même des performances proches de Claude Opus 4.7 Max d'Anthropic sur l'Artificial Analysis Intelligence Index, tout en étant environ douze fois plus rapide. Pour les développeurs et les entreprises qui construisent des applications sur des API LLM, ce rapport performance-coût représente un argument commercial direct : des capacités de niveau frontier sans la facture associée. Google a par ailleurs annoncé que Gemini 3.5 a été conçu dans le respect de son Frontier Safety Framework, avec des outils d'analyse interprétative capables d'examiner les mécanismes de raisonnement internes du modèle avant chaque réponse. Ce lancement s'inscrit dans une dynamique d'accélération tous azimuts, après que Google a progressivement regagné du terrain sur OpenAI et Anthropic depuis fin 2024. L'autre annonce majeure de l'I/O 2026 est Gemini Spark, un agent IA personnel conçu pour fonctionner en continu sur Google Cloud, natif dans l'écosystème Workspace, Gmail, Docs, Sheets, Slides, et activable simplement par e-mail. Sur mobile, la fonction Android Halo permettra de suivre en temps réel les actions de l'agent. Selon Josh Woodward, vice-président de Google Labs, Spark peut déjà rédiger automatiquement rapports et brouillons d'e-mails à partir de données issues de documents et feuilles de calcul, et certaines PME l'utiliseraient déjà en production. La convergence entre un modèle frontier accessible, une infrastructure cloud intégrée et un agent personnel persistant dessine la stratégie Google pour 2026 : verrouiller l'utilisateur dans un écosystème IA complet avant que la concurrence ne se consolide.

UEGemini 3.5 Flash est immédiatement disponible via l'API Gemini et Google AI Studio, offrant aux développeurs et entreprises européennes un modèle frontier moins cher et plus rapide susceptible d'accélérer l'adoption IA dans les PME qui s'appuient sur l'écosystème Google Workspace.

💬 Quand le Flash dépasse le Pro de la génération d'avant sur presque tous les benchmarks, c'est que la taxonomie des modèles est en train d'exploser, et c'est une bonne nouvelle pour les devs. Quatre fois plus rapide, deux à trois fois moins cher, performances frontier : difficile d'ignorer ça si tu construis quelque chose sur API. Mais l'annonce qui m'intéresse vraiment, c'est Spark : Google ne vend pas un modèle, il vend une serrure.

LLMsOpinion
1 source
NVIDIA et Google Cloud misent sur la prochaine génération de créateurs en IA
44NVIDIA AI Blog 

NVIDIA et Google Cloud misent sur la prochaine génération de créateurs en IA

À l'occasion de Google I/O 2026, NVIDIA et Google Cloud ont annoncé une série de nouvelles ressources pour leur communauté de développeurs commune, qui regroupe désormais plus de 100 000 membres. Lancée lors de Google I/O l'année précédente, cette communauté réunit développeurs, data scientists et ingénieurs en machine learning autour de l'écosystème NVIDIA sur Google Cloud. Parmi les nouveautés dévoilées cette année : un parcours d'apprentissage dédié à la bibliothèque JAX sur GPU NVIDIA, un codelab centré sur NVIDIA Dynamo pour l'optimisation de l'inférence, ainsi que des livestreams mensuels. Les développeurs peuvent désormais déployer des applications multi-agents en combinant les modèles ouverts Gemma 4 de Google DeepMind, les modèles NVIDIA Nemotron et le Google Agent Development Kit, sur des machines virtuelles G4 de Google Cloud équipées de GPU NVIDIA RTX PRO 6000 Blackwell, via Google Cloud Run ou des instances spot. Le nouveau parcours JAX et le codelab NVIDIA Dynamo sur GKE seront disponibles le mois prochain pour les membres de la communauté. Ces annonces ont un impact direct pour les équipes techniques qui cherchent à passer du prototype à la production rapidement. En combinant des modèles ouverts, des bibliothèques accélérées comme cuDF dans Google Colab Enterprise ou Dataproc, et une infrastructure GPU de dernière génération, les développeurs disposent d'un pipeline complet pour construire des applications d'IA prêtes pour la production : des systèmes RAG (retrieval-augmented generation) sur GKE aux pipelines de données d'entreprise en passant par l'analyse sportive. La collaboration sur JAX, framework de calcul numérique utilisé notamment par Google DeepMind pour l'entraînement de grands modèles, étend ces optimisations jusqu'à la plateforme Google Cloud AI Hypercomputer et au framework MaxText, permettant de passer d'expériences sur un seul GPU à des déploiements multi-rack avec une expérience cohérente. L'un des volets les plus significatifs du partenariat concerne l'IA responsable : NVIDIA est le premier partenaire industriel à avoir collaboré avec Google DeepMind sur SynthID, une technologie de tatouage numérique qui intègre des filigranes robustes directement dans les contenus générés par l'IA. Cette technologie est appliquée aux modèles Cosmos de NVIDIA, des modèles de fondation dédiés à la perception 3D et à la simulation pour robots et systèmes autonomes, disponibles sur build.nvidia.com. Dans un contexte où les agents IA combinent de plus en plus modèles propriétaires et open source pour raisonner et agir de manière autonome, cette couche de transparence devient un enjeu central pour la confiance des organisations qui déploient ces systèmes à grande échelle.

UELa technologie SynthID de filigrane numérique, développée avec Google DeepMind et intégrée aux modèles NVIDIA, répond directement aux obligations de transparence de l'AI Act européen sur les contenus générés par IA (Article 50).

OutilsOutil
1 source
Anthropic rachète Stainless, la startup API convoitée par OpenAI et Google
45Le Big Data 

Anthropic rachète Stainless, la startup API convoitée par OpenAI et Google

Anthropic a annoncé le 18 mai 2026 l'acquisition de Stainless, une startup new-yorkaise fondée en 2022 par Alex Rattray, ancien ingénieur de Stripe. Spécialisée dans l'automatisation des SDK et des connecteurs API, Stainless avait bâti en quelques années une position de référence dans l'écosystème IA. Selon The Information, l'opération dépasserait les 300 millions de dollars. La technologie de Stainless transforme des spécifications d'API en kits de développement logiciel prêts pour la production, compatibles avec Python, Go, Java, Kotlin et TypeScript. Son avantage distinctif est la maintenance automatique de ces SDK : à chaque évolution d'une API, les bibliothèques sont mises à jour sans intervention humaine. Anthropic utilisait déjà Stainless depuis les premières versions de son API Claude, mais la startup fournissait également ses outils à OpenAI, Google, Replicate, Runway et Cloudflare. Ces clients perdront l'accès aux produits hébergés de Stainless, dont son générateur de SDK, bien qu'ils conservent la propriété des SDK déjà générés et le droit de les modifier. Cette acquisition positionne Anthropic sur un terrain stratégique qui dépasse le simple rachat technologique. Dans le marché de l'IA agentique, la valeur ne réside plus uniquement dans la puissance des modèles, mais dans leur capacité à se connecter à des systèmes externes, des bases de données et des logiciels métiers. Les SDK, serveurs MCP et connecteurs sont précisément la couche technique qui rend cette connexion possible. En intégrant Stainless, Anthropic renforce toute son infrastructure développeur autour de Claude et prive simultanément ses concurrents directs d'un fournisseur jusqu'ici commun. OpenAI et Google, qui comptaient sur ces outils, devront désormais trouver ou développer des alternatives, ce qui représente un coût de friction non négligeable pour leurs équipes techniques et leurs clients. Cette opération s'inscrit dans une logique que les grandes plateformes cloud ont perfectionnée depuis des décennies. AWS, Microsoft Azure et Google Cloud n'ont pas construit leur domination uniquement sur l'infrastructure brute, mais surtout sur des couches d'outils qui fidélisent les développeurs et rendent le changement de fournisseur coûteux. Anthropic applique aujourd'hui cette même recette au marché des agents IA, en s'appropriant une infrastructure critique juste au moment où la compétition s'intensifie. La société pousse parallèlement son protocole MCP, qui standardise la communication entre agents IA et applications tierces, et Stainless vient directement renforcer cette pile. Le rachat transforme Anthropic d'un fabricant de modèles en véritable opérateur d'infrastructure pour développeurs, un positionnement qui pourrait peser lourd dans la consolidation qui s'annonce dans le secteur.

UELes développeurs européens utilisant les outils Stainless via OpenAI ou Google devront migrer vers des alternatives, renforçant leur dépendance à l'écosystème Anthropic/Claude.

💬 Le vrai coup, c'est pas les 300 millions, c'est qu'OpenAI et Google perdent leur fournisseur de SDK commun du jour au lendemain. La maintenance automatique des bibliothèques à chaque évolution d'API, c'est invisible, mais c'est exactement le genre de truc qui colle aux mains et crée une vraie dépendance. Avec MCP qui pousse en parallèle, Anthropic est en train de bâtir la couche infrastructure dont on ne sort pas facilement.

5 % d'utilisation GPU : le problème d'infrastructure IA à 401 milliards de dollars que les entreprises ne peuvent plus ignorer
46VentureBeat AI 

5 % d'utilisation GPU : le problème d'infrastructure IA à 401 milliards de dollars que les entreprises ne peuvent plus ignorer

Les entreprises ont dépensé des milliards pour sécuriser des GPU à tout prix, et la facture est désormais présentée. Selon Gartner, l'infrastructure IA représente 401 milliards de dollars de nouvelles dépenses en 2025, mais des audits terrain révèlent une réalité bien plus sombre : le taux d'utilisation moyen des GPU en entreprise stagne à 5 %. Pendant deux ans, la panique du « GPU scramble » a poussé DSI et directions financières à constituer des réserves de capacité sous des cycles d'amortissement de trois à cinq ans. Ces actifs sont désormais des coûts fixes inscrits aux bilans, indépendamment de leur usage effectif. Les chiffres du Q1 2026 confirment le basculement : dans le baromètre de VentureBeat, le critère « accès aux GPU » est passé de 20,8 % à 15,4 % en un seul trimestre comme moteur principal des décisions d'achat, tandis que le coût par inférence et le TCO (coût total de possession) bondissaient de 34 % à 41 %, dépassant la performance pure comme critère dominant. À 5 % d'utilisation, l'arithmétique est brutale : pour chaque dollar investi en silicium, 95 centimes partent directement dans la marge des fournisseurs cloud. Dans n'importe quel autre département, un taux de gaspillage de 95 % serait un motif de licenciement ; dans l'infrastructure IA, on appelait ça de la « préparation ». Les grands groupes comme Intuit, Mastercard ou Pfizer, qui bénéficiaient de relations privilégiées avec AWS, Azure et GCP pour sécuriser des réservations de capacité, se sont retrouvés riches en GPU mais pauvres en production : des équipes internes paralysées par la gouvernance des données, la gravité des données et une immaturité architecturale persistante ont empêché toute valorisation réelle de ces ressources. Le discours dominant sur la rareté du silicium a servi d'écran commode pour masquer cette inefficacité structurelle. Ce virage marque la fin de l'ère du chèque en blanc. Le passage à une tarification à l'usage en 2026 transforme les architectures héritées des phases pilotes, pensées avec des tokens en coûts fixes, en véritables passifs financiers. Les agents en contexte long et les pipelines de récupération complexes, construits quand les tokens étaient un coût noyé dans des licences forfaitaires, deviennent intenables sous une facturation mesuréé. L'inférence n'est plus un projet tactique : c'est un modèle économique stratégique dont les unités économiques sont, pour la plupart des entreprises, encore insoutenables. La question n'est plus de savoir si les investissements passés étaient justifiés, mais comment extraire un retour mesurable d'une infrastructure déjà déployée avant que les cycles d'amortissement ne l'emportent.

UELes entreprises européennes investies en infrastructure GPU sont exposées au même risque de sous-utilisation à 5 %, avec des cycles d'amortissement sur 3-5 ans qui transforment ces actifs en passifs financiers au moment où le marché bascule vers une tarification à l'usage.

💬 5 % d'utilisation, c'est le genre de stat qui ferait renvoyer n'importe quel responsable infra dans un département classique. La panique du GPU scramble a servi de couverture : on achetait du silicium pour ne pas rater le train, sans se demander si les équipes data étaient capables d'en faire quelque chose. Le basculement vers le pay-as-you-go va transformer ces réserves en passifs, et ça va faire des dégâts.

InfrastructureOpinion
1 source
Anthropic s'engage à dépenser 200 milliards de dollars sur Google Cloud sur cinq ans
47The Decoder 

Anthropic s'engage à dépenser 200 milliards de dollars sur Google Cloud sur cinq ans

Anthropic s'est engagé à dépenser environ 200 milliards de dollars sur les services de Google Cloud au cours des cinq prochaines années, selon un rapport de The Information. Ce montant représente plus de 40 % du carnet de commandes total de Google Cloud, une proportion sans précédent pour un seul client. OpenAI et Anthropic réunis comptent aujourd'hui pour environ la moitié des 2 000 milliards de dollars de revenus cloud contractualisés chez les quatre grands fournisseurs du marché : Amazon, Microsoft, Google et Oracle, alors que les deux startups demeurent déficitaires. Ces chiffres illustrent la dépendance structurelle des acteurs dominants de l'IA générative à l'infrastructure cloud, et la pression financière considérable qui pèse sur leurs modèles économiques. Pour justifier de tels engagements, Anthropic et OpenAI tablent chacun sur une multiplication de leurs revenus par 20 à 30 d'ici 2029. Si cette trajectoire est atteignable reste une question ouverte, au regard des pertes actuelles et de la compétition acharnée dans le secteur. Ces engagements s'inscrivent dans une relation d'interdépendance financière entre les géants du cloud et les startups IA. Google a investi plusieurs milliards de dollars dans Anthropic en tant qu'actionnaire, et ces dépenses cloud constituent en retour un flux de revenus garanti pour l'infrastructure Google. Ce modèle circulaire, où les fournisseurs cloud financent les startups qui reversent ces capitaux en achats d'infrastructure, soulève des questions sur la viabilité à long terme d'un secteur qui brûle des capitaux à une échelle inédite dans l'histoire de la tech.

UELa dépendance structurelle des leaders de l'IA générative aux infrastructures cloud américaines renforce les enjeux de souveraineté numérique européenne et soulève des questions sur la compétitivité des acteurs du secteur en Europe.

💬 200 milliards sur cinq ans chez Google Cloud, c'est pas un partenariat, c'est une dépendance assumée. Le truc fascinant, c'est la circularité du schéma : Google investit dans Anthropic, Anthropic reverse cet argent à Google Cloud, et tout le monde appelle ça de la croissance. Reste à voir comment ce montage tient si les revenus ne décollent pas au rythme x20 promis.

OGPO : un affinage complet et efficace des politiques de contrôle génératives
48arXiv cs.RO 

OGPO : un affinage complet et efficace des politiques de contrôle génératives

Un preprint arXiv de mai 2026 (2605.03065) présente OGPO, Off-policy Generative Policy Optimization, un algorithme de fine-tuning par renforcement pour les politiques génératives de contrôle (GCPs) basées sur la diffusion ou le flow matching, paradigme central de modèles comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). OGPO propage les gradients à travers l'intégralité du processus génératif via un objectif PPO modifié et maintient des réseaux critiques off-policy pour maximiser la réutilisation des données. Évalué sur des tâches de manipulation multi-tâches, d'insertion haute précision et de contrôle dextère, l'algorithme revendique un état de l'art et serait, selon les auteurs, le premier à fine-tuner des politiques de behavior cloning mal initialisées jusqu'au succès complet sans données expertes dans le replay buffer en ligne. Quatre stabilisateurs pratiques sont introduits : success-buffer regularization, conservative advantages, régularisation χ², et réduction de la Q-variance. Le fine-tuning RL des politiques génératives est l'un des principaux verrous pour le déploiement industriel de la robotique. Le behavior cloning pré-entraîne des modèles polyvalents sur de larges corpus de démonstrations, mais plafonne en deçà des taux de succès requis pour l'assemblage de précision ou la manipulation de pièces complexes. L'absence de données expertes dans le replay buffer est stratégiquement importante : un intégrateur adaptant un modèle fondation à une cellule de production spécifique n'a pas à collecter de nouvelles démonstrations coûteuses. Les stabilisateurs introduits adressent directement la sur-exploitation des critiques, mode d'échec documenté qui rendait les approches précédentes instables sur des observations en pixels. Les politiques diffusion pour la robotique ont émergé en 2023 avec Chi et al. (Diffusion Policy), avant d'être étendues au flow matching avec Pi-0 de Physical Intelligence et la famille GR00T de NVIDIA. Le fine-tuning RL de ces architectures avait été tenté avec des méthodes comme DPPO, mais restait limité aux politiques bien initialisées et nécessitait souvent des données expertes. OGPO se positionne comme une approche généraliste applicable à toute GCP. En compétition académique, les laboratoires de Berkeley, CMU et Stanford travaillent sur des problématiques proches. Côté industriel, Physical Intelligence, Boston Dynamics et Figure AI intègrent ce type d'optimisation dans leurs pipelines, et des acteurs européens comme Enchanted Tools (France) opèrent dans cet espace. La suite logique est une validation à plus grande échelle sur hardware réel et une extension aux architectures VLA (Vision-Language-Action) multimodales.

UEEnchanted Tools (France) opère sur des architectures similaires et pourrait intégrer OGPO pour affiner ses politiques de contrôle sans collecte de démonstrations expertes supplémentaires.

💬 Le vrai verrou, c'était ça : fine-tuner sans avoir à collecter de nouvelles démos expertes, parce que personne n'a le budget pour ça quand on adapte un modèle fondation à une cellule de prod spécifique. OGPO le fait, sur des politiques diffusion comme Pi-0 ou GR00T, avec des stabilisateurs intégrés pour que ça ne s'effondre pas en cours de training sur des observations en pixels. Reste à tenir sur du hardware réel à grande échelle, mais comme porte d'entrée vers la robotique de précision sans données expertes, c'est le genre de papier qu'on attendait.

RechercheOpinion
1 source
AgentCore Optimization : AWS lance une boucle d'amélioration des performances des agents
49AWS ML Blog 

AgentCore Optimization : AWS lance une boucle d'amélioration des performances des agents

Amazon a annoncé le lancement en préversion d'AgentCore Optimization, une nouvelle fonctionnalité intégrée à sa plateforme Amazon Bedrock AgentCore. Cette brique complète ce qu'Amazon appelle la boucle "observer, évaluer, améliorer" pour les agents IA en production. Concrètement, le système analyse automatiquement les traces de production, génère des recommandations d'optimisation pour les prompts système ou les descriptions d'outils, puis propose deux mécanismes de validation : l'évaluation par lot sur des jeux de données prédéfinis, et les tests A/B en conditions réelles via AgentCore Gateway, avec découpage du trafic en production à un pourcentage configurable et résultats assortis d'intervalles de confiance et de signification statistique. NTT DATA, partenaire annoncé lors du lancement, indique que des processus qui nécessitaient auparavant plusieurs semaines d'ajustement manuel de prompts peuvent désormais s'exécuter en cycles rapides et reproductibles. L'enjeu est de taille pour les équipes produit qui déploient des agents IA : la qualité d'un agent se dégrade silencieusement à mesure que les modèles évoluent, que le comportement des utilisateurs change, et que les prompts sont réutilisés dans des contextes imprévus. Jusqu'ici, la remédiation reposait entièrement sur l'intuition du développeur, lire des traces, formuler une hypothèse, réécrire le prompt, tester quelques cas, déployer, un cycle qui introduit souvent de nouveaux problèmes en corrigeant les anciens. AgentCore Optimization remplace cette boucle artisanale par un processus systématique fondé sur les données : les recommandations sont générées à partir des traces réelles et validées avant tout déploiement, éliminant la part de pari inhérente aux corrections en aveugle. Amazon Bedrock AgentCore, déjà utilisé par des milliers de développeurs pour construire des agents capables de raisonner et d'agir dans des workflows complexes, s'enrichit ainsi d'une couche d'amélioration continue qui manquait jusqu'à présent à l'écosystème. Les grandes équipes disposent certes d'équipes scientifiques dédiées et de benchmarks centralisés, mais ces dispositifs fonctionnent sur des cycles hebdomadaires ou mensuels, pendant que les agents dérivent en production chaque jour. En intégrant la traçabilité OpenTelemetry, les évaluateurs built-in (taux de succès, précision de sélection d'outils, sécurité), et la possibilité de simuler des jeux de données via un acteur LLM jouant le rôle de l'utilisateur final, Amazon positionne AgentCore comme une plateforme complète pour industrialiser l'optimisation des agents, une capacité qui pourrait devenir un critère de choix déterminant face à des concurrents comme Google Vertex AI ou Microsoft Azure AI Foundry.

UELes équipes européennes déployant des agents IA sur Amazon Bedrock peuvent désormais automatiser l'optimisation de leurs prompts et outils, réduisant des cycles d'ajustement manuel qui duraient plusieurs semaines à des itérations rapides et reproductibles.

OutilsOutil
1 source
AgentCore Optimization en préversion : la boucle de qualité des agents
50AWS ML Blog 

AgentCore Optimization en préversion : la boucle de qualité des agents

Amazon a annoncé le 5 mai 2026 la disponibilité en preview d'AgentCore Optimization, une nouvelle fonctionnalité de sa plateforme Amazon Bedrock AgentCore dédiée à l'amélioration continue des agents d'intelligence artificielle en production. Le système introduit une boucle automatisée en trois étapes : génération de recommandations à partir des traces de production, validation par évaluation en batch ou par test A/B, puis déploiement. Concrètement, l'API Recommendations analyse les logs stockés dans CloudWatch pour identifier les failles dans le prompt système ou les descriptions d'outils, en ciblant un signal de récompense défini par l'équipe, taux de succès des objectifs, précision dans la sélection d'outils, ou critères personnalisés via un LLM-as-judge. L'évaluation en batch compare ensuite la nouvelle version sur un jeu de tests préétabli, tandis que le test A/B, routé via AgentCore Gateway, divise le trafic réel selon un pourcentage configurable et produit des résultats avec intervalles de confiance et significativité statistique. NTT DATA, via Yoshiharu Okuda, son responsable de la stratégie IA générative, confirme déjà que des cycles de tuning de prompts qui prenaient auparavant plusieurs semaines sont devenus des itérations rapides et reproductibles grâce à ce système. L'enjeu est de taille pour les équipes produit qui déploient des agents à grande échelle. Jusqu'ici, lorsqu'un agent dégradait en qualité, parce qu'un modèle sous-jacent avait évolué, que les comportements utilisateurs avaient changé, ou qu'un prompt était réutilisé hors de son contexte d'origine, la correction reposait entièrement sur l'intuition d'un développeur : lire les traces, formuler une hypothèse, réécrire le prompt, tester quelques cas, déployer, et recommencer. Ce cycle manuel était non seulement lent, mais souvent contre-productif, un correctif résolvant un problème pour un utilisateur tout en en créant un nouveau pour un autre. AgentCore Optimization remplace cette mécanique artisanale par une boucle systématique alimentée par des données réelles, ce qui permet aux équipes produit de détecter les dérives au fil du quotidien plutôt que d'attendre les benchmarks hebdomadaires ou mensuels des équipes scientifiques dédiées. Amazon Bedrock AgentCore est la plateforme sur laquelle des milliers de développeurs construisent déjà des agents capables de raisonner, planifier et agir dans des workflows complexes. La composante Observability du service capture chaque appel de modèle, invocation d'outil et étape de raisonnement sous forme de traces compatibles OpenTelemetry, fournissant ainsi la matière première nécessaire à la nouvelle boucle d'optimisation. Cette annonce s'inscrit dans une tendance de fond : les grands fournisseurs cloud cherchent à industrialiser non plus seulement la création d'agents, mais leur maintenance opérationnelle dans la durée. Avec cette fonctionnalité encore en preview, Amazon positionne Bedrock comme une plateforme de bout en bout pour le cycle de vie complet des agents, dans un marché où Google Vertex AI et Microsoft Azure AI Foundry jouent la même carte d'intégration verticale.

UELes équipes produit françaises et européennes déployant des agents sur Amazon Bedrock pourront bénéficier de cycles d'optimisation automatisés, réduisant une dépendance aux processus manuels chronophages, sans impact réglementaire ou institutionnel spécifique à l'UE.

OutilsOutil
1 source

Suivre Google Cloud en continu

Recevez chaque jour les articles essentiels du sujet. Pas de bruit, pas de spam.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic