Aller au contenu principal

Dossier AWS — page 3

829 articles · page 3 sur 17

Ce qu'on suit chez AWS côté IA : Bedrock et ses modèles, SageMaker, les puces Trainium et Inferentia, l'investissement dans Anthropic et l'offre cloud IA.

101AWS ML Blog InfrastructureActu

Couchbase construit une architecture IA multi-modèle pour Capella iQ avec Amazon Bedrock

Le fournisseur de bases de données Couchbase a fait évoluer son assistant de développement Capella iQ pour s'appuyer sur Amazon Bedrock et la famille de modèles Claude d'Anthropic, en remplacement d'une architecture d'inférence à modèle unique. Le projet, décrit dans un billet co-écrit avec Tushar Madaan de Couchbase, repose sur une infrastructure déployée sur deux régions AWS, us-east-1 et us-west-2, afin de garantir une haute disponibilité. Un cluster Amazon EKS héberge trois microservices clés dans us-east-1 : cp-api, qui reçoit les requêtes des développeurs et orchestre les appels d'inférence ; cp-internal-api, qui gère la communication interne et la logique de routage des modèles ; et cp-ns, qui gère la configuration au niveau des espaces de noms, notamment les préférences de fournisseur de modèles par client. Un point de terminaison d'interface VPC assure une connectivité privée entre ce cluster et le runtime d'Amazon Bedrock, permettant d'exploiter l'inférence multi-région (Cross-Region Inference, ou CRIS) sur trois régions américaines : us-east-1, us-east-2 et us-west-2. Cette bascule répond à un besoin très concret de résilience opérationnelle et de flexibilité pour les grandes entreprises clientes de Couchbase. En s'appuyant sur l'inférence multi-région d'Amazon Bedrock, Capella iQ peut absorber des pics de trafic soudains et basculer automatiquement vers une région disponible en cas de dégradation, sans capacité pré-provisionnée et sans logique applicative supplémentaire à gérer côté Couchbase. Autre point important pour les clients entreprise : l'intégralité du trafic d'inférence, prompts et réponses inclus, transite exclusivement par l'infrastructure privée d'AWS et ne passe jamais par l'internet public, ce qui répond aux exigences de sécurité et de résidence des données propres à ce type de clientèle. Concrètement, quand un développeur demande à Capella iQ de générer une requête SQL++, de recommander un index ou de poursuivre une conversation multi-tours, le pod cp-api authentifie la demande, récupère le contexte de session, construit le prompt en intégrant l'historique de conversation, puis transmet l'appel via le point de terminaison VPC vers Bedrock, avant de renvoyer la réponse normalisée au développeur. Cette évolution s'inscrit dans la tendance plus large des éditeurs de logiciels d'entreprise à adopter des architectures d'inférence agnostiques par rapport au modèle, plutôt que de rester dépendants d'un unique fournisseur de LLM. Face à la croissance de l'adoption de Capella iQ, Couchbase avait besoin d'un système capable de s'adapter aux préférences de déploiement variées de ses clients tout en conservant une infrastructure scalable et robuste. Le choix d'Amazon Bedrock comme couche d'inférence permet à Couchbase de bénéficier directement des capacités de basculement régional et de répartition de charge gérées par AWS, sans avoir à développer cette logique en interne. Cette approche illustre aussi comment les modèles Claude d'Anthropic s'intègrent de plus en plus dans des produits d'infrastructure de données critiques, où la fiabilité, la confidentialité des données et la conformité pèsent autant que la qualité pure des réponses générées.

1 source
Grok arrive sur Amazon Bedrock
102AWS ML Blog 

Grok arrive sur Amazon Bedrock

xAI a annoncé la disponibilité générale de son modèle Grok 4.3 sur Amazon Bedrock, une intégration coécrite avec Eric Jiang, responsable chez xAI (filiale de SpaceX). xAI devient ainsi fournisseur de modèles sur la plateforme Bedrock d'Amazon. Grok 4.3 se distingue par un niveau d'effort de raisonnement configurable, quatre paliers disponibles (aucun, faible, moyen, élevé) que les développeurs peuvent ajuster selon chaque requête. Le modèle accepte du texte et des images en entrée, dispose d'une fenêtre de contexte d'un million de tokens et tourne sur Mantle, le nouveau moteur d'inférence d'Amazon Bedrock qui utilise des API compatibles OpenAI plutôt que l'API Runtime classique de Bedrock. Selon les benchmarks internes publiés par xAI au moment du lancement, Grok 4.3 s'est classé numéro un sur le test Omniscience d'Artificial Analysis, avec le taux d'hallucination le plus bas parmi les modèles de pointe comparés. Il occupe également la première place du benchmark Tau2 Telecom d'Artificial Analysis, qui évalue l'appel d'outils dans des scénarios de support client, ainsi que des tests Vals AI portant sur le droit jurisprudentiel et la finance d'entreprise. xAI affirme que le modèle se situe sur la frontière de Pareto entre intelligence et coût, avec un rapport allant jusqu'à dix fois plus d'intelligence par dollar dépensé que d'autres modèles concurrents. Cette annonce compte pour les équipes qui développent des agents et des flux de travail automatisés en entreprise, car elle leur offre un modèle unique capable de couvrir tout un éventail de tâches sans changer d'outil. Une simple classification peut tourner avec un effort de raisonnement nul pour minimiser la latence, tandis qu'une analyse de contrat ou de jurisprudence peut mobiliser le niveau élevé lorsque la profondeur d'analyse prime sur la vitesse de réponse. Cette flexibilité, combinée à la gestion fiable des appels d'outils et au respect des instructions, rend le modèle particulièrement adapté à des usages comme la révision de contrats, l'analyse de conventions de crédit ou les questions-réponses sur des documents financiers volumineux, des tâches où le modèle doit à la fois raisonner sur de longs textes et interagir avec des systèmes externes. Cette intégration s'inscrit dans la stratégie d'Amazon Web Services visant à diversifier les modèles disponibles sur Bedrock au-delà de ses partenaires historiques, en ouvrant la porte à des fournisseurs tiers comme xAI. Pour les développeurs, l'accès à Grok 4.3 passe par le SDK OpenAI ou des requêtes HTTPS directes vers l'API Chat Completions ou l'API Responses, via une URL propre à chaque région AWS, par exemple https://bedrock-mantle.us-west-2.api.aws/openai/v1 pour la région us-west-2. Les paramètres par défaut diffèrent aussi légèrement de la norme OpenAI : la température est fixée à 0,7 au lieu de 1, le top_p à 0,95 au lieu de 1, et le nombre maximal de tokens de complétion à 131 072 par défaut, des réglages que les équipes doivent ajuster explicitement si leur application l'exige.

UELes développeurs et entreprises françaises utilisant AWS pourront accéder à Grok 4.3 via les régions européennes de Bedrock, mais aucune entreprise ou régulation française/européenne n'est directement impliquée.

LLMsActu
1 source
Flo Health met à l'échelle la revue de contenu médical avec Amazon Bedrock (partie 2)
103AWS ML Blog 

Flo Health met à l'échelle la revue de contenu médical avec Amazon Bedrock (partie 2)

Flo Health, l'application de santé féminine qui compte des millions d'utilisatrices, a transformé une preuve de concept développée avec l'AWS Generative AI Innovation Center en un système de production complet basé sur Amazon Bedrock pour la révision et la génération de contenu médical. Ce travail, mené par Konstantin Lekh, Sasha Zinchuk et Eugene Sergueev côté Flo Health, avec Liza Zinovyeva côté AWS, a permis de réduire le temps de révision de 60% et de tripler le volume de contenu produit, sans agrandir l'équipe médicale. Auparavant, les experts médicaux de Flo Health passaient en moyenne sept jours ouvrés par article pour vérifier les faits, croiser les références avec des sources fiables et appliquer une checklist de conformité médicale en dix points. Le nouveau système repose sur une validation en trois couches: d'abord un contrôle du contenu par rapport aux directives médicales internes de l'entreprise, avec signalement des problèmes potentiels et suggestions de corrections; ensuite une vérification croisée avec des sources médicales externes reconnues, allant des outils d'aide à la décision clinique fondés sur des preuves aux revues à comité de lecture et aux organismes de régulation; enfin une relecture humaine par les experts médicaux, effectuée via une interface qui met en évidence les règles appliquées et fournit des liens directs vers les sources pertinentes. Cette avancée répond à un problème structurel bien identifié dans le secteur de la santé numérique: le recrutement de professionnels médicaux qualifiés capables de produire et vérifier du contenu est difficile, lent et coûteux, ce qui rend le simple ajout de personnel non viable pour suivre la demande croissante des utilisateurs. En s'appuyant sur l'intelligence artificielle générative plutôt que sur des outils génériques, Flo Health répond aussi à un enjeu de confiance critique: les systèmes d'IA classiques peuvent produire des hallucinations, c'est-à-dire des informations non ancrées dans des sources vérifiables, un risque inacceptable quand des millions de personnes s'appuient sur ce contenu pour comprendre leur propre santé. En construisant un système qui ne délivre que des informations sourcées et traçables, l'entreprise démultiplie l'impact de ses experts existants tout en maintenant, voire en renforçant, ses standards de fiabilité. Cette évolution s'inscrit dans une stratégie d'adoption progressive de l'IA, pensée pour bâtir la confiance par une validation continue plutôt qu'un remplacement brutal du jugement humain. Les métriques de succès retenues par Flo Health portent principalement sur deux axes: la réduction du temps de révision et la diminution du nombre de corrections requises de la part des experts. Le système intègre également des "juges IA" spécialisés, chacun dédié à une dimension particulière de la révision médicale, ainsi qu'un module de génération de contenu s'appuyant sur la génération augmentée par récupération (RAG) pour ancrer les textes produits dans des sources vérifiées. Cette approche illustre une tendance plus large dans le secteur de la santé numérique, où l'IA générative est de plus en plus déployée non pas pour remplacer l'expertise médicale, mais pour l'amplifier, ouvrant la voie à d'autres cas d'usage où fiabilité et scalabilité doivent coexister.

OutilsActu
1 source
L'IA d'AWS et Bluesight pour la conformité 340B des hôpitaux
104AI News 

L'IA d'AWS et Bluesight pour la conformité 340B des hôpitaux

Amazon Web Services a détaillé comment Bluesight, éditeur spécialisé dans la gestion pharmaceutique hospitalière, a développé Prism, une couche d'intelligence artificielle reliant les données de pharmacie et de conformité à travers sa gamme de produits. Le premier module, Prism Assistant pour ControlCheck, est désormais disponible en version générale et fonctionne dans 20 réseaux hospitaliers américains, selon les chiffres communiqués par AWS. Un second agent, destiné à la conformité des achats groupés dans le cadre du programme fédéral 340B, doit sortir plus tard en 2026. Ce programme oblige certains hôpitaux, notamment ceux à but non lucratif ou spécialisés en cancérologie, à documenter chaque exception lorsqu'ils achètent des médicaments via des centrales d'achat plutôt que par les canaux habituels. AWS estime qu'un seul établissement peut consacrer plus de 4 000 heures de travail par an à croiser manuellement les données d'achat avec les alertes de pénurie de la FDA, les registres de l'American Society of Health-System Pharmacists et les prévisions de rupture de stock. L'équipe de Bluesight, huit ingénieurs épaulés par sept spécialistes d'AWS, a construit la première version de l'outil en trois jours seulement, lors d'un programme accéléré organisé en septembre 2025, en s'appuyant sur Strands Agents, Amazon Bedrock et l'environnement Bedrock AgentCore Runtime. Cette architecture change concrètement le travail quotidien des équipes de conformité pharmaceutique. Grâce à une interface conversationnelle interrogeant directement les données de ControlCheck, les délais de traitement d'une requête sont passés de cinq minutes à dix secondes, selon AWS. Samir Neyazi, directeur produit chez Bluesight, y voit un outil attendu par les responsables des programmes de lutte contre le détournement de médicaments, qui perdaient un temps considérable à enquêter manuellement. Au-delà du gain de temps, le choix technique est notable : plutôt que de laisser le modèle de langage accéder directement aux bases de données, les ingénieurs ont encapsulé les API existantes dans des fonctions AWS Lambda, gardant toute la logique métier dans la couche applicative. Cette précaution limite les risques d'erreurs ou de résultats incohérents dans un secteur où la conformité réglementaire est critique. Le futur agent dédié au 340B ambitionne d'aller plus loin en croisant les données de trois produits Bluesight, CostCheck pour les achats, ShortageCheck pour les pénuries et 340BCheck pour l'éligibilité, en s'appuyant sur les modèles Claude Sonnet 4.6 d'Anthropic pour les tâches complexes et Claude Haiku 4.5 pour les réponses rapides, le tout hébergé dans un cloud privé virtuel. Si AWS présente ce déploiement en moins de neuf mois comme une réussite, les médias spécialisés comme TechForge Media rappellent que ces délais restent des chiffres communiqués par le fournisseur, sans vérification indépendante des établissements hospitaliers concernés. Le dossier illustre néanmoins l'appétit croissant du secteur de la santé américain pour les agents IA appliqués à des tâches réglementaires lourdes et chronophages.

💬 Bon, sur le papier, c'est le genre de dossier qu'on ne voit jamais passer et qui pourtant vaut le coup d'œil : au lieu de laisser un LLM taper dans les bases de données, ils l'ont enfermé derrière des Lambda qui gardent toute la logique métier. C'est exactement la bonne architecture pour un secteur où une hallucination peut coûter une amende fédérale, pas un game-changer, juste du bon sens appliqué. Reste que les chiffres (trois jours de dev, cinq minutes à dix secondes) viennent d'AWS et Bluesight eux-mêmes, donc à prendre avec la pince habituelle tant qu'un hôpital tiers ne les confirme pas.

OutilsActu
1 source
Bluesight construit une solution IA à base d'agents avec Amazon Bedrock
105AWS ML Blog 

Bluesight construit une solution IA à base d'agents avec Amazon Bedrock

Bluesight, éditeur logiciel spécialisé dans la gestion des pharmacies hospitalières et filiale du fonds Thoma Bravo, a développé avec Amazon Web Services une solution d'intelligence artificielle agentique baptisée Prism, construite sur Amazon Bedrock AgentCore. Le projet, co-écrit avec Vijay Venkatesh, directeur technique de Bluesight, répond à un problème concret : les hôpitaux américains doivent prouver que leurs achats de médicaments via un groupement d'achat (GPO) respectent les règles du programme fédéral 340B, ce qui suppose de croiser en permanence les listes de pénuries de la FDA, les données de l'ASHP, les niveaux de stock, des prédictions de rupture basées sur le machine learning et les signaux de plusieurs centaines d'autres établissements. Pour un seul établissement couvert par le programme, cet audit manuel représente plus de 4 000 heures de travail par an, un chiffre qui explose à l'échelle du réseau de plus de 620 hôpitaux clients de Bluesight. L'entreprise propose déjà six produits complémentaires, KitCheck, ControlCheck, CostCheck, 340BCheck, ShortageCheck et PrivacyPro, mais aucun ne permettait à lui seul de croiser ces données dispersées. Prism Assistant, la première brique dédiée à ControlCheck, a été lancée en mai 2026 et est utilisée par 20 établissements de santé ; une version multiproduit plus ambitieuse est prévue pour la fin de l'année 2026. Cette évolution change concrètement le travail des équipes de conformité hospitalière. ControlCheck surveille les transactions de substances contrôlées dans les pharmacies pour détecter des schémas de détournement, une tâche qui exigeait jusqu'ici des heures de compilation de rapports et de corrélation manuelle entre tableaux de bord avant de pouvoir produire des comptes-rendus pour les directions. Avec une interface conversationnelle capable de mener cette analyse en quelques secondes, les équipes gagnent un temps considérable. L'enjeu est encore plus net pour les hôpitaux classés DSH (part disproportionnée de patients défavorisés), PED (pédiatriques) ou CAN (centres de cancérologie autonomes), qui n'ont le droit d'acheter des médicaments ambulatoires via un GPO que s'ils prouvent l'indisponibilité réelle du produit ailleurs. Cette preuve nécessite de combiner des données issues de CostCheck, ShortageCheck et 340BCheck simultanément, alors qu'aucun produit ne disposait auparavant d'une vue d'ensemble. Le choix d'Amazon Bedrock AgentCore s'explique par trois critères jugés déterminants par Bluesight. D'abord, Amazon Bedrock est éligible HIPAA, condition non négociable pour une entreprise qui manipule des informations médicales protégées. Ensuite, la plateforme fournit une infrastructure agentique de niveau production sans que l'équipe ait à la construire de zéro, avec la traçabilité et le caractère déterministe qu'exigent les programmes de conformité hospitalière. Bluesight cherchait ainsi une architecture réutilisable plutôt que des solutions ponctuelles à reconstruire pour chaque nouveau cas d'usage, une approche qui doit désormais s'étendre progressivement à l'ensemble de sa suite de produits.

OutilsActu
1 source
Les défenseurs adoptent aussi l'injection de prompts
106Ars Technica AI 

Les défenseurs adoptent aussi l'injection de prompts

Des chercheurs de Tracebit ont annoncé lundi avoir découvert une méthode simple pour neutraliser les agents d'intelligence artificielle utilisés par des attaquants pour pirater des infrastructures cloud. Le principe consiste à placer des injections de prompt directement à côté des mots de passe, clés cryptographiques et autres secrets stockés sur AWS. Lorsqu'un agent LLM malveillant tente d'accéder à ces données sensibles, il tombe sur une instruction cachée qui lui ordonne d'effectuer une action interdite par ses propres garde-fous, les mécanismes de sécurité intégrés par les développeurs pour empêcher les IA de nuire. Résultat, le modèle s'arrête de lui-même, mettant fin à l'attaque en cours. Cette technique renverse une logique jusqu'ici à sens unique. Les injections de prompt sont traditionnellement l'arme favorite des attaquants: une commande habilement dissimulée dans un email, une invitation de calendrier ou un document suffit souvent à faire exécuter par un LLM des actions malveillantes, comme l'exfiltration de données confidentielles. Que des équipes de défense retournent cette même faille contre les assaillants marque un tournant. Pour les entreprises qui déploient des agents IA autonomes capables d'explorer des systèmes et de manipuler des identifiants, cela ouvre une piste de protection accessible et peu coûteuse, sans nécessiter de refonte des architectures de sécurité existantes. Cette découverte s'inscrit dans un contexte plus large où la sécurité des agents IA autonomes devient un enjeu majeur, à mesure que ces outils gagnent en autonomie et en capacité d'action sur des environnements sensibles comme le cloud. Les LLM utilisés à des fins offensives peuvent désormais scanner des systèmes, repérer des identifiants exposés et tenter de les exploiter sans supervision humaine constante. Face à cette menace grandissante, les chercheurs en sécurité explorent différentes pistes défensives, et cette méthode de piégeage par injection de prompt pourrait rapidement être adoptée par d'autres équipes de sécurité, voire intégrée nativement dans les outils de protection cloud, ouvrant la voie à une véritable course aux armements entre attaquants et défenseurs autour du contrôle des agents IA.

UELes entreprises europeennes deployant des agents IA autonomes sur AWS pourraient adopter cette technique defensive, mais aucun acteur ou reglementation francais/europeen n'est directement implique.

💬 Bonne nouvelle pour une fois côté défense: retourner l'injection de prompt contre l'attaquant, en planquant l'instruction d'arrêt à côté des secrets AWS, c'est malin et ça coûte trois fois rien à déployer. Reste que ça marche parce que l'attaquant utilise un agent avec des garde-fous actifs, un assaillant qui bricole son propre LLM sans ces limites passera au travers sans même s'en rendre compte. Le vrai signal ici, c'est que la sécurité cloud entre dans une course aux armements où le prompt lui-même devient un terrain de bataille, pas juste le code ou le réseau.

SécuritéActu
1 source
Déploiement de modèles quantifiés sur Amazon SageMaker AI avec Unsloth
107AWS ML Blog 

Déploiement de modèles quantifiés sur Amazon SageMaker AI avec Unsloth

Déployer des modèles quantifiés en production coûte cher lorsqu'ils restent en pleine précision 16 bits (BF16 ou FP16), car cela impose des instances GPU volumineuses et ralentit les cycles d'itération. Amazon Web Services a publié, avec Unsloth, un article co-écrit par Daniel Han et Michael Han détaillant comment déployer des modèles quantifiés dynamiquement sur son infrastructure. Unsloth propose une méthode appelée quantification dynamique, qui ne réduit pas uniformément la précision de toutes les couches d'un modèle. Selon Daniel Han, cofondateur d'Unsloth, un modèle nécessitant initialement 1,5 To de mémoire peut être ramené à 217 Go grâce à cette technique, soit une réduction de 86 % de la taille, pour seulement 14 % de perte de précision. Concrètement, un modèle standard utilise 16 bits par paramètre ; une quantification à 4 bits réduit la taille de 75 %, ce qui fait passer un modèle de 8 milliards de paramètres d'environ 16 Go à environ 5 Go. Le processus se déroule en trois étapes : une analyse couche par couche pour mesurer la sensibilité de chacune à la perte de précision, une allocation dynamique du nombre de bits qui conserve une précision élevée (par exemple 16 bits) pour les couches critiques tout en compressant fortement les autres (4 bits ou moins), puis un réglage fin pour que la qualité globale reste proche de l'original malgré la compression. Cette approche change trois paramètres essentiels au moment du déploiement sur AWS. D'abord le choix de l'instance : un modèle qui nécessitait auparavant plusieurs GPU peut désormais tourner sur un seul GPU, voire sur CPU. Ensuite, le profil de démarrage et de stockage : des fichiers de modèle plus légers se déplacent, se stockent et se déploient plus rapidement entre environnements. Enfin, la flexibilité de déploiement : les équipes peuvent choisir un fichier plus compact pour une inférence sensible aux coûts, une version plus fidèle pour les cas exigeant une haute qualité, ou une représentation fusionnée pour un débit plus élevé. Pour les entreprises qui opèrent des modèles de fondation à grande échelle, ces gains de mémoire et de coût peuvent se traduire par des économies substantielles sur la facture cloud. L'article présente quatre schémas de déploiement pour des modèles déjà quantifiés avec Unsloth sur l'infrastructure AWS : l'utilisation directe d'instances Amazon EC2, le service managé Amazon SageMaker AI pour l'inférence, ainsi qu'une intégration via Amazon EKS ou Amazon ECS lorsque l'inférence doit s'insérer dans une architecture de conteneurs existante. Cette publication s'inscrit dans une tendance plus large où les fournisseurs cloud et les éditeurs d'outils open source collaborent pour rendre les grands modèles de langage plus accessibles économiquement, alors que la course à des modèles toujours plus volumineux continue de faire grimper les coûts d'inférence pour les entreprises qui les déploient en production.

💬 Le chiffre qui compte : 86% de mémoire en moins pour seulement 14% de perte de précision, c'est le genre de ratio qui devrait faire revoir la facture GPU de pas mal de boîtes qui tournent des modèles en prod. Passer de plusieurs GPU à un seul, voire du CPU, ça change le calcul économique du déploiement, pas juste un détail d'ingé. Reste que la quantification dynamique demande une vraie analyse couche par couche en amont, donc c'est pas un bouton magique qu'on active en cinq minutes.

OutilsActu
1 source
KTern.AI développe une IA à base d'agents pour SAP sur Amazon Bedrock AgentCore
108AWS ML Blog 

KTern.AI développe une IA à base d'agents pour SAP sur Amazon Bedrock AgentCore

Comment KTern.AI, plateforme de transformation digitale dédiée à SAP, a bâti son IA agentique sur Amazon Bedrock AgentCore en s'appuyant sur le kit Strands Agents SDK. KTern.AI est partenaire SAP Spotlight et opère une plateforme certifiée SAP de Digital Transformation as a Service, structurée autour de cinq automatisations : Digital Maps, Digital Projects, Digital Process, Digital Labs et Digital Mines. Son moteur propriétaire de connaissance institutionnelle encode des années de patterns de transformation SAP et de bonnes pratiques, permettant, combiné à une hyperautomatisation pilotée par la donnée, des transformations sept fois plus rapides avec une réduction de 24 % de l'effort global. Les nouveaux agents déployés orchestrent de façon autonome des workflows allant de la rétro-ingénierie à l'analyse de code, en passant par le fit-to-standard et le repérage d'exceptions dans les processus Finance et Ventes, sans que l'entreprise ait eu à construire une infrastructure d'agents sur mesure. Cette bascule change concrètement la donne pour les grands comptes engagés dans des migrations S/4HANA ou des conversions système, des projets qui s'étalent sur des mois voire des années et mobilisent une expertise SAP difficile à faire monter en échelle avec des consultants humains seuls. Avant AgentCore, KTern.AI faisait tourner son application sur une pile de conteneurs auto-gérée, développée et maintenue en interne, ce qui détournait du temps d'ingénierie vers de l'infrastructure sans lien avec son cœur de métier : concevoir des agents capables de comprendre la transformation SAP. En migrant vers AgentCore, l'entreprise a pu se recentrer sur cette différenciation tout en gagnant en fiabilité de production. Le passage à l'agentique posait plusieurs défis techniques qu'aucune infrastructure maison ne pouvait résoudre proprement. Il fallait un contexte persistant à grande échelle, les agents devant retenir un état sur des centaines d'interactions et bâtir un contexte cumulatif sur toute la durée d'un projet sans le perdre à chaque session, tout en évitant de les saturer d'informations superflues, ce qui ralentit les réponses, augmente les coûts et le risque d'hallucination. S'y ajoutaient l'accès sécurisé et gouverné aux API SAP, aux systèmes ERP clients et aux référentiels de processus via des connexions authentifiées et auditables, la multi-location avec une configuration propre à chaque client sans développement spécifique par déploiement, une scalabilité dynamique pouvant faire passer d'une poignée d'agents pour un audit rapide à des dizaines d'agents tournant en continu pendant des mois lors d'une migration complète, et enfin une observabilité de niveau production, avec logs, traces et métriques détaillés pour rendre traçable chaque décision d'agent et chaque appel d'outil dans des environnements d'entreprise.

💬 Reste à voir si l'infra managée tient vraiment la charge sur des migrations S/4HANA qui durent des mois, mais l'idée de fond est bonne : le vrai métier de KTern.AI c'est de comprendre SAP, pas de maintenir une stack de conteneurs. C'est un pattern qu'on va voir se généraliser chez tous les éditeurs verticaux, arrêter de réinventer l'orchestration d'agents pour se concentrer sur la donnée métier propriétaire. Le détail qui compte, c'est la gestion du contexte sur des centaines d'interactions sans saturer le modèle : c'est exactement le genre de problème qu'aucune boîte n'a envie de résoudre elle-même en interne.

OutilsActu
1 source
Automatiser le tri et la priorisation de vos boîtes mail avec Amazon Bedrock
109AWS ML Blog 

Automatiser le tri et la priorisation de vos boîtes mail avec Amazon Bedrock

Amazon Web Services a publié un guide technique détaillant une solution d'intelligence artificielle destinée aux organismes du secteur public, en particulier aux collectivités locales britanniques, pour trier et prioriser automatiquement leurs courriels entrants grâce à Amazon Bedrock. Le système fonctionne ainsi : les messages électroniques sont déposés dans un espace de stockage Amazon S3, via Amazon Simple Email Service, une intégration tierce ou le SDK AWS. Chaque nouvel objet S3 déclenche une notification transmise à Amazon EventBridge, qui l'achemine vers une file d'attente Amazon SQS de type FIFO. Cette file est reliée, via EventBridge Pipes, à une machine à états AWS Step Functions, laquelle récupère le contenu du courriel puis interroge un modèle Amazon Bedrock, en l'occurrence Amazon Nova Pro, par le biais de l'API InvokeModel. Un prompt spécifique demande au modèle de classer chaque message selon le service municipal concerné (transports, aides sociales, taxe d'habitation, action sociale, gestion des déchets, environnement, informatique, protection de l'enfance, logement) et d'en évaluer le degré d'urgence, dans un format structuré. En cas d'échec de traitement, les messages sont redirigés vers une file d'attente de lettres mortes pour investigation. Cette automatisation répond à trois difficultés concrètes identifiées par AWS dans la gestion actuelle des courriels des collectivités. D'abord une crise des délais de réponse, avec des centaines de messages reçus chaque jour où les demandes urgentes se retrouvent noyées dans le flux général. Ensuite, un usage inefficace du temps des agents, qui consacrent des heures au tri manuel, un même message pouvant être examiné à plusieurs reprises par différents services avant d'aboutir au bon interlocuteur. Enfin, une évaluation de la gravité des demandes qui manque de cohérence d'un agent à l'autre. En automatisant ce triage, la solution vise à garantir que les dossiers urgents reçoivent une attention immédiate, tout en libérant le personnel administratif pour des tâches à plus forte valeur ajoutée dans le service aux citoyens. Cette initiative s'inscrit dans une tendance plus large d'adoption de l'IA générative par les administrations publiques, confrontées à des contraintes budgétaires et des effectifs limités alors que les attentes des usagers en matière de rapidité de traitement ne cessent de croître. AWS présente cette architecture comme une base de départ, conçue pour être adaptée et enrichie par les organismes qui l'adoptent plutôt que comme un produit fini. Le déploiement s'appuie exclusivement sur des services managés d'AWS, ce qui limite la charge d'exploitation pour des collectivités locales disposant rarement d'équipes informatiques dédiées à l'intelligence artificielle, tout en respectant les bonnes pratiques de sécurité recommandées pour le stockage de données sensibles sur Amazon S3, notamment le chiffrement et le principe du moindre privilège.

OutilsOutil
1 source
L'article mentionne Mistral AI Studio, pas seulement Anthropic ou une autre techno propriétaire, mais je vais quand même traduire simplement le titre technique demandé
110AWS ML Blog 

L'article mentionne Mistral AI Studio, pas seulement Anthropic ou une autre techno propriétaire, mais je vais quand même traduire simplement le titre technique demandé

Amazon a publié un guide technique détaillant la construction d'un serveur MCP (Model Context Protocol) prêt pour la production dans le secteur de l'ecommerce, combinant Amazon Bedrock AgentCore et Mistral AI Studio. Le tutoriel montre comment développer un serveur en Python avec le framework FastMCP, exposant six outils dédiés au commerce en ligne via un point de terminaison /mcp et un endpoint /health pour le monitoring. Le serveur s'appuie sur cinq tables Amazon DynamoDB à capacité à la demande, couvrant les produits, les clients, les commandes, les avis et les retours. L'authentification repose sur un système à deux niveaux de jetons JWT, avec Amazon Cognito gérant l'identité des utilisateurs via le protocole OAuth 2.1. Le déploiement s'effectue avec AWS Cloud Development Kit (CDK), et l'exécution est prise en charge par AgentCore Runtime, qui construit les images de conteneurs dans le cloud grâce à AWS CodeBuild, sans nécessiter Docker en local. Une fois déployé, ce serveur est connecté à Vibe, l'interface conversationnelle de Mistral AI disponible sur web, iOS et Android, permettant aux utilisateurs d'interagir en langage naturel avec les fonctions de recherche de produits, de passation de commandes, de soumission d'avis et de traitement des retours. Cette approche répond à un problème concret pour les équipes ecommerce : le développement d'assistants IA connectés nécessite habituellement des semaines d'intégration sur mesure, avec du code API spécifique pour chaque client, une gestion complexe de l'infrastructure de conteneurs et des mécanismes d'authentification à construire de zéro. En s'appuyant sur le standard MCP, un unique serveur peut être interrogé par plusieurs clients IA différents, éliminant le besoin de développer une intégration distincte pour chacun d'entre eux. AgentCore Runtime prend en charge la gestion des conteneurs, l'isolation des sessions, la validation des jetons JWT et l'observabilité, ce qui décharge les équipes techniques de la maintenance des load balancers et des middlewares d'authentification. Pour les entreprises du secteur, cela signifie un temps de mise sur le marché considérablement réduit pour des expériences client conversationnelles, tout en garantissant l'isolation des données propres à chaque client grâce à la gestion d'identité de Cognito. Ce projet illustre la stratégie plus large d'Amazon Web Services consistant à positionner Bedrock AgentCore comme plateforme de référence pour construire, connecter et faire évoluer des agents IA à grande échelle, en misant sur l'interopérabilité offerte par le protocole MCP plutôt que sur des intégrations propriétaires fermées. Le partenariat avec Mistral AI Studio, dont l'interface Vibe sert de vitrine grand public, s'inscrit dans une tendance où les fournisseurs cloud et les éditeurs de modèles collaborent pour rendre les agents IA directement exploitables par les entreprises, sans développement d'infrastructure supplémentaire. Ce guide, accompagné d'une démonstration vidéo, cible les équipes techniques cherchant à évaluer concrètement comment déployer un agent conversationnel connecté à leurs propres systèmes de données, avec des exigences de sécurité et de scalabilité déjà prises en compte dès la conception.

UEMistral AI, entreprise francaise, voit son interface Vibe integree a l'ecosysteme cloud d'Amazon, renforcant sa visibilite et son adoption sur le marche europeen de l'IA agentique.

OutilsTuto
1 source
Face aux géants américains, Mistral AI et Naver misent sur l’IA industrielle souveraine
111Le Big Data 

Face aux géants américains, Mistral AI et Naver misent sur l’IA industrielle souveraine

Naver Cloud, le géant sud-coréen du cloud, a officialisé le 8 juillet 2026 un partenariat mondial avec la start-up française Mistral AI. L'objectif affiché est de déployer des solutions d'intelligence artificielle souveraines au sein des entreprises manufacturières européennes et asiatiques. Les deux groupes veulent construire une alternative aux plateformes généralistes dominées par les hyperscalers américains, à un moment où les dépenses mondiales en infrastructures cloud ont atteint 129 milliards de dollars au premier trimestre 2026, un marché toujours contrôlé par Amazon Web Services, Microsoft et Google. Mistral apporte ses modèles et une expertise en ingénierie industrielle acquise auprès de groupes comme Airbus, BMW et ASML, tandis que Naver Cloud fournit son infrastructure, sa connaissance du marché sud-coréen et un accès direct aux industriels asiatiques. Lors de son AI Now Summit de mai 2026, Mistral avait déjà présenté une pile d'IA dédiée à l'ingénierie industrielle couvrant la conception, la simulation et la production, illustrée notamment par son accord avec Airbus pour étendre l'IA à l'aviation commerciale, aux hélicoptères, à la défense et au spatial, sous des exigences strictes de sécurité pour des données confidentielles ou militaires. Cette alliance illustre une stratégie de contournement face à des concurrents financièrement hors de portée. Plutôt que de rivaliser sur la taille des centres de données, Mistral et Naver choisissent de déplacer la bataille vers l'intégration fine de l'IA dans les processus industriels, un terrain où la puissance de calcul brute ne suffit pas. Les premiers cas d'usage ciblés, la détection en temps réel des anomalies de qualité et l'optimisation de la sélection des composants, ont déjà été expérimentés chez des fabricants européens et seront désormais proposés aux industriels coréens. Pour les entreprises manufacturières, l'enjeu est de taille : elles pourraient accéder à une IA capable de dialoguer avec leurs systèmes existants et leurs données métiers spécifiques, sans dépendre exclusivement des plateformes américaines, un argument de souveraineté numérique de plus en plus recherché en Europe comme en Asie. La commercialisation débutera en Corée du Sud, où Naver Cloud proposera les modèles et la plateforme de Mistral via sa propre infrastructure, pendant que Mistral enverra des ingénieurs de déploiement directement chez les clients coréens pour résoudre les difficultés d'intégration. Cette approche répond à un constat structurel : selon Synergy Research Group, AWS, Google et Microsoft représentaient encore fin 2025 près des deux tiers du marché mondial des infrastructures cloud, une domination que la croissance de l'IA ne fait que renforcer grâce à leur capacité d'investissement massif dans les centres de données et les accélérateurs. Face à cette asymétrie de moyens, Mistral et Naver misent sur la spécialisation sectorielle et la souveraineté des données comme véritables leviers commerciaux, pariant que l'avenir de l'IA industrielle se jouera moins sur la taille des infrastructures que sur la capacité à s'insérer durablement dans des chaînes de production complexes et sensibles.

UEMistral AI, entreprise française, renforce sa stratégie de souveraineté numérique en nouant une alliance industrielle internationale, offrant aux industriels européens une alternative aux plateformes cloud américaines dominantes.

BusinessActu
1 source
Traduction concise et factuelle du sens réel
112AWS ML Blog 

Traduction concise et factuelle du sens réel

Le géant du cloud Amazon vient de détailler les bonnes pratiques pour entraîner des agents conversationnels multi-tours grâce à l'apprentissage par renforcement (RL) sur Amazon SageMaker AI. Ce nouveau service, baptisé SageMaker AI MTRL, permet d'entraîner des agents capables de résoudre des tickets de support ou de modérer du contenu à travers une séquence d'actions liées entre elles : lecture d'instructions, appels d'outils, analyse des résultats, prise de décision et correction d'erreurs avant de livrer une réponse finale. L'agent peut tourner sur Amazon Bedrock AgentCore, Amazon EKS, Amazon EC2, AWS Fargate ou toute autre infrastructure choisie par le développeur, connectée via un petit adaptateur qui expose la surface d'outils au serveur d'exécution. Le service embarque une bibliothèque native d'algorithmes incluant PPO, CISPO et plusieurs estimateurs d'avantage par groupe comme GRPO ou RLOO, ainsi qu'une exécution serverless facturée au token, sans gestion de clusters GPU à prévoir. Les exemples cités s'appuient sur SOP-Bench, un benchmark d'Amazon Science qui évalue la capacité des agents à suivre des procédures opérationnelles standard complexes dans douze secteurs d'activité différents. Cette annonce compte parce que l'entraînement par renforcement multi-tours est nettement plus délicat que l'entraînement mono-tour classique. Plus un agent dispose de façons d'agir, plus il existe de moyens détournés de satisfaire la fonction de récompense sans réellement accomplir la tâche demandée, ce qui peut corrompre silencieusement le signal d'apprentissage. Pour les entreprises qui développent des agents IA destinés à des usages métiers critiques comme le support client ou la modération, disposer d'un cadre fiable permettant de mesurer la réussite en dehors de la seule récompense, de suivre les trajectoires d'exécution tour par tour dans MLflow, et d'obtenir des rapports d'évaluation avant déploiement vers un endpoint SageMaker AI ou Amazon Bedrock représente un gain de temps et de fiabilité considérable. Cela réduit le risque de déployer des agents qui paraissent performants en entraînement mais échouent une fois confrontés à des situations réelles. Le contexte plus large est celui d'une course entre grands fournisseurs cloud pour industrialiser l'entraînement d'agents IA autonomes, alors que les entreprises cherchent à automatiser des tâches complexes à plusieurs étapes plutôt que de simples réponses ponctuelles. Amazon met l'accent sur la nécessité de construire des environnements d'entraînement isolés et reproductibles, où les appels d'outils suivent les mêmes schémas et logiques métier que la production mais restent déconnectés du trafic réel, notamment parce qu'une session d'entraînement type génère plusieurs milliers de trajectoires simulées. Cette approche s'inscrit dans une tendance de fond où les fournisseurs de cloud proposent de plus en plus d'infrastructures clé en main pour le fine-tuning et le RL d'agents, un terrain où Amazon Web Services affronte directement Google Cloud et Microsoft Azure, tandis que la fiabilité des environnements simulés et la conception des récompenses deviennent des enjeux techniques centraux pour la fiabilité des futurs agents d'entreprise.

OutilsOutil
1 source
Se retire de GovCloud (US) : NVIDIA Nemotron et OpenAI GPT OSS accessibles sur Amazon Bedrock
113AWS ML Blog 

Se retire de GovCloud (US) : NVIDIA Nemotron et OpenAI GPT OSS accessibles sur Amazon Bedrock

Cette semaine, Amazon a annoncé l'arrivée de nouveaux modèles ouverts sur Amazon Bedrock, dans la région AWS GovCloud (US), un environnement cloud isolé réservé aux agences gouvernementales américaines, au secteur de la défense et du renseignement, ainsi qu'à leurs sous-traitants. Concrètement, Bedrock prend désormais en charge les modèles GPT OSS d'OpenAI (versions 120 milliards et 20 milliards de paramètres) ainsi que la famille NVIDIA Nemotron 3, comprenant Nemotron 3 Super (120 milliards de paramètres, architecture hybride de mélange d'experts n'activant que 12 milliards de paramètres par token) et les modèles Nemotron 3 Nano (versions 9B, 12B et 30B). Ces modèles fonctionnent entièrement sur une infrastructure exploitée par AWS, physiquement située aux États-Unis et administrée exclusivement par des citoyens américains, à l'intérieur du périmètre de conformité GovCloud. Cette région répond à des référentiels réglementaires stricts, dont le FedRAMP High, les niveaux d'impact 2, 4 et 5 du DoD Cloud Computing Security Requirements Guide, les règles ITAR sur le trafic d'armes, et les exigences CJIS pour les données judiciaires. Cette annonce répond à une tension centrale pour les administrations américaines : elles doivent pouvoir exploiter des modèles d'IA aussi performants que ceux utilisés dans le secteur privé, sans jamais faire sortir de données sensibles du périmètre réglementaire qui les encadre. Jusqu'ici, l'accès aux modèles ouverts les plus avancés impliquait souvent des compromis sur la souveraineté ou la conformité des données. En intégrant GPT OSS et Nemotron directement dans Bedrock au sein de GovCloud, Amazon permet aux agences fédérales, aux équipes de renseignement et à leurs prestataires de construire des applications agentiques pour des cas d'usage concrets : analyse de renseignement, planification de missions, examen de documents d'acquisition et de contrats, analyse de journaux de sécurité, évaluation automatisée de contrôles de sécurité, synthèse multi-documents et vérification de conformité réglementaire. L'accès via une API unifiée permet en outre de changer de modèle selon le besoin sans modifier le code applicatif, ce qui simplifie l'adoption pour des équipes techniques gouvernementales souvent contraintes par des cycles d'certification longs. Cette évolution s'inscrit dans la course plus large que se livrent les grands fournisseurs cloud pour capter la demande croissante en IA générative des administrations publiques, un marché où la confiance réglementaire pèse autant que la performance technique. Amazon Bedrock fonctionne comme une plateforme neutre donnant accès à des modèles de plusieurs fournisseurs indépendants, une stratégie qui contraste avec l'intégration verticale d'autres acteurs du cloud. L'arrivée de modèles ouverts d'OpenAI et de NVIDIA dans un environnement aussi cloisonné que GovCloud illustre aussi la normalisation des modèles à poids ouverts, autrefois cantonnés à la recherche ou aux usages commerciaux, dans des contextes de mission critique. Reste à voir combien d'autres familles de modèles ouverts suivront ce chemin vers les environnements souverains et régulés, et si cette disponibilité accélérera réellement l'adoption de l'IA agentique au sein des agences fédérales et des acteurs de la défense.

InfrastructureActu
1 source
HippoRAG : RAG neuro-inspiré avec Amazon Bedrock, Amazon Neptune et un PageRank personnalisé
114AWS ML Blog 

HippoRAG : RAG neuro-inspiré avec Amazon Bedrock, Amazon Neptune et un PageRank personnalisé

HippoRAG est un nouveau framework RAG (Retrieval Augmented Generation) inspiré du système de mémoire hippocampique du cerveau humain, conçu pour mieux gérer les tâches de raisonnement multi-sauts qui nécessitent de relier des informations dispersées entre plusieurs documents. L'implémentation présentée s'appuie entièrement sur l'infrastructure AWS: Amazon Bedrock fournit les capacités de modèle de langage pour extraire les triplets du graphe de connaissances et identifier les entités nommées, Amazon Neptune Database stocke la structure du graphe, Amazon Neptune Analytics exécute les algorithmes de graphe avancés, notamment le Personalized PageRank pour le classement de pertinence, et Amazon Titan Embeddings génère les représentations vectorielles du texte. Le pipeline de données démarre à partir du jeu de données HotpotQA au format JSON: une classe nommée HotpotQANeptuneImporter orchestre la lecture du fichier source, la génération de fichiers CSV compatibles avec le chargeur en masse de Neptune, leur envoi vers un bucket Amazon S3, puis leur chargement effectif dans le cluster Neptune. Les prérequis incluent un compte AWS avec accès à Bedrock et Neptune, un cluster Neptune configuré, un graphe Neptune Analytics créé à partir de celui-ci, ainsi que les permissions IAM nécessaires pour Bedrock, Neptune, Neptune Analytics et S3. L'intérêt de cette approche tient au fait que les méthodes RAG classiques traitent chaque document de façon isolée, ce qui les rend peu efficaces dès qu'une question exige de croiser des informations provenant de plusieurs sources différentes. En s'appuyant sur un graphe de connaissances et sur l'algorithme Personalized PageRank pour la recherche de pertinence, HippoRAG permet une récupération multi-sauts en une seule étape, là où les architectures RAG traditionnelles ont souvent besoin de plusieurs itérations successives pour reconstituer le fil du raisonnement. Pour les entreprises qui déploient des systèmes de questions-réponses ou de recherche documentaire à grande échelle, cela promet des réponses plus précises sur des requêtes complexes, tout en conservant la fiabilité et la scalabilité des services managés d'AWS plutôt que de dépendre d'une infrastructure de graphe maison. Cette architecture s'inscrit dans la théorie de l'indexation hippocampique de la mémoire à long terme, selon laquelle le néocortex traite les informations perceptives tandis que l'hippocampe construit un index d'associations entre les souvenirs, permettant au cerveau humain d'intégrer efficacement des expériences variées. C'est cette division des rôles que le système technique cherche à reproduire, en séparant le traitement du langage confié à Bedrock de l'indexation relationnelle confiée à Neptune. À mesure que les entreprises accumulent des bases documentaires massives et hétérogènes, ce type d'approche hybride, combinant graphes de connaissances et grands modèles de langage, pourrait devenir un standard pour dépasser les limites actuelles du RAG classique, avec des extensions envisageables vers d'autres jeux de données que HotpotQA et vers des cas d'usage d'entreprise plus larges.

OutilsOutil
1 source
Dans l’ombre de Mythos et Fable ressuscités, la Chine progresse rapidement
115Next INpact 

Dans l’ombre de Mythos et Fable ressuscités, la Chine progresse rapidement

Anthropic a annoncé le 30 juin le retour de Mythos 5, suivi de Fable 5 dès le 1er juillet, mettant fin à un épisode de trois semaines qui a fragilisé l'entreprise face à la concurrence chinoise des modèles à poids ouvert. Les faits remontent au 9 juin 2026, date de lancement de Claude Fable 5, version publique et encadrée de l'architecture Mythos, tandis que Mythos 5, dépourvue de ces garde-fous, restait réservée aux organisations vérifiées via le programme Glasswing. Trois jours plus tard, le 12 juin, le secrétaire au Commerce Howard Lutnick a adressé à Anthropic une directive de contrôle des exportations exigeant la suspension immédiate de l'accès aux deux modèles pour tout ressortissant étranger dans le monde, y compris les propres employés étrangers de l'entreprise. Incapable de filtrer ses utilisateurs par nationalité en temps réel, Anthropic a coupé l'accès sur Claude.ai, son API, AWS Bedrock, Google Cloud et Microsoft Foundry. Le 26 juin, Washington a autorisé un retour partiel de Mythos 5 pour une centaine d'organisations liées aux infrastructures critiques et à la cyberdéfense, laissant Fable 5 hors service jusqu'à ce 1er juillet. Cet épisode illustre la fragilité des positions commerciales face à des décisions politiques soudaines : des centaines de millions d'utilisateurs à travers le monde se sont retrouvés privés d'accès du jour au lendemain, et les entreprises clientes de l'API ou des plateformes cloud partenaires ont dû composer avec plusieurs semaines d'incertitude. Pendant ce temps, les modèles chinois à poids ouvert ont continué de progresser, profitant du retrait temporaire d'un concurrent majeur. L'image d'Anthropic sort également écornée, des rumeurs de surveillance d'utilisateurs chinois étant venues s'ajouter à la confusion entourant cette affaire. Le fond du dossier reste flou. Selon Anthropic, la lettre reçue ne détaillait pas la menace précise pour la sécurité nationale, mais l'entreprise a compris que le gouvernement avait eu vent d'une méthode permettant de contourner les protections de Fable 5, en lui demandant par exemple d'analyser une base de code donnée pour en corriger les failles. Des rumeurs, invérifiables, ont même évoqué un modèle capable de mettre à mal les défenses de la NSA. Anthropic conteste la proportionnalité de la mesure, rappelant que des tests menés avec le gouvernement américain, l'AISI britannique et des tiers n'avaient révélé aucun jailbreak universel, et que le niveau de capacité en cause était comparable à celui de GPT-5.5 d'OpenAI. L'épisode relance ainsi le débat sur l'équilibre entre sécurité nationale et compétitivité de l'industrie américaine de l'IA face à la Chine.

UELes entreprises et developpeurs europeens utilisant l'API Claude via AWS Bedrock, Google Cloud ou Microsoft Foundry ont subi plusieurs semaines de coupure d'acces a Mythos 5 et Fable 5, sans qu'aucune decision reglementaire europeenne n'en soit la cause.

💬 Ce qui frappe, c'est la vitesse à laquelle une boîte peut se retrouver à genoux à cause d'une lettre de Washington, pas d'un bug ou d'un concurrent. Anthropic a coupé l'accès à Fable 5 dans le monde entier pendant trois semaines sur simple injonction, pendant que les modèles chinois à poids ouvert avançaient tranquillement. Le vrai enseignement de cet épisode : la sécurité nationale américaine est en train de devenir un facteur de compétitivité aussi déterminant que la puissance des modèles eux-mêmes, et ça peut jouer contre les boîtes américaines autant que pour elles.

RégulationReglementation
1 source
Sécuriser le déploiement des modèles de pointe auprès des clients
116AWS ML Blog 

Sécuriser le déploiement des modèles de pointe auprès des clients

Voici la traduction/résumé en français : Amazon Web Services (AWS) a annoncé que les modèles Claude Fable 5 d'Anthropic redeviennent disponibles dès demain pour les clients de Bedrock, sa plateforme d'intelligence artificielle, avec des garde-fous renforcés contre les usages malveillants. Cette annonce s'inscrit dans la continuité de Bedrock Mantle, lancé l'an dernier pour offrir une protection renforcée des poids des modèles et de la confidentialité des données. AWS travaille également en étroite collaboration avec Anthropic et d'autres acteurs du secteur dans le cadre du Projet Glasswing, une initiative visant à encadrer le déploiement de modèles de nouvelle génération comme Claude Mythos, dont les capacités en cybersécurité sont particulièrement avancées. L'équipe de sécurité offensive d'AWS (Red Team) a directement contribué, aux côtés d'Anthropic, à améliorer les protections de Fable 5. Lorsque ses garde-fous se déclenchent, le modèle bascule automatiquement vers Opus 4.8, déjà accessible publiquement. Cette annonce illustre un dilemme central pour l'industrie de l'IA : comment mettre des capacités avancées de cybersécurité entre les mains des équipes de défense sans donner simultanément aux attaquants les moyens de mener des recherches de vulnérabilités plus poussées. AWS souligne que l'objectif prioritaire des garde-fous est justement d'empêcher les acteurs malveillants d'accéder à ce niveau de recherche offensive, tout en laissant aux entreprises, gouvernements et institutions académiques le temps de renforcer leurs défenses avant que ces capacités ne soient exploitées à grande échelle. Pour les clients de Bedrock, cela signifie un accès plus rapide aux modèles les plus récents, avec les standards de sécurité et de confidentialité attendus d'AWS, sans avoir à choisir entre performance et prudence. Cette collaboration s'inscrit dans un contexte plus large où les modèles frontières gagnent rapidement en puissance, notamment sur des tâches sensibles comme l'analyse de vulnérabilités logicielles. Anthropic a publié de son côté un billet de blog intitulé "Redeploying Fable 5", détaillant sa manière d'évaluer les capacités de cette nouvelle génération de modèles ainsi que ses engagements et délais de réponse en cas de signalement de problèmes après déploiement. AWS salue cette transparence et annonce vouloir continuer à faire évoluer les garde-fous au fur et à mesure que de nouveaux modèles sortent et que les enseignements s'accumulent sur l'efficacité des protections actuelles. Les deux entreprises présentent cette coopération comme une première tentative structurée de définir des niveaux de gravité et des protocoles de réponse spécifiques aux modèles capables d'assister en cybersécurité, un cadre appelé à s'affiner avec le reste du secteur.

💬 Le détail qui compte, c'est le fallback automatique : si Fable 5 dérape, il bascule tout seul vers Opus 4.8. Sur le papier ça règle le dilemme de la cybersécu offensive, mais Glasswing c'est surtout l'aveu que les modèles progressent plus vite que les garde-fous qu'on sait construire autour. Reste à voir si ça tient face à un vrai attaquant motivé, pas juste face à un red team maison.

SécuritéActu
1 source
« Simplifier l'accès multi-comptes aux modèles Amazon Bedrock avec les habilitations gérées »
117AWS ML Blog 

« Simplifier l'accès multi-comptes aux modèles Amazon Bedrock avec les habilitations gérées »

Les organisations qui exploitent des dizaines, voire des centaines de comptes AWS font face à un dilemme récurrent pour l'accès aux modèles d'intelligence artificielle sur Amazon Bedrock. AWS distingue trois catégories de modèles : les modèles Amazon comme Nova, les modèles vendus par Amazon tels que ceux de Meta, Mistral ou DeepSeek, accessibles immédiatement avec de simples permissions Bedrock, et les modèles tiers commercialisés via AWS Marketplace, comme Claude d'Anthropic, ceux de Cohere ou de Stability AI, qui exigent un abonnement Marketplace distinct dans chaque compte. Jusqu'ici, les équipes devaient soit accorder largement des permissions Marketplace à tous les comptes de travail, au risque de fragiliser la gouvernance, soit activer manuellement chaque abonnement compte par compte, une charge opérationnelle lourde qui ralentit l'adoption de l'IA à grande échelle. AWS présente désormais les "managed entitlements" pour Bedrock, une fonctionnalité qui permet de souscrire une seule fois depuis un compte central puis de distribuer l'accès aux modèles à travers toute l'organisation, via AWS License Manager, sans qu'aucune permission Marketplace ne soit nécessaire dans les comptes membres. Cette nouveauté change concrètement la donne pour les équipes cloud et sécurité chargées de gouverner l'usage de l'IA générative à l'échelle d'un groupe. Elle s'adresse en priorité aux organisations qui font tourner des charges de travail sur de multiples comptes AWS, qui veulent éviter de diffuser des droits Marketplace à chaque équipe, qui ont négocié des tarifs préférentiels via une offre privée et souhaitent les appliquer uniformément, ou qui ont besoin d'une visibilité centralisée sur qui accède à quels modèles. À l'inverse, les structures qui n'utilisent que des modèles Amazon ou partenaires, qui opèrent sur un compte unique, ou dont les équipes gèrent déjà leurs abonnements de façon autonome n'ont pas vraiment besoin de ce mécanisme. Le bénéfice principal réside dans la réduction du risque de mauvaise configuration et dans l'accélération du déploiement de modèles comme Claude à travers de grandes organisations, tout en gardant un contrôle centralisé. Sur le plan technique, la mise en place suppose qu'AWS Organizations soit configuré avec toutes les fonctionnalités activées, qu'un accès au compte de gestion soit disponible avec les permissions AWS Marketplace et AWS License Manager, et que des rôles liés aux services (service-linked roles) soient créés pour ces deux services. Le concept central repose sur deux notions : la licence, qui représente le droit de l'organisation à utiliser un modèle donné, et les attributions ("grants"), le mécanisme par lequel ce droit est partagé avec des comptes spécifiques. Cette approche s'inscrit dans la suite logique d'autres outils Bedrock comme l'évaluation de modèles ou les garde-fous (guardrails), qui visent tous à concilier autonomie des équipes et gouvernance centralisée des déploiements d'IA en entreprise.

InfrastructureActu
1 source
« Mise en œuvre de patterns de résilience avec Amazon Bedrock et une passerelle LLM »
118AWS ML Blog 

« Mise en œuvre de patterns de résilience avec Amazon Bedrock et une passerelle LLM »

Amazon Web Services a publié un article technique détaillant cinq patterns de résilience pour les déploiements d'inférence de grands modèles de langage (LLM) sur Amazon Bedrock, conçus pour accompagner les charges de travail d'IA générative qui passent de la phase expérimentale à la production à grande échelle. Le premier de ces patterns repose sur l'inférence cross-Region (CRIS) d'Amazon Bedrock, une fonctionnalité native qui redirige automatiquement les requêtes depuis une région source vers la région de destination optimale, en tenant compte en temps réel de la disponibilité, de la latence et de la demande. Les patterns suivants montent en complexité jusqu'à une orchestration multi-modèles via une passerelle LLM (LLM gateway), permettant de combiner plusieurs fournisseurs et modèles selon les besoins. Un dépôt GitHub accompagne l'article avec des exemples de code pour chaque pattern, afin que les développeurs puissent les tester directement dans leur propre environnement AWS. Cette approche progressive répond à des problèmes concrets rencontrés par les équipes qui exploitent des applications IA en production: l'épuisement soudain des quotas lors de pics de trafic imprévus, les effets de "voisin bruyant" dans les environnements multi-tenants, ou encore le besoin de répartir géographiquement l'inférence pour maximiser la disponibilité. Au-delà de la simple continuité de service, ces patterns ouvrent aussi la voie à une optimisation des coûts grâce à un routage intelligent des requêtes, et donnent aux équipes la liberté de basculer entre plusieurs modèles ou fournisseurs selon les contraintes de performance ou de budget. Pour des entreprises qui dépendent désormais de l'IA générative dans leurs produits, ces garanties de résilience deviennent aussi critiques que celles déjà appliquées aux architectures cloud traditionnelles. AWS rappelle que les bonnes pratiques classiques de résilience, comme la stabilité statique ou les mécanismes de backoff et de nouvelles tentatives, restent valables, mais que l'IA générative introduit des contraintes inédites: disponibilité fluctuante des modèles, quotas qui évoluent rapidement, limites de tokens variables selon les fournisseurs, et nécessité de maintenir une cohérence de comportement face aux nouvelles versions de modèles publiées régulièrement. L'article structure sa réflexion autour de quatre dimensions clés, la disponibilité, le temps de réponse, le coût et le débit, en précisant que ce premier volet se concentre sur la disponibilité via le basculement, la répartition géographique et l'isolation des quotas. AWS annonce que de prochains articles approfondiront l'optimisation du temps de réponse et le routage sensible aux coûts, signe que la firme entend documenter une stratégie complète de résilience pour les architectures d'inférence LLM en production.

InfrastructureActu
1 source
Building une NER bilingue pour la logistique cargo avec Amazon Bedrock
119AWS ML Blog 

Building une NER bilingue pour la logistique cargo avec Amazon Bedrock

IBS Software, fournisseur de solutions logicielles pour l'industrie du transport aérien, a développé avec Amazon Bedrock un système de reconnaissance d'entités nommées (NER) bilingue capable de traiter automatiquement des milliers de messages de logistique cargo en anglais et en japonais. L'objectif était d'extraire 23 types d'informations différentes depuis ces emails, notamment les numéros de lettre de transport aérien (AWB), les détails de vol, les poids, dimensions, descriptions de marchandises, informations sur expéditeurs et destinataires, ou encore les instructions de livraison spéciales. Une équipe de neuf chercheurs et ingénieurs a travaillé environ quatre mois sur le projet : un premier mois consacré à l'annotation de 500 emails bilingues (350 en anglais, 150 en japonais), un deuxième mois marqué par des tentatives infructueuses avec des frameworks open source comme PyTorch et la bibliothèque TextBrewer, un troisième mois de distillation réussie via Amazon Bedrock, et un dernier mois de déploiement en production. La méthode retenue consiste à distiller les connaissances du modèle Amazon Nova Pro vers le modèle plus léger Amazon Nova Lite, entraîné sur 4 époques et 70 étapes, avec une perte ramenée de 0,05 à 0,008. Résultat : une précision de 95,085% en F1-Score, pour un coût d'inférence réduit d'un facteur 14. Cette performance change concrètement la donne pour IBS Software et ses clients du secteur aérien, où le traitement manuel des emails cargo ralentissait les opérations et où le choix d'un modèle plus puissant se heurtait systématiquement à des coûts d'exploitation prohibitifs à grande échelle. En s'appuyant sur les capacités de distillation managée d'Amazon Bedrock plutôt que sur une infrastructure de calcul personnalisée, l'entreprise a pu déployer un pipeline de traitement en temps réel des fichiers .eml sans avoir à gérer elle-même l'hébergement des modèles. Pour l'industrie du fret aérien, dépendante de flux documentaires denses et multilingues, ce type d'automatisation réduit les délais de traitement et limite les erreurs de saisie qui peuvent retarder des expéditions. Le projet illustre aussi les limites des approches open source pour la distillation de modèles bilingues à l'échelle de la production : configuration complexe des pipelines, absence d'infrastructure managée pour l'entraînement et le déploiement, difficulté à ajuster les hyperparamètres pour une distillation au niveau des tokens, et incompatibilité avec les flux de travail existants. Ces obstacles ont poussé IBS Software à se tourner vers Amazon Bedrock Model Distillation, une fonctionnalité qui permet de transférer les capacités de modèles avancés vers des versions plus rapides et économiques sans sacrifier la précision. Ce cas d'usage s'inscrit dans une tendance plus large où les entreprises cherchent à concilier performance des grands modèles de langage et maîtrise des coûts d'inférence à grande échelle, notamment dans des secteurs à fort volume documentaire comme la logistique.

OutilsActu
1 source
Les agents IA ont besoin de contexte partout, même là où le cloud ne peut pas les suivre
120VentureBeat AI 

Les agents IA ont besoin de contexte partout, même là où le cloud ne peut pas les suivre

Couchbase a annoncé mardi son AI Data Plane, une plateforme opérationnelle unifiée qui combine mémoire persistante pour agents IA, récupération de contexte en temps réel et serveur MCP géré en entreprise. L'annonce positionne la société comme un acteur central dans la bataille pour le contrôle du contexte des agents IA en entreprise, un terrain où s'affrontent déjà des géants comme Databricks, AWS et Redis. L'AI Data Plane regroupe trois composants : une couche de persistance unifiée pour le contexte conversationnel, les données opérationnelles structurées et les embeddings vectoriels ; un serveur MCP auto-géré livré nativement dans la plateforme ; et un catalogue d'outils agents appelé Agent Catalog. La plateforme tourne de manière identique sur le cloud, en on-premises et dans des environnements edge déconnectés, grâce à Couchbase Lite, le moteur embarqué qui exécute SQL, recherche plein texte et recherche vectorielle localement sans connexion réseau. L'enjeu concret est celui de l'efficacité opérationnelle et de la souveraineté des données. Pour les secteurs réglementés, les déploiements industriels ou le retail en mobilité, l'impossibilité d'envoyer des données vers le cloud n'est pas un détail technique mais une contrainte légale ou physique. En cachant le contexte partagé localement, la plateforme évite que chaque agent récupère et traite les mêmes données indépendamment, réduisant la consommation de tokens pour les sessions concurrentes. Couchbase cite l'exemple concret d'une chaîne hôtelière où plusieurs agents servent simultanément des clients, chacun puisant dans un contexte local via recherche vectorielle on-device, la mémoire de session se synchronisant ensuite de manière bidirectionnelle vers le cloud dès que la connectivité est rétablie. Agora, une plateforme d'intégration d'IA conversationnelle pour les entreprises, utilise Couchbase en production depuis février 2024. Couchbase arrive à ce problème avec une architecture distincte : la société était un système de cache avant de devenir une base de données, ce que son CTO Gopi Duddi présente comme un avantage structurel. Écrire en mémoire est dix fois plus rapide qu'écrire sur disque, argue-t-il, séparant Couchbase des bases NoSQL qui superposent des workloads mémoire sur un stockage disque. Redis, qui partage ces racines dans le cache, a également annoncé récemment une couche de contexte pour agents IA, mais Duddi souligne que Couchbase maintient une conformité ACID, atomicité, cohérence, isolation, durabilité, essentielle pour les charges de travail transactionnelles. La vraie bataille qui se joue ici est celle du substrat de mémoire des agents : quelle plateforme de données va devenir le système d'enregistrement de l'intelligence artificielle en production, y compris là où le cloud ne peut pas suivre.

UEPour les entreprises européennes soumises au RGPD ou à des réglementations sectorielles imposant la localisation des données, la capacité de déploiement on-premises et edge constitue une alternative concrète aux architectures cloud-first pour les agents IA en production.

💬 Ce que fait Couchbase ici, c'est mettre la main sur la mémoire de travail des agents, et tout le monde comprend que c'est là que se joue la prochaine bataille d'infrastructure. Leurs racines dans le cache leur donnent un avantage structurel sur des bases NoSQL qui ont bricolé une couche mémoire par-dessus du disque. Pour les boîtes européennes entre RGPD et réseaux capricieux, un système qui tourne pareil offline et sur le cloud, c'est pas anodin.

InfrastructureOpinion
1 source
Construire un pipeline de traitement des dossiers de santé avec des agents IA sur Amazon Bedrock et AWS HealthLake
121AWS ML Blog 

Construire un pipeline de traitement des dossiers de santé avec des agents IA sur Amazon Bedrock et AWS HealthLake

Amazon Web Services vient de dévoiler une architecture de traitement automatisé des dossiers de remboursement médicaux, combinant Amazon Bedrock Data Automation, Amazon Bedrock AgentCore et AWS HealthLake. Le pipeline cible le formulaire CMS-1500, le standard américain de facturation médicale en format papier ou PDF. Concrètement, lorsqu'un prestataire de santé dépose un formulaire dans un bucket Amazon S3, une fonction AWS Lambda déclenche une chaîne de traitement : Bedrock Data Automation extrait les données structurées via une combinaison de reconnaissance optique de caractères, de modèles de machine learning et d'IA générative, puis produit un JSON normalisé avec scores de confiance et coordonnées des champs détectés. Un agent IA basé sur le framework Strands Agents, hébergé sur AgentCore, prend ensuite le relais pour valider les données extraites contre les enregistrements patients et prestataires stockés dans HealthLake, et crée si validation réussie une ressource FHIR (Fast Healthcare Interoperable Resources) standardisée. Le résultat est transmis via Amazon SNS, avec un résumé technique pour les gestionnaires de dossiers et une version simplifiée pour le patient. Les dossiers rejetés partent dans une file morte (dead letter queue) pour traitement humain. L'enjeu est considérable : le traitement manuel des formulaires papier représente encore un poste de coût majeur dans le secteur de la santé aux États-Unis, avec des erreurs de saisie, des extractions imprécises et des délais de validation qui ralentissent les remboursements. Ce pipeline réduit l'intervention humaine aux seuls cas d'exception, tout en maintenant une traçabilité complète grâce aux scores de confiance générés par Bedrock Data Automation. Pour les assureurs et les établissements de santé, l'adoption du standard FHIR est également stratégique : il facilite l'interopérabilité entre systèmes et répond aux exigences réglementaires croissantes en matière d'échange de données de santé. Cette annonce s'inscrit dans une tendance de fond où les grands fournisseurs cloud cherchent à capturer les flux de traitement documentaire des secteurs très réglementés, santé en tête. AWS positionne ici AgentCore comme une couche d'orchestration agentique prête à l'emploi, capable de gérer des workflows multi-étapes avec appels d'outils (ici createfhirclaim et searchfhirresources) sans infrastructure LLM à maintenir. La concurrence avec Azure Health Data Services et Google Cloud Healthcare API est directe. La prochaine étape logique sera l'extension à d'autres formats de formulaires médicaux et l'intégration de contrôles de conformité réglementaire automatisés, notamment autour du HIPAA, la loi américaine de protection des données de santé.

UELe standard FHIR est en cours d'adoption dans le secteur de la santé numérique européen, mais ce pipeline cible spécifiquement les formulaires de facturation américains (CMS-1500) et la réglementation HIPAA, sans impact direct sur la France ou l'UE.

OutilsOpinion
1 source
Claude Code a triplé la productivité des ingénieurs : les entreprises manquent maintenant de concepteurs produit
122VentureBeat AI 

Claude Code a triplé la productivité des ingénieurs : les entreprises manquent maintenant de concepteurs produit

Anthropic a récemment demandé à son équipe de croissance de recruter davantage de chefs de produit (product managers), et non moins. La raison : Claude Code avait discrètement transformé son équipe d'ingénierie en une organisation capable de livrer à environ trois fois son effectif réel. Ce détail résume une bascule structurelle que traverse aujourd'hui l'ensemble de l'industrie. Les questions mensuelles posées sur Stack Overflow ont chuté de 77 % depuis novembre 2022, date de lancement de ChatGPT. En 2026, pour une part significative des développeurs actifs, la première commande tapée dans un nouveau terminal n'est plus git ou vim, c'est claude. Des équipes AWS ont décrit une refonte d'architecture initialement prévue pour 30 ingénieurs sur 18 mois, menée à bien par 6 personnes en 76 jours. Amazon, avec son IDE Kiro, a compressé des cycles de développement de deux semaines à deux jours grâce à des flux pilotés par spécifications. En avril 2026, Anthropic a lancé les Claude Code Routines : des agents persistants, planifiables, qui s'exécutent sur un calendrier, sur un webhook ou pendant la nuit. Le goulot d'étranglement du logiciel n'est plus la frappe au clavier. C'est la décision de ce qu'il faut coder. Les ingénieurs qui délèguent cette responsabilité à quelqu'un d'autre sont désormais en situation de stagnation. Concrètement, le ratio traditionnel d'un chef de produit pour huit ingénieurs, déjà sous tension, s'approche en pratique de 1 pour 20, puisque chaque ingénieur produit davantage chaque jour. LinkedIn a supprimé son programme de chef de produit associé et l'a remplacé par un programme "Product Builder" formant des généralistes capables de couvrir produit, design et ingénierie. Le système produit des fonctionnalités construites plus vite qu'il ne produit de la clarté sur ce qu'il faut construire. Cette évolution s'est faite en plusieurs phases distinctes. L'ère Stack Overflow (2014-2022) a d'abord organisé le savoir collectif des développeurs. Puis ChatGPT a introduit un oracle plus rapide, encore externe à l'éditeur de code. L'intégration native dans l'IDE avec Cursor et Claude Code, entre 2024 et 2025, a dissous la hiérarchie technique traditionnelle : l'escalade vers l'ingénieur senior a largement disparu. La phase actuelle, celle des agents routiniers et des spécifications comme langage de travail, redistribue les rôles en profondeur. Les entreprises qui ont réellement déployé des flux agentiques en production convergent vers le même constat : la valeur ne réside plus dans la capacité à écrire du code, mais dans la capacité à décrire précisément ce que "correct" signifie. Celles qui n'ont pas encore ajusté leurs structures organisationnelles en conséquence accumulent une dette de gouvernance produit aussi réelle que la dette technique.

UELes entreprises françaises et européennes du logiciel sont confrontées aux mêmes pressions organisationnelles décrites, mais l'article ne cite aucun acteur, chiffre ou réglementation spécifique à la France ou à l'UE.

💬 La vraie conclusion que j'en tire, c'est pas que leurs ingénieurs codent vite, c'est qu'Anthropic manque maintenant de gens capables de décider ce qu'il faut coder. Quand le ratio PM/ingénieur passe de 1 pour 8 à 1 pour 20, la dette de gouvernance produit explose en même temps que la vitesse de livraison. Si tu n'as pas encore ajusté ton org autour de ça, c'est pas une dette technique qui t'attend, c'est une dette de sens.

SociétéOpinion
1 source
Vercel lance Eve, un framework open source pour créer des agents IA
123InfoQ AI 

Vercel lance Eve, un framework open source pour créer des agents IA

Vercel a lancé Eve, un framework open-source conçu pour construire, déployer et opérer des agents IA en production. Présenté par la plateforme américaine spécialisée dans le déploiement frontend, Eve repose sur une structure de projet basée sur le système de fichiers pour organiser les différents composants d'un agent : instructions, outils, compétences, sous-agents, canaux de communication et tâches planifiées. Les développeurs peuvent ainsi définir le comportement de leurs agents de manière déclarative, sans avoir à écrire l'intégralité de la plomberie technique sous-jacente. L'enjeu est significatif pour les équipes d'ingénierie qui peinent à passer de la phase de prototype à la mise en production d'agents IA fiables. En standardisant la structure d'un projet agentique, Eve réduit la quantité d'infrastructure à implémenter manuellement, un frein majeur à l'adoption en entreprise. Pour Vercel, cela représente aussi un moyen naturel d'ancrer l'exécution des agents sur sa propre plateforme cloud, transformant un outil open-source en point d'entrée vers ses services commerciaux. La sortie d'Eve s'inscrit dans une course effrénée entre fournisseurs d'infrastructure pour capter les workloads IA. Des acteurs comme AWS, Google Cloud et des startups spécialisées comme LangChain ou CrewAI proposent déjà des solutions concurrentes pour orchestrer des agents. Vercel, dont la réputation s'est construite sur la simplicité de déploiement pour les applications Next.js, tente de répliquer cette expérience développeur dans l'univers des agents autonomes, un marché en pleine structuration où la facilité d'usage restera un avantage décisif.

UELes équipes de développement européennes peuvent adopter Eve pour accélérer la mise en production d'agents IA, mais l'exécution reste ancrée sur l'infrastructure cloud américaine de Vercel.

OutilsOutil
1 source
Des agents IA en production pour la conformite financiere : les lecons de Stripe
124AWS ML Blog 

Des agents IA en production pour la conformite financiere : les lecons de Stripe

Stripe, le géant américain des paiements en ligne, a déployé en production un système d'agents IA dédié à la conformité financière, développé sur Amazon Web Services avec Amazon Bedrock. L'entreprise traite 1 400 milliards de dollars de volume de paiements annuels dans 50 pays, en servant des millions d'entreprises allant des startups aux 62 % des sociétés du Fortune 500. Pour gérer les risques de fraude et respecter les obligations réglementaires à cette échelle, ses équipes de conformité devaient examiner des milliers de transactions chaque jour. Le système d'agents, conçu selon un cadre ReAct, a permis de réduire de 26 % le temps de traitement des dossiers, tout en obtenant un taux de satisfaction de 96 % auprès des analystes internes. Les décisions finales restent systématiquement entre les mains d'experts humains. Ce déploiement illustre un problème structurel que rencontrent toutes les grandes institutions financières : les analystes qualifiés passaient jusqu'à 80 % de leur temps à naviguer entre des systèmes fragmentés pour rassembler des documents, au lieu de réaliser des évaluations de risque à haute valeur ajoutée. L'agent IA automatise cette phase de pré-investigation et d'agrégation documentaire, libérant les équipes pour les jugements complexes. À l'échelle mondiale, le coût de la conformité financière est estimé à 206 milliards de dollars par an. L'approche de Stripe permettrait d'identifier 95 % des attaques par test de carte en temps réel et de réduire de 20 % les frictions inutiles pour les clients légitimes, tout en conservant la traçabilité intégrale exigée par les régulateurs grâce à des journaux d'audit immuables. La croissance rapide de Stripe, qui représente aujourd'hui environ 1,3 % du PIB mondial numérique, a rendu intenable une mise à l'échelle des équipes de conformité proportionnelle au volume de transactions. L'entreprise a opté pour une architecture en trois composantes : décomposition des tâches et orchestration des révisions, cadre d'agents ReAct, et services d'infrastructure dédiés. Une attention particulière a été portée à l'optimisation des coûts via le prompt caching et à la gouvernance, avec des workflows d'approbation configurables et des points de contrôle humains à chaque étape critique. Ce modèle, co-développé par les équipes de Stripe et d'AWS, est présenté comme une référence pour les organisations souhaitant industrialiser la conformité sans sacrifier la qualité ni l'auditabilité, dans un contexte où les régulateurs financiers du monde entier renforcent leurs exigences en matière de traçabilité des décisions assistées par IA.

UELes établissements financiers européens soumis aux obligations KYC/AML et aux futures exigences de traçabilité de l'AI Act peuvent s'appuyer sur ce retour d'expérience pour évaluer l'automatisation de leur conformité via des agents IA.

OutilsOutil
1 source
Les surcouches à base d'agents pour moderniser les services d'entreprise existants
125AWS ML Blog 

Les surcouches à base d'agents pour moderniser les services d'entreprise existants

Les infrastructures d'entreprise reposent depuis des années sur des API REST et des microservices, des systèmes stables, bien rodés, mais conçus bien avant l'émergence des agents autonomes. Dans un article technique publié en collaboration entre des ingénieurs de Cisco et d'AWS, les auteurs présentent une approche baptisée "agentic overlays" : des couches d'enveloppe légères qui transforment des services REST existants en agents capables de participer au protocole A2A (Agent-to-Agent), le standard de communication inter-agents en train de s'imposer dans l'industrie. L'idée centrale est de ne rien réécrire : aucune duplication du code métier, aucune infrastructure parallèle à opérer, aucune migration forcée. Ces overlays exposent également les API REST comme outils compatibles avec le Model Context Protocol (MCP), permettant ainsi aux agents d'orchestration modernes de les invoquer directement. L'enjeu est considérable pour les entreprises qui ont déjà déployé des agents maison, souvent construits comme de simples endpoints REST avec de la logique agent embarquée. Ces agents ne sont pas nativement A2A : ils ne savent pas se découvrir mutuellement via des métadonnées (un "agent card"), négocier des capacités, ni échanger des messages structurés en JSON-RPC pour coordonner des tâches complexes. Sans solution de transition, les entreprises se retrouvent face à un choix coûteux : maintenir deux mondes en parallèle (l'ancien en REST, le nouveau en A2A) ou tout réécrire. Les overlays proposés permettent d'éviter ce dilemme en réduisant ce que les auteurs appellent l'"agent sprawl", la prolifération incontrôlée d'agents disparates dans l'infrastructure. Cette approche s'inscrit dans un contexte d'accélération rapide des standards d'interopérabilité entre agents. Le protocole A2A, porté notamment par Google, vise à établir un langage commun pour que des agents d'éditeurs différents puissent collaborer, déléguer des sous-tâches et composer des workflows multi-étapes, là où REST se contentait d'exécutions isolées et déterministes. L'adoption a jusqu'ici été freinée par la complexité opérationnelle d'introduire ces nouvelles infrastructures sans perturber les systèmes en production. En proposant des architectures de référence et du code d'exemple, les auteurs cherchent à abaisser cette barrière d'entrée et à accélérer la migration progressive des parcs applicatifs existants vers un monde d'agents interopérables, sans rupture brutale.

UELes entreprises européennes disposant de parcs applicatifs REST existants pourraient adopter ces patterns d'overlay pour migrer progressivement vers des architectures multi-agents sans réécriture coûteuse, mais aucun acteur ou réglementation européen n'est spécifiquement concerné.

InfrastructureOpinion
1 source
Analyser AWS Health en libre-service avec les agents IA d'Amazon Bedrock
126AWS ML Blog 

Analyser AWS Health en libre-service avec les agents IA d'Amazon Bedrock

Amazon Web Services a présenté Chaplin, acronyme de Customer Health and Planned Lifecycle Intelligence Nexus, une solution open source conçue pour transformer la gestion des notifications de santé d'infrastructure cloud. Disponible sur GitHub avec des instructions de déploiement détaillées, Chaplin repose sur Amazon Bedrock et le Model Context Protocol (MCP) pour offrir une analyse en langage naturel des événements AWS Health. Concrètement, une équipe d'exploitation peut interroger directement son assistant IA depuis Claude Code ou Kiro CLI pour obtenir, par exemple, la liste des événements RDS à venir dans les 60 prochains jours, un résumé des retraits d'instances EC2 classés par urgence, ou les correctifs de sécurité affectant les environnements de production, sans avoir à attendre une réponse humaine. Le problème auquel répond Chaplin est réel et coûteux pour les grandes organisations. Un lundi matin type, une équipe opérationnelle peut recevoir simultanément des alertes sur la fin de vie d'Amazon Linux 2, des dépréciations de versions RDS et des retraits d'instances EC2 répartis sur plus de 50 comptes AWS. Sans outil d'analyse centralisé, les équipes dépendaient jusqu'ici de leurs Technical Account Managers (TAMs) pour interpréter ces événements et évaluer leur impact métier, ce qui créait des goulots d'étranglement dans la prise de décision. Les tableaux de bord BI classiques, figés dans des schémas prédéfinis, ne permettaient pas de répondre à des questions dynamiques ou contextuelles. Le résultat : du temps perdu en réaction plutôt qu'en anticipation, et des migrations ou maintenances planifiées trop tard. Chaplin s'inscrit dans un mouvement plus large d'adoption du Model Context Protocol comme standard d'interopérabilité entre outils IA et systèmes d'entreprise. Parce qu'il repose sur MCP, Chaplin peut être combiné avec d'autres outils compatibles comme JIRA, GitHub ou ServiceNow, permettant aux équipes DevOps, sécurité et opérations d'agir directement depuis leur flux de travail habituel. AWS prévoit également de lier prochainement les événements Health éligibles aux templates AWS Transform, ce qui permettra aux clients de passer directement de l'alerte à l'action corrective. Chaplin est conçu pour prioriser et remonter ces événements actionnables en premier. La solution illustre une tendance de fond : déléguer aux agents IA non plus seulement l'analyse de données, mais la coordination opérationnelle dans des environnements cloud complexes et multi-comptes.

OutilsOutil
1 source
Fable 5 : un indice découvert dans le code de Claude relance l’espoir d’un retour
127Le Big Data 

Fable 5 : un indice découvert dans le code de Claude relance l’espoir d’un retour

Le 24 juin 2026, un utilisateur de X connu sous le pseudonyme @synthwavedd a mis au jour plusieurs chaînes de texte inédites enfouies dans le binaire de Claude Code v2.1.190. Ces fragments de code évoquent explicitement un quota hebdomadaire dédié à Fable 5, le dernier modèle phare d'Anthropic, ainsi que la possibilité pour les utilisateurs de continuer à l'utiliser via des crédits après avoir atteint cette limite. Plus significatif encore : l'ancienne mention d'un achat séparé de l'abonnement semble avoir disparu de la base de code. En parallèle, Fable 5 est réapparu dans le catalogue d'Amazon Bedrock avec une fiche toujours active, et le magazine Wired rapporte que les négociations entre Anthropic et l'administration américaine ont récemment évolué, Tom Brown, cofondateur de la société, ayant pris la main sur les discussions en lieu et place du PDG Dario Amodei. Ces indices prennent tout leur sens au regard de la situation actuelle. Depuis le 12 juin 2026, Fable 5 est inaccessible aux utilisateurs américains et internationaux, bloqué par une directive gouvernementale de l'administration Trump quelques jours seulement après son lancement, en même temps que Mythos. Anthropic conteste cette décision, estimant que les failles identifiées ne justifiaient pas un retrait total du modèle. Si les messages découverts dans le code ne constituent pas une preuve formelle de retour, ils décrivent une logique de distribution qui ne peut fonctionner que si le modèle redevient accessible. Les ingénieurs n'intègrent généralement pas ce type de mécanique dans une version de production sans raison opérationnelle concrète, ce qui confère à ces découvertes un poids que de simples rumeurs n'auraient pas. L'affaire Fable 5 illustre un phénomène inédit dans l'histoire de l'intelligence artificielle : un gouvernement bloquant l'accès à un modèle commercial développé par une entreprise de son propre territoire, dans un contexte de tensions croissantes autour de la sécurité des systèmes d'IA. Anthropic se retrouve ainsi coincé entre ses obligations réglementaires et la pression commerciale d'un marché mondial qui attendait Fable 5 comme un bond qualitatif majeur. La délégation des négociations à Tom Brown, figure moins exposée que Dario Amodei, suggère une stratégie d'apaisement plutôt que de confrontation. Si un accord venait à être trouvé, le retour du modèle s'accompagnerait vraisemblablement de nouvelles conditions d'accès, possiblement plus restrictives, dont la logique de quota hebdomadaire découverte dans le code pourrait être le premier signe.

UELe blocage de Fable 5 a privé les développeurs et entreprises européens d'accès à ce modèle ; un éventuel retour, potentiellement assorti d'un système de quotas restrictifs, concernerait directement les intégrateurs IA et startups françaises et européennes qui attendaient ce modèle pour leurs pipelines de production.

💬 Les ingénieurs ne codent pas des mécaniques de quota pour un modèle qu'ils n'ont pas l'intention de ressortir. Ce que @synthwavedd a trouvé dans le binaire de Claude Code, c'est pas une rumeur, c'est une spéc technique qui implique un plan de retour actif, et ça change tout. La vraie question maintenant, c'est à quelles conditions.

Mistral lance OCR 4, un outil d'extraction documentaire taillé pour l'IA en entreprise
128VentureBeat AI 

Mistral lance OCR 4, un outil d'extraction documentaire taillé pour l'IA en entreprise

Mistral AI a lancé mardi OCR 4, sa quatrième génération de technologie de reconnaissance optique de caractères en à peine quinze mois. Ce modèle de traitement documentaire dépasse la simple extraction de texte brut : il retourne une représentation structurée complète de chaque document, avec des boîtes de délimitation précises pour chaque bloc, une classification par type de contenu (titre, tableau, équation, signature) et des scores de confiance mot par mot. Le modèle supporte 170 langues, accepte les formats PDF, DOC, PPT et OpenDocument, et peut être déployé en conteneur autonome sur l'infrastructure interne d'une organisation. Il est disponible immédiatement via l'API Mistral, Document AI dans Mistral Studio, Amazon SageMaker et Microsoft Foundry, avec une intégration Snowflake annoncée prochainement. La tarification débute à 4 dollars pour 1 000 pages, ramenée à 2 dollars via l'API batch. Lors d'évaluations humaines indépendantes, les annotateurs ont préféré les sorties d'OCR 4 dans 72 % des cas face aux solutions concurrentes. Le changement central d'OCR 4 est architectural. Plutôt que de produire un flux plat de texte extrait, le modèle génère une carte sémantique du document : chaque bloc est localisé, typé et scoré. Cette traçabilité répond à une friction majeure des équipes qui construisent des pipelines RAG (retrieval-augmented generation) ou des workflows de conformité, où la question "d'où vient ce chiffre, sur quelle page ?" exige une réponse auditable. La classification des blocs permet en outre d'orienter automatiquement un tableau vers un pipeline de données structurées, un titre vers un découpage sémantique, ou une signature vers un workflow de caviardage. Packager ces sorties directement dans le modèle OCR supprime une couche d'analyse de mise en page que les équipes devaient jusqu'ici construire et maintenir séparément. Les scores de confiance permettent quant à eux de router programmatiquement les extractions incertaines vers des relecteurs humains, sans qu'une personne n'ait à vérifier chaque page de chaque document. Ce lancement intervient dans un contexte particulièrement porteur pour Mistral. La startup française, dont la proposition de souveraineté numérique européenne n'a jamais été aussi commercialement pertinente, cible explicitement les entreprises des secteurs réglementés, finance, santé, juridique, qui ne peuvent pas faire transiter leurs documents sensibles par des API cloud sous juridiction américaine. La capacité de déploiement on-premise en conteneur unique est le principal levier de différenciation face à des acteurs comme Google Document AI ou AWS Textract. Pour les développeurs, l'enjeu est aussi économique : dans les systèmes de production, l'OCR n'est que la première étape d'un pipeline plus large, et la reconstruction manuelle de la structure documentaire consomme souvent plus de temps d'ingénierie que la logique IA en aval. OCR 4 vise à éliminer cette étape, et si le modèle tient ses promesses, les gains se mesurent autant en heures d'ingénierie économisées qu'en coût d'extraction.

UEMistral AI, startup française, propose un déploiement on-premise en conteneur qui offre aux entreprises européennes des secteurs réglementés (finance, santé, juridique) une alternative souveraine aux solutions cloud sous juridiction américaine.

OutilsOutil
1 source
Créer un agent de prise de rendez-vous médicaux avec Amazon Nova 2 Sonic
129AWS ML Blog 

Créer un agent de prise de rendez-vous médicaux avec Amazon Nova 2 Sonic

Amazon Web Services publie une architecture complète pour déployer un agent vocal capable de gérer automatiquement les rappels de rendez-vous médicaux, en combinant Amazon Nova 2 Sonic et Amazon Bedrock AgentCore. Le taux d'absences non justifiées dans les établissements de santé américains oscille entre 5 et 30 % selon les spécialités, chaque créneau vide représentant une perte de revenus, du temps médical gaspillé et des soins retardés. L'agent décrit authentifie les patients par reconnaissance vocale, gère les rendez-vous en temps réel, confirmation, annulation, reprogrammation, collecte des informations de santé pré-consultation et transfère l'appel à un agent humain si la situation l'exige. Le système repose sur Bedrock AgentCore en mode serverless, Amazon Cognito pour l'authentification, DynamoDB pour la persistance des données, Amazon SNS pour les notifications, et un frontend React qui streame l'audio bidirectionnel via des connexions WebSocket authentifiées. La différence fondamentale avec les approches traditionnelles tient au traitement natif parole-à-parole de Nova 2 Sonic. Les pipelines classiques enchaînent trois services distincts, transcription automatique, modèle de langage, synthèse vocale, et perdent à chaque transfert les nuances acoustiques du patient : hésitations, ton anxieux, confusion. Nova 2 Sonic traite la voix dans un seul modèle unifié, préservant le contexte vocal à travers chaque tour de dialogue. En santé, où l'état émotionnel d'un patient devrait influencer directement la réponse de l'agent, cette rétention de contexte améliore concrètement la qualité des échanges. Le modèle gère en outre les bruits de fond courants en environnement domestique et clinique, les accents régionaux, et peut basculer en cours de conversation vers la langue préférée du patient sans aucune reconfiguration. Amazon positionne Nova 2 Sonic comme une réponse directe aux limites des pipelines textuels dans les interactions vocales à fort enjeu. L'architecture s'appuie sur le SDK Strands Agents, qui intègre sept outils spécifiques au secteur médical pour l'authentification, la gestion des plannings et l'escalade vers le personnel soignant. Pour connecter l'agent à de vraies lignes téléphoniques en mode sortant, AWS recommande d'intégrer Amazon Connect, non inclus dans cette démonstration qui se concentre sur la couche agentique. Dans un secteur où les appels de confirmation un par un ne passent plus à l'échelle, cette architecture cible directement les réseaux de cliniques et d'hôpitaux qui absorbent chaque année des millions d'interactions téléphoniques routinières, et cherchent à les automatiser sans sacrifier la dimension humaine de la relation patient.

OutilsOutil
1 source
Business Intelligence pilotée par l'IA avec Snowflake et Amazon Quick
130AWS ML Blog 

Business Intelligence pilotée par l'IA avec Snowflake et Amazon Quick

Un tableau de bord affiche 42 000 films visionnés, un autre en compte 38 500, et l'agent conversationnel cite un troisième chiffre. Ce scénario, qui se répète dans d'innombrables entreprises, coûte des heures de réconciliation aux équipes data plutôt que de répondre à des questions stratégiques. Amazon Web Services et Snowflake ont publié un guide d'intégration détaillé pour résoudre ce problème structurel : connecter les vues sémantiques Snowflake à Amazon QuickSight afin que chaque outil, qu'il soit BI traditionnel ou agent IA, lise exactement les mêmes définitions métier depuis la même source de vérité. La démo s'appuie sur un jeu de données de critiques de films réparti en trois tables (MOVIES, USERS, RATINGS) chargées depuis Amazon S3 dans Snowflake, sur lesquelles une vue sémantique SQL définit métriques, dimensions et relations entre tables. L'enjeu central est ce que les auteurs appellent le "last-mile gap" : aujourd'hui, la logique métier est encodée séparément dans chaque application (le dashboard ici, l'agent là), ce qui génère des divergences dès qu'une règle de calcul évolue. Les vues sémantiques Snowflake déplacent cette logique au niveau de la plateforme de données elle-même. Résultat : Cortex Analyst, le moteur de requêtes en langage naturel de Snowflake, et les dashboards QuickSight interprètent les données de façon identique. Cela réduit significativement le risque d'hallucinations de l'IA, qui surviennent souvent lorsqu'un modèle de langage doit interpréter des colonnes brutes sans contexte métier. Les contrôles d'accès natifs de Snowflake s'appliquent directement aux vues sémantiques, comme pour n'importe quelle table, ce qui préserve la gouvernance sur l'ensemble des points d'entrée SQL, BI et IA. Cette publication s'inscrit dans une tendance de fond qui agite l'industrie data depuis 2023 : la montée des "couches sémantiques" comme terrain de bataille entre les grandes plateformes cloud. Snowflake, Databricks, dbt Labs et Google BigQuery investissent tous massivement pour que leurs environnements deviennent le point central d'autorité sur les définitions métier, avant même que l'IA ou le BI ne les consomme. Amazon, via QuickSight, cherche ici à positionner sa solution BI comme nativement compatible avec cette logique, en s'appuyant sur un partenaire comme Snowflake plutôt qu'en développant sa propre couche sémantique. La prochaine étape mentionnée dans le guide est l'intégration RAG (retrieval-augmented generation) : les tableaux de bord QuickSight alimentés par Snowflake pourraient devenir des sources documentaires pour des agents IA plus larges, ouvrant la voie à des systèmes où la donnée structurée et les LLM coopèrent dans un même espace de travail unifié.

UELes équipes data européennes utilisant ces plateformes cloud peuvent adopter cette approche de couche sémantique unifiée, mais sans impact réglementaire ou marché spécifique à la France ou à l'UE.

OutilsOutil
1 source
Mistral OCR 4 apporte des sorties structurées prêtes à citer aux pipelines RAG, agents autonomes et recherche d'entreprise
131MarkTechPost 

Mistral OCR 4 apporte des sorties structurées prêtes à citer aux pipelines RAG, agents autonomes et recherche d'entreprise

Mistral AI a lancé le 24 juin 2026 OCR 4, la quatrième génération de son modèle de reconnaissance et de compréhension de documents. Contrairement à ses prédécesseurs qui se contentaient de convertir une page en texte brut, OCR 4 produit une représentation structurée de l'intégralité du document : chaque bloc de contenu est localisé par une boîte de délimitation précise, classifié par type (titre, tableau, équation, signature, etc.) et accompagné d'un score de confiance par mot et par page. Le modèle prend en charge 170 langues réparties en 10 groupes linguistiques, y compris les langues rares et peu dotées en ressources, et accepte les formats bureautiques courants comme PDF, DOC, PPT et OpenDocument. Il peut être déployé dans un seul conteneur pour les entreprises soumises à des contraintes de résidence des données ou de conformité réglementaire. La tarification est fixée à 4 dollars pour 1 000 pages, réduite à 2 dollars via l'API batch. Cette sortie change la donne pour les pipelines d'ingestion documentaire en entreprise. En fournissant non seulement ce que dit un document, mais aussi où se trouve chaque élément et à quel degré de certitude, OCR 4 facilite la génération augmentée par récupération (RAG) avec citations vérifiables, les flux agentiques capables d'agir sur des factures ou des contrats, et les processus de vérification humaine ciblée sur les zones à faible confiance. Les benchmarks indépendants sont convaincants : sur plus de 600 documents et 12 langues, des annotateurs humains ont préféré OCR 4 à tous les systèmes concurrents testés, avec un taux de victoire moyen de 72 %. Sur OlmOCRBench, le modèle obtient 85,20 points ; sur OmniDocBench, 93,07. Deux clients illustrent l'impact opérationnel : Rogo a mesuré une précision équivalente aux meilleurs parseurs agentiques du marché, pour un coût huit fois inférieur et une latence dix-sept fois plus faible ; Anaqua a constaté un traitement environ quatre fois plus rapide par page que son fournisseur précédent. OCR 4 s'inscrit dans une tendance de fond où les éditeurs de modèles cherchent à contrôler toute la chaîne de traitement documentaire, de l'ingestion brute jusqu'à la recherche sémantique. Mistral l'intègre dès aujourd'hui comme composant d'ingestion dans son Search Toolkit, un framework de recherche open source désormais en préversion publique, conçu pour alimenter des pipelines de récupération et d'évaluation avec des sorties structurées et prêtes pour la citation. La concurrence sur ce segment est vive : AWS Textract, Google Document AI et les parseurs agentiques spécialisés dominent l'espace entreprise depuis plusieurs années. Mistral parie que la combinaison prix-latence-multilingue, alliée à la possibilité de déploiement on-premise, lui ouvrira des marchés réglementés comme la finance, le droit et la santé, où les données ne peuvent pas quitter l'infrastructure interne.

UEMistral AI étant une entreprise française, OCR 4 renforce la souveraineté numérique européenne en proposant un déploiement on-premise conforme au RGPD, ciblant directement les secteurs réglementés (finance, santé, droit) en France et en Europe.

OutilsOpinion
1 source
Together AI et Hugging Face profitent de l'essor de l'open source
132The Information AI 

Together AI et Hugging Face profitent de l'essor de l'open source

Together AI, la néo-infrastructure cloud spécialisée dans les modèles d'IA open source, a relevé ses projections de revenus annuels au moins trois fois au cours des derniers mois. Son PDG Vipul Ved Prakash a révélé que la plateforme générait environ un milliard de dollars de revenus annualisés en mars 2026, portée par une explosion du volume de calcul : le nombre de tokens traités via son cloud est passé de 30 milliards par mois il y a un an à 400 000 milliards ce mois-ci, une grande partie de cette croissance s'étant produite au cours des six derniers mois. Chez Hugging Face, dépôt de référence pour les modèles open source, le nombre d'abonnés payants a doublé entre janvier et juin, a indiqué le cofondateur et PDG Clem Delangue, sans préciser les chiffres absolus. Dans le même élan, Not Diamond, startup spécialisée dans les "model routers", des logiciels permettant aux entreprises de basculer facilement entre différents modèles selon la tâche, a connu "une forte hausse de la demande ces six derniers mois", selon son PDG Tomás Hernando Kofman. Ces routeurs, utilisés notamment par Cisco et Adobe, permettraient d'économiser entre 20 % et 40 % sur les coûts d'utilisation des modèles Anthropic les plus onéreux. Cette dynamique illustre un basculement stratégique dans l'industrie : les entreprises cherchent activement à reprendre le contrôle de leurs coûts d'IA et à réduire leur dépendance à un fournisseur unique. Thomas Wolf, cofondateur de Hugging Face, parle d'un "grand réveil sobre" chez ses clients professionnels, préoccupés par les prix en hausse des modèles propriétaires et les risques d'enfermement technologique. Si l'on rapporte la croissance de Together AI aux tarifs actuels, par exemple 18 centimes par million de tokens pour DeepSeek v4 Pro, l'écart entre 30 milliards et 400 000 milliards de tokens représenterait environ 70 millions de dollars de dépenses mensuelles supplémentaires. Vipul Ved Prakash estime que les modèles open source représenteront à terme la grande majorité des usages d'IA dans le monde. Ce mouvement s'inscrit dans un contexte plus large de maturité du marché de l'IA en entreprise. OpenAI et Anthropic continuent de défendre leurs modèles premium en arguant que leurs performances justifient les prix pratiqués, mais la concurrence ouverte s'intensifie. Parallèlement, Amazon Web Services accélère sur un autre front : le géant du cloud forme actuellement ses "solution architects" pour qu'ils deviennent des ingénieurs déployés directement chez les clients, à l'image du modèle dit FDE (forward-deployed engineer) popularisé par Palantir et désormais adopté par OpenAI, Anthropic, Salesforce et Snowflake. AWS s'appuie sur des équipes pluridisciplinaires, incluant ingénieurs, scientifiques appliqués et stratèges en IA, comme au siège d'Atlanta de Cox Automotive début 2025. Ces consultants hybrides, à mi-chemin entre développeur, chef de produit et conseiller stratégique, répondent à une demande croissante des grandes entreprises qui ne disposent pas encore des compétences internes pour déployer l'IA de manière autonome.

UEHugging Face, cofondée par les Français Thomas Wolf et Clem Delangue, est au cœur de cette dynamique avec un doublement de ses abonnés payants, renforçant son rôle de référence mondiale pour l'IA open source et offrant aux entreprises européennes une alternative crédible aux modèles propriétaires américains pour réduire leur dépendance technologique.

BusinessOpinion
1 source
Infrastructure partagée, locataires isolés : la mutualisation multi-tenant avec Amazon Bedrock AgentCore
133AWS ML Blog 

Infrastructure partagée, locataires isolés : la mutualisation multi-tenant avec Amazon Bedrock AgentCore

Amazon Web Services vient de publier un guide architectural détaillé pour la construction d'applications d'intelligence artificielle multi-locataires à l'aide d'Amazon Bedrock AgentCore. Le document, second volet d'une série consacrée à ce sujet, s'appuie sur un cas concret dans le domaine médical : une plateforme d'agents IA servant simultanément plusieurs cliniques et hôpitaux. L'architecture proposée repose sur un modèle dit "pool", où tous les clients partagent la même infrastructure sous-jacente, mais sont isolés les uns des autres par des mécanismes logiques : identifiants scopés, politiques d'accès et partitionnement des données. La hiérarchie est structurée en trois niveaux, Niveau de service, Locataire, Utilisateur, et l'isolation est appliquée à chaque couche, depuis les documents stockés en base de connaissances jusqu'au suivi des coûts. Ce schéma répond à un défi concret pour les éditeurs de logiciels en mode SaaS : comment servir des clients aux besoins très différents sans multiplier les infrastructures dédiées ni exposer des données d'un client à un autre ? La solution présentée définit deux niveaux de service distincts. L'offre basique, destinée aux petites cliniques, utilise le modèle Mistral Ministral 3 8B Instruct pour des tâches de recherche documentaire simples, avec un coût réduit. L'offre premium, réservée aux hôpitaux et centres spécialisés, s'appuie sur OpenAI GPT OSS 120B, un modèle de 120 milliards de paramètres aux capacités de raisonnement avancées, et donne accès à des outils supplémentaires comme la recherche web. Cette différenciation par niveaux permet à un même fournisseur de servir des clients aux exigences très différentes tout en maintenant une efficacité opérationnelle. Le contexte est celui d'une adoption croissante des agents IA dans les entreprises, qui soulève des questions de gouvernance, d'attribution des coûts et de qualité de service que les architectures classiques ne résolvent pas facilement. Amazon positionne Bedrock AgentCore comme une brique native pour absorber cette complexité sans code personnalisé excessif. La publication du dépôt GitHub associé aux exemples illustre une volonté de standardisation des pratiques : l'objectif est que les équipes techniques puissent répliquer ces patterns dans des secteurs variés, plateformes SaaS, solutions d'entreprise multi-entités, services managés. Les enjeux sont significatifs, car une mauvaise isolation entre locataires dans un contexte médical exposerait des données sensibles de patients, avec des conséquences réglementaires sévères. Ce cadre architectural cherche précisément à rendre ce risque gérable par conception plutôt que par surveillance manuelle.

UELes éditeurs européens de SaaS dans le secteur médical peuvent s'appuyer sur ces patterns d'isolation multi-tenant pour faciliter la conformité au RGPD, même si la solution repose intégralement sur l'infrastructure américaine d'AWS.

💬 Le vrai problème des agents IA en SaaS, c'était l'isolation par tenant, pas les modèles. AWS publie un blueprint complet pour ça, du code, des niveaux de service différenciés, une attribution des coûts par client, tout ce que chaque équipe réinventait dans son coin depuis deux ans. Le piège pour les éditeurs européens, la solution repose entièrement sur l'infra américaine d'AWS.

OutilsTuto
1 source
ComfyUI sur Amazon SageMaker : exécuter des workflows de traitement
134AWS ML Blog 

ComfyUI sur Amazon SageMaker : exécuter des workflows de traitement

Amazon Web Services a publié un guide technique détaillant comment exécuter des workflows ComfyUI sur Amazon SageMaker AI, via ses "processing jobs", pour automatiser la génération de contenu visuel à grande échelle. La solution repose sur AWS Cloud Development Kit (CDK) et des instances GPU accélérées avec une facturation à la seconde et arrêt automatique à la fin du job. En pratique, le dispositif permet de générer des centaines d'images haute qualité en un seul batch, à partir de workflows ComfyUI exportés au format JSON. AWS illustre également l'intégration du modèle Z-Image Turbo, un modèle texte-vers-image reposant sur une architecture Transformer à flux unique (S3DiT) de 6 milliards de paramètres, 30 couches, une taille cachée de 3 840 et 32 têtes d'attention, avec une technique de fusion précoce qui traite uniformément les tokens texte et image dans le même Transformer. Pour les équipes marketing et créatives des grandes entreprises, cette automatisation change concrètement les règles du jeu. Là où un designer devait itérer manuellement pour produire des visuels adaptés à chaque marché ou segment d'audience, il devient possible de générer en une heure des centaines de visuels cohérents avec la charte graphique, des voix synthétisées multilingues pour des campagnes publicitaires, ou des clips vidéo avec scripts et images générés par IA. La facturation à la seconde de SageMaker élimine le gaspillage de compute, tandis que l'architecture en file d'attente traite plusieurs demandes en parallèle sans intervention manuelle. L'enjeu commercial est direct : chaque heure gagnée en production de contenu peut être réinvestie dans le lancement d'une campagne supplémentaire ou le ciblage d'un nouveau segment d'audience. Cette initiative s'inscrit dans une tendance de fond : les hyperscalers intègrent de plus en plus les outils open-source de l'IA générative dans leurs plateformes cloud managées, pour capter les workflows déjà adoptés par les praticiens. ComfyUI s'est imposé comme standard de facto pour composer des pipelines d'IA générative complexes sans coder chaque étape, grâce à son interface visuelle modulaire et ses workflows versionnables. En le portant sur SageMaker, AWS vise les entreprises qui utilisent déjà ComfyUI en local mais peinent à le faire passer à l'échelle en production. La prise en charge de modèles comme Z-Image Turbo, avec son architecture decoder-only inspirée des grands modèles de langage, signale aussi que la frontière entre génération de texte et génération d'image continue de s'estomper sur le plan architectural, ouvrant la voie à des pipelines multimodaux encore plus intégrés.

OutilsOutil
1 source
Copilot a fouillé vos emails, LiteLLM a exposé des clés admin : faites cet audit en 5 points
135VentureBeat AI 

Copilot a fouillé vos emails, LiteLLM a exposé des clés admin : faites cet audit en 5 points

En l'espace de deux semaines, quatre équipes de recherche ont révélé des failles critiques dans des outils d'IA d'entreprise, mettant à nu un même défaut structurel. Le 15 juin 2026, Varonis a divulgué SearchLeak (CVE-2026-42824), une chaîne d'exfiltration silencieuse dans Microsoft 365 Copilot Enterprise Search : un utilisateur clique sur une URL piégée hébergée sur microsoft.com, Copilot effectue une recherche dans sa propre boîte mail, et les données quittent le périmètre via un SSRF Bing, sans plugin, sans second clic, sans aucun indicateur visible. Quatre jours plus tôt, Obsidian Security avait publié une chaîne de trois CVE contre LiteLLM, une passerelle proxy qui centralise les accès à OpenAI, Anthropic, Azure et Bedrock. CVE-2026-47101 permet à un compte non-administrateur de générer une clé API universelle ; CVE-2026-47102 élève ce compte au rang d'administrateur via un endpoint non protégé ; CVE-2026-40217 permet une évasion du sandbox par exécution de code arbitraire. La chaîne combinée est scorée à CVSS 9.9. S'y ajoute CVE-2026-42271, une injection de commande dans les endpoints MCP de LiteLLM, inscrite sur la liste CISA KEV le 8 juin avec échéance de remédiation au 22 juin. Langflow a simultanément vu CVE-2026-5027 exploitée activement dès le 9 juin : une traversée de chemin dans l'upload de fichiers combinée à une auto-connexion activée par défaut ouvre une exécution de code à distance sans authentification sur environ 7 000 instances exposées, avec attribution à MuddyWater. Ces vulnérabilités révèlent un problème de fond identique : les outils IA d'entreprise acceptent des entrées externes sans frontière de confiance. Dans le cas de Copilot Enterprise Search, l'étendue est particulièrement préoccupante puisque l'outil hérite des droits organisationnels complets de l'utilisateur, exposant potentiellement l'ensemble de ce qu'il peut atteindre. Pour LiteLLM, compromettre la passerelle revient à obtenir simultanément toutes les clés de fournisseurs d'une organisation. Avec plus de 40 000 étoiles sur GitHub et des milliers de déploiements en entreprise, l'exposition est massive. L'exploitation active de Langflow par un acteur étatique iranien sur des milliers d'instances illustre la rapidité avec laquelle ces failles sont weaponisées après divulgation. Ces incidents s'inscrivent dans une tendance plus large. SearchLeak est la troisième chaîne d'exfiltration Copilot publiée par Varonis en douze mois, après Reprompt en janvier 2026 et EchoLeak en 2025, chaque fois avec un périmètre élargi. LiteLLM avait déjà été compromis en mars 2026 via une attaque supply chain qui avait backdooré les versions 1.82.7 et 1.82.8 sur PyPI. La campagne Mini Shai-Hulud a confirmé la viralité du vecteur : après la publication du code source d'un ver le 12 mai, des variantes ont compromis 32 packages npm de Red Hat Cloud Services le 1er juin, des packages téléchargés 80 000 fois par semaine. Le schéma est systémique : à mesure que l'IA s'intègre dans les infrastructures critiques, chaque couche de la chaîne, modèle, proxy, orchestrateur, dépendances, devient un vecteur d'attaque potentiel que les périmètres de confiance traditionnels ne couvrent pas.

UEDes milliers d'organisations européennes sont directement exposées à des exfiltrations silencieuses de données et compromissions de clés API via leurs outils IA d'entreprise, avec exploitation active confirmée par un acteur étatique iranien ciblant des instances non patchées.

SécuritéOpinion
1 source
AWS prépare une nouvelle génération d’agents IA d’entreprise
136Le Big Data 

AWS prépare une nouvelle génération d’agents IA d’entreprise

Amazon Web Services a dévoilé une série d'annonces autour de sa plateforme Bedrock et de plusieurs nouveaux services destinés à accélérer l'intégration des agents IA dans les environnements d'entreprise. Les évolutions touchent quatre domaines principaux : l'accès à la connaissance, l'automatisation des processus métier, la sécurité applicative et le développement logiciel. Bedrock AgentCore s'enrichit notamment de connecteurs vers SharePoint, Confluence, Google Drive et Amazon S3, mais aussi d'une capacité de navigation web directement intégrée au périmètre sécurisé du client. Un mécanisme d'accès aux contenus sous licence est également prévu, permettant aux fournisseurs de données de monétiser leur usage par les agents. Sur le terrain de la gouvernance, les équipes peuvent désormais analyser les erreurs récurrentes, tester différentes configurations et renforcer la protection contre les injections de prompt via Bedrock Guardrails. L'assistant métier Amazon Quick reçoit des capacités de gestion autonome de tâches, avec une vue unifiée regroupant échanges, rendez-vous et actions en attente, et s'ouvre à de nouveaux partenaires comme Adobe, Figma, Shopify, Snowflake et WhatsApp. Ces annonces marquent un changement de paradigme dans la façon dont AWS positionne l'IA en entreprise : il ne s'agit plus d'outils de question-réponse, mais d'agents capables d'agir de façon autonome sur des workflows réels. Pour les équipes de développement, AWS Continuum automatise l'identification et la correction des vulnérabilités logicielles, tandis qu'AWS Transform surveille en continu les dépôts de code pour détecter les composants vieillissants et proposer des pull requests correctives. AWS DevOps Agent élargit quant à lui son périmètre à la validation pré-production et à la génération automatique de scénarios de test. L'environnement de développement piloté par agents Kiro devient accessible sur iPhone. Ce virage vers l'automatisation concrète représente un enjeu majeur pour les directions techniques et les DSI, qui doivent désormais évaluer comment déléguer des pans entiers de leur chaîne de valeur à des systèmes autonomes. Ces évolutions s'inscrivent dans une compétition intense entre les grands fournisseurs de cloud pour capter les budgets IA des entreprises. AWS répond ainsi aux offres de Microsoft Copilot et de Google Vertex AI, qui avancent sur des territoires similaires. Le nouveau service AWS Context, qui construit automatiquement une représentation des liens entre données d'entreprise pour les rendre exploitables par les agents, illustre la volonté d'AWS de résoudre la fragmentation de l'information dans les grandes organisations, un problème structurel que ni les outils de recherche classiques ni les premiers chatbots d'entreprise n'ont su régler. La capacité à monétiser les données premium via les agents ouvre par ailleurs un nouveau marché pour les éditeurs de contenu, dont les modalités de valorisation restent encore à définir dans un cadre réglementaire et contractuel qui n'en est qu'à ses débuts.

UELes DSI français et européens opérant sur AWS peuvent dès maintenant évaluer le déploiement d'agents autonomes sur leurs workflows internes, dans un cadre de sécurité (Bedrock Guardrails, protection anti-injection) potentiellement aligné avec les exigences de l'AI Act.

💬 AWS Context est probablement l'annonce la plus sous-estimée du lot : construire automatiquement la carte des liens entre données d'entreprise, c'est ce que ni SharePoint ni Elastic n'ont réussi à faire depuis vingt ans. Le vrai enjeu ici, c'est pas les agents, c'est qui détient le graphe de connaissance de l'organisation. Azure l'avait compris avant tout le monde avec le Microsoft Graph, AWS vient de rattraper son retard, bon, presque.

OutilsOutil
1 source
AWS rejoint la course à la couche contextuelle avec un graphe enrichi par les agents, sans curation manuelle
137VentureBeat AI 

AWS rejoint la course à la couche contextuelle avec un graphe enrichi par les agents, sans curation manuelle

Amazon Web Services a annoncé mercredi, lors du AWS Summit à New York, une série de trois nouveaux produits destinés à constituer ce que l'entreprise appelle une "pile d'intelligence contextuelle" pour les agents d'intelligence artificielle. La pièce maîtresse est AWS Context, un service de graphe de connaissances capable d'apprendre automatiquement au fil de l'usage des agents. AWS a également annoncé la disponibilité générale d'Amazon S3 Annotations et lancé en préversion les "skill assets" dans AWS Glue Data Catalog. Swami Sivasubramanian, vice-président en charge de l'IA agentique chez AWS, a présenté le tout lors de la keynote : "Vos agents deviennent plus intelligents sans que vous ayez à tout reconstruire depuis zéro." AWS Context construit automatiquement un graphe à partir des données existantes d'une entreprise, en inférant les relations entre tables, colonnes, règles métier et sources de données, puis en mettant l'ensemble à disposition des agents en temps réel. Les responsables des données supervisent le graphe via la console AWS, valident les relations inférées et y attachent des définitions métier. L'enjeu central est d'éliminer la curation manuelle, coûteuse et chronophage, qui constitue aujourd'hui le principal obstacle au déploiement des agents IA en entreprise. Le graphe s'améliore de lui-même en apprenant quelles sources produisent des résultats corrects et quelles parties sont effectivement utilisées. Côté sécurité, chaque requête hérite des permissions IAM et Lake Formation de l'utilisateur appelant, rendant les accès aux données traçables par identité. Toutes les métadonnées sont publiées en format Apache Iceberg vers Amazon S3 Tables, interrogeables via Athena, Redshift, Spark ou tout moteur compatible Iceberg, sans API propriétaire. Les agents accèdent au graphe via des API de recherche agentique et des outils MCP, compatibles avec Bedrock AgentCore, EKS ou n'importe quel framework MCP. Des connexions vers des catalogues tiers sont également prises en charge, permettant d'intégrer des données extérieures à l'écosystème AWS. La couche de contexte est devenue un champ de bataille architectural où s'affrontent désormais plusieurs acteurs majeurs. Snowflake a lancé ce mois-ci ses services Horizon Context et Cortex Sense, Microsoft propose son approche via Fabric IQ, Redis a développé une plateforme de contexte optimisée pour la récupération de données, et Pinecone commercialise Nexus, qui précompile les données d'entreprise en artefacts spécialisés avant même que les agents ne les interrogent. L'argument structurel d'AWS est simple : pour les entreprises déjà clientes de S3, Glue et Lake Formation, le graphe contextuel s'intègre nativement à une infrastructure existante, sans migration ni verrouillage propriétaire. La question qui reste ouverte est de savoir si l'apprentissage automatique du graphe tient ses promesses à l'échelle des environnements de données réels, souvent hétérogènes et mal documentés.

UELes entreprises françaises et européennes déjà clientes d'AWS pourront intégrer cette couche contextuelle agentique nativement dans leur infrastructure S3/Glue existante, sans migration vers une solution tierce.

InfrastructureOpinion
1 source
Intelligence contextuelle pour vos données et agents IA à grande échelle
138AWS ML Blog 

Intelligence contextuelle pour vos données et agents IA à grande échelle

Amazon Web Services a annoncé lors de l'AWS Summit New York City le lancement prochain d'AWS Context, un nouveau service conçu pour donner aux agents d'intelligence artificielle un accès structuré et gouverné à l'ensemble des données d'une organisation. Le service construit automatiquement un graphe de connaissances en cartographiant les relations entre les sources de données existantes, lacs de données, entrepôts, bases de données, flux en temps réel, et expose ce graphe via des API de recherche agentique et des outils MCP. Les équipes data peuvent gérer ce graphe depuis une console dédiée, valider les relations inférées automatiquement, les promouvoir en production, et y attacher des définitions métier ou des règles d'usage. AWS Context s'appuie sur la technologie qui alimente déjà Amazon QuickSight Q, un graphe de connaissances personnel utilisé quotidiennement par des centaines de milliers d'utilisateurs et traitant des millions de requêtes par jour. La nouveauté : ce graphe devient organisationnel, partagé entre tous les agents et applications d'une entreprise. Les métadonnées clés sont publiées au format Apache Iceberg dans Amazon S3, ce qui les rend interrogeables via Athena, Redshift ou Spark. L'enjeu est fondamental pour les entreprises qui déploient des agents IA en production : un agent ne peut prendre de décisions fiables que s'il dispose du bon contexte au bon moment. Aujourd'hui, ce contexte est dispersé entre des dizaines de systèmes hétérogènes, et une grande partie de la connaissance institutionnelle n'est tout simplement pas écrite. AWS Context vise à combler ce vide en créant une couche de contexte centralisée, gouvernée et accessible en temps réel. Pour les utilisateurs existants d'Amazon QuickSight Q, le bénéfice est immédiat : une fois AWS Context activé, leurs agents accèdent automatiquement au graphe étendu, incluant les relations inter-systèmes et les règles métier qui dépassent ce qu'un graphe personnel peut offrir. AWS Glue Data Catalog, Amazon SageMaker Unified Studio et AWS Lake Formation s'intègrent nativement au service. Ce lancement s'inscrit dans une course industrielle plus large autour de ce qu'AWS appelle l'« intelligence de contexte ». Les grands fournisseurs cloud rivalisent pour proposer des infrastructures permettant aux agents IA de raisonner sur des données d'entreprise réelles, sans que les équipes aient à construire des pipelines de récupération complexes. AWS Context se distingue par deux caractéristiques : son graphe apprend automatiquement de l'usage des agents, propageant les chemins de jointure corrects et les ambiguïtés résolues à l'ensemble de l'organisation sans intervention humaine ; et son architecture ouverte, basée sur Apache Iceberg, garantit que les métadonnées restent portables et auditables, indépendamment des outils choisis. Le service est également conçu pour se connecter à des catalogues tiers, étendant le graphe au-delà de l'écosystème AWS. La disponibilité générale n'a pas encore été précisée.

InfrastructureActu
1 source
Les puces IA moins coûteuses d'Amazon séduisent les entreprises
139The Information AI 

Les puces IA moins coûteuses d'Amazon séduisent les entreprises

Les puces d'IA maison d'Amazon séduisent un nombre croissant d'entreprises grâce à un argument massue : le prix. Selon Karol Piatek, consultant en infrastructure IA au cabinet irlandais Co Driver Labs, l'utilisation des puces Inferentia2 et Trainium2 d'Amazon pour exécuter des modèles d'IA existants, ce qu'on appelle l'inférence, peut coûter jusqu'à 80 % moins cher que les H100 de Nvidia, à charge de travail comparable. Amazon multiplie depuis plusieurs mois les discussions avec des entreprises gérant leurs propres centres de données pour leur proposer ces alternatives : Trainium pour l'entraînement de nouveaux modèles, Inferentia pour le déploiement. L'écart de prix est suffisamment significatif pour peser dans les décisions d'infrastructure, surtout dans un contexte où les budgets IA explosent. Pour les entreprises qui n'ont pas besoin des performances brutes maximales de Nvidia mais cherchent à industrialiser leurs usages IA à moindre coût, les puces Amazon représentent un compromis crédible. L'argument de la disponibilité joue aussi : les H100 restent difficiles à obtenir en grande quantité. Cette dynamique s'inscrit dans une tendance de fond : les grands hyperscalers, Amazon, Google, Microsoft, investissent massivement dans leurs propres puces pour réduire leur dépendance à Nvidia, dont la domination sur le marché des accélérateurs IA est quasi totale. Amazon, qui vend déjà ces puces via AWS, tente désormais de convaincre les entreprises disposant de leurs propres infrastructures physiques, un segment jusqu'ici largement acquis à Nvidia. Si ces conversions se multiplient, la pression concurrentielle sur Jensen Huang et ses équipes pourrait s'intensifier.

UELes entreprises européennes gérant leurs propres infrastructures IA pourraient réduire leurs coûts d'inférence jusqu'à 80 % en adoptant les puces Inferentia2 d'Amazon comme alternative crédible aux H100 de Nvidia.

InfrastructureOpinion
1 source
La mise en cache des conteneurs dans Amazon SageMaker AI accélère le déploiement des modèles
140AWS ML Blog 

La mise en cache des conteneurs dans Amazon SageMaker AI accélère le déploiement des modèles

Amazon Web Services vient d'annoncer une nouvelle fonctionnalité pour SageMaker AI : le cache des images de conteneurs lors des événements de mise à l'échelle. Concrètement, cette optimisation réduit jusqu'à 51 % la latence de démarrage lors du lancement de nouvelles instances, et jusqu'à 2x pour les modèles d'IA générative en conditions réelles. Pour illustrer le gain : avec le modèle Qwen3-8B (16 Go) sur une instance ml.g6.2xlarge et le conteneur LMI de SageMaker (17,7 Go compressé), la latence de démarrage passe de 525 secondes à 258 secondes. Avant le cache, le téléchargement de l'image depuis Amazon ECR prenait à lui seul 333 secondes, en parallèle du téléchargement des poids du modèle depuis S3 (168 secondes). Avec le cache, l'image est déjà disponible localement (0 seconde), et le téléchargement du modèle tombe à 77 secondes, la compétition pour la bande passante réseau étant éliminée. L'enjeu est considérable pour les équipes qui déploient des modèles de langage en production. Lors d'un pic de trafic, chaque seconde de latence au démarrage d'une nouvelle instance se traduit directement en requêtes non servies ou en surcoût d'instances pré-chauffées. Les workloads d'IA générative sont particulièrement touchés car ils utilisent des conteneurs très volumineux, LMI (basé sur vLLM), vLLM natif, NVIDIA Triton, qui pouvaient représenter la majeure partie du temps d'initialisation. La fonctionnalité s'applique aux deux architectures d'endpoints SageMaker : les endpoints à modèle unique (où chaque nouvelle instance héberge sa propre copie du modèle) et les endpoints à composants d'inférence (où de nouvelles instances sont lancées uniquement quand aucune instance existante n'a la capacité suffisante). Si le cache est indisponible, SageMaker revient automatiquement au téléchargement depuis ECR, sans interruption de service. Cette annonce s'inscrit dans une stratégie progressive d'AWS pour réduire la latence de mise à l'échelle sur SageMaker. La plateforme avait déjà introduit des métriques CloudWatch sub-minute permettant de détecter les besoins de scale-out jusqu'à 6 fois plus vite, ainsi qu'un cache de données par instance pour les composants d'inférence réutilisant des instances déjà en cours d'exécution. Mais ces solutions précédentes ne couvraient pas le cas où une toute nouvelle instance devait être lancée, le scénario le plus coûteux. Le cache de conteneurs comble précisément ce manque. Dans un contexte où la concurrence entre AWS, Google Cloud et Azure s'intensifie sur les performances d'inférence, cette optimisation renforce la position de SageMaker pour les déploiements LLM à grande échelle, notamment dans les entreprises qui font face à des pics de charge imprévisibles.

UELes entreprises françaises et européennes déployant des LLMs sur Amazon SageMaker bénéficieront directement de cette réduction de latence au scale-out, sans configuration supplémentaire.

InfrastructureActu
1 source
Google Cloud soutient l’ambition de superintelligence d’Ineffable Intelligence
141Le Big Data 

Google Cloud soutient l’ambition de superintelligence d’Ineffable Intelligence

Ineffable Intelligence, startup londonienne fondée par David Silver, le chercheur britannique à l'origine d'AlphaGo, a annoncé lors du Google Cloud Summit London 2026 un partenariat stratégique avec Google Cloud pour soutenir le développement de son projet de superintelligence. Cette alliance intervient dans la foulée d'une levée de fonds de 1,1 milliard de dollars, la plus importante jamais réalisée par une startup européenne spécialisée dans l'IA. Concrètement, Ineffable Intelligence déploiera sur l'infrastructure Google Cloud l'un des plus grands clusters A5X au monde, équipé de GPU NVIDIA Vera Rubin NVL72, pour entraîner ce qu'elle appelle un « super-apprenant » : une intelligence artificielle capable d'acquérir des connaissances par l'expérience directe, en continu, plutôt qu'à partir de vastes ensembles de données précompilées. L'enjeu dépasse largement le simple choix d'un prestataire cloud. Les systèmes fondés sur l'apprentissage par renforcement continu imposent des contraintes d'infrastructure radicalement différentes des modèles génératifs classiques : ils génèrent, évaluent et exploitent en temps réel des flux d'expériences, ce qui exige non seulement une puissance de calcul considérable, mais aussi une interconnexion ultra-performante entre GPU, réseau à haut débit et stockage optimisé. Google Cloud se positionne précisément sur cette architecture intégrée, présentée comme un avantage décisif pour les laboratoires les plus exigeants. Pour l'industrie, ce partenariat marque une étape dans la compétition entre hyperscalers pour capter les projets d'IA les plus ambitieux, où l'infrastructure devient un levier de différenciation aussi important que les algorithmes eux-mêmes. David Silver, figure emblématique du domaine depuis sa contribution décisive à AlphaGo chez DeepMind, a quitté Google pour fonder Ineffable Intelligence avec l'ambition explicite de développer des systèmes capables de dépasser les capacités humaines dans des domaines comme les sciences, les mathématiques ou la technologie. L'approche par apprentissage par renforcement qu'il défend s'inscrit dans une tradition de recherche distincte des grandes entreprises qui misent sur la mise à l'échelle de modèles de langage entraînés sur du texte. Le choix de Google Cloud comme partenaire est une décision stratégique pour les deux parties : Ineffable Intelligence bénéficie d'une infrastructure de premier rang à grande échelle, tandis que Google utilise ce partenariat comme vitrine pour démontrer la maturité de son offre IA à une période où la concurrence entre Azure, AWS et Google Cloud pour attirer les laboratoires de recherche de pointe n'a jamais été aussi intense. La levée de 1,1 milliard confirme que le projet est pris très au sérieux par les investisseurs, même si l'horizon d'une superintelligence opérationnelle reste indéfini.

UELa levée record d'1,1 milliard de dollars par Ineffable Intelligence, startup londonienne fondée par le chercheur britannique à l'origine d'AlphaGo, s'impose comme un signal fort pour l'écosystème européen de l'IA, confirmant sa capacité à générer des laboratoires de recherche de niveau mondial capables de rivaliser avec les géants américains.

💬 David Silver quitte Google pour lever 1,1 milliard et retourner entraîner ses modèles sur... l'infra Google. Le serpent qui se mord la queue, mais version superintelligence. Ce qui m'intéresse vraiment là-dedans, c'est l'approche : de l'apprentissage par renforcement continu plutôt que du scaling de LLM sur texte, c'est une vraie bifurcation par rapport à ce que font OpenAI ou Anthropic. Reste à voir si ça donne quelque chose en dehors des jeux de plateau.

BusinessOpinion
1 source
Amazon et cinq autres entreprises auraient déclenché les mesures gouvernementales contre le modèle Fable d'Anthropic
142The Decoder 

Amazon et cinq autres entreprises auraient déclenché les mesures gouvernementales contre le modèle Fable d'Anthropic

Amazon CEO Andy Jassy, accompagné de dirigeants d'au moins cinq autres grandes entreprises technologiques, a alerté l'administration Trump sur des failles de sécurité identifiées dans Fable, le nouveau grand modèle de langage d'Anthropic. En quelques heures à peine après ces signalements, la Maison-Blanche a ordonné le retrait du modèle via un arrêté de contrôle des exportations, contraignant Anthropic à le mettre hors ligne immédiatement. L'identité précise des autres entreprises ayant participé à ce signalement collectif n'a pas été officiellement divulguée. La décision révèle une tension inédite au sein du secteur : Amazon est l'un des principaux bailleurs de fonds d'Anthropic, y ayant investi plusieurs milliards de dollars, tout en ayant participé activement au déclenchement de cette mesure gouvernementale contre son propre partenaire. Pour les développeurs et entreprises qui intégraient Fable dans leurs applications, le retrait brutal du modèle constitue une interruption majeure. Au-delà, l'épisode confirme que Washington est désormais prêt à mobiliser les contrôles à l'exportation comme levier direct de régulation des modèles d'IA avancés. Cette affaire s'inscrit dans un contexte de surveillance croissante des laboratoires d'IA par les autorités américaines, notamment autour des risques liés à la prolifération de systèmes très puissants. La coïncidence entre les investissements massifs d'Amazon dans Anthropic et son rôle concurrent via ses propres modèles déployés sur AWS Bedrock nourrit des questions sur d'éventuels conflits d'intérêts. Certains analystes y voient autant une démonstration de force politique qu'une décision de sécurité légitime, et l'avenir du modèle Fable reste à ce stade incertain.

UELes développeurs et entreprises européens ayant intégré Fable dans leurs applications sont contraints à une interruption immédiate de service, et cet usage inédit des contrôles à l'exportation américains crée un précédent susceptible de restreindre à tout moment l'accès européen aux modèles d'IA avancés.

💬 Amazon a mis des milliards dans Anthropic, et c'est Amazon qui a sonné l'alarme pour faire couper Fable, pendant que ses propres modèles concurrents tournent sur Bedrock. Bon, sur le papier c'est peut-être une vraie question de sécurité, j'y crois pas trop. Les devs européens qui avaient Fable en prod ont surtout retenu la leçon : un arrêté à Washington, et ton infra s'éteint.

Traiter des PDF et en extraire des insights : concevoir un pipeline intelligent avec les services IA générative d'AWS
143AWS ML Blog 

Traiter des PDF et en extraire des insights : concevoir un pipeline intelligent avec les services IA générative d'AWS

Amazon Web Services a dévoilé une architecture complète de traitement intelligent de documents reposant sur ses services d'IA générative, notamment Amazon Bedrock Data Automation (BDA). Ce service unifié permet d'extraire des informations structurées depuis des documents multimodaux, PDF, images, vidéos, fichiers audio, avec une capacité allant jusqu'à 3 000 pages et 500 Mo par requête API. Contrairement aux solutions OCR classiques qui se limitent à l'extraction de texte brut, BDA analyse le contexte, classe automatiquement chaque section d'un document dans la bonne catégorie, l'associe au bon modèle de traitement, et fournit des scores de confiance sur les données extraites. L'architecture s'appuie sur quatre couches intégrées : ingestion des fichiers via Amazon S3, extraction et stockage avec DynamoDB, couche d'intelligence sémantique via Amazon Bedrock Knowledge Base, et coordination agentique par des agents spécialisés hébergés sur Amazon Bedrock AgentCore Runtime, orchestrés par AWS Step Functions. Pour les organisations qui traitent chaque jour des millions de documents, contrats juridiques, dossiers médicaux, factures, déclarations d'assurance, cette solution répond à un goulot d'étranglement majeur : l'intervention humaine obligatoire dans les pipelines traditionnels. En automatisant la classification, la normalisation et la validation des données, BDA réduit les coûts opérationnels, accélère les délais de traitement et limite les erreurs de saisie. La capacité à relier plusieurs documents entre eux via une base de connaissances sémantique permet également des analyses croisées impossibles avec les approches OCR conventionnelles, ouvrant la voie à des cas d'usage comme l'audit automatisé de contrats ou l'analyse comparative de rapports financiers. Ce lancement s'inscrit dans une course que se livrent les grands fournisseurs cloud, AWS, Microsoft Azure et Google Cloud, pour proposer des pipelines documentaires clé en main à destination des entreprises. AWS positionne BDA comme une réponse directe aux limites des solutions point-à-point qui nécessitaient jusqu'ici d'assembler manuellement des modèles OCR, des LLM et des orchestrateurs distincts. En intégrant l'ensemble dans une API unifiée au sein de Bedrock, Amazon cherche à réduire la friction technique pour les équipes data et à accélérer l'adoption de l'IA générative dans des secteurs très réglementés comme la finance, la santé et le droit. Les prochaines évolutions attendues concernent l'élargissement des formats supportés et le renforcement des capacités d'analyse de graphiques et de visualisations complexes embarqués dans les documents.

UELes entreprises européennes des secteurs réglementés (finance, santé, droit) peuvent adopter BDA via AWS pour automatiser leurs pipelines documentaires, sous réserve de conformité RGPD quant au stockage des données dans les régions AWS européennes.

OutilsOutil
1 source
Pourquoi Microsoft et d'autres clients d'Anthropic ont tardé à adopter Claude Fable
144The Information AI 

Pourquoi Microsoft et d'autres clients d'Anthropic ont tardé à adopter Claude Fable

Lors du lancement de son dernier modèle d'intelligence artificielle Claude Fable, Anthropic a instauré une nouvelle politique de rétention des données : toutes les informations transmises au modèle sont conservées pendant 30 jours. L'objectif affiché est de détecter les usages malveillants ou illégaux. Mais cette décision a un effet secondaire immédiat : les entreprises qui utilisent Fable pour écrire ou modifier du code applicatif confient techniquement leurs données propriétaires à Anthropic pendant un mois. Dans certains cas, ces données sont stockées sur des serveurs cloud distincts de ceux que les clients ont eux-mêmes configurés. Amazon Web Services, qui héberge l'infrastructure d'Anthropic et revend ses modèles à ses propres clients cloud, a officiellement averti ces derniers mardi que "dès lors que vous optez pour la rétention des données, celles-ci quittent le périmètre de données et de sécurité d'AWS." Cette situation freine l'adoption de Fable chez plusieurs grands clients, dont Microsoft. Pourtant, les capacités de codage du modèle sont reconnues comme exceptionnelles, au point qu'Anthropic a pu relever ses tarifs sans perdre la demande. Le problème est fondamentalement de nature juridique et réglementaire : pour des entreprises manipulant du code propriétaire, des secrets industriels ou des données sensibles, accepter qu'un tiers conserve ces informations hors de leur périmètre de contrôle pendant 30 jours représente un risque de conformité inacceptable, notamment au regard des réglementations sectorielles ou des politiques internes de cybersécurité. La tension illustre un défi structurel pour les fournisseurs d'IA générative : plus leurs modèles sont puissants et déployés dans des environnements critiques, plus les exigences de souveraineté des données deviennent contraignantes. Anthropic se retrouve dans une position délicate, devant concilier ses impératifs de sécurité et de surveillance des usages avec les standards de confidentialité attendus par ses clients enterprise. La décision d'AWS de clarifier publiquement les implications de cette politique suggère que la pression des clients institutionnels est déjà forte, et que des aménagements contractuels ou techniques pourraient être négociés dans les semaines à venir.

UELes entreprises européennes utilisant Claude Fable pour du développement logiciel doivent évaluer si la rétention de données pendant 30 jours est compatible avec le RGPD et leurs politiques internes de sécurité.

💬 Fable code apparemment mieux que tout le monde, au point qu'Anthropic peut se permettre de monter ses prix. Mais 30 jours de rétention sur du code propriétaire, c'est le genre de clause que les équipes légales barrent d'un trait rouge sans lire la suite. Reste à voir si Anthropic lâche du lest, parce que se fâcher avec Microsoft et AWS en même temps, c'est pas une stratégie de croissance évidente.

SécuritéOpinion
1 source
☕️ Microsoft bloque Claude Fable 5 en interne à cause de la rétention des données
145Next INpact 

☕️ Microsoft bloque Claude Fable 5 en interne à cause de la rétention des données

Microsoft a intégré Claude Fable 5 d'Anthropic à GitHub Copilot et à sa plateforme Azure Foundry pour le développement d'applications IA, mais a bloqué l'accès au modèle pour ses propres employés dans les versions internes de ces outils. La raison : une politique de rétention des données incompatible avec les exigences internes de l'éditeur. Anthropic conserve en effet les requêtes et les réponses générées par Fable 5 pendant 30 jours, une durée qui peut s'étendre à deux ans en cas de suspicion d'usage malveillant. Ce délai existe parce que Fable 5 repose sur la même architecture que Mythos, le modèle à capacités avancées d'Anthropic, même s'il en est une version bridée : toute question touchant à la cybersécurité, la biologie, la chimie ou la distillation de modèles IA est automatiquement redirigée vers Opus 4.8, plus restreint. Pour les utilisateurs individuels de Claude.ai ou de l'application mobile, cette rétention de 30 jours est déjà la norme et ne change rien. En revanche, pour les entreprises qui accèdent à Claude via la console professionnelle, Amazon Bedrock, Google Cloud Agent ou Foundry avec le mode Zero Data Retention activé, c'est une rupture nette. Ce mode, proposé par Anthropic à certains clients enterprise, garantissait jusqu'ici qu'aucune donnée n'était conservée après traitement. Fable 5 ne supporte plus cette garantie, ce qui expose potentiellement des données sensibles, des informations confidentielles ou des propriétés intellectuelles aux conditions de rétention d'Anthropic. L'équipe juridique de Microsoft évalue actuellement les implications de ce changement, sans calendrier de résolution annoncé. Le cas illustre une tension structurelle croissante dans l'adoption des LLM de pointe par les grandes entreprises : plus les modèles sont puissants et soumis à des exigences de surveillance réglementaire, plus les conditions d'utilisation deviennent contraignantes pour les clients professionnels. D'autres organisations utilisant Fable 5 via ces mêmes canaux pourraient se retrouver dans la même situation que Microsoft, ce qui pourrait freiner l'adoption enterprise du modèle malgré ses performances.

UELes entreprises européennes utilisant Claude Fable 5 via Azure Foundry, Amazon Bedrock ou Google Cloud Agent perdent la garantie Zero Data Retention, créant un risque concret de non-conformité RGPD pour les données professionnelles sensibles.

💬 Le Zero Data Retention, c'était l'argument qui faisait craquer les directions juridiques. Anthropic le retire avec Fable 5 parce que le modèle partage une base avec Mythos et qu'ils veulent surveiller les requêtes sensibles, la logique est là, mais ça va freiner l'adoption enterprise bien plus sûrement que n'importe quel mauvais benchmark. Pour les boîtes européennes qui bossent sous RGPD, c'est pas une friction, c'est un mur.

LLMsOpinion
1 source
Créer un assistant de réparation d'équipements alimenté par l'IA avec Amazon Bedrock AgentCore
146AWS ML Blog 

Créer un assistant de réparation d'équipements alimenté par l'IA avec Amazon Bedrock AgentCore

Amazon Web Services a publié un tutoriel détaillé présentant la construction d'un assistant de réparation d'équipements agricoles propulsé par l'IA, en s'appuyant sur son service Amazon Bedrock AgentCore. L'assistant est conçu pour permettre aux techniciens de terrain de diagnostiquer des pannes de machines lourdes, d'identifier les pièces nécessaires et d'accéder aux procédures de réparation approuvées par les fabricants, le tout via un langage naturel. Techniquement, la solution repose sur plusieurs briques AWS : le runtime AgentCore associé au Strands Agents SDK, le modèle de fondation Amazon Nova 2 Lite pour l'inférence, une Knowledge Base Bedrock pour la génération augmentée par récupération (RAG), et AgentCore Memory pour la persistance des conversations entre sessions. Le frontend React est hébergé sur AWS Amplify, tandis qu'Amazon Cognito gère l'authentification des utilisateurs. Les données de documentation, manuels constructeurs, catalogues de pièces, guides de réparation, sont indexées dans Amazon S3, interrogées via Amazon OpenSearch Serverless pour la recherche vectorielle, avec Amazon Titan Embeddings pour la correspondance sémantique. Les tickets d'intervention sont stockés dans Amazon DynamoDB. La portée concrète de cet outil est significative pour un secteur où chaque heure d'immobilisation d'une machine pendant les récoltes peut se chiffrer en milliers d'euros de pertes. Aujourd'hui, un technicien envoyé sur site sans la bonne pièce doit souvent repartir, revenir, et multiplier les déplacements, allongeant le temps d'arrêt de manière coûteuse. En permettant un diagnostic précis en amont, avec accès instantané aux manuels techniques du fabricant et aux nomenclatures de pièces, l'assistant réduit ce cycle. La mémoire inter-sessions d'AgentCore est particulièrement utile : le technicien peut reprendre une conversation là où il l'avait laissée, sans répéter le contexte de la panne à chaque nouvelle interaction. Cette publication s'inscrit dans la stratégie agressive d'AWS pour imposer Bedrock AgentCore comme plateforme de référence pour le déploiement d'agents IA en production. Lancé en 2025, AgentCore vise à simplifier l'hébergement, la mémoire et l'observabilité des agents, des points de friction majeurs dans les projets IA réels. La concurrence est vive : Vertex AI de Google, Azure AI Foundry de Microsoft, et des frameworks open-source comme LangGraph cherchent tous à capter ce marché. En publiant des cas d'usage sectoriels concrets, ici l'agritech, après d'autres dans la santé ou la finance, AWS tente de démontrer la maturité opérationnelle de sa plateforme face à des besoins métier exigeants. La prochaine étape logique pour ce type de solution serait l'intégration de données IoT temps réel issues des capteurs des machines, pour passer du diagnostic assisté au diagnostic prédictif.

UELes développeurs et entreprises agritech européens peuvent s'appuyer sur ce tutoriel pour construire des assistants de maintenance similaires adaptés au parc de machines agricoles de l'UE.

OutilsOutil
1 source
Premier avis de sinistre automatisé : Strands Agents et Amazon Bedrock AgentCore pour un traitement intelligent des déclarations
147AWS ML Blog 

Premier avis de sinistre automatisé : Strands Agents et Amazon Bedrock AgentCore pour un traitement intelligent des déclarations

Amazon Web Services a présenté un système d'automatisation de la déclaration de sinistre initiale (FNOL, ou "First Notice of Loss") combinant deux de ses technologies : le SDK open source Strands Agents et l'outil Amazon Bedrock AgentCore Browser Tool. Le dispositif s'appuie également sur Amazon Nova Act, un client capable d'interpréter des instructions en langage naturel pour piloter des interfaces web. Concrètement, Nova Act orchestre les interactions avec les portails de gestion de sinistres, ouvrir un dossier non traité, déclencher une analyse d'images, tandis que les agents construits avec Strands Agents appliquent les règles métier propres à l'assurance : interprétation des preuves, corrélation entre différents types de médias, évaluation de la complexité du dossier. Les modèles de fondation sont servis via Amazon Bedrock, et les sessions de navigation sont gérées dans des environnements Chrome isolés, avec enregistrement et visualisation en temps réel pour garantir la traçabilité. L'enjeu est considérable pour les compagnies d'assurance. À chaque déclaration de sinistre, les experts reçoivent un ensemble hétérogène d'informations non structurées : photos prises sur le terrain, vidéos panoramiques des dégâts, documents scannés, notes dictées ou enregistrées. Avant même de pouvoir exercer leur jugement, ils doivent naviguer dans des portails, vérifier l'exhaustivité des pièces justificatives et interpréter manuellement chaque élément. Les estimations sectorielles indiquent que cette phase de validation représente une part significative du temps d'un expert lors du traitement initial d'un dossier. Lors de pics de sinistres, catastrophes naturelles, vagues saisonnières, ces délais s'accumulent, créent des files d'attente et dégradent l'expérience client. Le système proposé délivre aux experts des dossiers pré-analysés, avec les preuves étiquetées et contextualisées, prêts pour la prise de décision plutôt que pour la validation. Cette initiative s'inscrit dans un mouvement plus large d'automatisation des processus assurantiels par l'IA générative, un secteur où les grands acteurs du cloud, AWS, Microsoft Azure, Google Cloud, se livrent une concurrence intense pour conquérir les équipes claims et underwriting. L'approche d'AWS est notable car elle ne cherche pas à remplacer l'expert humain mais à éliminer le travail répétitif d'écran, en préservant la supervision et l'auditabilité. Les données d'intake étiquetées deviennent également un actif opérationnel durable, utilisable pour affiner le routage des dossiers, détecter des patterns de fraude ou améliorer les workflows sur l'ensemble du cycle de vie des sinistres. La prochaine étape naturelle sera l'intégration avec des systèmes de gestion de sinistres existants comme Guidewire ou Duck Creek, où la valeur de l'automatisation multimodale sera pleinement testée à l'échelle.

UELes assureurs européens pourraient adopter ces outils pour automatiser le traitement initial des sinistres, mais la conformité RGPD et la souveraineté des données constituent des obstacles réglementaires à évaluer avant tout déploiement.

OutilsOutil
1 source
IBM et Google Cloud veulent accélérer l’adoption de l’IA dans les entreprises
148Le Big Data 

IBM et Google Cloud veulent accélérer l’adoption de l’IA dans les entreprises

IBM et Google Cloud ont annoncé le 4 juin 2026 une expansion significative de leur partenariat stratégique, avec le lancement d'une Google Cloud Practice dédiée au sein d'IBM Consulting. Cette nouvelle entité regroupe des milliers de consultants IBM certifiés Google Cloud ainsi que des équipes d'ingénierie spécialisées, avec pour mission d'accompagner les grandes organisations dans le déploiement d'agents IA à l'échelle industrielle. Concrètement, les deux groupes combinent la plateforme Gemini Enterprise Agent de Google Cloud avec l'expertise sectorielle d'IBM Consulting pour couvrir huit domaines prioritaires : banque, assurance, administrations publiques, télécommunications, énergie, commerce de détail, cybersécurité et sciences de la vie. Les consultants IBM pourront désormais concevoir, déployer et gérer directement des agents IA sur l'infrastructure Google Cloud, en s'appuyant sur des composants préconfigurés et des méthodologies éprouvées. L'enjeu est de résoudre l'un des blocages les plus coûteux de l'industrie : la difficulté à transformer les projets pilotes en déploiements opérationnels rentables. De nombreuses entreprises ont expérimenté l'IA sans parvenir à en extraire une valeur concrète à grande échelle, faute d'intégration avec les systèmes critiques existants et de garanties suffisantes en matière de gouvernance et de conformité réglementaire. En proposant un cadre commun avec des agents sectoriels préconstruits, IBM et Google entendent réduire drastiquement le délai entre la conception et la mise en production, tout en permettant aux organisations d'automatiser des processus métiers complexes sans multiplier les développements sur mesure. Pour les secteurs fortement réglementés comme la finance ou la santé, la promesse est d'intégrer l'IA aux flux de travail existants tout en respectant les contraintes légales et sécuritaires. Cette initiative s'inscrit dans une tendance de fond qui voit les grands acteurs du cloud et du conseil former des alliances de plus en plus intégrées pour capter le marché de l'IA d'entreprise, estimé à plusieurs milliards de dollars. IBM, qui a repositionné une large partie de sa stratégie autour du conseil en transformation numérique depuis la cession de son activité infrastructure à Kyndryl en 2021, cherche à capitaliser sur sa présence dans les grandes entreprises pour distribuer les technologies de ses partenaires cloud. Google Cloud, de son côté, intensifie la mise en marché de Gemini via des alliances avec des intégrateurs disposant d'une relation de confiance établie avec les directions générales et les DSI. La prochaine étape attendue sera la mise sur le marché effective de ces agents sectoriels et les premiers retours de déploiements en production, qui conditionneront la crédibilité commerciale de cette alliance face à des concurrents comme Microsoft et Accenture ou AWS et Deloitte.

UELes secteurs prioritaires visés, banque, assurance et administrations publiques, sont au cœur de l'économie française et européenne, et ce cadre commun d'agents IA devra se conformer à l'AI Act et au RGPD, ce qui en fait un cas d'usage directement pertinent pour les DSI européens.

💬 Le vrai problème des pilotes IA qui restent des pilotes, IBM et Google s'y attaquent enfin avec du concret. Des milliers de consultants certifiés, des agents préconstruits par secteur, un cadre commun qui évite de tout recoder à chaque client, c'est le genre d'approche qui peut débloquer des grands comptes paralysés depuis deux ans sur les mêmes questions de conformité. Reste à voir ce que ça donne en prod, parce que Microsoft et Accenture ne regardent pas ça les bras croisés.

BusinessOpinion
1 source
Generalist lève 400 millions de dollars pour développer ses modèles d'IA généralistes
149The Robot Report 

Generalist lève 400 millions de dollars pour développer ses modèles d'IA généralistes

Generalist AI Inc. a annoncé une levée de fonds de 400 millions de dollars, portant son financement total à plus de 500 millions depuis sa création en 2024. Le tour a été mené par Radical Ventures, avec de nouveaux entrants incluant 8VC, Union Square Ventures, Hanabi Capital et Norwest, auxquels s'ajoutent les investisseurs historiques NVentures (NVIDIA), Boldstart Ventures, Spark Capital et Bezos Expeditions. Parmi les investisseurs individuels figurent Fei-Fei Li, Eric Yuan (PDG de Zoom), Bin Lin et Naval Ravikant. Basée à San Mateo, en Californie, la startup développe des modèles fondamentaux destinés à des robots généralistes, capables d'opérer sur différentes architectures matérielles. En novembre 2025, elle avait lancé GEN-0, présenté comme le premier modèle à appliquer les lois de mise à l'échelle (scaling laws) à la robotique physique. En avril 2026, elle a publié GEN-1, avec des métriques communiquées par la société elle-même: taux de succès moyen de 99 % sur des tâches où les modèles précédents atteignaient 64 %, vitesse d'exécution environ trois fois supérieure sur des manipulations dextères, et seulement une heure de données robotiques nécessaires par compétence apprise. Ces chiffres, s'ils se confirment en conditions industrielles réelles, représenteraient un changement structurel pour la commercialisation de la robotique généraliste. Le principal verrou du secteur reste logiciel: la plupart des intégrateurs investissent encore des semaines de collecte de données pour chaque nouvelle tâche. Un modèle nécessitant une heure de données par compétence transformerait radicalement l'économie du déploiement. Cela dit, les métriques publiées proviennent exclusivement des communications internes de Generalist AI, sans validation indépendante ni précision sur les conditions de benchmark ou la nature des tâches testées. Le concept de "data flywheel", selon lequel les déploiements chez des clients industriels génèrent les données qui alimentent le modèle suivant, est éprouvé dans le logiciel; sa transposition à la robotique physique, avec ses contraintes de sécurité et de variabilité du monde réel, reste à démontrer à l'échelle. Generalist AI a été fondée en 2024 par Pete Florence (CEO), Andy Zeng (Chief Scientist) et Andrew Barry (CTO), trois chercheurs issus des milieux académiques et industriels de la robotique. La startup s'inscrit dans un marché en forte compétition: Physical Intelligence avec son modèle Pi-0, Figure AI avec le Figure 03, Boston Dynamics, Apptronik et 1X Technologies ciblent tous le même segment des modèles d'IA généralistes pour robots physiques. En Europe, Enchanted Tools et Wandercraft progressent sur des verticales plus ciblées. Avec cette levée, Generalist AI prévoit d'accélérer le développement de modèles de nouvelle génération, d'étendre son infrastructure d'entraînement et de renforcer son moteur de collecte de données physiques. La prochaine étape observable sera la documentation de déploiements industriels concrets chez des clients identifiés, seul critère qui permettra de distinguer les performances en laboratoire de la viabilité commerciale annoncée.

UELa montée en puissance de Generalist AI accentue la pression concurrentielle sur les acteurs européens comme Enchanted Tools et Wandercraft, dont les verticales ciblées et les capacités de financement ne sont pas comparables aux 500 M$ levés par cette startup américaine en moins de deux ans.

💬 500 millions en deux ans, c'est du sérieux. Ce qui m'intéresse vraiment, c'est pas le chèque, c'est cette histoire d'une heure de données par compétence apprise (contre des semaines pour les intégrateurs actuels). Si ça tient en conditions industrielles, tu changes complètement l'économie du déploiement robotique, mais tous les chiffres sortent de chez eux sans validation externe, donc faut voir les premiers clients réels avant de s'emballer.

BusinessOpinion
1 source
Amazon déploie son assistant shopping IA chez les enseignes, dont Kate Spade
150AI News 

Amazon déploie son assistant shopping IA chez les enseignes, dont Kate Spade

Amazon commercialise désormais sa technologie d'assistant shopping par intelligence artificielle auprès d'autres enseignes de distribution, via un nouvel outil baptisé Agentic Shopping Assistant, construit sur AWS. Kate Spade, filiale du groupe Tapestry, figure parmi les premiers retailers à l'adopter, en déployant un "AI Gift Concierge" capable de guider les clients dans leurs achats cadeaux via une interface conversationnelle. Selon Amazon, plus de 300 millions de clients ont utilisé son propre assistant shopping l'année dernière, générant près de 12 milliards de dollars de ventes incrémentales. La société affirme que les enseignes peuvent déployer ces agents conversationnels "en quelques semaines" plutôt qu'en plusieurs années si elles partaient de zéro. L'offre comprend une architecture technique, du code prêt à l'emploi, et un accompagnement par des experts AWS et des intégrateurs partenaires. Le système repose sur Amazon Bedrock pour les applications d'IA générative, AgentCore pour l'orchestration des agents, et OpenSearch pour la recherche et la récupération de données. L'enjeu commercial est significatif : Amazon indique que les sessions de shopping conversationnel génèrent des taux de conversion 3,5 fois supérieurs aux recherches traditionnelles par mots-clés. Pour Kate Spade, l'assistant cible précisément le moment d'achat cadeau, un contexte que 53 % des consommateurs jugent stressant selon les données internes d'Amazon. Fabio Luzzi, directeur des données et de l'analytique chez Tapestry, a expliqué que l'outil est né d'une écoute directe des consommateurs. Le groupe a testé l'assistant pendant environ deux mois et demi avant de le rendre accessible au grand public. En offrant cette technologie clé en main à d'autres retailers, Amazon transforme ses infrastructures IA en service commercial à part entière, potentiellement accessible à n'importe quelle marque dotée d'un budget AWS. Ce lancement s'inscrit dans une accélération plus large de la stratégie IA d'Amazon. En mai 2026, la société avait déjà déployé Alexa for Shopping aux États-Unis, permettant aux utilisateurs de poser des questions d'achat directement dans la barre de recherche Amazon et d'obtenir des réponses conversationnelles. Cette fonctionnalité fusionne Rufus, l'assistant shopping lancé en 2024, et Alexa+. En externalisant cette technologie via AWS, Amazon cherche à s'imposer comme la couche d'infrastructure IA du commerce en ligne mondial, face à des concurrents comme Google Shopping ou les solutions propres développées par de grands retailers. La question centrale pour l'industrie est désormais de savoir si ce modèle d'assistant conversationnel deviendra la norme d'expérience d'achat en ligne, et dans quelle mesure Amazon captera une part des transactions réalisées sur des sites tiers.

UELes enseignes de distribution françaises et européennes peuvent désormais déployer des assistants shopping conversationnels clé en main via cette offre AWS, sans investissement pluriannuel en R&D propriétaire.

💬 Le playbook AWS, version shopping : tu bâtis une infra pour toi, ça marche, tu la revends à tout le monde. Les 3,5x de conversion, bon, c'est Amazon qui le dit, mais même à moitié ça reste sérieux. Kate Spade c'est juste le logo de lancement, dans six mois c'est la moitié du retail mondial qui tourne sur un agent Bedrock sans le savoir.

OutilsOutil
1 source