Aller au contenu principal

Dossier Agents IA — page 11

1829 articles · page 11 sur 37

Les agents IA : déploiements en production, écart pilote/prod, débat sur la confiance, agent debt et négociations automatisées.

501Apple Machine Learning RecherchePaper

Quantification de l'incertitude pour l'appel de fonctions dans les LLM

Les modèles de langage (LLM) sont de plus en plus déployés pour accomplir de manière autonome des tâches concrètes, notamment grâce au paradigme dit du "function calling", qui leur permet d'appeler des outils externes pour agir sur le monde réel. Ce mécanisme est aujourd'hui largement utilisé pour doter les LLM de capacités d'usage d'outils, que ce soit pour interroger une base de données, exécuter du code ou déclencher une action dans une application tierce. Le problème soulevé par des chercheurs est qu'un appel de fonction incorrect peut avoir des conséquences graves, en particulier lorsque l'action déclenchée est irréversible, comme un virement bancaire ou la suppression de données. Face à ce risque, les auteurs proposent d'évaluer la confiance du modèle dans la justesse d'un appel de fonction avant même de l'exécuter, via des méthodes de quantification de l'incertitude, ou "Uncertainty Quantification" (UQ). Cette approche change la donne pour les entreprises qui intègrent des agents IA autonomes dans leurs systèmes de production. Plutôt que de laisser un modèle exécuter aveuglément chaque action qu'il génère, la quantification de l'incertitude permettrait de détecter en amont les appels de fonction douteux et de les soumettre à une validation humaine ou de les bloquer purement et simplement. Pour les secteurs sensibles comme la finance, la santé ou la gestion de données critiques, ce type de garde-fou pourrait devenir un prérequis avant tout déploiement à grande échelle d'agents capables d'agir sans supervision constante. Cette recherche s'inscrit dans un mouvement plus large de la communauté IA visant à rendre les agents autonomes plus fiables et plus sûrs, alors que leur adoption s'accélère dans les entreprises. Les mécanismes de function calling, bien que puissants, restent une source de fragilité: un modèle peut mal interpréter une requête, halluciner des paramètres ou choisir le mauvais outil. En couplant ces systèmes à des méthodes de quantification de l'incertitude, les chercheurs espèrent ouvrir la voie à des agents capables d'évaluer eux-mêmes leur propre fiabilité, une étape jugée essentielle avant de leur confier des tâches à fort enjeu.

1 source
502NVIDIA AI Blog 

Nemotron Labs : comment les modèles ouverts donnent aux entreprises et aux États une IA fiable, maîtrisable et personnalisable

Traduction résumée de l'article : NVIDIA a publié un nouveau billet dans sa série de blog Nemotron Labs, consacrée à sa famille de modèles ouverts Nemotron. Le texte détaille comment plusieurs entreprises ont déjà personnalisé ces modèles pour des usages métiers précis. Abridge construit ainsi le premier modèle de fondation conçu spécifiquement pour les conversations cliniques. Glean a développé Waldo, un modèle de recherche agentique qui combine Nemotron avec des modèles fermés plus volumineux pour offrir une recherche d'entreprise à latence réduite et avec moins de tokens consommés. H Company a créé Holotron 3 Nano en post-entraînant Nemotron 3 Nano Omni sur des données propriétaires d'utilisation d'ordinateur, atteignant plus de 76% de précision sur OSWorld-Verified, un benchmark de référence pour les tâches informatiques, tout en égalant les modèles fermés les plus avancés pour une fraction du coût. Harvey a de son côté post-entraîné Nemotron 3 Ultra sur son propre benchmark juridique et obtenu une précision de niveau frontière, équivalente aux meilleurs modèles fermés sur des tâches juridiques complexes, avec un coût par exécution au moins dix fois inférieur. Heidi Health atteint des résultats comparables aux modèles de pointe en documentation clinique sans recourir à une puissance de calcul massive, tandis que YTL AI Labs a adapté un modèle Nemotron à la langue malaisienne pour la communauté de développeurs du pays. L'enjeu central mis en avant par NVIDIA est celui du contrôle et de la confiance. Contrairement aux modèles fermés, dont l'accès reste limité à une interface d'utilisation, les modèles ouverts permettent aux entreprises d'inspecter leur fonctionnement, de les évaluer selon leurs propres critères métier et de les affiner sans faire transiter leurs données sensibles par un tiers. Cet avantage est particulièrement décisif dans des secteurs comme la santé ou le droit, où une erreur peut avoir des conséquences lourdes et où les exigences de traçabilité et de conformité sont strictes. Pour ces industries, pouvoir auditer l'entraînement d'un modèle et le corriger devient un critère aussi important que sa performance brute. Cette approche s'inscrit dans une tendance plus large où l'avantage compétitif en IA ne dépend plus seulement du choix d'un modèle, mais de la manière dont il est adapté et intégré. NVIDIA promeut une architecture hybride où des modèles ouverts comme Nemotron gèrent des tâches spécialisées aux côtés de modèles fermés plus puissants chargés du raisonnement complexe, une répartition qui permet d'optimiser les coûts d'inférence tout en conservant de la flexibilité. L'exemple malaisien avec YTL AI Labs illustre par ailleurs un enjeu de souveraineté numérique, montrant comment des nations peuvent s'approprier des capacités d'IA adaptées à leur langue et à leur contexte local plutôt que de dépendre entièrement de fournisseurs étrangers.

LLMsActu
1 source
503MarkTechPost 

Le fil autonome des agents pour VideoAgent : analyse d'intention, planification par graphe et routage d'outils pour le montage vidéo

Voici un article de type MarkTechPost décrivant un tutoriel de construction d'un système multi-agents pour l'édition vidéo automatisée. Je le résume selon vos consignes. Un tutoriel technique publié récemment détaille la reconstruction complète d'un système multi-agents inspiré de VideoAgent, conçu pour comprendre, indexer, éditer et remonter des vidéos à partir d'instructions en langage naturel. L'architecture repose sur plusieurs modules assemblés en pipeline: un parseur d'intentions qui interprète les requêtes de l'utilisateur, une bibliothèque d'agents spécialisés, un routeur d'outils, un planificateur sous forme de graphe d'exécution, et un optimiseur dit "à gradient textuel" capable de détecter et réparer automatiquement les dépendances manquantes dans ce graphe. Ces composants pilotent des outils concrets de traitement vidéo: FFmpeg pour le montage, la transcription par Whisper, la détection de scènes, l'échantillonnage d'images clés, le sous-titrage automatique, l'indexation cross-modale, la recherche par similarité, le découpage de séquences et le montage synchronisé sur le rythme musical. Le système peut fonctionner sans clé API grâce à une couche d'abstraction (classe LLM) compatible avec plusieurs fournisseurs, dont OpenAI, DeepSeek, Anthropic et Google Gemini, avec des modèles par défaut comme gpt-4o-mini ou claude-3-5-sonnet-latest. La configuration prévoit notamment quatre "prises" maximum par tâche (maxshots) et quatre cycles d'optimisation (optrounds), avec quatre scénarios de démonstration: réponse à des questions sur une vidéo, génération de résumé, production d'un aperçu façon reportage d'actualité et montage synchronisé. L'intérêt de cette démarche dépasse le simple exercice pédagogique: elle offre aux développeurs et chercheurs un modèle reproductible pour construire des agents IA capables de raisonner sur du contenu vidéo de bout en bout, sans dépendre d'un service cloud propriétaire unique. Pour les créateurs de contenu, les rédactions ou les équipes marketing, ce type de système pourrait automatiser des tâches aujourd'hui chronophages comme le dérushage, la génération de résumés vidéo ou le montage calé sur la musique, réduisant le temps de production tout en conservant un contrôle par instructions textuelles simples. Ce projet s'inscrit dans une tendance plus large de l'IA appliquée à la vidéo, où les architectures multi-agents et les graphes de planification remplacent progressivement les pipelines rigides à étape unique. La capacité à réparer automatiquement un graphe d'exécution incomplet, via l'optimisation par gradient textuel, illustre une recherche active sur la robustesse des systèmes agentiques face à des instructions ambiguës. Combiné à des briques désormais matures comme Whisper pour la transcription ou les modèles d'embeddings pour la recherche cross-modale, ce type d'architecture ouvre la voie à des outils d'édition vidéo pilotés entièrement par le langage naturel, accessibles à des équipes ne disposant pas de compétences en montage traditionnel.

OutilsTuto
1 source
504Le Big Data 

Déployer Claude en entreprise : les 5 étapes indispensables pour réussir un projet d’IA

Annoncé le 12 juillet, le partenariat entre LTM et Anthropic vise à accélérer l'adoption de Claude, Claude Code et Claude Cowork au sein des grandes entreprises. LTM prévoit d'intégrer ces outils à sa plateforme BlueVerse pour couvrir plusieurs usages : développement logiciel, modernisation d'applications existantes, orchestration d'agents IA, supervision d'infrastructures et ingénierie de la fiabilité (SRE). Au delà de la simple mise à disposition du modèle, les deux entreprises annoncent la création d'un centre d'excellence dédié à Claude, chargé d'encadrer l'utilisation responsable des modèles, le cycle de vie des agents IA ainsi que les exigences de confidentialité et de résidence des données. LTM cible en priorité des secteurs réglementés comme la banque, la finance et l'assurance, où ces garanties de gouvernance sont particulièrement sensibles. Le partenariat s'accompagne d'un accompagnement technique et d'un volet formation des équipes, pensé pour transformer des expérimentations ponctuelles en déploiements à grande échelle. Cette annonce illustre un changement de posture chez les fournisseurs de modèles de langage, qui ne se contentent plus de vendre un accès à leur IA mais s'appuient sur des partenaires capables d'en industrialiser l'usage. Pour les entreprises, le message est clair : la valeur d'un modèle comme Claude ne se révèle pleinement que lorsqu'il est connecté aux données internes, intégré aux applications déjà en place et encadré par une gouvernance solide. Un usage limité à l'interface web, où chaque collaborateur rédige ou résume du contenu de son côté, produit des gains individuels mais reste sans effet réel sur les processus métiers. À l'inverse, une intégration aux systèmes CRM, ERP ou aux bases documentaires permet de générer une valeur mesurable, à condition d'y consacrer des ressources d'intégration, de sécurité et de compétences internes durables. Ce constat rejoint une tendance plus large observée depuis l'essor des grands modèles de langage : le goulot d'étranglement des projets d'IA en entreprise ne se situe plus dans la performance technique des modèles, mais dans leur capacité à s'insérer dans des environnements informatiques hétérogènes et fortement réglementés. LTM et Anthropic proposent une méthode en plusieurs étapes, qui commence par l'identification des cas d'usage à fort retour sur investissement, comme l'assistance au développement avec Claude Code ou l'accélération du support client, avant de passer à la connexion aux outils existants puis à la mise en place d'une gouvernance formelle. D'autres acteurs du cloud et de l'intégration, confrontés au même défi de passage à l'échelle, pourraient s'inspirer de ce modèle pour structurer leurs propres offres autour des IA génératives dans les mois à venir.

UELTM prévoit de déployer Claude via sa plateforme BlueVerse auprès d'entreprises françaises des secteurs réglementés (banque, finance, assurance), avec un centre d'excellence dédié à la gouvernance et à la résidence des données.

💬 LTM et Anthropic viennent de dire tout haut ce que tout le monde savait déjà : le goulot d'étranglement de l'IA en entreprise, c'est plus le modèle, c'est l'intégration aux vieux systèmes et la paperasse de conformité. Un centre d'excellence dédié à la gouvernance, sur le papier ça fait sérieux, surtout pour la banque et l'assurance qui ne signent rien sans ces garanties. Reste à voir si ça tient en prod une fois que les équipes internes doivent vraiment mettre les mains dans le CRM.

BusinessActu
1 source
505AWS ML Blog 

Nemotron 3 : affinement des modèles NVIDIA avec la personnalisation serverless d'Amazon SageMaker AI

Amazon vient d'annoncer l'intégration de la personnalisation de modèles serverless pour les modèles NVIDIA Nemotron 3 au sein d'Amazon SageMaker AI. Deux versions sont concernées: Nemotron 3 Nano, qui compte 30 milliards de paramètres au total dont 3 milliards actifs, et Nemotron 3 Super, plus imposant avec 120 milliards de paramètres au total dont 12 milliards actifs. Les entreprises peuvent désormais affiner ces modèles open-weight via trois techniques disponibles sans avoir à provisionner ni gérer la moindre infrastructure: le fine-tuning supervisé classique (SFT), l'apprentissage par renforcement avec récompenses vérifiables (RLVR), et l'apprentissage par renforcement avec retour d'IA (RLAIF). Nemotron 3 repose sur une architecture hybride combinant Mamba et Transformer sous forme de mélange d'experts (MoE), capable de gérer des contextes allant jusqu'à un million de tokens. Elle entrelace trois types de couches complémentaires: des couches Mamba-2 pour un traitement séquentiel rapide en temps linéaire, des couches d'attention Transformer pour un rappel associatif précis, et des couches de mélange d'experts latent qui compressent les tokens avant de les router vers des experts spécialisés. Résultat, seule une fraction des paramètres totaux est activée à chaque passage, comme les 12 milliards sur 120 pour la version Super, ce qui garantit un débit élevé à moindre coût de calcul. Pour les entreprises, affiner un modèle sur leurs propres données ne relève plus seulement de l'optimisation technique: cela revient à créer une propriété intellectuelle propriétaire, encodant leur savoir-faire, leur vocabulaire métier et leur ton de marque directement dans l'architecture du modèle. Cette approche permet souvent à des modèles plus petits et ouverts d'égaler, voire de dépasser, les performances de modèles propriétaires bien plus volumineux, tout en gardant les données sensibles dans une infrastructure privée et sécurisée. Pour les charges de travail à fort volume impliquant plusieurs agents, comme le codage ou le triage de cybersécurité, ce type d'avantage devient un facteur de compétitivité difficile à répliquer avec des modèles génériques du marché. Les deux modèles ont été entraînés via NeMo Gym, un système d'apprentissage par renforcement multi-environnements qui les aligne sur des tâches agentiques réelles en plusieurs étapes, couvrant le codage, le raisonnement et l'analyse de contextes longs. Nemotron 3 Nano affiche un débit quatre fois supérieur à son prédécesseur Nemotron 2 Nano, le rendant particulièrement adapté aux charges de travail multi-agents à fort volume où coût et latence sont critiques. Nemotron 3 Super, de son côté, cible les applications multi-agents complexes comme le développement logiciel, misant sur une capacité de raisonnement accrue tout en conservant une efficacité de calcul élevée.

UELes entreprises europeennes utilisant Amazon SageMaker AI pourront acceder a cette nouvelle capacite de personnalisation serverless, sans impact reglementaire ou sectoriel direct sur la France ou l'UE.

💬 Nemotron 3 Super fait tourner 12 milliards de paramètres actifs sur 120 et bat des modèles bien plus gros, c'est la confirmation qu'on n'a plus besoin de mastodontes pour du raisonnement agentique sérieux. Ce qui change vraiment, c'est le fine-tuning serverless : plus de cluster GPU à gérer, tu balances tes données et Amazon fait le reste. Reste que la vraie valeur, ce n'est plus le modèle en lui-même, c'est ce que t'y injectes, ton vocabulaire métier, ton ton de marque, tes données propriétaires. Pour du codage ou du triage cyber à gros volume, ça devient un avantage concurrentiel qu'un modèle générique ne rattrapera pas.

OutilsActu
1 source
506AWS ML Blog 

Le Fil IA développe une couche sémantique pour l'IA à base d'agents sur AWS avec Stardog et Amazon Bedrock AgentCore

AWS et Stardog ont présenté une architecture technique permettant de déployer une couche sémantique pour des agents d'intelligence artificielle directement sur les infrastructures cloud d'Amazon, sans extraction, transformation ni chargement de données (ETL). Le dispositif repose sur l'application Semantic AI de Stardog, connectée simultanément à Amazon Aurora et Amazon Redshift, et pilotée par un agent Strands Agents hébergé sur Amazon Bedrock AgentCore. Concrètement, cet agent peut répondre à des questions dites de « vision client à 360 degrés » en interrogeant les deux bases de données en même temps, sans qu'un ingénieur ait besoin de dupliquer ou de fusionner préalablement les données. Le même déploiement Stardog fonctionne aussi derrière d'autres services de calcul AWS, comme Amazon EKS, Amazon ECS ou AWS Lambda. Le choix d'AgentCore s'explique par le fait que ce service regroupe en une seule solution gérée l'authentification des accès entrants, l'hébergement de l'agent et la gestion des identifiants pour les outils tiers. Cette annonce s'inscrit dans un mouvement plus large que les auteurs appellent « l'analytique agentique », prolongement logique de vingt ans d'évolution des outils décisionnels, des rapports programmés aux tableaux de bord, puis au libre-service analytique. Jusqu'ici, même les outils en libre-service dépendaient d'un modèle de données déjà construit par un ingénieur, l'analyste humain restant le point de passage obligé pour toute question sortant du cadre prévu. Les agents génératifs promettent de lever ce goulot d'étranglement en raisonnant directement sur les données en temps réel, en écrivant leurs propres requêtes et en les affinant de manière autonome. Pour les entreprises, l'enjeu est direct : accélérer l'accès à une réponse fiable sans multiplier les développements sur mesure, tout en évitant le piège des réponses incohérentes lorsque deux agents interrogent des sources différentes pour la même question métier. Le véritable obstacle, selon AWS, n'est plus la capacité des modèles de fondation disponibles sur Bedrock à planifier des tâches complexes ou à générer du SQL, mais la fragmentation des données d'entreprise elles-mêmes. Un « client » n'a souvent pas la même définition dans un système de gestion de la relation client (CRM) que dans un système de facturation, tout comme le « chiffre d'affaires » peut varier selon l'équipe qui le calcule. Sur AWS, ces données sont réparties entre Aurora et les bases RDS pour les données opérationnelles, Redshift pour l'historique analytique, et S3 combiné à Athena pour les données non structurées, notamment via des formats ouverts comme Apache Iceberg. La génération augmentée par récupération (RAG), utilisée via Amazon Bedrock Knowledge Bases, fonctionne bien pour retrouver des passages de texte, mais s'avère insuffisante dès qu'une question exige de croiser des enregistrements entre systèmes tout en respectant des règles métier et des politiques d'accès aux données, d'où l'intérêt d'une couche sémantique dédiée.

💬 Le vrai sujet, c'est pas AWS ni Stardog, c'est la fragmentation des données d'entreprise. Un agent qui écrit du SQL tout seul, on sait déjà faire. Un agent qui sait que "client" veut pas dire la même chose dans le CRM et dans la facturation, c'est ça le boulot, et c'est là que ça coince depuis toujours. Bon, sur le papier c'est élégant : zéro ETL, une couche sémantique qui interroge Aurora et Redshift en même temps. Reste à voir si ça tient quand deux agents posent la même question métier et sortent deux réponses différentes, parce que c'est exactement le piège que ce genre d'archi est censé éviter.

OutilsActu
1 source
507Ars Technica AI 

OpenAI veut que son nouvel outil travaille pour vous et avec vous

OpenAI lance ChatGPT Work, un nouvel outil pensé pour mener des tâches complexes de bout en bout, sans intervention constante de l'utilisateur. L'an dernier, lors des premiers tests du mode Agent intégré au navigateur Atlas d'OpenAI, plusieurs tâches automatisées s'interrompaient après quelques minutes seulement, ce qui limitait fortement leur utilité pour des projets longs ou complexes. Avec le lancement de ChatGPT Work, l'entreprise affirme avoir résolu ce problème : l'outil peut désormais rester actif sur un projet pendant des heures si nécessaire et transformer un objectif en travail achevé. OpenAI invite les utilisateurs à tester la fonctionnalité en lui confiant une tâche qu'ils maîtrisent déjà bien, comme l'analyse d'un budget ou la préparation d'une réunion commerciale. L'entreprise promet également que ChatGPT Work peut automatiser des workflows entiers, en partant par exemple d'une recherche sur des clients pour aboutir à un brief de campagne, puis à des supports marketing adaptés localement. Cette avancée répond à une limite concrète qui freinait jusqu'ici l'adoption des agents IA en entreprise : leur incapacité à tenir la durée sur des tâches multi-étapes. En conservant un garde-fou humain, à savoir l'attente d'une approbation pour les actions jugées importantes, OpenAI cherche à rassurer les professionnels sur la fiabilité et la sécurité de la délégation à une IA, un enjeu central pour l'adoption en contexte de travail. L'outil s'inscrit dans la continuité du navigateur Atlas et de sa fonction Agent Mode, tout en intégrant les Scheduled Tasks, une version renforcée des tâches planifiées façon cron. Ces tâches récurrentes peuvent se déclencher selon un horaire fixe ou dès qu'un événement surveillé se produit, et continuer de s'exécuter même lorsque l'utilisateur est absent de son poste, avec un suivi possible depuis un smartphone. Ce lancement place OpenAI en concurrence directe avec les autres acteurs qui développent des agents capables d'automatiser des workflows professionnels complets.

💬 Fini le mode agent qui lâche au bout de dix minutes, là ils promettent des heures d'autonomie sur un vrai projet. Le vrai enjeu c'est pas la durée, c'est le garde-fou humain avant chaque action qui compte : sans ça, aucune boîte ne va déléguer un budget ou un brief client à une IA, quelle que soit sa patience. Reste à voir si ça tient sur un dossier chiant du quotidien, pas sur la démo calibrée d'OpenAI.

OutilsOutil
1 source
508Apple Machine Learning 

Recherche linguistique récursive face à l'incertitude : l'efficacité surprenante de la recherche de programmes auto-réflexifs pour le contexte long

Les modèles de langage peinent encore à exploiter fiablement de très longs contextes, même quand leur fenêtre de contexte s'étend sur des dizaines ou centaines de milliers de tokens : ils échoient souvent à extraire, relier et réutiliser correctement les informations disséminées dans ces textes. Une approche récente, les Recursive Language Models (RLM), tente de contourner ce problème en décomposant le contexte long en une série de sous-requêtes traitées de façon agentique, via des programmes générés et exécutés au moment de l'inférence. Un article de recherche s'attaque ici à une question restée jusque-là dans l'angle mort de cette méthode : comment sélectionner, parmi les multiples trajectoires possibles de programmes d'interaction avec le contexte, celle qui donnera le meilleur résultat. Les auteurs montrent que la performance des RLM dépend de façon critique de ce choix, et proposent une méthode de recherche de programme auto-réflexive fondée sur l'incertitude du modèle pour guider cette sélection. Cette question compte parce que les RLM sont présentés comme une piste sérieuse pour traiter des documents, bases de code ou historiques de conversation trop volumineux pour tenir dans une fenêtre de contexte classique, sans perte de précision. Si la qualité de la trajectoire de sous-requêtes choisie détermine la fiabilité finale des réponses, alors optimiser ce mécanisme de sélection devient un levier direct pour rendre ces systèmes utilisables en production, par exemple pour l'analyse de contrats juridiques, de logs techniques ou de vastes corpus de recherche, là où une mauvaise décomposition du contexte peut aujourd'hui faire échouer toute la chaîne de raisonnement. Le travail s'inscrit dans une dynamique plus large de recherche sur les architectures agentiques appliquées au traitement de contexte long, où plusieurs équipes explorent des stratégies de découpage, de résumé récursif ou d'appel d'outils pour pallier les limites structurelles des transformeurs sur les séquences très longues. En mettant l'incertitude du modèle au cœur du processus de sélection de programme, les auteurs ouvrent une piste pour rendre ces systèmes plus robustes et plus autonomes, avec des implications potentielles pour la conception future d'agents capables de gérer des tâches de recherche et d'analyse documentaire complexes sans supervision humaine constante.

RecherchePaper
1 source
Les innovateurs de l'IA adoptent NVIDIA Vera : l'importance du CPU mono-thread maximal à grande échelle
509NVIDIA AI Blog 

Les innovateurs de l'IA adoptent NVIDIA Vera : l'importance du CPU mono-thread maximal à grande échelle

Nvidia vient de présenter Vera, une puce qui inaugure une nouvelle catégorie de processeurs pensée spécifiquement pour l'ère de l'IA agentique : les CPU à performance monofil maximale à grande échelle. Dans le fonctionnement d'un système agentique, le CPU se trouve sur le chemin critique de chaque étape de raisonnement : c'est lui qui exécute les appels d'outils, le code, le traitement des données, la gestion du cache KV et l'analyse des résultats produits par le modèle. Or les processeurs de data center actuels n'ont pas été conçus pour ce rôle. Poussés par l'essor du cloud, les fabricants ont privilégié l'augmentation du nombre de cœurs par puce afin de réduire le coût par cœur louable, au détriment de la vitesse de chaque cœur pris individuellement. Le passage aux architectures en chiplets a aggravé le problème en introduisant ce que Nvidia appelle une "taxe chiplet" : chaque cœur perd l'accès à la pleine bande passante mémoire de la puce. Vera est présentée comme une réponse directe à ces limites, avec une architecture qui privilégie la vitesse par cœur, une bande passante mémoire suffisante par cœur et une latence prévisible. Cette approche change directement l'équation économique des usines à IA. Dans ces infrastructures, le GPU reste la ressource la plus coûteuse et la plus rare : chaque seconde où un GPU attend qu'un CPU termine une tâche annexe (exécution d'un outil, traitement d'une donnée) réduit son taux d'utilisation et, in fine, le revenu généré par l'installation. Pour un agent IA, qui fonctionne en boucle continue (le modèle raisonne, le CPU exécute, le résultat revient, le modèle décide de l'étape suivante), la vitesse d'exécution de chaque étape détermine la cadence de toute la chaîne, puisque chaque action dépend du résultat de la précédente. Ajouter davantage de cœurs augmente le débit global de tâches traitées en parallèle, mais ne réduit en rien le temps nécessaire à l'exécution d'une seule étape dans une seule boucle d'agent : c'est la performance individuelle de chaque cœur, et non leur nombre, qui fixe la vitesse réelle perçue par l'agent. Ce constat marque une rupture avec la trajectoire suivie par l'industrie du semi-conducteur depuis une décennie, où l'optimisation du coût par cœur avait pris le pas sur la performance brute, notamment pour servir des charges de travail traditionnelles, ponctuelles et pilotées par des utilisateurs humains. Les charges agentiques, elles, sont permanentes et massivement parallèles, avec des essaims d'agents qui tournent en continu à travers des chaînes d'étapes interdépendantes. En misant sur Vera, Nvidia cherche à repositionner le CPU comme un composant aussi stratégique que le GPU dans la conception des futures usines à IA, alors que la concurrence entre fabricants de puces pour l'infrastructure agentique s'intensifie.

💬 Nvidia vient de comprendre un truc que tout le monde avait loupé : dans une boucle d'agent, c'est le CPU qui fixe la cadence, pas le GPU. On a passé dix ans à optimiser le coût par cœur pour du cloud classique, et là on découvre que ça pénalise justement les charges agentiques qui tournent en continu. Selon Le Fil IA, la vraie bataille de l'infra IA en 2026 ne se joue plus seulement sur la puissance GPU mais sur la vitesse mono-thread du CPU qui l'alimente.

InfrastructureActu
1 source
Ce que des milliards de prédictions IA ont appris à Expedia avant l'ère des agents autonomes
510VentureBeat AI 

Ce que des milliards de prédictions IA ont appris à Expedia avant l'ère des agents autonomes

Expedia a publié ses principes directeurs pour l'intelligence artificielle et le machine learning, fruit de plusieurs années d'application de ces technologies sur l'ensemble du parcours voyageur : personnalisation, classement des résultats, recommandations, prévention de la fraude, support client et, plus récemment, expériences d'IA générative et agentique. L'entreprise a mis en place des "Agentic Release tollgates", des points de contrôle recommandés et parfois obligatoires avant le lancement de toute fonctionnalité d'IA agentique. Ces contrôles couvrent la définition claire des responsabilités, une gouvernance fondée sur le risque, l'évaluation systématique, le déploiement progressif et la surveillance continue. Une partie de ces exigences est déjà automatisée et intégrée directement dans le cycle de développement logiciel de l'entreprise. Parmi les règles concrètes annoncées : chaque modèle doit être relié à un indicateur d'impact business ou d'expérience voyageur précis, la complexité technique doit être justifiée face à une base de référence solide (modèle générique existant, heuristique simple ou solution prête à l'emploi), et aucun modèle ne peut être déployé à grande échelle sur la seule base de tests hors ligne : une évaluation en conditions réelles est systématiquement exigée en complément. Cette démarche traduit une préoccupation centrale pour les grandes entreprises qui déploient de l'IA à grande échelle : la différence entre une IA qui fonctionne ponctuellement et une IA qui tient dans la durée. À mesure que les systèmes passent de la simple prédiction à la conversation, au raisonnement, puis à l'action autonome au nom des utilisateurs, les attentes en matière de fiabilité, de gouvernance et de responsabilité changent radicalement de nature. Un agent IA qui réserve un vol ou modifie un itinéraire pour un client n'a pas le même niveau d'exigence qu'un simple algorithme de recommandation : une erreur a des conséquences directes et tangibles pour le voyageur. Pour l'industrie du voyage comme pour d'autres secteurs déployant des agents autonomes, ce cadre illustre une tendance de fond : les entreprises cherchent désormais à documenter et standardiser la gouvernance de l'IA avant que les régulateurs ne l'imposent, et à s'assurer que la vitesse de déploiement ne se fasse pas au détriment de la robustesse des systèmes. Le contexte plus large est celui d'un secteur technologique où la publication de principes reste souvent un exercice de communication sans traduction opérationnelle réelle. Expedia insiste précisément sur ce point : l'essentiel n'est pas d'énoncer des valeurs, mais de les transformer en mécanismes concrets, outils, exigences de release et processus que les équipes utilisent réellement au quotidien. L'entreprise mise sur des fondations partagées à l'échelle de l'organisation, plutôt que des piles technologiques isolées par équipe, pour que les améliorations d'un socle commun bénéficient à l'ensemble des cas d'usage. Cette approche s'inscrit dans un mouvement plus vaste des grandes plateformes numériques qui, face à la multiplication des agents IA autonomes, cherchent à concilier vitesse d'innovation et discipline d'ingénierie, un équilibre dont dépendra la confiance des utilisateurs dans les systèmes capables d'agir directement en leur nom.

💬 Enfin une boîte qui documente ses garde-fous avant de lâcher des agents autonomes sur des vraies réservations, plutôt que d'attendre l'accident pour y penser. Le détail qui compte : interdiction de déployer un modèle sur la seule base de tests hors ligne, il faut du réel derrière. Ça vaut le coup de le noter, parce que la différence entre une IA qui recommande un hôtel et une IA qui réserve à ta place, c'est exactement la marge d'erreur qu'on est prêts à tolérer, et là on parle carrément de zéro.

OutilsActu
1 source
La Chine encadre les IA compagnons : ce que Pékin vise réellement
511AI News 

La Chine encadre les IA compagnons : ce que Pékin vise réellement

La Chine a introduit un nouveau cadre réglementaire encadrant les compagnons IA, qui entrera en vigueur le 15 juillet 2026. Baptisé « Mesures provisoires pour la gestion des services interactifs anthropomorphiques par IA », ce texte a été publié conjointement le 10 avril 2026 par la Cyberspace Administration of China et quatre autres agences, dont la Commission nationale pour le développement et la réforme et le ministère de l'Industrie et des Technologies de l'information. Dans les jours précédant cette échéance, les deux applications d'IA grand public les plus utilisées du pays ont discrètement désactivé leurs fonctionnalités phares. Doubao, développée par ByteDance, a annoncé que sa fonction d'agent cesserait de fonctionner le 15 juillet, invoquant des « ajustements de fonctionnalités produit », tandis que Qwen, propriété d'Alibaba, a indiqué que ses agents à apparence humaine et ceux créés par les utilisateurs s'arrêteraient dès le 10 juillet, le reste des services d'agents suivant cinq jours plus tard. Tencent avait déjà retiré une fonctionnalité comparable de son application Yuanbao en juin. Contrairement à une lecture rapide qui y verrait une interdiction généralisée des agents IA, la nouvelle réglementation ne vise en réalité qu'une catégorie précise : les agents conçus pour entretenir une relation émotionnelle durable avec l'utilisateur, dotés de mémoire et d'une personnalité stable d'une session à l'autre. Les assistants de service client, les outils de questions-réponses, les assistants professionnels et les outils éducatifs ou de recherche en sont explicitement exclus, tant qu'ils évitent tout engagement émotionnel soutenu. Le problème pour Doubao et Qwen n'est donc pas venu d'une interdiction, mais d'un conflit de conception : les mesures exigent la mise en place de systèmes anti-addiction, de notifications d'usage obligatoires, de mécanismes de sortie instantanée et d'une détection en temps réel des dépendances malsaines, des exigences difficilement compatibles avec des agents pensés pour se souvenir des utilisateurs et maintenir une relation continue. Plutôt que d'adapter leurs produits, ByteDance et Alibaba ont choisi de les couper purement et simplement. Cette décision a des conséquences concrètes pour les utilisateurs, dont beaucoup ont exprimé leur tristesse sur Weibo, certains décrivant ces agents comme un véritable soutien émotionnel de longue date et déplorant l'absence de moyen simple pour exporter l'historique de leurs conversations. ByteDance permet aux utilisateurs de consulter leurs configurations et échanges en lecture seule jusqu'au 15 octobre 2026, avant que ces données ne soient traitées selon sa politique de confidentialité et deviennent irrécupérables ; l'entreprise redirige par ailleurs les utilisateurs de Doubao vers une application distincte, Maoxiang, où ils pourront recréer des agents. Alibaba, en revanche, n'a annoncé aucune solution de transition équivalente pour Qwen, dont les données d'agents sont vouées à une suppression définitive. Sur le fond, le texte chinois est plus nuancé qu'un simple coup de filet : il interdit les services de compagnon virtuel ou de membre de famille virtuel destinés aux mineurs, impose le consentement des parents pour les utilisateurs de moins de 14 ans, et oblige les plateformes à mettre en place des « modes mineurs » avec limites de temps d'usage, rappels à la vie réelle et contrôles parentaux renforcés, ainsi qu'une détection des utilisateurs en détresse aiguë nécessitant une intervention.

UECette régulation chinoise sur les compagnons IA émotionnels n'impose aucune obligation directe aux acteurs français ou européens, mais elle alimente le débat en cours sur l'encadrement des chatbots affectifs dans le cadre de l'AI Act.

💬 Ce qui frappe, c'est que Pékin ne tue pas les agents IA, il tue un seul type de lien : celui qui se souvient de toi et t'attache. Doubao et Qwen n'ont pas été interdits, ils ont juste refusé de construire les garde-fous anti-dépendance que la mémoire persistante rend obligatoires, et c'est plus révélateur que n'importe quelle interdiction frontale. Selon Le Fil IA, la Chine vient de tracer la ligne que l'Europe cherche encore à définir avec l'AI Act : pas la fonctionnalité qui pose problème, mais la relation émotionnelle qu'elle installe dans la durée.

RégulationReglementation
1 source
Traders, faites une pause ! Robinhood lance des agents IA qui analysent les cryptos 24h/24
512Le Big Data 

Traders, faites une pause ! Robinhood lance des agents IA qui analysent les cryptos 24h/24

Robinhood a ouvert son système de trading agentique aux cryptomonnaies via Robinhood Chain, permettant à des agents IA de surveiller les marchés 24 heures sur 24 et d'exécuter automatiquement des opérations pour le compte des utilisateurs. Ces agents analysent en continu plusieurs sources de données : cours des actifs, actualités financières, carnets d'ordres et mouvements de marché, afin de détecter des configurations statistiques susceptibles de générer un avantage. Selon Robinhood, environ 70 000 comptes agentiques fonctionnent déjà sur les marchés des actions et des options, un volume que l'entreprise juge significatif. L'un des premiers agents déployés sur les cryptos, baptisé Raxol et développé par la société Axol, s'est hissé parmi les quatre comptes les plus actifs seulement vingt-quatre heures après son lancement, une adoption rapide révélée notamment par un message publié par le compte Coin Bureau sur X le 3 juillet 2026. Cette évolution marque une nouvelle étape dans la démocratisation d'outils financiers longtemps réservés aux grands investisseurs institutionnels et aux fonds spéculatifs. Robinhood affirme vouloir permettre à ses agents IA de reproduire, à terme, la plupart des tâches qu'effectue aujourd'hui un trader humain, en misant sur la capacité de calcul et l'analyse continue de volumes de données massifs plutôt que sur l'intuition. Pour les investisseurs particuliers, la promesse est celle d'une surveillance ininterrompue des marchés cryptos, réputés pour leur volatilité extrême et leur activité qui ne s'arrête jamais, contrairement aux marchés actions traditionnels. Concrètement, cela signifie qu'un utilisateur pourrait déléguer à une IA la détection d'opportunités d'achat ou de vente pendant qu'il dort, sans avoir à surveiller lui même les graphiques en permanence. Cette annonce s'inscrit dans une tendance plus large de généralisation du trading algorithmique, une pratique déjà ancienne chez les fonds d'investissement mais jusqu'ici peu accessible au grand public. Robinhood, plateforme américaine connue pour avoir démocratisé le trading d'actions sans commission, cherche ainsi à consolider sa position en misant sur l'intelligence artificielle comme nouvel argument de différenciation face à ses concurrents. La société prend toutefois soin de rappeler que ces algorithmes ne prédisent pas l'avenir des marchés et ne garantissent aucun gain : ils identifient des tendances statistiques, avec les risques que cela comporte sur des actifs aussi imprévisibles que les cryptomonnaies, capables de bondir ou de chuter en quelques secondes après une simple rumeur ou annonce. La question reste ouverte de savoir si ces agents deviendront de véritables partenaires d'investissement fiables ou s'ils exposeront surtout les particuliers à de nouveaux risques mal maîtrisés, dans un secteur où la régulation peine encore à suivre le rythme de l'innovation.

💬 70 000 comptes déjà agentiques sur les actions et options, et Robinhood remet ça sur les cryptos avec Raxol qui explose en 24h : la démocratisation du trading algo, c'est fait, plus la peine d'en débattre. Bon, sur le papier, déléguer la surveillance nocturne à une IA qui ne dort jamais sur un marché qui ne dort jamais non plus, ça a du sens. Sauf que Robinhood a bâti son modèle sur le trading impulsif des particuliers, alors leur mettre un agent IA qui tourne 24h/24 entre les mains, c'est surtout leur donner un nouvel outil pour perdre de l'argent plus vite et plus souvent.

OutilsOutil
1 source
Le site web du futur pourrait s'assembler lui-même pour chaque visiteur
513Latent Space 

Le site web du futur pourrait s'assembler lui-même pour chaque visiteur

Adobe a présenté lors de l'AI Engineer World's Fair à San Francisco un concept baptisé "site agentique", capable de générer une page web personnalisée en temps réel pour chaque visiteur. Carlos Sanchez, Principal Scientist chez Adobe, a fait la démonstration d'un système qui interprète l'intention d'un visiteur à partir de son comportement de navigation et de ses recherches, classe ce comportement dans une catégorie d'intention (exploration, recherche d'information ou intention d'achat), puis utilise un modèle de langage pour assembler une page adaptée à partir du contenu existant de l'entreprise. Dans un exemple présenté, un visiteur intéressé par le camping s'est vu proposer une version du site d'une marque de machines à café entièrement réorganisée autour de la préparation du café en extérieur. Sanchez a aussi montré une interface où une requête libre comme "conférences IA en Europe" génère une page composée spécifiquement pour cette demande. Selon lui, la génération d'une page ne doit pas dépasser une à deux secondes, et le coût d'inférence actuel se situe entre un et deux centimes par page, un chiffre qu'il attend de voir baisser dans les prochains mois. Cette approche, qu'Adobe surnomme "audience of one", marque une rupture avec la personnalisation web classique, longtemps limitée au choix parmi un ensemble prédéfini d'options, comme des recommandations de produits basées sur les achats précédents ou une segmentation en profils d'audience. Ici, c'est la structure même de la page qui s'adapte à chaque visiteur, en s'appuyant sur le contenu déjà existant de l'entreprise comme base documentaire plutôt que de laisser un modèle inventer une expérience de toutes pièces. Pour les sites de commerce en ligne, l'enjeu est direct puisque la personnalisation peut être reliée immédiatement au taux de conversion, mais Sanchez estime que le potentiel dépasse la vente au détail et pourrait concerner toute organisation confrontée à une grande diversité de profils d'utilisateurs à convertir. Adobe n'a pas encore déployé ces expériences à grande échelle sur des sites clients en production : l'entreprise présente pour l'instant le concept et cherche des organisations prêtes à expérimenter. Sanchez reconnaît lui-même une incertitude sur l'adoption future de ces sites agentiques, résumant le dilemme de l'IA générative en une formule : il est facile de construire des choses, mais difficile de savoir quoi construire, ce qui pousse Adobe à développer d'abord puis à chercher les clients intéressés. Ce projet s'inscrit dans un mouvement plus large où les propriétaires de sites web testent simultanément plusieurs approches liées à l'IA, comme les interfaces conversationnelles, le contenu structuré via des protocoles comme WebMCP, les interfaces génératives ou les agents personnels, tout en cherchant des moyens d'attirer vers leurs sites des utilisateurs venus des plateformes d'IA tierces.

UEImpact indirect : les entreprises europeennes du e-commerce pourraient a terme s'inspirer de cette approche de personnalisation web, mais aucun element concret ne concerne directement la France ou l'UE pour l'instant.

OutilsOutil
1 source
Le routage entre modèles selon le coût : cinq approches
514The Information AI 

Le routage entre modèles selon le coût : cinq approches

Face à la hausse des prix des modèles d'IA les plus avancés et à une tendance chez les employés à systématiquement choisir les modèles les plus chers pour la moindre tâche, un nouvel outil gagne en popularité dans les entreprises : le routeur de modèles. Plutôt que de laisser chaque utilisateur sélectionner manuellement un modèle, souvent coûteux, pour répondre à ses questions ou générer du code, ces routeurs analysent la requête et l'orientent automatiquement vers le modèle le plus adapté, en fonction de la complexité réelle de la tâche. Ces solutions prennent des formes variées : produits autonomes vendus par des éditeurs spécialisés, fonctionnalités intégrées par les fournisseurs de cloud, ou encore applications développées en interne par les équipes informatiques elles-mêmes. Des entreprises comme Snowflake et Palo Alto Networks ont confirmé avoir réalisé des économies substantielles en remplaçant, pour certaines tâches, des modèles de pointe par des alternatives moins onéreuses. L'enjeu est direct : des tâches simples comme résumer des emails ou effectuer une recherche dans des documents peuvent souvent être traitées par des modèles open source ou des versions propriétaires plus anciennes, pour une fraction du coût des modèles les plus récents et les plus puissants. En automatisant ce choix, les routeurs permettent aux entreprises de réduire leurs factures liées à l'IA sans sacrifier significativement la qualité des réponses obtenues, un arbitrage devenu crucial à mesure que les usages internes de l'IA générative se multiplient et que les coûts associés grimpent en conséquence. Cette dynamique s'inscrit dans un mouvement plus large de maturation du marché de l'IA en entreprise : après une première phase d'adoption tous azimuts des modèles les plus performants, les directions financières et techniques cherchent désormais à rationaliser ces dépenses. Le phénomène de sur-utilisation des modèles chers, parfois qualifié familièrement de "tokenmaxxing", pousse les entreprises à repenser leur architecture d'accès à l'IA. Les fournisseurs de cloud et les éditeurs spécialisés voient dans les routeurs un nouveau segment de marché prometteur, alors que la pression sur les coûts de calcul devrait continuer de s'intensifier avec la diffusion massive des agents IA en entreprise.

UELes entreprises europeennes font face aux memes pressions sur les couts de l'IA generative et peuvent adopter ces routeurs pour rationaliser leurs depenses, meme si aucun acteur francais ou europeen n'est cite.

💬 Le vrai signal, c'est que "tokenmaxxing" existe déjà comme mot pour désigner le réflexe de choisir le modèle le plus cher par défaut. Ça montre que les entreprises ont payé cash pendant deux ans avant de se demander si un résumé d'email avait vraiment besoin d'un modèle de pointe. Le routage par coût, c'est la maturation logique du marché : Snowflake et Palo Alto qui confirment des économies substantielles, ça va convaincre plus de monde que n'importe quel argument théorique.

OutilsOutil
1 source
Modèle de sélection simplifié dans Amazon Bedrock grâce au Model Profiler open source
515AWS ML Blog 

Modèle de sélection simplifié dans Amazon Bedrock grâce au Model Profiler open source

Amazon vient de rendre open source le Model Profiler, un outil qui centralise la comparaison des modèles disponibles sur Amazon Bedrock, sa plateforme de génération de texte gérée. Bedrock donne accès à plus de 100 modèles fondation de fournisseurs comme Anthropic, OpenAI, Meta, Mistral AI, Cohere et Amazon lui-même, mais comparer leurs capacités, tarifs, disponibilité régionale, taille de fenêtre de contexte et débit obligeait jusqu'ici à naviguer entre plusieurs pages de console, documentations et appels API régionaux distincts. Le Model Profiler agrège ces données dans une interface web unique, avec filtrage avancé, comparaisons côte à côte et fiches détaillées par modèle. En coulisses, un pipeline serverless entièrement automatisé collecte les informations depuis sept sources différentes, cinq API AWS et deux URL publiques, incluant les spécifications des modèles Bedrock, les tarifs on-demand et batch, les quotas de débit (tokens par minute et requêtes par minute) sur 33 régions, les profils d'inférence cross-région, ainsi que les tailles de fenêtre de contexte via la base LiteLLM et le statut de cycle de vie via la documentation AWS. Le pipeline repose sur AWS Step Functions et orchestre 17 fonctions Lambda réparties en quatre phases, avec un système de cache S3 inter-Lambda qui réduit le nombre d'appels API d'environ 480 à 29 par exécution, soit un taux de succès de cache de 97%. L'ensemble tourne quotidiennement à 6h UTC et se termine en 8 à 12 minutes. Pour les équipes qui évaluent des modèles pour de nouveaux projets, cherchent à optimiser coûts et performances, ou migrent depuis d'autres systèmes d'IA, cet outil supprime une friction concrète: le temps perdu à croiser manuellement des documents épars pour prendre une décision éclairée. Comprendre les quotas est central dans ce choix. Le débit en tokens par minute (TPM) fixe le plafond de traitement, sachant que 1 000 tokens représentent environ 750 mots de texte, tandis que le nombre de requêtes par minute (RPM) limite les appels API indépendamment de leur taille, ces deux quotas variant selon le modèle et la région choisie. En rendant ces informations accessibles et à jour quotidiennement dans une seule interface, l'outil accélère la phase d'expérimentation et raccourcit le délai avant la mise en production. Cette initiative s'inscrit dans une tendance plus large où les grands fournisseurs cloud cherchent à simplifier l'accès à des catalogues de modèles de plus en plus vastes et fragmentés en termes de tarification, de régions et de capacités techniques. Amazon mise ici sur l'open source et sur une architecture serverless réutilisable, déployable en moins de cinq minutes via un template AWS CloudFormation, dont la fréquence de mise à jour est configurable par une règle Amazon EventBridge. Le projet embarque également un système agentique d'auto-réparation, propulsé par Bedrock, capable de détecter des lacunes dans les données collectées et d'appliquer automatiquement des correctifs de configuration jugés sûrs. À mesure que le nombre de modèles disponibles sur Bedrock continue de croître, cet outil pourrait devenir une référence pour les équipes techniques cherchant à arbitrer rapidement entre coût, performance et couverture géographique sans dépendre exclusivement des interfaces officielles d'AWS.

UELes entreprises europeennes utilisant Amazon Bedrock, disponible dans plusieurs regions UE, beneficient indirectement de cet outil de comparaison, mais aucune mesure ou entite francaise n'est concernee specifiquement.

OutilsOutil
1 source
Créer un agent de prise de rendez-vous médicaux avec Amazon Nova 2 Sonic
516AWS ML Blog 

Créer un agent de prise de rendez-vous médicaux avec Amazon Nova 2 Sonic

Amazon Web Services publie une architecture complète pour déployer un agent vocal capable de gérer automatiquement les rappels de rendez-vous médicaux, en combinant Amazon Nova 2 Sonic et Amazon Bedrock AgentCore. Le taux d'absences non justifiées dans les établissements de santé américains oscille entre 5 et 30 % selon les spécialités, chaque créneau vide représentant une perte de revenus, du temps médical gaspillé et des soins retardés. L'agent décrit authentifie les patients par reconnaissance vocale, gère les rendez-vous en temps réel, confirmation, annulation, reprogrammation, collecte des informations de santé pré-consultation et transfère l'appel à un agent humain si la situation l'exige. Le système repose sur Bedrock AgentCore en mode serverless, Amazon Cognito pour l'authentification, DynamoDB pour la persistance des données, Amazon SNS pour les notifications, et un frontend React qui streame l'audio bidirectionnel via des connexions WebSocket authentifiées. La différence fondamentale avec les approches traditionnelles tient au traitement natif parole-à-parole de Nova 2 Sonic. Les pipelines classiques enchaînent trois services distincts, transcription automatique, modèle de langage, synthèse vocale, et perdent à chaque transfert les nuances acoustiques du patient : hésitations, ton anxieux, confusion. Nova 2 Sonic traite la voix dans un seul modèle unifié, préservant le contexte vocal à travers chaque tour de dialogue. En santé, où l'état émotionnel d'un patient devrait influencer directement la réponse de l'agent, cette rétention de contexte améliore concrètement la qualité des échanges. Le modèle gère en outre les bruits de fond courants en environnement domestique et clinique, les accents régionaux, et peut basculer en cours de conversation vers la langue préférée du patient sans aucune reconfiguration. Amazon positionne Nova 2 Sonic comme une réponse directe aux limites des pipelines textuels dans les interactions vocales à fort enjeu. L'architecture s'appuie sur le SDK Strands Agents, qui intègre sept outils spécifiques au secteur médical pour l'authentification, la gestion des plannings et l'escalade vers le personnel soignant. Pour connecter l'agent à de vraies lignes téléphoniques en mode sortant, AWS recommande d'intégrer Amazon Connect, non inclus dans cette démonstration qui se concentre sur la couche agentique. Dans un secteur où les appels de confirmation un par un ne passent plus à l'échelle, cette architecture cible directement les réseaux de cliniques et d'hôpitaux qui absorbent chaque année des millions d'interactions téléphoniques routinières, et cherchent à les automatiser sans sacrifier la dimension humaine de la relation patient.

OutilsOutil
1 source
Intelligence contextuelle pour vos données et agents IA à grande échelle
517AWS ML Blog 

Intelligence contextuelle pour vos données et agents IA à grande échelle

Amazon Web Services a annoncé lors de l'AWS Summit New York City le lancement prochain d'AWS Context, un nouveau service conçu pour donner aux agents d'intelligence artificielle un accès structuré et gouverné à l'ensemble des données d'une organisation. Le service construit automatiquement un graphe de connaissances en cartographiant les relations entre les sources de données existantes, lacs de données, entrepôts, bases de données, flux en temps réel, et expose ce graphe via des API de recherche agentique et des outils MCP. Les équipes data peuvent gérer ce graphe depuis une console dédiée, valider les relations inférées automatiquement, les promouvoir en production, et y attacher des définitions métier ou des règles d'usage. AWS Context s'appuie sur la technologie qui alimente déjà Amazon QuickSight Q, un graphe de connaissances personnel utilisé quotidiennement par des centaines de milliers d'utilisateurs et traitant des millions de requêtes par jour. La nouveauté : ce graphe devient organisationnel, partagé entre tous les agents et applications d'une entreprise. Les métadonnées clés sont publiées au format Apache Iceberg dans Amazon S3, ce qui les rend interrogeables via Athena, Redshift ou Spark. L'enjeu est fondamental pour les entreprises qui déploient des agents IA en production : un agent ne peut prendre de décisions fiables que s'il dispose du bon contexte au bon moment. Aujourd'hui, ce contexte est dispersé entre des dizaines de systèmes hétérogènes, et une grande partie de la connaissance institutionnelle n'est tout simplement pas écrite. AWS Context vise à combler ce vide en créant une couche de contexte centralisée, gouvernée et accessible en temps réel. Pour les utilisateurs existants d'Amazon QuickSight Q, le bénéfice est immédiat : une fois AWS Context activé, leurs agents accèdent automatiquement au graphe étendu, incluant les relations inter-systèmes et les règles métier qui dépassent ce qu'un graphe personnel peut offrir. AWS Glue Data Catalog, Amazon SageMaker Unified Studio et AWS Lake Formation s'intègrent nativement au service. Ce lancement s'inscrit dans une course industrielle plus large autour de ce qu'AWS appelle l'« intelligence de contexte ». Les grands fournisseurs cloud rivalisent pour proposer des infrastructures permettant aux agents IA de raisonner sur des données d'entreprise réelles, sans que les équipes aient à construire des pipelines de récupération complexes. AWS Context se distingue par deux caractéristiques : son graphe apprend automatiquement de l'usage des agents, propageant les chemins de jointure corrects et les ambiguïtés résolues à l'ensemble de l'organisation sans intervention humaine ; et son architecture ouverte, basée sur Apache Iceberg, garantit que les métadonnées restent portables et auditables, indépendamment des outils choisis. Le service est également conçu pour se connecter à des catalogues tiers, étendant le graphe au-delà de l'écosystème AWS. La disponibilité générale n'a pas encore été précisée.

InfrastructureActu
1 source
Amazon Bedrock AgentCore : des agents plus informés et capables d'apprentissage continu
518AWS ML Blog 

Amazon Bedrock AgentCore : des agents plus informés et capables d'apprentissage continu

Amazon a annoncé cette semaine de nouvelles fonctionnalités pour Bedrock AgentCore, sa plateforme de développement d'agents IA, avec pour objectif de combler l'écart entre la puissance théorique des modèles de langage et leurs performances réelles en production. La mise à jour introduit trois couches d'accès à la connaissance : la Managed Knowledge Base, un outil de recherche web natif, et un accès à des données payantes. La Managed Knowledge Base permet désormais aux agents de se connecter directement aux sources de données internes des entreprises, SharePoint, Google Drive, Confluence, S3 et wikis internes, sans que les équipes techniques aient à construire leurs propres pipelines d'ingestion. Amazon gère le stockage vectoriel, les modèles d'embeddings et de reranking, ainsi que les questions de scalabilité. Au cœur de ce système se trouve un retriever agentique qui va bien au-delà du RAG classique : il planifie des requêtes croisées sur plusieurs bases de connaissance, relie des concepts connexes entre documents, et évalue les résultats intermédiaires avant de répondre. L'outil Web Search, lui, s'appuie sur la même infrastructure de recherche qui propulse Alexa+, Amazon Quick Suite et Kiro, et renvoie des extraits optimisés pour la densité d'information par token. Ces ajouts répondent à un problème concret et coûteux pour les entreprises déployant des agents IA : un modèle aussi performant soit-il reste inutile s'il ne peut pas accéder au document où se trouve la réponse. Un agent de service client incapable d'atteindre la politique de remboursement stockée dans SharePoint, un agent de recherche limité à ses données d'entraînement, un conseiller financier privé de données de marché en temps réel, tous sont des cas réels qui freinent le déploiement en production. La Managed Knowledge Base élimine plusieurs mois d'ingénierie préalable, tandis que le Web Search maintient les données dans l'environnement sécurisé AWS du client, un point critique pour les secteurs réglementés comme la finance ou la santé. Cette annonce s'inscrit dans la compétition intense entre fournisseurs cloud pour s'imposer comme plateforme de référence pour les agents IA d'entreprise. AWS, Google Cloud avec Vertex AI et Microsoft avec Azure AI Foundry se disputent le même marché : les équipes qui veulent déployer des agents capables d'agir réellement sur des données métier, pas seulement générer du texte. Amazon capitalise ici sur son infrastructure de recherche existante et son écosystème de services cloud pour offrir une intégration verticale que les solutions tierces ont du mal à concurrencer. La promesse d'amélioration continue via des boucles de rétroaction en production, mentionnée dans l'annonce, suggère qu'AgentCore ambitionne de devenir non seulement un outil de déploiement mais une plateforme d'optimisation itérative des agents dans la durée.

UELes entreprises européennes des secteurs réglementés (finance, santé) peuvent adopter ces fonctionnalités, les données restant dans l'environnement AWS sécurisé du client, ce qui simplifie la conformité réglementaire.

💬 Le vrai goulot d'étranglement pour les agents en prod, c'est jamais le modèle, c'est l'accès aux données d'entreprise. Avec AgentCore, Amazon efface plusieurs mois d'ingénierie RAG maison (SharePoint, Confluence, S3 gérés nativement) et garde les données dans son cloud sécurisé. AWS joue ici son principal atout : l'intégration verticale que ni Google ni Microsoft ne peuvent répliquer aussi facilement.

OutilsOutil
1 source
OpenAI étend l'évaluation des risques pré-déploiement au codage à base d'agents via des appels d'outils simulés
519MarkTechPost 

OpenAI étend l'évaluation des risques pré-déploiement au codage à base d'agents via des appels d'outils simulés

OpenAI a publié une nouvelle méthode de sécurité pré-déploiement baptisée Deployment Simulation, décrite dans un document technique mis en ligne sur son site. Le principe est simple : avant qu'un modèle soit mis en production, on simule son déploiement à l'avance. Concrètement, OpenAI rejoue des conversations réelles passées en remplaçant les réponses de l'ancien modèle par celles du nouveau candidat, puis analyse les résultats pour détecter d'éventuels comportements indésirables. La méthode est conçue pour préserver la vie privée des utilisateurs et produit une estimation du taux de comportements problématiques par message, vérifiable après la mise en ligne sur le trafic réel. La technique présente toutefois une limite inhérente : elle ne peut pas détecter des comportements qui se produisent moins d'une fois tous les 200 000 messages, ce qui la cantonne aux risques non marginaux. L'intérêt principal de cette approche réside dans ce qu'elle corrige par rapport aux évaluations traditionnelles. Celles-ci reposent sur des jeux de données synthétiques ou construits manuellement, sélectionnés pour être difficiles ou adversariaux, ce qui introduit trois biais connus : une sélection partiale des prompts, une couverture limitée, et une «conscience de l'évaluation» car le modèle peut réagir différemment à des contextes clairement artificiels. La Deployment Simulation, en s'appuyant sur une distribution représentative du trafic réel, réduit ces trois problèmes simultanément. La qualité de l'estimation croît avec la puissance de calcul disponible, et non avec l'effort humain nécessaire pour construire des benchmarks. OpenAI précise que la méthode a déjà informé des décisions de déploiement concrètes et mis en évidence des angles morts dans les évaluations classiques. Cette publication s'inscrit dans un effort plus large de l'industrie pour combler l'écart entre les tests de sécurité en laboratoire et les comportements réels des modèles en production. Les évaluations traditionnelles restent indispensables pour les risques rares et à haute sévérité, que la Deployment Simulation ne peut pas couvrir en dessous d'un certain seuil de prévalence. OpenAI présente les deux approches comme complémentaires plutôt que concurrentes. Alors que les grands laboratoires intensifient leurs travaux sur les systèmes agentiques, capables d'exécuter des tâches autonomes et d'appeler des outils externes, la question de la sécurité pré-déploiement devient plus critique. La méthode offre un cadre scalable pour anticiper les dérives avant qu'elles n'atteignent des millions d'utilisateurs, ce qui représente un pas méthodologique concret dans un domaine où les standards restent encore largement à construire.

UECette méthodologie pourrait servir de référence pour les obligations d'évaluation des risques pré-déploiement imposées par l'AI Act européen aux fournisseurs de systèmes d'IA à haut risque.

SécuritéOpinion
1 source
SkillOpt de Microsoft améliore GPT-5.5 avec un simple fichier Markdown entraîné
520The Decoder 

SkillOpt de Microsoft améliore GPT-5.5 avec un simple fichier Markdown entraîné

Microsoft, en collaboration avec trois universités chinoises, a mis au point SkillOpt, une méthode d'optimisation des documents d'instructions pour agents IA. Le principe est aussi simple qu'inattendu : un fichier Markdown soigneusement entraîné suffit à améliorer les performances de GPT-5.5 d'environ 23 points sur des tâches procédurales. La technique emprunte ses fondements aux méthodes d'entraînement classiques des grands modèles de langage, mais les applique non pas aux poids du réseau, mais au texte des instructions elles-mêmes. L'impact potentiel est considérable pour les développeurs et les entreprises qui déploient des agents IA. Le fichier Markdown optimisé ne se limite pas à GPT-5.5 : il se transfère à d'autres environnements comme Codex et Claude Code sans nécessiter de réentraînement supplémentaire. Cela signifie qu'il est possible d'améliorer substantiellement les capacités d'un agent en modifiant uniquement ses instructions textuelles, sans toucher aux modèles sous-jacents ni engager les coûts élevés d'un fine-tuning. Cette recherche reflète une dynamique croissante dans le domaine : optimiser les agents IA au niveau de leurs instructions plutôt qu'au niveau des paramètres du modèle. À mesure que les agents prolifèrent dans les environnements de développement logiciel et d'automatisation, la question de leur pilotage efficace devient centrale. SkillOpt propose une réponse légère et portable, qui pourrait redéfinir la manière dont les équipes techniques configurent et affinent leurs systèmes d'agents, quelle que soit la plateforme utilisée.

UELes développeurs européens déployant des agents IA peuvent bénéficier de cette méthode sans coût de fine-tuning, mais aucune institution ou réglementation européenne n'est directement impliquée.

💬 +23 points sur des tâches procédurales juste en optimisant un fichier Markdown, c'est le genre de résultat qui te fait relire deux fois. Ce qui m'intéresse vraiment, c'est le transfert : tu entraînes ton fichier d'instructions sur GPT-5.5 et ça marche aussi sur Claude Code sans rien changer. Reste à voir ce que ça donne sur des cas moins balisés que les benchmarks, mais la piste est sérieuse.

RecherchePaper
1 source
Traiter des PDF et en extraire des insights : concevoir un pipeline intelligent avec les services IA générative d'AWS
521AWS ML Blog 

Traiter des PDF et en extraire des insights : concevoir un pipeline intelligent avec les services IA générative d'AWS

Amazon Web Services a dévoilé une architecture complète de traitement intelligent de documents reposant sur ses services d'IA générative, notamment Amazon Bedrock Data Automation (BDA). Ce service unifié permet d'extraire des informations structurées depuis des documents multimodaux, PDF, images, vidéos, fichiers audio, avec une capacité allant jusqu'à 3 000 pages et 500 Mo par requête API. Contrairement aux solutions OCR classiques qui se limitent à l'extraction de texte brut, BDA analyse le contexte, classe automatiquement chaque section d'un document dans la bonne catégorie, l'associe au bon modèle de traitement, et fournit des scores de confiance sur les données extraites. L'architecture s'appuie sur quatre couches intégrées : ingestion des fichiers via Amazon S3, extraction et stockage avec DynamoDB, couche d'intelligence sémantique via Amazon Bedrock Knowledge Base, et coordination agentique par des agents spécialisés hébergés sur Amazon Bedrock AgentCore Runtime, orchestrés par AWS Step Functions. Pour les organisations qui traitent chaque jour des millions de documents, contrats juridiques, dossiers médicaux, factures, déclarations d'assurance, cette solution répond à un goulot d'étranglement majeur : l'intervention humaine obligatoire dans les pipelines traditionnels. En automatisant la classification, la normalisation et la validation des données, BDA réduit les coûts opérationnels, accélère les délais de traitement et limite les erreurs de saisie. La capacité à relier plusieurs documents entre eux via une base de connaissances sémantique permet également des analyses croisées impossibles avec les approches OCR conventionnelles, ouvrant la voie à des cas d'usage comme l'audit automatisé de contrats ou l'analyse comparative de rapports financiers. Ce lancement s'inscrit dans une course que se livrent les grands fournisseurs cloud, AWS, Microsoft Azure et Google Cloud, pour proposer des pipelines documentaires clé en main à destination des entreprises. AWS positionne BDA comme une réponse directe aux limites des solutions point-à-point qui nécessitaient jusqu'ici d'assembler manuellement des modèles OCR, des LLM et des orchestrateurs distincts. En intégrant l'ensemble dans une API unifiée au sein de Bedrock, Amazon cherche à réduire la friction technique pour les équipes data et à accélérer l'adoption de l'IA générative dans des secteurs très réglementés comme la finance, la santé et le droit. Les prochaines évolutions attendues concernent l'élargissement des formats supportés et le renforcement des capacités d'analyse de graphiques et de visualisations complexes embarqués dans les documents.

UELes entreprises européennes des secteurs réglementés (finance, santé, droit) peuvent adopter BDA via AWS pour automatiser leurs pipelines documentaires, sous réserve de conformité RGPD quant au stockage des données dans les régions AWS européennes.

OutilsOutil
1 source
Perplexity intègre Deep Research dans son agent informatique, en distribuant les sous-tâches sur plus de 20 modèles de pointe
522MarkTechPost 

Perplexity intègre Deep Research dans son agent informatique, en distribuant les sous-tâches sur plus de 20 modèles de pointe

Perplexity a intégré sa fonctionnalité Deep Research à son système d'orchestration multi-modèles baptisé Computer, une évolution majeure annoncée en juin 2026. Là où l'ancienne version exécutait une séquence fixe de recherches, la nouvelle décompose automatiquement chaque question complexe en sous-tâches, qu'elle distribue ensuite à plus de 20 modèles d'IA en parallèle. Le moteur de raisonnement central est Claude Opus 4.6, tandis que des sous-agents spécialisés, dont Gemini, prennent en charge des pans spécifiques de l'analyse. Le résultat n'est plus un simple résumé : Deep Research dans Computer produit des rapports complets avec citations vérifiées, des présentations et des tableurs interactifs, entièrement générés et modifiables au sein de l'environnement Computer. Une capacité distinctive, baptisée Search as Code, permet au modèle d'écrire lui-même le code qui pilote la recherche, exécutant des milliers d'appels de récupération en parallèle dans un environnement sandbox, avec filtrage, déduplication et reclassement des sources à la volée. Les gains de performance publiés par Perplexity illustrent l'ampleur du bond. Sur le benchmark BrowseComp d'OpenAI, qui teste la capacité à retrouver des informations difficiles à localiser par navigation web, le score passe de 40,7 % à 83,8 %, soit plus du doublement. Sur Humanity's Last Exam, un test d'expertise académique pluridisciplinaire conçu par le Center for AI Safety et Scale AI, le taux grimpe de 36,4 % à 50,5 %. Ces chiffres positionnent la nouvelle version comme l'une des solutions de recherche agentique les plus performantes du marché. Concrètement, un professionnel peut demander une comparaison des marges bénéficiaires des grands fabricants de puces IA sur cinq ans, une cartographie des différences entre le RGPD européen et les lois américaines sur la vie privée, ou une synthèse des essais cliniques sur l'impact cardiovasculaire des médicaments amaigrissants, et recevoir en retour un livrable structuré, prêt à l'emploi. Computer avait été lancé fin février 2026 comme plateforme cloud de coordination d'agents IA. L'intégration de Deep Research s'inscrit dans une course effrénée entre les acteurs de la recherche augmentée par l'IA, où Perplexity affronte directement Google, OpenAI et Anthropic sur le terrain de la recherche agentique complexe. La fonctionnalité est disponible pour les abonnés Perplexity Max, mais les développeurs peuvent y accéder de façon programmatique via l'Agent API en mode pay-as-you-go, avec un preset deep-research intégré au SDK officiel et une compatibilité avec le SDK OpenAI via l'endpoint POST /v1/responses. L'ouverture aux développeurs signal que Perplexity positionne cette infrastructure non comme un produit grand public isolé, mais comme une couche de recherche que d'autres applications pourront exploiter directement, ce qui pourrait redéfinir la manière dont les outils professionnels intègrent l'accès à l'information.

UELes professionnels et développeurs européens disposent d'un accès API à une couche de recherche agentique capable de traiter des sujets réglementaires comme le RGPD, sans impact institutionnel ou réglementaire direct sur la France ou l'UE.

OutilsOutil
1 source
FrontierCode : un benchmark pour la qualité du code face au contenu bâclé
523Latent Space 

FrontierCode : un benchmark pour la qualité du code face au contenu bâclé

Cognition, la société derrière l'agent de développement Devin, a publié FrontierCode, un nouveau benchmark destiné à mesurer la qualité réelle du code produit par les intelligences artificielles. Contrairement aux évaluations classiques comme SWE-Bench qui vérifient si les tests unitaires passent, FrontierCode évalue si le code serait effectivement accepté par un mainteneur dans un projet open-source réel. Chaque tâche du benchmark a nécessité plus de 40 heures de travail pour être construite, en collaboration directe avec des mainteneurs de projets open-source, et les soumissions sont notées sur cinq dimensions : sécurité par rapport aux régressions, propreté du code, périmètre de la modification, exactitude des tests et maintenabilité à long terme. Le résultat principal est saisissant : Claude Opus 4.8, le meilleur modèle sur le tier le plus difficile, n'obtient qu'environ 13% de réussite, loin des 50% et plus affichés habituellement sur SWE-Bench. Cet écart révèle un problème structurel dans la façon dont l'industrie mesure les progrès du codage automatisé. Les benchmarks actuels induisent en erreur : un modèle peut faire passer tous les tests d'une pull request tout en produisant du code impossible à intégrer dans une vraie base de code. METR avait déjà observé indépendamment que de nombreuses PRs validées par SWE-Bench ne seraient jamais fusionnées dans la branche principale d'un projet réel. Le phénomène est analogue aux "reward hacks" en apprentissage par renforcement : le modèle optimise pour la métrique de mesure plutôt que pour l'objectif réel. Pour les équipes d'ingénierie qui envisagent de déléguer du travail de maintenance logicielle à des agents IA, FrontierCode offre une jauge bien plus fiable que ce qui existait jusqu'ici. FrontierCode s'inscrit dans une remise en question plus large de ce que signifie "résoudre" le développement logiciel. Le benchmark s'est explicitement inspiré de FrontierMath, qui avait adopté la même approche de difficulté extrême pour l'évaluation des capacités mathématiques des modèles frontières. Le contexte est celui d'une accélération spectaculaire observée fin 2025, qui a rendu le "vibe coding" et les agents de développement autonomes suffisamment crédibles pour changer les pratiques. Parallèlement, un débat intense agite la communauté des praticiens sur la meilleure façon d'exploiter ces agents : donner des objectifs clairs avec des critères de vérification et des boucles d'itération plutôt que des instructions en une seule passe, tout en maintenant des points de contrôle humains dans les domaines où la vérification automatique reste difficile. FrontierCode apporte une réponse empirique à ce débat en montrant que, même dans les meilleures conditions, le fossé entre "le code compile" et "le code est bon" reste considérable.

UELes équipes d'ingénierie en France et en Europe peuvent s'appuyer sur cette nouvelle métrique pour évaluer la qualité réelle du code produit par les agents IA avant de déléguer des tâches de maintenance logicielle.

💬 13% sur le tier difficile pour le meilleur modèle du moment, c'est le chiffre qui remet tout le monde à sa place. On passait nos tests SWE-Bench comme si c'était le vrai critère, alors que la vraie question c'est "est-ce qu'un mainteneur mergerait ça ?" et là, la réponse est quasi systématiquement non. FrontierCode, c'est le benchmark qu'on aurait dû avoir bien avant que le vibe coding devienne une pratique sérieuse.

LLMsPaper
1 source
☕️ Ubuntu : vers de la reconnaissance vocale pour tous les champs texte
524Next INpact 

☕️ Ubuntu : vers de la reconnaissance vocale pour tous les champs texte

Canonical prévoit d'intégrer la reconnaissance vocale directement dans les champs texte d'Ubuntu, une fonctionnalité annoncée fin mai par Jon Seager, vice-président de l'ingénierie chez Canonical, lors du dernier Ubuntu Summit. Cette capacité, qui permettrait de dicter du texte dans la quasi-totalité des champs de saisie du système, est ciblée pour Ubuntu 26.10, la version attendue en octobre 2026, sous réserve que les tests se déroulent dans les délais. Seager a également mentionné deux autres fonctions dans le même registre : l'amélioration automatique de l'autofocus de la webcam et la qualité audio du microphone. Ces trois fonctionnalités seront traitées localement par un LLM embarqué, sans précision sur le modèle retenu. Techniquement, l'ensemble sera conditionné par un paquet Snap, que l'utilisateur pourra supprimer s'il ne souhaite pas utiliser ces services. L'apport le plus immédiat concerne l'accessibilité : permettre aux personnes ayant des difficultés motrices ou visuelles d'interagir avec n'importe quelle application via la voix, sans dépendre d'un logiciel tiers ou d'un service cloud. En intégrant cette capacité au niveau du système d'exploitation plutôt que de l'application, Canonical contourne la fragmentation habituelle des solutions d'accessibilité sous Linux, où la couverture varie fortement d'un environnement de bureau à l'autre. Pour les utilisateurs ordinaires, la dictée vocale universelle représente également un gain de productivité concret. Le fait que le traitement soit entièrement local élimine les problèmes de confidentialité liés à l'envoi de données audio vers des serveurs distants, ce qui distingue l'approche de Canonical de solutions comme la dictée Google ou Whisper en mode API. Cette annonce s'inscrit dans un contexte plus large de repositionnement de Canonical autour de l'IA, amorcé en avril dernier et accompagné de son lot de scepticisme dans la communauté open source. Le débat central porte sur la compatibilité des modèles d'IA avec les valeurs du logiciel libre : connaître les poids d'un modèle ne suffit pas, selon Seager, à garantir la transparence à laquelle l'écosystème libre est habitué, ce qui implique une attention particulière aux licences. Canonical semble pour l'instant adopter une stratégie prudente, ajoutant des cas d'usage concrets et limités plutôt que de viser immédiatement un "système agentique" comme le suggèrent ses propres éléments de communication. Une question pratique reste ouverte : un modèle local pèse souvent plusieurs gigaoctets, et l'installeur d'Ubuntu ne semble pas prévoir d'étape permettant à l'utilisateur de choisir explicitement quels services IA il souhaite activer, ce qui pourrait alourdir significativement l'empreinte de stockage de l'installation par défaut.

UEUbuntu étant largement déployé dans les administrations publiques et entreprises européennes, l'approche de traitement vocal entièrement local répond directement aux exigences RGPD en évitant l'envoi de données audio vers des serveurs tiers.

OutilsOutil
1 source
Les équipes platform chez LinkedIn déploient MCP et outils multi-agents à grande échelle
525InfoQ AI 

Les équipes platform chez LinkedIn déploient MCP et outils multi-agents à grande échelle

Karthik Ramgopal et Prince Valluri, ingénieurs chez LinkedIn, ont présenté leur approche pour déployer l'intelligence artificielle à grande échelle au sein d'une organisation de plusieurs milliers de développeurs. Plutôt que de laisser chaque équipe construire ses propres solutions en silo, ils ont mis en place une couche d'abstraction commune reposant sur le protocole MCP (Model Context Protocol) pour orchestrer des agents, structurer le contexte et sécuriser l'accès aux outils internes. Cette architecture a permis de déployer concrètement trois types d'agents en production : des agents de génération de code, des agents d'observation système et des agents de test d'interface utilisateur. L'enjeu est considérable pour les grandes entreprises technologiques : sans infrastructure partagée, chaque équipe réinvente la roue et les agents IA restent des expérimentations isolées sans impact à l'échelle. En centralisant l'orchestration et la gestion du contexte via une plateforme commune, LinkedIn parvient à transformer l'IA en véritable moteur d'exécution engineering, capable d'automatiser des tâches complexes comme les tests UI ou la surveillance de systèmes distribués, avec des garanties de sécurité homogènes. Cette initiative s'inscrit dans une tendance de fond : les grandes entreprises tech passent du stade des prototypes d'agents IA à celui des déploiements industriels, ce qui exige des équipes plateformes dédiées. Le protocole MCP, porté initialement par Anthropic et rapidement adopté par l'industrie, s'impose comme standard d'interopérabilité entre agents et outils. LinkedIn, filiale de Microsoft, bénéficie par ailleurs d'un accès privilégié aux modèles GPT-4o via Azure, ce qui accélère ces expérimentations à une échelle que peu d'entreprises peuvent atteindre.

UELes équipes d'ingénierie européennes peuvent s'inspirer de cette architecture MCP pour structurer leurs propres déploiements d'agents IA à l'échelle, le protocole MCP s'imposant comme standard industriel d'interopérabilité.

💬 MCP en prod chez LinkedIn sur des milliers de devs, c'est le signal qu'on attendait pour que le protocole bascule vraiment en standard industriel. Ce qui est intéressant là-dedans, c'est pas la tech en elle-même (Anthropic a bien bossé le design), c'est l'architecture plateforme : une couche commune au lieu que chaque équipe réinvente ses propres outils d'orchestration dans son coin. Reste à voir ce que ça donne pour les boîtes qui n'ont pas Azure et GPT-4o derrière.

InfrastructureOpinion
1 source
Accenture investit dans AlphaSense pour accélérer l’IA agentique en entreprise
526Le Big Data 

Accenture investit dans AlphaSense pour accélérer l’IA agentique en entreprise

Accenture a annoncé le 3 juin 2026 un investissement dans AlphaSense, plateforme américaine spécialisée dans l'intelligence de marché, simultanément à la clôture d'une levée de fonds de 350 millions de dollars qui valorise la startup à 7,5 milliards de dollars. Le tour de table a été mené par Vitruvian Partners, avec la participation d'Accenture Ventures, J.P. Morgan Growth Equity Partners, D.E. Shaw Ventures et Pinegrove. AlphaSense revendique aujourd'hui plus de 7 000 clients dans le monde, dont 90 % des entreprises du S&P 100, l'ensemble des grandes banques d'investissement mondiales et 92 % des cinquante plus grands groupes pharmaceutiques. La plateforme a franchi le cap des 600 millions de dollars de revenus annuels récurrents, et vient d'être reconnue comme leader dans le premier Magic Quadrant de Gartner consacré aux plateformes de veille concurrentielle et de marché. L'enjeu du partenariat dépasse le simple investissement financier : Accenture et AlphaSense entendent intégrer les capacités analytiques de la plateforme dans les opérations quotidiennes des grandes entreprises via des workflows d'IA agentique. AlphaSense s'appuie sur plus de 500 millions de documents professionnels, rapports financiers, publications réglementaires, études d'analystes, entretiens d'experts, que des modèles d'IA spécialisés peuvent interroger pour produire des recommandations exploitables en temps réel. L'objectif concret est d'automatiser l'exploitation de l'information afin d'accélérer les décisions stratégiques, dans des secteurs où la rapidité d'analyse est directement liée à la compétitivité : services financiers, sciences de la vie, santé, énergie et technologie. Cet investissement s'inscrit dans une stratégie plus large d'Accenture pour industrialiser l'usage de l'IA en entreprise. Selon une étude interne du cabinet, 78 % des dirigeants considèrent désormais l'IA davantage comme un levier de croissance des revenus que comme un outil de réduction des coûts, un changement de paradigme qui déplace la valeur vers la capacité à transformer des données massives et dispersées en décisions opérationnelles. AlphaSense se positionne précisément à cet endroit, à la jonction entre la veille stratégique et l'automatisation des processus, dans un marché où les grands acteurs du conseil cherchent à ancrer leurs clients dans des solutions propriétaires avant que la prochaine vague d'agents IA ne redessine les usages.

UEVitruvian Partners, fonds d'investissement européen, est le principal meneur du tour de table, et les grandes entreprises européennes clientes d'Accenture dans les secteurs financier et pharmaceutique seront parmi les premières exposées à ces workflows d'IA agentique.

BusinessActu
1 source
Meta lance Business Agent pour automatiser les ventes et le support client
527Le Big Data 

Meta lance Business Agent pour automatiser les ventes et le support client

Meta a annoncé le 3 juin 2026 le lancement de Business Agent, un assistant conversationnel alimenté par l'intelligence artificielle conçu pour automatiser les ventes, le support client et certaines tâches opérationnelles sur WhatsApp, Messenger et Instagram. Le groupe déploie également une infrastructure associée, baptisée plateforme Meta Business Agent, qui permet aux entreprises de créer et personnaliser leurs propres agents IA connectés à des outils tiers comme Shopify, Zendesk ou Shopee. Dès le lancement, plus d'un million d'entreprises ont accès à ce dispositif via les canaux de messagerie de Meta. Le déploiement commence gratuitement, avec des formules payantes annoncées pour les prochains mois, adaptées à différentes tailles de structures, des PME aux grands groupes. Avec plus d'un milliard de conversations quotidiennes entre entreprises et consommateurs sur ses plateformes, Meta transforme ces échanges en interfaces commerciales actives. Business Agent peut répondre aux demandes clients, recommander des produits, qualifier des prospects, prendre des rendez-vous et conclure des ventes, tout en s'adaptant à la langue et au ton propre à chaque marque. Contrairement aux chatbots traditionnels limités à des scénarios fixes, cet agent suit une logique d'exécution multi-tâches au sein d'une même conversation, avec la possibilité pour les entreprises de définir à quel moment un collaborateur humain doit reprendre la main. En interne, l'outil génère également des résumés des conversations manquées et des analyses des interactions récentes, réduisant la charge opérationnelle liée aux échanges répétitifs. Cette offensive s'inscrit dans une course accélérée entre les grandes plateformes technologiques pour monétiser leurs audiences via des agents IA. Meta, fort d'une base d'utilisateurs sans équivalent sur la messagerie mondiale, cherche à convertir cette présence en infrastructure commerciale incontournable pour les entreprises. La plateforme concurrence directement des solutions comme Google Business Messages ou les intégrations Salesforce Einstein, en misant sur la simplicité de déploiement et l'ubiquité de WhatsApp, dominant dans de nombreux marchés hors États-Unis. À terme, Meta prévoit d'étendre les capacités de Business Agent à la veille concurrentielle, aux études de marché, à la gestion d'agenda et à l'analyse de données produits, positionnant progressivement cet outil comme un assistant stratégique complet pour les équipes commerciales et marketing.

UELes entreprises françaises utilisant WhatsApp Business, très répandu en France et en Europe, peuvent désormais déployer des agents IA pour automatiser leur service client et leurs ventes directement dans leurs canaux de messagerie existants.

OutilsOutil
1 source
NVIDIA lance des compétences agents pour l'IA physique : véhicules autonomes, robotique et vision
528NVIDIA AI Blog 

NVIDIA lance des compétences agents pour l'IA physique : véhicules autonomes, robotique et vision

NVIDIA a profité de la conférence CVPR 2026 pour dévoiler une série de nouveaux outils d'IA physique destinés aux chercheurs travaillant sur les véhicules autonomes, la robotique et les systèmes de vision artificielle. Ces annonces s'appuient sur le lancement, quelques jours plus tôt, de NVIDIA Cosmos 3, présenté comme le premier modèle fondamental unifié de l'industrie combinant raisonnement visuel, génération de mondes et génération d'actions. Parmi les outils dévoilés figurent InstantNuRec, qui reconstruit des scènes routières en 3D à partir d'images sans optimisation par scène ; AlpaGym, un framework open source d'apprentissage par renforcement en boucle fermée capable de s'exécuter sur des milliers de GPU ; OmniDreams, un modèle génératif qui produit des rendus photoréalistes en temps réel en réponse aux actions d'une politique de conduite ; et Alpamayo 2 Super, un modèle VLA (vision-langage-action) de 32 milliards de paramètres conçu pour le développement de véhicules autonomes de niveau 4. Le problème central que cherche à résoudre NVIDIA est la fragmentation des workflows en IA physique. Aujourd'hui, reconstruire une scène réelle, générer des scénarios rares, entraîner une politique, évaluer son comportement et itérer rapidement implique de jongler entre des outils disparates, ce qui ralentit considérablement la recherche. Pour les véhicules autonomes en particulier, le défi est la « longue traîne » des situations de conduite : les interactions rares, les géométries routières inhabituelles, les variations d'éclairage qui sont difficiles à collecter en conditions réelles mais critiques pour la validation. Les nouveaux outils de NVIDIA permettent aux agents IA d'automatiser ces étapes, de la reconstruction de scènes à partir de données de flotte jusqu'à la génération de conditions synthétiques variées. Pour la vision industrielle, des compétences Metropolis permettent de générer des défauts visuels rares sur différentes surfaces, résolvant le problème chronique du manque de données pour la détection d'anomalies. Ces annonces s'inscrivent dans une stratégie cohérente de NVIDIA pour s'imposer comme infrastructure de référence de l'IA physique, un marché qu'elle considère comme la prochaine vague majeure après les grands modèles de langage. Cosmos 3, socle de l'ensemble de l'écosystème présenté, est positionné comme modèle ouvert dominant sur les benchmarks publics de l'IA physique. En combinant simulation haute fidélité, modèles fondateurs ouverts et frameworks d'entraînement scalables, NVIDIA tente de reproduire avec l'IA embarquée et robotique ce qu'elle a réussi dans le calcul haute performance : rendre son infrastructure si centrale que les chercheurs n'envisagent pas d'alternatives. Les prochaines étapes passeront par l'adoption de ces outils par les grands constructeurs automobiles et les laboratoires de robotique, qui testent actuellement leurs capacités sur des flottes réelles.

UELes constructeurs automobiles européens (Renault, Stellantis, BMW) et les laboratoires de recherche en robotique pourront utiliser ces outils open-source pour accélérer le développement de véhicules autonomes de niveau 4 et réduire leur dépendance à la collecte de données réelles.

RobotiqueOpinion
1 source
Amazon Quick au service de la recherche sur les cancers rares : intégration de bases de données biomédicales
529AWS ML Blog 

Amazon Quick au service de la recherche sur les cancers rares : intégration de bases de données biomédicales

Amazon a lancé Amazon Quick Research, un environnement de recherche unifié intégré à sa plateforme Amazon Quick, conçu pour accélérer l'analyse de données biomédicales fragmentées dans des domaines comme la cancérologie rare. L'outil combine des bases de données publiques, PubMed, ClinicalTrials.gov, des revues en accès libre, avec des fichiers internes (PDF, Word, Excel, CSV, JSON et une dizaine d'autres formats) au sein d'espaces de travail appelés Spaces, capables d'indexer jusqu'à 10 000 fichiers. Un agent orchestre la récupération multi-sources, décompose automatiquement une question de recherche en sous-thèmes, génère un plan d'investigation révisable avant exécution, puis produit un rapport structuré avec citations traçables jusqu'à la source. Les rapports sont exportables en PDF ou en Word, et un système de versioning permet d'annoter des passages spécifiques (jusqu'à 400 caractères par commentaire) pour déclencher des révisions ciblées qui incrémentent le numéro de version tout en conservant les versions antérieures. La démonstration publiée par AWS s'appuie sur le sarcome pédiatrique comme domaine d'application. L'enjeu principal est celui du temps perdu avant même que l'analyse commence. En cancérologie rare, les données sont aujourd'hui dispersées entre des pipelines de séquençage génomique, des registres d'essais cliniques, des référentiels de biomarqueurs et la littérature scientifique, des systèmes cloisonnés qui nécessitent habituellement des semaines de travail pour construire les pipelines ETL, réconcilier les schémas et interroger chaque source manuellement. Amazon Quick Research court-circuite cette étape en ingérant et indexant ces sources dès la création du projet, puis en synthétisant les résultats via un grand modèle de langage qui génère des conclusions avec leurs chaînes de preuve exposées via la fonctionnalité "Understand the statement". Pour les chercheurs, le gain est surtout sur la phase de revue de littérature et d'intégration de données, au bénéfice du temps consacré à l'analyse elle-même. Cette annonce s'inscrit dans la tendance plus large des agents IA appliqués à la recherche scientifique, où les grandes plateformes cloud cherchent à se positionner sur le marché des outils d'accélération biomédicale. AWS rejoint ainsi des acteurs comme Elsevier, Semantic Scholar ou plusieurs startups spécialisées qui proposent des outils comparables de synthèse de littérature. Amazon Quick Research reste un service payant avec facturation à l'usage, ce qui limite son accessibilité aux équipes académiques aux budgets serrés. Les développements probables incluent l'intégration de sources propriétaires, de bases cliniques sécurisées conformes au HIPAA, et potentiellement des connecteurs vers des entrepôts de données génomiques comme TCGA ou GEO, des ajouts qui étendraient considérablement la portée de l'outil dans un contexte où l'IA appliquée à l'oncologie de précision connaît une expansion rapide.

UELes chercheurs en oncologie rare en France et en Europe pourraient réduire le temps consacré à l'intégration de données biomédicales fragmentées, bien que la tarification à l'usage constitue un obstacle pour les équipes académiques aux budgets contraints.

OutilsOutil
1 source
Les agents de recherche IA ont tendance à confirmer leurs connaissances existantes plutôt qu'à explorer le web
530The Decoder 

Les agents de recherche IA ont tendance à confirmer leurs connaissances existantes plutôt qu'à explorer le web

Les principaux agents de recherche IA, dont GPT-5.4 d'OpenAI et Kimi K2.6 de Moonshot AI, n'effectuent pas autant de recherches web réelles qu'ils le laissent entendre. C'est la conclusion d'une étude menée par des chercheurs de l'Institut de technologie de Harbin, qui ont développé un nouveau benchmark temporel appelé LiveBrowseComp. Ce test se distingue des évaluations classiques en ne posant des questions que sur des événements survenus au cours des 90 derniers jours, soit une fenêtre temporelle postérieure aux données d'entraînement des modèles. Les résultats sont révélateurs : dès que les modèles ne peuvent plus s'appuyer sur leur mémoire d'entraînement, leurs performances s'effondrent et les classements habituels sont bouleversés. Cela signifie que ces agents, présentés comme de puissants outils de recherche en ligne, se contentent en réalité d'utiliser le web pour confirmer ce qu'ils savent déjà, plutôt que de véritablement explorer et synthétiser des informations récentes. Pour les entreprises et professionnels qui s'y fient pour une veille ou une analyse d'actualité, c'est une limitation critique. Ce constat intervient alors que les éditeurs d'IA rivalisent pour positionner leurs modèles comme des assistants de recherche autonomes capables de naviguer sur internet. Les benchmarks traditionnels, construits sur des données historiques, masquaient cette faiblesse structurelle. LiveBrowseComp introduit une contrainte temporelle qui force une évaluation plus honnête des capacités réelles de navigation web. L'enjeu est de taille : si les classements sont rebattus sur cette base, la confiance accordée aux agents IA pour des tâches de recherche actuelle devra être sérieusement réévaluée.

UELes entreprises et professionnels européens qui s'appuient sur ces agents pour de la veille ou de l'analyse d'actualité doivent réévaluer leur fiabilité pour tout contenu postérieur aux données d'entraînement.

💬 C'est prouvé maintenant : ces agents ne cherchent pas vraiment, ils confirment ce qu'ils savent. Le benchmark de Harbin est malin, poser uniquement des questions sur les 90 derniers jours c'est une façon élégante de court-circuiter la mémoire d'entraînement, et du coup les classements habituels volent en éclats. Si tu t'appuies là-dessus pour une vraie veille, je te laisse tirer les conclusions.

RecherchePaper
1 source
J’ai transformé mon PC en développeur IA avec OpenClaw (et voici combien ça me coûte vraiment)
531Frandroid 

J’ai transformé mon PC en développeur IA avec OpenClaw (et voici combien ça me coûte vraiment)

Un bricoleur passionné mais non-codeur a publié sur Frandroid le récit de son expérience avec OpenClaw, un agent IA autonome installé directement sur son PC personnel. L'auteur, qui bidouille depuis vingt ans sans jamais avoir maîtrisé la programmation, décrit comment cet outil a transformé sa machine en un véritable développeur à demeure : capable de rédiger des scripts sur commande, d'automatiser une veille technologique et de corriger des bugs de manière autonome, y compris pendant la nuit. Ce type de configuration, longtemps réservée aux développeurs, devient accessible à des profils purement amateurs. L'impact est significatif pour une catégorie d'utilisateurs jusqu'ici laissée de côté : les "power users" non-développeurs, ceux qui ont des idées d'automatisation mais butent sur l'obstacle du code. Un agent IA local et autonome efface cette barrière, rendant possible la création d'outils personnalisés sans compétences techniques. Pour l'industrie, cela illustre un basculement concret : l'IA ne sert plus seulement à assister les professionnels, elle démocratise des capacités autrefois réservées à une élite technique. OpenClaw s'inscrit dans une vague d'agents IA autonomes locaux, aux côtés de projets comme Aider ou Open Interpreter, qui misent sur l'exécution directe sur la machine de l'utilisateur plutôt que sur le cloud. Cette approche soulève des questions sur les coûts réels (abonnements LLM, ressources matérielles) et sur la sécurité, puisqu'un agent avec accès système peut agir sans supervision humaine. La popularité croissante de ces outils chez les profils non-techniques suggère que 2025-2026 marque le début d'une adoption grand public de l'IA agentique.

UELes 'power users' non-développeurs en France peuvent désormais accéder à des agents IA locaux autonomes pour automatiser des tâches sans compétences de programmation, abaissant concrètement la barrière technique pour un large public amateur francophone.

💬 Ça fait deux ans qu'on parle de démocratisation de l'IA, et là c'est peut-être la première fois que je vois un cas qui colle vraiment à ce mot. La barrière du code, c'était le dernier verrou, et un agent local qui bricole à ta place la nuit le fait sauter. La question des coûts réels et de l'accès système reste entière, mais le concept tient.

OutilsOutil
1 source
L’IA crée son propre Shadow IT : les entreprises perdent déjà la trace de leurs agents
532FrenchWeb 

L’IA crée son propre Shadow IT : les entreprises perdent déjà la trace de leurs agents

Un phénomène bien connu refait surface sous une forme nouvelle dans les entreprises : après avoir lutté pendant vingt ans contre le Shadow IT classique, les directions informatiques font face à une variante propulsée par l'intelligence artificielle. Des équipes métier déploient désormais des agents IA, des assistants automatisés et des flux de traitement autonomes sans passer par les circuits de validation informatique habituels. La facilité d'accès aux outils IA grand public, souvent accessibles via un simple abonnement ou une API, accélère cette dispersion incontrôlée. Le risque est considérable. Contrairement à une application SaaS classique, un agent IA peut accéder à des données sensibles, exécuter des tâches en autonomie, interagir avec des systèmes tiers et produire des résultats à grande échelle, le tout hors de tout audit interne. Les entreprises ne savent plus combien d'agents tournent en leur nom, quelles données ils traitent, ni qui en est réellement responsable. Cela expose les organisations à des violations réglementaires, notamment sous le RGPD ou l'AI Act européen, et à des risques de sécurité difficiles à quantifier. Ce phénomène s'inscrit dans une dynamique plus large : la démocratisation rapide des outils IA, portée par OpenAI, Google, Microsoft et des dizaines de startups, a rendu l'expérimentation accessible à n'importe quel salarié. Les DSI, déjà débordés par la transformation numérique, peinent à établir des cadres de gouvernance adaptés à cette nouvelle réalité. Les prochains mois devraient voir émerger des solutions de découverte et d'inventaire d'agents IA, un marché naissant que plusieurs éditeurs de cybersécurité commencent déjà à adresser.

UELes entreprises françaises et européennes sont directement exposées aux risques de non-conformité au RGPD et à l'AI Act en raison de déploiements d'agents IA internes non contrôlés et non audités.

💬 Le Shadow IT, on pensait l'avoir à peu près domestiqué. Mais n'importe quel chef de projet peut maintenant poser un agent en prod avec une carte bleue et un compte OpenAI, sans que la DSI ne le voie passer. La différence avec l'ancienne version, c'est que cet agent agit en autonomie, touche des données sensibles, et sous l'AI Act, si ça déraille, c'est ton entreprise qui morfle, pas l'employé qui a cliqué sur "déployer".

SécuritéOpinion
1 source
Lowe's : les données sémantiques améliorent ses agents IA
533The Information AI 

Lowe's : les données sémantiques améliorent ses agents IA

Lowe's, le géant américain de la distribution de bricolage, a récemment intégré deux outils de gestion des données, une couche sémantique et un graphe de connaissances, pour améliorer les performances de ses agents d'intelligence artificielle. Chandhu Nair, vice-président senior de l'entreprise, a expliqué que ces technologies permettent désormais à l'IA de mieux assister les clients dans le suivi de leurs commandes et d'aider les responsables de magasins à coordonner le travail quotidien des employés. Lowe's exploite un assistant d'achat alimenté par l'IA pour ses clients ainsi qu'un coach commercial intelligent destiné à ses vendeurs, tous deux développés en partenariat avec OpenAI au cours des deux dernières années. La chaîne a également déployé un agent spécialisé pour ses équipes financières, chargé de vérifier l'exactitude du traitement des factures, une priorité compte tenu du volume considérable de transactions que génère son statut de cinquième plus grand importateur aux États-Unis. L'apport concret de la couche sémantique réside dans sa capacité à standardiser les définitions des indicateurs métiers, ce que l'entreprise entend précisément par "revenu" ou "client", afin que l'IA ne travaille pas sur des données ambiguës ou incohérentes. Couplée au graphe de connaissances, qui cartographie les relations entre les différents types de données de l'entreprise, cette approche rend les agents nettement plus fiables et efficaces dans leurs décisions. Pour une enseigne comme Lowe's, qui gère des milliers de références produits, des dizaines de milliers d'employés et des millions de transactions, la précision des données est directement liée à la qualité du service rendu. Cette démarche s'inscrit dans une bataille plus large que se livrent les grands acteurs du logiciel d'entreprise. Microsoft, Databricks et SAP se disputent actuellement le contrôle des couches sémantiques au sein des systèmes d'information des grandes entreprises, conscients que celui qui maîtrise la définition des données maîtrise aussi l'intelligence artificielle qui les exploite. Le cas Lowe's illustre comment les détaillants de grande taille transforment leurs infrastructures de données héritées en socle opérationnel pour une IA agentique déployée à grande échelle.

OutilsOpinion
1 source
Cognition lève 1 milliard de dollars lors d'une série D valorisée à 26 milliards
534Latent Space 

Cognition lève 1 milliard de dollars lors d'une série D valorisée à 26 milliards

Cognition, le laboratoire spécialisé dans les agents IA, vient de lever 1 milliard de dollars lors d'un tour de table en Série D qui valorise la société à 26 milliards de dollars. Ce financement, annoncé fin mai 2026, représente une valorisation 2,5 fois supérieure à celle obtenue lors de sa Série C en septembre 2025, qui s'élevait à 10 milliards de dollars. Cognition devient ainsi officiellement le plus grand laboratoire d'agents IA indépendant encore en activité. La société projette un chiffre d'affaires annuel récurrent dépassant 1 milliard de dollars d'ici la fin de l'année 2026, une trajectoire alimentée par une clientèle déjà constituée d'acteurs exigeants de l'écosystème startup et entreprise, parmi lesquels Exa et Modal. Cette levée illustre l'appétit persistant des investisseurs pour les agents IA autonomes, segment en train de redéfinir le marché des logiciels d'entreprise. Dans le SaaS, l'ARR est un indicateur retardé de l'utilisation réelle : si Cognition projette ce seuil du milliard, c'est que des déploiements significatifs sont déjà actifs chez ses clients. La dynamique s'inscrit dans une logique de concentration du financement autour de quelques laboratoires indépendants capables de tenir tête aux grandes plateformes que sont OpenAI, Anthropic ou Google DeepMind. Cognition, positionné sur les agents codeurs autonomes, s'impose comme un acteur de référence dans une catégorie dont la valeur potentielle continue d'attirer des capitaux massifs. Cette annonce intervient dans un contexte d'effervescence technique autour de l'inférence et de l'architecture des agents. Sur le front de l'efficacité, plusieurs avancées ont marqué la semaine : EAGLE 3.1 améliore le décodage spéculatif pour les longues séquences, Perplexity a publié en open source un tokeniseur réduisant de 5 à 6 fois la charge CPU, et Qwen3.5 atteindrait 580 tokens par seconde pour des charges de travail agentiques grâce à une collaboration entre Alibaba, NVIDIA et les contributeurs de FlashAttention-4. Parallèlement, LangChain a livré Deep Agents v0.6 avec les Delta Channels, réduisant le stockage des points de contrôle pour une session de codage de 200 tours de 5,3 Go à seulement 129 Mo. La plateforme Trajectory a également été lancée pour permettre aux équipes d'utiliser les traces d'agents et les signaux d'usage produit dans une logique d'apprentissage continu. Ces évolutions techniques signalent un glissement de paradigme : ce n'est plus seulement la qualité du modèle qui fait la différence, mais l'adéquation entre le modèle, son environnement d'exécution et sa mémoire.

💬 26 milliards pour Cognition, ça fait un choc. Mais le chiffre qui compte c'est le milliard d'ARR projeté d'ici décembre : des déploiements déjà actifs chez des clients exigeants, et une valorisation multipliée par 2,5 en six mois pour un labo qui n'existait quasiment pas il y a trois ans. Et l'Europe dans tout ça, elle regarde.

BusinessOpinion
1 source
OpenRouter franchit 1,3 milliard de dollars de valorisation un an après son lancement
535Le Big Data 

OpenRouter franchit 1,3 milliard de dollars de valorisation un an après son lancement

OpenRouter, une startup américaine spécialisée dans les passerelles d'accès aux modèles d'intelligence artificielle, vient de boucler un tour de table de série B de 113 millions de dollars mené par CapitalG, le fonds de capital-risque d'Alphabet. Cette levée propulse sa valorisation à 1,3 milliard de dollars, soit plus du double des 547 millions estimés lors de son tour de série A de juin 2025, où Andreessen Horowitz, Menlo Ventures et Sequoia avaient déjà investi 40 millions de dollars. En douze mois d'existence, la société affiche désormais 8 millions d'utilisateurs dans le monde et traite environ 100 000 milliards de tokens par mois. Sur les six derniers mois, son volume hebdomadaire est passé de 5 000 milliards à 25 000 milliards de tokens, soit une multiplication par cinq. La plateforme donne accès à plus de 400 modèles d'IA, parmi lesquels ceux d'Anthropic, OpenAI, Google, xAI et DeepSeek. Cette progression illustre un basculement structurel du marché de l'IA générative : après des années centrées sur l'entraînement des modèles, l'industrie se concentre désormais sur l'inférence, c'est-à-dire l'exécution concrète des modèles dans des applications réelles. Les entreprises cherchent à optimiser leurs coûts et leur flexibilité opérationnelle, en pouvant sélectionner dynamiquement le modèle le mieux adapté à chaque tâche, qu'il s'agisse d'un traitement simple ou d'un raisonnement complexe. La montée en puissance des agents IA, ces systèmes autonomes qui enchaînent plusieurs actions et requêtes, renforce encore ce besoin : orchestrer plusieurs modèles spécialisés depuis une interface unique est devenu une nécessité opérationnelle pour de nombreuses équipes techniques. Pendant plusieurs années, l'industrie semblait s'orienter vers une concentration autour de quelques fournisseurs dominants, avec le risque d'un verrouillage technologique comparable à celui qu'ont connu les entreprises avec certains éditeurs cloud ou logiciels d'entreprise. Le succès d'OpenRouter révèle une réalité plus nuancée : les organisations souhaitent conserver leur pouvoir de négociation, limiter les risques de dépendance et s'adapter rapidement aux évolutions rapides du marché. Dans ce contexte, les intermédiaires capables d'agréger et d'orchestrer plusieurs fournisseurs deviennent des infrastructures stratégiques à part entière. La valorisation d'OpenRouter, atteinte en un an seulement, confirme que l'avenir du déploiement de l'IA en entreprise sera résolument multi-modèles.

UELes équipes techniques européennes peuvent adopter OpenRouter pour orchestrer plusieurs modèles IA sans dépendance à un fournisseur unique, mais l'impact direct sur la France ou l'UE reste limité à cet avantage opérationnel indirect.

💬 1,3 milliard en un an, je m'y attendais pas à cette vitesse. OpenRouter a compris avant tout le monde que la vraie bataille, c'est pas qui entraîne les meilleurs modèles, mais qui te permet de tous les orchestrer sans te faire enfermer chez un seul provider. Reste à voir comment les grands fournisseurs vont réagir quand ils réaliseront que leur API est en train de devenir une commodité.

BusinessOpinion
1 source
Sarang Kulkarni : les enseignements du développement d'agents de recherche approfondie en production
536InfoQ AI 

Sarang Kulkarni : les enseignements du développement d'agents de recherche approfondie en production

Sarang Kulkarni, architecte chez Thoughtworks, a présenté lors de l'Arc of AI Conference 2026 les enseignements tirés du déploiement en production de systèmes d'agents de recherche approfondie. Ces systèmes, appelés Deep Research Agentic Systems, sont des agents IA capables de conduire des investigations en plusieurs étapes sur des questions complexes : ils combinent raisonnement dynamique, récupération d'information en chaîne (multi-hop retrieval) et génération de rapports analytiques structurés, allant bien au-delà des chatbots classiques. Ces architectures multi-agents représentent un saut qualitatif pour les entreprises qui ont besoin d'automatiser des tâches de veille, d'analyse concurrentielle ou de recherche documentaire. Là où un LLM standard répond à une question en une passe, un agent de recherche profonde décompose le problème, interroge plusieurs sources, valide ses hypothèses et synthétise un rapport cohérent. Le retour d'expérience de Thoughtworks, cabinet de conseil technologique présent dans le monde entier, est particulièrement précieux car il aborde les réalités du déploiement en production : latence, fiabilité, coûts opérationnels et maintenance des workflows. L'intervention de Kulkarni s'inscrit dans une tendance de fond : après l'engouement pour les LLMs, l'industrie entre dans une phase d'industrialisation des agents IA. Des acteurs comme Google avec Deep Research, Perplexity ou OpenAI ont popularisé le concept, mais les pratiques de déploiement en entreprise restent peu documentées. Les conférences spécialisées comme Arc of AI 2026 deviennent des espaces clés pour partager ce savoir tacite, avant que les standards de l'ingénierie agentique ne se cristallisent.

UELes entreprises européennes déployant des agents IA en production peuvent s'appuyer sur ce retour d'expérience de Thoughtworks pour anticiper les défis de latence, fiabilité et coûts opérationnels.

OutilsOutil
1 source
Le SaaS est-il mort ?
537Ben's Bites 

Le SaaS est-il mort ?

La question commence à circuler sérieusement dans les cercles tech : le SaaS est-il en train de mourir ? Dans sa newsletter Ben's Bites, l'investisseur et analyste Dan Shipper défend une thèse nuancée mais inquiétante pour les éditeurs de logiciels traditionnels. Le problème ne vient pas de ce que les entreprises peuvent désormais coder leurs propres outils grâce à l'IA, c'est un argument souvent avancé mais qui reste marginal en pratique. Le vrai problème, selon lui, est structurel : les outils SaaS sont conçus pour une base d'utilisateurs massive, ils grossissent en permanence, accumulent des fonctionnalités, modifient leurs interfaces, et finissent par dépasser les besoins réels de leurs clients. L'utilisateur ne voulait qu'une fraction du produit, et se retrouve prisonnier d'un outil qui a outgrown lui. Cette semaine, plusieurs actualités illustrent concrètement cette bascule : OpenAI a sorti du stade expérimental le mode "Goal" de Codex, qui permet d'exécuter des workflows en plusieurs étapes avec un objectif unique en tête. Le protocole MCP reçoit une mise à jour majeure dont la finalisation est prévue pour le 28 juillet, ajoutant le support natif pour les interfaces applicatives, les tâches longues, et des règles de sécurité renforcées. Perplexity a open-sourcé Bumblebee, un scanner de sécurité pour machines de développeurs qui détecte les packages risqués et les configurations d'agents IA sans exécuter les outils inspectés. Ce mouvement a des conséquences directes pour les entreprises qui achètent des logiciels. Si les outils rigides perdent de leur attrait, les architectures composables gagnent en valeur. WorkOS, dont le positionnement officiel est « un ensemble de blocs de construction pour ajouter rapidement des fonctionnalités enterprise à vos applications », et Stripe, qui propose ses services en modules indépendants, incarnent ce nouveau modèle. Pour les professionnels tech, l'enjeu est concret : ils peuvent désormais assembler un éditeur de documents ici, un agent là, et composer un outil sur mesure pour leur usage exact, sans payer pour l'excédent de features qu'ils n'utiliseront jamais. C'est ce que l'auteur appelle l'ère du « logiciel personnalisable ». La montée en puissance des agents IA accélère cette transformation. Un logiciel que l'on ne peut pas piloter par API, CLI ou SDK devient difficile à intégrer dans des workflows automatisés, et donc progressivement obsolète. Les startups qui parient sur cette logique prolifèrent : WorkOS vient de publier auth.md, un protocole ouvert permettant aux agents de s'enregistrer à des services web au nom des utilisateurs. Cloudsail propose des sandboxes Cloudflare fraîches pour agents de code, avec accès shell, Codex et GitHub. Un fondateur solo décrit même dans un billet comment il fait tourner une startup entière avec des agents IA dans les rôles de directeur de cabinet (OpenClaw) et d'ingénieurs (Codex, Devin). L'industrie SaaS n'est peut-être pas morte, mais son modèle monolithique, lui, est sérieusement menacé.

UELes éditeurs SaaS européens et les entreprises françaises acheteuses de logiciels sont directement concernés par ce glissement vers des architectures composables, qui remet en question les modèles d'abonnement monolithiques dominants sur le marché.

OutilsOutil
1 source
Des systèmes d'IA autonomes mettent à l'épreuve la gouvernance dans les environnements physiques
538AI News 

Des systèmes d'IA autonomes mettent à l'épreuve la gouvernance dans les environnements physiques

Le 20 mai dernier, l'Infocomm Media Development Authority (IMDA) de Singapour a publié la version 1.5 de son cadre de gouvernance pour les IA agentiques, au moment où les systèmes d'intelligence artificielle autonomes quittent les environnements logiciels pour s'installer dans les entrepôts, les réseaux de livraison et les espaces publics. Ce cadre définit des lignes directrices pour les organisations qui déploient des agents capables de planifier, décider et agir en plusieurs étapes pour accomplir des objectifs. Parallèlement, lors d'un sommet IA à Singapour la semaine dernière, des acteurs comme Grab ont présenté leurs expériences concrètes : l'entreprise pilote actuellement des véhicules autonomes et des robots de livraison dans le quartier de Punggol, à Singapour. Son directeur technique, Suthen Thomas Paradatheth, a détaillé leur approche : simulation intensive, tests en circuit fermé puis ouvert, et déploiement progressif avant tout passage à l'échelle. L'enjeu central est que les défaillances d'une IA dans le monde physique ont des conséquences bien plus graves que dans le domaine numérique. Le Dr Ya-Qin Zhang, doyen fondateur de l'Institute for AI Industry Research de l'université Tsinghua, a résumé le problème : "Tout risque dans le domaine numérique sera amplifié dans le domaine physique, et le domaine physique aura des conséquences physiques." Les systèmes de transport, les drones, les réseaux logistiques et les infrastructures critiques deviennent des points de vulnérabilité à mesure que l'IA s'intègre plus profondément dans les opérations physiques. Grab a également souligné qu'une longue traîne de problèmes imprévus peut surgir après le déploiement, ce qui rend la surveillance continue non négociable. La plupart des cadres de gouvernance existants se sont concentrés sur les risques en ligne : biais algorithmiques, désinformation, contenus nuisibles. L'émergence des IA incarnées dans des environnements physiques imprévisibles force une refonte de cette approche. Le cadre de l'IMDA préconise des déploiements graduels, une surveillance continue et des tests post-déploiement, reconnaissant explicitement que tous les risques ne peuvent être anticipés avant la mise en service. Les discussions au sommet de Singapour ont pointé vers des modèles de gouvernance fondés sur la télémétrie et les tests itératifs, plutôt que sur une certification unique. L'IMDA recommande aussi d'appliquer le principe du moindre privilège pour les accès des agents, de définir des procédures opérationnelles standard et de prévoir des mécanismes permettant de mettre hors ligne un agent défaillant. La question de la répartition des responsabilités entre développeurs, intégrateurs et opérateurs reste un chantier ouvert dans ce secteur en rapide mutation.

RégulationReglementation
1 source
MDASH : Microsoft chasse les failles IA à l'échelle
539InfoQ AI 

MDASH : Microsoft chasse les failles IA à l'échelle

Microsoft a dévoilé MDASH, une plateforme de sécurité agentique multi-modèles conçue pour automatiser la découverte de vulnérabilités à grande échelle dans Windows et d'autres environnements logiciels de l'entreprise. Le système mobilise plus de 100 agents IA spécialisés qui collaborent pour analyser, valider, débattre et prouver l'existence de failles dans des bases de code complexes. Il s'agit d'une approche radicalement différente des audits de sécurité traditionnels, qui reposaient jusqu'ici sur des équipes humaines réduites face à des millions de lignes de code. L'enjeu est considérable : les grandes entreprises comme Microsoft gèrent des centaines de millions de lignes de code, rendant toute revue manuelle exhaustive impossible. En orchestrant une centaine d'agents capables de se contredire et de valider mutuellement leurs résultats, MDASH vise à réduire les angles morts des audits classiques et à détecter des classes de vulnérabilités qui passeraient autrement inaperçues. Cette automatisation pourrait changer radicalement la vitesse à laquelle des correctifs de sécurité critiques sont identifiés et déployés. Microsoft n'est pas le premier acteur à explorer l'IA pour la recherche de vulnérabilités, Google Project Zero, des startups comme Protect AI ou des initiatives académiques ont déjà testé des approches similaires, mais la mise en production d'un système de cette ampleur par un éditeur majeur marque un tournant. La divulgation publique de MDASH intervient dans un contexte où la pression réglementaire sur la sécurité logicielle s'intensifie, notamment avec le Cyber Resilience Act européen, et où les adversaires étatiques exploitent eux-mêmes l'IA pour accélérer la découverte de failles zero-day.

UELe Cyber Resilience Act européen impose aux éditeurs vendant en UE des obligations de sécurité logicielle renforcées, et l'automatisation à grande échelle de la détection de vulnérabilités que représente MDASH pourrait devenir un benchmark de conformité pour les entreprises européennes soumises à cette réglementation.

💬 Cent agents qui se contredisent pour valider des failles, c'est le vrai truc nouveau ici, pas juste "on a balancé un LLM sur du code". Ça rend aussi définitivement caduque l'idée qu'une petite équipe de chercheurs peut couvrir des centaines de millions de lignes à la main. Reste à voir si les adversaires étatiques, qui font exactement ça depuis des mois, n'ont pas déjà une longueur d'avance.

SécuritéOpinion
1 source
L'avenir de l'IA physique n'est pas humanoïde : il est spécialisé et rentable
540Robotics Business Review 

L'avenir de l'IA physique n'est pas humanoïde : il est spécialisé et rentable

Hailo, fabricant israélien de processeurs IA dédiés au traitement embarqué (edge computing), publie une analyse positionnant l'IA physique comme la prochaine rupture technologique après les phases perception, génératif et agentique. La thèse centrale: les systèmes robotiques autonomes ne peuvent pas dépendre du cloud pour leur boucle de contrôle en temps réel. L'argument est illustré par un cas concret et délibérément banal: un robot d'entretien qui rencontre une chaussette sur le sol. Les systèmes actuels à base de règles prédéfinies la heurtent et se bloquent, nécessitant une intervention humaine. Les architectures alimentées par vision IA l'évitent. Mais la vraie autonomie, selon Hailo, consiste à identifier l'objet, le ramasser et le déposer à sa place, soit une boucle complète perception-raisonnement-action exécutée localement, sans appel réseau. L'article ne fournit pas de métriques de performance ni de benchmarks chiffrés: c'est un positionnement stratégique, pas une publication technique. L'argument pour l'edge est structurellement solide, même si sa source est directement intéressée. La latence introduite par un aller-retour cloud dans une boucle de contrôle robotique représente un risque opérationnel réel: une coupure réseau ou un pic de latence imprévisible dans un contexte de manipulation physique peut provoquer des accidents ou des arrêts de ligne. Le modèle hybride proposé, entraînement dans le cloud, inférence à la périphérie, correspond à ce que déploient déjà des acteurs comme Boston Dynamics (Spot avec traitement embarqué) ou les AMR d'Exotec en logistique. Pour un COO industriel ou un intégrateur, cela se traduit concrètement: les architectures sans dépendance réseau sont une exigence de sécurité fonctionnelle, pas seulement un choix de performance. L'article contredit implicitement la narrative selon laquelle le cloud suffit pour les robots opérationnels, et rejoint les conclusions de plusieurs déploiements terrain où la connectivité intermittente reste le premier point de défaillance. Hailo, fondé en 2017 à Tel Aviv et introduit en bourse en 2024, commercialise les puces Hailo-8 et Hailo-15 destinées à l'inférence embarquée sur caméras, robots et véhicules. Ses concurrents directs sur ce segment sont NVIDIA avec la gamme Jetson Orin, Qualcomm avec ses plateformes Robotics RB-series, et Intel avec les Myriad X. L'article est publié à l'approche du Robotics Summit and Expo de Boston, prévu début juin 2026, où Hailo sera probablement présent. Sur la question humanoïde, le texte est interrompu avant de développer son argument, mais l'amorce est claire: la course au robot polyvalent anthropomorphe (Figure, 1X, Agility Robotics, Unitree) est freinée non par l'IA, mais par les contraintes mécaniques, énergétiques et de coût du hardware. Un signal que les prochains déploiements industriels à grande échelle passeront probablement par des robots à tâche unique, moins coûteux et plus fiables, plutôt que par des humanoïdes généraux.

UEL'argument edge-first s'applique aux déploiements industriels européens et rejoint la pratique d'acteurs comme Exotec (France), mais l'article reste un positionnement marketing sans impact réglementaire ou stratégique direct sur la France ou l'UE.

💬 La chaussette sur le sol, c'est le meilleur exemple que j'ai lu depuis longtemps pour expliquer pourquoi l'edge est non-négociable. Que Hailo ait un intérêt commercial dans l'affaire, peu importe: une boucle perception-action qui dépend du cloud, c'est un point de défaillance que personne ne veut en prod. Et les humanoïdes polyvalents, c'est bien pour les keynotes, les robots à tâche unique qui tournent vraiment, c'est là que les déploiements industriels se passent aujourd'hui.

RobotiqueOpinion
1 source
De nouvelles licornes dans l'infrastructure IA : Exa, Modal, TurboPuffer
541Latent Space 

De nouvelles licornes dans l'infrastructure IA : Exa, Modal, TurboPuffer

Trois entreprises spécialisées dans l'infrastructure pour l'intelligence artificielle ont atteint simultanément des jalons majeurs cette semaine, signalant une consolidation rapide du secteur. TurboPuffer, moteur de recherche vectorielle, annonce 100 millions de dollars de revenus récurrents annuels tout en étant rentable. Exa, moteur de recherche sémantique pour les agents IA, lève 250 millions de dollars dans un tour de Série C qui valorise l'entreprise à 2,2 milliards de dollars. Modal, plateforme cloud de calcul GPU à la demande, annonce quant à elle 355 millions de dollars levés à une valorisation de 4,7 milliards de dollars en Série C. Ces trois annonces tombent dans la même fenêtre de 48 heures, les 20 et 21 mai 2026. Ces chiffres illustrent une dynamique structurelle : l'explosion de la demande en infrastructure IA n'est plus portée uniquement par les grands hyperscalers comme AWS ou Google Cloud, mais de plus en plus par des acteurs spécialisés capables de répondre précisément aux besoins des développeurs d'agents et de pipelines LLM. Modal permet d'exécuter du code Python avec des GPU en quelques secondes sans gérer de serveurs ; Exa fournit une API de recherche conçue pour les LLM plutôt que pour les humains ; TurboPuffer offre une base de données vectorielle haute performance. Que les trois atteignent ces valorisations en même temps indique que le marché des outils pour construire des applications IA génère désormais des revenus réels et prévisibles, pas seulement des promesses. Ces succès s'inscrivent dans un contexte où l'ingénierie IA est devenue une discipline à part entière, distincte de la recherche fondamentale en machine learning. L'émergence d'une couche d'infrastructure spécialisée, entre les modèles de fondation des grands labs et les applications finales, crée un espace économique autonome. Latent Space, le podcast et newsletter qui suit ces entreprises depuis leurs débuts, note avoir interviewé les fondateurs des trois sociétés bien avant ces valorisations, soulignant à quel point la communauté des praticiens IA identifie tôt les acteurs structurants. La question désormais est de savoir si ces entreprises resteront indépendantes ou deviendront des cibles d'acquisition pour les grandes plateformes cloud, qui cherchent à intégrer verticalement la chaîne de valeur du développement IA.

UELes développeurs français et européens d'applications IA disposent désormais d'une couche d'infrastructure spécialisée (compute GPU à la demande, recherche vectorielle, recherche sémantique pour LLMs) comme alternative aux grands hyperscalers pour leurs pipelines d'agents.

💬 TurboPuffer rentable à 100M ARR, Modal à 4,7 milliards, Exa à 2,2, tout ça en 48h, c'est pas du hasard. J'attendais ce signal pour confirmer que la couche infra entre les grands modèles et les applis génère vraiment de l'argent, pas juste du cashburn déguisé en croissance. Si tu construis des trucs avec des LLMs, ces outils sont soit déjà dans ta stack, soit tu vas y venir.

InfrastructureOpinion
1 source
Optimisation des flux de travail en radiologie grâce aux agents IA
542AWS ML Blog 

Optimisation des flux de travail en radiologie grâce aux agents IA

Des chercheurs et ingénieurs d'Amazon Web Services, en partenariat avec Radiology Partners, ont publié un article technique décrivant un système d'agents IA capables d'optimiser l'attribution des examens radiologiques. Le problème qu'ils cherchent à résoudre est documenté par une étude portant sur 62 hôpitaux et 2,2 millions d'examens : les systèmes traditionnels de liste de travail radiologique provoquent des retards moyens de 17,7 minutes sur les cas urgents, et génèrent des surcoûts estimés entre 2,1 et 4,2 millions de dollars par réseau hospitalier. La solution proposée repose sur Amazon Bedrock AgentCore et le Strands Agents SDK, deux outils AWS permettant de déployer des agents autonomes capables de raisonner sur des données cliniques complexes en temps réel. Le coeur du problème est structurel : les systèmes actuels fonctionnent à partir de règles fixes qui ignorent le contexte opérationnel. Ils ne tiennent pas compte de la spécialisation précise du radiologue disponible, de son niveau de fatigue après plusieurs heures consécutives d'interprétations complexes, ni de la difficulté réelle de l'examen à traiter. Ce déficit d'analyse pousse les radiologues à sélectionner les cas les plus simples ou les mieux rémunérés, laissant les études complexes en attente. Les agents IA proposés évaluent simultanément six facteurs : spécialisation, charge de travail actuelle, schémas de fatigue, complexité du cas, urgence clinique et disponibilité. Contrairement aux moteurs déterministes, le système apprend des historiques d'attribution et s'adapte continuellement, réduisant mécaniquement les comportements de sélection opportuniste. Ce développement s'inscrit dans une tendance plus large de l'IA agentique dans les environnements à forte criticité. Les systèmes de type worklist radiologique existent depuis des décennies, mais leur logique déterministe n'a jamais évolué sans intervention humaine manuelle : quand une règle produit un résultat sous-optimal, le même schéma se répète indéfiniment jusqu'à ce qu'un administrateur modifie le paramétrage. L'introduction d'agents fondés sur des modèles de fondation (foundation models) disponibles via Amazon Bedrock représente un changement de paradigme, passant de la gestion de tâches à une orchestration véritablement autonome. Radiology Partners, l'un des plus grands groupes de radiologie aux États-Unis, a choisi de s'associer à AWS pour déployer cette approche à l'échelle industrielle, signalant que l'IA agentique est désormais considérée comme une capacité opérationnelle critique, et non plus comme un projet expérimental.

OutilsOutil
1 source
L'IA en entreprise : obstacles, feuilles de route, cybersécurité et IA physique au deuxième jour de TechEx
543AI News 

L'IA en entreprise : obstacles, feuilles de route, cybersécurité et IA physique au deuxième jour de TechEx

La deuxième journée de la conférence TechEx North America, tenue au San Jose McEnery Convention Center, a concentré ses sessions sur les obstacles concrets au déploiement de l'IA en entreprise. Les intervenants ont ouvert le programme AI & Big Data en évoquant le "cimetière de l'IA", ces projets pilotes qui affichent de bons résultats en phase de test mais échouent à passer en production réelle. Les discussions ont couvert un large spectre : financement basé sur les tokens, choix entre construire ou acheter une infrastructure physique dédiée, conception de fondations de données adaptées aux agents autonomes, et méthodes pour générer un retour sur investissement durable malgré la multiplicité des variables en jeu. Le problème central identifié par les experts est ce qu'ils appellent l'"effet copilote personnel" : un outil d'IA fonctionne remarquablement bien sur le poste d'un utilisateur unique, notamment quand il s'agit d'un dirigeant dont les gains de productivité créent un enthousiasme généralisé dans l'entreprise, mais cette réussite individuelle ne se transpose pas automatiquement à l'échelle d'un département, et encore moins d'une organisation entière. En parallèle, les sessions cybersécurité ont mis en lumière un "écart de vélocité" : les équipes métier adoptent les systèmes d'IA agentique bien plus vite que les équipes sécurité ne peuvent les gouverner, créant des angles morts critiques. L'IA amplifie à la fois les capacités offensives des attaquants, via des outils de scan automatisé d'exploits, et les risques internes liés à des agents non bornés ou mal supervisés. Le phénomène du "shadow IT" se réinvente sous la forme du "shadow AI" : des collaborateurs utilisent des outils d'IA non approuvés pour traiter des données sensibles, ou des systèmes autorisés fonctionnent sans périmètre clairement défini, élargissant la surface d'attaque à l'insu des équipes de sécurité. Face à ce contexte, le principe du "zéro confiance", refus par défaut pour tout utilisateur humain ou machine, est apparu comme une réponse structurante, imposant une vérification d'identité et de niveau de privilège non seulement aux personnes, mais aussi aux services et agents automatisés. La convergence entre gouvernance des données, supervision des systèmes et cybersécurité s'impose désormais comme l'enjeu organisationnel majeur pour toute entreprise cherchant à industrialiser l'IA sans exposer ses actifs critiques.

UELes entreprises européennes, soumises à l'AI Act et au RGPD, sont directement concernées par les problématiques de gouvernance du 'shadow AI' et d'encadrement des agents autonomes décrites dans cette conférence.

SécuritéActu
1 source
Conseil sur le feedback des agents
544Ben's Bites 

Conseil sur le feedback des agents

Un développeur partage une technique récente pour fluidifier ses échanges avec des agents IA : plutôt que de taper ses retours ou d'utiliser la dictée vocale, il enregistre son écran en commentant à voix haute ce qu'il fait, puis fournit cette vidéo directement à l'agent. Ce dernier analyse les images, transcrit la voix, extrait les moments clés horodatés et génère un rapport HTML structuré, avec des GIFs illustrant les points importants et une liste d'actions à accomplir. La méthode permet aussi de naviguer vers d'autres applications pour montrer des exemples de référence, que l'agent intègre dans son analyse. Ben a formalisé cette approche en une "skill" réutilisable baptisée video-to-html, qui instruit l'agent pour convertir n'importe quelle vidéo en document HTML structuré avec keyframes, horodatages et animations courtes. Les fichiers générés servent également de journal de bord du projet, consultables à tout moment. Cette technique s'attaque à un problème concret dans les workflows avec des agents : la difficulté à communiquer un retour visuel précis et contextualisé. Là où les feedbacks textuels restent abstraits et les captures d'écran statiques, la vidéo permet de montrer l'interface en situation réelle, de naviguer entre applications, et de commenter en temps réel ce qui fonctionne ou non. L'approche consomme davantage de tokens, mais l'auteur note que les agents analysent efficacement les frames extraites, rendant une compression préalable via ffmpeg superflue pour la plupart des usages. Pour les équipes travaillant régulièrement avec des agents de développement ou de design, ce type de boucle de feedback visuel structuré pourrait accélérer les itérations de manière significative, en réduisant les allers-retours d'éclaircissement. Cette semaine apporte également plusieurs annonces importantes pour l'écosystème IA. Anthropic a annoncé un changement de politique à compter du 15 juin : les utilisateurs de Claude via des outils tiers comme Cursor, Zed ou T3 Code disposeront d'un quota distinct, équivalent en valeur à leur abonnement mensuel, sans report possible ni tokens subventionnés au-delà. En compensation, les limites hebdomadaires augmentent de 50 % pendant les deux prochains mois. Vercel, de son côté, a publié un index de production basé sur l'usage réel de son AI Gateway : Anthropic capte 61 % des dépenses (porté par Opus), Google représente 38 % des volumes de tokens (grâce à Flash), et les workloads agentiques constituent désormais 59 % de la totalité des tokens consommés. Notion a lancé une plateforme développeur avec une API markdown permettant la synchronisation de données externes et l'intégration d'agents comme Claude directement dans l'outil, accompagnée d'un CLI nommé ntn. Google a présenté "Gemini Intelligence" pour Android, incluant l'autocomplétion de formulaires et la transformation de notes vocales en texte structuré, à quelques jours de sa conférence I/O.

OutilsOutil
1 source
Agent View débarque sur Claude Code : votre armée d’agents IA en une vue
545Le Big Data 

Agent View débarque sur Claude Code : votre armée d’agents IA en une vue

Anthropic a lancé une nouvelle fonctionnalité appelée Agent View pour son outil Claude Code, disponible dès la version 2.1.139 de l'application. Accessible via la commande claude agents dans le terminal, cette interface regroupe l'ensemble des sessions d'agents actives dans un tableau de bord unique intégré directement à l'environnement de développement. Elle est disponible pour tous les abonnements Pro, Max, Team et Enterprise, ainsi que via l'API Claude, dans le respect des limites de débit habituelles. Les administrateurs d'organisation disposent par ailleurs de la possibilité de désactiver la fonctionnalité depuis les paramètres centraux. Chaque ligne du tableau de bord représente une session Claude Code avec son état en temps réel : en cours, en attente de réponse humaine, terminée, inactive, arrêtée ou en échec. Pour les équipes de développeurs qui orchestrent plusieurs tâches simultanées, Agent View change concrètement la façon de travailler. Jusqu'ici, gérer plusieurs agents en parallèle signifiait jongler entre de multiples fenêtres de terminal, sans vue d'ensemble claire sur l'état de chaque processus. Désormais, un développeur peut lancer en parallèle des agents chargés de correctifs, de tests, de revues de code ou de mises à jour, passer de l'un à l'autre sans friction, reprendre une session suspendue à tout moment, et surtout identifier immédiatement les agents qui nécessitent une intervention humaine. Ce gain de visibilité est particulièrement précieux dans les environnements d'intégration continue où le temps perdu à chercher quelle tâche est bloquée peut coûter cher. Cette mise à jour s'inscrit dans une stratégie plus large qu'Anthropic mène depuis plusieurs mois pour transformer Claude Code en véritable plateforme de gestion d'agents IA pour les équipes techniques. L'entreprise avait déjà introduit successivement les sous-agents, les équipes d'agents, les compétences personnalisées, les hooks, les commandes à distance, les tâches programmées et une version web de Claude Code. Agent View est en quelque sorte la pièce qui manquait : elle consolide tous ces blocs épars en une interface cohérente. Anthropic cherche clairement à sortir Claude Code du statut d'assistant à l'écriture de code pour en faire un outil d'orchestration de workflows autonomes, en concurrence directe avec des environnements comme GitHub Copilot Workspace ou les solutions agentiques de Google DeepMind. La question qui reste ouverte est celle de la fiabilité à grande échelle : plus les agents sont nombreux et autonomes, plus la capacité à détecter rapidement les échecs devient critique, et c'est précisément ce que vise Agent View.

OutilsOutil
1 source
L'ingénierie centrée client au service de l'innovation en IA
546MIT Technology Review 

L'ingénierie centrée client au service de l'innovation en IA

Malgré des années d'investissements massifs dans la digitalisation, les grandes entreprises ne capturent en moyenne moins d'un tiers de la valeur attendue, selon une étude McKinsey. Ashish Agrawal, vice-président responsable des technologies de paiement et cartes business chez Capital One, identifie une cause structurelle : la plupart des organisations construisent leurs outils technologiques d'abord, puis cherchent ensuite à les appliquer aux besoins clients. Son équipe a inversé cette logique en adoptant ce qu'il appelle le "customer-back engineering" : partir des attentes, frictions et besoins concrets des utilisateurs, puis remonter vers les solutions techniques. Concrètement, Capital One impose à chaque ingénieur plusieurs points de contact annuels avec les clients : sessions d'empathie digitale pour observer les parcours utilisateurs, immersions au sein du support client, accompagnements terrain aux côtés des équipes commerciales, et hackathons centrés sur de vrais problèmes clients. Cette approche produit un effet multiplicateur sur l'innovation. Quand les ingénieurs sont exposés directement aux difficultés vécues par les utilisateurs, ils développent des solutions que ni les équipes produit ni les équipes commerciales n'auraient imaginées seules, car ils restent naturellement proches des systèmes et des données. L'impact est aussi motivationnel : voir concrètement comment une modification de code améliore la vie d'un client transforme l'engagement des développeurs. Avec l'IA, cet effet est amplifié. Dans le service client de Capital One, des agents conversationnels basés sur l'IA générative peuvent désormais résumer instantanément l'historique d'un échange, fournir au conseiller humain le contexte complet d'une demande et poser automatiquement des questions de suivi ciblées, des tâches qui demandaient auparavant plusieurs minutes de lecture manuelle. Le constat d'Agrawal s'inscrit dans un débat plus large sur la manière dont les grandes entreprises tirent parti de l'IA. Beaucoup ont construit des pipelines de données riches au fil des années sans en exploiter pleinement le potentiel. L'émergence des outils agentiques change la donne : combinés à un écosystème de données de qualité, ils permettent de passer des correctifs incrémentaux à une transformation à haute vélocité. Le véritable frein n'est plus technologique mais organisationnel : rapprocher les ingénieurs des clients demande une discipline managériale forte et une culture délibérément entretenue. Capital One parie que les entreprises qui réussiront à ancrer cette proximité dans leurs pratiques d'ingénierie seront celles capables d'itérer le plus vite, d'identifier les bons problèmes avant leurs concurrents, et donc de transformer l'IA en avantage compétitif durable plutôt qu'en coût technologique supplémentaire.

BusinessOpinion
1 source
OpenAI sort (enfin) l’extension Codex pour Chrome (mais il y a un hic)
547Le Big Data 

OpenAI sort (enfin) l’extension Codex pour Chrome (mais il y a un hic)

OpenAI a lancé le 7 mai 2026 une extension Chrome pour son agent de développement Codex, compatible avec macOS et Windows. L'outil permet à Codex d'opérer directement depuis le navigateur : effectuer des recherches, remplir des formulaires, consulter des tableaux de bord, ou gérer plusieurs tâches en parallèle sur différents onglets, sans mobiliser l'interface principale. L'extension s'intègre notamment avec des plateformes comme LinkedIn, Salesforce ou Gmail, ainsi qu'avec des outils internes d'entreprise qui nécessitent une session déjà authentifiée. Les premiers retours des développeurs sont enthousiastes : l'un d'eux rapporte que Codex a automatiquement détecté et fermé des doublons pour faire passer son nombre d'onglets ouverts de 77 à 42. L'équipe d'OpenAI elle-même a qualifié l'intégration de "miracle". Un bémol notable : l'extension n'est pas encore disponible pour les utilisateurs européens et britanniques, et la version Firefox n'a pas encore été annoncée. Cette extension représente un saut qualitatif dans la manière dont les agents IA s'intègrent au travail quotidien des développeurs et des professionnels. Jusqu'ici, les agents devaient souvent contourner les limitations liées à l'authentification, incapables d'accéder aux plateformes protégées sans sessions actives. En opérant directement dans Chrome, Codex peut désormais agir là où se trouve réellement le travail, c'est-à-dire dans les interfaces web des outils métier. L'agent sélectionne automatiquement le bon mode d'action selon la tâche : il utilise un plugin dédié quand une intégration existe, bascule sur Chrome quand un accès authentifié est requis, et recourt à son navigateur interne pour les environnements locaux. Ce niveau d'autonomie contextuelle réduit considérablement la friction entre l'intention de l'utilisateur et l'exécution réelle, ce qui change la proposition de valeur des agents IA pour les usages professionnels intensifs. Codex est le pari d'OpenAI sur les agents de développement autonomes, un segment en forte compétition avec GitHub Copilot Workspace, Cursor ou encore Devin de Cognition. L'extension Chrome s'inscrit dans une stratégie plus large visant à ancrer Codex dans les workflows réels plutôt que dans des environnements sandbox isolés. Sur le plan de la confidentialité, OpenAI précise ne pas conserver l'historique complet des actions dans Chrome : seuls les éléments utilisés dans le contexte de la conversation sont enregistrés, captures d'écran, textes consultés, appels d'outils. L'entreprise recommande d'éviter de transmettre des informations très sensibles, sauf nécessité vérifiée. Le comportement de l'agent est également conditionné par le paramètre "Mémoires Codex" : activé, il peut s'appuyer sur ses souvenirs enregistrés ; désactivé, il opère sans cet historique. L'absence de disponibilité en Europe reste la principale contrainte à court terme, dans un contexte réglementaire où le RGPD complique le déploiement rapide de ce type d'outil.

UEL'extension n'est pas disponible pour les utilisateurs européens et britanniques, le RGPD compliquant son déploiement rapide dans la région.

💬 L'anecdote des 77 onglets ramenés à 42 fait sourire, mais elle dit quelque chose de vrai : pour la première fois, un agent peut opérer dans les interfaces web avec session active, sans contourner les logins. C'est le verrou qui bloquait tous les agents depuis deux ans. On attendra la disponibilité en Europe, donc.

OutilsOutil
1 source
Sage et AWS veulent démocratiser l’IA agentique dans les PME
548Le Big Data 

Sage et AWS veulent démocratiser l’IA agentique dans les PME

Sage et AWS ont annoncé lors du salon Sage Future à San Francisco un renforcement significatif de leur partenariat stratégique, centré sur l'IA agentique à destination des petites et moyennes entreprises. L'accord porte sur quatre axes concrets : le développement de logiciels financiers cloud enrichis par l'IA, l'intégration des solutions Sage Developer sur Amazon Bedrock AgentCore, la distribution via AWS Marketplace, et l'accélération des migrations des outils de bureau vers le cloud. Concrètement, les agents IA de Sage automatiseront des tâches financières critiques : comptabilité fournisseurs, gestion de trésorerie, paie et rapports de conformité. Steve Hare, PDG de Sage, a résumé la philosophie du projet : "L'IA représente une opportunité majeure pour les PME, mais son adoption dépend avant tout de la confiance, des outils disponibles et de la simplicité d'intégration." Pour les PME, ce partenariat représente un changement de paradigme potentiellement significatif. Aujourd'hui, beaucoup d'entre elles s'appuient encore sur des logiciels financiers installés localement, difficiles à maintenir et inadaptés à l'IA moderne. L'enjeu n'est pas simplement de gagner du temps sur des tâches répétitives : il s'agit de permettre aux dirigeants d'accéder plus rapidement à des données financières fiables pour prendre de meilleures décisions. Via AWS Marketplace, les solutions de Sage pourront être déployées directement dans les environnements que les clients utilisent déjà, sans friction technique supplémentaire. Julia White, directrice marketing d'AWS, estime que les entreprises en croissance "ne devraient plus avoir à choisir entre simplicité et puissance technologique." Ce rapprochement s'inscrit dans une tendance de fond : selon l'International Data Corporation, les dépenses mondiales en IA devraient progresser de 31,9 % par an entre 2025 et 2029. Le marché sort de la phase expérimentale pour entrer dans un déploiement opérationnel à grande échelle, mais les PME restent à la traîne face aux coûts de modernisation et à la complexité des migrations cloud. En combinant l'expertise de Sage dans les logiciels financiers pour PME avec l'infrastructure d'AWS et la puissance de Bedrock AgentCore, les deux groupes cherchent à abaisser ces barrières. Le modèle ouvre également une opportunité aux éditeurs indépendants partenaires de Sage, qui pourront développer des applications compatibles avec AgentCore et les distribuer via la marketplace d'AWS sans reconstruire une infrastructure commerciale de zéro, ce qui pourrait accélérer l'émergence d'un écosystème d'outils financiers agentiques dédiés aux PME.

UESage étant largement déployé dans les PME françaises et européennes, ce partenariat pourrait accélérer la migration vers des logiciels comptables cloud avec IA agentique intégrée, réduisant concrètement les barrières techniques et financières pour les dirigeants de PME en France.

💬 Sage est déjà dans les compta de milliers de PME françaises, c'est ça qui rend l'annonce intéressante. Pas besoin de convaincre quelqu'un de changer d'outil, juste de lui glisser des agents dans ce qu'il utilise déjà. Reste à voir si la promesse "simple à intégrer" tient quand c'est le comptable d'une menuiserie de 12 personnes qui s'y colle.

OutilsOutil
1 source
☕️ Meta voudrait prendre sa revanche sur OpenClaw avec Hatch
549Next INpact 

☕️ Meta voudrait prendre sa revanche sur OpenClaw avec Hatch

Meta développe en secret une plateforme d'agents IA baptisée Hatch, selon des informations publiées par The Information. Les premiers tests de cet agent autonome débuteraient dès juin 2026, et des simulations ont déjà été réalisées dans des environnements web reproduisant des services populaires comme DoorDash, Etsy, Yelp et Outlook. Hatch aurait été entraîné avec les modèles Claude Opus et Sonnet 4.6 d'Anthropic, avant d'être migré vers Muse Spark, le grand modèle de langage développé en interne par Meta. Les équipes travaillent actuellement sur quatre axes prioritaires : la mémoire de l'agent, sa capacité à prendre des initiatives, la gestion des outils tiers et la compréhension de longues séquences d'informations. L'enjeu dépasse la simple course à la démonstration technologique. Ce que Meta cherche à construire, c'est une infrastructure capable de servir des milliards d'utilisateurs avec des agents qui peuvent agir de manière autonome, comprendre des objectifs complexes et travailler en continu pour les atteindre, c'est exactement la formule qu'avait décrite Mark Zuckerberg lors du dernier point de résultats de l'entreprise. En parallèle, Meta plancherait sur un agent de shopping intégré à Instagram, attendu pour le quatrième trimestre 2026 : les utilisateurs pourraient toucher un produit dans un Reel ou un fil de photos pour obtenir des informations et l'acheter directement sans quitter l'application. Une fonctionnalité de shopping en un clic avait déjà été présentée en mars 2026, Hatch représenterait la couche d'intelligence qui rendrait cette expérience vraiment fluide. Hatch ne sort pas de nulle part. Meta avait tenté d'acquérir OpenClaw, la plateforme d'agents autonomes développée par Peter Steinberger, mais celui-ci a finalement choisi de rejoindre OpenAI en début d'année, emportant son projet avec lui. Privé de cette acquisition stratégique, Meta a décidé de construire sa propre solution. Le défi est considérable : les agents IA actuels restent fragiles, enclins aux hallucinations, aux erreurs sur les prix ou les fiches produit, des imperfections que Zuckerberg a lui-même reconnues publiquement. Sur le front commercial, Meta cherche à rattraper TikTok, dont les fonctions de commerce social sont déjà bien établies. Avec Hatch côté agents et l'agent shopping côté Instagram, le groupe positionne l'IA agentique comme le prochain levier de monétisation de ses plateformes, dans une course où OpenAI, Google et Apple jouent également leurs propres cartes.

UEL'agent Hatch et l'agent shopping Instagram de Meta toucheront directement les millions d'utilisateurs européens des plateformes Meta, avec une conformité obligatoire à l'AI Act pour ces systèmes agentiques.

Google ajoute des webhooks événementiels à l'API Gemini et supprime le recours au polling pour les tâches IA longues
550MarkTechPost 

Google ajoute des webhooks événementiels à l'API Gemini et supprime le recours au polling pour les tâches IA longues

Google a intégré des webhooks événementiels à son API Gemini, une fonctionnalité désormais accessible à tous les développeurs utilisant la plateforme. Ce mécanisme de notification en temps réel remplace le système de polling jusqu'ici incontournable dans les pipelines d'intelligence artificielle à long cours. Concrètement, au lieu que le code client envoie des requêtes GET répétées pour vérifier si une tâche est terminée, c'est l'API Gemini qui contacte directement le serveur du développeur dès qu'une opération se conclut, via un HTTP POST instantané. Le système s'applique aux opérations longues durée, appelées Long-Running Operations, comme la génération de vidéos, les sessions Deep Research ou le traitement de milliers de prompts via l'API Batch, des tâches qui peuvent s'étaler sur plusieurs minutes voire plusieurs heures. Cette évolution répond à un problème concret d'efficacité à grande échelle. Le polling continu consomme inutilement du quota API et des ressources de calcul, tout en introduisant un délai artificiel entre la fin d'une tâche et le moment où l'application en est informée. Pour les architectures agentiques ou les pipelines de traitement en volume, ces frictions se cumulent et deviennent un goulet d'étranglement opérationnel. Avec les webhooks, la latence de notification tombe à zéro et le quota économisé peut être redirigé vers le traitement réel. Deux modes de configuration sont disponibles : les webhooks statiques, configurés une fois au niveau du projet via le WebhookService API pour des intégrations globales comme les notifications Slack ou la synchronisation de bases de données, et les webhooks dynamiques, définis à la demande pour un appel spécifique via un champ webhookconfig, idéaux pour router des tâches vers des files d'attente dédiées dans les systèmes d'orchestration d'agents. Les webhooks dynamiques supportent également un champ usermetadata permettant d'attacher des paires clé-valeur arbitraires à chaque job, comme {"job_group": "nightly-eval", "priority": "high"}, facilitant ainsi le routage différencié vers des processeurs en aval sans infrastructure de suivi supplémentaire. Sur le plan de la sécurité, Google s'appuie strictement sur la spécification Standard Webhooks : chaque requête est signée via les en-têtes webhook-signature, webhook-id et webhook-timestamp, garantissant l'idempotence et la protection contre les attaques par rejeu. Les webhooks statiques utilisent un HMAC avec un secret partagé symétrique, fourni une seule fois à la création et impossible à récupérer ensuite en cas de perte. La rotation de ce secret intègre un paramètre REVOKEPREVIOUSSECRETSAFTERH24, qui maintient l'ancien secret valide pendant 24 heures pour permettre une transition sans interruption en production, ou une révocation immédiate en cas d'incident. Cette annonce s'inscrit dans la montée en puissance des workflows agentiques dans l'écosystème Gemini, où Google cherche à outiller les développeurs pour des systèmes autonomes capables de traiter des charges massives de manière fiable et économe en ressources.

UELes développeurs français et européens utilisant l'API Gemini pour des pipelines IA à longue durée peuvent réduire leur consommation de quota et améliorer leurs architectures agentiques en adoptant ces webhooks événementiels.