Aller au contenu principal

Actualités IA — page 239

7 616 articles au fil, du plus récent au plus ancien.

Claude Code s'étend à toute l'organisation via Amazon Bedrock
4761AWS ML Blog 

Claude Code s'étend à toute l'organisation via Amazon Bedrock

Anthropic et Amazon Web Services ont annoncé le lancement de Claude Cowork dans Amazon Bedrock, une intégration qui permet aux entreprises de déployer l'application de bureau Claude directement depuis leur infrastructure AWS. Concrètement, les utilisateurs téléchargent l'application Claude Desktop sur leur machine, puis le service informatique de l'entreprise pousse une configuration centralisée via des outils de gestion de parc comme Jamf, Microsoft Intune ou Group Policy. L'inférence est entièrement routée vers Amazon Bedrock dans les régions AWS choisies par l'organisation, sans licence par siège payée à Anthropic : la facturation est à la consommation, intégrée à l'accord AWS existant. L'application donne accès aux projets, artefacts, mémoire, import-export de fichiers, connecteurs distants et serveurs MCP. Les fonctionnalités nécessitant l'infrastructure Anthropic, onglet Chat, Computer Use, Skills Marketplace, sont exclues de cette offre. L'enjeu dépasse la seule productivité des développeurs. Claude Cowork vise à étendre l'adoption de l'IA à l'ensemble des travailleurs de la connaissance d'une organisation : chefs de produit, analystes, équipes juridiques ou RH peuvent déléguer de la recherche documentaire, de l'analyse de fichiers, de la génération de rapports, sans quitter leur environnement de travail habituel. Pour les entreprises soumises à des contraintes réglementaires strictes, l'argument central est la souveraineté des données : Amazon Bedrock ne stocke pas les prompts, fichiers, inputs ou outputs d'outils, ni les réponses du modèle, et ne les utilise pas pour entraîner des modèles fondamentaux. Les profils d'inférence régionaux, cross-régionaux ou globaux permettent de choisir le niveau de résidence des données adapté à chaque juridiction. Cette annonce s'inscrit dans une dynamique plus large de déploiement entreprise de l'IA générative, où les grands groupes cherchent à concilier puissance des modèles de pointe et exigences de conformité interne. AWS et Anthropic approfondissent ainsi un partenariat stratégique amorcé il y a plusieurs années, Amazon ayant investi plusieurs milliards de dollars dans Anthropic. Pour les organisations qui utilisent déjà Claude Code dans Bedrock pour leurs équipes techniques, la même configuration peut être réutilisée pour déployer Cowork. L'intégration avec IAM, VPC endpoints, CloudTrail et CloudWatch permet une gouvernance et une observabilité natives. La prochaine étape probable : étendre les capacités des serveurs MCP disponibles dans ce contexte géré, afin de connecter Claude aux systèmes métier internes sans compromettre l'isolation réseau.

OutilsOutil
1 source
Les entreprises surestiment leur contrôle sur l'IA : 72 % ne sont pas aussi sécurisées qu'elles le croient
4762VentureBeat AI 

Les entreprises surestiment leur contrôle sur l'IA : 72 % ne sont pas aussi sécurisées qu'elles le croient

Dans 72 % des entreprises interrogées, les décideurs affirment utiliser au moins deux plateformes d'intelligence artificielle qu'ils considèrent comme leur couche "primaire", selon une enquête menée par VentureBeat auprès de 40 grandes entreprises entre janvier et mars 2026. Ce chiffre révèle un écart béant entre la perception du contrôle et la réalité opérationnelle. L'exemple le plus frappant vient du système hospitalier Mass General Brigham (MGB), plus grand employeur du Massachusetts avec 90 000 salariés : l'an dernier, son directeur technique Nallan Sriraman a dû stopper un nombre incontrôlé de projets pilotes internes en IA qui avaient proliféré sans supervision. MGB a depuis construit une plateforme sécurisée maison autour de Microsoft Copilot, capable de supporter jusqu'à 30 000 utilisateurs, pour empêcher que les données de santé protégées (PHI) des patients ne soient transmises au fournisseur du modèle sous-jacent, OpenAI. En parallèle, l'hôpital doit bâtir un "plan de contrôle" central pour orchestrer les agents IA déployés séparément par Epic, Workday et ServiceNow, qui fonctionnent tous différemment. Ce phénomène de dispersion, que VentureBeat nomme "gouvernance mirage", traduit une contradiction structurelle : les entreprises croient avoir mis en place une gouvernance solide alors qu'elles n'ont défini ni responsabilités claires, ni garde-fous précis, ni processus d'évaluation ou de sécurité réels. Pour les responsables de la sécurité en particulier, cette multiplicité de plateformes, issues de Microsoft Azure, Google, OpenAI, Anthropic ou d'éditeurs applicatifs, élargit mécaniquement la surface d'attaque, à un moment où les cyberattaques assistées par IA gagnent en sophistication. Le paradoxe est d'autant plus aigu que les entreprises se sont tournées vers leurs grands fournisseurs logiciels existants pour éviter de dupliquer les efforts, mais se retrouvent malgré tout contraintes de construire autour de leurs lacunes. Ce contexte reflète la vitesse à laquelle les hyperscalers et les grands éditeurs ont intégré l'IA dans leurs offres, forçant leurs clients entreprise à absorber une complexité non anticipée. Comme l'explique Sriraman avec l'analogie des "six aveugles et l'éléphant", chaque fournisseur décrit l'IA à sa façon, rendant toute vision cohérente difficile à construire. Le marché reste "encore naissant", selon ses termes, ce qui rend les décisions stratégiques particulièrement hasardeuses. La prochaine étape pour des organisations comme MGB sera de stabiliser ces plans de contrôle multi-agents tout en attendant que les fournisseurs mûrissent leurs propres capacités de sécurité, un pari sur un calendrier que personne ne maîtrise vraiment.

SécuritéActu
1 source
Le générateur d'images d'OpenAI peut désormais interroger le web
4763The Verge AI 

Le générateur d'images d'OpenAI peut désormais interroger le web

OpenAI a déployé ChatGPT Images 2.0, une nouvelle version de son générateur d'images propulsée par le modèle GPT Image 2. La mise à jour introduit des "capacités de raisonnement" inédites : le système peut désormais interroger le web en temps réel pour enrichir ses créations visuelles à partir d'une seule invite. Ces nouvelles fonctionnalités sont réservées aux abonnés ChatGPT Plus, Pro, Business et Enterprise. En mode raisonnement activé, le générateur peut produire plusieurs images cohérentes à partir d'un même prompt, tout en améliorant le suivi des instructions, la préservation des détails choisis par l'utilisateur et la génération de texte intégré aux images. L'intégration de la recherche web dans un générateur d'images marque un tournant significatif : cela permet au modèle d'incorporer des informations récentes et contextuelles directement dans la création visuelle, sans que l'utilisateur ait à fournir ces données manuellement. Pour les professionnels du marketing, du design ou du journalisme, cela ouvre la voie à des visuels plus précis et actualisés, générés avec moins d'effort. La capacité à produire du texte lisible dans les images reste par ailleurs l'un des défis historiques de l'IA générative, et toute amélioration dans ce domaine a une valeur pratique immédiate. Cette annonce s'inscrit dans une course acharnée entre OpenAI, Google (Imagen) et Midjourney pour dominer le marché des générateurs d'images IA. OpenAI avait déjà surpris le secteur en mars 2025 avec l'intégration native de la génération d'images dans ChatGPT via GPT-4o. L'ajout du raisonnement et de l'accès web à la couche image prolonge cette stratégie d'unification des capacités multimodales dans un seul produit grand public, renforçant la position de ChatGPT comme plateforme centrale de l'IA générative.

ChatGPT Images 2.0 d'OpenAI gère le texte multilingue, les infographies, les diapositives, les cartes et le manga
4764VentureBeat AI 

ChatGPT Images 2.0 d'OpenAI gère le texte multilingue, les infographies, les diapositives, les cartes et le manga

OpenAI a officiellement lancé ChatGPT Images 2.0 ce mois d'avril 2026, quelques mois seulement après la sortie de GPT-Image-1.5 en décembre 2025. Le nouveau modèle, baptisé en interne "duct tape" lors de semaines de tests discrets sur la plateforme LM Arena AI, est désormais accessible à tous les abonnés ChatGPT, tous niveaux confondus. Pour les développeurs, il est disponible via l'API sous le nom gpt-image-2. Ses capacités dépassent largement celles de son prédécesseur : génération de longs blocs de texte multilingues intégrés dans une image, création d'infographies complètes, de diapositives, de cartes, de mangas, de plans d'appartement, de grilles d'images multiples et de modèles de personnages sous différents angles. Le modèle peut également reproduire avec une fidélité troublante des interfaces utilisateur et des captures d'écran de sites réels, intégrer des résultats de recherche web directement dans une image, et s'appliquer aux photos téléversées par les utilisateurs. OpenAI a aussi introduit une suite de fonctionnalités baptisée "Thinking" pour les abonnés ChatGPT. Ce lancement marque un tournant dans la manière dont OpenAI conçoit la création visuelle. La philosophie revendiquée par l'entreprise est explicite dans ses notes de version : "Les images sont un langage, pas une décoration. Une bonne image fait ce que fait une bonne phrase : elle sélectionne, organise et révèle." En pratique, cela signifie que des professionnels du marketing, de la communication, du journalisme ou de la formation peuvent désormais produire des visuels informationnels complexes sans compétences en design. La capacité à reproduire des figures publiques réelles, comme le PDG Sam Altman, soulève aussi des questions sur l'usage de cet outil à des fins de désinformation, notamment dans le contexte de campagnes d'influence politique utilisant des personnages fictifs présentés comme de "vrais Américains" soutenant Donald Trump, un phénomène récemment documenté par le New York Times. La sortie de ChatGPT Images 2.0 intervient dans un marché de la génération d'images IA de plus en plus disputé. Google avait lancé en février 2026 son propre modèle Nano Banana 2, aussi connu sous le nom Gemini 3 Pro Image, capable lui aussi d'intégrer du texte dense dans les images. Mais selon les premiers tests comparatifs, la solution d'OpenAI surpasse Google sur la fidélité des interfaces et la gestion de compositions multi-images. Face aux risques d'abus, Adele Li, responsable produit ChatGPT Images chez OpenAI, a réaffirmé lors d'un briefing presse l'engagement de l'entreprise en matière de sécurité : les images générées sont taguées avec des métadonnées indiquant leur origine artificielle, et des garde-fous spécifiques visent à prévenir toute interférence électorale. OpenAI insiste sur le fait que ces protections distinguent ChatGPT des nouveaux entrants du secteur, qui opèrent avec "des standards et des philosophies différents".

CréationActu
1 source
Une seule API, des rapports complets : la révolution Deep Research est là
4765Le Big Data 

Une seule API, des rapports complets : la révolution Deep Research est là

Google a officiellement lancé le 21 avril 2026 deux nouveaux agents d'analyse accessibles via l'API Gemini : Deep Research et Deep Research Max. Alimentés par le modèle Gemini 3.1 Pro, ces agents transforment une simple requête en rapport d'analyse structuré, en enchaînant automatiquement la collecte de données, le recoupement de sources et la mise en forme des résultats. Deep Research cible les usages interactifs qui privilégient la rapidité, tandis que Deep Research Max adopte une approche plus exhaustive, multipliant les sources et affinant ses conclusions pour une précision accrue. L'API génère également des infographies et des graphiques directement intégrés aux rapports, rendant les données exploitables sans passer par des outils tiers. Des acteurs spécialisés comme FactSet, S&P Global et PitchBook participent déjà à l'écosystème, confirmant l'ancrage industriel de la démarche. Ce lancement change concrètement la façon dont les entreprises peuvent mobiliser l'IA pour l'analyse. Jusqu'ici, les outils de recherche automatisée se limitaient à récupérer des réponses ponctuelles ; l'API Deep Research orchestre un véritable processus d'investigation autonome. Elle connecte le web ouvert aux bases de données internes via le Model Context Protocol, permettant aux organisations d'intégrer leurs données propriétaires dans le flux d'analyse sans les exposer à l'extérieur. L'accès au web peut même être désactivé entièrement, ce qui ouvre la porte aux secteurs soumis à des contraintes de confidentialité strictes, finance, santé, droit. Les utilisateurs conservent par ailleurs un contrôle précis : ils peuvent ajuster le plan de recherche avant son exécution et suivre les étapes en temps réel, ce qui renforce la traçabilité des résultats produits. Cette évolution s'inscrit dans une course technologique qui s'est accélérée depuis que les grands laboratoires ont compris que la valeur des LLM ne réside pas seulement dans la génération de texte, mais dans leur capacité à raisonner sur des corpus complexes et hétérogènes. OpenAI avait ouvert la voie avec son propre produit Deep Research début 2025 ; Google répond aujourd'hui avec une offre directement exposée en API, ciblant les développeurs et les équipes analytiques plutôt que les seuls utilisateurs finaux. Les domaines visés, études de marché, sciences de la vie, analyse financière, sont précisément ceux où le coût de production d'un rapport de qualité est élevé et où la vitesse d'analyse constitue un avantage concurrentiel direct. La prochaine étape sera de mesurer si la qualité des rapports produits tient face aux standards des analystes humains dans ces secteurs exigeants.

OutilsOutil
1 source
Les États-Unis utilisent le premier supercalculateur exascale mondial pour modéliser des supernovae et des réacteurs à fusion
4766Interesting Engineering 

Les États-Unis utilisent le premier supercalculateur exascale mondial pour modéliser des supernovae et des réacteurs à fusion

Des scientifiques américains du laboratoire national d'Oak Ridge (ORNL), rattaché au Département de l'Énergie, ont utilisé Frontier, le superordinateur exascale le plus puissant du monde, pour modéliser la turbulence magnétohydrodynamique (MHD) dans les plasmas. Capable d'effectuer plus de deux quintillions de calculs par seconde, Frontier est classé troisième superordinateur le plus rapide au monde, derrière Aurora et El Capitan. L'équipe, dirigée par le doctorant Semih Kacmaz sous la supervision d'Eliu Huerta, scientifique computationnel à l'Argonne National Laboratory, a développé une approche en deux étapes combinant un opérateur neuronal informé par la physique et un modèle de diffusion génératif. Ensemble, ces deux systèmes d'IA produisent des prédictions de turbulences très détaillées en quelques secondes, avec une réduction des erreurs de plus de moitié par rapport aux méthodes conventionnelles. Ce résultat représente une avancée majeure dans un domaine que les physiciens considèrent comme l'un des plus récalcitrants de leur discipline. La turbulence MHD régit le comportement des gaz ionisés soumis à des champs magnétiques, des phénomènes omniprésents dans l'univers : éruptions solaires, explosions de supernovæ, magnétosphère terrestre. Les méthodes traditionnelles, comme l'approche Reynolds-Averaged Navier-Stokes (RANS), reposent sur des équations simplifiées qui lissent les détails fins et ne capturent pas toute la physique en jeu. Le nouveau cadre IA, lui, reconstruit les petits tourbillons et fluctuations rapides qui définissent les écoulements turbulents, ouvrant la voie à des modèles de supernovæ bien plus précis et à la conception de réacteurs à fusion nucléaire plus efficaces. "C'est la première fois que l'IA parvient à modéliser fidèlement la turbulence magnétisée dans des conditions aussi extrêmes", a déclaré Huerta. La turbulence dans les plasmas constitue un obstacle de longue date pour deux domaines stratégiques : l'astrophysique, qui cherche à comprendre les explosions stellaires, et la fusion nucléaire, dont la viabilité industrielle dépend en partie de la maîtrise du comportement des plasmas à haute énergie. Des projets comme ITER ou les réacteurs privés de Commonwealth Fusion Systems se heurtent précisément à ces instabilités. En mobilisant l'allocation de temps de calcul sur Frontier pour générer des milliers de simulations haute-fidélité servant à entraîner leurs modèles, les chercheurs ont démontré que les supercalculateurs exascale peuvent débloquer des problèmes jugés hors de portée. L'équipe prévoit désormais d'étendre le modèle à des simulations plasma en 3D complètes et à des environnements astrophysiques plus complexes, ce qui pourrait accélérer à la fois la recherche fondamentale sur la dynamique des étoiles et le développement applicatif de la fusion comme source d'énergie décarbonée.

RecherchePaper
1 source
Google lance des agents Deep Research et Deep Research Max pour automatiser la recherche complexe
4767The Decoder 

Google lance des agents Deep Research et Deep Research Max pour automatiser la recherche complexe

Google DeepMind a lancé Deep Research Max, un nouvel agent IA reposant sur Gemini 2.5 Pro, capable de mener des recherches autonomes sur le web et dans des sources de données propriétaires. Pour la première fois, les développeurs peuvent connecter des flux financiers et d'autres sources spécialisées via le Model Context Protocol (MCP). L'agent accompagne une version standard, Deep Research, déjà disponible dans les produits Google, tandis que la variante Max vise davantage les usages professionnels et techniques. L'enjeu est considérable pour les secteurs où l'analyse de données complexes est chronophage : finance, droit, recherche académique, conseil stratégique. En automatisant la collecte et la synthèse d'informations issues de sources hétérogènes, y compris des bases propriétaires inaccessibles au grand public, ces agents pourraient transformer le travail d'analyste ou de chercheur. La possibilité de brancher des flux financiers en temps réel via MCP représente une ouverture concrète vers des cas d'usage enterprise jusqu'ici difficiles à couvrir avec des LLM généralistes. Google s'inscrit ici dans une course intense aux agents de recherche autonomes : OpenAI a lancé son propre Deep Research début 2025, et Perplexity propose des fonctionnalités similaires. Le Model Context Protocol, initialement développé par Anthropic, s'impose progressivement comme standard d'interopérabilité entre agents IA et sources de données tierces, ce qui explique l'adoption par Google. Les benchmarks avancés restent peu transparents sur leur méthodologie, un point de vigilance récurrent dans ce secteur où les annonces marketing précèdent souvent les preuves indépendantes.

Adobe facturera ses agents IA uniquement en cas de succès
4768The Information AI 

Adobe facturera ses agents IA uniquement en cas de succès

Adobe va désormais facturer ses agents d'intelligence artificielle uniquement lorsqu'ils accomplissent réellement une tâche, selon Anil Chakravarthy, président de l'entreprise. Ce modèle de tarification à la performance s'appliquera à CX Enterprise, la nouvelle suite de produits IA rebaptisée cette semaine, qui regroupe des agents capables d'exécuter des "tâches complètes" pour le compte d'entreprises clientes. Concrètement, un agent CX Enterprise peut croiser des données issues d'applications Adobe avec des sources tierces comme des bases de données Amazon Web Services pour diagnostiquer, par exemple, pourquoi les réservations hôtelières chutent dans le sud de la France pour un client du secteur touristique. Ce modèle "pay for outcomes" représente une rupture significative avec les abonnements fixes traditionnels, et va même plus loin que la tarification à l'usage adoptée récemment par Anthropic, Salesforce, ServiceNow ou Workday. Pour les entreprises clientes, l'avantage est clair : elles ne paient que pour des résultats mesurables, ce qui réduit le risque financier lié à l'adoption de ces outils. Pour Adobe, c'est un pari sur la confiance et sur la maturité de ses agents IA, dont la fiabilité doit être suffisante pour supporter ce type d'engagement commercial. Cette annonce s'inscrit dans une recomposition profonde du marché des logiciels d'entreprise autour de l'IA agentique. Des startups comme Sierra ont déjà montré la voie avec cette approche, forçant les grands éditeurs à repenser leurs modèles économiques pour rester compétitifs. Adobe, historiquement positionné sur la création et le marketing digital, cherche à s'imposer dans l'espace de l'expérience client automatisée, un marché en pleine explosion où les agents IA sont appelés à remplacer des workflows entiers. La course à la monétisation de l'IA agentique ne fait que commencer, et le modèle à la performance pourrait rapidement devenir la norme attendue par les acheteurs entreprises.

BusinessOpinion
1 source
4769The Verge 

Les célébrités pourront localiser et demander la suppression des deepfakes IA sur YouTube

YouTube étend son outil de détection des deepfakes générés par intelligence artificielle aux célébrités hollywoodiennes. La fonctionnalité, baptisée "likeness detection", analyse automatiquement les vidéos publiées sur la plateforme pour identifier les contenus synthétiques représentant des personnalités publiques inscrites au programme. Ces dernières peuvent ainsi surveiller les apparitions non autorisées de leur image et soumettre des demandes de retrait, évaluées au cas par cas selon la politique de confidentialité de YouTube, sans garantie de suppression systématique. Cet outil représente une avancée concrète dans la lutte contre les deepfakes non consentis, un phénomène en forte croissance depuis la démocratisation des générateurs vidéo par IA. Pour les personnalités publiques, la capacité de détecter et de contester automatiquement ces contenus réduit considérablement le délai entre la publication d'un faux et son signalement, limitant ainsi la propagation de désinformation ou de contenus compromettants. La démarche signale également que YouTube commence à prendre une responsabilité active sur ce type de contenu, plutôt que d'attendre des signalements manuels. YouTube avait commencé à tester cette fonctionnalité auprès des créateurs de contenu à l'automne 2024, avant de l'étendre aux politiciens et journalistes en mars 2026. L'inclusion des célébrités marque une troisième phase d'un déploiement progressif qui suit la pression réglementaire croissante, notamment aux États-Unis et en Europe, autour des contenus synthétiques non consentis. La question de la gouvernance des deepfakes implique désormais directement les grandes plateformes, qui doivent concilier liberté d'expression, protection de l'image et obligations légales émergentes.

ÉthiqueActu
1 source
Un robot humanoïde Nvidia tient un poste de 8 heures en usine Siemens à 60 bacs par heure
4770Interesting Engineering 

Un robot humanoïde Nvidia tient un poste de 8 heures en usine Siemens à 60 bacs par heure

En janvier 2026, le robot humanoïde HMND 01 Alpha du startup britannique Humanoid a réalisé un déploiement de deux semaines dans l'usine électronique de Siemens à Erlangen, en Allemagne. Les résultats, annoncés à la Hannover Messe 2026 en partenariat avec Nvidia, ont dépassé tous les objectifs fixés : le robot à roues a opéré en continu pendant plus de huit heures, déplaçant 60 bacs de stockage par heure avec un taux de réussite supérieur à 90 %. Sa mission consistait à saisir des bacs, les transporter à travers l'usine et les déposer sur des convoyeurs aux points de transfert désignés pour les opérateurs humains, dans un environnement de production réel où ses performances avaient un impact direct sur les opérations. Stephan Schlauss, directeur mondial de la motion control chez Siemens, a qualifié l'usine d'Erlangen de "customer zero" : Siemens s'est volontairement positionné comme premier client payant et validateur de la technologie, avant de la proposer à d'autres industriels. Ce déploiement est significatif parce qu'il franchit la frontière entre démonstration contrôlée et production industrielle réelle. Le robot a travaillé aux côtés d'humains et de systèmes automatisés existants, coordonnant ses actions en temps réel avec des véhicules à guidage autonome et les systèmes de l'usine via la plateforme Siemens Xcelerator, qui a fourni des capacités de jumeau numérique, de perception par IA, d'interfaces PLC-robot et de gestion de flotte. C'est précisément ce niveau d'intégration enterprise qui distingue un vrai déploiement industriel d'une simple preuve de concept. Deepu Talla, vice-président robotique et edge AI chez Nvidia, a affirmé que ce déploiement ouvre la voie aux robots humanoïdes pour atteindre des objectifs de production réels sur des lignes actives. Humanoid, fondée en 2024 par Artem Sokolov et dont le siège est à Londres avec des bureaux à Boston et Vancouver, emploie plus de 200 ingénieurs issus d'Apple, Tesla, Google et Boston Dynamics. L'entreprise a développé le HMND 01 Alpha en environ sept mois, là où le cycle habituel dépasse 18 à 24 mois, grâce à une approche "simulation d'abord" utilisant Nvidia Isaac Lab pour l'apprentissage par renforcement et Nvidia Isaac Sim pour la validation virtuelle avant tout déploiement physique. La version bipède du robot dispose de 29 degrés de liberté et d'une suite complète de capteurs. Siemens et Humanoid présentent le déploiement d'Erlangen non comme une expérimentation isolée mais comme une architecture de référence reproductible par d'autres fabricants, dans un contexte où la pénurie de main-d'oeuvre dans l'industrie manufacturière et les contraintes de flexibilité rendent les lignes entièrement automatisées souvent inadaptées.

RobotiqueOpinion
1 source
OpenAI lance Euphony : la révolution Codex qui change la lecture des conversations IA
4771Le Big Data 

OpenAI lance Euphony : la révolution Codex qui change la lecture des conversations IA

OpenAI a publié le 21 avril 2026 un nouvel outil open-source baptisé Euphony, conçu pour visualiser les données de chat et les journaux de sessions Codex. Concrètement, l'outil permet aux développeurs de coller une URL publique ou d'importer un fichier local, et Euphony convertit automatiquement ces données brutes en une interface de messagerie lisible dans le navigateur. L'outil prend en charge le rendu Markdown complet, y compris les formules mathématiques et les blocs de code, une fonction de traduction intégrée pour les sessions en langue étrangère, ainsi qu'un mode éditeur permettant de modifier directement le texte et les métadonnées sans changer d'environnement. Le filtrage par requêtes JMESPath permet de trier des milliers de conversations selon des critères très précis, tandis qu'un mode Focus masque les appels d'outils techniques pour ne conserver que le dialogue essentiel. Les développeurs peuvent également partager un lien direct vers un message spécifique et annoter les réponses avec des étiquettes colorées personnalisables. Cet outil répond à un problème concret et quotidien pour quiconque travaille avec des LLMs en production : les logs de sessions d'IA sont volumineux, structurés de façon peu intuitive, et difficiles à analyser manuellement. En rendant ces données navigables visuellement, Euphony accélère les cycles d'évaluation et de débogage. La visualisation des jetons Harmony, qui montre comment le modèle segmente chaque mot, apporte une transparence supplémentaire sur le fonctionnement interne du pipeline. Pour les équipes qui construisent ou affinent des agents IA, la possibilité d'annoter, de filtrer et de partager des extraits précis transforme un outil de consultation en véritable tableau de bord d'évaluation collaborative. OpenAI positionne Euphony dans un contexte où Codex, son moteur de génération de code, est de plus en plus utilisé pour des tâches complexes et des sessions longues générant des volumes importants de données conversationnelles. La publication en open-source signale une stratégie d'ouverture vers la communauté développeur, cohérente avec d'autres initiatives récentes de la société visant à rendre l'écosystème Codex plus accessible. En intégrant nativement le contenu système et les métadonnées développeur dans l'interface, l'outil comble un angle mort des environnements de développement actuels, où l'inspection du contexte complet d'une session reste fastidieuse. La prochaine étape logique serait une intégration directe dans les environnements de développement ou les plateformes d'évaluation de modèles, un marché où des acteurs comme LangSmith ou Weights & Biases sont déjà bien établis.

OutilsOutil
1 source
Construire une gouvernance et une sécurité axées sur les agents autonomes
4772MIT Technology Review 

Construire une gouvernance et une sécurité axées sur les agents autonomes

Alors que les agents d'intelligence artificielle s'intègrent de plus en plus dans le fonctionnement quotidien des grandes entreprises, une nouvelle menace silencieuse se profile : le manque de gouvernance de ces systèmes autonomes crée des angles morts dangereux. Selon le rapport 2026 State of AI du Deloitte AI Institute, 74 % des entreprises prévoient de déployer des agents IA d'ici deux ans. Pourtant, seulement 21 % d'entre elles disposent d'un modèle de gouvernance mature pour superviser ces agents autonomes. Les dirigeants identifient la confidentialité des données et la sécurité comme leur première préoccupation (73 %), devant la conformité légale et réglementaire (50 %) et la supervision des capacités de gouvernance (46 %). Dans de nombreuses organisations modernes, les identités non humaines (systèmes, bots, agents) dépassent déjà en nombre les identités humaines, une tendance qui va s'accélérer brutalement avec l'essor de l'IA agentique. L'enjeu est concret et immédiat : un agent mal sécurisé peut être manipulé pour accéder à des systèmes sensibles, exfiltrer des données propriétaires ou exécuter des actions non autorisées à grande échelle. Sans un plan de contrôle centralisé, ce ne sont pas des expériences isolées qui échouent, mais des déploiements entiers qui dysfonctionnent de façon imprévisible. Andrew Rafla, associé au sein de la pratique Cyber de Deloitte, résume l'exigence minimale : être capable de répondre à la question "quel agent a fait quoi, au nom de qui, avec quelles données, sous quelle politique, et peut-on le reproduire ou l'arrêter ?" Si ces réponses ne sont pas évidentes, l'entreprise n'a pas de plan de contrôle fonctionnel, seulement une exécution non maîtrisée. La gouvernance est précisément ce qui transforme des pilotes impressionnants en cas d'usage industrialisables et sûrs. Ce défi n'est pas apparu du vide. L'accélération des déploiements d'IA depuis 2023 a conduit de nombreuses entreprises à intégrer des agents dans leurs processus sans adapter leurs cadres de sécurité, conçus à l'origine pour des utilisateurs humains. Les outils classiques de gestion des identités et des accès (IAM) ne sont pas pensés pour des entités autonomes capables d'agir en chaîne et à vitesse machine. Ce rapport, produit par Insights, la branche de contenu personnalisé du MIT Technology Review, illustre une prise de conscience croissante dans l'industrie : la course à l'adoption de l'IA agentique doit impérativement s'accompagner d'une infrastructure de contrôle robuste, au risque de voir les gains de productivité annulés par des incidents de sécurité à grande échelle.

SécuritéActu
1 source
4773Ars Technica AI 

Anthropic reçoit 5 milliards de dollars d'Amazon et s'engage à acheter ses puces

Amazon a annoncé un investissement supplémentaire de 5 milliards de dollars dans Anthropic, le créateur du modèle d'IA Claude, portant l'engagement financier total du géant du e-commerce à 13 milliards de dollars. Cet accord, révélé par le Wall Street Journal, prévoit également la possibilité qu'Amazon injecte jusqu'à 20 milliards de dollars supplémentaires si le partenariat atteint certains jalons commerciaux. En contrepartie, Anthropic utilisera ces fonds pour acquérir des puces IA auprès d'Amazon, avec la capacité d'en obtenir suffisamment pour atteindre jusqu'à 5 gigawatts de puissance de calcul, destinés à entraîner et faire fonctionner ses modèles Claude. Cet afflux massif de capitaux arrive à un moment décisif pour Anthropic, qui fait face à une demande explosive pour ses abonnements payants depuis début 2026. Cette montée en charge brutale a mis sous pression l'infrastructure cloud existante, entraînant des problèmes de performance et des interruptions de service pour des milliers d'utilisateurs. Accéder à davantage de capacité de calcul via Amazon Web Services permettrait à Anthropic de stabiliser ses services et de soutenir la croissance rapide de sa base d'utilisateurs sans être freiné par des goulots d'étranglement techniques. Amazon avait déjà investi 8 milliards de dollars dans Anthropic lors de rounds précédents, s'imposant comme l'un des principaux soutiens financiers de la startup. Ce partenariat stratégique positionne AWS comme fournisseur cloud de référence pour Anthropic, face à Microsoft qui joue le même rôle auprès d'OpenAI et Google qui développe ses propres modèles Gemini en interne. La course aux ressources de calcul est devenue l'un des principaux fronts de compétition dans l'IA générative, et cet accord illustre comment les grands acteurs cloud transforment leurs investissements financiers en avantages infrastructurels durables. La clause des 20 milliards conditionnels signale également qu'Amazon mise sur une croissance continue de Claude comme levier commercial stratégique pour AWS.

BusinessActu
1 source
4774VentureBeat AI 

Kimi K2.6 exécute des agents pendant plusieurs jours et révèle les limites de l'orchestration d'entreprise

Moonshot AI, le laboratoire chinois à l'origine de la famille de modèles Kimi, a lancé Kimi K2.6, un modèle conçu spécifiquement pour les agents à exécution continue. Contrairement aux systèmes concurrents, Moonshot revendique des cas d'usage internes où des agents ont fonctionné en autonomie pendant plusieurs heures, et dans un cas documenté, cinq jours d'affilée, pour gérer de la surveillance d'infrastructure et de la réponse à des incidents. Le modèle est désormais disponible sur Hugging Face, via l'API Kimi, Kimi Code et l'application Kimi. Sa principale nouveauté technique réside dans une version améliorée des "Agent Swarms", capables de coordonner jusqu'à 300 sous-agents exécutant simultanément 4 000 étapes parallèles. À la différence de Claude Code d'Anthropic ou de Codex d'OpenAI, qui s'appuient sur des rôles prédéfinis pour orchestrer leurs agents, K2.6 laisse le modèle lui-même décider de l'orchestration en temps réel. Cette évolution met en lumière une fragilité structurelle dans l'écosystème des agents IA : les frameworks d'orchestration existants ont été conçus pour des agents qui s'exécutent en quelques secondes ou minutes, pas pour des processus qui durent des jours. Maintenir l'état d'un agent sur une longue durée pose des problèmes inédits, car l'environnement dans lequel il opère ne cesse d'évoluer pendant son exécution. L'agent doit appeler des outils, des API et des bases de données différents tout au long de sa vie, ce qu'aucun framework actuel n'a été conçu pour gérer proprement. Mark Lambert, directeur produit chez ArmorCode, souligne que le déficit de gouvernance dépasse déjà le rythme de déploiement : ces systèmes génèrent du code et des changements système plus vite que la plupart des organisations ne peuvent les examiner, corriger ou auditer. La course aux agents longue durée s'inscrit dans une compétition plus large entre fournisseurs de modèles, où la capacité d'orchestration est devenue un avantage concurrentiel à part entière. Anthropic, OpenAI et désormais Moonshot AI expérimentent tous des architectures multi-sessions et d'exécution en arrière-plan, mais aucun n'a encore résolu le problème fondamental : sans mécanisme de rollback clair, un agent autonome qui échoue après plusieurs heures d'exécution peut laisser des systèmes dans un état incohérent. Kunal Anand, directeur produit chez F5, résume le défi : l'industrie est passée des scripts aux services, puis aux agents, mais le saut architectural que représentent les agents à long horizon était loin d'être anticipé par la plupart des entreprises. Le praticien Maxim Saplin l'énonce clairement : l'orchestration reste fragile, et ce n'est pas en affinant les prompts qu'on réglera le problème, mais en repensant à la fois les produits et l'entraînement des modèles.

LLMsOpinion
1 source
4775MarkTechPost 

Google présente Simula : un framework de raisonnement pour générer des datasets synthétiques contrôlables dans des domaines IA spécialisés

Google et l'École polytechnique fédérale de Lausanne (EPFL) ont présenté Simula, un nouveau cadre de génération de données synthétiques pensé pour les domaines spécialisés de l'IA, cybersécurité, raisonnement juridique, santé, où les données réelles sont rares, coûteuses ou inaccessibles pour des raisons de confidentialité. Contrairement aux approches classiques qui s'appuient sur des données de départ existantes ou des prompts artisanaux, Simula construit chaque jeu de données à partir de zéro, en traitant la génération de données comme un problème de conception de mécanismes. Le système décompose le processus en quatre étapes distinctes et contrôlables, pilotées par un modèle multimodal (appelé M3), et est capable de produire des jeux d'entraînement à très grande échelle, jusqu'à 512 000 exemples, tout en garantissant qualité, diversité et complexité simultanément. Le défi que Simula tente de résoudre est au cœur du prochain palier de développement de l'IA. Si les modèles généralistes ont pu s'entraîner sur l'immensité du web, les modèles spécialisés butent contre un mur : annoter manuellement des données dans des domaines pointus est lent, cher et sujet aux erreurs. Simplement demander à un grand modèle de langage de générer des données d'entraînement produit des résultats biaisés, répétitifs et peu complexes. Simula répond à cela par une architecture en taxonomies hiérarchiques, le système identifie d'abord les axes de variation d'un domaine (type d'attaque, classe de vulnérabilité, acteur menaçant pour la cybersécurité, par exemple), puis les développe en arbre pour couvrir les cas rares, avec une stratégie "Best-of-N" et une étape de critique automatique pour détecter les sous-catégories manquantes. La diversité locale est gérée par des "méta-prompts" générés à partir de combinaisons de nœuds taxonomiques, tandis qu'une fraction configurable d'exemples passe par une étape de complexification explicite. La publication de Simula s'inscrit dans une course plus large à la donnée synthétique de qualité, portée par des acteurs comme Microsoft, Meta ou des startups spécialisées, mais l'approche de Google se distingue par sa transparence méthodologique et son refus de dépendre de données sources existantes, ce qui ouvre la voie à des domaines où même les données de départ font défaut. L'enjeu est considérable : qui maîtrise la génération de données synthétiques contrôlées maîtrise potentiellement la capacité à entraîner des modèles surspécialisés sans contrainte réglementaire ni coût d'annotation. Google et l'EPFL ont publié leurs travaux via le blog de recherche Google, mais Simula n'est pas encore disponible en open source, la suite dépendra de la décision de Google d'ouvrir ou non l'accès à ce cadre à la communauté.

RecherchePaper
1 source
4776AWS ML Blog 

Traçabilité de bout en bout avec DVC et Amazon SageMaker AI MLflow

Les équipes de machine learning en production font face à un problème récurrent : retracer précisément l'origine d'un modèle déployé. Quelle version du jeu de données l'a entraîné ? Peut-on reproduire à l'identique un modèle mis en production il y a six mois ? Amazon Web Services propose une réponse concrète en combinant trois outils : DVC (Data Version Control), Amazon SageMaker AI et SageMaker AI MLflow Apps. L'architecture s'articule en quatre étapes : un job SageMaker Processing prétraite les données brutes et les versionne via DVC en les poussant vers Amazon S3 ; un job SageMaker Training clone le dépôt DVC à un tag Git précis, récupère le dataset exact via dvc pull, entraîne le modèle et enregistre tout dans MLflow. Chaque run MLflow stocke un identifiant datagitcommit_id, soit le hash DVC pointant vers le dataset exact dans S3. Le modèle entraîné est ensuite enregistré dans le MLflow Model Registry et peut être déployé sur un endpoint SageMaker. La chaîne de traçabilité complète devient alors : modèle en production → run MLflow → commit DVC → dataset dans Amazon S3. Cet enchaînement répond à un besoin critique dans les secteurs régulés : santé, services financiers, véhicules autonomes. Dans ces domaines, les exigences d'audit imposent de relier chaque modèle déployé à ses données d'entraînement précises, et de pouvoir exclure à la demande des enregistrements individuels des futurs cycles d'entraînement. Sans ce niveau de traçabilité, une question apparemment simple, "quelles données ont servi à entraîner le modèle actuellement en production ?", peut mobiliser plusieurs jours d'enquête dans des logs dispersés, des notebooks et des buckets S3. La solution proposée réduit ce risque opérationnel en rendant la traçabilité structurelle plutôt qu'optionnelle. DVC est un outil open source gratuit qui étend Git pour gérer des datasets volumineux et des artefacts ML que Git seul ne peut pas versionner. MLflow, de son côté, assure le suivi des expériences, le registre des modèles et la lignée. Les deux outils couvrent chacun la moitié du problème de traçabilité, et leur combinaison ferme la boucle. L'implémentation requiert un compte AWS avec des permissions sur SageMaker, S3, CodeCommit et IAM, Python 3.11 ou 3.12, et le SDK SageMaker v3.4.0 minimum. Les notebooks utilisent AWS CodeCommit comme backend Git pour les métadonnées DVC, mais l'architecture est compatible avec GitHub, GitLab ou Bitbucket moyennant un simple remplacement de l'URL remote. AWS publie des notebooks d'accompagnement permettant de déployer les deux patterns décrits, traçabilité au niveau du dataset et traçabilité au niveau de l'enregistrement individuel, directement dans un compte AWS existant.

OutilsTuto
1 source
On n’est plus dans la science-fiction : il est vraiment possible d’acheter un robot humanoïde en promo aujourd’hui
4777Frandroid 

On n’est plus dans la science-fiction : il est vraiment possible d’acheter un robot humanoïde en promo aujourd’hui

L'Agibot X2 Ultra, robot humanoïde développé par la société chinoise Agibot, est désormais disponible à l'achat pour le grand public via la plateforme Joybuy, à un prix promotionnel de 36 889 euros contre 41 899 euros habituellement. La machine est capable d'interagir physiquement avec son environnement, de marcher de manière bipède, de danser et d'exécuter des gestes fins comme former un cœur avec les doigts, des capacités qui relevaient encore récemment du domaine expérimental. Ce basculement vers la commercialisation grand public marque un tournant symbolique : pour la première fois, un humanoïde fonctionnel peut être commandé en ligne comme n'importe quel produit électronique haut de gamme. Si le prix reste prohibitif pour un particulier, il se situe dans une fourchette accessible pour des entreprises souhaitant expérimenter l'automatisation physique sans attendre des déploiements industriels à grande échelle. La réduction de 5 000 euros, aussi anecdotique soit-elle, signale une logique de marché en train de s'installer. Agibot, fondée en 2023 à Shanghai et soutenue par des investisseurs proches de l'écosystème technologique chinois, s'inscrit dans une course mondiale à l'humanoïde qui voit s'affronter Figure, 1X, Agility Robotics ou encore Tesla avec Optimus. La Chine pousse activement ce secteur comme axe stratégique, avec des subventions publiques et un tissu industriel capable de produire à coût compétitif. La question n'est plus de savoir si ces robots seront viables, mais à quelle vitesse leurs prix s'effondreront pour atteindre une masse critique d'acheteurs.

RobotiqueOpinion
1 source
4778VentureBeat AI 

Von recommande tous les grands modèles IA pour l'analyse des revenus, et automatise leur combinaison

Von, une nouvelle plateforme d'intelligence artificielle lancée par l'équipe derrière Rattle, une startup spécialisée dans l'automatisation des processus, s'attaque à un paradoxe bien connu dans les entreprises tech : si les outils comme Claude Code ou Cursor ont radicalement transformé le quotidien des développeurs, les équipes commerciales restent, elles, prisonnières de silos de données, de saisies manuelles dans les CRM et de reportings approximatifs. Fondée par Sahil Aggarwal, Von se positionne non pas comme une solution ponctuelle supplémentaire, mais comme une "couche d'intelligence" unifiée pour les équipes Go-To-Market. La plateforme commence par construire un "graphe de contexte" de l'entreprise en ingérant des données structurées issues de CRM comme Salesforce et HubSpot, ainsi que des données non structurées provenant d'enregistreurs d'appels (Gong, Zoom, Chorus), de fils de messagerie et de documentation interne. Elle s'appuie ensuite sur une architecture multi-modèles : Claude d'Anthropic pour le raisonnement de haut niveau, ChatGPT pour le traitement massif de données, et Gemini de Google pour la génération de contenus créatifs comme les présentations et rapports. Lors d'une démonstration, Von a analysé 101 comptes PME pour identifier les risques de désabonnement en un peu plus de trois minutes, une tâche qu'un analyste humain effectuerait en une à deux semaines. L'enjeu est considérable pour les opérations commerciales. L'un des problèmes chroniques des équipes de vente est l'écart entre ce qui est enregistré dans un CRM et ce qui s'est réellement dit lors d'un appel client. Von résout ce problème en croisant automatiquement les transcriptions d'appels avec les données Salesforce, permettant d'identifier des incohérences dans les raisons de pertes de deals ou d'évaluer la santé d'une opportunité commerciale sur la base du sentiment réel exprimé, et non d'une mise à jour manuelle d'un commercial. La plateforme génère également des fiches de briefing pré-appel, des analyses de victoires et défaites commerciales regroupées par thèmes, et automatise les tâches administratives Salesforce à faible valeur ajoutée. En agissant comme un "Data Scientist IA" ou un "VP RevOps" virtuel, Von promet de libérer les équipes des tâches de reporting répétitives pour les recentrer sur la vente. Ce positionnement s'inscrit dans une tendance plus large de l'IA d'entreprise : après avoir conquis les workflows techniques, les grandes plateformes cherchent à s'implanter dans les fonctions commerciales et opérationnelles, historiquement moins automatisées. Von hérite de l'expertise de Rattle dans l'intégration des outils de vente, ce qui lui confère une connaissance fine des flux de données GTM. Le choix d'une stratégie "mixture of models" plutôt que d'un modèle unique reflète une maturité technique croissante dans l'industrie, où l'optimisation coût-performance dicte désormais l'architecture des solutions. La prochaine étape pour Von sera de démontrer sa capacité à s'imposer face à des acteurs établis comme Clari, Gong ou Salesforce Einstein dans un marché de l'intelligence des revenus déjà très concurrentiel et en pleine consolidation.

OutilsOutil
1 source
4779Next INpact 

☕️ OkCupid épinglé pour un transfert de photos d’utilisateurs vers une société d’IA

En mars 2026, OkCupid et sa maison mère Match Group ont conclu un accord avec la Federal Trade Commission (FTC) américaine après la révélation que le site de rencontres avait transmis illégalement les données de ses utilisateurs à une société d'intelligence artificielle. Au cœur de l'affaire : 3 millions de photos d'utilisateurs, accompagnées de données démographiques et de géolocalisation, livrées à Clarifai, une entreprise spécialisée dans la reconnaissance faciale. Les faits remontent à 2014, lorsque Matthew Zeiler, fondateur de Clarifai, contactait Maxwell Khron, cofondateur d'OkCupid, pour obtenir un accès massif aux données du site, dont des dirigeants d'OkCupid étaient par ailleurs actionnaires. Ce transfert s'est effectué sans aucune restriction sur l'usage ultérieur des informations, sans notification aux utilisateurs et sans possibilité pour eux de s'y opposer. L'accord avec la FTC, finalisé fin mars 2026, oblige OkCupid et Match à ne plus induire en erreur leurs membres sur l'utilisation de leurs données personnelles, mais n'implique aucune sanction financière, la FTC ne disposant pas de ce pouvoir. Le scandale illustre une pratique qui touche directement des millions de personnes ayant confié leurs photos et informations intimes à une plateforme de rencontres, sans jamais imaginer que ces données alimenteraient des modèles de reconnaissance faciale commerciaux et militaires. Clarifai compte en effet parmi ses clients l'armée américaine, ce qui soulève des questions sérieuses sur l'usage final de ces données biométriques. L'absence totale de consentement, combinée à la violation explicite de la propre politique de confidentialité d'OkCupid, place cet accord dans la catégorie des manquements les plus graves aux droits des utilisateurs : non seulement les règles internes ont été bafouées, mais une loi fédérale interdisant les pratiques commerciales trompeuses l'a également été. L'enquête de la FTC, ouverte en 2019, aura mis cinq ans à aboutir à un règlement qui, pour beaucoup d'observateurs, reste insuffisant face à l'ampleur des faits. Clarifai, qui n'était pas formellement mise en cause dans la procédure, a affirmé avoir supprimé les données reçues d'OkCupid, mais seulement douze ans après les faits, et sans préciser combien de modèles avaient été entraînés sur ces données ni pendant combien de temps ils avaient été utilisés ou commercialisés. L'affaire s'inscrit dans un contexte plus large de monétisation opaque des données issues des applications de rencontres : des enquêtes parallèles ont révélé que des données similaires ont été revendues pour identifier des membres du clergé catholique. Match Group, qui opère également Tinder, Hinge et plusieurs autres plateformes, se retrouve ainsi au centre d'un débat croissant sur la gouvernance des données personnelles sensibles dans le secteur des applications de rencontres.

ÉthiqueReglementation
1 source
4780VentureBeat AI 

Trois agents de codage IA ont laissé fuiter des secrets via une injection de prompt, un éditeur l'avait prédit

Un chercheur en sécurité de l'Université Johns Hopkins, Aonan Guan, accompagné de ses collègues Zhengyu Liu et Gavin Zhong, a publié la semaine dernière une divulgation technique intitulée "Comment and Control" démontrant qu'une simple injection de prompt dans le titre d'une pull request GitHub suffisait à compromettre trois agents de codage IA majeurs. L'attaque a forcé l'action Claude Code Security Review d'Anthropic à publier sa propre clé API en commentaire, et la même technique a fonctionné sur le Gemini CLI Action de Google ainsi que sur le Copilot Agent de GitHub (Microsoft), sans nécessiter aucune infrastructure externe. Les trois entreprises ont discrètement corrigé la faille : Anthropic l'a classée CVSS 9.4 Critique en versant une prime de 100 dollars, Google a payé 1 337 dollars, et GitHub a accordé 500 dollars via son programme Copilot Bounty. Aucune des trois n'avait publié de CVE officiel ni d'avis de sécurité public au moment de la divulgation. L'impact de cette vulnérabilité touche directement tous les dépôts GitHub utilisant le déclencheur pullrequesttarget, requis par la plupart des intégrations d'agents IA pour accéder aux secrets. Contrairement au déclencheur standard pull_request, ce mode injecte les secrets dans l'environnement d'exécution, exposant collaborateurs, champs de commentaires et flux de code automatisé à des acteurs malveillants. Merritt Baer, directrice de la sécurité chez Enkrypt AI et ancienne directrice adjointe de la sécurité chez AWS, résume l'enjeu sans détour : la protection doit se situer "à la frontière de l'action, pas à celle du modèle", c'est le runtime qui constitue le véritable périmètre d'exposition. Cette attaque illustre une surface de risque concrète pour toute organisation ayant intégré des agents IA dans ses pipelines de revue de code. Ce qui rend cet incident particulièrement révélateur, c'est que la fiche système d'Anthropic pour Claude Code Security Review indiquait explicitement que l'outil "n'est pas durci contre les injections de prompt", l'exploit n'a fait que confirmer ce qui était documenté. En comparaison, la fiche système d'OpenAI pour GPT-5.4 publie des évaluations d'injection au niveau du modèle mais ne documente pas la résistance au niveau du runtime ou de l'exécution des outils. Celle de Google pour Gemini 3.1 Pro, publiée en février, renvoie pour l'essentiel à une documentation plus ancienne et maintient son programme de red teaming entièrement interne, sans programme cyber externe. L'écart entre ce que les éditeurs documentent et ce qu'ils protègent réellement est désormais au coeur du débat sur la sécurité des agents IA déployés dans des environnements de développement sensibles.

SécuritéActu
1 source