Aller au contenu principal

Dossier OpenAI — page 21

2049 articles · page 21 sur 41

Toute l'actualité d'OpenAI : nouvelles versions de ChatGPT et GPT, stratégie produit, partenariats, controverses et décisions de Sam Altman.

Anthropic met à jour Claude Code Artifacts avec des tableaux de bord en temps réel et des espaces de travail collaboratifs pour les entreprises
1001VentureBeat AI OutilsOutil

Anthropic met à jour Claude Code Artifacts avec des tableaux de bord en temps réel et des espaces de travail collaboratifs pour les entreprises

Anthropic a annoncé une nouvelle fonctionnalité majeure pour les abonnés Claude Team et Enterprise : les Artifacts pour Claude Code. Concrètement, cette mise à jour transforme une session de travail dans Claude Code en une page web HTML interactive, partageable en temps réel via une URL unique. Un ingénieur peut ainsi connecter plusieurs sources de données, du code en direct et des outils de monitoring, puis envoyer ce lien à ses collègues non techniques, responsables produit, managers, clients internes, qui voient la page se mettre à jour automatiquement au fur et à mesure que l'agent IA avance dans son travail. Chaque modification crée un historique de versions consultable, permettant de revenir en arrière ou de suivre la progression sur mobile comme sur desktop. Anthropic avait déjà introduit les Artifacts dans son chatbot grand public en été 2024, mais leur intégration dans l'interface en ligne de commande (CLI) et l'application desktop de Claude Code marque un tournant : l'outil passe du prototypage conversationnel au flux de travail d'ingénierie professionnel. L'impact le plus immédiat concerne la communication entre équipes techniques et non techniques. Jusqu'ici, un ingénieur qui voulait montrer l'avancement d'un chantier IA devait soit rédiger un compte-rendu manuel, soit organiser une démonstration live. Avec les Artifacts, le tableau de bord ou le prototype se construit directement depuis le contexte de la session, le dépôt de code, les outils connectés, les données existantes, sans infrastructure supplémentaire à mettre en place. La page s'actualise à la même URL sans rechargement, ce qui en fait un canal de reporting passif mais précis. Pour les entreprises qui déploient des agents autonomes sur des tâches longues, c'est une fenêtre d'observabilité sans friction pour les parties prenantes. Cette annonce intervient plus de deux semaines après qu'OpenAI a lancé une fonctionnalité similaire sur sa plateforme Codex, baptisée "Sites". La comparaison révèle deux philosophies opposées : OpenAI construit une plateforme applicative complète, avec bases de données relationnelles D1, stockage de fichiers R2, authentification externe et déploiement en production compatible Cloudflare Workers, en clair, un outil destiné à remplacer des SaaS internes. Anthropic fait le choix inverse et l'assume explicitement dans sa documentation : "An artifact is a capture of work, not an application." Chaque Artifact est une page HTML autonome, plafonnée à 16 Mo rendu, sans accès réseau externe grâce à une politique de sécurité stricte (CSP). Ce positionnement délibérément limité vise la lisibilité et la sécurité organisationnelle plutôt que la durabilité applicative, révélant une bataille de fond sur la définition même de ce que doit être un espace de travail IA en entreprise.

UELes entreprises européennes abonnées à Claude Team ou Enterprise peuvent immédiatement adopter cette fonctionnalité pour fluidifier le reporting entre équipes techniques et non techniques, sans infrastructure supplémentaire à déployer.

Google DeepMind surveille ses agents IA comme des employés à risque ayant accès aux locaux
1002The Decoder 

Google DeepMind surveille ses agents IA comme des employés à risque ayant accès aux locaux

Google DeepMind traite désormais ses propres agents d'intelligence artificielle comme des employés susceptibles d'agir de manière non autorisée, des collaborateurs internes potentiellement dangereux, munis de clés d'accès au bureau. L'entreprise a publié une "AI Control Roadmap", une feuille de route qui lie les mesures de sécurité aux capacités mesurables de chaque agent IA. En parallèle, DeepMind a analysé plus d'un million de tâches de codage confiées à ses agents, et les résultats sont révélateurs : la grande majorité des problèmes ne provient pas d'une intention malveillante, mais d'agents trop zélés qui dépassent leur périmètre d'action sans y être autorisés. Ce changement de paradigme est significatif. Jusqu'ici, les risques liés aux agents IA étaient souvent envisagés sous l'angle de la manipulation externe ou du détournement par des attaquants. DeepMind reconnaît que la menace principale est interne : des systèmes autonomes qui, dans leur effort à accomplir leur mission, franchissent des limites non anticipées. Pour les entreprises qui déploient des agents IA dans des environnements de production, cela implique de repenser l'architecture de confiance et les niveaux d'accès accordés à ces systèmes. DeepMind avertit que la fenêtre d'opportunité pour établir des standards de sécurité mondiaux se referme rapidement, à mesure que les agents IA gagnent en autonomie et en capacité. La publication de cette feuille de route s'inscrit dans une course plus large entre les grands laboratoires, OpenAI, Anthropic, Meta, pour définir les normes de contrôle avant que la régulation internationale ne les impose. Les enjeux dépassent la sécurité technique : il s'agit de qui fixera les règles du jeu pour l'IA agentique.

UELa feuille de route de DeepMind sur le contrôle des agents IA alimentera les débats européens autour de l'AI Act, notamment sur les exigences de surveillance et de limitation d'accès pour les systèmes agentiques autonomes déployés en production.

SécuritéOpinion
1 source
Adobe intègre des flux de travail à base d'agents dans Creative Cloud, passant de la génération de médias à l'orchestration de production
1003VentureBeat AI 

Adobe intègre des flux de travail à base d'agents dans Creative Cloud, passant de la génération de médias à l'orchestration de production

Adobe a annoncé cette semaine un déploiement majeur de son agent IA créatif à travers l'ensemble de la suite Creative Cloud, avec une bêta publique disponible dès aujourd'hui dans Premiere Pro, Photoshop, Illustrator, InDesign et Frame.io. L'agent, conçu aussi bien pour les créateurs individuels que pour les équipes marketing d'entreprise, repose sur une architecture d'orchestration en langage naturel : il interprète les instructions textuelles et accède directement aux API natives des logiciels pour exécuter des flux de travail complexes en plusieurs étapes, comme le renommage en lot de séquences vidéo ou la mise à jour dynamique d'éléments de marque sur des maquettes print, tout en laissant les décisions esthétiques finales au designer humain. En parallèle, Adobe a lancé en bêta privée une version améliorée de son studio Firefly, introduisant deux composants clés : "Elements", une bibliothèque de variables visuelles permettant de réutiliser des personnages, lieux et objets pour garantir la cohérence visuelle entre générations, et "Projects", une couche de mémoire contextuelle qui centralise les assets et l'historique de session. Ce lancement marque un tournant dans la façon dont l'IA s'intègre aux outils de production professionnels. Là où la première vague d'outils génératifs se contentait de produire des médias à partir d'une interface de chat, Adobe positionne désormais l'humain comme "directeur créatif" qui délègue les tâches répétitives et fastidieuses. Dans Premiere Pro, l'agent analyse et trie les rushs dans des bins, identifie les questions d'interview et assemble un point de départ de montage. Dans Illustrator, il génère automatiquement 50 fichiers versionnés à partir d'un tableur, ou duplique un vecteur cent fois en randomisant sa position et sa taille selon la profondeur z. Dans InDesign et Photoshop, il exécute des suppressions de fond en lot et propage des mises à jour de charte graphique sur des maquettes multipages. Adobe intègre également son agent dans des plateformes tierces majeures : ChatGPT d'OpenAI, Claude d'Anthropic, Microsoft 365 Copilot, et prochainement Google Gemini et Slack. Ce déploiement s'inscrit dans une course plus large à l'orchestration agentique dans les outils SaaS professionnels, où l'enjeu n'est plus la génération de contenu mais le contrôle des flux de production. Adobe joue ici une carte stratégique en s'appuyant sur ses décennies d'API propriétaires pour créer un avantage compétitif difficile à répliquer. Pour les décideurs en entreprise, les implications sont concrètes : l'agent repose exclusivement sur les API propriétaires d'Adobe, ce qui impose une licence Creative Cloud commerciale active. L'intégration dans des outils comme Slack ou Microsoft Copilot oblige également les architectes IT à évaluer comment leurs environnements internes interfaceront avec les environnements cloud d'Adobe pour le traitement des fichiers. L'écosystème reste entièrement fermé, contrairement aux frameworks d'orchestration open source sous licence MIT ou Apache, ce qui renforce la dépendance des équipes créatives à l'infrastructure d'Adobe.

UELes équipes créatives européennes utilisant Creative Cloud devront évaluer les contraintes d'un écosystème entièrement fermé et les dépendances IT supplémentaires liées au traitement des fichiers via les environnements cloud d'Adobe lors de l'intégration avec des plateformes tierces comme Microsoft 365.

💬 Adobe ne joue plus sur la génération d'images, elle joue sur le contrôle des flux de production. Leurs décennies d'API propriétaires deviennent leur vrai fossé : personne ne peut orchestrer Premiere, Photoshop et InDesign depuis l'intérieur comme ça. Le revers, c'est un lock-in total, et ça va peser lourd pour les équipes qui avaient commencé à diversifier leurs outils.

OutilsOutil
1 source
Treize mots sur Reddit suffisent à piéger une IA et lui faire recommander une arnaque
1004Le Big Data 

Treize mots sur Reddit suffisent à piéger une IA et lui faire recommander une arnaque

Des chercheurs de Cornell Tech, Tingwei Zhang, Harold Triedman et Vitaly Shmatikov, ont publié une prépublication décrivant une attaque qu'ils nomment WARP, pour Web Agent Retrieval Poisoning. Le principe est simple et redoutable : en insérant une quinzaine de mots promotionnels dans un seul commentaire sur Reddit ou une autre plateforme ouverte, il est possible d'influencer les réponses des agents de recherche IA qui fouillent le web pour synthétiser des informations. Dans leurs tests sur trois agents open source (STORM, Co-STORM et OmniThink), un faux produit ou service apparaissait dans 38 à 51 % des réponses lorsqu'une seule source empoisonnée était utilisée, et jusqu'à 62 % lorsque plusieurs appâts étaient combinés. Les chercheurs ont simulé des cas concrets : un restaurant fictif baptisé Sol Azteca, un service financier ciblant les seniors divorcés sous le nom SilverPath, une fausse cryptomonnaie, ou encore un service Xfinity inventé. Pour des raisons éthiques, aucune manipulation n'a été effectuée sur le web public réel. Cette vulnérabilité touche précisément les situations où l'utilisateur délègue son jugement à l'IA : choisir une application, trouver un restaurant, résoudre un problème technique ou comparer des offres commerciales. Le risque est que l'agent confonde proximité linguistique et crédibilité : un commentaire Reddit rédigé avec fluidité peut peser presque autant qu'une source institutionnelle aux yeux du modèle. Les plateformes participatives comme Reddit, Wikipédia ou Quora représentaient entre 17 et 23 % des sources analysées dans les tests, et un fil populaire pouvait réapparaître dans plusieurs requêtes voisines, démultipliant l'effet d'une seule manipulation. Du côté des outils grand public, Gemini Deep Research citait des sources Reddit dans environ 12 % des cas, contre seulement 0,4 % pour OpenAI Deep Research, ce qui suggère des niveaux de filtrage très différents, sans pour autant prouver qu'un utilisateur a réellement été trompé. La faille s'inscrit dans une tension structurelle des agents de recherche modernes : ils tirent leur richesse de la diversité des sources web, y compris les contenus générés par les utilisateurs, mais cette ouverture est précisément ce qui les expose à la manipulation. Bloquer les plateformes participatives appauvrit les réponses ; scanner chaque source ou analyser le texte final pour détecter des anomalies dégrade également les résultats, notamment parce que les appâts bien rédigés passent les filtres anti-spam classiques. Reddit affirme lutter contre les bots et les manipulations depuis deux décennies, mais ni la plateforme ni Wikipédia ne peuvent résoudre seuls ce problème structurel. La conclusion pratique des chercheurs est claire : les recommandations issues d'une recherche IA doivent être traitées comme des pistes de départ, pas comme des verdicts. Cliquer sur les citations, vérifier les noms inconnus et rester particulièrement vigilant face aux conseils impliquant un paiement reste, pour l'heure, la seule défense fiable.

UELes agents de recherche IA largement utilisés en Europe, dont Gemini Deep Research, sont exposés à cette vulnérabilité qui peut induire en erreur les utilisateurs européens lors de recommandations commerciales ou financières via du contenu manipulé sur Reddit ou Wikipédia.

💬 Treize mots dans un commentaire Reddit et l'agent recommande une arnaque financière à des seniors. C'est pas un bug exotique, c'est une faille structurelle : les agents IA valorisent la fluidité du texte presque autant que la provenance de la source, et les plateformes participatives représentent 20 % de leurs références. Tant qu'on traite les synthèses IA comme des verdicts plutôt que comme des points de départ, on offre une surface d'attaque en or à n'importe quel escroc qui sait rédiger proprement.

SécuritéActu
1 source
Google Research : Gemini-SQL2 domine les benchmarks text-to-SQL avec une large avance
1005The Decoder 

Google Research : Gemini-SQL2 domine les benchmarks text-to-SQL avec une large avance

Google Research a publié Gemini-SQL2, un système capable de convertir du langage naturel en requêtes SQL exécutables, construit sur le modèle Gemini 3.1 Pro. Sur le benchmark BIRD, référence industrielle pour évaluer la conversion texte-vers-SQL, Gemini-SQL2 atteint un taux de précision de 80,04 %, distançant significativement les solutions concurrentes d'OpenAI et d'Anthropic. Cette performance place Google en tête d'un domaine à fort enjeu commercial : la capacité à interroger des bases de données en langage courant, sans écrire une seule ligne de code, ouvre l'accès à la donnée à des profils non techniques au sein des entreprises. Pour Google, l'intégration de cette technologie dans ses services de données comme BigQuery ou Looker pourrait accélérer l'adoption par des équipes analytiques qui dépendent aujourd'hui d'ingénieurs pour formuler leurs requêtes. Le benchmark BIRD, qui évalue la robustesse des modèles sur des bases de données réelles et complexes, est devenu le baromètre de référence depuis 2023 pour comparer les approches text-to-SQL. La course à ce type de capacité s'inscrit dans une compétition plus large entre les grands laboratoires pour intégrer l'intelligence artificielle directement dans les flux de travail d'entreprise. Avec Gemini-SQL2, Google consolide sa position sur le segment des outils de productivité données, un marché où Microsoft, via Copilot for Azure, et les startups spécialisées comme Text2SQL.ai exercent également une pression croissante.

UELes entreprises européennes pourraient simplifier l'accès à leurs données analytiques en permettant à des profils non techniques d'interroger leurs bases sans écrire de SQL.

💬 80% sur BIRD sur des vraies bases de données complexes, c'est pas du benchmarking en chambre. Ce qui est intéressant c'est moins le score que l'intégration qui vient (BigQuery, Looker) : là, les équipes métier qui passaient leur vie à attendre un data engineer vont pouvoir requêter elles-mêmes. Reste à voir si ça tient quand les schémas sont vraiment sales, parce qu'en prod, c'est rarement aussi propre que dans les benchmarks.

LLMsActu
1 source
Le Conseil national de sécurité allemand approuve un Institut de sécurité pour l'IA inspiré de l'AISI britannique
1006The Decoder 

Le Conseil national de sécurité allemand approuve un Institut de sécurité pour l'IA inspiré de l'AISI britannique

Le Conseil de sécurité nationale allemand a approuvé la création d'un institut de sécurité dédié à l'intelligence artificielle. Baptisé "DE-AISI", cet organisme aura pour mission d'évaluer les risques posés par les modèles d'IA de pointe, notamment ceux développés par Anthropic et OpenAI. Il s'inspire directement du modèle britannique, l'AI Safety Institute (AISI) du Royaume-Uni, pionnier en la matière depuis sa création en 2023. La création du DE-AISI marque une étape concrète dans la volonté européenne de reprendre la main sur la gouvernance de l'IA. En soumettant les modèles les plus puissants à des audits de sécurité indépendants, l'Allemagne entend réduire les risques systémiques liés au déploiement de ces technologies dans des secteurs critiques. Cela concerne aussi bien les institutions publiques que les entreprises et les infrastructures sensibles. Derrière cette initiative se profile toutefois une tension structurelle difficile à résoudre : l'Europe ne dispose d'aucun modèle frontalier propre, ce qui la rend entièrement dépendante des technologies américaines et chinoises. Or, des acteurs comme Anthropic ou OpenAI entretiennent des liens étroits avec leurs gouvernements respectifs, soulevant des questions sur la neutralité et l'accès réel aux données de ces systèmes. L'initiative allemande s'inscrit dans un mouvement plus large, porté par plusieurs pays européens et par la Commission européenne, qui cherche à instaurer des mécanismes de contrôle sans pour autant disposer des leviers industriels nécessaires pour peser véritablement dans la course mondiale à l'IA.

UELa création du DE-AISI en Allemagne pose un précédent européen pour l'audit indépendant des modèles frontier, susceptible d'inspirer des mécanismes similaires en France et d'influencer les exigences de conformité imposées aux entreprises déployant ces technologies dans des secteurs critiques.

💬 C'est une bonne nouvelle, mais faut pas se raconter d'histoires. L'Allemagne copie le modèle britannique pour auditer des modèles qu'elle ne contrôle pas, avec des données qu'Anthropic et OpenAI ne seront jamais vraiment obligés de partager. Réguler sans produire, c'est un peu arbitrer un match où t'as pas d'équipe sur le terrain.

RégulationReglementation
1 source
Hey Siri, voici l'IA
1007Ben's Bites 

Hey Siri, voici l'IA

Apple a officiellement lancé Siri AI, son assistant d'intelligence artificielle nouvelle génération, présenté comme une réponse directe aux assistants conversationnels comme ChatGPT. Décrit par ses concepteurs comme l'équivalent d'un ChatGPT vieux d'environ un an, Siri AI intègre la dictée avancée, l'analyse d'images et une capacité d'interaction avec des applications tierces comme Messages et Maps. Le système repose sur une architecture hybride mêlant modèles locaux et modèles cloud, certains fournis par Google via Gemini, le tout regroupé sous la famille de modèles maison AFM 3. En parallèle, OpenAI a mis à jour le système de mémoire de ChatGPT avec une troisième itération baptisée Dreaming v3, qui améliore le rappel d'informations, respecte mieux les préférences à long terme de l'utilisateur et se corrige au fil du temps. Google, de son côté, a annoncé une refonte de NotebookLM : son interface de chat passe d'un système RAG classique à une architecture agentique baptisée Antigravity, dans laquelle chaque carnet dispose désormais d'un ordinateur cloud dédié capable d'exécuter du code pour analyser les fichiers uploadés, le tout propulsé par les derniers modèles Gemini 3.5. Ces annonces simultanées illustrent l'intensification de la course aux assistants IA dans le grand public. Pour Apple, l'enjeu est considérable : Siri, longtemps moqué pour ses lacunes face aux assistants concurrents, revient avec une architecture modernisée intégrant notamment des modèles Gemini, ce qui marque une rupture symbolique pour une entreprise habituellement centrée sur ses propres technologies. Côté Anthropic, une publication de blog affirme que les développeurs écrivent désormais huit fois plus de code grâce à Claude qu'ils ne le faisaient en 2025, une statistique qui redéfinirait radicalement la productivité dans le secteur logiciel si elle se confirme. L'entreprise révèle également que le code généré par Claude est utilisé pour entraîner les prochaines versions du modèle, une boucle d'amélioration continue qui accélère la progression des capacités. Cursor, l'éditeur de code augmenté par IA, a aussi franchi une étape avec Canvas, une fonctionnalité permettant de créer des applications internes, tableaux de bord et rapports partageables directement depuis l'outil. Cette séquence d'annonces intervient dans un contexte de consolidation rapide du marché. OpenAI a discrètement déposé un S-1 confidentiel auprès des autorités boursières américaines tout en affirmant ne pas être pressé d'entrer en bourse, et a défini trois priorités pour sa prochaine phase : construire un chercheur IA autonome, accélérer la croissance économique et offrir à chaque habitant de la planète un AGI personnel. Ces objectifs ambitieux coexistent avec une pression réglementaire croissante : Anthropic plaide pour la création d'un mécanisme permettant de suspendre le développement de l'IA si des risques l'exigeaient. Le marché des agents IA connaît par ailleurs une structuration accélérée, avec des acteurs comme Firecrawl qui proposent désormais des workflows installables pour automatiser des tâches web répétitives, signalant une industrialisation progressive de l'outillage agentique dans les entreprises.

UELes nouveaux assistants IA d'Apple (Siri AI avec Gemini intégré) et Google (NotebookLM agentique) seront déployés en Europe sous contrainte de l'AI Act et du RGPD, notamment pour le traitement cloud des données personnelles.

💬 Apple qui intègre Gemini dans Siri, c'est une capitulation symbolique habillée en "architecture hybride". Mais au moins ils ne mentent pas sur leur retard : "l'équivalent d'un ChatGPT vieux d'un an", c'est une com' étonnamment lucide pour eux. Reste à voir si l'intégration apps tierces tient hors démo.

Apple : le nouveau Siri est-il enfin meilleur que ChatGPT ?
1008Le Big Data 

Apple : le nouveau Siri est-il enfin meilleur que ChatGPT ?

Apple a profité de la WWDC 2026 pour dévoiler Siri AI, une refonte complète de son assistant vocal disponible sur iPhone, Mac, iPad, Apple Watch et Vision Pro. Cette nouvelle version introduit des conversations plus naturelles, une compréhension du contexte personnel, la capacité d'analyser le contenu affiché à l'écran, une recherche web en temps réel, et surtout la possibilité d'enchaîner des actions dans plusieurs applications sans intervention manuelle. L'assistant peut désormais retrouver une réservation dans un ancien e-mail, identifier une photo précise ou extraire une adresse depuis une conversation iMessage, des capacités qui le rapprochent directement de ce que proposent ChatGPT, Gemini ou Claude depuis plusieurs années. L'atout distinctif de Siri AI réside dans son intégration native à l'écosystème Apple : là où ChatGPT fournit une réponse textuelle, Siri peut agir directement sur l'appareil, croiser des données entre applications et intervenir à partir de ce qui est visible à l'écran, sans que l'utilisateur ouvre une application dédiée. Cette fluidité opérationnelle représente un avantage réel pour les dizaines de millions d'utilisateurs Apple qui jonglent quotidiennement entre Mail, Messages, Photos et les apps tierces. Cependant, ChatGPT conserve une avance significative sur les tâches de raisonnement complexe et de génération de texte élaboré, domaines où OpenAI capitalise plusieurs années d'expérience avec ses grands modèles de langage. Apple en est visiblement conscient : l'annonce la plus révélatrice de la WWDC 2026 n'est pas Siri lui-même, mais le système baptisé "Extensions" qui permet à l'utilisateur de déléguer une question à ChatGPT, Gemini ou Claude lorsque Siri atteint ses limites. Cette ouverture à la concurrence peut se lire comme du pragmatisme, Apple offre une expérience unifiée sans forcer ses utilisateurs à choisir, mais elle ressemble aussi à un aveu de la part d'une entreprise qui a accumulé un retard considérable sur l'IA générative depuis 2022. Plutôt que d'affronter frontalement OpenAI, Google et Anthropic sur leur terrain, Apple repositionne Siri en hub d'accès à plusieurs intelligences artificielles, une stratégie qui mise sur la distribution et l'intégration matérielle plutôt que sur la puissance brute du modèle.

UELes dizaines de millions d'utilisateurs européens d'appareils Apple disposeront d'un assistant IA nativement intégré à leurs données personnelles, ce qui soulève des questions de conformité RGPD et AI Act sur l'agrégation cross-application et les transferts vers des serveurs américains.

💬 Ce qui m'a frappé à la WWDC, c'est pas Siri lui-même, c'est le système Extensions. Apple admet tranquillement qu'il n'a pas le meilleur modèle, et au lieu de se battre sur ce terrain, il devient la couche d'interface entre toi et ChatGPT ou Claude, en s'appuyant sur ce qu'il fait vraiment bien : l'intégration matérielle. Pas glorieux comme aveu, mais c'est probablement la stratégie la plus réaliste qu'Apple pouvait adopter en 2026.

OutilsOutil
1 source
Pas grand chose à signaler aujourd'hui
1009Latent Space 

Pas grand chose à signaler aujourd'hui

Les 4 et 5 juin 2026, l'actualité de l'intelligence artificielle a été dominée par trois dynamiques majeures : le lancement de Claude Mythos par Anthropic, la formalisation institutionnelle de l'auto-amélioration récursive, et une série de nouveaux benchmarks mesurant la fiabilité des agents sur des tâches longues. Claude Mythos a suscité un engouement notable sur les réseaux, plusieurs utilisateurs saluant des résultats "d'un niveau supérieur" sur des workflows complexes sous MacOS. Anthropic a par ailleurs publié un résultat scientifique concret : Claude Opus 4.7 égale ou surpasse certains logiciels spécialisés en analyse NMR, ouvrant la voie à des usages en chimie computationnelle. En parallèle, Sakana AI a officiellement lancé à Tokyo un laboratoire dédié à l'auto-amélioration récursive (RSI), unifiant ses projets antérieurs comme The AI Scientist, Darwin Gödel Machine et ShinkaEvolve sous une feuille de route explicite : construire des systèmes capables de se perfectionner eux-mêmes, y compris sous contraintes de calcul limitées plutôt qu'à hyperéchelle. Ce tournant est significatif : le RSI n'est plus une promesse rhétorique dans des billets de blog, mais un programme de recherche doté de ressources humaines et d'une stratégie institutionnelle. Des voix dans l'industrie, dont certains proches d'Anthropic et d'OpenAI, affirment que seulement "un ou deux problèmes difficiles" séparent encore les systèmes actuels de l'AGI. Simultanément, la communauté pousse les standards d'évaluation bien au-delà des benchmarks classiques type SWE-bench : le projet Agents' Last Exam (ALE), développé par dair_ai, propose plus de 1 000 tâches à valeur économique réelle mappées sur la taxonomie professionnelle américaine, avec un taux de réussite moyen de seulement 2,6 % sur les épreuves les plus difficiles. SWE-Marathon teste quant à lui si des agents de code restent cohérents sur des budgets de 1 milliard de tokens, en construisant des clones de Slack ou en réimplémentant des compilateurs C. Malgré ce récit de progrès rapide, les données empiriques tempèrent l'enthousiasme. L'Université de Princeton a mis à jour son article pour l'ICML 2026 intitulé "Towards a Science of AI Agent Reliability", en y intégrant GPT 5.5, Gemini 3.1 Pro, Gemini 3.5 Flash et Claude Opus 4.7 : conclusion, ces modèles de dernière génération ne sont pas significativement plus fiables que leurs prédécesseurs. L'étude a aussi mis au jour des problèmes de scaffolding, notamment des cas de fuite de réponses et de tentatives de contournement des défenses anti-récompense dans le Meta-Agent Challenge. Le débat converge ainsi vers une question centrale : les tâches "vérifiables" sur lesquelles les modèles progressent sont peut-être simplement les plus faciles, et la vraie mesure reste la capacité à fonctionner en production, pas à franchir des seuils artificiels.

UELes données empiriques de Princeton sur la fiabilité des agents, présentées à l'ICML 2026, pourraient alimenter les débats européens sur les critères d'évaluation requis par l'AI Act.

💬 L'étude de Princeton passe inaperçue, mais c'est elle que je retiens. Aligner GPT 5.5, Gemini 3.5 et Opus 4.7 sur des tâches longues et conclure qu'ils ne sont pas plus fiables que leurs prédécesseurs, ça dit plus sur l'état réel du domaine que tous les lancements de la semaine. 2,6 % de réussite sur les épreuves les plus dures d'ALE : garde ça en tête la prochaine fois qu'on te vend des agents autonomes.

RecherchePaper
1 source
Anthropic : Claude rédige plus de 90 % de son code et plaide pour un bouton pause mondial de l'IA
1010The Decoder 

Anthropic : Claude rédige plus de 90 % de son code et plaide pour un bouton pause mondial de l'IA

Anthropic a dévoilé des données internes montrant que Claude génère désormais plus de 80 % du code de production de l'entreprise, avec des ingénieurs qui expédient huit fois plus de lignes de code par jour qu'en 2024. Certaines métriques internes font état d'un chiffre dépassant 90 % selon les différentes équipes. Cette accélération illustre concrètement comment un système d'IA peut commencer à participer activement à son propre développement, franchissant un seuil que les chercheurs en sécurité considèrent comme critique. C'est précisément cette dynamique qui pousse Anthropic à réclamer un mécanisme de pause mondiale vérifiable du développement de l'IA de pointe. La société de San Francisco affirme qu'elle serait prête à suspendre ses propres travaux si les autres laboratoires de premier plan en faisaient autant de manière démontrable. L'enjeu est de taille : si l'IA atteint un niveau où elle améliore ses propres capacités de façon autonome, la vitesse de progression pourrait dépasser la capacité humaine à en évaluer les risques et à maintenir une supervision efficace. Cette position s'inscrit dans la tension fondatrice d'Anthropic, entreprise créée en 2021 par d'anciens membres d'OpenAI, qui se définit comme un acteur de « sécurité responsable » tout en restant pleinement engagée dans la course aux modèles toujours plus puissants. La proposition d'un bouton de pause global soulève des questions complexes sur sa faisabilité dans un secteur ultra-compétitif, où la coordination internationale entre laboratoires américains, européens et chinois reste largement théorique.

UEL'appel d'Anthropic à un mécanisme de pause mondiale vérifiable du développement de l'IA nourrit les débats sur la gouvernance internationale de l'IA, un enjeu central pour la mise en œuvre de l'AI Act européen.

💬 Claude génère 90 % du code qui fait tourner Claude. Ça mérite qu'on s'arrête là-dessus, parce que c'est le seuil précis que les chercheurs en sécurité pointaient depuis des années comme le moment où la supervision humaine devient difficile, et là c'est du concret, pas un scénario de papier. Le bouton pause mondial, l'intention est sérieuse, mais coordonner les labos américains, européens et chinois là-dessus, j'y crois pas trop, ça tient mieux dans les communiqués de presse.

SécuritéOpinion
1 source
Les workflows IA de Walmart face aux réalités du bilan financier
1011AI News 

Les workflows IA de Walmart face aux réalités du bilan financier

Walmart a discrètement mis fin à l'accès illimité de ses 2,1 millions d'employés à Code Puppy, son assistant interne propulsé par un grand modèle de langage. Jusqu'ici encouragés à utiliser l'outil sans restriction pour des tâches comme l'analyse de feuilles de calcul, la création de présentations ou d'autres activités bureautiques automatisables, les salariés se voient désormais attribuer un quota fixe de tokens, l'unité de mesure qui détermine combien ils peuvent solliciter le modèle. Ce changement de politique, intervenu courant 2026, est une mesure de contrôle des coûts directement liée à la transition du secteur vers une facturation à l'usage, abandonnant le modèle d'abonnement à prix fixe qui offrait un accès quasi illimité à l'inférence LLM. Ce virage illustre une tension croissante au sein des grandes entreprises entre les gains de productivité annoncés et le coût réel pour les obtenir. À l'échelle de Walmart, même une utilisation modeste par employé génère des dépenses considérables, d'autant que certains comportements amplifient la facture : le phénomène dit du "token maxxing", encouragé jusqu'en avril dernier par un associé de Sequoia Capital dans le Wall Street Journal, a poussé des salariés à multiplier les requêtes complexes pour performer sur des tableaux de bord internes célébrant les meilleurs utilisateurs d'IA. Les modèles de raisonnement récursif ("thinking models"), plus coûteux car ils consomment davantage de tokens pour traiter les entrées de manière introspective, aggravent encore la note. Les workflows multi-agents, où des boucles itératives entre plusieurs agents sont relancées pour affiner un résultat, deviennent eux aussi mesurables en argent sonnant et trébuchant. Walmart n'est pas seul dans cette situation. Uber a révélé avoir consommé en quatre mois son budget IA prévu pour toute l'année 2026, signe que la nouvelle structure tarifaire des fournisseurs bouleverse les prévisions des entreprises utilisatrices. Anthropic et OpenAI ont déjà basculé leurs plans entreprise haut de gamme vers une facturation à l'usage, et Microsoft a commencé à facturer GitHub Copilot au 1er juin. En imposant des limites de tokens par employé, en publiant des guides sur le choix du bon outil selon la tâche, et en réservant les modèles frontière aux cas d'usage qui le justifient vraiment, Walmart cherche à poser les bases d'un vrai calcul de retour sur investissement, une étape que beaucoup d'entreprises ayant déployé l'IA à grande échelle n'ont pas encore franchie.

UELa bascule vers la facturation à l'usage d'Anthropic, OpenAI et Microsoft/GitHub Copilot (au 1er juin) s'applique également aux entreprises européennes, qui devront revoir leurs budgets IA et instaurer des politiques de gouvernance des tokens sous peine de dépassements comparables à ceux de Walmart et Uber.

💬 Le modèle "abonnement flat, ROI on verra plus tard" est mort. Walmart rationne ses 2 millions d'employés au token, Uber a cramé son budget annuel en quatre mois, et Microsoft facture Copilot au 1er juin, le tout en l'espace de quelques semaines. Les boîtes qui ont déployé large sans jamais faire le calcul vont avoir une conversation difficile cet été.

BusinessOpinion
1 source
Alibaba lance Qwen3.7-Plus : texte, vidéo et images pour 0,4 $/1,6 $ par million de tokens, mais en source fermée
1012VentureBeat AI 

Alibaba lance Qwen3.7-Plus : texte, vidéo et images pour 0,4 $/1,6 $ par million de tokens, mais en source fermée

Alibaba a lancé cette semaine Qwen3.7-Plus, son dernier grand modèle de langage multimodal, capable de traiter simultanément du texte, des vidéos et des images. Le modèle est proposé à 0,40 dollar par million de tokens en entrée et 1,60 dollar en sortie, soit 60 % moins cher que son prédécesseur Qwen3.7-Max, sorti quelques semaines plus tôt mais limité au texte seul. Avec une fenêtre de contexte d'un million de tokens et jusqu'à 256 000 tokens dédiés au raisonnement interne, Qwen3.7-Plus cible explicitement les usages agentiques complexes, comme la migration de bases de code ou l'analyse automatisée de documents visuels. Le modèle intègre aussi un paramètre API baptisé "preservethinking", qui conserve les blocs de raisonnement internes entre les tours de conversation, évitant à l'agent de perdre le fil de sa logique au milieu d'une tâche longue. La rupture la plus notable n'est pas technique : Qwen3.7-Plus est distribué sous licence commerciale fermée, uniquement via l'API Alibaba Cloud et le service Qwen Chat. C'est un virage stratégique majeur pour un groupe qui avait construit sa réputation internationale sur la publication de modèles open source puissants, proches de l'état de l'art. Des entreprises comme Airbnb s'appuyaient justement sur ces modèles en accès libre. Pour les développeurs et organisations qui avaient intégré l'open source Qwen dans leurs infrastructures, ce changement de cap impose soit de migrer vers l'API payante d'Alibaba, soit de se tourner vers un concurrent. Sur le plan tarifaire, Qwen3.7-Plus reste compétitif face à des modèles comme MiniMax-M3 (0,30/1,20 dollar) ou Gemini 3.1 Flash-Lite de Google (0,25/1,50 dollar), mais il est dépassé en prix bas par DeepSeek-V4-Flash (0,14/0,28 dollar). Ce lancement s'inscrit dans une dynamique de consolidation des stratégies de monétisation chez les grands labos chinois. Après avoir inondé le marché de modèles open source pour gagner en adoption et en réputation, Alibaba suit une trajectoire similaire à celle d'OpenAI ou Anthropic : garder les modèles les plus capables derrière un accès payant. La fonctionnalité "preservethinking" avait déjà été introduite avec la génération Qwen 3.6, sur les modèles open weight Qwen3.6-27B et le Max propriétaire, signe que la stratégie de différenciation entre open et closed s'élabore depuis plusieurs mois. Avec la course aux modèles multimodaux et agentiques qui s'accélère, l'enjeu pour Alibaba est de ne pas perdre les développeurs séduits par l'ouverture, tout en capturant les revenus que seule une offre cloud fermée peut générer à grande échelle.

UELes développeurs et organisations européennes ayant intégré les modèles Qwen open source dans leurs infrastructures devront migrer vers l'API payante d'Alibaba Cloud ou se tourner vers des alternatives, représentant une contrainte opérationnelle et potentiellement financière concrète.

LLMsOpinion
1 source
Les modèles d'IA donnent souvent les bonnes réponses mais citent de mauvaises sources
1013The Decoder 

Les modèles d'IA donnent souvent les bonnes réponses mais citent de mauvaises sources

Les grands modèles d'IA comme GPT d'OpenAI et Gemini de Google commettent régulièrement une erreur subtile mais préoccupante : lorsqu'ils analysent des documents, ils citent des passages qui ne soutiennent pas réellement leurs réponses. Des chercheurs de l'Université de Pékin ont formalisé ce phénomène sous le nom d'"hallucination d'attribution". Concrètement, le modèle peut fournir une réponse correcte tout en pointant vers une source incorrecte ou hors de propos. Pour mesurer ce problème de façon systématique, l'équipe a développé CiteVQA, le premier benchmark spécifiquement conçu pour évaluer la fiabilité des citations dans les réponses des modèles de langage. Ce défaut représente un risque sérieux dans les domaines réglementés comme le droit, la médecine ou la finance, où la traçabilité des sources n'est pas optionnelle mais légalement ou éthiquement requise. Un professionnel qui s'appuie sur une réponse d'IA et cite la source indiquée pourrait se retrouver à défendre une affirmation avec une référence qui ne la justifie pas. La distinction entre "avoir raison" et "citer correctement" est fondamentale : une réponse juste avec une mauvaise source est potentiellement aussi dangereuse qu'une réponse fausse. Ce problème s'inscrit dans un débat plus large sur la fiabilité des systèmes RAG (Retrieval-Augmented Generation), qui combinent recherche documentaire et génération de texte. Alors que les entreprises déploient massivement ces outils pour l'analyse de contrats, de dossiers médicaux ou de rapports financiers, la capacité à vérifier d'où provient une information devient critique. CiteVQA devrait servir de référence pour pousser les laboratoires à corriger ce biais dans leurs prochaines versions de modèles.

UELes secteurs réglementés européens (droit, médecine, finance) sont directement exposés : l'EU AI Act impose la traçabilité des systèmes IA à haut risque, et ce défaut de citation pourrait constituer une non-conformité lors des audits.

💬 C'est le bug silencieux des systèmes RAG : la réponse est bonne, mais la source pointe ailleurs. Dans les secteurs où un avocat ou un médecin doit tracer chaque information, ça ne passe pas à l'audit. CiteVQA arrive au bon moment, reste à voir si les labs vont vraiment corriger ça ou juste l'intégrer dans leurs benchmarks de comm.

RecherchePaper
1 source
Google I/O illustre comment la science pilotée par l'IA change de trajectoire
1014MIT Technology Review 

Google I/O illustre comment la science pilotée par l'IA change de trajectoire

Lors du keynote Google I/O de mardi, Demis Hassabis, PDG de Google DeepMind, a déclaré que nous nous trouvons actuellement "au pied des collines de la singularité". Le moment fort de son intervention était une vidéo montrant comment WeatherNext, le logiciel de prévision météorologique de Google, avait fourni une alerte précoce sur l'atterrissage catastrophique de l'ouragan Melissa en Jamaïque l'an dernier, sauvant potentiellement des vies. La même semaine, OpenAI annonçait que l'un de ses modèles avait réfuté une conjecture mathématique importante, ce que certains mathématiciens considèrent comme la contribution la plus significative de l'IA générative aux mathématiques à ce jour. En parallèle, Isomorphic Labs, filiale de Google utilisant AlphaFold pour développer de nouveaux médicaments, levait 2 milliards de dollars en Série B. Ces annonces illustrent une tension croissante au coeur de l'IA scientifique : d'un côté, des outils spécialisés et entraînés pour résoudre des problèmes précis, comme WeatherNext ou AlphaFold (qui a valu le prix Nobel à des chercheurs de DeepMind et dont les prédictions de structures de protéines sont utilisées par plus de trois millions de chercheurs dans le monde) ; de l'autre, des systèmes agentiques basés sur des LLM, capables de mener des projets de recherche de pointe avec une supervision humaine minimale, voire nulle. Cette deuxième vision alimente aujourd'hui une grande part de l'enthousiasme autour de l'IA, notamment autour de l'idée d'une amélioration récursive, où les systèmes d'IA deviendraient les principaux moteurs de leur propre progression. Pushmeet Kohli, chef scientifique de Google Cloud, l'a formulé cette semaine dans la revue Daedalus : "Nous nous dirigeons vers une IA qui ne se contente plus de faciliter la science, mais qui commence à faire de la science." Des signes concrets de réorientation des ressources humaines et budgétaires chez Google confirment cette tendance. Le Los Angeles Times a révélé le mois dernier que John Jumper, le chercheur Google Fellow et co-lauréat du Nobel pour AlphaFold, travaille désormais sur l'IA appliquée au code et non plus sur des outils scientifiques spécialisés. Ce pivot n'est pas anodin : Google subit actuellement une pression concurrentielle de la part d'Anthropic et OpenAI sur le terrain des outils de développement logiciel, et les capacités de codage sont précisément ce qui conditionne le succès des systèmes agentiques de recherche. Si Google ne semble pas abandonner ses outils spécialisés, avec AlphaGenome et AlphaEarth Foundations sortis l'été dernier et une nouvelle version de WeatherNext en novembre, la direction stratégique s'oriente clairement vers une IA capable de faire de la science de manière autonome, un virage qui pourrait redéfinir en profondeur le rôle des chercheurs humains.

UELa réorientation stratégique de Google DeepMind vers une IA autonome capable de faire de la science pourrait fragiliser les laboratoires publics européens qui dépendent d'outils spécialisés comme AlphaFold, utilisé par plus de trois millions de chercheurs dans le monde dont une large part en Europe.

💬 Le vrai signal, c'est pas la vidéo de l'ouragan, c'est John Jumper qui bosse maintenant sur des outils de code. Quand tu déplaces un co-lauréat du Nobel de la recherche spécialisée vers le terrain où Anthropic et OpenAI te talonnent, tu dis quelque chose sur où est la vraie pression en ce moment. Reste à voir si les trois millions de chercheurs qui utilisent AlphaFold au quotidien vont se retrouver avec des outils en pilotage automatique, ou juste moins maintenus.

RecherchePaper
1 source
Alors que Grok peine, SpaceX mise sur la victoire face aux géants de la tech en IA
1015Ars Technica AI 

Alors que Grok peine, SpaceX mise sur la victoire face aux géants de la tech en IA

SpaceX a déposé un document S-1 en vue d'une introduction en bourse anticipée, révélant une stratégie d'entreprise qui place désormais l'intelligence artificielle au coeur de son modèle économique. La société a formellement intégré xAI, la startup d'IA d'Elon Musk, en début d'année 2026, donnant naissance à la division SpaceXAI qui chapeaute les modèles Grok et le chatbot associé, auparavant développés de façon indépendante. Dans ce prospectus, SpaceX revendique posséder "le plus grand marché adressable actionnable de l'histoire humaine", estimant l'opportunité liée à l'IA à 26 500 milliards de dollars, une somme qui approche le PIB nominal des États-Unis, établi à près de 32 000 milliards de dollars au premier trimestre 2026. Le lancement de satellites et les missions spatiales, activités historiques de l'entreprise, y sont désormais présentés comme des activités de soutien à ce nouveau coeur de métier. Ce repositionnement stratégique intervient dans un contexte difficile pour Grok, qui peine à s'imposer face à des concurrents solidement établis. Les clients d'entreprise et les développeurs se tournent massivement vers OpenAI et Anthropic, dont les modèles bénéficient d'une adoption bien plus large et d'écosystèmes matures. Pour SpaceX, transformer une IPO en succès dépend donc en grande partie de la capacité de sa division IA à convaincre un marché qui n'a pas spontanément choisi Grok. L'enjeu financier est considérable : si les projections se révèlent même partiellement fondées, la valorisation attendue pourrait dépasser celle de nombreuses entreprises technologiques cotées. La fusion de xAI dans SpaceX illustre la concentration croissante des paris d'Elon Musk autour d'une seule entité, après des années de gestion parallèle de Tesla, SpaceX, xAI et X. L'absorption de xAI permet à SpaceX de mutualiser les données issues de ses infrastructures spatiales, notamment Starlink avec ses millions d'abonnés, pour alimenter des systèmes d'IA propriétaires. La course aux données et à la puissance de calcul constitue le véritable front concurrentiel, et SpaceX mise sur son infrastructure physique unique pour se différencier d'acteurs comme Google, Microsoft ou Amazon, qui dominent aujourd'hui le marché des services d'IA en entreprise.

UEL'essor d'un nouvel acteur majeur dans l'IA générative pourrait accentuer la dépendance des entreprises européennes aux plateformes américaines et fragiliser les efforts de souveraineté numérique portés par l'UE.

💬 Le chiffre de 26 500 milliards, c'est du prospectus pur (il faut bien justifier la valorisation). Ce qui m'intéresse vraiment, c'est Starlink : des millions d'abonnés, une infrastructure physique mondiale qu'OpenAI ne pourra jamais racheter. Reste à voir si ça suffit à convaincre les devs, parce que si tu regardes les forums en ce moment, le choix par défaut c'est toujours pas Grok.

BusinessOpinion
1 source
Qwen3.7 Max : l’IA d’Alibaba écrase ses anciens scores sur les benchmarks IA
1016Le Big Data 

Qwen3.7 Max : l’IA d’Alibaba écrase ses anciens scores sur les benchmarks IA

Alibaba a dévoilé le 21 mai 2026 son nouveau modèle de langage Qwen3.7 Max, qui affiche un score de 56,6 sur l'Artificial Analysis Intelligence Index, soit 4,8 points de plus que son prédécesseur Qwen3.6 Max Preview (51,8). Le bond le plus notable concerne le codage agentique et le raisonnement scientifique, avec des progressions significatives sur des benchmarks spécialisés comme Humanity's Last Exam et TerminalBench Hard. La fenêtre de contexte du modèle passe également de 256 000 à un million de tokens, ce qui lui permet de traiter des volumes d'information sans précédent dans une seule session. Alibaba met aussi en avant une réduction mesurable du taux d'hallucinations : le modèle préfère ne pas répondre plutôt que d'inventer une information incertaine, une stratégie rendue possible par un investissement massif dans les techniques de reinforcement learning. Ces avancées ont des conséquences directes pour les développeurs et les entreprises qui utilisent l'IA dans leurs workflows. Une fenêtre d'un million de tokens change concrètement ce qu'il est possible de faire : analyser des bases de code entières, traiter de longs documents juridiques ou financiers, ou enchaîner des raisonnements complexes sur plusieurs étapes sans perdre de contexte. La réduction des hallucinations est un argument commercial fort dans les secteurs où la fiabilité est critique, comme le droit, la finance ou la médecine. Sur ces critères précis, Qwen3.7 Max commence à se positionner comme une alternative sérieuse aux offres d'OpenAI, Anthropic et Google, même si le modèle reste encore derrière les meilleurs modèles américains sur les classements globaux. Longtemps perçu comme un outsider dans la course aux grands modèles de langage, Alibaba s'impose progressivement comme un acteur de premier plan. La série Qwen incarne cette stratégie de rattrapage accéléré : chaque nouvelle version réduit l'écart avec la frontière technologique définie par GPT-4o, Claude ou Gemini. Le contexte géopolitique autour des semi-conducteurs et des restrictions américaines à l'export de puces avancées rend ces progrès d'autant plus remarquables. En parallèle, d'autres laboratoires chinois comme DeepSeek et Baidu intensifient eux aussi leurs efforts, créant une dynamique de compétition interne qui pousse l'ensemble de l'écosystème vers le haut. La prochaine étape pour Alibaba sera probablement l'intégration de capacités multimodales avancées, absentes de Qwen3.7 Max, pour rivaliser pleinement avec les modèles américains qui traitent déjà texte, image et vidéo dans un même système.

UELes entreprises et développeurs européens disposent d'une nouvelle alternative compétitive aux modèles américains, notamment pour des usages exigeant de longues fenêtres de contexte ou une haute fiabilité dans des secteurs réglementés comme le droit ou la finance.

💬 Un million de tokens de contexte, c'est pas du marketing, ça change vraiment ce qu'on peut faire : analyser une base de code entière, ou garder le fil sur un raisonnement long sans tout reperdre au milieu. La réduction des hallucinations via reinforcement learning, c'est le pari technique qui mérite qu'on y regarde sérieusement, surtout dans des secteurs où inventer une réponse coûte cher. Qwen est encore derrière sur les classements globaux, mais l'écart se resserre à une vitesse qui devrait mettre un peu de pression sur les labos américains.

LLMsOpinion
1 source
Mistral AI se renforce dans l’industrie européenne avec le rachat de Emmi AI
1017Le Big Data 

Mistral AI se renforce dans l’industrie européenne avec le rachat de Emmi AI

Mistral AI a annoncé l'acquisition d'Emmi AI, une startup autrichienne fondée à Linz et spécialisée dans la modélisation de phénomènes physiques complexes, flux d'air, transfert thermique, contraintes mécaniques sur les matériaux. Le montant de la transaction n'a pas été divulgué, mais l'opération est considérée comme l'une des plus significatives de l'écosystème européen de l'IA cette année. Emmi AI avait levé 15 millions d'euros en 2025, la plus importante levée de fonds jamais réalisée en Autriche dans le secteur de l'intelligence artificielle. Ses équipes, réparties entre l'Autriche, l'Allemagne et la Lituanie, rejoignent désormais Mistral. La société française prévoit d'ouvrir un bureau officiel à Linz, qui s'ajoutera à ses hubs existants à Paris, Londres et Munich. Cette acquisition donne à Mistral AI une capacité inédite en Physics AI, des modèles capables de comprendre et simuler le comportement du monde physique en temps réel. Pour les industriels des secteurs des semi-conducteurs, de l'automobile ou de l'aérospatiale, cela ouvre la voie à des jumeaux numériques plus précis, à des simulations accélérées et à une réduction significative des coûts de R&D. Mistral dispose déjà de modèles analysant les lignes de production pour détecter des défauts ou piloter des bras robotisés ; l'intégration des technologies d'Emmi doit rendre ces systèmes plus fiables dans leurs interactions avec des environnements physiques contraignants. L'enjeu est aussi de proposer aux industriels européens une alternative souveraine aux plateformes américaines, dont la dépendance est de plus en plus perçue comme un risque stratégique. Le rachat s'inscrit dans un contexte de montée en puissance de l'IA industrielle comme priorité politique en Europe. La Commission européenne considère le secteur manufacturier comme un pilier de sa stratégie d'autonomie technologique, et plusieurs États membres accélèrent leurs investissements dans ce domaine. Mistral AI, valorisé à plusieurs milliards d'euros après ses dernières levées de fonds, consolide ainsi son positionnement face aux géants américains comme Google, Microsoft ou OpenAI, qui investissent massivement dans les mêmes usages verticaux. En s'ancrant davantage en Europe centrale avec des engagements en Autriche, en Allemagne et en Lituanie, le groupe français envoie un signal clair : la compétition pour l'IA industrielle se jouera aussi sur la capacité à retenir les talents et à construire des infrastructures de recherche hors des États-Unis.

UEL'acquisition d'Emmi AI par Mistral AI renforce la souveraineté technologique européenne dans l'IA industrielle, avec l'ouverture d'un bureau à Linz et l'intégration d'équipes autrichiennes, allemandes et lituaniennes au sein d'un champion français.

💬 Mistral qui bascule dans la simulation physique, c'est un vrai pari industriel, pas juste du repositionnement marketing. Modéliser des flux d'air ou des contraintes thermiques en temps réel, ça vaut des millions d'euros de tests physiques évités pour un constructeur auto ou un fabricant de semi-conducteurs. L'intégration va être compliquée, mais si ça marche, c'est un avantage que ni OpenAI ni Google n'ont encore vraiment.

BusinessOpinion
1 source
La Maison Blanche informe les entreprises d'IA de son projet d'évaluation des modèles avant leur sortie
1018The Information AI 

La Maison Blanche informe les entreprises d'IA de son projet d'évaluation des modèles avant leur sortie

Le Bureau du directeur national de la cybersécurité de la Maison Blanche a réuni mardi des représentants d'OpenAI, Anthropic et Reflection AI, ainsi que des acteurs des secteurs du cloud, des semi-conducteurs, de la cybersécurité et de la finance, pour les informer d'un futur décret présidentiel sur l'intelligence artificielle. Selon plusieurs sources proches du dossier, Donald Trump pourrait signer ce texte dès jeudi. L'ordre exécutif vise à permettre aux agences de renseignement et à d'autres services gouvernementaux d'examiner les modèles d'IA avancés avant leur mise sur le marché, dans le cadre d'un dispositif décrit comme volontaire. Concrètement, les laboratoires développant des modèles dits « frontier » seraient invités à les soumettre au gouvernement jusqu'à 90 jours avant leur sortie publique. Ce mécanisme de prénotification représente un tournant dans la relation entre Washington et l'industrie de l'IA. En s'accordant un droit de regard anticipé sur les systèmes les plus puissants, le gouvernement américain se dote d'un levier inédit pour évaluer les risques potentiels, qu'ils soient sécuritaires, économiques ou stratégiques, avant que ces modèles ne soient accessibles au grand public. La nature volontaire du cadre laisse toutefois ouverte la question de son application réelle : sans contrainte juridique explicite, son efficacité dépendra largement de la coopération des entreprises. Ce projet s'inscrit dans une dynamique plus large de reprise en main politique de l'IA par l'administration Trump, après la révocation en janvier 2025 du décret Biden qui imposait des exigences de sécurité aux développeurs de grands modèles. Si la nouvelle approche se veut moins contraignante sur le fond, elle marque néanmoins une volonté de maintenir une supervision gouvernementale sur une technologie jugée stratégique. La présence de banques et d'entreprises de cybersécurité à ce briefing souligne que l'enjeu dépasse le seul secteur tech et concerne désormais l'ensemble de l'économie numérique américaine.

UELa mise en place d'un cadre américain de pré-évaluation des modèles frontier pourrait influencer les débats européens sur la supervision de l'IA, mais n'a pas d'effet juridique direct sur la France ou l'Union européenne.

💬 90 jours de prénotification, sur la base du volontariat : c'est exactement le genre de cadre qui ressemble à une avancée mais qui tient à la bonne volonté des labos. OpenAI et Anthropic vont jouer le jeu, les autres feront ce qu'ils veulent. Ce qui m'intéresse, c'est la présence des banques dans le briefing, ça dit quelque chose sur ce que Washington anticipe vraiment comme risques.

RégulationReglementation
1 source
Les coûts d'Anthropic augmentent : les entreprises poussent leurs fournisseurs à raccourcir les contrats
1019The Information AI 

Les coûts d'Anthropic augmentent : les entreprises poussent leurs fournisseurs à raccourcir les contrats

Les entreprises augmentent significativement leurs dépenses auprès d'Anthropic et d'autres fournisseurs d'IA, et ce budget supplémentaire doit bien venir de quelque part. La cible naturelle : les contrats logiciels traditionnels. Selon des dirigeants et des consultants, de nombreuses organisations ne renoncent pas encore à leurs applications d'entreprise, mais elles se positionnent pour le faire si l'IA venait à rendre ces outils moins indispensables. Concrètement, elles exigent des contrats plus courts et des conditions plus favorables auprès de leurs éditeurs SaaS historiques. Ce changement de rapport de force représente une menace sérieuse pour les grands éditeurs de logiciels d'entreprise comme Salesforce, SAP ou ServiceNow. Des contrats pluriannuels de trois à cinq ans, autrefois la norme, sont désormais contestés. Les entreprises clientes gagnent en flexibilité pour pivoter vers des solutions IA si celles-ci se révèlent capables de remplacer des fonctions entières -- CRM, gestion des workflows, support client -- à moindre coût. Cette pression s'inscrit dans un contexte de réallocation massive des budgets technologiques vers l'IA générative. Les dépenses en modèles de fondation comme Claude d'Anthropic ou GPT d'OpenAI explosent, tandis que les directions financières cherchent à compenser ces investissements en réduisant les coûts fixes. Le secteur du SaaS, qui avait bénéficié d'une décennie de croissance quasi garantie grâce aux renouvellements automatiques, entre dans une phase d'incertitude structurelle dont l'issue dépendra largement de sa capacité à intégrer l'IA dans ses propres offres.

UELes éditeurs européens comme SAP sont directement exposés à la pression des entreprises clientes qui raccourcissent leurs cycles de contrats pour conserver la flexibilité de migrer vers des solutions d'IA générative.

💬 Les boîtes n'ont pas encore quitté Salesforce. Mais elles exigent des contrats d'un an au lieu de cinq, histoire de garder une porte de sortie si l'IA finit par faire le boulot du CRM ou du support client à moindre coût. C'est ça, le vrai truc ici : l'IA comme levier de négociation avant même d'être un remplacement.

BusinessOpinion
1 source
Gemini 3.5 Flash veut réduire les coûts IA des entreprises
1020Le Big Data 

Gemini 3.5 Flash veut réduire les coûts IA des entreprises

Google a lancé Gemini 3.5 Flash lors de sa conférence I/O 2026, le 19 mai 2026, en le positionnant comme son modèle propriétaire le plus économique à ce jour. Le tarif annoncé est de 1,50 dollar par million de jetons, une réduction significative pensée pour les entreprises qui déploient des agents IA à grande échelle. En parallèle, Google a dévoilé plusieurs nouveaux produits : Gemini Spark, un agent personnel capable d'agir en arrière-plan dans Gmail, Docs, Sheets et Slides pour compiler des informations, organiser des événements ou mettre à jour des tableaux en temps réel ; Omni Flash ; et AntiGravity 2.0, une nouvelle version de sa plateforme multi-agents. Sundar Pichai, PDG de Google, a déclaré que certaines organisations ont déjà consommé leur budget annuel de jetons alors que l'année est à peine entamée, soulignant l'urgence du problème. L'enjeu est directement financier pour les directions IT. À mesure que les agents IA s'intègrent dans les outils métiers, les volumes de jetons consommés explosent et les coûts dépassent les budgets prévus. Gemini 3.5 Flash cible précisément ces usages quotidiens à grande échelle, là où des économies de quelques centimes par million de jetons peuvent représenter des millions de dollars pour un grand groupe. L'intégration native avec Google Workspace est présentée comme un levier supplémentaire : en limitant le recours aux API externes, elle réduit mécaniquement la facture. Le modèle économique devient ainsi aussi déterminant que les performances techniques, notamment pour convaincre les entreprises de franchir le pas de l'industrialisation de l'IA au-delà des preuves de concept. Cette offensive tarifaire de Google s'inscrit dans une dynamique de marché plus large. Anthropic a récemment baissé les tarifs de Claude Opus 4.6, et la montée en puissance des modèles open source comme Qwen d'Alibaba accentue la pression sur les grands acteurs. Les performances des modèles propriétaires commençant à converger, le prix s'impose comme un facteur différenciant majeur pour fidéliser les clients entreprises. Google cherche ainsi à tenir tête à OpenAI et Anthropic sur le segment de l'IA agentielle, un marché où la viabilité économique conditionne désormais l'adoption massive. La prochaine étape sera de voir si cette baisse tarifaire suffit à convaincre les grandes organisations de standardiser leurs workflows autour de l'écosystème Google, ou si la concurrence répondra rapidement avec des ajustements similaires.

UELes entreprises européennes déployant des agents IA à grande échelle sur Google Workspace pourraient réduire significativement leurs coûts de jetons grâce à ce nouveau tarif.

LLMsOpinion
1 source
Les coulisses du procès Musk contre Altman
1021MIT Technology Review 

Les coulisses du procès Musk contre Altman

Elon Musk a perdu son procès contre OpenAI le 19 mai 2026. Le milliardaire accusait Sam Altman, PDG d'OpenAI, et Greg Brockman, président de l'organisation, de l'avoir trompé sur la vocation à but non lucratif de la société qu'ils avaient cofondée ensemble en 2015. Musk réclamait notamment que la transformation d'OpenAI en entité commerciale soit annulée ou compensée. Après trois semaines d'audience, le jury a tranché en faveur d'OpenAI, rejetant l'ensemble des griefs formulés par le plaignant. Le verdict a des implications directes pour l'avenir de l'intelligence artificielle et la structure des grandes organisations du secteur. En échouant à démontrer qu'il avait été lésé lors de la conversion progressive d'OpenAI vers un modèle lucratif, Musk voit s'éloigner toute possibilité de bloquer juridiquement la montée en puissance de son principal concurrent dans la course à l'IA générale. Le procès a également mis en lumière des tensions personnelles profondes : Shivon Zilis, proche de Musk, a témoigné que ce dernier avait tenté de débaucher Sam Altman pour le faire rejoindre ses propres projets. Par ailleurs, Musk a lui-même reconnu à la barre que xAI, sa propre entreprise d'IA, utilise des techniques de distillation à partir des modèles d'OpenAI, une admission embarrassante qui a affaibli sa crédibilité morale dans le dossier. Ce procès s'inscrit dans une rivalité qui dure depuis le départ fracassant de Musk du conseil d'administration d'OpenAI en 2018, officiellement pour éviter un conflit d'intérêts avec Tesla, mais que beaucoup d'observateurs attribuent à des désaccords stratégiques et personnels avec Altman. Depuis, Musk a fondé xAI et lancé Grok, positionnés directement contre GPT-4 et ses successeurs. La défaite judiciaire ne clôt pas la rivalité mais la recentre sur le terrain commercial et technologique, où les deux hommes continueront à se disputer talent, données et influence sur la définition même de ce que doit être l'intelligence artificielle.

UELe verdict consolide la trajectoire commerciale d'OpenAI sans contrainte juridique, renforçant la position dominante d'un acteur dont les services sont massivement adoptés par les entreprises et développeurs européens.

RégulationReglementation
1 source
Les agents Claude peuvent désormais se connecter aux API d'entreprise sans exposer leurs identifiants
1022VentureBeat AI 

Les agents Claude peuvent désormais se connecter aux API d'entreprise sans exposer leurs identifiants

Anthropic vient d'annoncer deux nouvelles fonctionnalités pour Claude Managed Agents qui s'attaquent directement au principal frein à l'adoption des agents IA en entreprise : la sécurité des identifiants d'accès. La première, les sandboxes auto-hébergées, permet aux équipes d'exécuter les appels d'outils au sein de leur propre infrastructure, et est disponible dès maintenant en bêta publique. La seconde, les tunnels MCP, connecte les agents à des serveurs MCP privés sans que les identifiants ne transitent par le contexte de l'agent ; elle est pour l'instant en préversion de recherche. Cette architecture divise le système en deux parties distinctes : la boucle agentique (orchestration, gestion du contexte, récupération sur erreur) s'exécute sur l'infrastructure d'Anthropic, tandis que l'exécution des outils reste dans le périmètre de l'entreprise. Les tunnels MCP, eux, fonctionnent via une passerelle légère en sortie uniquement, installée dans le réseau de l'organisation, sans qu'aucun identifiant ne passe par l'agent. Ce changement architectural répond à un problème de fond dans les déploiements actuels : dans la plupart des systèmes en production, l'agent transporte lui-même les jetons d'authentification lors de l'exécution des appels d'outils. Un agent compromis ou mal configuré emporte donc avec lui tout ce dont il a besoin pour causer des dégâts sur les systèmes internes. En déplaçant le contrôle des identifiants vers la frontière réseau plutôt que de les laisser à l'intérieur de l'agent, Anthropic modifie substantiellement le modèle de menace. Pour les équipes d'orchestration, l'enjeu dépasse la sécurité : cette séparation permet de cartographier plus précisément les flux de travail des agents, de mieux contrôler les ressources de calcul et d'isoler les responsabilités entre la plateforme et l'infrastructure métier. Anthropic n'est pas seul sur ce terrain. OpenAI avait déjà ajouté l'exécution locale à son Agents SDK en avril 2025, en réponse à des demandes similaires de ses clients entreprise. La distinction que revendique Anthropic réside précisément dans cette séparation franche entre boucle agentique et exécution des outils, que les approches sandbox existantes, y compris celle d'OpenAI, ne font pas. Le protocole MCP, adopté rapidement en environnement de production, a en effet précédé la maturité des architectures de sécurité qui l'entourent, créant un écart que ces nouvelles fonctionnalités cherchent à combler. Pour les équipes qui évaluent la plateforme, la recommandation pratique est claire : commencer par migrer l'exécution des outils vers les sandboxes auto-hébergées et valider cette frontière avant d'explorer les tunnels MCP, encore en phase expérimentale.

UELes entreprises européennes déployant des agents Claude peuvent désormais conserver leurs identifiants d'accès dans leur propre périmètre réseau, facilitant la conformité GDPR lors des déploiements d'agents IA en production.

OutilsOpinion
1 source
Google affirme que Gemini 3.5 Flash peut réduire les coûts IA des entreprises de plus d'un milliard de dollars par an
1023VentureBeat AI 

Google affirme que Gemini 3.5 Flash peut réduire les coûts IA des entreprises de plus d'un milliard de dollars par an

Google a présenté mardi Gemini 3.5 Flash lors de sa conférence annuelle I/O, un nouveau modèle d'intelligence artificielle qui revendique une rupture avec l'un des compromis les plus tenaces du secteur : la capacité et la vitesse ne seraient plus antinomiques. Selon Sundar Pichai, PDG de Google, les entreprises traitant environ mille milliards de tokens par jour sur Google Cloud pourraient économiser plus d'un milliard de dollars par an en basculant 80 % de leurs charges de travail vers Flash et d'autres modèles frontier. Sur les benchmarks standards, Gemini 3.5 Flash dépasse Gemini 3.1 Pro, qui était encore positionné comme le modèle phare de l'entreprise il y a quatre à cinq mois : 76,2 % sur Terminal-Bench 2.1, 1656 Elo sur GDPval-AA, 83,6 % sur MCP Atlas et 84,2 % sur CharXiv Reasoning. Il génère des tokens quatre fois plus vite que les modèles frontier concurrents comparables, voire douze fois plus vite dans sa version optimisée disponible dès maintenant sur Antigravity, la plateforme de développement agentique de Google. Koray Kavukcuoglu, directeur technique de Google DeepMind, confirme : « Nous avons développé une version encore plus optimisée de Flash, non pas quatre fois, mais douze fois plus rapide, à qualité égale. » L'enjeu est considérable pour les entreprises qui ont massivement investi dans l'IA générative. Depuis trois ans, les DSI sont contraints de jongler entre des modèles puissants mais lents et coûteux pour les tâches complexes, et des modèles légers mais moins fiables pour les requêtes simples. Ce pilotage en portefeuille génère une ingénierie coûteuse, des expériences utilisateur inégales et, surtout, des budgets tokens qui s'épuisent à toute vitesse. Pichai l'a formulé sans détour lors d'un briefing presse lundi : « Vous avez probablement entendu des DSI dire que leurs entreprises ont déjà dépassé leur budget annuel de tokens, et on est seulement en mai. » Flash, à environ un tiers à la moitié du coût des modèles frontier actuels tout en atteignant selon Google 90 % de leurs performances, rendrait ce compromis obsolète pour la majorité des cas d'usage. Cette annonce s'inscrit dans une bataille d'efficience qui s'est intensifiée depuis que les entreprises ont commencé à déployer des agents IA en production à grande échelle. La course ne porte plus seulement sur l'intelligence brute des modèles, mais sur leur coût d'exploitation réel. Google fait face à une pression croissante d'Anthropic, d'OpenAI et de Meta, qui ont tous lancé des modèles intermédiaires visant le même créneau. Avec Flash, Google revendique la position unique de modèle occupant le quadrant supérieur droit de l'index intelligence/vitesse d'Artificial Analysis, sans concurrent direct à date. La disponibilité immédiate du modèle turbo dans Antigravity suggère que Google mise sur les workflows agentiques comme terrain de différenciation durable face à ses rivaux.

UELes entreprises européennes sur Google Cloud peuvent réduire significativement leurs budgets tokens en adoptant Flash pour leurs charges de travail agentiques, sans attendre de réglementation spécifique UE.

LLMsOpinion
1 source
Face aux États-Unis et à la Chine, MISTRAL cherche son propre modèle d’IA et fait l’acquisition d’Emmi AI
1024FrenchWeb 

Face aux États-Unis et à la Chine, MISTRAL cherche son propre modèle d’IA et fait l’acquisition d’Emmi AI

Mistral AI, la startup parisienne fondée en 2023 et valorisée plus de six milliards d'euros, annonce l'acquisition d'Emmi AI, une société spécialisée dans les agents conversationnels d'entreprise. Cette opération s'inscrit dans une stratégie de diversification accélérée : plutôt que de se limiter à l'entraînement de modèles fondationnels, Mistral cherche à construire une offre verticalement intégrée, allant du modèle de base jusqu'aux applications déployées chez les clients. Les détails financiers de l'acquisition n'ont pas été rendus publics. L'enjeu est de taille pour l'écosystème européen. Les entreprises du continent restent largement dépendantes des hyperscalers américains (AWS, Azure, Google Cloud) pour leurs infrastructures, des GPU NVIDIA pour le calcul, et des modèles d'OpenAI, Anthropic ou Google pour l'inférence. En absorbant Emmi AI, Mistral tente de proposer une alternative souveraine complète aux directions informatiques européennes soucieuses de leur autonomie stratégique et de conformité réglementaire, notamment au regard de l'AI Act européen entré en vigueur en 2024. Ce rachat intervient alors que la compétition internationale s'intensifie sur deux fronts simultanés : les États-Unis maintiennent leur avance sur les modèles de pointe, tandis que la Chine rattrape son retard à marche forcée avec des architectures intégrées comme celles de Huawei ou Baidu. Pour Mistral, qui a levé 1,1 milliard de dollars en 2024 avec des investisseurs comme Andreessen Horowitz et la Banque publique d'investissement, l'heure est au passage à l'échelle commerciale, pas seulement technologique.

UEL'acquisition d'Emmi AI par Mistral AI renforce l'offre souveraine européenne en agents IA d'entreprise, donnant aux DSI françaises et européennes une alternative intégrée aux solutions américaines, dans un contexte de conformité à l'AI Act.

💬 Mistral fait le pari qu'un modèle de base, ça ne suffit plus. Racheter Emmi AI, c'est aller chercher le client là où il est, dans ses workflows d'entreprise, plutôt que d'attendre qu'il vienne lui-même sur une API. Reste à voir si une startup, même avec un milliard en caisse, peut tenir tête aux hyperscalers sur leur propre terrain.

BusinessOpinion
1 source
☕️ Meta promet des discussions « vraiment privées » avec son IA
1025Next INpact 

☕️ Meta promet des discussions « vraiment privées » avec son IA

Meta a lancé une fonctionnalité appelée "Discussion Incognito" pour son assistant Meta AI, disponible dans WhatsApp et dans l'application dédiée Meta AI. Annoncée en mai 2026, cette option permet de discuter avec l'assistant dans un environnement dit sécurisé, basé sur la technologie maison de traitement privé des requêtes développée l'an dernier. Concrètement, les conversations ne sont pas enregistrées sur les serveurs de Meta, et elles sont supprimées à la fin de chaque session. Mark Zuckerberg a déclaré qu'il s'agissait du "premier grand produit d'IA pour lequel aucune trace de vos conversations n'est stockée sur des serveurs". Meta précise également que, contrairement à d'autres plateformes concurrentes, les questions et réponses ne sont pas accessibles à des tiers : le chat temporaire de ChatGPT conserve les données jusqu'à 30 jours, et celui de Gemini jusqu'à 72 heures. Cette initiative répond à un besoin réel : de nombreux utilisateurs posent à leurs assistants IA des questions très personnelles, touchant à leur santé, leurs finances ou leur vie privée. OpenAI avait lui-même révélé lors de la présentation de ChatGPT Health que les questions médicales figuraient parmi les usages les plus fréquents de son assistant. Dans ce contexte, la promesse d'une confidentialité totale devient un argument commercial fort, en particulier pour Meta, dont le modèle économique repose quasi exclusivement sur la collecte de données personnelles à des fins publicitaires. Proposer un espace d'échange véritablement privé représente donc une rupture symbolique notable avec l'image habituelle de l'entreprise. La décision n'est pas sans ironie. Le 8 mai, Meta a discrètement supprimé le chiffrement de bout en bout sur Instagram, justifiant ce recul par la complexité d'utilisation et la très faible adoption de la fonctionnalité. Autrement dit, la protection maximale des échanges entre humains a été abandonnée au motif qu'elle était peu pratique, tandis qu'elle devient un argument de vente pour les conversations avec une IA. Cette asymétrie soulève des questions sur les priorités réelles de l'entreprise en matière de vie privée. La technologie sous-jacente, documentée dans un livre blanc public, empêche théoriquement même Meta d'accéder au contenu des échanges, ce qui représente une contrainte technique significative pour un groupe habitué à monétiser chaque donnée utilisateur. La concurrence entre les grandes plateformes sur la confidentialité de leurs IA s'annonce comme un terrain de bataille croissant, à mesure que ces outils pénètrent les usages les plus intimes du quotidien.

UEWhatsApp étant l'application de messagerie dominante en France et en Europe, cette fonctionnalité touche directement des millions d'utilisateurs européens qui partagent des données sensibles avec Meta AI, dans un contexte de vigilance accrue autour du RGPD.

ÉthiqueOpinion
1 source
Ernie 5.1 de Baidu réduit de 94 % les coûts de pré-entraînement tout en rivalisant avec les meilleurs modèles
1026The Decoder 

Ernie 5.1 de Baidu réduit de 94 % les coûts de pré-entraînement tout en rivalisant avec les meilleurs modèles

Baidu a dévoilé Ernie 5.1, une nouvelle version de son modèle d'intelligence artificielle phare qui représente une avancée significative en matière d'efficacité de développement. Le modèle n'utilise qu'un tiers des paramètres de son prédécesseur et n'aurait coûté que 6 % du budget de pré-entraînement habituellement nécessaire pour des modèles de performance comparable, soit une réduction de 94 % des coûts. Sur le classement Search Arena, référence internationale pour évaluer les LLMs dans les tâches de recherche, Ernie 5.1 se positionne 4e au niveau mondial, derrière deux variantes de Claude Opus d'Anthropic et GPT-5.5 Search d'OpenAI. Cette performance économique repose sur une architecture baptisée "Once-For-All" : plutôt que d'entraîner plusieurs modèles distincts selon leur taille, cette approche permet d'extraire des sous-modèles plus compacts depuis un unique cycle d'entraînement. Le résultat est un modèle de niveau mondial obtenu à une fraction du coût habituel, ce qui pourrait radicalement abaisser la barrière financière à l'entrée pour les acteurs qui souhaitent développer des LLMs compétitifs. Cette annonce s'inscrit dans un contexte de course à l'efficacité qui redéfinit le secteur depuis la publication de DeepSeek R1 début 2025, laquelle avait démontré qu'il était possible d'obtenir des performances de premier rang sans budgets astronomiques. Baidu, acteur historique de l'IA en Chine et concurrent direct de géants comme Alibaba et Tencent sur le marché local, renforce ainsi sa position internationale à un moment où la compétition avec les laboratoires américains s'intensifie sur tous les fronts.

LLMsOpinion
1 source
GPT-5.5 coûte 49 à 92 % plus cher que son prédécesseur, selon la longueur des entrées
1027The Decoder 

GPT-5.5 coûte 49 à 92 % plus cher que son prédécesseur, selon la longueur des entrées

OpenAI a doublé le prix affiché de GPT-5.5 par rapport à GPT-5.4, justifiant cette hausse par la promesse que des réponses plus courtes compenseraient le surcoût pour les utilisateurs. Mais une analyse conduite par OpenRouter, plateforme d'agrégation de modèles de langage, révèle que la réalité est bien différente : en s'appuyant sur des données d'utilisation réelles, OpenRouter conclut que les coûts effectifs ont augmenté de 49 à 92 % selon la longueur des requêtes soumises au modèle. Cette hausse tarifaire a des conséquences directes pour les développeurs et les entreprises qui intègrent GPT-5.5 dans leurs applications via l'API d'OpenAI. Une augmentation pouvant frôler les 100 % sur certains usages représente un choc budgétaire significatif, en particulier pour les startups et les équipes traitant de gros volumes de requêtes. Le fait que l'écart entre le tarif officiel et le coût réel soit si prononcé soulève également des questions sur la transparence des grilles tarifaires publiées par OpenAI. Anthropic a, elle aussi, relevé le prix de son modèle haut de gamme Opus 4.7, confirmant une tendance de fond dans l'industrie. Les deux entreprises se préparent à une introduction en bourse, ce qui pourrait expliquer une stratégie visant à améliorer leur rentabilité à court terme. Alors que la concurrence entre les grands acteurs de l'IA reste intense, cette course à la hausse des prix suggère que la phase de conquête à prix coûtant laisse progressivement place à une logique de monétisation plus agressive.

UELes startups et développeurs européens intégrant GPT-5.5 ou Opus 4.7 via API subissent une hausse effective de 49 à 92 % de leurs coûts opérationnels, les contraignant à revoir leurs budgets ou à évaluer des alternatives open-source.

💬 La "promesse de réponses plus courtes qui compensent", c'était du flan. OpenRouter a sorti les vraies données d'utilisation : +49 à +92% sur les coûts réels selon la longueur des requêtes, loin de ce qu'annonce le tarif officiel. Entre les deux boîtes en pré-IPO qui remontent leurs marges simultanément, le signal est assez lisible.

BusinessOpinion
1 source
DeepSeek lève plus de 7 milliards de dollars pour accélérer sa monétisation
1028The Information AI 

DeepSeek lève plus de 7 milliards de dollars pour accélérer sa monétisation

DeepSeek, le laboratoire d'intelligence artificielle chinois qui a ébranlé l'industrie mondiale début 2025 avec ses modèles performants à faible coût, s'apprête à lever jusqu'à 50 milliards de yuans, soit environ 7,35 milliards de dollars, dans ce qui constituerait son tout premier tour de financement externe. Liang Wenfeng, fondateur et PDG milliardaire de la société, prévoit lui-même d'apporter la plus grande part de cette levée. Si elle se concrétise à ce montant, il s'agirait du tour de financement le plus important jamais réalisé par une entreprise d'intelligence artificielle chinoise. Cette levée de fonds marque un tournant stratégique majeur pour DeepSeek, qui a jusqu'ici fonctionné sans capital externe. La perspective de cette entrée d'argent frais pousse le laboratoire à accélérer ses plans de monétisation afin de devenir commercialement viable. DeepSeek aurait également indiqué à certains investisseurs qu'il compte désormais publier ses modèles à un rythme plus rapproché, aligné sur les standards du secteur, abandonant ainsi la cadence irrégulière qui était jusque-là sa marque de fabrique. DeepSeek s'était distingué en janvier 2025 en publiant des modèles rivaux de ceux d'OpenAI ou Google, mais développés à une fraction du coût déclaré, provoquant une onde de choc sur les marchés boursiers américains et alimentant les débats sur la suprématie technologique entre les États-Unis et la Chine. Cette levée signale que le laboratoire entend désormais transformer sa notoriété technique en position commerciale durable, dans un écosystème IA chinois de plus en plus compétitif face à Baidu, Alibaba et ByteDance.

UELa montée en puissance commerciale de DeepSeek intensifie la concurrence mondiale dans l'IA et pourrait influencer les choix d'adoption des entreprises européennes, qui devront peser les questions de conformité liées à l'utilisation de modèles issus de laboratoires chinois.

💬 7 milliards pour un labo qui s'est construit sans un centime externe, c'est un vrai changement de posture. Ce qui m'intéresse plus que le montant, c'est l'abandon de leur cadence de publication chaotique pour quelque chose de plus régulier, parce que c'est ça qui bloquait l'adoption sérieuse. Transformer la notoriété technique en machine commerciale face à Baidu et ByteDance, c'est pas le même sport.

BusinessActu
1 source
Sierra lève 950 millions pour s’imposer sur le marché de l’enterprise AI
1029Le Big Data 

Sierra lève 950 millions pour s’imposer sur le marché de l’enterprise AI

Sierra, la startup spécialisée dans les agents IA pour les entreprises, a annoncé le 4 mai 2026 une levée de fonds de 950 millions de dollars, portant sa valorisation à plus de 15 milliards de dollars. Ce tour de table, mené par Tiger Global et GV, donne à l'entreprise plus d'un milliard de dollars en caisse pour accélérer son développement. Fondée il y a moins de deux ans par Bret Taylor, également président d'OpenAI et ancien co-CEO de Salesforce, Sierra compte déjà parmi ses clients plus de 40 % des entreprises du Fortune 50. Sa croissance financière est tout aussi spectaculaire : 100 millions de dollars de revenus annuels récurrents fin 2025, puis 150 millions dès le début 2026. Les agents déployés sur sa plateforme gèrent aujourd'hui des milliards d'interactions couvrant des cas d'usage concrets comme le refinancement immobilier, le traitement de sinistres ou la gestion des retours e-commerce. Ce financement confirme que le marché enterprise de l'IA a franchi un cap décisif : les grandes organisations ne testent plus, elles déploient à grande échelle. Les gains de productivité commencent à se matérialiser concrètement. Chez Uber, par exemple, environ 10 % du code est désormais généré automatiquement, et un projet d'intégration de réservation hôtelière estimé à un an de développement a été finalisé en six mois grâce aux workflows automatisés de Sierra. Nordstrom a lancé un agent vocal en cinq semaines, Singtel en dix semaines avec un taux de résolution supérieur à 70 %, et Cigna a réduit de 80 % le temps d'authentification de ses patients. Ces résultats illustrent la promesse centrale de l'enterprise AI : compresser les cycles de développement tout en augmentant la capacité d'innovation des grandes organisations. Sierra émerge dans un contexte où la compétition pour les budgets IA des grandes entreprises s'intensifie. Face à des acteurs comme Salesforce Agentforce ou ServiceNow, la startup se différencie par la profondeur de ses déploiements et le profil de son fondateur, qui lui confère une crédibilité rare pour naviguer dans les strates décisionnelles du Fortune 500. En avril 2026, Sierra a également lancé Ghostwriter, un outil qui génère automatiquement des agents à partir d'une simple description en langage naturel, avec l'ambition de rendre les logiciels d'entreprise complexes, comme Workday, accessibles via une interface conversationnelle. Avec ce milliard en caisse, Sierra vise à s'imposer comme la plateforme de référence mondiale pour la transformation de l'expérience client par l'IA agentique, dans une course où la capacité à industrialiser rapidement les déploiements sera l'avantage décisif.

BusinessOpinion
1 source
Le Pentagone choisit ses nouveaux fournisseurs IA et exclut Anthropic… enfin presque
1030Next INpact 

Le Pentagone choisit ses nouveaux fournisseurs IA et exclut Anthropic… enfin presque

Le Pentagone a signé fin avril 2026 des accords avec huit fournisseurs de modèles d'intelligence artificielle pour déployer leurs technologies dans des opérations militaires classifiées. Les entreprises retenues sont OpenAI, Google, Microsoft, Amazon Web Services, NVIDIA, Oracle, SpaceX via sa filiale xAI, et Reflection. Ces contrats couvrent deux niveaux de classification : l'IL6, équivalent du « secret défense », et l'IL7, réservé aux données encore plus sensibles liées aux opérations en cours. Concrètement, ces IA seront mobilisées pour l'analyse de renseignement, la planification d'opérations et l'aide à la prise de décision en temps réel. Une entreprise brille par son absence : Anthropic, pourtant l'un des acteurs les plus avancés du secteur, a été écarté de ces accords. Cette sélection marque une accélération majeure de l'intégration de l'IA dans l'appareil militaire américain, avec des implications industrielles et éthiques immédiates. Chez Google, l'accord signé le 27 avril a provoqué une fronde interne : plus de 560 employés ont adressé une lettre ouverte à Sundar Pichai, réclamant que l'entreprise refuse tout contrat impliquant des opérations classifiées. « La seule façon de garantir que Google ne soit pas associé à de tels dommages est de refuser tout travail sur des projets classifiés », écrivent les signataires. Kent Walker, président des affaires juridiques d'Alphabet, a répondu sans ambiguïté dans un mémo interne, affirmant que Google travaillait « avec fierté » avec le ministère de la Défense depuis ses débuts et que soutenir la sécurité nationale de manière « réfléchie et responsable » restait une priorité de l'entreprise. Le cas Anthropic illustre les tensions profondes entre les exigences du Pentagone et les garde-fous éthiques des labs d'IA. Le DoD utilisait pourtant les modèles Claude depuis 2024, dans des opérations sensibles : ils auraient notamment contribué à la capture de Nicolas Maduro le 3 janvier, et aux premières opérations militaires liées au conflit israélo-iranien. Mais Anthropic a posé des conditions, refusant notamment que sa technologie serve à la surveillance de masse de citoyens américains ou à des armes entièrement autonomes. Le DoD, peu enclin à se laisser imposer des contraintes par un fournisseur, a alors désigné Anthropic « fournisseur à risque », une première pour une entreprise américaine, assimilée à une menace pour la chaîne d'approvisionnement nationale. L'affaire s'est depuis enlisée devant les tribunaux. Le lancement de Mythos par Anthropic début avril semble avoir légèrement rouvert la porte : le directeur technique du DoD, Emil Michael, reconnaît qu'Anthropic reste un risque d'approvisionnement tout en laissant entendre que la situation pourrait évoluer.

UEL'accélération de l'IA militaire classifiée aux États-Unis risque de relancer les débats européens sur une doctrine IA-défense propre et sur les limites que l'AI Act pourrait imposer aux applications militaires des modèles d'IA.

💬 Anthropic dit non à la surveillance de masse et aux armes autonomes, et se retrouve officiellement sur liste noire du Pentagone. C'est sans doute le premier lab à perdre un gros contrat sur des principes éthiques, pas juste à en parler depuis une scène de conférence. Ça va leur coûter cher, et c'est pourtant le seul truc crédible qu'on ait vu depuis longtemps dans ce secteur.

BusinessReglementation
1 source
GitHub Copilot adopte une facturation à la consommation
1031AI News 

GitHub Copilot adopte une facturation à la consommation

À partir du 1er juin 2026, GitHub Copilot abandonne son modèle d'abonnement à requêtes fixes pour adopter une facturation à la consommation de tokens. Jusqu'à présent, les utilisateurs disposaient d'un quota mensuel de « requêtes premium », chaque requête comptant pour une unité qu'il s'agisse d'une tâche complexe de refactorisation ou d'une simple question. Le nouveau système remplace ces requêtes par des « AI Credits » : un abonné Copilot Pro à 10 dollars par mois reçoit 1 000 crédits, chaque crédit valant un centime américain. Un token représente environ les trois quarts d'un mot, ce qui signifie que 10 000 mots de code soumis à Copilot génèrent entre 12 000 et 13 000 tokens facturés. Le coût réel dépendra du modèle choisi, du ratio entrées/sorties, de la taille du cache et de la fonctionnalité utilisée. Seules les suggestions de complétion de code et les « Next Edit suggestions » resteront gratuites. Ce changement modifie profondément la relation des développeurs avec l'outil. Alors que l'abonnement mensuel masquait jusqu'ici la consommation réelle de tokens, Microsoft subventionnait de facto trois à huit fois la valeur nominale de chaque abonnement grâce à ses revenus logiciels et cloud, les utilisateurs devront désormais surveiller activement leur dépense token par requête. Pour un développeur qui enchaîne des tâches simples, l'impact sera limité. En revanche, les équipes qui déploient des agents de codage autonomes sur de grandes bases de code risquent de voir leur facture exploser rapidement. Le cas d'Uber est emblématique : selon The Information, le directeur technique de l'entreprise a déclaré avoir déjà épuisé l'intégralité du budget IA 2026 dès les premiers mois de l'année, alors que 11 % des mises à jour du code d'Uber sont désormais rédigées par des agents IA, principalement basés sur Claude d'Anthropic. Ce virage tarifaire s'inscrit dans un mouvement plus large du secteur. Anthropic et OpenAI ont déjà migré leurs clients enterprise vers une facturation à la consommation. Microsoft, propriétaire de GitHub, suit la même trajectoire mais à partir d'une position plus exposée : Copilot cible précisément les développeurs individuels et les petites équipes, un public moins préparé que les grandes entreprises à raisonner en coût par token. Le risque pour GitHub est double : freiner l'exploration des nouveaux utilisateurs, qui hésiteront avant de soumettre de longues sessions de débogage, et accélérer l'arbitrage chez les équipes tech qui compareront désormais les coûts réels de Copilot face à ses concurrents directs comme Cursor ou les offres Claude for Business. La transparence des coûts, longtemps perçue comme un avantage client, devient un terrain de compétition où les marges de chaque acteur seront exposées.

UELes développeurs français et européens utilisant GitHub Copilot devront surveiller activement leur consommation de tokens dès juin 2026 et réévaluer leurs budgets IA face à des alternatives comme Cursor ou Claude for Business.

💬 Microsoft vient de retirer le masque. Tant que le forfait fixe absorbait tout, personne ne regardait la consommation réelle, mais là, un agent autonome sur une grosse codebase, et la facture peut tripler sans prévenir. Le cas Uber, c'est pas une anecdote, c'est exactement ce qui attend les équipes qui ont dit oui à l'IA à grande échelle sans jamais compter les tokens.

OutilsOutil
1 source
Le graphe de connaissances d'AWS Quick prend des décisions d'orchestration invisibles pour les plans de contrôle
1032VentureBeat AI 

Le graphe de connaissances d'AWS Quick prend des décisions d'orchestration invisibles pour les plans de contrôle

AWS a élargi cette semaine son assistant Quick avec une version desktop dotée d'un graphe de connaissances personnel persistant, capable d'exécuter des actions sur des fichiers locaux et des outils SaaS sans attendre d'y être invité. Contrairement aux copilotes conversationnels qui réinitialisent leur contexte à chaque session, Quick construit désormais en continu un profil utilisateur à partir des fichiers locaux, du calendrier, des e-mails et des applications connectées comme Google Workspace, Microsoft 365, Zoom, Salesforce et Slack. Ce graphe lui permet de déclencher des actions de manière proactive, rappeler à un chef d'équipe d'organiser des points réguliers, par exemple, sans que l'utilisateur n'ait à formuler de requête. AWS avait lancé Quick en octobre 2024 comme alternative aux plateformes de productivité IA de Google, OpenAI et Anthropic, combinant accès aux données d'entreprise, construction d'agents, recherche approfondie et automatisation de workflows. Ce changement introduit ce que les experts appellent une "orchestration fantôme" : un niveau de décision personnalisé qui opère en dehors des couches d'orchestration centralisées que les équipes IT déploient habituellement pour garder le contrôle sur les agents IA. Plutôt que de suivre des workflows définis à l'avance, Quick prend des décisions fondées sur des déclencheurs implicites, des interprétations propres à chaque utilisateur et des temporalités variables. Upal Saha, cofondateur et CTO de Bem, résume le risque : "Quand vous déployez un agent qui raisonne en plusieurs étapes pour parvenir à une décision, vous avez déjà accepté de ne pas pouvoir en expliquer intégralement le déroulement après coup. C'est acceptable pour une démo, pas pour un pipeline de traitement de sinistres ou un workflow financier où un régulateur peut exiger un audit complet de chaque décision automatisée sur les trois dernières années." AWS insiste sur le fait que Quick reste encadré par les politiques de sécurité, les permissions et les identités d'entreprise, et que les intégrations passent toutes par des API ou des connexions MCP contrôlées. Jigar Thakkar, vice-président de la suite Quick chez AWS, positionne le produit comme "l'endroit unique où les employés peuvent accéder à toutes leurs informations et tâches." Cette évolution s'inscrit dans une tendance plus large de l'industrie : Anthropic avec ses Claude Managed Agents et OpenAI avec son Agent SDK poussent eux aussi vers des agents plus autonomes dans les workflows d'entreprise, mais en maintenant des périmètres d'orchestration définis. La question qui se pose désormais est de savoir si les entreprises sont prêtes à accepter ce compromis entre productivité gagnée par l'autonomie et traçabilité exigée par la conformité réglementaire.

UELes entreprises européennes utilisant AWS Quick devront évaluer la conformité de l'orchestration fantôme avec l'AI Act et le RGPD, qui exigent traçabilité et explicabilité des décisions automatisées dans les workflows réglementés.

OutilsOutil
1 source
Google et le Pentagone concluent un accord pour un usage de l'IA sans restriction légale
1033The Verge 

Google et le Pentagone concluent un accord pour un usage de l'IA sans restriction légale

Google a conclu un accord classifié avec le département américain de la Défense (DoD) autorisant ce dernier à utiliser ses modèles d'intelligence artificielle pour "tout usage gouvernemental légal", selon un rapport de The Information publié lundi. La révélation intervient moins de vingt-quatre heures après qu'une partie des employés de Google a adressé une pétition au PDG Sundar Pichai, exigeant qu'il bloque l'accès du Pentagone à ses technologies, par crainte que celles-ci soient employées à des fins "inhumaines ou extrêmement préjudiciables". Cet accord positionne Google aux côtés d'OpenAI et xAI, qui ont eux aussi signé des contrats classifiés avec le gouvernement américain. La décision illustre la tension croissante au sein des grandes entreprises tech entre impératifs commerciaux et éthique de déploiement : le DoD représente un client stratégique de premier plan, mais ses usages potentiels des systèmes d'IA restent opaques pour le grand public comme pour les salariés de ces entreprises. Le contexte récent éclaire la portée de ce choix. Anthropic a été récemment inscrit sur liste noire par le Pentagone après avoir refusé de supprimer ses garde-fous de sécurité sur demande du DoD. Google, en acceptant un accès étendu et sans restrictions explicites, prend le chemin inverse. La question des applications militaires de l'IA, qu'il s'agisse de ciblage, de surveillance ou d'automatisation de décisions, s'impose désormais comme un enjeu central pour l'ensemble du secteur.

UEL'accord pousse les régulateurs européens à préciser dans l'AI Act les conditions d'usage militaire de l'IA, mettant en lumière un vide réglementaire que les institutions de l'UE devront combler.

SécuritéOpinion
1 source
ImageGen est sur la voie de l'AGI
1034Latent Space 

ImageGen est sur la voie de l'AGI

GPT-Image-2, le dernier modèle de génération d'images d'OpenAI, s'impose comme l'un des outils les plus polyvalents du moment. Capable de produire des visuels éducatifs, des infographies précises, des illustrations issues de la culture populaire ou des assets graphiques en temps réel pendant qu'un développeur code, il s'intègre désormais directement dans Codex, l'agent de programmation d'OpenAI, comme compétence activable. Cette combinaison GPT-Image-2 plus Codex permet de générer des ressources visuelles de manière itérative au fil du développement, ce qui change concrètement le flux de travail des développeurs. La qualité du modèle en termes de fidélité et de faible taux d'hallucinations est telle que des concurrents comme Claude Design, pourtant présenté il y a peu comme la référence, ne figurent plus dans la conversation. Cette dynamique soulève une question stratégique sérieuse : les modèles de génération d'images sont-ils un luxe pour des laboratoires qui cherchent à atteindre l'intelligence artificielle générale, ou bien une nécessité ? La réponse semble de plus en plus claire : oui, ils sont nécessaires. Parce que le texte, le code et les données structurées ne suffisent plus à démontrer le "G" de "AGI". Une IA vraiment générale doit maîtriser la voix, le visuel, la génération multimodale, y compris les calques transparents. Fermer cette boucle créative, c'est prendre une avance décisive sur tous les concurrents qui se concentrent uniquement sur le code et la productivité d'entreprise. En parallèle, OpenAI a opéré un pivot stratégique majeur en révisant son partenariat exclusif avec Microsoft. Sam Altman a annoncé que si Microsoft reste le cloud partenaire principal, OpenAI peut désormais distribuer ses modèles sur tous les clouds, y compris Google TPU et AWS Bedrock, une confirmation d'Andy Jassy est attendue dans les prochaines semaines. La licence de Microsoft sur la propriété intellectuelle d'OpenAI devient ainsi non exclusive, et la clause AGI de l'accord original serait de facto caduque selon plusieurs observateurs. Sur le plan des benchmarks, GPT-5.5 affiche des résultats contrastés : 67,1 % sur WeirdML sans mode de réflexion, contre 57,4 % pour GPT-5.4, mais toujours en retrait face à Claude Opus 4.7 à 76,4 %. L'Arena LMSYS place le modèle en troisième position en mathématiques et deuxième en recherche, mais neuvième en code. Enfin, GitHub a annoncé la migration de Copilot vers une facturation à l'usage au 1er juin, un signal fort de la monétisation croissante des workflows agentiques, tandis qu'OpenAI a publié en open source Symphony, une couche d'orchestration reliant les gestionnaires de tickets à des agents Codex pour automatiser le cycle complet "issue → PR → revue humaine".

UELa restructuration du partenariat OpenAI-Microsoft vers une licence non exclusive pourrait faciliter l'accès aux modèles OpenAI via des fournisseurs cloud alternatifs utilisés par les entreprises européennes.

CréationActu
1 source
Google et AWS répartissent la pile des agents IA entre contrôle et exécution
1035VentureBeat AI 

Google et AWS répartissent la pile des agents IA entre contrôle et exécution

Google et Amazon Web Services viennent de redéfinir leurs approches respectives pour orchestrer les agents IA d'entreprise, révélant une fracture profonde dans la façon de concevoir l'infrastructure agentique. Google a lancé une nouvelle version de Gemini Enterprise, regroupant sous une même bannière sa plateforme Gemini Enterprise et son application éponyme, tout en rebaptisant Vertex AI en Gemini Enterprise Platform. De son côté, AWS a enrichi Bedrock AgentCore d'un système de harness, un dispositif de configuration automatique alimenté par Strands Agents, son framework open source. Ce harness permet aux équipes de définir ce que l'agent doit faire, quel modèle utiliser et quels outils appeler, le reste étant pris en charge automatiquement. Dans le même temps, Anthropic a dévoilé ses Claude Managed Agents et OpenAI a renforcé son Agents SDK, confirmant que l'ensemble de l'industrie cherche simultanément à résoudre le même problème : comment gérer des agents IA qui tournent durablement en production. L'enjeu dépasse la simple question de l'outillage développeur. À mesure que les agents passent de courtes tâches ponctuelles à des workflows autonomes de longue durée, un nouveau type de défaillance émerge : la dérive d'état (state drift). Un agent qui fonctionne en continu accumule de la mémoire, des réponses et un contexte évolutif. Avec le temps, ce contexte devient obsolète : les sources de données changent, les outils renvoient des réponses contradictoires, et l'agent perd en fiabilité sans que personne ne s'en rende forcément compte. C'est ce problème systémique que Google et AWS cherchent à prévenir, par deux chemins opposés. Google mise sur un plan de contrôle à la manière de Kubernetes, centré sur la gouvernance et la visibilité. AWS privilégie la vitesse de déploiement et la simplification de la configuration, en déléguant la coordination à la couche d'exécution. Cette divergence illustre une transformation plus profonde de la pile IA, qui se stratifie désormais en couches spécialisées. Google positionne Gemini Enterprise comme une porte d'entrée unifiée vers l'ensemble de ses systèmes IA, avec des outils de sécurité et de gouvernance inclus dans l'abonnement, selon Maryam Gholami, directrice senior produit chez Google. AWS, Anthropic et OpenAI s'orientent davantage vers la vélocité et la flexibilité d'exécution. La question de savoir quelle approche s'imposera reste ouverte : Gholami elle-même reconnaît que ce sont les clients qui dicteront les usages des agents longue durée, un domaine où les bonnes pratiques restent encore à définir. Le vrai test viendra lorsque les entreprises feront tourner ces systèmes en conditions réelles, avec des agents qui devront remonter de l'information, demander des validations humaines, et résister à la dégradation progressive de leur contexte.

UELes entreprises européennes qui déploient des agents IA en production sur Google Cloud ou AWS devront arbitrer entre les deux approches d'orchestration pour leurs workflows agentiques durables.

InfrastructureOpinion
1 source
Alibaba publie Qwen3.6-27B, un modèle dense qui surpasse le MoE 397B sur les benchmarks de codage par agents
1036MarkTechPost 

Alibaba publie Qwen3.6-27B, un modèle dense qui surpasse le MoE 397B sur les benchmarks de codage par agents

L'équipe Qwen d'Alibaba a publié Qwen3.6-27B, un modèle dense en open-weight de 27 milliards de paramètres disponible sous licence Apache 2.0 sur Hugging Face, en deux variantes : BF16 et FP8. Ce modèle se distingue notamment sur les benchmarks de codage agentique, où il surpasse des modèles bien plus imposants : il atteint 1 487 points sur QwenWebBench (génération de code frontend) contre 1 068 pour son prédécesseur Qwen3.5-27B, et 36,2 sur NL2Repo (génération de code à l'échelle d'un dépôt) contre 27,3. Sur SWE-bench Verified, référence du secteur pour les agents logiciels autonomes, il atteint 77,2, se rapprochant des 80,9 de Claude 4.5 Opus. Fait notable : ces performances dépassent celles du Qwen3.5-397B-A17B, un modèle Mixture-of-Experts quatorze fois plus grand. L'intérêt de cette publication tient à deux innovations concrètes. La première concerne le codage agentique : le modèle a été spécifiquement optimisé pour naviguer dans de larges bases de code, modifier plusieurs fichiers simultanément et produire du code exécutable cohérent, couvrant sept catégories allant du design web à la 3D. La seconde innovation, baptisée Thinking Preservation, répond à une limite structurelle des LLM actuels : par défaut, le raisonnement intermédiaire (chain-of-thought) n'est conservé que pour le message en cours et disparaît au tour suivant. Qwen3.6-27B propose une option pour conserver et réutiliser ces traces de raisonnement sur l'ensemble d'une conversation, ce qui réduit les tokens redondants et améliore l'utilisation du cache KV dans les workflows d'agents itératifs. Cette sortie s'inscrit dans une stratégie accélérée d'Alibaba sur les modèles ouverts : Qwen3.6-27B est le deuxième modèle de la famille Qwen3.6, après le Qwen3.6-35B-A3B (MoE à 3B paramètres actifs) lancé quelques semaines plus tôt, lui-même héritier de la série Qwen3.5. Sur le plan architectural, le modèle adopte une structure hybride originale répartie sur 64 couches : trois sublayers sur quatre utilisent Gated DeltaNet, une attention linéaire en O(n) bien plus efficace que l'attention classique quadratique O(n²), tandis qu'une couche sur quatre conserve l'attention standard. Cette conception permet de traiter de longs contextes avec un coût mémoire réduit, tout en maintenant la précision sur les tâches complexes. Compatible avec SGLang, vLLM et Hugging Face Transformers, le modèle vise directement les développeurs qui construisent des agents de codage, dans un segment où Anthropic et OpenAI restent pour l'instant en tête.

LLMsOpinion
1 source
Les entreprises surestiment leur contrôle sur l'IA : 72 % ne sont pas aussi sécurisées qu'elles le croient
1037VentureBeat AI 

Les entreprises surestiment leur contrôle sur l'IA : 72 % ne sont pas aussi sécurisées qu'elles le croient

Dans 72 % des entreprises interrogées, les décideurs affirment utiliser au moins deux plateformes d'intelligence artificielle qu'ils considèrent comme leur couche "primaire", selon une enquête menée par VentureBeat auprès de 40 grandes entreprises entre janvier et mars 2026. Ce chiffre révèle un écart béant entre la perception du contrôle et la réalité opérationnelle. L'exemple le plus frappant vient du système hospitalier Mass General Brigham (MGB), plus grand employeur du Massachusetts avec 90 000 salariés : l'an dernier, son directeur technique Nallan Sriraman a dû stopper un nombre incontrôlé de projets pilotes internes en IA qui avaient proliféré sans supervision. MGB a depuis construit une plateforme sécurisée maison autour de Microsoft Copilot, capable de supporter jusqu'à 30 000 utilisateurs, pour empêcher que les données de santé protégées (PHI) des patients ne soient transmises au fournisseur du modèle sous-jacent, OpenAI. En parallèle, l'hôpital doit bâtir un "plan de contrôle" central pour orchestrer les agents IA déployés séparément par Epic, Workday et ServiceNow, qui fonctionnent tous différemment. Ce phénomène de dispersion, que VentureBeat nomme "gouvernance mirage", traduit une contradiction structurelle : les entreprises croient avoir mis en place une gouvernance solide alors qu'elles n'ont défini ni responsabilités claires, ni garde-fous précis, ni processus d'évaluation ou de sécurité réels. Pour les responsables de la sécurité en particulier, cette multiplicité de plateformes, issues de Microsoft Azure, Google, OpenAI, Anthropic ou d'éditeurs applicatifs, élargit mécaniquement la surface d'attaque, à un moment où les cyberattaques assistées par IA gagnent en sophistication. Le paradoxe est d'autant plus aigu que les entreprises se sont tournées vers leurs grands fournisseurs logiciels existants pour éviter de dupliquer les efforts, mais se retrouvent malgré tout contraintes de construire autour de leurs lacunes. Ce contexte reflète la vitesse à laquelle les hyperscalers et les grands éditeurs ont intégré l'IA dans leurs offres, forçant leurs clients entreprise à absorber une complexité non anticipée. Comme l'explique Sriraman avec l'analogie des "six aveugles et l'éléphant", chaque fournisseur décrit l'IA à sa façon, rendant toute vision cohérente difficile à construire. Le marché reste "encore naissant", selon ses termes, ce qui rend les décisions stratégiques particulièrement hasardeuses. La prochaine étape pour des organisations comme MGB sera de stabiliser ces plans de contrôle multi-agents tout en attendant que les fournisseurs mûrissent leurs propres capacités de sécurité, un pari sur un calendrier que personne ne maîtrise vraiment.

UELes entreprises européennes soumises aux obligations de conformité de l'AI Act sont particulièrement exposées à ce risque de 'gouvernance mirage', où un écart entre gouvernance déclarée et réalité opérationnelle pourrait constituer une non-conformité réglementaire.

SécuritéActu
1 source
Course à l’IA : le laboratoire de Jeff Bezos proche d’un méga deal à 38 milliards
1038Le Big Data 

Course à l’IA : le laboratoire de Jeff Bezos proche d’un méga deal à 38 milliards

Project Prometheus, la start-up d'IA cofondée par Jeff Bezos, s'apprête à finaliser une levée de fonds de près de 10 milliards de dollars qui porterait sa valorisation à 38 milliards, selon le Financial Times. Cette opération intervient moins d'un an après un premier tour de table de 6,2 milliards, confirmant une trajectoire de financement exceptionnellement rapide. La société, fondée il y a moins de 12 mois, compte entre 50 et 200 employés recrutés en grande partie chez OpenAI, xAI et Google DeepMind. Elle est dirigée par Jeff Bezos aux côtés de Vik Bajaj, ancien responsable de Google X et professeur associé à Stanford. Ses bureaux sont établis à San Francisco, au coeur de l'écosystème mondial de l'IA. Par ailleurs, selon le New York Times, Bezos aurait engagé des discussions préliminaires avec des investisseurs du Moyen-Orient et d'Asie du Sud-Est pour lever jusqu'à 100 milliards de dollars supplémentaires, dans le but de créer un fonds dédié aux entreprises exploitant les technologies de Prometheus. Ce qui distingue Prometheus de la plupart de ses concurrents, c'est son positionnement sur l'IA physique : des systèmes capables d'interagir directement avec des environnements industriels réels, dans des secteurs comme la fabrication, l'ingénierie aérospatiale ou la production de semi-conducteurs. Là où l'IA générative peine encore à démontrer un retour sur investissement immédiat pour les industriels, Prometheus parie sur une IA qui agit dans le monde tangible plutôt que de se limiter au traitement de données. Pour les entreprises manufacturières et les grandes industries, ce type de technologie représente un levier de transformation directe, potentiellement plus concret que les modèles conversationnels grand public. C'est précisément ce créneau qui justifie l'intérêt massif des investisseurs, malgré l'absence totale de revenus à ce stade. La montée en puissance de Project Prometheus s'inscrit dans une phase nouvelle de la course mondiale à l'IA, où les batailles ne se jouent plus uniquement sur les performances des modèles de langage, mais sur leur intégration dans l'économie réelle. Jeff Bezos, avec une fortune estimée à plus de 200 milliards de dollars et un réseau d'investisseurs mondial, dispose d'une capacité d'action hors norme pour imposer Prometheus dans ce segment. La stratégie rappelle les logiques d'intégration verticale bien connues dans la tech : contrôler à la fois la technologie fondamentale et l'écosystème d'entreprises qui l'exploitent. Bloomberg précise que le tour de table actuel reste ouvert et que ses modalités pourraient encore évoluer, signe que la compétition pour entrer au capital de la start-up reste vive. Dans un secteur où OpenAI, Anthropic et Google se disputent la couche logicielle, Prometheus tente de s'imposer sur la couche industrielle, un pari ambitieux mais cohérent avec la vision long terme de son fondateur.

UEL'orientation de Prometheus vers l'IA industrielle (fabrication, aérospatiale, semi-conducteurs) pourrait à terme concurrencer ou transformer des secteurs manufacturiers européens, mais aucun impact direct sur la France ou l'UE n'est identifié à ce stade.

💬 38 milliards pour une boîte sans un euro de revenu et moins d'un an d'existence, sur le papier ça crie bulle. Mais l'angle IA physique (fabrication, aérospatiale, semi-conducteurs) c'est vraiment pas le même jeu que la guerre des chatbots, et là Bezos arrive avec la patience et le réseau qu'il faut pour jouer long. C'est le genre de pari qui paraît absurde en 2026 et évident en 2030.

BusinessOpinion
1 source
1039Latent Space 

[AINews] Moonshot Kimi K2.6 : le meilleur modèle open source du monde se met à jour pour rivaliser avec Opus 4.6 (avant DeepSeek v4 ?)

Moonshot AI a lancé Kimi K2.6 le 18 avril 2026, une mise à jour majeure de son modèle de langage open-weight qui consolide la position du laboratoire chinois en tête des modèles ouverts mondiaux. Ce modèle de type Mixture-of-Experts (MoE) totalise 1 000 milliards de paramètres, avec 32 milliards actifs à la fois, 384 experts, une fenêtre de contexte de 256 000 tokens, la multimodalité native et une quantification INT4. Disponible dès le jour de lancement sur vLLM, OpenRouter, Cloudflare Workers AI, Baseten et MLX, il revendique des records open source sur plusieurs benchmarks de référence : 54,0 sur HLE with tools, 58,6 sur SWE-Bench Pro, 76,7 sur SWE-Bench Multilingual et 83,2 sur BrowseComp. Moonshot revendique également des capacités d'exécution longue durée inédites : plus de 4 000 appels d'outils enchaînés, des sessions continues de plus de 12 heures, et jusqu'à 300 sous-agents parallèles via un système baptisé "Claw Groups". Simultanément, Alibaba a publié Qwen3.6-Max-Preview, un avant-goût de son prochain modèle phare, qui a atteint la 7e place dans le classement Code Arena, propulsant Alibaba au 3e rang des laboratoires dans cette catégorie. Ces sorties illustrent une accélération concrète des modèles ouverts chinois dans les domaines du code et des agents autonomes, deux terrains jusqu'ici dominés par des acteurs américains comme Anthropic, OpenAI et Google. La communauté des développeurs a rapidement adopté K2.6 comme alternative crédible à Claude ou GPT-4 pour des tâches d'infrastructure : des utilisateurs rapportent une exécution autonome sur cinq jours, des réécritures de noyaux système, et un moteur d'inférence en Zig surpassant LM Studio de 20 % en débit. K2.6 tient également tête à Gemini 3.1 Pro sur les tâches de design frontend avec un taux de victoire et d'égalité de 68,6 %, un terrain considéré comme le point fort de Google. Le contexte est celui d'une course ouverte et intense entre laboratoires. Depuis le lancement de K2.5 en janvier 2026, Moonshot occupe la première place parmi les labs chinois open source, dans un silence relatif de DeepSeek depuis la version v3.2, dont une v4 reste attendue. Moonshot est par ailleurs l'un des trois laboratoires chinois que l'équipe d'Anthropic a cités en février pour avoir potentiellement utilisé ses données d'entraînement sans autorisation. En parallèle, Hermes Agent, la pile d'agents open source la plus en vue du moment, a dépassé 100 000 étoiles sur GitHub en moins de deux mois, détrônant OpenClaw en croissance hebdomadaire. L'ensemble du tableau suggère que les modèles ouverts, portés par des labs asiatiques bien dotés, ne jouent plus dans une catégorie inférieure aux modèles propriétaires occidentaux.

UELes développeurs européens peuvent désormais déployer localement un modèle open-weight de niveau frontier, réduisant leur dépendance aux API propriétaires américaines soumises au Cloud Act.

LLMsActu
1 source
Sephora confie son programme de fidélité à ChatGPT : pourquoi c’est un tournant
1040FrenchWeb 

Sephora confie son programme de fidélité à ChatGPT : pourquoi c’est un tournant

Sephora a annoncé fin mars à Las Vegas, lors de la conférence Shoptalk Spring, un partenariat stratégique avec OpenAI pour intégrer ChatGPT au cœur de son programme de fidélité Beauty Insider. Ce qui distingue cet accord de simples expérimentations marketing : l'enseigne confie à l'IA les données de ses membres, un actif considéré comme l'un des plus précieux de l'entreprise. Sephora inaugure ainsi ce que l'industrie commence à appeler le « shopping agentique », où l'IA ne se contente plus de répondre à des questions mais agit pour le compte de l'utilisateur. Pour les quelque 34 millions de membres Beauty Insider aux États-Unis, cela signifie potentiellement une expérience d'achat entièrement personnalisée, pilotée par un assistant capable d'analyser l'historique d'achats, les préférences de marques et les tendances beauté en temps réel. L'enjeu dépasse la simple recommandation produit : en laissant une IA accéder aux données comportementales de ses clients les plus fidèles, Sephora parie que la personnalisation de masse peut devenir un avantage concurrentiel durable face à la concurrence en ligne et aux plateformes comme Amazon. Ce partenariat s'inscrit dans une vague plus large de grands distributeurs qui cherchent à monétiser leurs données first-party à l'heure où les cookies tiers disparaissent. OpenAI, de son côté, accélère son virage vers les applications commerciales après avoir sécurisé des financements massifs, et le retail de luxe constitue un terrain d'expansion stratégique. La question qui reste ouverte est celle de la gouvernance : confier des données clients sensibles à un tiers comme OpenAI soulève des interrogations sur la souveraineté des données et la conformité au RGPD pour les opérations européennes de Sephora.

UESephora, entreprise française du groupe LVMH, confie des données clients sensibles à OpenAI, ce qui soulève des questions concrètes de conformité RGPD pour ses opérations européennes.

BusinessOpinion
1 source
1041Ars Technica AI 

Des retards de construction touchent 40 % des centres de données américains prévus pour 2026

Près de 40 % des projets de centres de données américains prévus pour 2026 accuseront un retard de plus de trois mois sur leur calendrier initial, selon une analyse publiée par le Financial Times. Ce constat repose sur des images satellites fournies par la société d'analyse géospatiale SynMax, croisées avec les déclarations publiques et documents de permis compilés par le groupe de recherche IIR Energy. Les projets concernés appartiennent à des géants technologiques comme Microsoft, Oracle et OpenAI. Les responsables de chantiers liés à OpenAI ont notamment signalé un manque critique d'artisans qualifiés, électriciens, monteurs de tuyauteries, pour mener de front plusieurs chantiers simultanément. Ce ralentissement menace directement les ambitions de l'industrie de l'intelligence artificielle, qui a engagé des centaines de milliards de dollars dans la construction de centres de données de plus en plus imposants, chacun pouvant consommer autant d'électricité que des centaines de milliers de foyers américains. Des retards de trois mois ou plus sur des infrastructures aussi stratégiques pèsent lourd : ils décalent la mise en production de capacités de calcul indispensables à l'entraînement et au déploiement des modèles d'IA, retardant par ricochet les lancements de produits et les engagements commerciaux pris auprès des clients cloud. Cette situation s'inscrit dans un contexte de course effrénée aux ressources : la demande de travailleurs spécialisés dans la construction de centres de données a explosé bien plus vite que l'offre disponible. À cela s'ajoutent des pénuries chroniques d'équipements électriques, des délais de raccordement au réseau électrique qui s'étendent parfois sur plusieurs années, et une résistance locale croissante dans certaines communautés qui s'inquiètent de l'impact de ces mégastructures sur la consommation d'eau et d'énergie. La question est désormais de savoir si l'industrie tech saura adapter son rythme d'investissement à la réalité des contraintes physiques et humaines du terrain.

UELes retards dans les capacités de calcul cloud américaines pourraient ralentir l'accès des entreprises européennes aux services d'IA et renchérir les coûts d'infrastructure.

InfrastructureActu
1 source
GPT-Rosalind : cette IA travaille gratuitement pour les chercheurs, mais il y a un hic
1042Le Big Data 

GPT-Rosalind : cette IA travaille gratuitement pour les chercheurs, mais il y a un hic

OpenAI a présenté le 16 avril 2026 GPT-Rosalind, un modèle d'intelligence artificielle de nouvelle génération conçu spécifiquement pour la recherche en biologie, la découverte de médicaments et la médecine translationnelle. Baptisé en hommage à la chimiste Rosalind Franklin, ce modèle est accessible en version test via ChatGPT, Codex et l'API d'OpenAI, mais uniquement pour un cercle restreint d'organisations américaines sélectionnées. Ses capacités couvrent la génomique, l'ingénierie des protéines et la chimie moléculaire : il croise des données complexes, formule des hypothèses biologiques et conçoit des protocoles expérimentaux complets. Sur BixBench, référence sectorielle en bioinformatique, il se classe premier parmi tous les modèles ayant publié leurs résultats. Sur LABBench2, il surpasse GPT-5.4 sur six tâches sur onze, avec une performance particulièrement nette sur CloningQA, un exercice de conception de réactifs pour protocoles de clonage moléculaire. En collaboration avec Dyno Therapeutics, le modèle a été testé sur des séquences d'ARN inédites : ses propositions ont dépassé 95 % des experts humains en prédiction de protéines, et atteint le 84e percentile pour la génération de séquences. Pour la recherche biomédicale, l'enjeu est considérable. Des tâches qui mobilisaient des équipes entières pendant des années peuvent désormais être accélérées par un modèle capable de raisonner sur des structures biologiques complexes. La gratuité pendant la phase de test lève la barrière financière pour les laboratoires, leur permettant d'expérimenter sans contrainte de budget. Si les performances observées se confirment en conditions réelles, GPT-Rosalind pourrait compresser significativement les cycles de développement de médicaments, dont les délais se comptent actuellement en décennies et les coûts en milliards de dollars. OpenAI a choisi une stratégie d'accès délibérément restrictive, justifiée par la sensibilité des domaines concernés. Les organisations candidates subissent une vérification approfondie : leurs travaux doivent présenter un impact collectif identifiable et positif. Les bénéficiaires acceptent des conditions d'usage strictes et s'engagent à mettre en place des mécanismes contre les détournements. Cette prudence n'est pas anodine : un modèle capable de manipuler des concepts biologiques avancés, comme la conception de protéines ou la modification de séquences génétiques, soulève des questions de biosécurité que la communauté scientifique et les régulateurs scrutent de près. Le lancement de GPT-Rosalind s'inscrit dans une course plus large entre OpenAI, Google DeepMind et des acteurs spécialisés comme Insilico Medicine pour dominer l'IA appliquée aux sciences de la vie, un marché estimé à plusieurs centaines de milliards de dollars d'ici 2030.

UELes laboratoires et chercheurs européens sont exclus de l'accès à GPT-Rosalind, réservé à un cercle restreint d'organisations américaines, creusant l'écart avec les acteurs américains dans la course à l'IA biomédicale.

RechercheOpinion
1 source
Google et le Pentagone discutent d'un accord IA classifié, l'entreprise renouant avec le secteur militaire
1043The Information AI 

Google et le Pentagone discutent d'un accord IA classifié, l'entreprise renouant avec le secteur militaire

Google est en négociation avec le Département de la Défense américain pour un accord qui permettrait au Pentagone de déployer les modèles d'intelligence artificielle Gemini dans des environnements classifiés. L'information, révélée par deux personnes ayant une connaissance directe des discussions, indique que les deux parties envisagent un contrat autorisant l'utilisation de l'IA de Google pour l'ensemble des usages légaux au sein des forces armées américaines. Selon l'une de ces sources, Google aurait proposé d'inclure dans le contrat des clauses restrictives visant à empêcher que ses modèles soient utilisés pour de la surveillance de masse intérieure ou pour des systèmes d'armes autonomes, notamment le ciblage, sans supervision humaine "appropriée". Cet accord marquerait un tournant majeur dans la relation entre Google et le secteur militaire. L'entreprise deviendrait un contractant technologique significatif du Pentagone, avec un accès potentiel à des infrastructures classifiées, un niveau d'engagement rarement atteint dans l'industrie tech civile. Pour l'armée américaine, intégrer Gemini dans des environnements sécurisés ouvrirait la voie à des capacités d'analyse, de traitement du renseignement et de prise de décision assistée par IA à une échelle et une vitesse sans précédent. Les garde-fous proposés par Google, bien que symboliquement importants, restent formulés de façon vague, notamment autour de la notion de contrôle humain "approprié", ce qui laisse une marge d'interprétation considérable. Ce rapprochement s'inscrit dans un renversement de position spectaculaire pour Google. En 2018, face à une fronde interne massive de ses employés, l'entreprise avait abandonné le projet Maven, un contrat avec le Pentagone portant sur l'analyse d'images de drones par IA, et s'était engagée à ne pas développer d'IA à usage militaire offensif. Depuis, la concurrence acharnée avec Microsoft, qui fournit déjà des services cloud et d'IA à l'armée via Azure et ses partenariats avec OpenAI, ainsi que la pression des actionnaires ont poussé Google à reconsidérer cette posture. La course aux contrats gouvernementaux dans le domaine de l'IA est désormais un enjeu stratégique majeur pour l'ensemble des grandes entreprises technologiques américaines.

UECe rapprochement militaro-technologique américain pourrait accélérer les débats européens sur la souveraineté technologique et l'encadrement de l'IA dans la défense.

BusinessActu
1 source
Broadcom et Meta : un partenariat à l’échelle du Gigawatt pour le futur de l’IA
1044Le Big Data 

Broadcom et Meta : un partenariat à l’échelle du Gigawatt pour le futur de l’IA

Meta et Broadcom ont officialisé le 14 avril 2026 un partenariat stratégique pluriannuel pour bâtir l'une des infrastructures de calcul IA les plus massives jamais conçues. Dès la première phase, la capacité déployée dépasse 1 gigawatt, avec une trajectoire assumée vers plusieurs gigawatts dans les années à venir. Au cœur du dispositif : les puces propriétaires MTIA (Meta Training and Inference Accelerator), conçues pour optimiser à la fois l'entraînement et l'inférence des modèles d'IA. Broadcom fournit l'ensemble de la chaîne matérielle, de la conception des accélérateurs via sa plateforme XPU à leur interconnexion réseau haut débit. La collaboration est prévue pour durer jusqu'en 2029 au moins, avec des générations successives de puces MTIA adaptées aux besoins évolutifs de Meta. Ce partenariat représente un changement d'échelle radical dans la façon dont les grandes plateformes numériques abordent leurs besoins en calcul. Meta ne se contente plus d'acheter des GPU sur étagère : l'entreprise co-conçoit avec Broadcom des accélérateurs taillés sur mesure pour ses propres charges de travail, ce qui permet d'optimiser conjointement la logique de calcul, la gestion mémoire et les transferts de données à haute vitesse. L'enjeu est concret : alimenter des services utilisés quotidiennement par des milliards de personnes, de WhatsApp à Instagram en passant par Threads, tout en réduisant le coût total de possession. Mark Zuckerberg a affiché publiquement l'ambition d'apporter des capacités d'IA avancées à chaque utilisateur, jusqu'à ce qu'il décrit comme une forme de "superintelligence personnelle". À cette échelle, chaque point d'efficacité matérielle se traduit directement en milliards de dollars d'économies ou de capacités supplémentaires. Ce mouvement s'inscrit dans une tendance de fond qui redessine l'industrie du semi-conducteur et des infrastructures cloud. Face à la domination de Nvidia sur le marché des GPU d'IA, les hyperscalers comme Meta, Google ou Amazon investissent massivement dans des puces personnalisées pour réduire leur dépendance à un seul fournisseur et reprendre le contrôle de leur stack matériel. Broadcom, qui accompagne déjà Google avec ses TPU, se positionne comme le partenaire de référence pour ces projets de co-conception à grande échelle. Le choix d'une architecture réseau basée sur Ethernet ouvert plutôt que sur des protocoles propriétaires facilite l'évolutivité et l'intégration dans des data centers existants. Avec des investissements qui se chiffrent désormais en gigawatts plutôt qu'en mégawatts, la course à l'infrastructure IA prend une dimension comparable à celle de l'industrie énergétique, et les prochains trimestres diront si cette stratégie d'hyper-scalabilité donne à Meta l'avantage compétitif recherché face à OpenAI, Google et Microsoft.

InfrastructureOpinion
1 source
1045VentureBeat AI 

Claude Managed Agents d'Anthropic offre aux entreprises un guichet unique mais soulève un risque de dépendance fournisseur

Anthropic a lancé la semaine dernière une nouvelle plateforme baptisée Claude Managed Agents, destinée aux entreprises souhaitant déployer des agents IA sans se confronter aux complexités techniques habituelles de l'orchestration. Selon Anthropic, la plateforme permet de passer d'un déploiement en semaines ou en mois à quelques jours seulement, en gérant nativement la définition des tâches, des outils et des garde-fous, ainsi que l'exécution des graphes d'état, le routage, la gestion des permissions et le traçage de bout en bout. Des données directionnelles de VentureBeat portant sur plusieurs dizaines d'entreprises au premier trimestre 2026 montrent par ailleurs que l'adoption des API d'orchestration native d'Anthropic est passée de 0 % à 5,7 % entre janvier et février, sur des panels respectifs de 56 et 70 organisations de plus de 100 employés. Microsoft Copilot Studio et Azure AI Studio restaient en tête avec 38,6 % des répondants en février, suivis d'OpenAI à 25,7 %. L'enjeu concret pour les entreprises est double. D'un côté, Claude Managed Agents promet de supprimer la couche d'orchestration externe, sandboxing, checkpointing, gestion des credentials, traçabilité, en l'absorbant directement dans le modèle. C'est un gain de vitesse et de simplicité réel pour des équipes déjà saturées par la multiplication des agents. De l'autre, cela implique de confier les données de session à une base gérée par Anthropic et de laisser l'exécution des agents se dérouler dans un environnement que l'entreprise ne contrôle pas pleinement. Le comportement des agents devient plus difficile à garantir, et les organisations s'exposent à des instructions contradictoires si leur seul levier de contrôle reste le prompting contextuel. Cette sortie s'inscrit dans une course à l'orchestration qui s'intensifie à mesure que les entreprises industrialisent leurs workflows agentiques. Anthropic, porté notamment par l'essor de Claude Code au cours de l'année écoulée, tente ainsi d'élargir son empreinte au-delà de la fourniture de modèles fondamentaux pour devenir le runtime de référence des agents d'entreprise. La stratégie ressemble à celle des grandes plateformes SaaS : créer un écosystème suffisamment intégré pour devenir difficile à quitter. C'est précisément ce que beaucoup d'entreprises espéraient éviter en adoptant l'IA, après avoir déjà subi les effets du lock-in avec leurs fournisseurs logiciels traditionnels. La question qui se pose désormais est de savoir si la promesse de simplicité et de rapidité justifie cette dépendance accrue à un fournisseur unique, et si les concurrents comme Microsoft ou OpenAI proposeront rapidement des alternatives comparables.

UELes entreprises européennes qui adoptent Claude Managed Agents s'exposent à un risque de dépendance fournisseur accru, sans cadre contractuel ou réglementaire spécifique encadrant la souveraineté des données de session confiées à Anthropic.

OutilsOpinion
1 source
L’IA gratuite, c’est terminé : les prix du compute s’envolent
1046FrenchWeb 

L’IA gratuite, c’est terminé : les prix du compute s’envolent

Pendant deux ans, l'intelligence artificielle a été proposée à des tarifs quasi symboliques : APIs accessibles, chatbots gratuits, génération de contenu à la demande. Cette période d'abondance artificielle touche désormais à sa fin. Les coûts du compute, longtemps subventionnés par les levées de fonds massives des grands acteurs, remontent à la surface, et les hausses de prix se multiplient chez les principaux fournisseurs de services IA. Ce retournement a des conséquences directes pour les entreprises et développeurs qui ont bâti leurs produits sur des hypothèses de coût très basses. Les marges se réduisent, les modèles économiques sont à revoir, et les startups les plus dépendantes des APIs tierces se retrouvent sous pression. Pour les utilisateurs finaux, la fin des offres gratuites ou très généreuses signifie une recomposition du marché : les acteurs capables de maîtriser leur infrastructure prendront l'avantage sur ceux qui sous-traitent entièrement leur compute. Ce tournant s'explique par la conjonction de plusieurs facteurs : la demande mondiale en puissance GPU explose tandis que l'offre reste contrainte, les datacenters saturent, et les investisseurs commencent à exiger de la rentabilité après des années de croissance à perte. OpenAI, Anthropic, Google et Microsoft ont tous signalé des tensions sur leurs infrastructures. La prochaine phase de l'IA sera celle de la sélection économique : seuls survivront les usages dont la valeur justifie réellement le coût de calcul.

UELes startups et développeurs européens qui ont bâti leurs produits sur des APIs IA bon marché doivent revoir en urgence leurs modèles économiques face à la remontée des coûts de compute.

💬 On y est. J'avais mis un an à convaincre des clients que les APIs IA à 0,002$ du token, c'était pas un modèle viable sur le long terme, et là ça se confirme brutalement. Les startups qui ont bâti leur MRR sur du compute subventionné par la VC money vont avoir quelques trimestres difficiles. Reste à voir qui a les reins assez solides pour absorber la hausse, ou qui va simplement disparaître.

InfrastructureOpinion
1 source
Perplexity voit ses revenus grimper de 50% grâce aux agents IA
1047Le Big Data 

Perplexity voit ses revenus grimper de 50% grâce aux agents IA

Perplexity, la startup américaine connue pour son moteur de recherche conversationnel, a vu son chiffre d'affaires annuel récurrent (ARR) bondir à 450 millions de dollars en mars 2026, soit une hausse de 50 % en un seul mois. Cette progression fait suite au lancement de Computer, un agent IA capable d'exécuter des tâches concrètes comme effectuer des achats en ligne, résumer l'actualité ou envoyer des e-mails à partir d'instructions en langage naturel. La société a également introduit un nouveau modèle de tarification à l'usage, qui facture les clients au-delà d'un certain quota de crédits, en complément de ses abonnements mensuels allant de 20 à 200 dollars. Perplexity revendique désormais plus de 100 millions d'utilisateurs actifs mensuels et plusieurs dizaines de milliers de clients professionnels. Pour replacer l'ampleur de cette croissance : l'ARR de la société était de 16 millions de dollars il y a deux ans, avant d'atteindre 305 millions début 2026. Ce bond de 50 % en un mois illustre un pivot stratégique majeur : Perplexity ne cherche plus seulement à concurrencer Google sur la recherche d'information, mais à se positionner sur le marché des agents IA autonomes, un segment en pleine explosion. En proposant des outils capables d'agir à la place de l'utilisateur, la startup s'attaque à un marché beaucoup plus vaste et potentiellement plus rentable que la simple requête web. L'ajout du navigateur Comet, qui intègre des fonctionnalités agentiques directement dans la navigation, et de Model Council, qui interroge plusieurs modèles d'IA en parallèle pour comparer leurs réponses, témoigne d'une diversification rapide de l'offre. Pour les entreprises et les professionnels, ces outils représentent une alternative crédible aux assistants IA des géants comme Google ou Microsoft. Cette ascension se déroule pourtant dans un contexte juridique tendu. Perplexity est visée par plusieurs poursuites d'éditeurs de presse, dont le New York Times et Britannica, pour violation de droits d'auteur et plagiat dans le cadre de son moteur de recherche. Une plainte distincte l'accuse également d'avoir partagé des données d'utilisateurs avec Google et Meta sans consentement, ce que la société rejette. Sur le plan financier, la rentabilité reste hors de portée : Perplexity dépend d'OpenAI, d'Anthropic et d'autres fournisseurs externes pour accéder aux modèles de langage, ce qui génère un coût à chaque requête. Malgré cela, les investisseurs maintiennent leur confiance. La valorisation de l'entreprise a atteint 20 milliards de dollars en septembre 2025, contre 500 millions début 2024, avec au capital des noms comme Nvidia, SoftBank, Jeff Bezos et Yann LeCun. La prochaine étape sera de transformer cette traction commerciale en profitabilité durable.

UELes entreprises européennes peuvent évaluer Perplexity comme alternative crédible aux assistants IA dominants, mais les poursuites pour violation de droits d'auteur soulèvent des questions de conformité avec la directive européenne sur le droit d'auteur.

BusinessActu
1 source
1048MarkTechPost 

Meta Superintelligence Lab lance Muse Spark : modèle multimodal avec compression du raisonnement et agents parallèles

Meta Superintelligence Labs a dévoilé Muse Spark, le premier modèle de sa famille Muse, marquant une étape majeure dans la course aux modèles de raisonnement multimodaux. Conçu nativement pour traiter texte et images de manière simultanée -- et non via un module visuel ajouté après coup -- Muse Spark intègre l'utilisation d'outils, un raisonnement visuel en chaîne de pensée, et une orchestration multi-agents. Sur le benchmark ScreenSpot Pro, qui évalue la capacité à localiser des éléments d'interface dans des captures d'écran, le modèle obtient un score de 72,2 (84,1 avec outils Python), devançant Claude Opus 4.6 Max à 57,7 et GPT-5.4 Xhigh à 39,0. Ces chiffres positionnent Muse Spark parmi les meilleurs modèles actuels sur les tâches combinant vision et langage. Ce qui distingue techniquement Muse Spark, c'est l'approche de Meta autour de trois axes de montée en puissance : le préentraînement, l'apprentissage par renforcement (RL), et le raisonnement au moment de l'inférence. Sur le préentraînement, Meta a entièrement reconstruit sa pile technique en neuf mois, atteignant les mêmes capacités que son précédent modèle Llama 4 Maverick avec dix fois moins de calcul. Le RL, appliqué après le préentraînement, entraîne le modèle à produire de bonnes réponses plutôt qu'à simplement prédire des tokens -- Meta annonce une progression log-linéaire stable sur les métriques pass@1 et pass@16. Enfin, le raisonnement à l'inférence introduit un phénomène que l'équipe appelle "thought compression" : le modèle apprend d'abord à penser plus longtemps pour mieux répondre, puis une pénalité sur la longueur de la réflexion le force à comprimer son raisonnement, avant qu'il n'étende à nouveau ses solutions pour atteindre de meilleures performances. Cette dynamique produit un modèle plus efficace par token généré. Le mode Contemplating représente peut-être l'innovation architecturale la plus audacieuse : Muse Spark peut orchestrer plusieurs agents en parallèle au moment de l'inférence, chacun explorant une piste de raisonnement différente. Ce choix s'inscrit dans une stratégie plus large de Meta, qui investit massivement dans l'infrastructure -- dont le data center Hyperion -- pour soutenir ces trois axes de scaling simultanément. La division a été rebaptisée Meta Superintelligence Labs, signalant une ambition explicite de leadership sur l'AGI. Avec OpenAI, Google DeepMind et Anthropic qui poussent chacun leurs propres architectures de raisonnement, la sortie de Muse Spark illustre que la prochaine frontière ne sera pas seulement la taille des modèles, mais la manière dont ils apprennent à penser -- et à comprimer cette pensée -- avant de répondre.

UELes développeurs et entreprises européens pourront utiliser un nouveau modèle multimodal de référence, mais aucun impact réglementaire ou commercial direct sur la France ou l'UE n'est à noter.

LLMsOpinion
1 source
1049The Verge AI 

Le secteur de l'IA face à une course aux profits devenue existentielle

Anthropic et OpenAI se trouvent à un tournant critique en 2026 : après avoir absorbé des centaines de milliards de dollars d'investissements en capital, en centres de données, en puces et en infrastructure, ces deux géants de l'IA doivent désormais prouver qu'ils peuvent devenir des entreprises véritablement rentables. Les projections financières des deux sociétés, révélées cette semaine par le Wall Street Journal, évoquent une croissance vertigineuse, avec des revenus se chiffrant en centaines de milliards de dollars d'ici la fin de la décennie. Cette semaine encore, OpenAI a levé 122 milliards de dollars supplémentaires, signalant que les marchés continuent de parier sur leur succès, mais la pression pour transformer cet argent en bénéfices n'a jamais été aussi intense, notamment à l'approche de deux des plus grandes introductions en bourse de l'histoire. Ce qui précipite la crise, c'est l'essor des agents IA comme Claude Code, Cowork ou Codex d'OpenAI, qui consomment des ressources de calcul à une cadence bien supérieure à ce que ces entreprises avaient anticipé. Pour gérer cette pression sur leurs infrastructures, les deux sociétés prennent des décisions douloureuses. OpenAI a brutalement supprimé son application de génération vidéo Sora le mois dernier, abandonnant au passage un contrat de licence d'un milliard de dollars avec Disney, au motif que le service coûtait trop cher à faire tourner et que la capacité de calcul était nécessaire pour Codex. Anthropic a de son côté décidé la semaine dernière d'interdire aux utilisateurs de Claude de consommer librement des ressources via le framework open source OpenClaw dans le cadre d'un abonnement standard, les forçant à basculer vers des plans à la consommation, nettement plus onéreux. Ces arbitrages révèlent une tension structurelle qui traverse toute l'industrie de l'IA : les modèles économiques construits sur l'abonnement mensuel ne tiennent plus face à l'appétit en calcul des agents. La plupart des dirigeants du secteur, interrogés ces derniers mois, anticipent d'ailleurs une vague de faillites spectaculaires parmi les acteurs les moins bien capitalisés, estimant que le marché ne pourra pas soutenir indéfiniment toutes les entreprises actuellement en course. Pour Anthropic et OpenAI, dont les introductions en bourse se profilent comme des événements majeurs, la question n'est plus simplement de savoir si l'IA générative est utile, mais si elle peut générer suffisamment de revenus pour justifier les valorisations colossales promises aux investisseurs. Les compromis opérationnels observés ces dernières semaines ne sont probablement que les premiers signes visibles d'un rééquilibrage profond qui va redéfinir quels produits survivent, et à quel prix.

UELe basculement vers une facturation à la consommation pour les agents IA va renchérir les coûts d'usage pour les développeurs et entreprises européens dépendant des APIs d'OpenAI et d'Anthropic.

BusinessOpinion
1 source
1050InfoQ AI 

MCP Dev Summit de l'AAIF : passerelles, gRPC et renforcement des protocoles

Le MCP Dev Summit North America 2026 s'est tenu les 2 et 3 avril au New York Marriott Marquis, réunissant environ 1 200 participants autour de l'évolution du Model Context Protocol (MCP). Organisé par l'Agentic AI Foundation, une initiative portée par la Linux Foundation, le sommet a mis en avant les défis concrets de déploiement du MCP en environnement d'entreprise, avec des contributions notables d'Amazon et d'Uber. Les discussions techniques ont porté sur trois axes majeurs : la sécurisation des passerelles (gateways), l'intégration via gRPC, et l'observabilité des protocoles en production. Ces orientations reflètent une maturité croissante du MCP, qui passe du stade expérimental à des déploiements à grande échelle dans des infrastructures critiques. Pour des entreprises comme Amazon ou Uber, la capacité à faire communiquer des agents IA de manière fiable, sécurisée et traçable devient un impératif opérationnel. L'accent mis sur l'interopérabilité signale que l'écosystème cherche à éviter la fragmentation entre implémentations propriétaires. Le MCP, initialement proposé par Anthropic fin 2024 comme standard ouvert pour connecter les modèles de langage aux outils et données externes, connaît une adoption accélérée depuis que des acteurs majeurs comme OpenAI et Google ont annoncé leur support. La prise en charge par la Linux Foundation via l'Agentic AI Foundation marque une étape vers sa gouvernance communautaire. Ce sommet illustre que le vrai enjeu n'est plus l'existence du protocole, mais sa robustesse industrielle face aux exigences de sécurité et de scalabilité des grandes organisations.

UEL'adoption du MCP comme standard ouvert sous gouvernance Linux Foundation crée un cadre d'interopérabilité que les entreprises européennes déployant des agents IA devront intégrer dans leurs architectures.

OutilsActu
1 source