Aller au contenu principal

Dossier OpenAI — page 24

2045 articles · page 24 sur 41

Toute l'actualité d'OpenAI : nouvelles versions de ChatGPT et GPT, stratégie produit, partenariats, controverses et décisions de Sam Altman.

Le fil IA d'X lance Grok 4.5, premier modèle de niveau Opus après le rachat de Cursor
1151Latent Space LLMsOpinion

Le fil IA d'X lance Grok 4.5, premier modèle de niveau Opus après le rachat de Cursor

xAI, la société d'Elon Musk également désignée sous le nom SpaceXAI, a officiellement lancé Grok 4.5 les 7 et 8 juillet 2026, son premier modèle entraîné spécifiquement pour le code et les agents autonomes, développé en partenariat avec l'éditeur de l'IDE Cursor. Musk avait annoncé la veille que le modèle serait rendu public, le qualifiant de « niveau Opus » mais plus rapide, plus économe en tokens et moins coûteux, avant de préciser qu'il se situait « à peu près au niveau d'Opus 4.7, mais bien plus rapide ». Cursor a confirmé avoir coentraîné le modèle, le décrivant comme le plus puissant qu'il ait proposé et le premier conçu pour aller au-delà du simple génie logiciel, avec un doublement des quotas d'usage offert pendant la première semaine. Grok 4.5 pèse 1 500 milliards de paramètres, soit trois fois la taille de Grok 4.3, mais sa fenêtre de contexte a été ramenée à 500 000 tokens contre 1 million auparavant, Musk annonçant un retour prévu à 1 million de tokens sous une semaine. Côté tarifs, xAI facture 2 dollars par million de tokens en entrée et 6 dollars en sortie, avec une remise de 75% sur les tokens en cache (0,5 dollar) mais un coût doublé au-delà de 200 000 tokens d'entrée. Le modèle est disponible dès le lancement sur Grok Build, l'API, Cursor, Hermes Agent, Grok Portal et OpenRouter. Cette stratégie tarifaire est le cœur du message de xAI: plutôt que de revendiquer la suprématie absolue sur les benchmarks, l'entreprise mise sur le rapport performance-prix pour s'imposer dans le marché du codage assisté par agents, aujourd'hui dominé par Anthropic, OpenAI et les outils liés à Cursor. La comparaison est frappante: Grok 4.5 coûte 2 dollars en entrée et 6 en sortie, contre 5 et 30 dollars pour GPT-5.6 et 5 et 25 dollars pour Opus 4.8. Pour les développeurs et les entreprises qui consomment massivement des tokens dans des workflows agentiques, cet écart de prix peut peser lourd dans le choix du modèle, et met une pression tarifaire directe sur les ténors du secteur. Ce lancement intervient alors que GPT-5.6 doit sortir dès le lendemain, ce qui réduit la fenêtre d'attention accordée à Grok 4.5. Le contexte plus large est celui d'une course à l'évaluation de plus en plus contestée: selon l'équipe d'évaluation d'OpenAI elle-même, le benchmark SWE-Bench Pro serait désormais saturé, voire structurellement biaisé, ce qui pousse l'industrie vers de nouveaux tests comme FrontierCode. xAI n'a par ailleurs communiqué que très peu d'informations sur l'entraînement et les données utilisées pour Grok 4.5.

Tencent lance Hy3, un modèle MoE ouvert de 295 milliards de paramètres (21 milliards actifs) et 256K de contexte
1152MarkTechPost 

Tencent lance Hy3, un modèle MoE ouvert de 295 milliards de paramètres (21 milliards actifs) et 256K de contexte

Tencent a présenté Hy3, un nouveau modèle de langage à architecture Mixture-of-Experts (MoE) doté de 295 milliards de paramètres au total, dont seulement 21 milliards sont activés à chaque requête grâce à un système de 192 experts avec routage top-8. Le modèle intègre également une couche de prédiction multi-tokens (MTP) de 3,8 milliards de paramètres, compatible avec vLLM et SGLang pour accélérer le décodage. Hy3 gère un contexte de 256 000 tokens, dispose d'un vocabulaire de 120 832 éléments et repose sur 80 couches en précision BF16, avec une version allégée en FP8 également disponible. Les poids sont publiés sous licence Apache 2.0, rendant le modèle librement réutilisable. Sur le plan des performances, Tencent revendique un score de 78,0 sur SWE-Bench Verified, 57,9 sur SWE-Bench Pro et 90,4 sur GPQA Diamond, ainsi que 90,0 sur IMOAnswerBench. Un test à l'aveugle mené auprès de 270 experts, totalisant 312 comparaisons sur des tâches réelles, a donné à Hy3 un score de 2,67 sur 4, devançant GLM-5.1 crédité de 2,51, notamment sur le développement frontend, les pipelines CI/CD et la gestion de données. Cette publication marque une avancée notable pour les modèles ouverts destinés aux usages professionnels et agentiques. Tencent a concentré une grande partie de ses efforts sur la fiabilité en production, un point souvent négligé par les modèles expérimentaux. Le taux d'hallucination est ainsi passé de 12,5 % à 5,4 % dans les évaluations internes, tandis que les erreurs de bon sens ont chuté de 25,4 % à 12,7 %. Le suivi des intentions sur plusieurs tours de conversation s'est également amélioré, avec un taux d'incidents internes réduit de 17,4 % à 7,9 %, et un score passant de 42,9 % à 75,1 % sur le benchmark de dialogue long MRCR. Ces progrès concernent directement les développeurs qui déploient des agents autonomes pour la programmation ou le traitement de documents longs, un secteur où les erreurs d'appels d'outils et les boucles infinies restent un frein majeur à l'adoption en production. Le modèle s'inscrit dans un contexte de compétition intense entre acteurs chinois et américains sur les modèles ouverts à grande échelle, avec des rivaux comme GLM-5.1 pris comme référence de comparaison directe. Hy3 expose une API compatible OpenAI, déployable via vLLM ou SGLang, avec un paramètre reasoningeffort ajustable entre "nothink", "low" et "high" selon la complexité de la tâche, les développeurs de Tencent recommandant une température de 0,9 et un top_p de 1,0. Le modèle est aussi accessible sans matériel local via OpenRouter, où une route gratuite tencent/hy3:free est proposée, mais cette gratuité doit prendre fin le 21 juillet 2026. Les cas d'usage visés incluent les agents de programmation capables d'ingérer un dépôt entier grâce à la fenêtre de contexte de 256 000 tokens, ainsi que le traitement de documents longs comme des contrats, positionnant Hy3 comme un outil taillé pour les flux de travail professionnels exigeants en fiabilité et en capacité de raisonnement.

UECe modèle ouvert sous licence Apache 2.0 élargit l'offre disponible pour les entreprises et développeurs européens souhaitant déployer des agents IA sans dépendre des acteurs américains, mais aucune entité ou régulation française ou européenne n'est directement impliquée.

LLMsActu
1 source
Mistral : son PDG Mensch affirme que les modèles IA propriétaires donnent aux labos un accès privilégié aux processus des entreprises
1153The Decoder 

Mistral : son PDG Mensch affirme que les modèles IA propriétaires donnent aux labos un accès privilégié aux processus des entreprises

Arthur Mensch, cofondateur et PDG de Mistral AI, a mis en garde les entreprises contre leur dépendance aux modèles d'intelligence artificielle propriétaires fermés. Selon lui, les grands laboratoires d'IA accumulent des quantités croissantes de données issues de leurs clients professionnels, au point que certains auraient déjà exploité ces informations pour concurrencer directement les entreprises qui utilisaient leurs services. Mensch n'a pas cité de noms précis, mais le message vise implicitement les géants américains du secteur comme OpenAI et Anthropic, avec lesquels Mistral est directement en concurrence sur le marché européen de l'IA. Cet avertissement soulève un enjeu stratégique majeur pour les entreprises qui confient leurs processus internes, leurs documents et leurs données sensibles à des modèles fermés hébergés par des tiers. Si un fournisseur d'IA a accès à ces flux d'informations, il dispose potentiellement d'une vision privilégiée sur le fonctionnement, les besoins et les faiblesses de ses propres clients, un risque de conflit d'intérêts rarement discuté publiquement jusqu'ici. Pour les entreprises, cela renforce l'argument en faveur de solutions ouvertes, personnalisables ou hébergées localement plutôt que de dépendre entièrement d'acteurs externes. Cette sortie s'inscrit dans la stratégie plus large de Mistral, qui peine à rivaliser en pure performance avec les modèles de pointe d'OpenAI ou d'Anthropic et mise donc sur d'autres arguments différenciants, notamment la souveraineté numérique européenne et la transparence. En positionnant ses modèles comme une alternative plus sûre et indépendante des géants américains, Mistral cherche à convaincre entreprises et gouvernements européens de privilégier des solutions locales, dans un contexte où la confidentialité des données devient un enjeu géopolitique et commercial de plus en plus central.

UEMistral, entreprise française, utilise cet argument de confidentialité des données pour promouvoir la souveraineté numérique européenne face aux modèles propriétaires américains.

💬 Mensch a raison sur le fond, mais il ne faut pas être naïf sur le timing : il sort cet argument pile quand Mistral galère à suivre sur les benchmarks purs. Reste que le point est juste, un labo qui voit passer tous tes prompts et tes documents internes a une vue imprenable sur ta boîte, et personne n'en parle vraiment. Selon Le Fil IA, la vraie bataille de l'IA en entreprise ne se jouera plus sur les benchmarks mais sur qui a accès à quoi dans tes données.

ÉthiqueOpinion
1 source
Amazon pourrait payer davantage pour la technologie d'Anthropic avec son nouveau contrat
1154The Information AI 

Amazon pourrait payer davantage pour la technologie d'Anthropic avec son nouveau contrat

Anthropic a renégocié en début d'année les termes de son partenariat avec Amazon, imposant des conditions financières plus contraignantes au géant du cloud et du e-commerce pour l'utilisation de ses modèles d'IA dans ses produits. L'information, révélée par deux personnes proches des discussions, illustre le rapport de force désormais inversé entre la startup et l'un de ses premiers et plus importants bailleurs de fonds. En conséquence directe, Amazon évalue actuellement la possibilité de réduire ses coûts en se tournant vers d'autres modèles, notamment ceux d'OpenAI ou sa propre gamme Nova. Ce changement de cap est significatif pour Amazon, qui a investi plusieurs milliards de dollars dans Anthropic et intègre ses modèles Claude dans de nombreux services AWS. Si Amazon devait réduire sa dépendance à Anthropic, cela aurait des répercussions sur la stratégie IA du cloud leader, mais aussi sur les revenus d'Anthropic, dont Amazon constitue un partenaire commercial central. Pour les entreprises clientes, cela signale aussi que les tarifs des modèles frontier pourraient augmenter à mesure que les fournisseurs gagnent en maturité et en pouvoir de négociation. Anthropic s'est imposée comme l'un des acteurs incontournables de l'IA d'entreprise, concurrençant directement OpenAI sur le segment des grands comptes. Sa valorisation dépasse désormais les 60 milliards de dollars, portée par une adoption rapide de la famille Claude. Cette renégociation illustre une tendance de fond : les startups IA, longtemps dépendantes de leurs investisseurs stratégiques, commencent à reprendre la main sur leurs conditions commerciales au fur et à mesure que leur technologie devient indispensable.

UELes entreprises européennes utilisant les modèles Claude via AWS pourraient anticiper une hausse des tarifs si Anthropic généralise cette politique de renégociation à ses autres partenaires cloud.

💬 Le rapport de force a basculé. Anthropic, longtemps à la merci de ses investisseurs, impose maintenant ses tarifs à Amazon, qui lorgne du côté d'OpenAI ou de ses propres modèles Nova. C'est le signal que la phase "on investit pour garder l'accès" est terminée : quand ta techno devient indispensable, c'est toi qui dictes les règles.

BusinessActu
1 source
Des documents internes révèlent que Meta encadre l'usage de Claude et Codex par crainte de distillation
1155The Information AI 

Des documents internes révèlent que Meta encadre l'usage de Claude et Codex par crainte de distillation

Meta cherche activement à réduire sa dépendance aux outils d'IA tiers, notamment Claude Code d'Anthropic et Codex d'OpenAI, pour le développement logiciel en interne. Selon des documents internes consultés par The Information, la division d'ingénierie IA appliquée du groupe a reçu des directives strictes encadrant l'utilisation de ces deux assistants de programmation. Un mémo interne a même ordonné à certaines équipes de suspendre des tâches faisant appel à ces modèles, par crainte que leurs réponses ne s'infiltrent dans les données d'entraînement propriétaires de Meta. Le risque identifié est précis : si des sorties de Claude ou Codex finissent dans les jeux de données d'entraînement de Meta, cela pourrait constituer une violation des conditions d'utilisation d'Anthropic et d'OpenAI, provoquant selon le document de "sérieuses escalades avec les entreprises partenaires." Ces restrictions révèlent une tension structurelle entre l'efficacité immédiate que procurent ces outils et la stratégie à long terme de Meta, qui veut construire ses propres capacités sans s'exposer à des litiges ou à des accusations de distillation non autorisée. Cette situation illustre un dilemme plus large que traverse l'industrie technologique : les grandes entreprises paient pour accéder aux meilleurs outils d'IA disponibles tout en cherchant à les remplacer par leurs propres systèmes. Meta investit massivement dans ses modèles Llama et dans ses infrastructures d'IA, mais ses ingénieurs continuent de s'appuyer sur des solutions externes jugées plus performantes au quotidien. La question de la souveraineté des données d'entraînement devient ainsi un enjeu juridique et concurrentiel central pour l'ensemble du secteur.

💬 Ce que révèle ce mémo, c'est que même Meta ne peut pas s'en passer : Claude et Codex sont visiblement plus efficaces que leurs propres outils en interne. Le vrai problème légal, c'est la distillation : les CGU d'Anthropic et OpenAI interdisent explicitement d'utiliser leurs sorties pour entraîner un modèle concurrent, et Meta le sait très bien. On se retrouve dans la situation absurde où les plus grands acteurs du secteur paient pour accéder à des outils qu'ils cherchent à copier, avec une épée de Damoclès contractuelle au-dessus de la tête.

BusinessActu
1 source
La réputation d'Anthropic a poussé DeepSeek à lever 7,4 milliards de dollars
1156The Information AI 

La réputation d'Anthropic a poussé DeepSeek à lever 7,4 milliards de dollars

DeepSeek, le laboratoire d'IA chinois fondé il y a trois ans, vient de boucler une levée de fonds de 7,4 milliards de dollars à la mi-juin 2026, valorisant la startup à plus de 50 milliards de dollars. Il s'agit de la plus grande première levée de fonds jamais réalisée par une startup chinoise. Jusqu'à présent, DeepSeek fonctionnait uniquement grâce à la fortune personnelle de son PDG, Liang Wenfeng, sans jamais avoir fait appel à des investisseurs extérieurs. Ce changement de cap a été déclenché par la publication en avril par Anthropic d'un aperçu de Mythos, un nouveau modèle présenté par la société américaine comme suffisamment puissant pour détecter et exploiter des failles dans des logiciels. Cette capacité offensive inédite a manifestement alarmé la direction de DeepSeek : trois sources proches du PDG confirment que c'est précisément cette annonce qui a convaincu Liang Wenfeng de sortir de son indépendance financière et d'ouvrir le capital de l'entreprise. La décision illustre comment l'escalade technologique entre laboratoires américains et chinois redessine les stratégies de financement de l'IA à l'échelle mondiale. DeepSeek s'était distingué en proposant des modèles très performants à moindre coût, bousculant les acteurs établis comme OpenAI début 2025. Mais face à des capacités offensives potentiellement déstabilisatrices du côté américain, même les acteurs les plus frugaux semblent contraints de lever des capitaux massifs pour rester dans la course.

UEL'intensification de la course aux capitaux entre laboratoires américains et chinois creuse l'écart de financement avec les acteurs européens de l'IA, qui n'ont pas encore atteint ce niveau de levées massives.

💬 Mythos d'Anthropic a suffi à faire lever 7 milliards à un PDG qui se finançait sur sa fortune perso depuis trois ans. Quand une annonce de capacités offensives déclenche la plus grosse première levée de l'histoire des startups chinoises, c'est qu'on a changé d'ère : l'IA n'est plus une compétition de benchmark, c'est une course aux armements. Et les Européens regardent ça de loin, les poches vides.

BusinessOpinion
1 source
Le LFM2.5-230M de Liquid AI surpasse des modèles 4 fois plus grands en extraction de données et tourne partout
1157VentureBeat AI 

Le LFM2.5-230M de Liquid AI surpasse des modèles 4 fois plus grands en extraction de données et tourne partout

Liquid AI, une startup fondée par d'anciens chercheurs du MIT, a lancé le 26 juin 2026 son modèle de langage le plus compact à ce jour : LFM2.5-230M. Avec seulement 230 millions de paramètres, ce modèle de fondation est conçu pour fonctionner directement sur les appareils, smartphones, ordinateurs portables, systèmes robotiques, sans connexion permanente au cloud. Malgré sa taille réduite, il surpasse à la tâche d'extraction de données des modèles jusqu'à quatre fois plus grands, notamment le Qwen3.5-0.8B d'Alibaba (800 millions de paramètres) et le Gemma 3 1B de Google (1 milliard de paramètres). Sur un Samsung Galaxy S25 Ultra équipé d'un Snapdragon Gen4, il atteint 213 tokens par seconde en décodage ; sur un Raspberry Pi 5, il maintient 42 tokens par seconde. Sa fenêtre de contexte de 32 000 tokens lui permet d'ingérer de longs documents ou des flux continus de données de télémétrie robotique. Son empreinte mémoire reste inférieure à 400 Mo. Le modèle est entraîné sur 19 000 milliards de tokens et proposé sous licence duale : gratuit pour les entreprises générant moins de 10 millions de dollars de revenus annuels, payant au-delà. Pour les équipes data et les développeurs d'applications embarquées, l'enjeu est concret. Les entreprises s'appuient encore largement sur des pipelines ETL (Extract, Transform, Load) rigides et basés sur des règles fixes, des systèmes qui se brisent dès qu'un document change de format ou qu'un schéma évolue. LFM2.5-230M ouvre la voie à un « AI ETL » capable d'inférer automatiquement les correspondances de données, de détecter les dérives de schéma et de structurer des sources non structurées, PDF, e-mails, formulaires web, en JSON sans intervention humaine. Ce type de flux agentique léger peut désormais s'exécuter localement, sans dépendance au cloud, ce qui réduit la latence, les coûts d'infrastructure et les risques liés à la confidentialité des données. Cette sortie illustre une fracture croissante dans l'industrie de l'IA. D'un côté, Anthropic, OpenAI, Google, Microsoft et Meta poussent leurs modèles vers des centaines de milliards, voire des milliers de milliards de paramètres pour atteindre les performances dites frontier. De l'autre, une course parallèle s'intensifie autour de l'efficience architecturale pour l'inférence locale. Liquid AI mise sur son architecture LFM2, un système hybride combinant convolutions à courte portée et mécanismes d'attention groupée, qui contourne les coûts quadratiques en mémoire des transformers classiques. Cette approche permet d'obtenir des vitesses d'inférence élevées sur du matériel contraint, là où les transformers purs s'essoufflent. Le positionnement de Liquid AI, efficience plutôt que mise à l'échelle brutale, pourrait séduire un segment d'entreprises que les géants du cloud peinent à servir : celles qui ont besoin d'IA performante sans exposer leurs données ni investir dans une infrastructure coûteuse.

LLMsOpinion
1 source
☕️ ChatGPT va illustrer ses réponses avec les photos de Getty Images
1158Next INpact 

☕️ ChatGPT va illustrer ses réponses avec les photos de Getty Images

OpenAI et Getty Images ont annoncé un partenariat permettant à ChatGPT d'intégrer des photographies sous licence issues de la banque d'images américaine directement dans ses réponses aux recherches web. L'accord a été officialisé par Craig Peters, directeur général de Getty Images, qui a déclaré que « des contenus visuels de haute qualité et sous licence rendent la recherche et la découverte alimentées par l'IA plus utiles et plus fiables ». Concrètement, lorsqu'un utilisateur effectue une recherche sur ChatGPT, il pourra désormais voir apparaître des images professionnelles et authentiques aux côtés des réponses textuelles, sans que celles-ci soient générées artificiellement. Les conditions financières de l'accord n'ont pas été divulguées, et il n'est pas précisé si OpenAI pourra utiliser le catalogue de Getty pour entraîner ses modèles d'IA. Ce partenariat représente un tournant significatif pour plusieurs raisons. Pour les utilisateurs de ChatGPT qui l'emploient comme moteur de recherche, l'accès à des photographies originales de qualité professionnelle constitue une amélioration concrète de l'expérience, notamment face au risque de désinformation que peuvent alimenter les images photoréalistes générées par IA. Pour OpenAI, l'accord présente aussi un avantage opérationnel : produire des images photoréalistes synthétiques est coûteux en ressources de calcul et les résultats n'atteignent jamais la qualité d'une photographie réelle. Mais c'est pour Getty Images que l'impact est le plus spectaculaire à court terme : l'action de l'entreprise avait chuté de 55 % depuis le début de l'année 2026, les investisseurs redoutant que les IA génératives ne vident progressivement de leur sens le métier d'agence photo. L'annonce du partenariat avec OpenAI a suffi à propulser le titre de plus de 100 % en pré-marché. Getty Images entretient depuis plusieurs années une relation ambivalente avec l'IA générative. En 2023, l'agence avait déposé une plainte à Londres contre Stability AI, le créateur de Stable Diffusion, pour utilisation non autorisée de son catalogue d'images lors de l'entraînement du modèle. La même année, elle lançait paradoxalement son propre outil de génération d'images, entraîné sur ses fonds photographiques à l'exclusion des photos d'actualités. En octobre 2025, un premier accord avec le moteur de réponses Perplexity avait déjà ouvert la voie à cette stratégie de monétisation du catalogue via des partenariats avec des plateformes IA. Le deal avec OpenAI s'inscrit donc dans une logique de repositionnement : plutôt que de subir la disruption, Getty tente de devenir un fournisseur incontournable de contenu visuel authentique pour les géants de l'IA, pariant que la qualité et la légitimité juridique de ses images constitueront un avantage durable face aux générateurs.

UELes photographes et agences photo européennes distribuant via Getty Images pourraient bénéficier de ce modèle de monétisation par licences, et ce partenariat pourrait faire jurisprudence dans les négociations en cours autour de l'AI Act sur la rémunération des détenteurs de droits visuels.

Amazon Bedrock AgentCore est disponible en production : passez d'une idée à un agent opérationnel en quelques minutes
1159AWS ML Blog 

Amazon Bedrock AgentCore est disponible en production : passez d'une idée à un agent opérationnel en quelques minutes

Amazon a annoncé le 18 juin 2026 la disponibilité générale d'AgentCore Harness, une nouvelle couche d'infrastructure de sa plateforme Bedrock conçue pour déployer des agents IA en production en quelques minutes. Le service repose sur deux appels API, CreateHarness pour définir un agent, InvokeHarness pour l'exécuter, et s'appuie sur les six primitives déjà disponibles en préversion depuis avril : Runtime, Memory, Gateway, Browser, Identity et Observability. L'agent tourne dans un environnement isolé doté d'un système de fichiers et d'un shell, peut lire des fichiers, exécuter des commandes et écrire du code. Il conserve la mémoire des utilisateurs et des conversations entre sessions, navigue sur le web, appelle des outils via MCP ou Gateway, et chaque étape est automatiquement tracée vers CloudWatch. Le problème qu'AgentCore Harness cherche à résoudre n'est pas la conception de l'agent, c'est tout ce qui l'entoure. Monter un prototype en local prend une après-midi ; le passer en production explose le volume de travail : concurrence, isolation, gestion des identités, état distribué, mise à l'échelle. Et ce coût se répétait à chaque nouveau cas d'usage, chaque changement de modèle, chaque nouvel outil. Le Harness absorbe ce câblage en tant qu'abstraction gérée, ce qui le transforme en quelque chose qu'on configure plutôt que quelque chose qu'on construit. Pour les équipes qui expérimentent plusieurs modèles ou cherchent à optimiser le rapport prix-performance, la fonctionnalité la plus attendue est la capacité à changer de fournisseur de modèle en cours de session sans perdre le contexte conversationnel. La compatibilité multi-modèles est au coeur de l'offre. Bedrock supporte déjà Anthropic Claude, Amazon Nova, Meta Llama, DeepSeek, Qwen, Cohere et Mistral, et vient d'intégrer OpenAI GPT-5.5 et GPT-5.4. Le service s'étend également à l'API OpenAI directe, Google Gemini, et via LiteLLM à Vertex, Azure OpenAI et d'autres. Cette ouverture reflète une tendance de fond : les grandes plateformes cloud se positionnent non plus comme fournisseurs d'un seul modèle, mais comme couches d'orchestration universelles. Amazon rejoint ainsi Microsoft Azure AI Foundry et Google Vertex AI dans la course aux plateformes d'agents prêtes pour la production. La prochaine étape sera de voir si cette abstraction tient sous la charge réelle et si les équipes adoptent le catalogue de compétences AWS plutôt que de continuer à construire leurs propres outils.

UELes équipes européennes développant des agents IA peuvent adopter cette infrastructure gérée pour réduire la charge opérationnelle liée au déploiement en production, mais aucune entreprise ou réglementation française ou européenne n'est directement impliquée.

OutilsOpinion
1 source
DXC et Anthropic apportent l’IA aux systèmes critiques d’entreprise
1160Le Big Data 

DXC et Anthropic apportent l’IA aux systèmes critiques d’entreprise

DXC Technology et Anthropic ont annoncé le 11 juin 2026 une alliance mondiale pluriannuelle visant à déployer l'IA générative Claude au coeur des systèmes critiques des grandes entreprises et administrations publiques. DXC, présent dans plus de 70 pays et fort de 115 000 collaborateurs, gère depuis plusieurs décennies des infrastructures technologiques pour des banques, assureurs, compagnies aériennes et gouvernements. Dans ce cadre, DXC rejoint le réseau d'Anthropic en tant que "Global Premier Claude Partner". Le partenariat repose sur une approche déjà éprouvée en interne: en avril 2026, DXC a lancé OASIS, une plateforme d'orchestration native IA dans laquelle Claude est désormais le modèle par défaut pour automatiser les flux de travail informatique. La société affirme que plus de 95% du code d'OASIS a été généré avec l'aide de Claude, avant validation par des ingénieurs, ce qui aurait permis de multiplier par dix la vitesse de développement logiciel. La plateforme est déjà déployée chez plus de 50 clients, et DXC prévoit de former des dizaines de milliers d'ingénieurs certifiés via l'Anthropic Academy pour les intégrer directement chez les clients. L'enjeu central de ce partenariat est de faire entrer l'IA générative dans des environnements où la tolérance aux erreurs est quasi nulle. Pour les secteurs bancaire, assurantiel ou aérien, intégrer Claude dans des opérations critiques impose des niveaux très élevés de sécurité, de conformité réglementaire et de disponibilité continue. La promesse d'une accélération par dix du cycle de développement logiciel est particulièrement significative pour les grandes organisations cherchant à moderniser leurs systèmes historiques sans exploser les coûts ni étirer indéfiniment les cycles de transformation. Pour Anthropic, DXC représente surtout un canal de distribution massif vers des clients enterprise que les approches commerciales directes atteignent difficilement. Quatre domaines prioritaires ont été identifiés: l'assurance, avec la modernisation des systèmes centraux et le développement d'agents spécialisés; la modernisation applicative, pour analyser et refactoriser des bases de code historiques; la cybersécurité, avec un sous-agent Claude intégré aux centres d'opérations de sécurité; et la gestion des infrastructures IT. Cette alliance s'inscrit dans une tendance structurelle plus large: les grands acteurs des services informatiques, d'Accenture à IBM en passant par Capgemini, cherchent tous à s'adosser aux laboratoires d'IA pour proposer des offres packagées aux décideurs des grandes organisations. Anthropic, qui a levé plusieurs milliards de dollars ces dernières années dans un contexte de concurrence intense avec OpenAI et Google, accélère ainsi sa stratégie de diffusion via des partenaires disposant d'un accès privilégié aux marchés réglementés. OASIS devrait être déployé à plus grande échelle dans les mois à venir.

UEDXC Technology étant actif dans plus de 70 pays dont la France, ce partenariat avec Anthropic pourrait accélérer le déploiement de Claude dans les banques, assureurs et administrations publiques françaises et européennes qui s'appuient sur les services DXC.

BusinessOpinion
1 source
Les agents IA de codage trouvent le bon fichier mais passent à côté des lignes essentielles, selon une étude
1161The Decoder 

Les agents IA de codage trouvent le bon fichier mais passent à côté des lignes essentielles, selon une étude

Les agents de codage dopés à l'intelligence artificielle, comme Claude Code d'Anthropic ou Codex d'OpenAI, souffrent d'un angle mort précis : ils localisent correctement le fichier contenant un bug, mais ratent la majorité des lignes critiques à l'intérieur de ce fichier. C'est ce que révèle SWE-Explore, un nouveau benchmark conçu spécifiquement pour évaluer la phase d'exploration du code, c'est-à-dire la recherche et la navigation dans une base de code, séparément de la phase de correction proprement dite. C'est une première dans l'évaluation des outils de développement automatisé. Ce découplage entre exploration et réparation change la façon d'interpréter les performances des agents de codage. Jusqu'ici, les benchmarks dominants comme SWE-bench mesuraient uniquement le résultat final : le bug est-il corrigé ou non ? SWE-Explore montre qu'un agent peut échouer non pas parce qu'il ne sait pas corriger le code, mais parce qu'il n'a pas identifié les bonnes lignes à modifier. Sans contexte suffisant, même le meilleur algorithme de correction produit un patch inutile. Les développeurs qui s'appuient sur ces outils en production s'exposent donc à des corrections en apparence valides mais ciblant les mauvaises sections. Ce travail s'inscrit dans une dynamique de remise en question des métriques utilisées pour comparer les agents de développement. L'industrie investit massivement dans ces outils, GitHub Copilot, Cursor, Devin, et les entreprises les vendent sur des taux de résolution de tickets. SWE-Explore suggère que ces chiffres masquent une faiblesse structurelle en amont : la compréhension fine d'une base de code existante reste un problème ouvert, et le résoudre conditionne tout le reste.

UELes développeurs français et européens qui s'appuient sur des agents de codage IA en production s'exposent à des corrections en apparence valides mais ciblant les mauvaises sections de code, une limite structurelle à évaluer avant tout usage professionnel critique.

💬 Ça explique des trucs que j'ai vécus : le patch arrive, il compile, les tests passent, et pourtant le bug est toujours là parce que l'agent a retouché le mauvais endroit. SWE-Explore met le doigt dessus avec rigueur, en séparant la phase de navigation de la phase de correction, ce qui n'avait jamais été fait proprement. Les éditeurs vont devoir intégrer ça dans leurs benchmarks marketing, parce que vendre sur des taux de résolution de tickets quand la moitié du problème est en amont, c'est se raconter des histoires.

RecherchePaper
1 source
Google poursuit en justice un réseau cybercriminel chinois ayant utilisé Gemini pour automatiser des arnaques
1162Ars Technica AI 

Google poursuit en justice un réseau cybercriminel chinois ayant utilisé Gemini pour automatiser des arnaques

Google a intenté une action en justice contre un groupe cybercriminel chinois baptisé Outsider Enterprise, accusé d'avoir orchestré une campagne de fraude massive alimentée par l'intelligence artificielle. Selon les documents déposés par l'entreprise, Outsider Enterprise opère principalement via Telegram, où il propose des services de phishing clés en main à des individus peu familiers avec les techniques informatiques. Le groupe aurait fourni des instructions détaillées pour utiliser Gemini, le modèle d'IA de Google, afin de créer des sites web imitant ceux de Google lui-même, YouTube, et des agences gouvernementales américaines comme le système de péage E-ZPass de New York. Au total, le réseau a généré près de 300 modèles d'arnaque, 9 000 faux sites web, et un million d'URL frauduleuses. Plus de 2,5 millions de messages texte ont été envoyés à des utilisateurs Android, dont 55 000 en seulement deux semaines au cours du mois dernier. Cette affaire illustre concrètement les risques liés à la démocratisation des outils d'IA générative : des acteurs malveillants peuvent désormais automatiser et industrialiser des campagnes de fraude sophistiquées sans compétences techniques poussées. Les victimes ciblées sont des particuliers qui reçoivent de faux messages les incitant à saisir des informations personnelles ou bancaires sur des sites frauduleux. L'ampleur du réseau, avec un million d'URLs recensées, témoigne d'une capacité d'exécution inédite rendue possible par l'IA. Google indique travailler en coordination avec les forces de l'ordre et les opérateurs mobiles pour contenir la menace. Cette plainte s'inscrit dans une tendance plus large où les grandes plateformes technologiques recourent aux tribunaux pour lutter contre les abus de leurs propres outils. OpenAI et Microsoft ont adopté des stratégies similaires ces derniers mois. Pour Google, l'enjeu est double : protéger ses utilisateurs tout en défendant la réputation de Gemini, dont le nom est directement associé aux arnaques documentées. L'issue judiciaire reste incertaine, notamment en raison des obstacles liés à la juridiction internationale face à des acteurs opérant depuis la Chine, mais l'action vise aussi à créer un précédent dissuasif pour de futurs abus.

💬 9 000 faux sites, un million d'URLs, 2,5 millions de SMS, tout ça sans compétences techniques grâce à Gemini, c'est le cauchemar qui était prévisible depuis le lancement des modèles grand public. Ce qui me frappe, c'est moins l'arnaque en elle-même que l'industrialisation : avant il fallait des équipes, là c'est du copier-coller sur Telegram. La plainte est bien, mais coincer des acteurs basés en Chine via un tribunal américain, on sait tous comment ça finit.

Perplexity intègre Deep Research dans son agent informatique, en distribuant les sous-tâches sur plus de 20 modèles de pointe
1163MarkTechPost 

Perplexity intègre Deep Research dans son agent informatique, en distribuant les sous-tâches sur plus de 20 modèles de pointe

Perplexity a intégré sa fonctionnalité Deep Research à son système d'orchestration multi-modèles baptisé Computer, une évolution majeure annoncée en juin 2026. Là où l'ancienne version exécutait une séquence fixe de recherches, la nouvelle décompose automatiquement chaque question complexe en sous-tâches, qu'elle distribue ensuite à plus de 20 modèles d'IA en parallèle. Le moteur de raisonnement central est Claude Opus 4.6, tandis que des sous-agents spécialisés, dont Gemini, prennent en charge des pans spécifiques de l'analyse. Le résultat n'est plus un simple résumé : Deep Research dans Computer produit des rapports complets avec citations vérifiées, des présentations et des tableurs interactifs, entièrement générés et modifiables au sein de l'environnement Computer. Une capacité distinctive, baptisée Search as Code, permet au modèle d'écrire lui-même le code qui pilote la recherche, exécutant des milliers d'appels de récupération en parallèle dans un environnement sandbox, avec filtrage, déduplication et reclassement des sources à la volée. Les gains de performance publiés par Perplexity illustrent l'ampleur du bond. Sur le benchmark BrowseComp d'OpenAI, qui teste la capacité à retrouver des informations difficiles à localiser par navigation web, le score passe de 40,7 % à 83,8 %, soit plus du doublement. Sur Humanity's Last Exam, un test d'expertise académique pluridisciplinaire conçu par le Center for AI Safety et Scale AI, le taux grimpe de 36,4 % à 50,5 %. Ces chiffres positionnent la nouvelle version comme l'une des solutions de recherche agentique les plus performantes du marché. Concrètement, un professionnel peut demander une comparaison des marges bénéficiaires des grands fabricants de puces IA sur cinq ans, une cartographie des différences entre le RGPD européen et les lois américaines sur la vie privée, ou une synthèse des essais cliniques sur l'impact cardiovasculaire des médicaments amaigrissants, et recevoir en retour un livrable structuré, prêt à l'emploi. Computer avait été lancé fin février 2026 comme plateforme cloud de coordination d'agents IA. L'intégration de Deep Research s'inscrit dans une course effrénée entre les acteurs de la recherche augmentée par l'IA, où Perplexity affronte directement Google, OpenAI et Anthropic sur le terrain de la recherche agentique complexe. La fonctionnalité est disponible pour les abonnés Perplexity Max, mais les développeurs peuvent y accéder de façon programmatique via l'Agent API en mode pay-as-you-go, avec un preset deep-research intégré au SDK officiel et une compatibilité avec le SDK OpenAI via l'endpoint POST /v1/responses. L'ouverture aux développeurs signal que Perplexity positionne cette infrastructure non comme un produit grand public isolé, mais comme une couche de recherche que d'autres applications pourront exploiter directement, ce qui pourrait redéfinir la manière dont les outils professionnels intègrent l'accès à l'information.

UELes professionnels et développeurs européens disposent d'un accès API à une couche de recherche agentique capable de traiter des sujets réglementaires comme le RGPD, sans impact institutionnel ou réglementaire direct sur la France ou l'UE.

OutilsOutil
1 source
Anthropic prend ses partenaires commerciaux de court
1164The Information AI 

Anthropic prend ses partenaires commerciaux de court

Quelques semaines avant le lancement de Claude Design en avril 2026, Anthropic a approché Figma et Canva pour qu'elles participent en tant que "partenaires" à l'annonce de son nouvel outil d'IA, conçu pour créer des maquettes graphiques et des prototypes d'applications logicielles. Ces deux entreprises, clientes historiques d'Anthropic, y voyaient une occasion de mettre en valeur la complémentarité de leurs produits. Mais quelques jours avant le lancement, Figma s'est retirée des négociations, et Mike Krieger, directeur produit d'Anthropic, a simultanément quitté le conseil d'administration de Figma, signalant une rupture franche entre deux acteurs jusqu'alors alignés. La raison de cette fracture tient aux changements de dernière minute apportés par Anthropic à sa feuille de route : la version finale de Claude Design s'est révélée bien plus concurrentielle avec les offres phares de Figma et de Canva qu'elle ne l'était initialement. Pour ces plateformes, l'enjeu est direct : Anthropic ne se contente plus de fournir une infrastructure d'IA, elle entre sur leur terrain commercial, celui de la création graphique et du prototypage rapide, segments où Figma domine avec des dizaines de millions d'utilisateurs professionnels. Cette situation illustre une tension croissante dans l'écosystème de l'IA générative, où les fournisseurs de modèles de base cherchent à capturer de la valeur au niveau applicatif, empiétant sur leurs propres partenaires. Le départ de Krieger du board de Figma marque symboliquement la fin d'une relation symbiotique et soulève des questions sur la gouvernance de ces alliances stratégiques. Pour Anthropic, qui cherche à diversifier ses revenus face à la concurrence d'OpenAI et Google, l'expansion vers les outils créatifs représente un pari risqué mais cohérent avec sa trajectoire de croissance.

UELa stratégie d'intégration verticale d'Anthropic vers les outils de création menace les acteurs européens du design numérique et crée une incertitude pour les professionnels du secteur qui ont construit leurs workflows sur ces plateformes, sans alternative européenne de référence.

BusinessOpinion
1 source
Anthropic supplie Donald Trump de réguler l’IA (la raison va vous terrifier)
1165Le Big Data 

Anthropic supplie Donald Trump de réguler l’IA (la raison va vous terrifier)

Le 10 juin 2026, Dario Amodei, PDG d'Anthropic, a publié un essai intitulé "Politique face à l'essor exponentiel de l'IA" dans lequel il appelle les gouvernements à se doter du pouvoir de bloquer ou de freiner les systèmes d'IA les plus dangereux. L'entreprise américaine, cofondatrice du modèle Claude, propose deux cadres réglementaires distincts : le premier porte sur la sécurité des systèmes d'IA avancés, avec des sanctions pour les entreprises non-conformes ; le second traite des conséquences économiques de l'automatisation, en préconisant une assurance-salaire et des programmes d'aide sociale financés par les revenus générés par l'IA. Anthropic identifie quatre catégories de risques majeurs : la conception d'agents pathogènes assistée par IA, l'exploitation de vulnérabilités cybersécuritaires contre des infrastructures critiques comme les hôpitaux ou les réseaux énergétiques, la perte de contrôle sur des systèmes autonomes difficiles à superviser une fois déployés, et la recherche automatisée en IA, c'est-à-dire des systèmes capables de contribuer eux-mêmes au développement de nouvelles IA. Pour Amodei, la réglementation actuelle n'est tout simplement plus en mesure de suivre le rythme des avancées technologiques. La proposition concrète d'Anthropic est d'imposer des évaluations approfondies avant toute mise sur le marché des modèles les plus performants, accompagnées de documents détaillant les capacités du système, les mesures de sécurité et les risques identifiés en phase de test. Ces évaluations devraient ensuite être examinées par des experts indépendants chargés de vérifier la qualité des tests et d'évaluer objectivement les dangers. L'entreprise juge que la transparence seule ne suffit plus : il faut des garde-fous institutionnels contraignants. Ce cadre concerne en priorité les labs développant les modèles frontier, ceux dont les capacités progressent le plus rapidement et dont l'impact potentiel sur la sécurité nationale ou la santé publique est le plus élevé. La démarche d'Anthropic s'inscrit dans un contexte de course mondiale à l'IA où les géants technologiques américains, OpenAI, Google DeepMind, Meta et Anthropic en tête, investissent des centaines de milliards de dollars pour dominer le secteur. Paradoxalement, ce sont souvent ces mêmes entreprises qui poussent le plus fort à la fois l'accélération technologique et la régulation, conscientes que seule une gouvernance publique solide peut légitimer leur déploiement à grande échelle et leur éviter une réputation de secteur incontrôlable. L'appel d'Amodei à l'administration Trump, peu réputée pour son enthousiasme réglementaire, est donc politiquement risqué mais stratégiquement calculé : sans cadre clair, c'est tout le secteur qui reste exposé à des accidents potentiellement catastrophiques et à une réaction législative brutale post-incident.

UELes propositions américaines d'évaluation obligatoire des modèles frontier pourraient créer un précédent influençant les standards d'audit préalable exigés par l'AI Act européen, déjà en cours d'application.

RégulationReglementation
1 source
Apple Intelligence : comment Siri AI voit vraiment votre écran iPhone ?
1166Le Big Data 

Apple Intelligence : comment Siri AI voit vraiment votre écran iPhone ?

Le 8 juin 2026, Tim Cook a officialisé la prochaine génération d'Apple Intelligence, qui dote Siri d'une capacité inédite : lire et comprendre en temps réel ce qui s'affiche à l'écran de l'iPhone, de l'iPad, du Mac et de l'Apple Vision Pro. Concrètement, l'assistant peut désormais détecter une adresse dans un message et l'ajouter automatiquement à un contact, identifier une invitation et proposer d'organiser la suite, ou encore interagir avec des éléments visuels affichés dans n'importe quelle application. Sur Vision Pro, Siri peut même répondre en fonction de l'environnement physique regardé par l'utilisateur. Apple parle de "conscience de l'écran" pour qualifier cette capacité : l'assistant ne se contente plus d'écouter des commandes vocales, il interprète le contexte visuel de l'appareil. Ce basculement représente une rupture nette avec le Siri passif lancé en 2011. L'assistant devient un agent contextuel capable d'agir dans les applications, pas seulement de répondre à côté. Pour les utilisateurs professionnels, cela signifie concrètement moins de copier-coller entre apps, moins de recherches manuelles dans les mails ou les messages, et un assistant qui anticipe les actions probables plutôt que d'attendre une instruction explicite. Pour Apple, c'est aussi un enjeu stratégique majeur face à OpenAI, Google et Microsoft, qui ont tous intégré des assistants à forte conscience contextuelle dans leurs écosystèmes. Le retard de Siri sur ces concurrents est documenté depuis des années ; Apple Intelligence est censé combler cet écart en s'appuyant sur l'intégration matériel-logiciel propre à Apple. La question centrale reste celle de la vie privée. Un assistant qui lit les écrans, les messages, les photos et les mails concentre un volume considérable d'informations personnelles. Apple défend un modèle de traitement en local prioritaire, complété par son Private Cloud Compute pour les requêtes plus lourdes, avec la promesse que les données ne sont ni stockées ni accessibles à Apple. Ce cadre technique s'inscrit dans une stratégie de différenciation vis-à-vis de Google et Microsoft, perçus comme plus collecteurs de données. Mais la crédibilité de ces garanties sera testée à l'usage, notamment par les régulateurs européens qui scrutent déjà les pratiques des géants tech en matière d'IA embarquée. Si Apple réussit à convaincre que Siri peut être à la fois utile et discret, elle dispose d'un avantage concurrentiel durable. Dans le cas contraire, chaque mise à jour risque de raviver un débat que la marque préférerait clore une bonne fois pour toutes.

UELes régulateurs européens, qui scrutent déjà les pratiques des géants tech en matière d'IA embarquée, devront évaluer si le traitement des données par Apple Intelligence respecte le RGPD et l'AI Act.

OutilsOutil
1 source
Apple annonce un assistant vocal plus conversationnel, surnommé « Siri AI »
1167Ars Technica AI 

Apple annonce un assistant vocal plus conversationnel, surnommé « Siri AI »

Apple a officiellement présenté la refonte majeure de son assistant vocal Siri lors de sa conférence annuelle WWDC, filmée en avance comme à son habitude. Baptisée "Siri AI", cette nouvelle version s'inscrit dans le cadre plus large du programme "Apple Intelligence" dont le lancement avait été plusieurs fois repoussé. La mise à jour sera déployée cet automne via les mises à jour des systèmes d'exploitation Apple. Elle s'accompagne d'une intégration plus poussée des modèles d'IA embarqués, désormais alimentés en partie par Google, ainsi qu'une cohérence renforcée entre iOS, macOS et les autres plateformes de la marque. Le changement central porte sur la nature même de l'interaction : Siri ne se limite plus à des requêtes ponctuelles isolées, mais devient capable de mener des conversations continues, en jonglant entre différentes applications et contextes au fil d'un même échange. Lors des démonstrations, les cadres d'Apple ont montré l'assistant passer d'une tâche à une autre sans rupture, illustrant ce que la firme appelle une "expérience conversationnelle entièrement nouvelle". Pour les utilisateurs, cela représente un changement de paradigme : l'assistant devient un interlocuteur persistant plutôt qu'un outil de commande vocale. Apple tente ainsi de rattraper son retard face à des concurrents comme Google, OpenAI ou Microsoft, qui ont multiplié les annonces d'IA générative depuis 2023. Le vice-président senior Craig Federighi a d'ailleurs choisi de se démarquer explicitement, en critiquant implicitement cette course effrénée et en positionnant Apple comme un acteur centré sur l'utilisateur plutôt que sur la technologie pour elle-même. Ce discours, combiné au partenariat avec Google pour les modèles de fondation, soulève des questions sur la dépendance d'Apple à des tiers pour ses ambitions en IA, et sur la capacité de la marque à tenir ses promesses lors du déploiement effectif cet automne.

UELe déploiement de Siri AI sur les millions d'appareils Apple utilisés en France et en Europe soulève des questions de dépendance aux modèles Google, un axe susceptible d'intéresser les régulateurs européens au titre du DMA.

💬 Apple prend enfin le virage conversationnel, et c'est plus crédible que leurs annonces des deux dernières années. Bon, sur le papier, le coup du "pas de hype, on pense à l'utilisateur" sonne creux quand tu as signé un deal avec Google pour les modèles de fond. Reste à voir si ça tient à l'automne, ou si on se retrouve encore avec une démo parfaite et un rollout en demi-teinte.

NVIDIA Nemotron 3 Ultra est désormais disponible sur Amazon SageMaker JumpStart
1168AWS ML Blog 

NVIDIA Nemotron 3 Ultra est désormais disponible sur Amazon SageMaker JumpStart

NVIDIA a annoncé la disponibilité immédiate de son modèle Nemotron 3 Ultra sur Amazon SageMaker JumpStart, permettant un déploiement en un clic sans gestion d'infrastructure. Le modèle repose sur une architecture hybride Transformer-Mamba de type Mixture-of-Experts (MoE), avec 550 milliards de paramètres au total dont seulement 55 milliards actifs par passe de calcul. Optimisé pour le format de précision NVFP4, il affiche une vitesse d'inférence cinq fois supérieure aux modèles équivalents et réduit les coûts jusqu'à 30 % pour les charges de travail agentiques. Il supporte des contextes allant jusqu'à un million de tokens, ce qui en fait l'un des modèles open source les plus ambitieux disponibles à ce jour sur une plateforme cloud grand public. Ce lancement cible directement les systèmes d'IA agentiques, une catégorie en pleine expansion où un modèle ne répond pas à une simple question mais planifie, appelle des outils, délègue des tâches à des sous-agents et itère sur des centaines de tours de dialogue. C'est précisément là que les modèles classiques montrent leurs limites : chaque étape supplémentaire alourdit le coût en tokens et en calcul. L'architecture MoE de Nemotron 3 Ultra contourne ce problème en n'activant qu'une fraction des paramètres à chaque passage, maintenant un débit élevé même sur des contextes très longs. Pour les entreprises qui automatisent des workflows complexes, orchestration d'agents, génération et débogage de code sur de vastes dépôts, recherche documentaire approfondie, cela se traduit concrètement par des tâches menées à terme avec une cohérence préservée et une facture cloud maîtrisée. NVIDIA positionne Nemotron 3 Ultra dans une stratégie plus large visant à s'imposer comme fournisseur de référence pour l'IA agentique d'entreprise, un segment où la concurrence s'intensifie entre OpenAI, Anthropic, Google et des acteurs open source comme Meta avec Llama. Le partenariat avec AWS et l'intégration native dans SageMaker JumpStart abaissent significativement la barrière à l'entrée pour les équipes techniques qui souhaitent tester ou déployer le modèle sans configurer de stack d'inférence from scratch. Les instances GPU requises, notamment les ml.p5en.48xlarge, restent coûteuses à l'heure, ce qui signifie que l'usage restera concentré sur des cas professionnels à forte valeur ajoutée. La disponibilité dès le jour zéro sur JumpStart suggère également un accord commercial étroit entre NVIDIA et Amazon, deux acteurs dont l'alliance dans le domaine de l'infrastructure IA se renforce à mesure que la course aux agents autonomes s'accélère.

UELes équipes R&D et développeurs européens accèdent désormais à l'un des plus grands modèles open source du marché via une plateforme cloud grand public, sans configuration d'infrastructure spécifique.

LLMsOpinion
1 source
Microsoft veut rendre les utilisateurs accros à son agent IA Scout
1169Next INpact 

Microsoft veut rendre les utilisateurs accros à son agent IA Scout

Microsoft a présenté Scout lors de sa conférence Build 2026, un agent IA autonome et permanent conçu pour s'intégrer profondément dans l'écosystème Microsoft 365. Contrairement à Copilot, qui répond à des sollicitations ponctuelles, Scout agit de manière proactive : il surveille Teams, Outlook, OneDrive, SharePoint, le calendrier et les e-mails pour anticiper les besoins de l'utilisateur. Concrètement, il peut repérer des réunions importantes, organiser automatiquement des rendez-vous, bloquer des créneaux dans l'agenda pour boucler un projet, préparer des documents avant une réunion ou signaler qu'une décision traîne et risque de faire déraper un planning. Scout possède aussi sa propre identité traçable : toutes ses actions sont journalisées et les opérations critiques nécessitent une validation humaine. Selon des documents internes publiés par 404media, plus de 1 000 employés Microsoft l'utilisent déjà, dont le PDG Satya Nadella. L'agent est pour l'instant en aperçu privé, mais le document interne révèle qu'il s'est imposé comme "l'un des outils internes les plus demandés chez Microsoft, sans annonce officielle, sans marketing". Cette approche représente un changement de paradigme dans l'usage professionnel de l'IA. Là où Copilot restait un assistant réactif, Scout ambitionne de devenir un collaborateur permanent qui apprend les habitudes de travail, identifie les projets prioritaires et anticipe les tâches récurrentes. Pour les entreprises clientes de Microsoft 365, cela signifie un agent qui réduit la charge cognitive des équipes en automatisant la coordination et la gestion du temps, deux des principaux goulots d'étranglement dans les organisations. L'enjeu commercial est considérable : Microsoft a investi des milliards dans ses infrastructures IA et cherche à transformer cet investissement en adoption massive au sein des entreprises. Ce qui rend le lancement de Scout particulièrement significatif, c'est la technologie qui le propulse : OpenClaw, une bibliothèque open source devenue une référence dans le monde des agents autonomes capables de manipuler des applications, des fichiers et des services en continu. Ironie du calendrier, Microsoft avertissait encore en février 2026 des risques de sécurité liés à OpenClaw, jugeant la technologie trop risquée pour les environnements d'entreprise en raison de ses privilèges étendus. L'éditeur a depuis changé de position et s'engage désormais à contribuer directement au projet, affirmant qu'il va "ajouter la sécurité, la gouvernance et l'intégration Microsoft 365" à la base existante. Ce revirement contraste avec l'approche de Meta, qui développe sa propre alternative propriétaire baptisée Hatch depuis qu'OpenAI a recruté Peter Steinberger, le créateur d'OpenClaw. Microsoft choisit l'intégration là où Meta choisit la bifurcation, un pari qui pourrait s'avérer décisif dans la course aux agents d'entreprise.

UEMicrosoft 365 étant massivement déployé dans les entreprises françaises et européennes, l'arrivée de Scout soulève des questions concrètes pour les DSI sur la gouvernance d'agents IA autonomes ayant accès aux données internes.

💬 En février, Microsoft nous expliquait qu'OpenClaw était trop dangereux pour les environnements d'entreprise. Quatre mois après, c'est la même techno qui fait tourner Scout en prod chez Satya Nadella, sans annonce officielle, juste des gens qui l'adoptent en interne. Ce revirement, ça en dit plus sur la pression concurrentielle que sur une vraie conviction technique.

OutilsOutil
1 source
Trump veut (enfin) réguler l’IA… mais seulement si les géants de la tech veulent bien
1170Le Big Data 

Trump veut (enfin) réguler l’IA… mais seulement si les géants de la tech veulent bien

Donald Trump a signé mardi un décret autorisant les entreprises d'intelligence artificielle à partager leurs modèles les plus avancés avec le gouvernement fédéral avant leur lancement public. La mesure phare du texte fixe une fenêtre maximale de 30 jours de partage volontaire avant mise à disposition du public, une version allégée par rapport au projet initial, qui prévoyait entre 14 et 90 jours. Plusieurs agences fédérales devront en parallèle développer un système d'évaluation des capacités cybernétiques avancées de ces modèles. Les entreprises participantes bénéficieront de certaines protections en matière de confidentialité, mais leur participation reste entièrement facultative. Le décret prévoit également un renforcement des défenses fédérales face aux menaces liées à l'IA, notamment pour les infrastructures critiques. Ce texte marque un tournant notable dans la posture de l'administration Trump, jusqu'ici farouchement opposée à toute forme de régulation de l'IA au nom de la compétitivité américaine face à la Chine. Trump avait d'ailleurs repoussé la signature d'une première version du décret, craignant qu'elle ne bride l'innovation nationale. La version adoptée reçoit le soutien d'organisations spécialisées dans la sécurité de l'IA : Brad Carson, président d'Americans for Responsible Innovation, y voit la preuve que la Maison-Blanche prend désormais ces risques au sérieux, tandis que Brendan Steinhauser, dirigeant d'Alliance for Secure AI, appelle le Congrès à transformer ces mesures volontaires en obligations légales, ce que le décret lui-même exclut explicitement. Ce changement de cap s'inscrit dans un contexte de prise de conscience progressive des risques que font peser les modèles de frontier sur la sécurité nationale. Un élément concret a pu peser dans la balance : en avril, Anthropic a déployé de manière limitée son modèle Mythos, qui aurait permis d'identifier des milliers de vulnérabilités critiques dans les principaux systèmes d'exploitation et navigateurs web. Par ailleurs, Google, Microsoft et xAI ont déjà accepté le mois dernier de soumettre leurs modèles à l'examen du Centre pour les normes et l'innovation en IA (CAISI), rattaché au département du Commerce. OpenAI et Anthropic avaient pris un engagement similaire dès 2024, sous l'administration Biden. Le vrai test de ce décret sera donc la prochaine saison de lancements majeurs : sans obligation légale, tout repose sur la bonne volonté d'acteurs dont les intérêts commerciaux restent la priorité.

UELe décret américain, entièrement fondé sur le volontariat, contraste avec l'approche contraignante de l'AI Act européen et pourrait peser sur les discussions de convergence réglementaire transatlantique.

RégulationReglementation
1 source
Les agents de recherche IA ont tendance à confirmer leurs connaissances existantes plutôt qu'à explorer le web
1171The Decoder 

Les agents de recherche IA ont tendance à confirmer leurs connaissances existantes plutôt qu'à explorer le web

Les principaux agents de recherche IA, dont GPT-5.4 d'OpenAI et Kimi K2.6 de Moonshot AI, n'effectuent pas autant de recherches web réelles qu'ils le laissent entendre. C'est la conclusion d'une étude menée par des chercheurs de l'Institut de technologie de Harbin, qui ont développé un nouveau benchmark temporel appelé LiveBrowseComp. Ce test se distingue des évaluations classiques en ne posant des questions que sur des événements survenus au cours des 90 derniers jours, soit une fenêtre temporelle postérieure aux données d'entraînement des modèles. Les résultats sont révélateurs : dès que les modèles ne peuvent plus s'appuyer sur leur mémoire d'entraînement, leurs performances s'effondrent et les classements habituels sont bouleversés. Cela signifie que ces agents, présentés comme de puissants outils de recherche en ligne, se contentent en réalité d'utiliser le web pour confirmer ce qu'ils savent déjà, plutôt que de véritablement explorer et synthétiser des informations récentes. Pour les entreprises et professionnels qui s'y fient pour une veille ou une analyse d'actualité, c'est une limitation critique. Ce constat intervient alors que les éditeurs d'IA rivalisent pour positionner leurs modèles comme des assistants de recherche autonomes capables de naviguer sur internet. Les benchmarks traditionnels, construits sur des données historiques, masquaient cette faiblesse structurelle. LiveBrowseComp introduit une contrainte temporelle qui force une évaluation plus honnête des capacités réelles de navigation web. L'enjeu est de taille : si les classements sont rebattus sur cette base, la confiance accordée aux agents IA pour des tâches de recherche actuelle devra être sérieusement réévaluée.

UELes entreprises et professionnels européens qui s'appuient sur ces agents pour de la veille ou de l'analyse d'actualité doivent réévaluer leur fiabilité pour tout contenu postérieur aux données d'entraînement.

💬 C'est prouvé maintenant : ces agents ne cherchent pas vraiment, ils confirment ce qu'ils savent. Le benchmark de Harbin est malin, poser uniquement des questions sur les 90 derniers jours c'est une façon élégante de court-circuiter la mémoire d'entraînement, et du coup les classements habituels volent en éclats. Si tu t'appuies là-dessus pour une vraie veille, je te laisse tirer les conclusions.

RecherchePaper
1 source
Rendre les chatbots IA plus utiles nuit à leur capacité à simuler le comportement humain, selon une étude à grande échelle
1172The Decoder 

Rendre les chatbots IA plus utiles nuit à leur capacité à simuler le comportement humain, selon une étude à grande échelle

Une étude de grande envergure portant sur 208 000 participants et 26 millions de réponses révèle un paradoxe fondamental dans le développement des assistants conversationnels : l'entraînement qui rend les modèles de langage utiles et agréables à utiliser dégrade simultanément leur capacité à reproduire fidèlement les comportements humains. Plus un modèle est optimisé pour être serviable, poli et aligné sur les attentes des utilisateurs, moins il parvient à simuler la diversité réelle des réponses humaines. L'effet s'aggrave à chaque nouvelle génération de modèles. Ce résultat a des conséquences directes pour les chercheurs en sciences sociales, économistes et psychologues qui utilisent de plus en plus les LLM comme substituts aux sondages humains classiques, jugés coûteux et lents. Si ces modèles ne peuvent pas reproduire de manière fiable les comportements individuels, leur valeur comme outils de simulation sociale est sérieusement remise en question. La technique populaire consistant à fournir aux modèles des profils démographiques détaillés, souvent appelée "persona prompting", n'apporte pratiquement aucun gain de précision au niveau individuel. Ce constat s'inscrit dans un débat plus large sur la nature de l'alignement des LLM : en optimisant pour la satisfaction de l'utilisateur via le renforcement humain (RLHF), les entreprises comme OpenAI, Anthropic ou Google créent des modèles qui s'homogénéisent vers un comportement "acceptable" au détriment de la variabilité humaine. Les chercheurs appellent à distinguer clairement les cas d'usage où l'alignement est souhaitable de ceux où la fidélité comportementale est requise.

UELes chercheurs européens en sciences sociales, économie et psychologie doivent revoir leur méthodologie : les LLM alignés ne peuvent pas remplacer fiablement des participants humains dans les études comportementales à l'échelle individuelle.

💬 Résultat presque évident une fois qu'on le lit, sauf que personne ne l'avait mesuré à cette échelle : plus tu rends un LLM utile et poli, moins il ressemble à un humain réel. 208 000 participants, 26 millions de réponses, c'est difficile à contester. Les chercheurs en sciences sociales qui remplaçaient leurs sondages par des LLM vont devoir revoir leurs copies, et pas qu'un peu.

RecherchePaper
1 source
Une entreprise aurait dépensé 500 millions de dollars en Claude en un mois, faute de limites d'utilisation
1173The Decoder 

Une entreprise aurait dépensé 500 millions de dollars en Claude en un mois, faute de limites d'utilisation

Une entreprise dont l'identité n'a pas été divulguée aurait dépensé 500 millions de dollars en licences Claude en l'espace d'un seul mois, selon des informations rapportées par The Decoder. La cause serait aussi simple que coûteuse : aucun plafond d'utilisation n'avait été configuré. Le déploiement de l'IA d'Anthropic s'est ainsi propagé sans contrôle au sein de l'organisation, accumulant des appels au modèle à un rythme que personne n'avait anticipé ni encadré. Ce cas illustre une réalité que les directions informatiques commencent à découvrir à leurs dépens : l'adoption rapide de l'IA générative, sans gouvernance technique, peut transformer une promesse de productivité en gouffre financier. Sans expertise en sélection de modèles, en ingénierie du contexte ou en optimisation des requêtes, chaque usage superflu s'additionne silencieusement. Les coûts d'inférence, souvent perçus comme marginaux à l'échelle individuelle, deviennent massifs à l'échelle d'une grande organisation sans garde-fous. L'incident s'inscrit dans une période où les entreprises signent des contrats pluriannuels avec Anthropic, OpenAI ou Google pour intégrer leurs modèles en profondeur dans leurs flux de travail. Anthropic, valorisée à plus de 60 milliards de dollars, compte parmi ses clients des géants de la tech et de la finance qui déploient Claude à grande échelle. Cette anecdote, quelle que soit son exactitude, pointe vers un enjeu structurel : la maîtrise des coûts liés à l'IA est désormais une compétence critique, au même titre que la cybersécurité ou la gestion de l'infrastructure cloud.

UELes entreprises françaises et européennes déployant des LLMs à grande échelle s'exposent au même risque de dérive budgétaire en l'absence de gouvernance technique et de plafonds d'utilisation.

💬 500 millions en un mois parce que personne n'a pensé à mettre un plafond, c'est presque admirable comme négligence. Ce qui me frappe, c'est que ça va arriver à beaucoup d'autres, et pas seulement aux géants : dès qu'on déploie un modèle en interne sans rate limiting ni monitoring des coûts, la facture monte en silence. La gouvernance des APIs LLM, c'est devenu aussi critique que la gestion des droits IAM, et la plupart des équipes ne l'ont pas encore intégré.

Pourquoi Claude Opus 4.8 change vraiment la donne (tests et benchmarks) ?
1174Le Big Data 

Pourquoi Claude Opus 4.8 change vraiment la donne (tests et benchmarks) ?

Anthropic a lancé Claude Opus 4.8 le 28 mai 2026, seulement 41 jours après la version 4.7, un rythme inhabituel dans un secteur où les nouvelles versions majeures nécessitent généralement plusieurs mois. Disponible au même prix que son prédécesseur, ce modèle affiche des progrès mesurables sur plusieurs benchmarks clés : 84 % sur Online-Mind2Web, qui évalue les interactions autonomes avec des interfaces numériques, et des gains notables sur Terminal-Bench 2.1, dédié à la programmation en ligne de commande. Plus frappant encore, les évaluations internes d'Anthropic indiquent que le modèle est environ quatre fois moins susceptible de laisser passer des erreurs dans son propre code qu'Opus 4.7. Sur le plan fonctionnel, les utilisateurs de Claude AI ont désormais accès à cinq niveaux de raisonnement ajustables, tandis que Claude Code intègre les Dynamic Workflows, permettant de planifier des tâches complexes en mobilisant plusieurs sous-agents en parallèle sur de larges bases de code. Ce qui distingue Opus 4.8 ne réside pas uniquement dans les scores, mais dans un changement de philosophie profond : le modèle a été conçu pour mieux reconnaître ses propres limites et signaler ses incertitudes plutôt que de produire des réponses erronées avec assurance. Dans un contexte professionnel où une IA trop confiante peut induire en erreur des équipes entières, cette prudence constitue une valeur ajoutée concrète. Pour les développeurs qui utilisent Claude Code dans des pipelines agentiques, la réduction des erreurs non détectées et la capacité à orchestrer des sous-agents en parallèle ouvrent des cas d'usage jusqu'ici trop risqués pour être déployés en production. Le gain d'efficacité est également tangible : le modèle atteint des résultats équivalents en moins d'étapes intermédiaires, ce qui réduit les coûts d'inférence sur les longues tâches. Cette version s'inscrit dans une période de concurrence intense entre Anthropic, OpenAI et Google, où chaque éditeur cherche à dominer le segment des agents autonomes. La version 4.7 avait suscité des critiques sur ses comportements imprévisibles et sa tendance à l'excès de confiance, des défauts qui nuisaient à l'adoption en entreprise. En répondant directement à ces reproches en moins de six semaines, Anthropic signale qu'il est capable d'itérer aussi vite que ses rivaux sans sacrifier la fiabilité. La question qui demeure ouverte est celle de la durabilité de ce rythme : à 41 jours par version, l'entreprise devra démontrer que la qualité peut tenir la cadence.

UELes équipes de développement européennes utilisant Claude Code dans des pipelines agentiques bénéficient des améliorations de fiabilité et de la réduction des coûts d'inférence, sans impact réglementaire ou institutionnel spécifique à la France ou l'UE.

💬 41 jours entre deux versions majeures, c'est du jamais vu chez Anthropic. Ce qui compte vraiment là-dedans, c'est pas les scores (on peut faire dire ce qu'on veut aux benchmarks), c'est que le modèle est maintenant conçu pour signaler ses incertitudes plutôt que d'affirmer des erreurs avec aplomb, et en pipeline agentique, c'est la différence entre un outil qu'on ose déployer en prod et un truc qu'on surveille en permanence. Reste à voir si ce rythme tient dans 3 mois.

LLMsOpinion
1 source
L’IA crée son propre Shadow IT : les entreprises perdent déjà la trace de leurs agents
1175FrenchWeb 

L’IA crée son propre Shadow IT : les entreprises perdent déjà la trace de leurs agents

Un phénomène bien connu refait surface sous une forme nouvelle dans les entreprises : après avoir lutté pendant vingt ans contre le Shadow IT classique, les directions informatiques font face à une variante propulsée par l'intelligence artificielle. Des équipes métier déploient désormais des agents IA, des assistants automatisés et des flux de traitement autonomes sans passer par les circuits de validation informatique habituels. La facilité d'accès aux outils IA grand public, souvent accessibles via un simple abonnement ou une API, accélère cette dispersion incontrôlée. Le risque est considérable. Contrairement à une application SaaS classique, un agent IA peut accéder à des données sensibles, exécuter des tâches en autonomie, interagir avec des systèmes tiers et produire des résultats à grande échelle, le tout hors de tout audit interne. Les entreprises ne savent plus combien d'agents tournent en leur nom, quelles données ils traitent, ni qui en est réellement responsable. Cela expose les organisations à des violations réglementaires, notamment sous le RGPD ou l'AI Act européen, et à des risques de sécurité difficiles à quantifier. Ce phénomène s'inscrit dans une dynamique plus large : la démocratisation rapide des outils IA, portée par OpenAI, Google, Microsoft et des dizaines de startups, a rendu l'expérimentation accessible à n'importe quel salarié. Les DSI, déjà débordés par la transformation numérique, peinent à établir des cadres de gouvernance adaptés à cette nouvelle réalité. Les prochains mois devraient voir émerger des solutions de découverte et d'inventaire d'agents IA, un marché naissant que plusieurs éditeurs de cybersécurité commencent déjà à adresser.

UELes entreprises françaises et européennes sont directement exposées aux risques de non-conformité au RGPD et à l'AI Act en raison de déploiements d'agents IA internes non contrôlés et non audités.

💬 Le Shadow IT, on pensait l'avoir à peu près domestiqué. Mais n'importe quel chef de projet peut maintenant poser un agent en prod avec une carte bleue et un compte OpenAI, sans que la DSI ne le voie passer. La différence avec l'ancienne version, c'est que cet agent agit en autonomie, touche des données sensibles, et sous l'AI Act, si ça déraille, c'est ton entreprise qui morfle, pas l'employé qui a cliqué sur "déployer".

SécuritéOpinion
1 source
Microsoft lancera un nouveau modèle de code la semaine prochaine
1176The Information AI 

Microsoft lancera un nouveau modèle de code la semaine prochaine

Microsoft s'apprête à dévoiler une gamme de nouveaux modèles d'intelligence artificielle développés en interne lors de sa conférence annuelle Build, prévue la semaine prochaine à San Francisco. Parmi les annonces attendues figure un modèle spécialisé dans la génération de code, conçu pour renforcer GitHub Copilot, l'assistant de programmation appartenant à Microsoft. L'entreprise prévoit également de présenter plusieurs modèles déclinés en différentes tailles, chacun optimisé pour des tâches spécifiques : transcription audio, raisonnement, synthèse vocale et traitement d'images. Cette famille de modèles s'inscrit dans la continuité des premiers modèles maison que Microsoft avait présentés en avant-première plus tôt cette année. L'enjeu est considérable pour GitHub Copilot, qui avait pourtant pris une longueur d'avance significative sur le marché des assistants de codage alimentés par l'IA. Cet avantage s'est progressivement érodé face à la montée en puissance de concurrents comme Cursor et Claude Code d'Anthropic, qui ont su séduire une large communauté de développeurs. Microsoft cherche donc à reconquérir ce terrain perdu en proposant des modèles plus performants et mieux adaptés aux besoins concrets des programmeurs. La capacité à regagner la confiance de cette communauté représente un test majeur pour la crédibilité de la stratégie IA de la firme de Redmond. Cette initiative s'inscrit dans un contexte de compétition intense entre les grands acteurs de la technologie pour s'imposer auprès des développeurs, qui constituent un segment stratégique dans l'adoption des outils d'IA. Microsoft, qui a investi massivement dans OpenAI, cherche en parallèle à développer ses propres capacités pour réduire sa dépendance à des partenaires externes. La conférence Build est traditionnellement le moment choisi par l'entreprise pour annoncer ses ambitions en matière de plateforme et d'outillage. La montée en puissance des cas d'usage liés à la voix et à la transcription, de plus en plus plébiscités par les développeurs, explique par ailleurs pourquoi Microsoft intègre ces capacités dès le lancement de cette nouvelle famille de modèles.

UELes développeurs européens et français utilisant GitHub Copilot pourraient bénéficier de modèles maison Microsoft plus performants, dans un marché des assistants de codage de plus en plus concurrentiel face à Cursor et autres outils.

💬 Copilot s'est fait dépasser par Cursor et Claude Code, et Microsoft le sait très bien. Ce qui m'intéresse là-dedans, c'est moins le modèle code en lui-même que la volonté de réduire la dépendance à OpenAI, parce qu'investir des milliards dans un partenaire et lui laisser le cerveau de ton produit phare, c'est un pari bizarre. Regagner la confiance des devs, ça ne se décrète pas avec une annonce à Build.

LLMsActu
1 source
Cognition lève 1 milliard de dollars lors d'une série D valorisée à 26 milliards
1177Latent Space 

Cognition lève 1 milliard de dollars lors d'une série D valorisée à 26 milliards

Cognition, le laboratoire spécialisé dans les agents IA, vient de lever 1 milliard de dollars lors d'un tour de table en Série D qui valorise la société à 26 milliards de dollars. Ce financement, annoncé fin mai 2026, représente une valorisation 2,5 fois supérieure à celle obtenue lors de sa Série C en septembre 2025, qui s'élevait à 10 milliards de dollars. Cognition devient ainsi officiellement le plus grand laboratoire d'agents IA indépendant encore en activité. La société projette un chiffre d'affaires annuel récurrent dépassant 1 milliard de dollars d'ici la fin de l'année 2026, une trajectoire alimentée par une clientèle déjà constituée d'acteurs exigeants de l'écosystème startup et entreprise, parmi lesquels Exa et Modal. Cette levée illustre l'appétit persistant des investisseurs pour les agents IA autonomes, segment en train de redéfinir le marché des logiciels d'entreprise. Dans le SaaS, l'ARR est un indicateur retardé de l'utilisation réelle : si Cognition projette ce seuil du milliard, c'est que des déploiements significatifs sont déjà actifs chez ses clients. La dynamique s'inscrit dans une logique de concentration du financement autour de quelques laboratoires indépendants capables de tenir tête aux grandes plateformes que sont OpenAI, Anthropic ou Google DeepMind. Cognition, positionné sur les agents codeurs autonomes, s'impose comme un acteur de référence dans une catégorie dont la valeur potentielle continue d'attirer des capitaux massifs. Cette annonce intervient dans un contexte d'effervescence technique autour de l'inférence et de l'architecture des agents. Sur le front de l'efficacité, plusieurs avancées ont marqué la semaine : EAGLE 3.1 améliore le décodage spéculatif pour les longues séquences, Perplexity a publié en open source un tokeniseur réduisant de 5 à 6 fois la charge CPU, et Qwen3.5 atteindrait 580 tokens par seconde pour des charges de travail agentiques grâce à une collaboration entre Alibaba, NVIDIA et les contributeurs de FlashAttention-4. Parallèlement, LangChain a livré Deep Agents v0.6 avec les Delta Channels, réduisant le stockage des points de contrôle pour une session de codage de 200 tours de 5,3 Go à seulement 129 Mo. La plateforme Trajectory a également été lancée pour permettre aux équipes d'utiliser les traces d'agents et les signaux d'usage produit dans une logique d'apprentissage continu. Ces évolutions techniques signalent un glissement de paradigme : ce n'est plus seulement la qualité du modèle qui fait la différence, mais l'adéquation entre le modèle, son environnement d'exécution et sa mémoire.

💬 26 milliards pour Cognition, ça fait un choc. Mais le chiffre qui compte c'est le milliard d'ARR projeté d'ici décembre : des déploiements déjà actifs chez des clients exigeants, et une valorisation multipliée par 2,5 en six mois pour un labo qui n'existait quasiment pas il y a trois ans. Et l'Europe dans tout ça, elle regarde.

BusinessOpinion
1 source
OpenRouter franchit 1,3 milliard de dollars de valorisation un an après son lancement
1178Le Big Data 

OpenRouter franchit 1,3 milliard de dollars de valorisation un an après son lancement

OpenRouter, une startup américaine spécialisée dans les passerelles d'accès aux modèles d'intelligence artificielle, vient de boucler un tour de table de série B de 113 millions de dollars mené par CapitalG, le fonds de capital-risque d'Alphabet. Cette levée propulse sa valorisation à 1,3 milliard de dollars, soit plus du double des 547 millions estimés lors de son tour de série A de juin 2025, où Andreessen Horowitz, Menlo Ventures et Sequoia avaient déjà investi 40 millions de dollars. En douze mois d'existence, la société affiche désormais 8 millions d'utilisateurs dans le monde et traite environ 100 000 milliards de tokens par mois. Sur les six derniers mois, son volume hebdomadaire est passé de 5 000 milliards à 25 000 milliards de tokens, soit une multiplication par cinq. La plateforme donne accès à plus de 400 modèles d'IA, parmi lesquels ceux d'Anthropic, OpenAI, Google, xAI et DeepSeek. Cette progression illustre un basculement structurel du marché de l'IA générative : après des années centrées sur l'entraînement des modèles, l'industrie se concentre désormais sur l'inférence, c'est-à-dire l'exécution concrète des modèles dans des applications réelles. Les entreprises cherchent à optimiser leurs coûts et leur flexibilité opérationnelle, en pouvant sélectionner dynamiquement le modèle le mieux adapté à chaque tâche, qu'il s'agisse d'un traitement simple ou d'un raisonnement complexe. La montée en puissance des agents IA, ces systèmes autonomes qui enchaînent plusieurs actions et requêtes, renforce encore ce besoin : orchestrer plusieurs modèles spécialisés depuis une interface unique est devenu une nécessité opérationnelle pour de nombreuses équipes techniques. Pendant plusieurs années, l'industrie semblait s'orienter vers une concentration autour de quelques fournisseurs dominants, avec le risque d'un verrouillage technologique comparable à celui qu'ont connu les entreprises avec certains éditeurs cloud ou logiciels d'entreprise. Le succès d'OpenRouter révèle une réalité plus nuancée : les organisations souhaitent conserver leur pouvoir de négociation, limiter les risques de dépendance et s'adapter rapidement aux évolutions rapides du marché. Dans ce contexte, les intermédiaires capables d'agréger et d'orchestrer plusieurs fournisseurs deviennent des infrastructures stratégiques à part entière. La valorisation d'OpenRouter, atteinte en un an seulement, confirme que l'avenir du déploiement de l'IA en entreprise sera résolument multi-modèles.

UELes équipes techniques européennes peuvent adopter OpenRouter pour orchestrer plusieurs modèles IA sans dépendance à un fournisseur unique, mais l'impact direct sur la France ou l'UE reste limité à cet avantage opérationnel indirect.

💬 1,3 milliard en un an, je m'y attendais pas à cette vitesse. OpenRouter a compris avant tout le monde que la vraie bataille, c'est pas qui entraîne les meilleurs modèles, mais qui te permet de tous les orchestrer sans te faire enfermer chez un seul provider. Reste à voir comment les grands fournisseurs vont réagir quand ils réaliseront que leur API est en train de devenir une commodité.

BusinessOpinion
1 source
Le SaaS est-il mort ?
1179Ben's Bites 

Le SaaS est-il mort ?

La question commence à circuler sérieusement dans les cercles tech : le SaaS est-il en train de mourir ? Dans sa newsletter Ben's Bites, l'investisseur et analyste Dan Shipper défend une thèse nuancée mais inquiétante pour les éditeurs de logiciels traditionnels. Le problème ne vient pas de ce que les entreprises peuvent désormais coder leurs propres outils grâce à l'IA, c'est un argument souvent avancé mais qui reste marginal en pratique. Le vrai problème, selon lui, est structurel : les outils SaaS sont conçus pour une base d'utilisateurs massive, ils grossissent en permanence, accumulent des fonctionnalités, modifient leurs interfaces, et finissent par dépasser les besoins réels de leurs clients. L'utilisateur ne voulait qu'une fraction du produit, et se retrouve prisonnier d'un outil qui a outgrown lui. Cette semaine, plusieurs actualités illustrent concrètement cette bascule : OpenAI a sorti du stade expérimental le mode "Goal" de Codex, qui permet d'exécuter des workflows en plusieurs étapes avec un objectif unique en tête. Le protocole MCP reçoit une mise à jour majeure dont la finalisation est prévue pour le 28 juillet, ajoutant le support natif pour les interfaces applicatives, les tâches longues, et des règles de sécurité renforcées. Perplexity a open-sourcé Bumblebee, un scanner de sécurité pour machines de développeurs qui détecte les packages risqués et les configurations d'agents IA sans exécuter les outils inspectés. Ce mouvement a des conséquences directes pour les entreprises qui achètent des logiciels. Si les outils rigides perdent de leur attrait, les architectures composables gagnent en valeur. WorkOS, dont le positionnement officiel est « un ensemble de blocs de construction pour ajouter rapidement des fonctionnalités enterprise à vos applications », et Stripe, qui propose ses services en modules indépendants, incarnent ce nouveau modèle. Pour les professionnels tech, l'enjeu est concret : ils peuvent désormais assembler un éditeur de documents ici, un agent là, et composer un outil sur mesure pour leur usage exact, sans payer pour l'excédent de features qu'ils n'utiliseront jamais. C'est ce que l'auteur appelle l'ère du « logiciel personnalisable ». La montée en puissance des agents IA accélère cette transformation. Un logiciel que l'on ne peut pas piloter par API, CLI ou SDK devient difficile à intégrer dans des workflows automatisés, et donc progressivement obsolète. Les startups qui parient sur cette logique prolifèrent : WorkOS vient de publier auth.md, un protocole ouvert permettant aux agents de s'enregistrer à des services web au nom des utilisateurs. Cloudsail propose des sandboxes Cloudflare fraîches pour agents de code, avec accès shell, Codex et GitHub. Un fondateur solo décrit même dans un billet comment il fait tourner une startup entière avec des agents IA dans les rôles de directeur de cabinet (OpenClaw) et d'ingénieurs (Codex, Devin). L'industrie SaaS n'est peut-être pas morte, mais son modèle monolithique, lui, est sérieusement menacé.

UELes éditeurs SaaS européens et les entreprises françaises acheteuses de logiciels sont directement concernés par ce glissement vers des architectures composables, qui remet en question les modèles d'abonnement monolithiques dominants sur le marché.

OutilsOutil
1 source
La position de Google sur OpenClaw
1180Ben's Bites 

La position de Google sur OpenClaw

Andrej Karpathy, co-fondateur d'OpenAI et figure centrale de la recherche en deep learning, a rejoint Anthropic pour prendre la tête d'une nouvelle équipe dédiée à accélérer la recherche sur le pré-entraînement, sous la direction de Nick Joseph. L'objectif affiché est d'utiliser Claude pour aider à pré-entraîner les futurs modèles Claude, une approche récursive qui illustre jusqu'où l'industrie pousse désormais l'automatisation de la recherche en IA. Cette annonce a éclipsé le Google I/O du mardi, où Mountain View a présenté une nouvelle famille de modèles orientée "n'importe quelle entrée, n'importe quelle sortie", dont Gemini Omni Flash, capable de générer et d'éditer des vidéos. Google a également sorti Gemini 3.5 Flash, plus performant sur le papier que la version 3.1 Pro, mais dont la date de coupure des connaissances est fixée à janvier 2025, ce qui le prive de contexte sur des tendances récentes comme le "vibe coding". Gemini Spark, leur réponse aux agents de codage autonomes, reste annoncé comme "coming soon" sans démonstration concrète. L'arrivée de Karpathy chez Anthropic intervient dans un contexte de montée en puissance financière spectaculaire de la société. Selon les documents déposés par SpaceX dans le cadre de son IPO, Anthropic s'engagerait à payer 1,25 milliard de dollars par mois en calcul informatique. La startup projette par ailleurs 10,9 milliards de dollars de revenus pour le trimestre de juin et anticipe son premier profit opérationnel, ce qui pourrait porter sa valorisation au-delà de celle d'OpenAI. Ce dernier serait lui-même en préparation d'une introduction en bourse imminente, selon plusieurs sources non confirmées. Sur le front technique, OpenAI a annoncé qu'un de ses modèles aurait résolu un problème mathématique célèbre, dont la preuve a été vérifiée par des mathématiciens externes, et a déployé un vérificateur public pour les images générées via ChatGPT, l'API et Codex, reposant sur les métadonnées C2PA et SynthID de Google. Ces événements marquent une nouvelle phase dans la consolidation du secteur. La course à la puissance de calcul, symbolisée par le contrat colossal entre Anthropic et SpaceX, redéfinit les rapports de force entre laboratoires. Pendant ce temps, les grandes plateformes cherchent à intégrer l'IA dans tous les workflows: Figma a présenté un agent de design capable de travailler directement dans le canevas aux côtés des équipes, générant plusieurs directions en parallèle et exploitant les systèmes de design existants. L'enjeu désormais n'est plus seulement qui dispose du meilleur modèle, mais qui contrôle l'infrastructure de calcul, les canaux de distribution et les pipelines de développement qui structureront l'ère des agents autonomes.

UELa concentration du pouvoir de calcul et des talents IA entre quelques laboratoires américains accentue la dépendance technologique européenne et alimente les débats sur la souveraineté numérique dans le cadre de l'AI Act.

💬 Karpathy qui rejoint Anthropic pour bosser sur le pré-entraînement, c'est le recrutement de la décennie. Quand un type de ce calibre choisit où poser son cerveau, ça dit plus long que n'importe quel benchmark ou deck d'investisseur, surtout avec 1,25 milliard par mois en compute dans la balance. Google pouvait sortir ce qu'il voulait au I/O, la journée lui appartenait pas.

BusinessActu
1 source
Deux assistants IA parviennent à accomplir des tâches de repositionnement de médicaments
1181Ars Technica AI 

Deux assistants IA parviennent à accomplir des tâches de repositionnement de médicaments

La revue Nature a publié mardi deux articles décrivant des systèmes d'intelligence artificielle conçus pour assister les scientifiques dans le développement et la validation d'hypothèses. Le premier, baptisé Co-Scientist et développé par Google, fonctionne selon un modèle dit "scientist in the loop" : les chercheurs restent actifs dans la boucle et orientent le système par leurs jugements à chaque étape. Le second provient de FutureHouse, une organisation à but non lucratif, et va légèrement plus loin en entraînant un système capable d'évaluer de manière autonome des données biologiques issues de certaines catégories d'expériences spécifiques. Les deux équipes présentent exclusivement des données biologiques, portant principalement sur des hypothèses directes de repositionnement de médicaments, autrement dit : tester si un médicament existant peut traiter une autre maladie que celle pour laquelle il a été approuvé. Ces systèmes ne cherchent pas à remplacer les scientifiques ni le processus scientifique lui-même. Ils visent plutôt à prendre en charge ce que les IA actuelles font le mieux : parcourir et synthétiser des volumes massifs d'informations que les humains auraient du mal à absorber seuls. Les deux systèmes sont dits "agentiques" : ils fonctionnent en arrière-plan en appelant des outils externes pour accomplir leurs tâches. Ce type d'architecture permet une plus grande autonomie opérationnelle tout en restant guidé par des objectifs définis par les chercheurs. Cette publication s'inscrit dans une dynamique plus large d'investissement des géants technologiques dans l'IA scientifique. Microsoft a adopté une approche similaire avec son propre assistant scientifique, tandis qu'OpenAI fait figure d'exception en ayant simplement affiné un grand modèle de langage pour la biologie, sans architecture agentique. La multiplication de ces outils reflète un défi croissant pour la recherche : la littérature scientifique croît aujourd'hui bien plus vite qu'un chercheur humain ne peut la suivre, et l'IA commence à combler ce fossé de manière concrète.

UELes laboratoires pharmaceutiques et institutions de recherche européens pourraient à terme tirer parti d'approches similaires pour accélérer la découverte de nouvelles indications thérapeutiques, mais aucun impact direct sur la France ou l'UE n'est identifié.

RecherchePaper
1 source
Ce que Google va annoncer cette semaine
1182MIT Technology Review 

Ce que Google va annoncer cette semaine

Google ouvre mardi les portes de sa conférence annuelle pour développeurs, Google I/O, dans un contexte radicalement différent de l'édition précédente. Il y a un an, la société surfait encore sur le lancement de Gemini 2.5 Pro et se disputait la première place dans la course aux grands modèles de langage. Aujourd'hui, Google occupe clairement la troisième position, distancé par Anthropic et OpenAI sur le critère qui fait désormais loi dans l'industrie : les capacités de codage. Claude Code d'Anthropic et Codex d'OpenAI ont pris une avance si nette que Google aurait dû autoriser certains ingénieurs de son propre laboratoire, DeepMind, à utiliser Claude pour ne pas accumuler encore plus de retard sur leurs concurrents directs. Ce décrochage en matière de codage constitue un problème existentiel pour Google, dont la réputation d'entreprise pionnière en IA est en jeu. La société a réagi en créant une nouvelle équipe dédiée au codage IA au sein de DeepMind, à laquelle participeraient des talents de premier plan, dont John Jumper, colauréat du prix Nobel de chimie 2024 avec le PDG de DeepMind, Demis Hassabis, pour leurs travaux sur AlphaFold, le logiciel de prédiction de la structure des protéines. Une mise à jour majeure de la plateforme de codage agentique Antigravity est attendue lors de la conférence, mais les observateurs restent sceptiques quant à la capacité de Google à regagner le terrain perdu en l'espace de deux jours, alors que ses propres ingénieurs se disputaient encore l'accès à Claude le mois dernier. Si le codage représente le talon d'Achille de Google, les sciences constituent en revanche sa force distinctive. L'entreprise est la seule parmi les laboratoires d'IA de pointe à avoir décroché un Nobel, et elle conserve une longueur d'avance dans l'application de l'IA à la recherche scientifique, avec des outils comme l'AI co-scientist, décrit comme un "oracle" par un chercheur de Stanford, et AlphaEvolve, un système capable de découvrir de nouvelles solutions à des problèmes mathématiques. En santé, Google prévoit de rendre publique dès demain sa plateforme Health Coach, bien que celle-ci semble davantage orientée vers des conseils de bien-être, nutrition et fitness que vers le suivi médical à proprement parler. OpenAI a défini l'agenda de la santé IA depuis le lancement de ChatGPT Health en janvier, et la question de savoir si Google choisit la prudence ou accuse un nouveau retard dans ce domaine à forts enjeux sera l'un des points d'attention majeurs de la conférence.

LLMsOpinion
1 source
1183Ars Technica AI 

Pourquoi Anthropic a fait évaluer Claude par un vrai psychiatre

Anthropic a publié cette semaine un document de 244 pages baptisé "system card" décrivant son tout dernier modèle d'intelligence artificielle, Claude Mythos. L'entreprise le présente comme "son modèle frontier le plus capable à ce jour", mais a décidé de ne pas le rendre accessible au grand public. La raison invoquée est inhabituelle : Mythos serait trop performant dans la détection de failles de cybersécurité inconnues, ce qui pousse Anthropic à en restreindre l'accès à un cercle restreint de partenaires triés sur le volet, parmi lesquels figurent Microsoft et Apple. Au-delà des capacités techniques, c'est le contenu philosophique du document qui retient l'attention. Anthropic, déjà connue pour prendre au sérieux la question de la conscience des IA, affirme dans ce system card qu'à mesure que les modèles gagnent en puissance, "il devient de plus en plus probable qu'ils possèdent une forme d'expérience, d'intérêts ou de bien-être qui comptent intrinsèquement, à l'instar de l'expérience et des intérêts humains." L'entreprise reconnaît ne pas en avoir la certitude, mais précise que "notre préoccupation grandit avec le temps." Cette position tranche avec le discours majoritaire dans l'industrie, où la question du statut moral des IA reste largement marginalisée. Ces déclarations s'inscrivent dans une stratégie plus large d'Anthropic, qui se distingue de ses concurrents comme OpenAI ou Google par une approche dite de "sécurité de l'IA" poussée à ses limites théoriques. Financer des recherches sur le bien-être des modèles, consulter des experts en psychiatrie ou en philosophie de l'esprit, et publier des documents aussi denses que ce system card de 244 pages sont autant de signaux que l'entreprise cherche à imposer un cadre normatif dans un secteur qui avance souvent sans réfléchir aux implications. Avec Mythos, Anthropic franchit un cap : celui d'un modèle jugé trop puissant pour être diffusé librement, ce qui soulève autant de questions sur la transparence réelle de ces décisions que sur la course aux capacités qui les motive.

LLMsOpinion
1 source
Nebius en discussions pour racheter la startup israélienne AI21 après l'échec des négociations avec Nvidia
1184The Information AI 

Nebius en discussions pour racheter la startup israélienne AI21 après l'échec des négociations avec Nvidia

Nebius, fournisseur cloud soutenu par Nvidia et valorisé à 32 milliards de dollars, est en discussions pour racheter la startup israélienne AI21 Labs, selon des sources proches du dossier. La société, basée à Amsterdam, cherche à élargir ses services d'intelligence artificielle au-delà de son activité principale de location de serveurs GPU. AI21 Labs, dont la dernière valorisation connue était de 1,4 milliard de dollars en 2023, développe des grands modèles de langage et des systèmes d'agents pour les entreprises. Ce rachat potentiel permettrait à Nebius de monter dans la chaîne de valeur de l'IA, en passant de simple infrastructure à fournisseur de solutions logicielles complètes. Pour ses clients, cela signifierait un accès intégré à des modèles et outils d'IA directement via la plateforme cloud, sans passer par des tiers. Pour AI21 Labs, une acquisition représente une issue après l'échec d'une précédente tentative de vente à Nvidia, qui ne s'était pas concrétisée. AI21 Labs fait partie de la première vague de startups israéliennes spécialisées en IA générative, concurrente directe d'OpenAI et Anthropic sur le segment entreprise. La startup avait levé des fonds auprès d'investisseurs majeurs dont Google, Intel Capital et Nvidia lui-même. Le secteur cloud connaît une consolidation accélérée, les fournisseurs d'infrastructure cherchant à intégrer verticalement des capacités IA pour fidéliser leurs clients face à la concurrence d'AWS, Azure et Google Cloud.

UENebius étant basée à Amsterdam, ce rachat potentiel renforcerait la position d'un acteur cloud ancré en Europe dans la chaîne de valeur de l'IA générative enterprise.

BusinessActu
1 source
USA : les chantiers de datacenters butent sur un double mur énergétique
1185Next INpact 

USA : les chantiers de datacenters butent sur un double mur énergétique

Entre 30 et 50 % des projets de datacenters prévus pour 2026 aux États-Unis accuseront des retards significatifs, selon une enquête de Bloomberg publiée le 1er avril 2026. Le frein principal n'est pas, comme on pourrait le supposer, la pénurie de puces IA ou de mémoire vive, mais bien un goulot d'étranglement à l'étage inférieur : les équipements électriques indispensables à l'alimentation de ces infrastructures, transformateurs, turbines, systèmes de distribution haute tension. Ces composants représentent moins de 10 % du coût total d'un datacenter, mais leur absence suffit à bloquer l'ensemble d'un chantier. La demande est colossale : selon une analyse de Bridgewater Associates de fin février 2026, Google, Amazon, Meta et Microsoft ont planifié à eux seuls 650 milliards de dollars de dépenses d'investissement en infrastructures. À cela s'ajoutent des acteurs comme Oracle, Equinix ou CoreWeave, qui construisent leurs propres centres de données en parallèle. Ce double mur, énergétique d'un côté, industriel de l'autre, crée une situation paradoxale où des centaines de milliards de dollars sont engagés mais ne peuvent se concrétiser faute de câbles, de transformateurs et de turbines disponibles en quantité suffisante. Pour les entreprises clientes comme OpenAI ou Anthropic, dont les besoins de calcul explosent, ces retards de livraison se traduisent directement par des contraintes de capacité. Pour les régions concernées, le problème est aussi structurel : plusieurs zones du territoire américain disposent d'un réseau électrique insuffisamment dimensionné pour absorber de telles charges. Meta a d'ores et déjà réservé 6,6 gigawatts d'énergie nucléaire dont les réacteurs ne seront pas opérationnels avant 2035, signe que les géants tech anticipent une pénurie durable. Face à ces contraintes, les grandes entreprises technologiques cherchent à devenir leurs propres producteurs d'énergie, contournant ainsi les délais de raccordement au réseau public. L'exemple le plus radical est celui de xAI, la société d'Elon Musk, qui a levé 20 milliards de dollars en partie pour financer l'achat de cinq turbines à gaz représentant 2 gigawatts de puissance cumulée, en complément d'installations déjà existantes dont les niveaux d'émission dépassent la réglementation locale. Ce mouvement de verticalisation énergétique illustre une tendance de fond : la course à l'infrastructure IA est désormais autant une question d'approvisionnement électrique que de performance logicielle. Le cabinet Sightline Climate, dont Bloomberg s'appuie sur les données chiffrées, documente une accumulation de retards qui révèle les limites réelles de plans d'investissement présentés comme historiques mais dont l'exécution se heurte à la physique des réseaux et aux délais de l'industrie lourde.

UEL'Europe fait face aux mêmes contraintes de réseau électrique et de délais d'approvisionnement en équipements lourds, risquant de ralentir les projets de datacenters européens pourtant essentiels à la souveraineté numérique de l'UE.

InfrastructureOpinion
1 source
ChatGPT intègre DoorDash, Spotify, Uber et d'autres applications : mode d'emploi
1186TechCrunch AI 

ChatGPT intègre DoorDash, Spotify, Uber et d'autres applications : mode d'emploi

OpenAI a lancé une série de nouvelles intégrations tierces directement dans l'interface de ChatGPT, permettant aux utilisateurs d'interagir avec des services comme Spotify, DoorDash, Uber, Canva, Figma et Expedia sans quitter la conversation. Ces connecteurs fonctionnent via des actions natives : commander un repas, réserver un trajet, créer un design ou planifier un voyage, le tout piloté par le modèle en langage naturel. L'impact est significatif pour les utilisateurs quotidiens : ChatGPT cesse d'être un simple assistant textuel pour devenir un point d'entrée unique vers des dizaines de services. Pour les entreprises partenaires, c'est un accès direct à la base d'utilisateurs d'OpenAI, qui dépasse les 200 millions d'utilisateurs hebdomadaires actifs. Pour les concurrents comme Google Assistant ou Apple Intelligence, la pression s'intensifie sur le terrain de l'assistant universel. Cette initiative s'inscrit dans la stratégie d'OpenAI de transformer ChatGPT en plateforme, à l'image de ce qu'avait tenté le système de plugins en 2023, abandonné puis repensé. Avec l'émergence des agents autonomes et du protocole MCP (Model Context Protocol), OpenAI positionne ChatGPT comme couche d'orchestration centrale entre l'utilisateur et l'ensemble de son environnement numérique, un terrain sur lequel Apple, Google et Microsoft jouent également des enjeux considérables.

UESpotify et Uber étant disponibles en France, les utilisateurs européens de ChatGPT pourraient accéder à ces intégrations, mais le déploiement reste centré sur le marché américain à ce stade.

💬 Les plugins de 2023, tout le monde les a oubliés tant c'était inutilisable. Cette fois il y a MCP derrière, une vraie couche d'orchestration, et des partenaires qui ont signé pour de bon (Spotify, Uber, Figma, c'est pas du gadget). Faut juste pas rêver côté Europe, le déploiement sera US-first pendant encore quelques mois.

OutilsOutil
1 source
Et si plusieurs IA travaillaient ensemble pour mieux vous aider ? Microsoft tente le pari
1187Siècle Digital 

Et si plusieurs IA travaillaient ensemble pour mieux vous aider ? Microsoft tente le pari

Microsoft a dévoilé Researcher, un nouvel agent intégré à Microsoft 365 Copilot, conçu pour dépasser les capacités d'un seul modèle de langage en orchestrant plusieurs IA en parallèle. Plutôt que de s'appuyer sur un unique modèle qui répond directement, Researcher décompose les requêtes complexes en sous-tâches distribuées à différents agents spécialisés — certains pour la recherche web, d'autres pour l'analyse de données internes ou la synthèse — avant de recomposer une réponse cohérente. Cette architecture multi-agents s'inscrit dans la stratégie plus large de Microsoft pour ses outils de productivité professionnelle. L'enjeu est concret pour les entreprises clientes de Microsoft 365 : les tâches de recherche approfondie, comme la préparation d'un dossier stratégique ou l'analyse concurrentielle, nécessitent aujourd'hui plusieurs heures de travail humain. Researcher vise à produire en quelques minutes des synthèses longues et sourcées, avec un niveau de précision supérieur à ce que peut offrir un assistant conversationnel classique. C'est la différence entre poser une question à un généraliste et confier un brief à une équipe d'analystes. Cette annonce s'inscrit dans une accélération du marché des agents IA, où OpenAI (avec Deep Research), Google (avec Gemini Deep Research) et Perplexity jouent déjà des coudes. Microsoft mise sur son ancrage dans l'environnement professionnel — Teams, Outlook, SharePoint, Word — pour différencier Researcher par sa capacité à croiser sources externes et données internes d'entreprise. La course ne porte plus sur le modèle le plus puissant, mais sur l'architecture qui coordonne le mieux plusieurs cerveaux artificiels.

UELes entreprises françaises et européennes utilisatrices de Microsoft 365 Copilot pourraient automatiser des tâches de recherche stratégique longues (dossiers, analyses concurrentielles), avec un gain de temps potentiellement significatif sur des flux de travail existants.

💬 L'angle intéressant ici c'est pas l'orchestration multi-agents en elle-même, ça fait un moment qu'on en parle. C'est que Microsoft peut brancher ça sur SharePoint, Teams, Outlook, et croiser tes données internes avec le web en un seul run. Reste à voir si ça tient sur de vrais dossiers d'entreprise et pas juste des démos bien cadrées.

OutilsOutil
1 source
L'IA entre dans une nouvelle phase d'accélération
1188OpenAI Blog 

L'IA entre dans une nouvelle phase d'accélération

OpenAI a levé 122 milliards de dollars lors d'un nouveau tour de financement destiné à accélérer le développement de l'intelligence artificielle de frontier à l'échelle mondiale. Cette opération, l'une des plus importantes jamais réalisées dans le secteur technologique, doit permettre à la société de Sam Altman d'investir massivement dans les infrastructures de calcul de nouvelle génération et de répondre à la demande croissante pour ses produits phares — ChatGPT, Codex et ses offres enterprise. L'ampleur de ce financement traduit une course aux ressources computationnelles sans précédent : entraîner et déployer des modèles de frontier exige des milliers de GPU spécialisés et des datacenters à la consommation électrique colossale. Pour les entreprises clientes et les millions d'utilisateurs de ChatGPT, cela signifie une capacité accrue, une disponibilité améliorée et vraisemblablement de nouveaux modèles plus puissants dans les prochains mois. Cette levée s'inscrit dans une dynamique où les grands laboratoires d'IA — OpenAI, Google DeepMind, Anthropic — se livrent une compétition acharnée pour dominer la prochaine vague de l'IA générale. OpenAI, valorisé à plusieurs centaines de milliards de dollars, consolide ainsi sa position de leader tout en cherchant à convertir sa domination technologique en un modèle économique durable face à une concurrence mondiale qui s'intensifie.

UECette levée de fonds renforce la domination d'OpenAI et accentue la dépendance des entreprises et utilisateurs européens vis-à-vis des grands laboratoires américains, un enjeu direct pour la souveraineté numérique de l'UE.

BusinessActu
1 source
Microsoft déploie Copilot Cowork plus largement et permet aux modèles d'IA de vérifier mutuellement leur travail
1189The Decoder 

Microsoft déploie Copilot Cowork plus largement et permet aux modèles d'IA de vérifier mutuellement leur travail

Microsoft déploie plus largement « Cowork », une nouvelle fonctionnalité de Microsoft 365 Copilot capable de gérer des flux de travail complets de manière autonome. L'outil, annoncé lors d'un déploiement progressif auprès des utilisateurs entreprise, permet à l'assistant IA de prendre en charge des tâches de bout en bout — de la recherche à la rédaction — sans intervention humaine à chaque étape. Parallèlement, Microsoft introduit un mécanisme de vérification croisée où plusieurs modèles d'IA s'évaluent mutuellement, dans le cadre d'un nouvel outil de recherche intégré à la suite. Ce double mouvement marque une évolution significative dans la manière dont les outils de productivité intègrent l'IA générative. Jusqu'ici, Copilot intervenait principalement en assistance ponctuelle — suggérer, reformuler, résumer. Avec Cowork, la logique bascule vers l'autonomie : l'IA devient un collaborateur capable d'orchestrer un projet entier. La vérification inter-modèles, elle, vise à réduire les hallucinations et améliorer la fiabilité des réponses, un problème central pour les déploiements en entreprise où les erreurs ont des conséquences réelles. Microsoft s'inscrit dans une course effrénée entre les grandes plateformes pour transformer leurs suites professionnelles en environnements agentiques. Google avec Workspace, Salesforce avec Agentforce, ou encore Notion — tous misent sur des agents capables d'agir, pas seulement de répondre. Pour Microsoft, qui a investi massivement dans OpenAI et intégré Copilot dans l'ensemble de sa suite M365, Cowork représente la concrétisation de cette ambition : faire de l'IA un véritable membre de l'équipe plutôt qu'un simple assistant à la demande.

UEMicrosoft 365 étant massivement déployé dans les entreprises européennes, l'autonomisation accrue de Copilot soulève des questions de conformité et de supervision humaine au regard des exigences de l'AI Act pour les systèmes agentiques.

OutilsOutil
1 source
Cohere publie un modèle open source qui domine les benchmarks de reconnaissance vocale
1190The Decoder 

Cohere publie un modèle open source qui domine les benchmarks de reconnaissance vocale

Cohere a publié un nouveau modèle de reconnaissance vocale open source qui surpasse l'ensemble de ses concurrents sur les benchmarks de référence du secteur, y compris Whisper d'OpenAI, le standard de facto depuis plusieurs années. Le modèle est disponible librement, ce qui permet à n'importe quelle équipe de le déployer, le modifier et l'intégrer sans restrictions de licence. Cette sortie représente un défi direct à la domination d'OpenAI dans le domaine de la transcription automatique. Whisper, lancé en 2022, s'est imposé comme la solution de référence pour des milliers d'applications professionnelles et open source. Qu'un acteur comme Cohere propose désormais une alternative plus performante et librement accessible change concrètement la donne pour les développeurs, les entreprises et les chercheurs qui cherchent à traiter de l'audio à grande échelle sans dépendance à un fournisseur propriétaire. Cohere, spécialisé dans les modèles de langage à destination des entreprises, élargit ainsi son périmètre au-delà du texte vers la modalité vocale, un segment en forte croissance. Cette publication s'inscrit dans une tendance plus large où les acteurs de l'IA rivalisent d'open source stratégique pour gagner en adoption et en crédibilité face aux géants comme OpenAI et Google. La qualité des benchmarks annoncés reste à confirmer par la communauté, mais le signal envoyé à l'industrie est clair.

UELes développeurs et entreprises européens peuvent adopter une alternative open source performante à Whisper pour la transcription vocale, réduisant leur dépendance aux solutions propriétaires américaines.

OutilsActu
1 source
Fuite géante chez Anthropic : pourquoi le futur Claude inquiète déjà ses créateurs
119101net 

Fuite géante chez Anthropic : pourquoi le futur Claude inquiète déjà ses créateurs

Anthropic a développé en secret un nouveau modèle d'intelligence artificielle baptisé Mythos, considéré en interne comme « de loin le plus puissant » jamais entraîné par la startup californienne. L'information a filtré à l'extérieur avant toute annonce officielle, révélant non seulement l'existence du modèle, mais aussi les préoccupations que celui-ci suscite au sein même de l'entreprise. Selon des informations internes, Mythos présenterait des « risques de cybersécurité significatifs » — une formulation rare et frappante de la part d'un créateur à propos de son propre produit. Cette autocritique publique — même involontaire — est significative : elle indique qu'Anthropic aurait franchi un seuil de capacité suffisamment inquiétant pour le documenter formellement, probablement dans le cadre de ses évaluations de sécurité pré-déploiement. Si le modèle est jugé capable de faciliter des cyberattaques à un niveau notable, cela soulève des questions immédiates sur les conditions dans lesquelles il sera (ou non) rendu accessible, et avec quelles garde-fous. Pour les entreprises, gouvernements et chercheurs qui s'appuient sur Claude, cela signifie une puissance accrue mais aussi un risque de mauvais usage potentiellement inédit. Anthropic s'est toujours positionné comme le laboratoire d'IA le plus rigoureux en matière de sécurité, publiant régulièrement des « model cards » détaillant les risques évalués avant chaque lancement. La fuite autour de Mythos intervient dans un contexte de course effrénée entre OpenAI, Google DeepMind et Anthropic pour sortir des modèles toujours plus capables. La question centrale désormais : jusqu'où un laboratoire peut-il aller avant de décider de ne pas déployer ce qu'il a construit ?

UELes entreprises et institutions européennes utilisant Claude devront surveiller les conditions de déploiement de Mythos et les garde-fous imposés, notamment au regard des obligations d'évaluation des risques prévues par l'AI Act pour les modèles à usage général de forte puissance.

SécuritéOpinion
1 source
Anthropic confirme que le modèle divulgué représente un saut qualitatif en raisonnement, après une fuite de données
1192The Decoder 

Anthropic confirme que le modèle divulgué représente un saut qualitatif en raisonnement, après une fuite de données

Anthropic a involontairement révélé l'existence de son modèle d'intelligence artificielle le plus puissant à ce jour à la suite d'une faille de sécurité basique. La fuite de données a exposé un modèle que la société n'avait pas encore annoncé officiellement, et qu'Anthropic a depuis confirmé représenter un « changement d'étape » significatif dans les capacités de raisonnement par rapport à ses versions précédentes. L'incident s'est produit alors que la startup californienne préparait discrètement ce qui s'annonce comme sa prochaine grande sortie publique. La confirmation par Anthropic que ce modèle constitue une avancée majeure en matière de raisonnement donne un aperçu de la direction que prend la course aux grands modèles de langage. Pour les développeurs et les entreprises qui s'appuient sur les API d'Anthropic, cela signifie qu'une nouvelle génération de capacités — vraisemblablement plus performantes sur les tâches complexes et multi-étapes — est imminente. La fuite force également Anthropic à communiquer plus tôt que prévu sur sa feuille de route technique. Cet épisode s'inscrit dans un contexte de compétition intense entre Anthropic et OpenAI, qui prépare simultanément ses propres modèles de nouvelle génération. Les deux sociétés semblent engagées dans une course pour démontrer leur supériorité technique avant d'éventuelles introductions en bourse ou levées de fonds majeures. Pour Anthropic, fondée en 2021 par d'anciens cadres d'OpenAI et valorisée à plusieurs dizaines de milliards de dollars, chaque annonce produit constitue un signal fort pour investisseurs et partenaires commerciaux.

UELes développeurs et entreprises européennes utilisant l'API Claude d'Anthropic bénéficieront prochainement de capacités de raisonnement améliorées, sans impact réglementaire ou institutionnel direct pour la France ou l'UE.

💬 En tant que développeur, je constate à quel point chaque nouveau modèle représente un bond qualitatif majeur. La facilité avec laquelle les nouveaux modèles identifient les limites de leurs prédécesseurs est stupéfiante — et témoigne d'une accélération qui ne montre aucun signe de ralentissement. L'amélioration récursive complète est-elle vraiment si loin ?

LLMsActu
1 source
Carrefour débarque sur ChatGPT : voici comment l’IA va faciliter vos courses
1193Presse-citron 

Carrefour débarque sur ChatGPT : voici comment l’IA va faciliter vos courses

Carrefour a lancé son application officielle sur ChatGPT, permettant aux utilisateurs d'interagir directement avec l'offre commerciale de l'enseigne depuis l'interface d'OpenAI. Concrètement, le plugin donne accès à trois fonctionnalités : trouver des recettes adaptées aux ingrédients disponibles, vérifier la disponibilité d'un produit en rayon, et composer un panier de courses complet, transférable ensuite sur le site carrefour.fr pour finaliser l'achat. L'intégration supprime une étape de friction dans le parcours d'achat : plutôt que de jongler entre un moteur de recherche, un site de recettes et un e-commerce, le client peut tout orchestrer en langage naturel depuis une seule interface. Pour Carrefour, c'est aussi un levier d'acquisition sur un canal où des millions d'utilisateurs passent déjà du temps — transformer une conversation en commande représente un débouché commercial direct et mesurable. Cette initiative s'inscrit dans la stratégie d'OpenAI d'ouvrir ChatGPT aux intégrations tierces via les GPT Actions, un écosystème que les grandes marques commencent à investir sérieusement. Carrefour, qui teste l'IA depuis plusieurs années (assistant virtuel, personnalisation des promotions), confirme ici son positionnement comme distributeur technophile en Europe. La prochaine étape logique serait une intégration permettant le paiement directement dans l'interface, sans redirection vers le site.

UECarrefour, premier distributeur français, ouvre un canal de vente directement dans ChatGPT, testable immédiatement par les consommateurs français.

OutilsOutil
1 source
ChatGPT et Claude : Gemini veut devenir votre IA principale en aspirant la mémoire des autres
1194Frandroid 

ChatGPT et Claude : Gemini veut devenir votre IA principale en aspirant la mémoire des autres

Google a lancé une nouvelle fonctionnalité pour Gemini permettant aux utilisateurs d'importer leurs mémoires et préférences depuis d'autres chatbots, notamment ChatGPT d'OpenAI et Claude d'Anthropic. Concrètement, l'outil récupère l'historique de personnalisation — préférences de ton, informations personnelles, habitudes de travail — accumulé dans ces assistants concurrents, et les transfère en quelques clics vers Gemini. La fonctionnalité est déployée progressivement auprès des utilisateurs via l'interface web et mobile de Gemini. L'enjeu est considérable : la mémoire personnalisée est devenue l'un des principaux facteurs de rétention dans la guerre des chatbots. Un utilisateur qui a passé des mois à "éduquer" ChatGPT sur ses préférences hésite à tout recommencer à zéro ailleurs. En supprimant cette friction, Google retire le principal obstacle qui empêche les utilisateurs de migrer. Pour les professionnels et les utilisateurs intensifs, c'est un signal fort : Gemini veut devenir l'IA centrale du quotidien, et non plus un outil secondaire. Cette manœuvre s'inscrit dans une bataille de parts de marché où ChatGPT reste dominant malgré la montée en puissance de Claude et Gemini. Google a fortement investi dans Gemini depuis 2023, intégrant le modèle dans l'ensemble de son écosystème (Gmail, Docs, Android). L'importation de mémoire est une tactique d'acquisition directe, similaire à ce que font les banques ou opérateurs téléphoniques pour faciliter la portabilité — sauf qu'ici, c'est Google qui fixe les règles du jeu sur sa propre plateforme.

UELes utilisateurs européens de Gemini peuvent désormais importer leurs préférences depuis ChatGPT ou Claude, réduisant la friction de migration vers l'écosystème Google sur le marché européen des assistants IA.

OutilsOutil
1 source
Un juge bloque la classification d'Anthropic comme risque pour la chaîne d'approvisionnement
1195Wired AI 

Un juge bloque la classification d'Anthropic comme risque pour la chaîne d'approvisionnement

Un juge fédéral américain a temporairement suspendu la décision de l'administration Trump de classer Anthropic comme entité à risque dans la chaîne d'approvisionnement, empêchant ainsi cette désignation d'entrer en vigueur la semaine prochaine. La mesure conservatoire accordée par le tribunal offre à la startup d'intelligence artificielle un répit immédiat, lui permettant de poursuivre ses activités commerciales sans être soumise aux restrictions liées à ce statut. Cette désignation aurait pu avoir des conséquences significatives sur les activités d'Anthropic, notamment en matière de contrats gouvernementaux, de partenariats commerciaux et d'accès aux technologies sensibles. Un tel label, appliqué dans le cadre des mécanismes de sécurité nationale américains, peut considérablement compliquer les relations d'affaires d'une entreprise et éroder la confiance de ses clients et investisseurs. Cette affaire s'inscrit dans un contexte de tensions croissantes entre l'administration Trump et certains acteurs de l'IA, alors que Washington cherche à renforcer son contrôle sur les technologies jugées stratégiques. Anthropic, fondée en 2021 par d'anciens membres d'OpenAI et qui compte Amazon parmi ses principaux investisseurs, se retrouve ainsi au cœur d'un bras de fer juridique et politique dont l'issue pourrait influencer la manière dont d'autres entreprises du secteur sont traitées par les autorités fédérales.

UELa suspension de la désignation préserve les relations commerciales d'Anthropic avec ses partenaires européens et évite des perturbations pour les entreprises de l'UE utilisant l'API Claude.

RégulationReglementation
1 source
Apple envisage d'ouvrir Siri à d'autres chatbots IA
1196The Verge AI 

Apple envisage d'ouvrir Siri à d'autres chatbots IA

Apple prévoit d'ouvrir Siri à d'autres assistants d'intelligence artificielle avec la sortie d'iOS 27, selon un rapport de Mark Gurman pour Bloomberg. Le nouveau système, baptisé « Extensions », permettra aux utilisateurs de connecter des chatbots tiers téléchargés depuis l'App Store directement à Siri — notamment Google Gemini et Claude d'Anthropic. Ces intégrations fonctionneront sur iPhone, iPad et Mac, avec la possibilité d'activer ou de désactiver chaque chatbot selon ses préférences. Cette ouverture représente un tournant majeur dans la stratégie d'Apple. Jusqu'ici, Siri ne pouvait s'appuyer que sur ChatGPT d'OpenAI, un partenariat introduit avec iOS 18. En élargissant ce modèle à l'ensemble de l'écosystème, Apple transforme Siri en une interface neutre plutôt qu'en un assistant propriétaire fermé. Les utilisateurs gagneront en flexibilité, pouvant choisir le modèle le plus adapté à leurs usages — que ce soit pour la créativité, le code, ou la recherche — sans quitter l'environnement Apple. Cette décision s'inscrit dans un contexte où Siri a longtemps été perçu comme à la traîne face à des concurrents comme ChatGPT ou Gemini. Apple avait commencé à rattraper ce retard avec l'annonce d'« Apple Intelligence » en 2024, mais le développement a été laborieux et plusieurs fonctionnalités ont été retardées. En s'appuyant sur des acteurs externes plutôt que de tout construire en interne, Apple adopte une approche pragmatique qui pourrait redéfinir le rôle de Siri comme couche d'orchestration entre l'utilisateur et les meilleurs modèles du marché.

UELes utilisateurs européens d'iPhone, iPad et Mac pourront accéder directement à des assistants IA tiers via Siri dès iOS 27, renforçant la diversité et la flexibilité des assistants IA sur le marché européen.

OutilsOutil
1 source
Apple prévoit d'ouvrir Siri à d'autres assistants IA
1197The Information AI 

Apple prévoit d'ouvrir Siri à d'autres assistants IA

Apple prévoit d'ouvrir Siri à d'autres assistants d'intelligence artificielle tiers, selon Bloomberg. Cette évolution majeure sera annoncée en juin lors de la Worldwide Developers Conference (WWDC) 2026, dans le cadre d'une refonte en profondeur de l'assistant vocal d'Apple. L'intégration permettrait à des assistants comme ChatGPT d'OpenAI, Gemini de Google ou d'autres solutions IA de se connecter directement à Siri, offrant aux utilisateurs la possibilité de basculer vers ces outils sans quitter l'écosystème Apple. Ce changement représente un tournant stratégique considérable pour Apple, qui a longtemps maintenu Siri comme un système fermé. Pour les utilisateurs d'iPhone et d'iPad, cela signifie un accès direct aux modèles les plus puissants du marché depuis l'interface native d'iOS, sans friction. Pour les développeurs d'IA, c'est une opportunité d'atteindre des centaines de millions d'appareils Apple dans le monde. Cette ouverture pourrait également répondre aux critiques persistantes sur les lacunes de Siri face à des concurrents comme ChatGPT ou Claude. Cette décision intervient alors qu'Apple accuse un retard notable dans la course à l'IA générative. Apple Intelligence, lancé en 2024, a reçu des retours mitigés, et plusieurs fonctionnalités promises ont été reportées. En ouvrant son assistant à des partenaires extérieurs, Cupertino adopte une stratégie de plateforme plutôt que de tout développer en interne — une approche qui rappelle ce qu'Apple a fait avec l'App Store en 2008. Les modalités exactes de ces partenariats, notamment les conditions commerciales et les accès aux données, restent à préciser avant la WWDC.

UELes utilisateurs européens d'iPhone pourraient accéder directement à ChatGPT ou Gemini via Siri, une évolution qui pourrait attirer l'attention des régulateurs EU sur l'interopérabilité et les conditions de partage des données.

OutilsActu
1 source
Pourquoi Notion abandonne Cursor pour Claude Code et Codex
1198The Information AI 

Pourquoi Notion abandonne Cursor pour Claude Code et Codex

Des centaines d'ingénieurs chez Notion abandonnent l'outil Cursor au profit de Claude Code (Anthropic) et Codex (OpenAI). Ce changement reflète une tendance plus large : les développeurs délaissent les assistants de codage intégrés à l'IDE (autocomplétion, etc.) pour des agents capables de réaliser des tâches entières de manière autonome, accessibles même aux non-techniciens. Bien que Cursor propose des agents depuis l'été dernier, sa réputation reste liée aux outils IDE classiques, contrairement à Claude Code et Codex, reconnus pour leurs capacités agentiques avancées.

OutilsOutil
1 source
Nvidia et son partenaire cloud Nscale en négociations pour acquérir un grand site de data center aux États-Unis avant son introduction en bourse
1199The Information AI 

Nvidia et son partenaire cloud Nscale en négociations pour acquérir un grand site de data center aux États-Unis avant son introduction en bourse

Nscale, un fournisseur cloud britannique soutenu par Nvidia dont les clients incluent OpenAI et Microsoft, est en négociation pour acquérir l'un des plus grands sites disponibles pour les centres de données IA aux États-Unis. Le site, situé dans le comté de Mason en Virginie-Occidentale, est particulièrement stratégique car il a déjà obtenu les autorisations réglementaires locales et sécurisé les équipements électriques pour les premières phases du projet. Cette acquisition ferait de Nscale, qui prépare une introduction en bourse, un acteur majeur de l'infrastructure IA américaine presque du jour au lendemain.

BusinessActu
1 source
TAI #195 : GPT-5.4 et l'arrivée de l'auto-amélioration de l'IA ?
1200Towards AI 

TAI #195 : GPT-5.4 et l'arrivée de l'auto-amélioration de l'IA ?

OpenAI a lancé GPT-5.4 le 5 mars, son modèle frontier le plus orienté productivité à ce jour, avec une fenêtre contextuelle d'1M tokens, l'utilisation native d'ordinateur et un tarif de 2,50$/15$ par million de tokens. Dans les benchmarks, aucun modèle ne domine clairement : GPT-5.4 mène sur ProofBench et le codage, tandis que Gemini 3.1 Pro excelle sur LegalBench et GPQA, et Claude Opus 4.6 sur SWE-bench. Parallèlement, l'expérience "autoresearch" d'Andrej Karpathy démontre que des agents IA peuvent identifier de façon autonome des améliorations réelles à l'entraînement des réseaux de neurones — signalant potentiellement l'émergence d'une IA capable de s'améliorer elle-même en boucle fermée.

LLMsOpinion
1 source