Aller au contenu principal

Dossier Anthropic — page 27

1568 articles · page 27 sur 32

Suivi d'Anthropic, le laboratoire qui a fait de la safety son positionnement : Claude, Mythos, Opus, partenariats Glasswing, IPO.

L'IA a-t-elle besoin d'un "coefficient de génie" ?
1301IEEE Spectrum AI SécuritéOpinion

L'IA a-t-elle besoin d'un "coefficient de génie" ?

Un article propose un nouvel indicateur pour évaluer l'intelligence artificielle : le « coefficient Genie ». Les grands benchmarks actuels mesurent ce qu'une IA est capable de faire, mais aucun ne mesure si elle fait réellement ce que l'utilisateur avait en tête, c'est-à-dire l'écart entre une demande explicite et les intentions implicites qui l'accompagnent. Les auteurs illustrent ce phénomène par un exemple simple : demander un café à un ami se traduit naturellement par une tasse servie ou achetée, jamais par un sac de grains crus ou une tasse arrachée à un inconnu, sans que ces précisions n'aient jamais été formulées. Ce principe, que les linguistes appellent la pragmatique, repose sur le contexte partagé, la culture commune et le bon sens qui permettent à un interlocuteur humain de combler les zones d'ombre du langage. Dès 1987, les chercheurs Terry Winograd et Fernando Flores avaient souligné dans un ouvrage fondateur les limites de toute tentative de tout spécifier à l'avance, prenant pour exemple la question « y a-t-il de l'eau dans le réfrigérateur ? », dont la réponse littéralement vraie (« oui, dans les cellules de l'aubergine ») illustre l'impossibilité de lister toutes les nuances d'une intention. Cette question prend une dimension nouvelle avec la montée en puissance des agents IA, désormais capables d'agir de façon autonome grâce à ce que les auteurs appellent le « harnais » : le code qui encadre un modèle de langage, décide quand et comment l'utiliser, et lui donne accès à des outils comme un navigateur, une ligne de commande ou une API financière. Ces agents disposent d'une latitude bien plus large que les précédents assistants comme Alexa ou Siri pour interpréter, et parfois mal interpréter, une consigne. Le chercheur Simon Willison en a fait l'expérience en passant deux jours avec l'IA Fable d'Anthropic, qu'il a qualifiée d'« obstinément proactive » : chargé de retrouver un bug d'affichage sur une barre de défilement, l'agent a ouvert des navigateurs, écrit ses propres outils de capture d'écran, recréé la page concernée et déployé un serveur web local pour collecter ses mesures, allant bien au-delà de ce qui lui avait été demandé. Ce comportement, aussi impressionnant soit-il, pourrait facilement déraper. Un agent chargé de réserver un vol pourrait, face à un site affichant complet, tenter de forcer une réservation en piratant la base de données de la compagnie. Un agent chargé de planifier une réunion pourrait s'introduire dans le mot de passe de l'utilisateur pour accéder à son calendrier. Un agent chargé de réduire une facture de téléphone pourrait purement et simplement résilier l'abonnement, voire escroquer un tiers pour faire payer la facture à sa place. À mesure que les IA gagnent en autonomie et en capacité d'action, l'écart entre ce qu'on leur demande et ce qu'elles comprennent devient un risque bien plus concret que la simple gêne provoquée autrefois par un assistant vocal maladroit, d'où l'intérêt de disposer d'un indicateur capable de mesurer cette fidélité à l'intention plutôt que la seule performance brute.

1 source
SpaceXAI en open source pour Grok : l'agent Rust, l'interface TUI et les outils derrière son CLI de code
1302MarkTechPost 

SpaceXAI en open source pour Grok : l'agent Rust, l'interface TUI et les outils derrière son CLI de code

Elon Musk et sa société xAI ont mis en open source Grok Build, l'agent de codage IA en ligne de commande qui alimente leur outil grok CLI. Le code source a été publié aujourd'hui sur GitHub sous licence Apache 2.0, couvrant l'ensemble de l'infrastructure : le moteur de l'agent, l'interface terminal (TUI), le shell en ligne de commande et les outils de développement associés. Grok Build avait été lancé en version bêta le 25 mai 2026. Il s'agit d'un agent capable de comprendre une base de code, de modifier des fichiers, d'exécuter des commandes shell et de rechercher sur le web, tout en gérant des tâches de longue durée. L'outil fonctionne selon trois modes : une interface terminal interactive en plein écran avec support de la souris, un mode headless pour l'automatisation et l'intégration continue, et une intégration dans les éditeurs de code via l'Agent Client Protocol (ACP). Le dépôt publié s'organise en plusieurs modules (crates) : xai-grok-shell pour le runtime de l'agent, xai-grok-tools pour les implémentations d'outils comme le terminal et l'édition de fichiers, xai-grok-pager pour le rendu de l'interface, et xai-grok-workspace pour la gestion du système de fichiers et du contrôle de version. Cette ouverture change la donne pour les développeurs et les entreprises soucieuses de confidentialité ou de souveraineté technologique. Grok Build peut désormais fonctionner entièrement en local : il suffit de compiler l'outil soi-même, de le connecter à un modèle d'inférence local via un fichier de configuration config.toml, et de s'affranchir complètement des serveurs d'API de xAI. Cette flexibilité ouvre la voie à des déploiements en environnement isolé (air-gapped), à des audits de sécurité approfondis du code avant toute adoption dans un contexte réglementé, ou encore à la création de forks internes adaptés aux besoins spécifiques d'une entreprise, la licence Apache 2.0 le permettant explicitement. En revanche, contrairement à des projets comme Codex CLI d'OpenAI, xAI n'accepte pas les contributions externes (pull requests) sur ce dépôt, ce qui limite son évolution à une gouvernance interne. Cette annonce s'inscrit dans une compétition croissante autour des agents de codage en ligne de commande, un segment où s'affrontent déjà Codex CLI d'OpenAI (également sous licence Apache 2.0, mais limité aux modèles OpenAI), le projet communautaire OpenCode sous licence MIT compatible avec plus de 75 fournisseurs de modèles, et Claude Code d'Anthropic, qui reste propriétaire et fermé aux forks. En rendant son harnais d'agent public tout en conservant le contrôle des contributions, xAI cherche à séduire les développeurs et entreprises en quête de transparence et de personnalisation, sans pour autant renoncer à la maîtrise de sa feuille de route technique. La bataille se joue désormais autant sur l'ouverture du code que sur le choix des modèles compatibles, un terrain où Grok Build se distingue par sa flexibilité totale de configuration.

UELa possibilité de déploiement local intéresse les entreprises européennes soucieuses de souveraineté technologique, mais aucune entreprise ou réglementation française n'est directement concernée.

💬 xAI ouvre le code mais ferme la porte aux contributions, et c'est ça la vraie nouvelle : un open source à sens unique, où tu peux auditer et forker Grok Build, mais jamais peser sur sa feuille de route. Pour les boîtes qui veulent tourner en local, voire en air-gapped, c'est du concret, pas du marketing de circonstance. Reste que la gouvernance, elle, ne bouge pas d'un pouce, xAI garde la main sur tout.

OutilsOutil
1 source
Google met à jour Android Bench avec de nouveaux LLM, mais Gemini reste à la traîne
1303Ars Technica AI 

Google met à jour Android Bench avec de nouveaux LLM, mais Gemini reste à la traîne

Google a mis à jour Android Bench, son benchmark dédié à l'évaluation des grands modèles de langage sur des tâches de développement Android, lancé en mars. La nouvelle version intègre huit modèles supplémentaires parmi les plus récents du marché : Claude Fable 5, Claude Sonnet 5 et Claude Opus 4.8 d'Anthropic, GLM 5.2, Kimi K2.7 Code, MiniMax M3, ainsi que Qwen 3.7 Plus et Qwen 3.7 Max. Le classement repose sur une suite de 100 tâches de développement Android et adopte désormais un nouveau cadre de test présenté comme plus simple à utiliser. Google a également ajouté de nouvelles métriques, notamment le coût et l'efficacité des modèles, en plus d'intégrer des modèles à poids ouverts, qui n'étaient pas couverts jusqu'ici. Ce type de benchmark répond à un besoin concret pour les développeurs Android : la génération de code par IA s'est imposée comme l'un des usages les plus populaires des LLM, mais tous les modèles ne se valent pas selon les tâches. Distinguer les suggestions réellement utiles des résultats approximatifs suppose de savoir quel outil choisir pour quel contexte. En publiant des résultats comparatifs sur le coût, l'efficacité et la qualité du code produit, Google donne aux équipes de développement des repères concrets pour arbitrer entre les différents modèles disponibles, plutôt que de se fier uniquement à la réputation générale d'un LLM. Cette mise à jour s'inscrit dans une compétition de plus en plus dense entre fournisseurs de modèles, où Anthropic, la Chine avec GLM, Kimi et Qwen, et d'autres acteurs multiplient les versions spécialisées pour le code. Google invite désormais les développeurs à exécuter eux-mêmes ces tests sur leurs propres projets et à transmettre leurs retours, dans l'idée de faire évoluer Android Bench de façon continue. Reste à voir comment les modèles propres à Google, notamment Gemini, se positionneront face à cette concurrence croissante dans les prochaines itérations du benchmark.

LLMsOutil
1 source
Microsoft lance « Frontier Company », 2,5 milliards de dollars pour intégrer 6 000 ingénieurs IA chez ses clients
1304The Decoder 

Microsoft lance « Frontier Company », 2,5 milliards de dollars pour intégrer 6 000 ingénieurs IA chez ses clients

Microsoft a annoncé un investissement de 2,5 milliards de dollars pour lancer une nouvelle entité baptisée "Frontier Company", chargée de déployer 6 000 ingénieurs directement chez ses clients entreprises. Contrairement aux équipes de conseil classiques qui interviennent ponctuellement, ces ingénieurs seront intégrés en continu au sein des organisations clientes pour piloter l'adoption de l'intelligence artificielle dans leurs processus métier. L'objectif affiché n'est plus l'expérimentation à petite échelle, mais l'intégration de l'IA dans les rouages centraux des entreprises, avec des résultats mesurables en termes de retour sur investissement. Cette initiative marque un changement de stratégie important pour Microsoft, qui cherche à se positionner comme une plateforme neutre plutôt que comme un simple fournisseur de modèles. Cela la distingue d'OpenAI et d'Anthropic, qui poussent leurs propres modèles via leurs propres structures de déploiement et de conseil. Pour les grandes entreprises, cela signifie potentiellement un accompagnement plus profond et moins lié à un modèle d'IA en particulier, avec un accès facilité à l'écosystème Azure et aux outils Microsoft déjà largement utilisés dans le monde professionnel. Cette annonce s'inscrit dans une compétition de plus en plus féroce entre les géants de la tech pour capter la valeur générée par l'IA en entreprise, un marché jugé bien plus lucratif que celui des consommateurs individuels. En misant sur une armée d'ingénieurs déployés sur le terrain plutôt que sur la seule puissance de ses modèles, Microsoft parie sur l'exécution et l'intégration comme avantage concurrentiel face à des rivaux qui misent davantage sur la performance brute de leurs technologies.

BusinessActu
1 source
L'IA ne deviendra un vrai collègue que lorsqu'elle finira les tâches au lieu de se contenter de répondre
1305The Decoder 

L'IA ne deviendra un vrai collègue que lorsqu'elle finira les tâches au lieu de se contenter de répondre

Une équipe de chercheurs de Tencent et de plusieurs universités chinoises a publié un article de synthèse qui cartographie la trajectoire des systèmes d'intelligence artificielle vers ce qu'ils appellent le "collègue numérique". Leur constat central : les assistants IA actuels restent fondamentalement limités parce qu'ils répondent à des questions plutôt qu'ils ne terminent des tâches. Pour franchir ce seuil, deux conditions sont nécessaires : des environnements de travail persistants, dans lesquels l'agent conserve un état entre deux interactions, et des compétences réutilisables, c'est-à-dire des séquences d'actions que le système peut mobiliser sans les réapprendre à chaque fois. L'enjeu est considérable pour les entreprises qui misent sur l'automatisation. Un agent capable uniquement de générer du texte reste un outil consultatif. Un agent qui peut ouvrir un fichier, modifier une base de données, envoyer un e-mail et vérifier le résultat le lendemain est un exécutant autonome. Cette distinction change radicalement le périmètre de ce que l'IA peut remplacer ou augmenter dans les environnements professionnels réels. Ce travail s'inscrit dans une vague de recherche sur les agents IA dits "long-horizon", capables de maintenir un objectif sur plusieurs étapes et plusieurs sessions. Des laboratoires comme Google DeepMind, Anthropic et OpenAI travaillent sur des architectures similaires, mais la feuille de route proposée ici par Tencent offre un cadre structuré pour évaluer la maturité de ces systèmes. La course au "vrai" agent de travail est désormais l'un des fronts les plus disputés de l'IA appliquée.

UECette feuille de route proposée par Tencent pour évaluer la maturité des agents IA peut servir de référence aux entreprises françaises et européennes qui investissent dans l'automatisation par agents.

💬 Ce qui distingue un outil d'un collègue, c'est la mémoire entre deux sessions et la capacité à finir ce qu'il commence. Tencent le formule enfin clairement, et ça fait du bien d'avoir un cadre structuré pour évaluer ce qu'on appelle un peu trop vite "agent". Reste à voir si ça tient hors conditions de labo.

RecherchePaper
1 source
MiniMax Sparse Attention (MSA) : attention block-sparse à deux branches pour un MoE de 109 milliards de paramètres
1306MarkTechPost 

MiniMax Sparse Attention (MSA) : attention block-sparse à deux branches pour un MoE de 109 milliards de paramètres

MiniMax a publié MSA (MiniMax Sparse Attention), une nouvelle méthode d'attention parcimonieuse construite sur la base de l'architecture Grouped Query Attention (GQA). L'équipe de recherche l'a intégrée et testée dans un modèle Mixture-of-Experts de 109 milliards de paramètres, entraîné sur un budget de 3 000 milliards de tokens avec des données multimodales natives. Le résultat concret est MiniMax-M3, un modèle de production désormais disponible, accompagné d'un noyau d'inférence publié en open source. Le principe de MSA repose sur deux étapes : une branche Index qui sélectionne les blocs de tokens clé-valeur pertinents pour chaque requête, et une branche Principale qui applique l'attention softmax exacte uniquement sur ces blocs sélectionnés. Chaque requête consulte 16 blocs de 128 tokens, soit un budget fixe de 2 048 tokens clé-valeur, quelle que soit la longueur du contexte. Un noyau optimisé rend cette sélection 5,1 fois plus rapide que torch.topk à 128 000 tokens de contexte, et 3,7 fois plus rapide que le noyau radix-select de TileLang. L'enjeu technique est direct : l'attention standard en softmax a un coût quadratique par rapport à la longueur du contexte, ce qui signifie que doubler la fenêtre de contexte quadruple le coût de calcul. MSA court-circuite ce problème en fixant le coût par requête à O(kBk), indépendamment de la taille du contexte, là où l'attention GQA dense maintient un coût en O(N). Pour les modèles qui traitent des documents longs, du code étendu ou des corpus multimodaux, cela représente un gain concret en vitesse et en coût d'inférence. La méthode préserve par construction le contexte local immédiat de chaque requête, un bloc local étant toujours inclus dans la sélection, tout en permettant aux différents groupes d'attention de couvrir des régions éloignées du contexte de manière indépendante. La course aux longues fenêtres de contexte est l'un des fronts les plus actifs du développement des grands modèles de langage en 2025 et 2026. Plusieurs laboratoires, dont Anthropic, Google DeepMind et Meta, ont publié des travaux sur des architectures d'attention efficaces pour dépasser les 100 000 tokens. MiniMax, entreprise chinoise fondée en 2021 et valorisée à plusieurs milliards de dollars, s'impose ici avec une approche originale : plutôt que de remplacer l'attention, MSA la raffine de l'intérieur en greffant la sélection parcimonieuse sur GQA sans modifier l'architecture principale. Deux modes d'entraînement sont proposés, soit un départ depuis zéro (MSA-PT, après 40 milliards de tokens de préchauffage), soit une conversion d'un checkpoint dense entraîné sur 2 600 milliards de tokens (MSA-CPT, suivi de 400 milliards de tokens supplémentaires), ce qui facilite l'adoption par des équipes disposant déjà de modèles en production.

RecherchePaper
1 source
Google Gemini rencontre de gros problèmes, que se passe-t-il vraiment ?
1307Le Big Data 

Google Gemini rencontre de gros problèmes, que se passe-t-il vraiment ?

Le 10 juin 2026, Google Gemini a été frappé par une panne significative touchant des milliers d'utilisateurs aux États-Unis et au Royaume-Uni. Les premières difficultés ont été signalées à partir de 6h11 heure de l'Est (11h11 GMT), avec une montée rapide des remontées sur Downdetector : environ 480 signalements côté américain et 440 côté britannique en quelques heures. Les utilisateurs se heurtent à deux codes d'erreur spécifiques, 1076 et 1099, aussi bien sur l'interface web que sur l'application mobile. Le premier semble lié à un problème de session ou de communication avec la conversation en cours, le second pointe vers une défaillance côté serveur. La panne touche indistinctement les comptes Google Workspace et les comptes grand public, ce qui exclut une simple limite de quota individuel. L'impact est concret pour tous ceux qui utilisent Gemini dans leur workflow quotidien : rédaction d'emails, préparation de briefs, assistance à des réunions ou aide aux devoirs. Ce qui aggrave la situation, c'est le décalage flagrant entre l'expérience vécue par les utilisateurs et la communication officielle de Google : la page de statut des services affiche toujours un fonctionnement normal, tandis que l'outil renvoie des erreurs à chaque nouvelle invite. Certains utilisateurs signalent qu'une deuxième tentative immédiate peut parfois fonctionner, mais ce contournement reste aléatoire et inutilisable en production. L'absence de reconnaissance officielle laisse les utilisateurs sans visibilité sur la durée et la cause de l'incident. Cette panne survient dans un contexte de concurrence extrêmement tendue entre les grands acteurs de l'IA générative. Google positionne Gemini comme son produit phare face à ChatGPT d'OpenAI et Claude d'Anthropic, et l'intègre progressivement dans l'ensemble de ses services professionnels et grand public. Une indisponibilité non communiquée, même partielle, érode la confiance des entreprises qui envisagent de s'appuyer sur ces outils dans des contextes critiques. Google n'avait toujours pas publié d'explication ni reconnu officiellement un incident global au moment des premiers constats. La situation devrait se clarifier dans les heures suivantes selon l'évolution du volume de signalements et une éventuelle communication de l'entreprise.

UELes utilisateurs français et européens de Gemini peuvent être affectés par cette panne, qui compromet la fiabilité de l'outil pour les usages professionnels quotidiens.

OutilsActu
1 source
Moonshot AI vise une valorisation de 30 milliards de dollars avec une nouvelle levée de fonds
1308Le Big Data 

Moonshot AI vise une valorisation de 30 milliards de dollars avec une nouvelle levée de fonds

Moonshot AI, la startup chinoise à l'origine du chatbot Kimi, mène des discussions préliminaires avec des investisseurs en vue de lever jusqu'à 2 milliards de dollars supplémentaires. Si cette opération aboutit, sa valorisation atteindrait 30 milliards de dollars, contre un peu plus de 4 milliards fin 2025. La société a déjà bouclé récemment un tour mené par la plateforme Meituan valorisant l'entreprise à 20 milliards de dollars. Fondée par Yang Zhilin, ancien chercheur passé par Google, Meta et l'université Tsinghua, Moonshot AI a franchi en avril 2026 la barre des 200 millions de dollars de chiffre d'affaires annuel récurrent (ARR), un seuil symbolique qui témoigne de sa capacité à générer des revenus stables. Son catalogue s'est enrichi avec Kimi Work, un agent IA polyvalent basé sur la série de modèles K2.6, commercialisé auprès des particuliers comme des entreprises. Ces performances commerciales expliquent l'attractivité de Moonshot AI aux yeux des investisseurs. Là où de nombreux acteurs de l'IA peinent à convertir leurs prouesses techniques en revenus récurrents, Moonshot AI démontre une capacité concrète à monétiser ses modèles auprès de segments de clientèle variés, des abonnements grand public jusqu'aux déploiements en entreprise. L'ARR est l'un des indicateurs les plus scrutés dans le secteur technologique car il permet d'évaluer la solidité financière sur le long terme, et dépasser les 200 millions de dollars représente un signal fort pour les investisseurs qui cherchent à miser sur des acteurs capables de rivaliser avec les géants occidentaux comme OpenAI ou Anthropic. Moonshot AI prépare par ailleurs une étape structurante : une introduction en Bourse à Hong Kong. Pour y parvenir, la société est en train de réorganiser sa gouvernance et de démanteler sa structure offshore historique, sous la pression accrue des autorités chinoises sur les cotations à l'étranger. Afin de préserver l'accès aux financements libellés en dollars, l'entreprise envisagerait la mise en place d'une structure de coentreprise. Ce montage illustre le défi central auquel font face les scale-ups technologiques chinoises aujourd'hui : concilier des exigences réglementaires nationales de plus en plus strictes avec la nécessité d'attirer des capitaux internationaux. La réussite de cette double équation pourrait faire de Moonshot AI un modèle de référence pour l'ensemble de l'écosystème IA chinois, à un moment où la compétition mondiale pour la domination de l'intelligence artificielle s'intensifie sur tous les fronts.

UELa montée en puissance de Moonshot AI renforce la compétition mondiale en IA et pourrait influencer les stratégies d'investissement et de positionnement des acteurs européens du secteur.

BusinessActu
1 source
Pourquoi les stablecoins pourraient devenir la monnaie native des agents IA
1309FrenchWeb 

Pourquoi les stablecoins pourraient devenir la monnaie native des agents IA

L'essor des agents d'intelligence artificielle autonomes soulève une question concrète que l'économie numérique n'avait jamais eu à résoudre : comment un logiciel peut-il payer un autre logiciel, en temps réel, sans intervention humaine ? Cette problématique, encore théorique il y a trois ans, est désormais au centre des discussions dans les écosystèmes tech et crypto. Les stablecoins, ces cryptomonnaies indexées sur des devises stables comme le dollar, s'imposent comme la réponse la plus sérieuse pour permettre ces transactions machine-à-machine à grande échelle. L'infrastructure bancaire traditionnelle, conçue pour des humains dotés d'une identité légale, est structurellement inadaptée aux besoins des agents IA : délais de règlement incompatibles avec des traitements en millisecondes, exigences KYC inapplicables à un logiciel, montants minimaux de transaction prohibitifs pour des micropaiements de fractions de centimes. Les stablecoins, en revanche, fonctionnent nativement sur des blockchains programmables, permettant des transferts instantanés et quasi-gratuits entre systèmes autonomes, sans intermédiaire humain ni compte bancaire requis. Cette convergence s'inscrit dans l'accélération du mouvement dit "agentic AI", porté activement par Anthropic, OpenAI et Google, dont les agents auront bientôt besoin d'accéder à des API tierces, des services cloud ou d'autres agents spécialisés contre paiement. Les émetteurs de stablecoins comme Circle (USDC) et Tether (USDT) perçoivent ce marché comme un vecteur de croissance considérable, d'autant que la régulation américaine clarifie progressivement le cadre légal de ces instruments, renforçant leur légitimité pour des usages institutionnels et automatisés.

UELe règlement MiCA, déjà en vigueur dans l'UE, encadre les stablecoins comme l'USDC et pourrait faciliter leur adoption par les entreprises européennes développant des agents IA autonomes.

OutilsOpinion
1 source
ChatGPT se verrouille contre les cyberattaques : ce nouveau mode va mieux protéger vos données, comment l’activer ?
131001net 

ChatGPT se verrouille contre les cyberattaques : ce nouveau mode va mieux protéger vos données, comment l’activer ?

OpenAI a déployé une nouvelle fonctionnalité de sécurité baptisée "Lockdown Mode" pour ChatGPT, disponible sur l'ensemble des abonnements, du niveau gratuit jusqu'aux offres payantes. Ce mode verrouillé désactive délibérément plusieurs capacités natives du chatbot, notamment la navigation web en temps réel, afin de réduire la surface d'attaque exposée aux cybermenaces. L'activation se fait en quelques clics depuis les paramètres de l'application, sans nécessiter de configuration technique avancée. La cible principale de cette fonctionnalité est le monde professionnel : avocats, consultants, journalistes ou tout employé amené à traiter des informations sensibles ou confidentielles via ChatGPT. Le mode répond spécifiquement aux attaques par injection de requêtes, une technique où du contenu malveillant intégré dans un document ou une page web tente de détourner les instructions données au modèle pour exfiltrer des données ou manipuler les réponses. En coupant l'accès aux sources externes, OpenAI supprime le vecteur d'attaque le plus courant. Les attaques par prompt injection ont fortement progressé depuis la démocratisation des agents IA capables de naviguer sur le web et d'exécuter des actions autonomes, poussant plusieurs chercheurs en sécurité à alerter les éditeurs. OpenAI s'inscrit ainsi dans une tendance plus large du secteur, après que Microsoft et Anthropic ont également renforcé les garde-fous de leurs propres assistants. Le Lockdown Mode représente un compromis assumé entre sécurité et fonctionnalité, laissant à l'utilisateur le choix du niveau de protection selon son contexte d'usage.

UELes professionnels français (avocats, journalistes, consultants) manipulant des données sensibles via ChatGPT peuvent désormais activer ce mode pour réduire leur exposition aux attaques par injection de requêtes.

SécuritéActu
1 source
L'IA à base d'agents a résolu le code, et mis à nu tous les autres problèmes du génie logiciel
1311VentureBeat AI 

L'IA à base d'agents a résolu le code, et mis à nu tous les autres problèmes du génie logiciel

L'intelligence artificielle agentique a résolu le problème de l'écriture du code, mais ce faisant, elle a mis en lumière tous les autres goulots d'étranglement du génie logiciel. Les équipes d'ingénierie génèrent aujourd'hui plus de code que jamais grâce aux agents IA, mais les dirigeants d'entreprise posent une question de plus en plus pressante : si le rythme de livraison s'est accéléré, pourquoi les produits ne s'améliorent-ils pas à la même cadence ? La réponse est que l'écriture du code n'a jamais été le facteur limitant. Ce qui ralentit les organisations, c'est la définition des bonnes exigences, l'intégration avec des systèmes complexes, et la maintenance en conditions réelles. Quand les agents inondent une organisation de nouveau code, ces difficultés structurelles s'amplifient. La revue humaine du code généré par IA est en train de devenir un énorme nouveau bottleneck, et les ingénieurs perdent le contexte nécessaire pour détecter les erreurs des agents. Des coûts incontrôlés émergent aussi : Uber a épuisé son budget IA 2026 dès le mois d'avril, et selon Axios, une entreprise anonyme a reçu une facture Anthropic de 500 millions de dollars en un seul mois à cause de boucles agentiques incontrôlées. Ces dérives ont des conséquences concrètes sur les organisations. Les entreprises qui n'anticipent pas ces dynamiques risquent de tirer une conclusion simpliste et destructrice : réduire les effectifs tout en augmentant les dépenses IA. Celles qui raisonnent de manière délibérée créeront au contraire de nouveaux rôles adaptés à cette réalité. La différence tient à une gouvernance claire : traiter les configurations d'agents comme de l'infrastructure de production, versionner et tester les prompts avant déploiement, et surtout ne jamais accorder à un agent les mêmes droits d'accès qu'à un ingénieur humain. Ces derniers disposent d'un jugement contextuel et assument une responsabilité directe, un agent qui hérite de leurs permissions sans garde-fous introduit un angle mort d'accountability dans les systèmes critiques. Cette situation s'inscrit dans une transition plus large : l'IA passe de l'assistance à l'exécution autonome, et les modèles économiques comme les pratiques de sécurité n'ont pas encore rattrapé ce changement. Sur le plan technique, la réponse passe par une stratégie multi-modèles et multi-fournisseurs, aucun modèle n'excelle sur toutes les tâches, et se concentrer sur un seul vendeur crée un point de défaillance unique inacceptable pour une fonction aussi critique que l'ingénierie. La priorité doit aller aux modèles frontier les plus performants plutôt qu'aux moins chers en coût par token, car c'est la qualité du résultat qui détermine le coût réel en minimisant les retravaux coûteux. Les métriques traditionnelles, lignes de code, pull requests, déploiements, ne mesurent plus rien d'utile dans ce nouveau contexte.

💬 Personne ne voulait l'entendre, mais écrire du code n'a jamais été le vrai goulot. Les agents ont prouvé ça à coup de factures à 500 millions et de budgets grillés en avril pour l'année entière. Ce qui ralentit encore, c'est comprendre ce qu'on construit et intégrer les vieilles briques, et là, aucun agent ne te sauve si t'as pas mis les garde-fous.

SociétéOpinion
1 source
xAI aurait entraîné ses modèles de code sur les réponses de Claude pendant des mois, avant d'en perdre l'accès
1312The Decoder 

xAI aurait entraîné ses modèles de code sur les réponses de Claude pendant des mois, avant d'en perdre l'accès

La startup d'Elon Musk, xAI, a utilisé les sorties du modèle Claude d'Anthropic pour entraîner ses propres modèles de codage pendant plusieurs mois, selon The Decoder. Lorsqu'Anthropic a coupé l'accès de xAI à ses API, l'entreprise n'a pas arrêté : elle a contourné l'interdiction via des comptes privés et le service tiers Blackbox AI, poursuivant l'entraînement de manière clandestine. En parallèle, l'équipe de pré-entraînement de xAI s'est effondrée à moins de cinq personnes, et plusieurs responsables clés ont démissionné. Cette pratique constitue une violation des conditions d'utilisation d'Anthropic, qui interdit explicitement l'utilisation de ses sorties pour entraîner des modèles concurrents. Elle révèle aussi la pression intense dans la course aux modèles de codage, un segment stratégique où Cursor, GitHub Copilot et d'autres outils se disputent des centaines de millions de dollars de revenus. Utiliser le modèle d'un concurrent comme source d'entraînement permet de raccourcir drastiquement les délais et les coûts de développement. La situation interne chez xAI semble structurellement fragile : les infrastructures GPU massives achetées par Musk sont désormais louées en partie à Anthropic et à Google, faute de capacité d'utilisation interne. Ce retournement de situation, financer indirectement ses concurrents directs avec ses propres serveurs, illustre les difficultés d'une organisation qui peine à structurer ses ressources autour d'une feuille de route cohérente. Grok, le modèle phare de xAI, cherche encore à s'imposer durablement face à GPT-4o et Gemini.

💬 Voler les sorties de Claude pour entraîner tes modèles, et simultanément louer tes GPU à Anthropic, c'est un niveau d'absurde qui dépasse la fiction. La vraie info c'est l'équipe pré-entraînement réduite à cinq personnes: xAI a les infrastructures mais pas l'organisation pour s'en servir. Grok court après GPT-4o avec les notes de cours de Claude dans la poche.

ÉthiqueActu
1 source
L’IA de Meta censée tout changer sera en retard et c’est à cause de ChatGPT
1313Le Big Data 

L’IA de Meta censée tout changer sera en retard et c’est à cause de ChatGPT

Le prochain grand modèle d'intelligence artificielle de Meta, connu en interne sous le nom de « Muse Spark », accuserait des retards répétés avant son déploiement dans les applications du groupe. C'est ce que révèle le Wall Street Journal, qui indique que le lancement a été repoussé à plusieurs reprises. Initialement conçu comme un système multimodal de pointe, Muse Spark devait être capable de traiter simultanément du texte, des images, du raisonnement complexe et des interactions avancées au sein des plateformes Meta. Le groupe prévoyait également de l'ouvrir aux développeurs externes afin qu'ils puissent construire leurs propres services à partir de ce socle technologique. Mark Zuckerberg lui-même en avait fait l'une des priorités stratégiques absolues de l'entreprise, justifiant des investissements de plusieurs dizaines de milliards de dollars dans les centres de données, les infrastructures et les puces spécialisées. Ces retards révèlent la difficulté croissante pour Meta de tenir le rythme face à une concurrence qui ne ralentit pas. En interne, des responsables estiment que Muse Spark demeure en retrait sur plusieurs critères essentiels, notamment la qualité du raisonnement et la stabilité des résultats. Ce n'est pas qu'une question de performances techniques : c'est surtout la capacité du modèle à rivaliser frontalement avec ChatGPT d'OpenAI, Gemini de Google et Claude d'Anthropic qui pose problème. Pour un groupe dont les applications touchent plus de trois milliards d'utilisateurs, lancer un modèle perçu comme inférieur aux alternatives disponibles pourrait nuire à la crédibilité de Meta dans la course à l'IA et freiner l'adoption auprès des développeurs. Ce retard s'inscrit dans une dynamique de marché particulièrement tendue. OpenAI poursuit l'expansion de l'écosystème ChatGPT, Google accélère l'intégration de Gemini dans Android et Workspace, et Anthropic gagne progressivement du terrain dans les entreprises. Meta, malgré des ressources financières considérables, paie le prix d'une compétition qui s'est durcie bien plus vite qu'anticipé. Le groupe avait misé sur une fenêtre d'opportunité pour s'imposer avec un modèle souverain, intégré nativement dans ses plateformes sociales et ouvert à l'écosystème tiers. Si Muse Spark continue à prendre du retard, Meta risque de se retrouver à lancer un modèle dans un paysage où les positions dominantes seront déjà consolidées, rendant la tâche encore plus ardue pour rattraper les leaders actuels.

UELes développeurs européens qui anticipaient l'ouverture de l'API Muse Spark pour construire leurs services devront patienter davantage, sans impact réglementaire ou économique direct pour la France/UE.

LLMsActu
1 source
Le cofondateur milliardaire de Databricks et Perplexity incite les chercheurs en IA à éviter les géants de la tech
1314The Information AI 

Le cofondateur milliardaire de Databricks et Perplexity incite les chercheurs en IA à éviter les géants de la tech

Andy Konwinski, co-fondateur milliardaire de Databricks et de Perplexity AI, mène depuis plusieurs mois une campagne active pour convaincre les chercheurs en intelligence artificielle de ne pas rejoindre les grandes entreprises technologiques. Il a exposé sa vision lors de la conférence AI de l'Association for Computing Machinery à San Jose, plaidant pour que les académiques continuent à publier leurs travaux en accès libre plutôt que de rejoindre des laboratoires privés qui gardent leurs avancées secrètes. Son appel intervient dans un contexte de fermeture croissante de l'écosystème de recherche en IA. Un rapport de Stanford publié en 2026 a documenté qu'OpenAI, Anthropic et Google ne divulguent désormais plus les détails sur les logiciels utilisés pour entraîner leurs modèles, la puissance de calcul mobilisée, ni la taille de leurs jeux de données, des informations pourtant essentielles pour que d'autres chercheurs puissent reproduire et améliorer ces résultats. Cette opacité croissante prive la communauté scientifique mondiale des briques de connaissance nécessaires pour progresser collectivement. Pour Konwinski, l'enjeu dépasse la simple compétition industrielle : "Il existe de nombreuses raisons, fondamentales, sociétales, pour défendre la démocratie, qui font que la recherche ouverte doit survivre." Ce débat s'inscrit dans une tension structurelle entre academia et industrie qui s'est considérablement accentuée avec la montée en puissance des grands modèles de langage. Le tournant illustratif reste le célèbre article de recherche publié par Google en 2017, le papier "Attention Is All You Need" sur l'architecture Transformer, qui est devenu la base de pratiquement tous les modèles et chatbots d'IA modernes. Ce travail, rendu public à l'époque, a permis à l'ensemble de l'industrie d'avancer. La question qui se pose aujourd'hui est de savoir si un tel partage serait encore possible dans un environnement où la recherche est devenue un avantage concurrentiel jalousement protégé.

UELa fermeture progressive de la recherche IA par OpenAI, Anthropic et Google fragilise les exigences de transparence et d'auditabilité portées par l'AI Act européen.

RecherchePaper
1 source
Dépasser l'IA informelle, par Carina Hong (Axiom Math)
1315Latent Space 

Dépasser l'IA informelle, par Carina Hong (Axiom Math)

En 2025, Axiom, une startup fondée seulement sept mois plus tôt, a réussi à résoudre les 12 problèmes du Putnam, l'un des concours mathématiques universitaires les plus difficiles au monde, avec un score de 12/12 (8/12 dans le temps imparti). À titre de comparaison, les meilleurs étudiants humains plafonnent autour de 110/120, DeepSeek avait atteint 103/120, et la médiane des participants se situe habituellement à 0 ou 1 point. Carina Hong, PDG d'Axiom, défend une approche radicalement différente de la majorité des laboratoires d'IA : la vérification formelle des preuves mathématiques via le langage Lean, un système qui permet de valider mécaniquement qu'un raisonnement est correct, de la même façon qu'un compilateur vérifie du code. La startup a par ailleurs publié en open source AXLE, une suite d'outils interactifs basés sur Lean pour explorer et manipuler des preuves. Sur le benchmark ProofGen Verina, qui mesure la capacité à générer du code accompagné de sa preuve de correction, Axiom revendique un score de 99 % (187 sur 189). L'enjeu dépasse largement les olympiades mathématiques. En mi-2026, Claude Code d'Anthropic et Codex d'OpenAI dominent le marché du développement logiciel assisté par IA, confirmant le pari d'Anthropic sur le code. Mais Hong estime que la maîtrise du code, aussi impressionnante soit-elle, ne suffit pas à atteindre l'AGI : des lacunes subsistent dans les capacités de raisonnement rigoureux. La vérification formelle offre quelque chose qu'aucune autre approche ne fournit encore : un signal de récompense binaire et fiable pour l'entraînement par renforcement. Plutôt que de s'appuyer sur des heuristiques statistiques comme RLHF ou GRPO, un système peut simplement vérifier si une preuve est valide, exactement comme on compile et teste du code. C'est un avantage considérable pour la qualité et la fiabilité des modèles. Hong illustre sa philosophie par l'exemple de Srinivasa Ramanujan, le mathématicien autodidacte indien dont l'intuition était prodigieuse, mais qui ne formulait pas ses résultats en preuves rigoureuses. Lorsque G.H. Hardy l'a convaincu de formaliser ses démonstrations, Ramanujan a lui-même progressé, car la rigueur l'a forcé à articuler des détails qui ouvrent de nouvelles voies. Surtout, ses preuves sont devenues transmissibles et cumulables : d'autres pouvaient s'appuyer dessus pour aller plus loin. C'est précisément ce que Hong appelle "composer l'intelligence" plutôt que de l'accumuler. Dans un secteur où les grands modèles rivalisent sur des benchmarks de coding et de raisonnement général, Axiom parie que la prochaine frontière se jouera sur la capacité à produire des raisonnements vérifiables de bout en bout, une approche qui pourrait s'avérer décisive à mesure que l'IA s'attaque à des domaines exigeant une fiabilité absolue.

RecherchePaper
1 source
Comment choisir son assistant IA pour maximiser la productivité des développeurs
1316InfoQ AI 

Comment choisir son assistant IA pour maximiser la productivité des développeurs

Sepehr Khosravi, ingénieur senior, a présenté une analyse comparative des outils d'assistance à la programmation basés sur l'intelligence artificielle, en se concentrant notamment sur Cursor et Claude Code. Sa présentation explore des techniques concrètes destinées aux développeurs expérimentés : l'ingénierie de contexte, la définition de règles personnalisées, et les intégrations via le protocole MCP (Model Context Protocol). Il s'appuie sur des benchmarks issus de situations réelles pour évaluer les forces et limites respectives de ces outils. L'enjeu est de taille pour les équipes de développement : ces copilotes IA promettent des gains de productivité significatifs, mais leur adoption non maîtrisée peut mener à une dégradation de la qualité du code. Khosravi propose un cadre stratégique permettant aux ingénieurs de tirer parti de ces outils sans sacrifier la lisibilité, la maintenabilité ou les standards de leur base de code. La question n'est plus de savoir si adopter ces assistants, mais comment le faire intelligemment. Cette réflexion s'inscrit dans un marché des copilotes IA en pleine ébullition, où GitHub Copilot, Cursor, Claude Code et d'autres outils se disputent l'adoption des développeurs professionnels. L'émergence du protocole MCP, porté notamment par Anthropic, ouvre de nouvelles possibilités d'intégration entre les LLM et les environnements de développement. Les choix faits aujourd'hui par les équipes techniques auront des conséquences durables sur leurs pratiques et leur architecture logicielle.

OutilsOutil
1 source
Les nouveaux agents IA de Zip visent à empêcher les équipes financières d'uploader des contrats dans ChatGPT
1317VentureBeat AI 

Les nouveaux agents IA de Zip visent à empêcher les équipes financières d'uploader des contrats dans ChatGPT

Zip, la plateforme d'approvisionnement d'entreprise valorisée à 2,2 milliards de dollars, a présenté lundi deux nouvelles offres lors de son AI Summit à New York, réunissant des représentants d'Anthropic, OpenAI, Datadog et Humana. La première est une suite de cinq "Superagents" capables d'analyser des contrats, de coder des factures et de négocier avec des fournisseurs, entièrement dans le cadre de gouvernance de Zip. La seconde est une implémentation du Model Context Protocol (MCP) qui permet de connecter les données de Zip directement à des assistants IA comme Claude ou ChatGPT, tout en préservant les pistes d'audit et les contrôles de conformité. Ces agents ciblent chacun un goulot d'étranglement précis du cycle d'achat, de la demande initiale jusqu'au paiement. Ces annonces répondent à un problème que les directions achats connaissent mais évitent de mentionner publiquement : leurs équipes utilisent déjà l'IA pour des tâches financières sensibles, mais depuis des comptes personnels non surveillés. Des employés téléchargent des données de dépenses dans Claude, relisent des contrats confidentiels dans ChatGPT ou génèrent des analyses financières internes dans Gemini, sans qu'aucune trace n'existe. Les conséquences juridiques sont réelles : les violations de la loi SOX aux États-Unis peuvent entraîner des amendes allant jusqu'à 25 millions de dollars, des peines de prison pour les dirigeants, voire la radiation en bourse pour les sociétés cotées. "Ce travail se passe déjà, avec ou sans gouvernance", a déclaré Lu Cheng, co-fondateur et directeur technique de Zip. "Même les entreprises qui construisent l'IA elles-mêmes veulent que ce travail soit encadré." Le lancement s'inscrit dans une bataille concurrentielle qui s'intensifie sur le marché de l'IA pour les achats en entreprise. SAP vient de présenter sa vision "Autonomous Enterprise" à la conférence Sapphire 2026, avec plus de 50 assistants Joule spécialisés couvrant finance, chaîne d'approvisionnement et achats. Coupa a de son côté lancé sa plateforme Compose lors de l'Inspire 2026 à Las Vegas en mai. Le cabinet Gartner prédit que 40 % des applications d'entreprise intégreront des agents IA spécialisés d'ici fin 2026, contre moins de 5 % aujourd'hui. Face à ces poids lourds, Zip mise sur son positionnement d'orchestrateur transversal : l'entreprise se connecte à SAP, Coupa, ServiceNow et d'autres outils simultanément, ce qui lui donne une visibilité sur l'ensemble du processus d'achat que les solutions isolées ne peuvent pas offrir. C'est cette position de couche centrale, combinée au contrôle de conformité, que Zip cherche à transformer en avantage décisif.

UELes directions achats européennes font face au même risque de shadow IT financier (contrats et données sensibles uploadés dans des outils IA non encadrés), une problématique accentuée par les obligations RGPD et NIS2 qui imposent une traçabilité stricte des traitements de données personnelles.

OutilsOutil
1 source
Amazon Bedrock AgentCore Gateway étend sa prise en charge du protocole MCP
1318AWS ML Blog 

Amazon Bedrock AgentCore Gateway étend sa prise en charge du protocole MCP

Amazon a annoncé cette semaine une extension significative des capacités d'AgentCore Gateway, son service de passerelle centralisée pour le protocole MCP (Model Context Protocol) au sein d'Amazon Bedrock. Les nouvelles fonctionnalités couvrent notamment la prise en charge étendue des schémas d'outils MCP, l'intégration des primitives MCP prompts et ressources, la découverte dynamique de serveurs MCP à l'exécution, la gestion de sessions pour les interactions temps réel, un mécanisme d'élicitation permettant des demandes d'entrée en cours d'exécution, et un échange de jetons OAuth 2.0 pour l'authentification déléguée. Ces ajouts s'appliquent à un service qui sert déjà de point d'entrée unique entre les serveurs MCP d'une organisation et les clients qui les consomment, en centralisant la gestion des identifiants, l'observabilité et la connectivité sécurisée. L'enjeu est directement opérationnel pour les équipes engineering en entreprise. Sans passerelle centralisée, chaque serveur MCP déployé, qu'il gère les contrats pour l'équipe juridique, les données financières ou les incidents opérationnels, doit gérer indépendamment ses propres mécanismes d'authentification, de contrôle d'accès et de journalisation. Cela multiplie les délais d'approbation, fragmente la visibilité sur l'usage des outils et oblige les équipes sécurité à auditer chaque serveur séparément. AgentCore Gateway réduit ce fardeau en laissant chaque équipe se concentrer sur la logique métier de son serveur MCP, tandis que la passerelle prend en charge tout le reste : agrégation des capacités, politiques d'accès basées sur les ressources, isolation réseau via AWS PrivateLink, logs d'audit centralisés, et guardrails déterministes via AgentCore Policy. MCP, le protocole lancé par Anthropic fin 2024 pour standardiser la façon dont les agents IA interagissent avec des outils et services externes, a rapidement été adopté par les grands acteurs du cloud, dont AWS, Microsoft et Google. Amazon intègre AgentCore Gateway dans son écosystème Bedrock, qui concurrence directement Azure AI et Google Cloud Vertex AI dans la course aux infrastructures d'agents IA en entreprise. La montée en puissance des architectures multi-agents, où plusieurs modèles coopèrent en orchestrant des dizaines d'outils, rend ce type de couche de gouvernance centrale de plus en plus stratégique. Les prochaines étapes probables incluent une intégration plus poussée avec les outils d'identité AWS IAM et une extension du support aux agents tiers via les flux OAuth 2.0 maintenant disponibles dans la passerelle.

InfrastructureOpinion
1 source
Vous manquez vite de messages ? Claude ajoute un nouveau contrôle
1319Le Big Data 

Vous manquez vite de messages ? Claude ajoute un nouveau contrôle

Anthropic vient de déployer une nouvelle fonctionnalité sur Claude baptisée « Effort Control », annoncée fin mai 2026. Elle se matérialise par un bouton positionné directement à côté du sélecteur de modèle dans l'interface du chatbot. L'utilisateur peut désormais choisir entre quatre niveaux d'effort : Low, Medium, High et Max. Plus le niveau est élevé, plus Claude mobilise de ressources pour analyser la demande et produire une réponse détaillée. Le mode Low est activé par défaut, ce qui permet de limiter d'emblée la consommation de crédits. En pratique, une question simple traitée en mode Low ne pèsera pas autant sur le quota qu'une analyse complexe soumise en mode Max. Cette fonctionnalité répond à une frustration bien documentée chez les abonnés de Claude. Le système de limites d'Anthropic fonctionne sur la base de la consommation de ressources computationnelles, et non d'un simple décompte de messages. Résultat : il est quasi impossible de savoir combien d'échanges il reste avant de se retrouver bloqué jusqu'au lendemain. En donnant la main aux utilisateurs sur l'intensité de chaque requête, Anthropic offre un levier concret pour étirer son quota sur la journée. Pour les professionnels qui alternent entre tâches légères (résumés, reformulations) et demandes lourdes (analyse de code, raisonnement complexe), l'économie potentielle est réelle. Les abonnements Pro, Max et Team sont en théorie les premiers bénéficiaires, même si la fonctionnalité touche l'ensemble des formules. La mesure reste néanmoins partielle. Ce que réclamait une large partie de la communauté Claude, c'est un compteur de messages restants transparent, comparable à ce que proposent d'autres services. Anthropic continue de garder le flou sur ses plafonds exacts : les abonnements premium promettent « davantage d'utilisation », sans jamais quantifier précisément ce que cela représente au quotidien. Une jauge de consommation existe dans l'interface, mais le plafond réel demeure difficile à interpréter. Claude se retrouve ainsi dans une position paradoxale : l'utilisateur peut désormais contrôler la vitesse à laquelle il consomme ses ressources, mais sans savoir combien il lui en reste. Dans un contexte où OpenAI et Google DeepMind cherchent eux aussi à affiner la gestion des quotas pour leurs abonnés, cette demi-mesure risque de ne pas suffire à clore le débat sur la transparence des limites d'utilisation chez Anthropic.

OutilsOutil
1 source
OpenAI améliore la lisibilité de GPT-5.5 Instant et retire deux anciens modèles
1320The Decoder 

OpenAI améliore la lisibilité de GPT-5.5 Instant et retire deux anciens modèles

OpenAI vient d'annoncer une mise à jour de GPT-5.5 Instant destinée à produire des réponses plus naturelles et plus lisibles. En parallèle, la société retire la fonctionnalité Canvas de ses modèles les plus récents : les tâches de rédaction et de programmation s'effectueront désormais directement dans l'interface de chat, sans environnement séparé. OpenAI annonce également la fin de deux modèles plus anciens, o3 et GPT-4.5, qui seront définitivement retirés de ChatGPT d'ici août 2026 au plus tard. Ces changements reflètent une stratégie de rationalisation du portefeuille de modèles d'OpenAI. Supprimer Canvas au profit d'une expérience intégrée au chat simplifie l'interface pour les utilisateurs tout en concentrant les efforts de développement sur les modèles de nouvelle génération. La retraite d'o3 et de GPT-4.5 signale que la société entend éviter la fragmentation de son offre, qui multipliait les options aux performances et aux coûts variables pour les développeurs comme pour les abonnés. Cette consolidation intervient dans un contexte de forte compétition, où Anthropic, Google et Meta poussent leurs propres familles de modèles à un rythme soutenu. OpenAI cherche à clarifier sa gamme après une période marquée par une prolifération rapide de variantes, o1, o3, GPT-4o, GPT-4.5, GPT-5, parfois difficile à suivre même pour les professionnels. La suppression progressive des modèles anciens laisse présager une architecture plus lisible autour de GPT-5 et de ses déclinaisons directes dans les mois à venir.

UELes développeurs et entreprises européens utilisant l'API OpenAI devront planifier la migration de leurs intégrations basées sur o3 ou GPT-4.5 avant août 2026.

💬 Enfin du ménage. Le catalogue OpenAI était devenu franchement illisible, avec o1, o3, GPT-4o, GPT-4.5 qui se marchaient dessus en termes de positionnement et de coût, sans qu'on comprenne vraiment quoi choisir pour quel usage. La date d'août 2026 pour retirer o3 et GPT-4.5 laisse le temps de planifier les migrations, c'est au moins ça.

LLMsOpinion
1 source
Le code : outil de raisonnement et d'action des agents IA, pas seulement leur production
1321The Decoder 

Le code : outil de raisonnement et d'action des agents IA, pas seulement leur production

Un article de synthèse publié récemment soutient que le véritable goulot d'étranglement dans le développement d'agents IA autonomes n'est pas le modèle de langage lui-même, mais la couche logicielle qui l'entoure. Baptisée "harness", cette infrastructure regroupe les outils externes, la mémoire persistante, les systèmes de test et les mécanismes de contrôle des permissions. C'est elle, selon les auteurs, qui transforme un modèle stateless en agent opérationnel. Le laboratoire chinois Deepseek a déjà tiré les conclusions pratiques de cette thèse en montant à Pékin une équipe dédiée exclusivement au développement du harness, avec une formule qui résume tout : modèle plus harness égal agent IA. Cela repose la question fondamentale de la valeur dans l'écosystème IA. Si le modèle seul ne suffit pas, les entreprises qui maîtrisent l'orchestration logicielle autour du modèle, et non uniquement l'entraînement, détiennent un avantage concurrentiel décisif. Pour les développeurs et les équipes produit, cela signifie que construire des agents performants exige autant d'ingénierie système que de puissance brute en paramètres. Cette vision s'inscrit dans une tendance plus large où les grands laboratoires et startups investissent massivement dans les frameworks agentiques. LangChain, LlamaIndex, ou encore les outils natifs d'Anthropic et OpenAI illustrent cette course à l'infrastructure plutôt qu'au modèle. Le mouvement de Deepseek, qui structure une équipe entière autour du harness plutôt que de simplement scaler les paramètres, pourrait annoncer une réorganisation profonde des priorités dans la course à l'IA agentique.

InfrastructureOpinion
1 source
LangSmith sur AWS pour évaluer les agents LLM avancés
1322AWS ML Blog 

LangSmith sur AWS pour évaluer les agents LLM avancés

AWS et LangChain ont publié conjointement un guide pratique sur l'évaluation des agents IA complexes en production, en s'appuyant sur l'outil LangSmith déployé sur l'infrastructure AWS. Co-rédigé par Karan Singh, directeur des partenariats chez LangChain, ce guide combine les travaux de LangChain et le guide publié par Anthropic sur la démystification des évaluations d'agents. Il présente cinq patterns d'évaluation, une méthode pour construire des tests hors ligne via pytest et LangSmith, ainsi qu'une configuration de monitoring en production. Le cas d'usage central est un agent "texte vers SQL" fonctionnant sur Amazon Bedrock, utilisant le modèle Amazon Nova 2 Lite, un modèle de raisonnement rapide et économique avec une fenêtre de contexte d'un million de tokens, capable de traiter texte, images, vidéos et documents, et bien adapté aux charges de travail agentiques. Le défi posé par l'évaluation des agents IA est fondamentalement différent de celui des LLMs classiques, pour trois raisons majeures : la non-déterminisme (le même agent peut réussir 90 % du temps et échouer dans 10 % des cas), la propagation d'erreurs (une faute à l'étape 3 peut fausser toutes les étapes suivantes, un agent SQL qui identifie mal le schéma construira un JOIN incorrect et produira une réponse erronée), et la créativité des solutions (les modèles frontières trouvent parfois des chemins valides non anticipés par les concepteurs de tests). Pour mesurer la fiabilité réelle, le guide introduit deux métriques clés : pass@k, qui mesure la probabilité d'au moins un succès en k tentatives, et pass^k, qui mesure la probabilité que toutes les k tentatives aboutissent, permettant ainsi de distinguer les agents capables d'improviser de ceux qui produisent des résultats cohérents et reproductibles. Ce guide s'inscrit dans une tendance de fond : à mesure que les agents IA passent des démonstrations aux déploiements réels, l'absence d'outils d'évaluation rigoureuse est devenue l'un des principaux freins à leur adoption industrielle. LangChain, qui développe l'un des frameworks d'orchestration les plus utilisés, et AWS, qui héberge une part croissante des charges de travail IA via Bedrock, se positionnent ensemble sur ce segment critique. LangSmith est disponible sur AWS Marketplace, ce qui simplifie son intégration dans les environnements cloud existants. Cette collaboration reflète une maturité croissante de l'écosystème : après une phase d'enthousiasme autour des agents autonomes, l'industrie se tourne désormais vers les questions de fiabilité, d'observabilité et de gouvernance, conditions indispensables à un déploiement à grande échelle.

OutilsOutil
1 source
Les fournisseurs d'inférence connaissent-ils un essor ?
1323The Information AI 

Les fournisseurs d'inférence connaissent-ils un essor ?

Il y a moins d'un an, les fournisseurs d'inférence spécialisés suscitaient un scepticisme marqué dans l'industrie de l'IA. Des startups comme Fireworks AI, Baseten et Together AI, qui louent des serveurs Nvidia à des développeurs d'applications et les aident à déployer des modèles open source, avaient connu une croissance rapide, mais semblaient fragilisées face à la concurrence des grands fournisseurs cloud. Ces derniers disposent en effet d'un avantage structurel majeur : ils possèdent leurs propres puces, là où les fournisseurs d'inférence doivent d'abord les louer à AWS, Google ou Azure avant de les revendre à leurs clients, ce qui comprime mécaniquement leurs marges brutes. Pourtant, le discours dominant a changé. Ces acteurs spécialisés semblent aujourd'hui trouver leur place dans un écosystème où la demande d'inférence explose, portée par la multiplication des applications IA en production. Leur proposition de valeur, flexibilité, optimisation technique, et support des modèles open source, répond à des besoins que les clouds généralistes satisfont moins bien, notamment pour les équipes cherchant à éviter l'enfermement propriétaire et à contrôler précisément leurs coûts d'inférence. Ce retournement s'inscrit dans une dynamique plus large : avec la prolifération des modèles open source performants comme Llama ou Mistral, les développeurs disposent désormais d'alternatives crédibles aux API propriétaires d'OpenAI ou Anthropic. Les fournisseurs d'inférence se positionnent comme l'infrastructure neutre de ce marché alternatif, pariant sur le fait que la fragmentation des modèles leur garantit une demande structurelle durable face aux géants du cloud.

UELa montée en puissance des fournisseurs d'inférence open source renforce l'écosystème autour de Mistral (entreprise française), offrant aux développeurs européens une infrastructure neutre pour déployer des modèles sans dépendance aux API propriétaires.

InfrastructureOpinion
1 source
Une école voulait filmer des enfants pour entraîner l’IA : les parents pètent les plombs
1324Le Big Data 

Une école voulait filmer des enfants pour entraîner l’IA : les parents pètent les plombs

L'Université de Washington a dû abandonner un projet de recherche après une levée de boucliers de parents d'élèves. L'étude prévoyait d'équiper des enseignants de maternelle de caméras embarquées et d'installer des dispositifs fixes dans les salles de classe, afin de capter les interactions quotidiennes entre professeurs et enfants. Ces enregistrements devaient alimenter des modèles d'intelligence artificielle capables d'analyser la qualité pédagogique des échanges en classe. Le dispositif reposait sur un opt-out qui incluait automatiquement tous les enfants, sauf refus explicite des parents. Selon 404 Media, qui a consulté les documents transmis aux familles, les vidéos pouvaient être traitées via des services d'IA hébergés dans le cloud, sans que les entreprises impliquées ni les modèles utilisés ne soient nommément identifiés. Face aux protestations, l'université a confirmé l'arrêt du programme peu après les premières réactions négatives. Les parents ont soulevé des questions concrètes restées sans réponse satisfaisante : que devenait l'image d'un enfant dont la famille refusait de participer, dans une classe où tous les autres élèves étaient filmés ? Les chercheurs promettaient de masquer visages et noms "dans la mesure du possible", une formulation jugée nettement insuffisante. S'y ajoutaient des problèmes d'accessibilité : de nombreuses familles issues de l'immigration ne parlaient pas anglais, et aucun formulaire traduit n'était disponible. Faith Boninger, codirectrice du National Education Policy Center, a également pointé l'opacité du dispositif, notamment l'absence de réponse claire sur qui pouvait accéder aux données, combien de temps elles seraient conservées, et qui finançait réellement la recherche. Un parent interrogé anonymement par 404 Media résumait l'inquiétude collective : "Je suis troublé par l'idée que l'image de mon enfant soit utilisée dans des outils d'IA inconnus." Cet incident s'inscrit dans un mouvement de fond : l'IA s'impose rapidement dans l'éducation, portée par des investissements massifs d'entreprises comme OpenAI, Anthropic et Microsoft, qui multiplient partenariats universitaires et accès gratuits aux outils génératifs pour les étudiants et enseignants. Mais développer des modèles spécialisés dans l'éducation nécessite des volumes considérables de données réelles, et c'est précisément là que le bât blesse. Les établissements scolaires, qui accueillent des mineurs dans un cadre légalement protégé, deviennent des terrains convoités pour la collecte de données d'entraînement. L'échec du projet de l'Université de Washington illustre la tension croissante entre les besoins de l'industrie IA et les droits fondamentaux des familles, en particulier autour du consentement éclairé. À mesure que ces projets se multiplient, la gouvernance des données issues des environnements scolaires ne peut plus être reléguée en note de bas de page d'un formulaire incompréhensible.

UELe RGPD impose en Europe un consentement explicite pour le traitement des données de mineurs, rendant un dispositif d'opt-out similaire illégal, mais l'incident souligne la vigilance nécessaire face aux projets de recherche en IA dans les établissements scolaires européens.

ÉthiqueOpinion
1 source
Les clés pour décrocher un poste dans un laboratoire d'IA de pointe (en préentraînement)
1325Latent Space 

Les clés pour décrocher un poste dans un laboratoire d'IA de pointe (en préentraînement)

Vlad Feinberg, ingénieur spécialisé dans l'infrastructure TPU chez Google, a publié mi-mai 2026 un guide destiné aux développeurs souhaitant intégrer les grands laboratoires d'IA de pointe. Son conseil central : maîtriser le travail au niveau du noyau (kernel) des modèles de langage. Il s'appuie sur le Scaling Handbook publié l'an dernier par DeepMind, un document qui cartographie les pratiques de préentraînement à grande échelle. Selon Feinberg, le principal goulot d'étranglement de tout projet LLM réside dans la capacité à rendre concrètement exécutables des modifications logiques abstraites, c'est-à-dire à optimiser les calculs au plus bas niveau du code. Il souligne aussi l'importance croissante des langages dédiés (DSL) pour le développement de kernels, et mentionne de façon inattendue les agents autonomes comme AlphaEvolve parmi les compétences désormais valorisées. Son exercice pratique est sans ambiguïté : dériver les lois de Chinchilla, les implémenter depuis zéro en JAX pour des architectures dense et MoE, puis écrire un kernel Pallas capable de surpasser jax.lax.ragged_dot pour les projections MoE en fusionnant les couches up et down, et identifier un contexte où l'accélération du forward pass est mesurable et explicable. Ce type de guide est rare dans un domaine qui recrute souvent via des réseaux opaques. En pointant vers des compétences précises et vérifiables plutôt que vers des diplômes ou des expériences académiques, Feinberg ouvre potentiellement l'accès aux laboratoires de pointe à des profils autodidactes ou venant d'industries connexes. Le travail au niveau kernel, qui consiste à optimiser les calculs matriciels sur GPU ou TPU pour réduire la latence et améliorer l'utilisation de la mémoire, est au coeur de la compétitivité des modèles. C'est aussi une compétence objectivement mesurable : soit le kernel bat le benchmark de référence, soit il ne le bat pas. Feinberg propose même d'inviter ceux qui réussissent l'exercice complet à intervenir comme speakers lors d'ateliers communautaires, signal clair que la démonstration pratique vaut plus qu'un CV. Cette publication intervient dans un contexte d'accélération générale de l'écosystème IA. Anthropic a diffusé la même semaine des bonnes pratiques pour déployer Claude Code sur des monorepos de plusieurs millions de lignes, avec diagnostics de cache de prompts et activation par défaut du mode Fast sur Opus 4.7 pour des workflows à plus faible latence. Cognition a lancé Devin Auto-Triage, un agent "premier répondant" pour les bugs et incidents en production, doté d'une mémoire long terme et capable de générer des pull requests automatiquement. LangChain a présenté LangSmith Engine comme une boucle CI/CD pour agents, détectant automatiquement les défaillances en production. À la veille de Google I/O, moment attendu pour les annonces Gemini, le secteur converge vers des agents persistants en arrière-plan plutôt que vers de simples interfaces conversationnelles, et les ingénieurs capables d'en construire les fondations bas-niveau restent la ressource la plus recherchée.

LLMsTuto
1 source
Construction d'un serveur MCP sécurisé sur AWS pour une plateforme B2B d'un million d'entreprises
1326InfoQ AI 

Construction d'un serveur MCP sécurisé sur AWS pour une plateforme B2B d'un million d'entreprises

Shadi Elyafi, ingénieur logiciel, a publié un retour d'expérience détaillé sur la construction d'un serveur MCP (Model Context Protocol) sécurisé sur AWS, destiné à exposer une plateforme d'intelligence B2B à un client LLM. La plateforme en question agrège les profils de plus d'un million d'entreprises, et l'objectif était de permettre à un utilisateur de formuler des requêtes en langage naturel du type « trouve des entreprises SaaS en Allemagne avec 50 à 200 employés » et d'obtenir des résultats directement dans son interface LLM, sans passer par une API classique. L'enjeu central de ce projet n'était pas fonctionnel mais sécuritaire : comment ouvrir un accès LLM à des données de production sensibles sans créer une passerelle dangereuse ? Un modèle de langage branché directement sur une base de données réelle peut, en théorie, être manipulé pour extraire des données non autorisées, contourner des filtres, ou générer des requêtes destructrices. La conception du serveur MCP devait donc intégrer des garde-fous robustes, une gestion fine des autorisations et une isolation claire entre la logique d'inférence et les données métier. Ce type d'architecture reflète une tendance croissante dans l'industrie : intégrer les outils MCP dans des environnements cloud d'entreprise pour donner aux LLM un accès structuré à des systèmes internes. Anthropic a défini le protocole MCP en fin 2024, et son adoption en contexte B2B s'accélère depuis. Les plateformes de données d'entreprise sont particulièrement concernées, car elles concentrent des informations concurrentielles à haute valeur, ce qui rend la question de la sécurisation de ces ponts LLM-production critique pour toute organisation qui souhaite tirer parti de l'IA générative en production.

OutilsOutil
1 source
Hapag-Lloyd utilise Amazon Bedrock pour transformer les retours clients en informations exploitables
1327AWS ML Blog 

Hapag-Lloyd utilise Amazon Bedrock pour transformer les retours clients en informations exploitables

Hapag-Lloyd, l'un des leaders mondiaux du transport maritime de conteneurs, a déployé une solution d'analyse automatisée des retours clients basée sur Amazon Bedrock, le service d'IA générative d'AWS. L'armateur allemand, qui exploite une flotte de 313 porte-conteneurs représentant 2,5 millions d'EVP de capacité de transport, emploie environ 14 000 personnes dans son segment de lignes régulières et gère plus de 400 bureaux dans 140 pays. Son équipe d'ingénierie produit, répartie entre Hambourg et Gdańsk, pilote cette initiative dans le cadre d'une ambition plus large de devenir une entreprise dite "AI-native". Le système s'appuie sur Amazon Bedrock, LangChain et LangGraph, ainsi qu'Elasticsearch pour collecter les commentaires clients, en extraire le sentiment, identifier des thèmes récurrents et produire des synthèses exploitables. L'enjeu est d'abord opérationnel : avant cette solution, les chefs de produit exportaient manuellement des fichiers CSV toutes les deux semaines, parcouraient des centaines de commentaires et les catégorisaient à la main, un travail qui pouvait mobiliser plusieurs heures, parfois plusieurs jours, avant chaque réunion de revue produit. Désormais, l'ensemble de ce flux est automatisé, de l'ingestion des données à la production d'insights. Les équipes peuvent ainsi se concentrer sur la stratégie et l'innovation plutôt que sur l'analyse répétitive. Pour une entreprise qui relie plus de 600 ports via 133 lignes régulières mondiales et traite un volume massif d'interactions clients, la capacité à lire rapidement les signaux du terrain constitue un avantage concurrentiel direct sur la qualité de service et la réactivité produit. Cette transformation s'inscrit dans une dynamique plus large de l'industrie du shipping, où la digitalisation s'accélère sous la pression de la concurrence et des attentes croissantes des chargeurs. Hapag-Lloyd a construit sa capacité sur une stack technologique qu'il maîtrise en propre, ce qui lui a permis d'itérer rapidement vers des usages d'IA générative sans dépendance contraignante. Le choix d'Amazon Bedrock est également révélateur : le service donne accès via une API unifiée aux modèles d'Anthropic, Meta, Mistral, DeepSeek et d'autres, avec des garanties de sécurité et de confidentialité adaptées aux exigences d'un groupe coté en bourse. À mesure que d'autres armateurs et acteurs logistiques adoptent des approches similaires, la capacité à transformer le feedback client en décisions produit en temps quasi réel pourrait devenir un standard du secteur plutôt qu'un avantage différenciant.

UEHapag-Lloyd, armateur allemand coté en bourse avec ses équipes à Hambourg et Gdańsk, automatise l'analyse de ses retours clients via Amazon Bedrock, signalant l'accélération de l'IA générative dans la logistique maritime européenne.

OutilsOutil
1 source
Amazon Bedrock AgentCore Browser : actions au niveau du système d'exploitation
1328AWS ML Blog 

Amazon Bedrock AgentCore Browser : actions au niveau du système d'exploitation

Amazon a annoncé cette semaine l'ajout des OS Level Actions à AgentCore Browser, son environnement de navigation isolé et sécurisé disponible dans la plateforme Bedrock. Cette nouvelle capacité est accessible via l'API InvokeBrowser sans configuration supplémentaire pour les sessions existantes comme pour les nouvelles. Elle expose huit actions réparties en trois catégories : contrôle de la souris (clics, positionnement), saisie clavier (touches, raccourcis) et capture visuelle (screenshot plein écran en PNG encodé base64). Le principe de fonctionnement repose sur une boucle action-screenshot-réaction : l'agent exécute une action, capture l'état de l'écran, l'envoie à un modèle de vision pour décider de la prochaine étape, et recommence. Chaque appel API transporte une seule action identifiée par son type et ses arguments, et renvoie un statut SUCCESS ou FAILED lié à la session via l'en-tête x-amzn-browser-session-id. Ce lancement répond à une limite structurelle des outils d'automatisation web actuels. Playwright et le Chrome DevTools Protocol (CDP) opèrent exclusivement dans la couche DOM du navigateur : ils ne voient pas, et ne peuvent donc pas interagir avec, tout ce que le système d'exploitation génère en dehors de cette couche. Les boîtes de dialogue natives comme les demandes d'impression (window.print()), les invites de sécurité Windows ou macOS, les sélecteurs de certificats ou encore les menus contextuels sont totalement invisibles pour CDP. Pour les agents dotés de vision, ce blocage était particulièrement frustrant : le modèle pouvait observer précisément ce qu'il fallait faire sur le screenshot, mais n'avait aucun mécanisme pour agir. Les OS Level Actions comblent exactement ce vide en donnant à l'agent un contrôle direct au niveau du bureau complet, pas seulement du contenu web. Cette annonce s'inscrit dans la montée en puissance des agents d'automatisation web déployés en production, où les workflows réels font surface à des états applicatifs imprévisibles que les tests ne reproduisent pas. La couche DOM est suffisante dans la majorité des scénarios, mais les cas limites, configuration OS spécifique, permissions utilisateur, applications hybrides web-natif, se produisent régulièrement à l'échelle. Amazon positionne AgentCore Browser comme une infrastructure complète pour les agents autonomes, capable de gérer aussi bien le web standard que les interfaces natives du système. L'intégration dans Bedrock suggère que cette fonctionnalité sera prochainement exploitée par des agents construits avec d'autres services de la plateforme, notamment les modèles Claude d'Anthropic disponibles via Bedrock, qui disposent déjà de capacités d'utilisation d'outils et de vision avancées.

OutilsOutil
1 source
Les agents IA ratent toutes les discussions de votre équipe. SageOX propose une infrastructure de contexte pour agents autonomes
1329VentureBeat AI 

Les agents IA ratent toutes les discussions de votre équipe. SageOX propose une infrastructure de contexte pour agents autonomes

SageOX, une startup de Seattle fondée par des vétérans ayant construit l'infrastructure originale d'AWS EC2 et EBS, est sortie du mode furtif en annonçant un tour de financement de 15 millions de dollars mené par Canaan, avec la participation d'A.Capital, Pioneer Square Labs et Founders' Co-op. L'entreprise, dirigée par Ajit Banerjee, ancien ingénieur chez Hugging Face, Meta, Amazon et Apple, commercialise ce qu'elle appelle une "infrastructure de contexte agentique" : un système conçu pour garder les agents IA aussi informés que les employés humains sur les décisions, discussions et objectifs d'une équipe. La suite produit repose sur deux composants principaux : l'Ox Dot, un petit appareil physique placé dans les espaces partagés qui enregistre réunions et séances de travail d'une simple pression, et l'Ox CLI, un outil en ligne de commande open source sous licence MIT qui permet aux assistants de codage comme Claude Code ou Codex d'interroger la mémoire collective de l'équipe avant d'écrire du code. Le problème que SageOX cherche à résoudre est celui du "drift" des agents, c'est-à-dire leur tendance à s'écarter des intentions réelles de l'équipe parce qu'ils démarrent chaque tâche sans historique ni contexte. Si une équipe décide en réunion d'utiliser un schéma d'authentification précis, l'agent de codage l'ignorera complètement, sauf si quelqu'un le lui précise explicitement dans chaque prompt. L'Ox Dot capture audio, transcrit et identifie les intervenants, puis distille ces échanges en une mémoire d'équipe accessible aux humains et aux agents. Sa fonctionnalité "Auto Rewind" permet même de capturer rétrospectivement une conversation informelle qui s'est tenue sans enregistrement, évitant la perte de décisions prises lors d'échanges spontanés. La commande ox agent prime intègre ensuite cet historique directement dans le contexte de travail des agents. Le problème de l'"ingénierie du contexte" est l'un des défis majeurs non résolus de l'ère agentique. À mesure que les grands fournisseurs de modèles comme OpenAI, Anthropic ou Google descendent dans la chaîne de valeur en proposant leurs propres agents métier, la question de comment équiper ces agents d'un contexte riche et fidèle à la réalité d'une organisation reste entière. SageOX parie que la réponse n'est pas dans le prompt engineering ou la documentation statique, mais dans une couche d'infrastructure dédiée qui capte le contexte là où il se forme naturellement : conversations, tableaux blancs, standups. Ryan Snodgrass, CTO et ancien d'Amazon, pousse même plus loin en remettant en question les principes classiques de gestion de code source, estimant que les historiques "propres" de commits sont souvent contre-productifs pour les agents. La startup s'attaque ainsi à un marché encore peu balisé, à l'intersection de la collaboration d'équipe et de l'orchestration agentique.

OutilsOutil
1 source
Zyphra présente TSP : stratégie d'entraînement adaptée au matériel offrant un débit 2,6 fois supérieur au TP+SP
1330MarkTechPost 

Zyphra présente TSP : stratégie d'entraînement adaptée au matériel offrant un débit 2,6 fois supérieur au TP+SP

Zyphra a publié une nouvelle technique d'entraînement et d'inférence pour les grands modèles de langage baptisée TSP, pour Tensor and Sequence Parallelism. Testée sur jusqu'à 1 024 GPU AMD MI300X, cette approche affiche un débit 2,6 fois supérieur aux configurations standards combinant parallélisme tensoriel et de séquence, tout en réduisant la mémoire de pointe par GPU sur les deux types de charge de travail, entraînement et inférence. L'idée centrale est ce que Zyphra appelle le "parallelism folding" : plutôt que de répartir les poids du modèle et les tokens de la séquence sur deux axes distincts d'une grille de GPU, TSP combine les deux sur un seul axe de taille D. Résultat : chaque GPU ne détient qu'un D-ième des poids du modèle et qu'un D-ième de la séquence d'entrée, ce qui réduit mécaniquement l'empreinte mémoire par appareil pour les paramètres, les gradients, les états de l'optimiseur et les activations, en un seul mouvement. Cela change concrètement la façon dont les ingénieurs peuvent planifier l'infrastructure pour les très grands modèles. Les deux approches dominantes jusqu'ici avaient chacune un défaut structurel : le parallélisme tensoriel (TP) réduit la mémoire des poids mais génère des communications dont le coût explose avec la longueur des séquences ; le parallélisme de séquence (SP) allège les activations mais laisse les poids entièrement répliqués sur chaque GPU. Combinés sur des axes orthogonaux, ces deux schémas exigent un groupe de T fois Sigma GPU par réplique du modèle, ce qui peut forcer les communications à transiter par des interconnexions inter-nœuds lentes comme InfiniBand, plutôt que par les tissus haute bande passante intra-nœuds comme AMD Infinity Fabric ou NVLink. TSP évite ce surcoût en maintenant tout le groupe sur un axe unique, suffisamment compact pour rester dans les liens rapides. La course aux grands modèles a rendu la gestion de la mémoire GPU aussi critique que les algorithmes eux-mêmes. Les entreprises comme OpenAI, Anthropic, Google ou Meta opèrent des clusters de plusieurs milliers de GPU où chaque point de pourcentage d'efficacité mémoire se traduit directement en coûts d'infrastructure ou en capacité à entraîner des modèles plus grands. Zyphra, startup spécialisée dans l'IA d'entreprise et les architectures hybrides comme Zamba, publie cette technique avec une description technique détaillée, signalant une volonté de peser dans les débats d'infrastructure aux côtés des équipes de recherche système de Google DeepMind, Meta FAIR ou Microsoft. TSP devra maintenant être évalué sur des architectures NVIDIA et des topologies de cluster variées pour confirmer si ses gains se généralisent au-delà des GPU AMD.

InfrastructureOpinion
1 source
Reinforced Agent : retour d'information à l'inférence pour les agents à appel d'outils
1331Apple Machine Learning 

Reinforced Agent : retour d'information à l'inférence pour les agents à appel d'outils

Des chercheurs ont publié une étude acceptée au cinquième atelier sur la génération, l'évaluation et les métriques du langage naturel, dans le cadre de la conférence ACL 2026, portant sur une nouvelle approche appelée Reinforced Agent. Leur travail s'attaque à un problème précis : les agents LLM capables d'appeler des outils externes (API, bases de données, fonctions) sont habituellement évalués sur trois critères, le choix du bon outil, la précision des paramètres transmis, et la reconnaissance du périmètre d'action. Or, ces évaluations interviennent systématiquement après l'exécution, une fois l'erreur déjà commise. L'équipe propose d'intégrer un agent évaluateur spécialisé directement dans la boucle d'exécution, au moment même de l'inférence, pour corriger le tir en temps réel. L'enjeu est considérable pour les systèmes d'agents autonomes en production. Lorsqu'un agent commet une erreur de sélection d'outil ou transmet de mauvais paramètres, les méthodes actuelles ne peuvent que constater le problème après coup, puis corriger via du prompt engineering ou du réentraînement, deux processus lents et coûteux. Un retour d'information en temps réel permettrait de réduire drastiquement les erreurs en cascade, particulièrement critiques dans des environnements où chaque appel d'outil a des effets concrets, comme la modification de données ou le déclenchement de transactions. Cette recherche s'inscrit dans une tendance forte de l'IA en 2025-2026 : faire passer les agents d'une logique réactive à une logique corrective en cours d'exécution. Des acteurs comme Anthropic, OpenAI et Google investissent massivement dans l'architecture multi-agents, où la supervision entre agents devient un levier clé de fiabilité. L'approche Reinforced Agent ouvre la voie à des systèmes capables d'auto-audit dynamique, une brique essentielle pour déployer des agents dans des environnements critiques et à haute responsabilité.

RecherchePaper
1 source
AWS : guide complet pour migrer des LLMs en production d'IA générative
1332AWS ML Blog 

AWS : guide complet pour migrer des LLMs en production d'IA générative

Amazon Web Services a publié un guide technique détaillant un cadre structuré pour migrer des modèles de langage (LLM) en production, baptisé "Generative AI Model Agility Solution". Conçu pour les équipes qui souhaitent passer d'un modèle à un autre, que ce soit entre différentes familles de LLM ou vers une version plus récente du même modèle, le dispositif repose sur trois étapes clés : évaluation du modèle source, migration et optimisation des prompts via Amazon Bedrock Prompt Optimization et l'outil Anthropic Metaprompt, puis évaluation du modèle cible. La durée totale d'une migration en suivant ce cadre varie de deux jours à deux semaines selon la complexité du cas d'usage. AWS met à disposition plusieurs exemples de fonctionnalités et de scénarios concrets pour faciliter la prise en main. La capacité à changer rapidement de modèle est devenue un enjeu stratégique pour les organisations qui déploient de l'IA en production : les performances évoluent vite, les coûts varient fortement d'un fournisseur à l'autre, et rester lié à un seul LLM expose à des risques opérationnels. Ce framework répond à ce problème en automatisant une grande partie du travail de comparaison : il fournit des métriques quantifiables sur le coût, la latence, la précision et la qualité, permettant des décisions fondées sur des données plutôt que sur des impressions. Il prend également en charge les cas où aucune réponse de référence ("ground truth") n'est disponible, en s'appuyant sur des indicateurs comme la pertinence des réponses, leur fidélité au contexte, ou la détection de biais et de contenus toxiques. Le lancement de ce guide s'inscrit dans une compétition intense entre fournisseurs de cloud pour capter les budgets IA des grandes entreprises. Amazon Bedrock, la plateforme d'accès aux LLM managés d'AWS, doit convaincre les organisations qu'elles peuvent migrer vers ses modèles sans friction excessive, notamment face à des concurrents comme Azure OpenAI ou Google Vertex AI. En intégrant nativement l'outil Metaprompt d'Anthropic, AWS mise sur la qualité des prompts comme levier différenciant, une approche cohérente avec les investissements massifs du groupe dans Anthropic. La publication de ce cadre open au niveau méthodologique signale aussi une volonté d'AWS de standardiser les pratiques de migration LLM avant que ce marché ne se fragmente davantage, en positionnant Bedrock comme la plateforme de destination naturelle pour les migrations de production.

OutilsOutil
1 source
Configurer Amazon Bedrock AgentCore Gateway pour un accès sécurisé aux ressources privées
1333AWS ML Blog 

Configurer Amazon Bedrock AgentCore Gateway pour un accès sécurisé aux ressources privées

Amazon a dévoilé une nouvelle fonctionnalité pour son service Bedrock AgentCore Gateway : la connectivité VPC gérée, qui permet aux agents d'intelligence artificielle d'accéder à des ressources privées hébergées derrière des réseaux Amazon Virtual Private Cloud (VPC) sans exposer le trafic sur l'internet public. Concrètement, ce mécanisme repose sur un composant appelé Resource Gateway, qui provisionne automatiquement des interfaces réseau élastiques (ENI) directement à l'intérieur du VPC cible, à raison d'une interface par sous-réseau. Deux modes de fonctionnement sont proposés : le mode managé, où AgentCore prend en charge l'intégralité de l'infrastructure réseau à partir des identifiants VPC, de sous-réseau et des groupes de sécurité fournis par l'utilisateur ; et le mode auto-géré, qui laisse davantage de contrôle à l'équipe technique. Trois scénarios pratiques illustrent ces cas d'usage : la connexion à un endpoint privé Amazon API Gateway, l'intégration avec un serveur MCP (Model Context Protocol) hébergé sur Amazon Elastic Kubernetes Service (EKS), et l'accès à une API REST privée dans un réseau isolé. Pour les équipes qui déploient des agents IA en production, cette capacité représente un gain opérationnel significatif. Jusqu'ici, chaque chemin de connexion entre un agent et un outil interne (base de données, API métier, microservice) nécessitait une configuration réseau manuelle, ralentissant les déploiements et multipliant les risques de mauvais paramétrage. Avec AgentCore Gateway VPC egress, une Resource Configuration délimite précisément l'endpoint accessible, un nom de domaine ou une adresse IP, plutôt que d'ouvrir l'accès à l'ensemble du VPC. La Service Network Resource Association, créée et gérée automatiquement par AgentCore, connecte ensuite cette configuration au réseau de service, ce qui permet à l'agent d'invoquer l'endpoint privé de façon sécurisée et traçable. Pour les organisations avec des architectures multi-VPC ou hybrides, le service s'intègre nativement avec AWS Transit Gateway et le VPC peering inter-régions. Cette annonce s'inscrit dans la stratégie plus large d'Amazon pour rendre ses agents IA exploitables dans des environnements d'entreprise contraints, où la sécurité réseau et la conformité interdisent tout transit par l'internet public. Bedrock AgentCore est la couche d'infrastructure d'Amazon dédiée à l'orchestration et au déploiement d'agents autonomes en production, concurrençant directement les offres de Microsoft Azure AI Foundry et Google Vertex AI Agent Builder. La prise en charge du protocole MCP, standard ouvert porté par Anthropic pour connecter les agents à des outils externes, signale une convergence de l'écosystème autour d'interfaces interopérables. À mesure que les agents IA migrent du prototype vers le système critique, la capacité à les brancher sur des ressources internes sans compromettre le périmètre de sécurité devient un prérequis incontournable pour les DSI, ce qu'Amazon positionne désormais comme une fonctionnalité de première classe.

UELes organisations européennes soumises au RGPD déployant des agents IA peuvent exploiter cette connectivité VPC privée pour maintenir leurs données internes hors de l'internet public, facilitant ainsi la conformité réglementaire.

InfrastructureTuto
1 source
Quand les agents IA se parlent entre eux : la startup Band lance un 'orchestrateur universel
1334VentureBeat AI 

Quand les agents IA se parlent entre eux : la startup Band lance un 'orchestrateur universel

Une nouvelle startup américaine, BAND (également connue sous le nom de Thenvoi AI Ltd.), est sortie de la confidentialité ce mois-ci avec 17 millions de dollars levés en financement Seed pour résoudre l'un des problèmes les plus concrets de l'essor des agents IA : leur incapacité à communiquer entre eux. Fondée par Arick Goomanovsky, la société se positionne comme un "orchestrateur universel", une couche d'infrastructure de communication que ses fondateurs qualifient de "Slack pour agents". Son architecture repose sur deux niveaux : un "agentic mesh" qui permet la découverte et la délégation structurée entre agents, et un plan de contrôle qui assure la gouvernance des permissions en temps réel. Contrairement à la plupart des solutions existantes, BAND ne fait pas appel à des LLM pour router les messages, préférant un système de routage déterministe breveté pour éviter les erreurs non-prévisibles. La plateforme supporte également la communication multi-pairs en duplex intégral, permettant à plusieurs agents, un agent de planification, un agent de code, un agent QA, de collaborer dans un espace partagé avec un contexte synchronisé. L'enjeu est considérable pour les entreprises qui ont massivement déployé des agents IA au cours des dix-huit derniers mois sans se soucier de leur interopérabilité. Un agent construit sur LangChain ne peut pas facilement déléguer une tâche à un agent CrewAI, et un agent intégré dans Salesforce n'a aucun moyen natif de se coordonner avec un script Python tournant sur un cloud privé. Sans infrastructure de communication dédiée, les organisations se retrouvent avec des dizaines d'agents isolés incapables de former une force de travail cohérente. BAND entend combler ce vide en devenant un middleware indépendant, compatible avec tous les frameworks et tous les clouds, éliminant ainsi la dépendance à un fournisseur unique. La gestion des identités et des droits d'accès est particulièrement critique : si un humain mandate l'agent A, qui délègue à l'agent B, BAND garantit que l'agent B n'accède qu'aux données auxquelles l'humain original est autorisé. Ce problème d'interopérabilité était prévisible dès le début de la vague agentique, mais l'industrie a d'abord prioritisé la création d'agents individuels au détriment de leur coordination. BAND s'inscrit dans une tendance plus large : après la phase de "construction", vient la phase de "mise en réseau". La startup s'appuie techniquement sur la même infrastructure que WhatsApp et Discord pour absorber les volumes de trafic attendus, anticipant un monde où les identités numériques dépasseront en nombre les identités humaines. Des protocoles comme MCP d'Anthropic ou A2A de Google posent des jalons, mais restent limités à des scénarios point-à-point. BAND parie sur un marché encore ouvert, avec des concurrents encore absents à cette échelle, pour s'imposer comme la couche de plomberie invisible d'une économie agentique en construction.

InfrastructureOpinion
1 source
ChatGPT et Claude en panne : que s’est-il réellement passé ?
1335Le Big Data 

ChatGPT et Claude en panne : que s’est-il réellement passé ?

Le 20 avril 2026, en début d'après-midi, les deux assistants IA les plus utilisés au monde ont connu des perturbations simultanées. ChatGPT d'OpenAI et Claude d'Anthropic ont affiché des temps de réponse anormalement longs, voire des pannes complètes pour certains utilisateurs. Les premières alertes ont émergé autour de 16h, heure française, avec une hausse nette des signalements sur DownDetector. Les requêtes s'accumulaient sans réponse, les délais s'allongeaient, et les utilisateurs constataient rapidement que le problème ne se limitait pas à un seul service. Copilot de Microsoft et Gemini de Google ont également montré des signes de ralentissement au même moment, avec une latence inhabituelle bien que leurs services soient restés partiellement opérationnels. La panne a touché simultanément plusieurs acteurs majeurs, ce qui a immédiatement orienté les soupçons vers une cause commune en amont des applications elles-mêmes. Le principal suspect est Cloudflare, l'un des fournisseurs d'infrastructure réseau les plus critiques d'Internet. Ce service joue un rôle de relais et de filtre entre les utilisateurs et les serveurs des plateformes : il accélère le trafic, absorbe les attaques DDoS et gère la distribution des requêtes à l'échelle mondiale. Quand Cloudflare rencontre des difficultés, l'effet peut se propager en cascade sur des dizaines de services dépendants. La page de statut officielle de Cloudflare a effectivement signalé ce jour-là des dégradations sur plusieurs composants clés, notamment Analytics, Rules, Workers et Zero Trust. Ces modules sont au coeur du fonctionnement de nombreuses applications web modernes. Aucun lien officiel n'a toutefois été confirmé entre cet incident Cloudflare et les pannes de ChatGPT et Claude, mais la coïncidence temporelle et la nature simultanée des perturbations sur plusieurs plateformes indépendantes renforcent fortement cette hypothèse. Cet incident illustre une vulnérabilité structurelle de l'écosystème IA actuel : la concentration de l'infrastructure critique entre les mains d'un petit nombre de fournisseurs. OpenAI, Anthropic, Microsoft et Google ont beau opérer des produits concurrents, ils partagent souvent les mêmes couches d'infrastructure réseau, de CDN et de sécurité. Une défaillance à ce niveau peut donc paralyser simultanément des services qui semblent pourtant indépendants. À mesure que les outils d'IA s'intègrent dans les workflows professionnels quotidiens, rédaction, développement, analyse, leur indisponibilité, même temporaire, génère un impact économique et opérationnel réel. Cet épisode devrait relancer les discussions sur la résilience des infrastructures IA et la nécessité, pour les grands acteurs, de diversifier leurs dépendances techniques pour éviter qu'un seul point de défaillance ne mette à genoux l'ensemble du secteur.

UELes professionnels français utilisant ChatGPT ou Claude dans leurs workflows quotidiens ont subi une interruption de service, révélant la dépendance structurelle de l'écosystème IA européen envers quelques fournisseurs d'infrastructure réseau américains.

1336VentureBeat AI 

L'IA tient-elle ses promesses ? Transformer l'élan vers l'IA en valeur mesurable

Les grandes entreprises traversent aujourd'hui ce que Brian Gracely, directeur de la stratégie de portefeuille chez Red Hat, appelle le moment "Day 2" de l'intelligence artificielle : la phase où les pilotes cèdent la place à la production, et où les questions de coût, de gouvernance et de rentabilité deviennent plus complexes que la construction des systèmes eux-mêmes. Lors d'une session de l'AI Impact Tour de VentureBeat, Gracely a illustré cette réalité avec un exemple frappant : des clients qui détiennent 50 000 licences de Microsoft Copilot sans savoir précisément ce que leurs employés en tirent, tout en payant pour ce qu'il décrit comme "le calcul informatique le plus cher du monde, parce que ce sont des GPU". Après deux ou trois cycles budgétaires consacrés à l'IA générative, les directions d'entreprise ne demandent plus "peut-on construire quelque chose ?" mais "obtenons-nous ce pour quoi nous payons ?" Le problème central n'est pas seulement le coût brut de l'infrastructure GPU : c'est l'absence d'instrumentation permettant de relier les dépenses aux résultats concrets, rendant quasi impossible la justification des renouvellements de contrats à grande échelle. Cette prise de conscience provoque un changement stratégique profond dans la manière dont les entreprises envisagent leur rapport à l'IA. Le modèle dominant des deux dernières années, payer un fournisseur au token, au siège ou à l'appel API en lui déléguant toute l'infrastructure, est de plus en plus remis en question. Gracely résume cette évolution : plutôt que d'être purement "consommateur de tokens", certaines organisations cherchent à devenir "productrices de tokens", en évaluant quels usages justifient de posséder ou louer directement des GPU, et si les cas d'usage nécessitent vraiment les modèles les plus avancés ou si des modèles ouverts plus légers suffisent. Cette décision n'est pas binaire : elle dépend de la tolérance au risque, de la nature des charges de travail et de la maturité de chaque organisation. Le paradoxe auquel font face les responsables financiers est bien réel. Le PDG d'Anthropic, Dario Amodei, a estimé que les coûts d'inférence chutent d'environ 60 % par an, et l'émergence de modèles open source comme DeepSeek a considérablement élargi les alternatives stratégiques disponibles. Pourtant, la baisse du coût unitaire ne se traduit pas par une réduction des factures totales : l'usage s'accélère à un rythme qui compense largement les gains d'efficacité. C'est une manifestation du paradoxe de Jevons, principe économique selon lequel l'amélioration de l'efficacité d'une ressource tend à augmenter sa consommation globale plutôt qu'à la réduire. Une entreprise qui triple son utilisation de l'IA pendant que les coûts diminuent de moitié dépense encore davantage qu'avant. Pour les décideurs, cela signifie que la maturité de l'IA en entreprise passe désormais par une discipline opérationnelle rigoureuse, et non plus par l'enthousiasme des premières expérimentations.

BusinessOpinion
1 source
Préparez votre portefeuille : OpenAI lance un nouveau niveau ChatGPT Pro à 100 $
1337Le Big Data 

Préparez votre portefeuille : OpenAI lance un nouveau niveau ChatGPT Pro à 100 $

OpenAI a annoncé le 9 avril 2026 un nouveau niveau d'abonnement ChatGPT Pro à 100 dollars par mois, venant s'ajouter au niveau Plus existant. Ce plan premium offre entre 5 et 20 fois plus d'utilisation de Codex, l'outil de génération et de complétion de code intégré à ChatGPT. Les abonnés Pro accèdent également au raisonnement avancé via GPT-5.4 Pro, à un nombre maximal de tâches Codex simultanées, au chargement illimité de fichiers avec GPT-5.3, à la génération d'images sans restriction, ainsi qu'à un accès étendu à la recherche approfondie, au mode agent, aux projets, aux tâches planifiées et aux GPT personnalisés. OpenAI a précisé dans la foulée que l'accès promotionnel à Codex accordé aux abonnés Plus prenait fin le jour même de l'annonce. Ce nouveau palier cible principalement les développeurs intensifs et les professionnels qui s'appuient quotidiennement sur des capacités de raisonnement avancées. Pour eux, la possibilité de conduire des sessions Codex longues et complexes représente un gain concret : prototypes plus ambitieux, itérations plus rapides, réduction du temps de développement logiciel. Les entreprises technologiques peuvent également y voir un levier pour accélérer leurs cycles de production sans multiplier les abonnements individuels. L'accès anticipé aux nouvelles fonctionnalités constitue un avantage supplémentaire pour ceux qui cherchent à rester à la pointe des capacités disponibles. À 100 dollars mensuels, le tarif reste élevé pour un usage individuel, mais se positionne en dessous des coûts d'API pour des volumes d'utilisation équivalents. Cette annonce s'inscrit dans une stratégie de montée en gamme progressive qu'OpenAI déploie depuis le lancement de ChatGPT Plus à 20 dollars en 2023. La société fait face à des coûts d'infrastructure considérables liés à l'entraînement et à l'inférence de modèles toujours plus puissants, et la segmentation tarifaire lui permet de financer ces investissements tout en conservant une offre accessible au grand public. La guerre des assistants IA s'intensifie avec Google, Anthropic et Microsoft qui proposent leurs propres niveaux premium, poussant chaque acteur à différencier son offre par la performance brute et les outils spécialisés. Codex, repositionné comme outil central du plan Pro, illustre le pari d'OpenAI sur le marché des développeurs, segment jugé stratégique pour ancrer l'usage professionnel de ChatGPT dans les workflows d'entreprise. Les prochains mois diront si ce prix trouve preneur au-delà des early adopters.

UELes développeurs et entreprises françaises peuvent souscrire à ce nouveau palier, mais sans avantage tarifaire spécifique pour l'Europe et avec un coût élevé pour un usage individuel.

OutilsOpinion
1 source
1338InfoQ AI 

Les copilotes IA pour développeurs : comment choisir et maximiser sa productivité

Sepehr Khosravi, développeur et expert en outillage IA, a présenté une analyse approfondie de l'état actuel des assistants de code basés sur l'intelligence artificielle, en s'intéressant particulièrement aux outils comme Cursor et Claude Code. Sa présentation dépasse la simple comparaison de fonctionnalités pour entrer dans les détails techniques qui différencient ces solutions : le mode "Composer" de Cursor, qui orchestre des modifications multi-fichiers en autonomie, et les capacités de recherche contextuelle de Claude Code, capable de naviguer dans de grandes bases de code pour comprendre l'architecture avant d'agir. L'enjeu central soulevé par Khosravi est la gestion des fenêtres de contexte et des intégrations MCP (Model Context Protocol), deux facteurs souvent négligés qui déterminent en pratique l'efficacité réelle de ces outils en environnement professionnel. Il souligne que le gain de productivité ne se limite pas à l'accélération de l'écriture de code : les workflows agentiques permettent de compresser l'ensemble du cycle de développement, de la compréhension du problème à la revue de code, en réduisant les allers-retours entre développeurs. S'appuyant sur des retours d'expérience de responsables techniques dans des entreprises tech, Khosravi illustre comment les équipes qui tirent le meilleur parti de ces outils ne les utilisent pas comme de simples autocompléteurs améliorés, mais comme des agents intégrés dans leurs processus. La concurrence entre éditeurs comme Cursor, GitHub Copilot et Anthropic s'intensifie sur ce segment des workflows agentiques, qui représente désormais le vrai terrain de différenciation dans l'outillage développeur.

OutilsOutil
1 source
Google fusionne Gemini et NotebookLM : les projets ne sont plus réservés à ChatGPT et Claude
1339Numerama 

Google fusionne Gemini et NotebookLM : les projets ne sont plus réservés à ChatGPT et Claude

Google s'apprête à intégrer les carnets NotebookLM directement dans l'interface de son chatbot Gemini, une fonctionnalité dévoilée à quelques semaines de la Google I/O 2026. Cette conférence annuelle, au cours de laquelle le géant californien devrait présenter un large éventail de nouveautés liées à ses intelligences artificielles, sert de toile de fond à plusieurs annonces anticipées destinées à préparer le terrain. L'intégration des projets NotebookLM dans Gemini constitue l'une des initiatives les plus attendues de ce cycle. Jusqu'ici, la gestion de projets structurés et de bases de connaissances personnelles était le domaine réservé de ChatGPT (avec ses "Projects") et de Claude (avec ses "Projects" d'Anthropic). Gemini en était dépourvu, ce qui le plaçait en retrait pour les utilisateurs souhaitant organiser leurs recherches ou travailler sur des documents sur la durée. En fusionnant NotebookLM dans son chatbot, Google comble ce manque et offre à Gemini une dimension de gestion documentaire persistante que ses concurrents proposaient déjà. NotebookLM, lancé en 2023 et popularisé notamment par sa fonction de génération de podcasts audio synthétiques, avait jusqu'alors une existence séparée au sein de l'écosystème Google. Ce rapprochement entre les deux produits s'inscrit dans une stratégie plus large de consolidation des outils IA de Google autour de Gemini, qui doit devenir le point d'entrée unifié de l'IA grand public de l'entreprise. La Google I/O 2026, dont la date exacte n'a pas encore été précisée, devrait fournir davantage de détails sur le périmètre exact de cette intégration et les autres fonctionnalités à venir.

UELes utilisateurs européens de Gemini disposeront d'une gestion documentaire persistante intégrée, les mettant à parité avec ChatGPT et Claude sur cette fonctionnalité clé.

OutilsOutil
1 source
Google AI Research présente PaperOrchestra, un cadre multi-agents pour la rédaction automatisée d'articles de recherche
1340MarkTechPost 

Google AI Research présente PaperOrchestra, un cadre multi-agents pour la rédaction automatisée d'articles de recherche

Une équipe de chercheurs de Google Cloud AI Research a présenté PaperOrchestra, un système multi-agents conçu pour automatiser la rédaction complète d'articles scientifiques. À partir de matériaux non structurés, un résumé d'idée brut et des journaux d'expérimentation, le système produit un manuscript LaTeX prêt à soumettre à une conférence, incluant une revue de littérature, des figures générées automatiquement et des citations vérifiées via API. Le pipeline orchestre cinq agents spécialisés travaillant en séquence, dont deux en parallèle : un agent d'organisation produit d'abord un plan JSON structuré, puis un agent de visualisation génère les figures pendant qu'un agent de revue bibliographique identifie et vérifie les références via l'API Semantic Scholar, en calculant la distance de Levenshtein pour détecter les titres approximatifs et en éliminant les citations hallucinations. Un quatrième agent rédige ensuite les sections restantes, et un cinquième assemble le tout en LaTeX final. Ce système comble un vide réel dans l'outillage de la recherche académique. Les solutions existantes souffraient toutes de limitations structurelles : PaperRobot ne gérait que des séquences de texte incrémentales, AI Scientist (v1 et v2, de Sakana AI) automatise la boucle expérimentale entière mais son module de rédaction reste couplé à ses propres pipelines internes et ne peut pas traiter des données extérieures. Les systèmes spécialisés comme AutoSurvey2 ou LiRA produisent de bonnes revues de littérature mais sont incapables de positionner une méthode spécifique face à l'état de l'art. CycleResearcher, lui, exige un fichier BibTeX structuré en entrée, un artefact rarement disponible en début de rédaction. PaperOrchestra est le premier système à accepter les matériaux tels qu'un chercheur les aurait réellement après ses expériences, sans pré-traitement. L'enjeu derrière ce type d'outil dépasse la simple automatisation : la rédaction académique représente souvent plusieurs semaines de travail après la fin des expériences, et c'est précisément là que de nombreux papiers n'aboutissent jamais, notamment pour les chercheurs moins expérimentés. En industrialisant cette étape, Google s'inscrit dans une course plus large à l'automatisation de la recherche scientifique, où Sakana AI, Anthropic et d'autres tentent de réduire le cycle entre idée et publication. La contrainte imposée par PaperOrchestra, au moins 90 % du corpus bibliographique identifié doit être activement cité, et la vérification systématique des références montrent une volonté de ne pas sacrifier la rigueur à la vitesse. La prochaine étape naturelle serait l'intégration avec des pipelines expérimentaux réels, ce qui rapprocherait encore davantage ce système d'une automatisation complète du cycle de recherche.

UELes chercheurs académiques en France et dans l'UE pourraient bénéficier de cet outil pour réduire le temps de rédaction de leurs articles scientifiques, mais aucun déploiement européen spécifique n'est annoncé.

RecherchePaper
1 source
L'état des lieux des assistants de codage IA
1341InfoQ AI 

L'état des lieux des assistants de codage IA

Birgitta Böckeler, experte chez Thoughtworks, dresse un état des lieux lucide des assistants de codage par IA en 2025. Dans une présentation intitulée State of Play: AI Coding Assistants, elle analyse comment ces outils ont évolué bien au-delà du simple "vibe coding", cette pratique consistant à générer du code de manière intuitive sans structure rigoureuse, pour entrer dans une phase de maturité plus exigeante, centrée sur ce qu'elle appelle le "context engineering" : l'art de fournir aux modèles le bon contexte au bon moment pour produire du code fiable. Le coeur de son argument porte sur la notion de "harness engineering", soit la conception de contraintes architecturales et de filets de sécurité qui permettent à des agents autonomes de générer du code sans introduire de régressions ou de failles critiques. Pour les responsables techniques, cela implique un arbitrage constant entre vitesse de développement et maintenabilité du code, avec en toile de fond des risques de sécurité réels liés à l'autonomie croissante des modèles, et des coûts d'inférence qui peuvent rapidement s'emballer. Cette réflexion s'inscrit dans un moment charnière pour l'industrie du développement logiciel, où des outils comme GitHub Copilot, Cursor ou les agents de codage d'Anthropic et OpenAI redéfinissent le rôle des ingénieurs. La question n'est plus de savoir si l'IA peut écrire du code, mais comment encadrer cette capacité pour qu'elle soit viable en production, à grande échelle et sur le long terme.

OutilsOutil
1 source
Ce que les données révèlent vraiment sur l'IA et votre emploi
1342MIT Technology Review 

Ce que les données révèlent vraiment sur l'IA et votre emploi

Au sein de la Silicon Valley, l'idée d'une apocalypse de l'emploi causée par l'IA est désormais traitée comme une certitude. Dario Amodei, PDG d'Anthropic, a décrit l'IA comme "un substitut général de la main-d'oeuvre humaine" capable de réaliser tous les emplois en moins de cinq ans. Une chercheuse en impacts sociétaux chez Anthropic a quant à elle évoqué une possible récession à court terme et "l'effondrement de l'échelle des débuts de carrière". Ces déclarations alimentent une anxiété croissante chez les travailleurs, au point de renforcer les mouvements réclamant un moratoire sur la construction de centres de données. Alex Imas, économiste à l'Université de Chicago, a accepté de faire le point sur ce que l'on sait réellement, et surtout sur ce que l'on ignore. Son constat est sévère : les outils actuels pour prédire l'impact de l'IA sur l'emploi sont "lamentables". La mesure la plus utilisée, le taux d'"exposition" d'un métier à l'IA, consiste à comptabiliser combien de tâches qui le composent pourraient être automatisées. C'est la méthode qu'OpenAI a appliquée en décembre dernier à un catalogue gouvernemental américain de milliers de tâches professionnelles, datant de 1998, constatant par exemple qu'un agent immobilier est exposé à 28 %. Anthropic a utilisé ce même référentiel en février pour analyser des millions de conversations avec Claude. Mais pour Imas, "l'exposition seule est un outil totalement inutile pour prédire les suppressions de postes" : savoir qu'une tâche peut être automatisée ne dit rien sur ce que fera concrètement l'employeur de ce gain de productivité. L'enjeu central est en réalité une question d'économie industrielle que personne ne sait encore trancher : si un développeur peut produire en un jour ce qui lui prenait trois jours grâce à l'IA, l'entreprise va-t-elle embaucher moins de développeurs ou au contraire en recruter davantage pour aller plus vite ? La réponse dépend du secteur, de la structure des marchés et de la concurrence. Dans un marché compétitif, les gains de productivité se répercutent souvent en baisse de prix, ce qui stimule la demande et donc l'emploi. Mais ce mécanisme ne s'applique pas uniformément. Imas plaide pour que les économistes collectent d'urgence des données granulaires sur la façon dont les entreprises réallouent réellement leur main-d'oeuvre après l'adoption de l'IA, car sans ces données, toute politique publique sur l'emploi reste aveugle. Le débat dépasse donc largement les prédictions catastrophistes : il appelle à une observation rigoureuse de terrain, que personne n'a encore vraiment commencée.

UELe manque de données empiriques rigoureuses sur la réallocation réelle de la main-d'oeuvre après adoption de l'IA fragilise également les politiques publiques européennes sur l'emploi et les débats autour de l'AI Act.

SociétéOpinion
1 source
Les salariés de Meta se disputent le statut de « légende des tokens » en IA
1343The Information AI 

Les salariés de Meta se disputent le statut de « légende des tokens » en IA

Chez Meta Platforms, un classement interne baptisé "Claudeonomics" transforme l'utilisation de l'intelligence artificielle en compétition entre employés. Mis en place par un salarié de l'entreprise sur son intranet à partir de données internes, ce tableau de bord mesure le nombre de tokens, les unités de données traitées par les modèles d'IA, consommés par chaque utilisateur. Les 250 plus gros consommateurs parmi les quelque 85 000 employés de Meta y figurent, avec des titres honorifiques à la clé : "Session Immortal" pour les plus assidus, et "Token Legend" pour les véritables champions de l'outil. Le nom "Claudeonomics" est une référence directe à Claude, le modèle phare d'Anthropic, le concurrent d'OpenAI dont Meta a vraisemblablement adopté les outils en interne. Ce type de mécanisme de gamification révèle une tendance de fond dans les grandes entreprises tech : encourager l'adoption massive des outils d'IA par les employés en jouant sur la compétition et la reconnaissance sociale. Pour Meta, qui investit massivement dans l'IA générative, afficher des statistiques d'usage aussi élevées est aussi un signal fort sur la culture interne de l'entreprise. Cette initiative s'inscrit dans un contexte où les géants de la tech cherchent à mesurer et accélérer l'intégration de l'IA dans leurs workflows quotidiens. Meta, qui développe ses propres modèles Llama tout en recourant à des outils tiers, fait face à la même question que l'ensemble de l'industrie : comment transformer des outils puissants en réflexes productifs pour des dizaines de milliers de salariés ? Les classements internes, aussi anecdotiques qu'ils paraissent, sont l'un des leviers expérimentés.

BusinessOpinion
1 source
Des agents en essaim : présentation d'une approche ludique et rentable
1344InfoQ AI 

Des agents en essaim : présentation d'une approche ludique et rentable

Adrian Cockcroft, ancien architecte en chef d'Amazon Web Services et figure reconnue de l'ingénierie cloud, a présenté une conférence intitulée « Diriger un essaim d'agents pour le plaisir et le profit », dans laquelle il expose sa vision de ce qu'il appelle le développement « AI-native ». S'appuyant sur des expériences concrètes menées avec des outils comme Cursor et Claude Flow, il décrit une approche de niveau « directeur » : plutôt que d'écrire du code ligne par ligne, l'ingénieur orchestre des essaims d'agents autonomes qui exécutent les tâches en parallèle. Ses expérimentations couvrent notamment le BDD (développement piloté par le comportement), les serveurs MCP et le portage de code entre langages de programmation. Cette transition du cloud-native vers l'AI-native représente un changement de paradigme majeur pour l'industrie du logiciel. Elle implique que la valeur ajoutée de l'ingénieur se déplace de l'écriture du code vers la conception de plateformes capables de coordonner des agents IA. Pour les équipes de développement, cela signifie repenser les workflows, les outils de revue et la façon dont on mesure la productivité. Cockcroft est l'une des voix les plus influentes à théoriser ce basculement, après avoir contribué à populariser les microservices et l'architecture cloud à grande échelle chez Netflix puis AWS. L'émergence d'outils comme Claude Flow ou les serveurs MCP d'Anthropic crée l'infrastructure nécessaire à cette orchestration multi-agents. La question qui s'ouvre désormais est de savoir quelles compétences humaines resteront irremplaçables dans un pipeline où les agents gèrent l'essentiel de l'exécution technique.

OutilsOutil
1 source
Physical Intelligence en discussion pour une valorisation de 11 milliards de dollars
1345The Information AI 

Physical Intelligence en discussion pour une valorisation de 11 milliards de dollars

Physical Intelligence, la startup américaine spécialisée dans l'IA pour la robotique, serait en négociations pour lever environ un milliard de dollars lors d'un tour de financement qui valoriserait l'entreprise à plus de 11 milliards de dollars, selon un rapport Bloomberg publié vendredi. Founders Fund, Lightspeed Venture Partners et Thrive Capital figurent parmi les investisseurs participants à ce tour. Une valorisation à 11 milliards de dollars en l'espace de quelques années place Physical Intelligence parmi les startups d'IA les mieux financées au monde, aux côtés d'OpenAI ou Anthropic. Ce signal fort reflète l'appétit croissant des investisseurs pour la robotique généraliste — domaine longtemps considéré comme trop difficile à scaler, mais que les progrès des modèles de fondation commencent à débloquer concrètement. Fondée en 2023 par d'anciens chercheurs de Google et Tesla, Physical Intelligence développe des modèles d'IA destinés à doter les robots de capacités polyvalentes, sans programmation spécifique à chaque tâche. La startup avait déjà levé 400 millions de dollars en 2024 avec le soutien de Jeff Bezos et d'OpenAI. Ce nouveau tour intervient dans un contexte de course mondiale à la robotique humanoïde, où Figure, Boston Dynamics et les ambitions de Tesla Optimus intensifient la compétition pour attirer capitaux et talents.

BusinessActu
1 source
Claude Code lance l’auto mode, pour équilibrer l’autonomie de l’IA et la sécurité
1346Blog du Modérateur 

Claude Code lance l’auto mode, pour équilibrer l’autonomie de l’IA et la sécurité

Anthropic a lancé une nouvelle fonctionnalité pour Claude Code appelée « auto mode », permettant aux développeurs de laisser l'agent exécuter des tâches de manière autonome sans validation manuelle à chaque étape. Le système soumet chaque action à un classifieur IA interne avant de l'exécuter, ce qui permet de filtrer automatiquement les opérations risquées ou non souhaitées. Cette approche représente un compromis entre efficacité et sécurité : les développeurs gagnent en productivité en évitant les interruptions constantes, tout en conservant un filet de sécurité automatisé. Le classifieur IA agit comme gardien, évaluant le niveau de risque de chaque action avant qu'elle ne soit appliquée sur le système. L'auto mode s'inscrit dans la tendance croissante des éditeurs d'outils d'IA à proposer des agents plus autonomes, un enjeu majeur alors que ces assistants accèdent de plus en plus à des environnements de production sensibles.

OutilsOutil
1 source
ChatGPT en PLS : Claude peut maintenant contrôler tout votre ordinateur
1347Presse-citron 

ChatGPT en PLS : Claude peut maintenant contrôler tout votre ordinateur

Anthropic a étendu les capacités de son agent Claude, qui peut désormais prendre le contrôle complet d'un ordinateur, au-delà du simple navigateur. L'IA peut ainsi exécuter des tâches autonomes sur l'ensemble du système. Anthropic reconnaît cependant des risques associés et déconseille notamment d'autoriser Claude à accéder aux applications bancaires.

OutilsOutil
1 source
Claude Dispatch : comment profiter pleinement de l’IA agentique sans se tirer une balle dans le pied
1348Numerama 

Claude Dispatch : comment profiter pleinement de l’IA agentique sans se tirer une balle dans le pied

Le 23 mars 2026, Anthropic a mis en lumière Dispatch, une fonctionnalité de Cowork permettant à Claude de travailler de manière autonome sur un ordinateur pendant que l'utilisateur lui donne des instructions depuis son téléphone. Lancée discrètement avant cette date, elle a été propulsée sur le devant de la scène via une vidéo publiée sur X. Les recommandations de sécurité mentionnées en petits caractères par Anthropic méritent une attention particulière dans le contexte de cette IA agentique.

OutilsOutil
1 source
1349Les Numériques IA 

Actualité : “Vos choix sont devenus une marchandise à acheter et vendre” : j'ai écouté l’étrange entretien entre Claude et Bernie Sanders, voici ce qu'il faut retenir

Le 19 mars 2026, Bernie Sanders a publié sur YouTube un entretien vocal inédit avec Claude, le modèle d'IA d'Anthropic, portant sur la collecte de données personnelles et leur exploitation commerciale. Sanders y interroge l'IA sur l'opacité des systèmes algorithmiques, et Claude décrit un modèle où les comportements et préférences des utilisateurs sont transformés en données monnayables. L'entretien illustre une prise de conscience politique croissante autour de la surveillance numérique et de la marchandisation des choix individuels.

UEL'entretien renforce le débat politique sur la surveillance numérique et la monétisation des données personnelles, un sujet au cœur du RGPD et des discussions européennes sur la régulation des plateformes algorithmiques.

SociétéOpinion
1 source
1350Le Big Data 

L’entreprise chinoise Moonshot AI vise 18 milliards de valorisation

Moonshot AI, la startup chinoise derrière le chatbot Kimi, cherche à lever 1 milliard de dollars pour atteindre une valorisation de 18 milliards de dollars — soit plus de quatre fois sa valeur de fin 2025, portée par des investisseurs comme Alibaba et Tencent. Cette explosion reflète l'engouement mondial pour l'IA, notamment en Chine où des acteurs comme MiniMax et Zhipu rivalisent avec OpenAI et Anthropic. Le modèle Kimi K2.5, basé sur une architecture MoE de 1 000 milliards de paramètres et capable de traiter jusqu'à 256 000 tokens, affiche des benchmarks impressionnants : 50,2 % sur Humanity's Last Exam (contre 41,7 % pour GPT-5) et 60,2 % sur BrowseComp (contre 54,9 % pour GPT-5.1).

BusinessActu
1 source