Aller au contenu principal

Dossier Open weight & Open source — page 10

831 articles · page 10 sur 17

Le mouvement open-weight : DeepSeek, Mistral, Gemma, Qwen et Llama. La fracture stratégique entre laboratoires fermés et écosystème ouvert.

Les agents IA auto-évolutifs avec OpenSpace : skills, MCP, lignage et réutilisation à faible coût
451MarkTechPost OutilsOutil

Les agents IA auto-évolutifs avec OpenSpace : skills, MCP, lignage et réutilisation à faible coût

Un nouveau framework open source baptisé OpenSpace, développé par l'équipe de recherche HKUDS, propose de construire des agents IA capables de faire évoluer et de réutiliser leurs propres compétences au fil du temps. Le projet, hébergé sur GitHub, nécessite Python 3.12 ou supérieur et s'installe via un clonage du dépôt suivi d'une installation en mode éditable. Un tutoriel détaillé montre comment configurer l'environnement : définir les clés d'API Anthropic ou OpenAI, choisir un modèle comme Claude Sonnet 4.5, puis créer un espace de travail dédié et un dossier de compétences, ou "skills". Une fois la configuration terminée, l'agent peut exécuter des tâches concrètes, par exemple écrire une fonction Python qui analyse un fichier CSV d'heures travaillées et calcule une paie hebdomadaire incluant les heures supplémentaires majorées à 1,5 fois le taux normal, avec un test sur un jeu de données synthétique. Chaque compétence développée par l'agent est enregistrée dans une base SQLite locale, avec un système de versionnage et de traçabilité qui indique son origine : corrigée (FIX), dérivée d'une compétence existante (DERIVED) ou capturée directement lors d'une exécution (CAPTURED). Cette approche répond à un problème central des agents IA actuels : la réinvention permanente de solutions déjà trouvées, qui gonfle les coûts en tokens et en temps de calcul à chaque nouvelle tâche similaire. En stockant et en réutilisant les compétences déjà validées plutôt qu'en régénérant du code ou des raisonnements depuis zéro, OpenSpace promet de réduire les coûts d'exécution pour les tâches répétitives ou proches de celles déjà rencontrées, un enjeu important pour les équipes techniques qui déploient des agents IA en production sur de gros volumes de requêtes. Le fait que ces compétences soient formalisées sous forme de fichiers SKILL.md et connectables à des agents hôtes via le protocole MCP les rend également portables d'un projet à l'autre. Cette architecture transforme potentiellement un agent IA d'un outil sans mémoire, qui recommence chaque tâche depuis zéro, en un système capable d'accumuler une expertise réutilisable, réduisant latence et facture des appels aux modèles de langage. OpenSpace s'inscrit dans une tendance plus large de l'écosystème des agents IA, où le protocole MCP, popularisé par Anthropic, s'impose progressivement comme standard pour connecter les modèles de langage à des outils et des sources de données externes. Le projet intègre un serveur MCP en streaming HTTP, permettant à d'autres agents ou applications de puiser directement dans la bibliothèque de compétences accumulées, ainsi qu'un tableau de bord baptisé "openspace-dashboard" pour visualiser et analyser cette base évolutive. Cette capacité à conserver des compétences dans une base structurée, avec traçabilité complète de leur lignée, s'inscrit dans les efforts de la communauté open source pour rendre les agents IA plus autonomes et plus économiques, à un moment où les coûts d'inférence des grands modèles restent un frein majeur à leur déploiement à grande échelle. Le projet, publié sous l'organisation HKUDS sur GitHub, laisse entrevoir de futures itérations où plusieurs agents pourraient partager et affiner collectivement leurs capacités.

1 source
NVIDIA lance Cosmos 3 Edge, un modèle de monde ouvert à 4 milliards de paramètres capable de raisonner et de générer des actions robotiques en local
452MarkTechPost 

NVIDIA lance Cosmos 3 Edge, un modèle de monde ouvert à 4 milliards de paramètres capable de raisonner et de générer des actions robotiques en local

NVIDIA a dévoilé Cosmos 3 Edge, un modèle du monde open source de 4 milliards de paramètres conçu pour fonctionner directement sur des appareils embarqués, sans connexion à un centre de données. Il permet aux robots et aux agents de vision par IA de comprendre leur environnement, de raisonner en temps réel et de générer des actions robotiques en local. Ce modèle complète la famille Cosmos 3, dont les deux premières déclinaisons, Cosmos 3 Nano (16 milliards de paramètres) et Cosmos 3 Super (64 milliards), avaient été lancées le 31 mai 2026 lors de la GTC Taipei. Edge en constitue le troisième et plus petit palier, environ seize fois plus compact que Super. L'objectif est précis : offrir des performances proches de celles d'un centre de données à des machines aux ressources mémoire limitées, comme celles utilisées dans les usines, les entrepôts ou les hôpitaux. Sur le plan technique, Cosmos 3 repose sur une architecture Mixture-of-Transformers à deux tours : une tour autorégressive dédiée au traitement du texte et de la vision pour la compréhension et le raisonnement, et une tour de diffusion qui gère vision, audio et tokens d'action pour la prédiction, la génération et la simulation. Les deux tours partagent des couches d'attention multimodale tout en conservant des couches de normalisation distinctes. Cosmos 3 Edge s'appuie sur un transformeur dense de 2 milliards de paramètres pour son module de raisonnement, compatible avec les conventions de messages de Qwen3-VL. Cette avancée répond à un besoin concret de l'industrie robotique : déployer une intelligence capable de raisonner sur le monde physique directement sur des systèmes contraints en mémoire et en calcul, sans dépendre du cloud. Pour un bras robotique, une simple reconnaissance visuelle d'un objet ne suffit pas : il faut aussi suivre sa position, anticiper le mouvement du préhenseur et prévoir ce qui se produit au contact. En unifiant ces capacités dans un modèle compact, NVIDIA facilite l'intégration de l'IA embarquée dans des secteurs où la latence, la confidentialité des données et l'autonomie énergétique sont critiques, comme la logistique, la santé ou la production industrielle. Le modèle introduit une représentation d'action commune à plusieurs types de systèmes physiques, sous forme de vecteurs géométriques compacts capturant translation, rotation et état de manipulation, avec des dimensions variant selon le cas d'usage, de 9 pour une caméra ou un véhicule autonome jusqu'à 29 pour un robot humanoïde. En mode politique, Cosmos 3 Edge peut prédire une action à partir d'un état donné ou, inversement, déduire l'action à l'origine d'un changement visuel observé. NVIDIA a également publié Cosmos 3 Edge Policy (DROID), une politique de manipulation robotique entraînée sur le jeu de données DROID pour des tâches de préhension et de dépôt, illustrant la volonté de l'entreprise de rapprocher modélisation du monde et contrôle robotique concret.

UELes entreprises europeennes de logistique, sante et industrie pourraient exploiter ce modele open source pour deployer de l'IA embarquee sans dependre du cloud, mais aucun acteur ou reglementation francais/europeen n'est directement concerne.

RobotiqueActu
1 source
Le SaaSpocalypse arrive : les quatre cles pour survivre
453The Information AI 

Le SaaSpocalypse arrive : les quatre cles pour survivre

Un scénario de disruption logicielle poussé à l'extrême circule dans les cercles technologiques sous le nom de "SaaSpocalypse". L'idée: dans quelques années, des agents de codage IA deviendraient si performants que n'importe quel utilisateur disposant d'un ordinateur pourrait obtenir des logiciels de qualité professionnelle à moindre coût, voire gratuitement. OpenAI et Anthropic proposeraient eux-mêmes des applications pour de nombreuses fonctions métier, tirant parti de leurs modèles de pointe et de leur accès à des puces IA puissantes. Des développeurs dirigeraient des agents pour contribuer massivement à des projets open source, faisant émerger une multitude d'alternatives bon marché aux logiciels historiques du marché. Cette vague de nouveaux entrants ferait chuter les marges de la plupart des éditeurs de logiciels vers zéro. Les conséquences pour les fournisseurs de SaaS traditionnels seraient sévères. Dans ce scénario, une part croissante des utilisateurs de leurs applications seraient eux-mêmes des agents IA, capables d'exploiter les outils d'entreprise plus efficacement que des humains. Le modèle de tarification par siège, pilier économique du secteur depuis des années, deviendrait alors largement obsolète, contraignant les éditeurs à basculer vers une facturation à l'usage ou aux résultats, par exemple au nombre de tâches accomplies. Pour les utilisateurs humains encore présents, l'attente changerait aussi: une interface soignée ne suffirait plus à différencier un produit, puisque l'IA serait censée adapter automatiquement l'expérience aux préférences de chacun. Ce scénario s'inscrit dans un débat plus large sur l'avenir du modèle économique du logiciel à l'ère des agents autonomes. Il pose la question de qui, des géants de l'IA générative, des communautés open source ou des éditeurs historiques, captera la valeur lorsque le coût marginal de production d'un logiciel s'effondrera. Pour survivre, les entreprises SaaS devront repenser leurs sources de différenciation, au-delà du code lui-même, qu'il s'agisse de données propriétaires, de distribution, de confiance des clients ou d'intégration profonde dans les flux de travail existants. La question reste ouverte de savoir à quelle vitesse, et avec quelle ampleur, ce scénario pourrait effectivement se matérialiser.

BusinessOpinion
1 source
Postgres pour agents de production : votre base relationnelle pour l'IA en entreprise
454InfoQ AI 

Postgres pour agents de production : votre base relationnelle pour l'IA en entreprise

Article de synthèse pour Le Fil IA : Gwen Shapira, figure reconnue de l'écosystème des bases de données, a présenté une conférence détaillant comment PostgreSQL s'impose comme fondation relationnelle pour les applications d'IA en production. Elle y explique comment les équipes exploitent les capacités multi-modales de Postgres, notamment le parsing JSONB et l'indexation vectorielle HNSW à haut rappel, pour fournir aux grands modèles de langage à la fois du contexte déterministe et sémantique. Shapira aborde également la quantification vectorielle, une technique permettant d'accélérer les requêtes jusqu'à 4 fois, ainsi que des stratégies concrètes pour gérer la mémoire des agents IA. Cette présentation répond à un enjeu central pour les entreprises qui déploient des agents IA en production : disposer d'une infrastructure de données robuste, capable de combiner recherche vectorielle et requêtes structurées classiques sans multiplier les systèmes. En évitant de dupliquer les données entre une base relationnelle et une base vectorielle dédiée, les équipes techniques réduisent la complexité opérationnelle et les coûts de maintenance. La quantification vectorielle promet par ailleurs des gains de performance significatifs, un facteur critique quand les agents doivent interroger de larges volumes de mémoire contextuelle en temps réel. Cette évolution s'inscrit dans une tendance de fond où PostgreSQL, longtemps cantonné aux usages transactionnels classiques, gagne du terrain face aux bases de données vectorielles spécialisées comme Pinecone ou Weaviate. Grâce à des extensions comme pgvector, la base open source devient une alternative crédible pour les architectures d'agents IA d'entreprise, qui doivent gérer simultanément mémoire agentique, données métier et recherche sémantique. La question de la gestion de la mémoire des agents, encore peu standardisée dans l'industrie, reste un terrain d'expérimentation actif où les approches de Shapira apportent des pistes concrètes pour les équipes en production.

💬 Bon, sur le papier c'est logique : pourquoi tu irais payer Pinecone et gérer deux bases si Postgres avec pgvector fait le boulot ? La quantification vectorielle qui accélère de 4x, ça c'est du concret, pas juste une promesse marketing. Reste que la mémoire des agents, personne n'a encore de standard qui tienne, alors les spécialistes vont continuer à vendre leur base dédiée un moment.

OutilsOpinion
1 source
ACRouter choisit le modèle d'IA le plus adapté à chaque tâche, réduisant les coûts de 2,6 fois par rapport à un usage exclusif d'Opus
455VentureBeat AI 

ACRouter choisit le modèle d'IA le plus adapté à chaque tâche, réduisant les coûts de 2,6 fois par rapport à un usage exclusif d'Opus

Un nouveau framework open source baptisé Agent-as-a-Router s'attaque au routage de modèles d'IA en entreprise, un maillon de plus en plus central de la pile technologique IA. Son implémentation concrète, ACRouter, a été testée par les chercheurs sur des tâches réelles de codage et de workflows agentiques, et a nettement surpassé à la fois les routeurs statiques classiques et la stratégie coûteuse consistant à tout envoyer systématiquement vers un modèle premium comme Claude Opus, avec un gain de coût mesuré à 2,6 fois sans sacrifier les performances. Contrairement aux routeurs traditionnels, qui reposent soit sur des règles heuristiques écrites à la main (par exemple rediriger vers GPT-5.5 si le prompt contient certains mots-clés, sinon vers un modèle open source comme Kimi K2.7), soit sur des classifieurs entraînés sur des données historiques, ACRouter fonctionne selon une boucle Context-Action-Feedback (C-A-F): il examine chaque nouveau prompt et ses métadonnées, consulte sa mémoire des tâches similaires passées, choisit le modèle le plus adapté, puis observe le résultat réel de l'exécution pour enrichir sa mémoire en vue des décisions futures. Cette approche change la donne pour les équipes qui gèrent des infrastructures IA à grande échelle, car elle permet de remplacer des règles figées par un système qui s'auto-optimise en continu, sans nécessiter l'entraînement de modèles massifs ni la rédaction sans fin de nouvelles heuristiques. Concrètement, dans un pipeline d'analyse de données d'entreprise, si un modèle open source comme Kimi génère une requête SQL erronée à cause d'un nom de colonne halluciné, le système C-A-F détecte l'échec de compilation, l'enregistre comme signal négatif, et ajuste ses futurs choix de routage pour des requêtes similaires. Pour les équipes qui déploient de l'IA à grande échelle, cela représente un moyen concret de réduire les coûts tout en maintenant la qualité, en réservant les modèles les plus chers aux cas réellement complexes. Le problème que ce framework cherche à résoudre est bien identifié: les routeurs classiques souffrent d'un déficit d'information structurel, puisqu'ils ne voient jamais si le modèle choisi a effectivement réussi sa tâche. Cela génère trois faiblesses majeures, à savoir un état de connaissance figé qui empêche toute accumulation de retours d'exécution, une mauvaise généralisation face à des situations hors distribution lorsque les usages évoluent en production, et une forte vulnérabilité au renouvellement rapide des modèles, un classifieur entraîné sur les modèles d'aujourd'hui pouvant devenir obsolète dès qu'un modèle plus performant apparaît la semaine suivante. En traitant le routeur comme un agent capable d'apprendre sur le terrain plutôt que comme un simple classifieur statique, les chercheurs proposent une réponse directe à ces limites, à un moment où la multiplication des modèles disponibles rend la question du choix automatique de plus en plus stratégique pour les entreprises.

💬 Le routage de modèles, c'est le vrai sujet de 2026, pas les benchmarks des nouveaux LLM. Là, tu as un routeur qui apprend de ses échecs au lieu de suivre des règles écrites à la main, et le gain de 2,6x sur Opus, c'est pas du flan si les chiffres tiennent en prod ailleurs que chez les chercheurs qui l'ont testé. Le point qui compte : dès qu'on a plusieurs modèles disponibles, celui qui gagne, c'est pas le meilleur modèle, c'est le meilleur arbitre entre les modèles.

OutilsOutil
1 source
Aurora 1.5 : extension des modèles de fondation ouverts pour la météo et le système terrestre
456Microsoft Research 

Aurora 1.5 : extension des modèles de fondation ouverts pour la météo et le système terrestre

Microsoft Research a dévoilé Aurora 1.5, une extension majeure de son modèle de fondation Aurora pour l'étude du système terrestre, développé initialement par Microsoft Research AI for Science et présenté pour la première fois en 2024, avant sa publication dans la revue Nature en 2025. Cette nouvelle version, portée par la division Microsoft Weather, ajoute 22 nouvelles variables météorologiques aux quatre variables d'origine, couvrant notamment les champs de surface, les niveaux de pression, le vent, la température, l'humidité, les précipitations et le rayonnement. Le modèle passe également à une résolution temporelle horaire, contre des intervalles plus larges auparavant, et intègre désormais la prévision d'ensemble probabiliste, une fonctionnalité très demandée par les utilisateurs. Cette technique consiste à exécuter plusieurs simulations simultanément pour évaluer l'éventail des résultats possibles et leur probabilité, plutôt que de produire une seule prévision déterministe. Le modèle est publié en open source sur GitHub, avec les poids disponibles sur Hugging Face, permettant à chercheurs et développeurs de l'évaluer, de l'adapter et de le déployer librement. Cette mise à jour élargit considérablement le champ d'application d'Aurora, qui dépassait déjà la simple météo pour couvrir les vagues océaniques, la chimie atmosphérique et certaines applications climatiques via un réglage fin. Avec ses nouvelles variables et sa granularité horaire, le modèle devient pertinent pour des secteurs entiers qui dépendent de signaux terrestres intégrés : énergie, agriculture, transport et gestion des risques climatiques et de résilience des infrastructures. La résolution horaire permet par exemple d'anticiper précisément le début d'un épisode de précipitations, d'éclairer des décisions commerciales sensibles au climat, ou de suivre la trajectoire d'un cyclone tropical au moment de son atterrissage. Pour les organisations exposées aux aléas climatiques, ce niveau de précision peut directement améliorer la préparation opérationnelle et la prise de décision, dans un contexte où les risques liés au climat pèsent de plus en plus sur les communautés, les infrastructures et les économies à l'échelle mondiale. Aurora 1.5 illustre une stratégie plus large de Microsoft consistant à faire passer la recherche de pointe vers un usage élargi : garder le modèle ouvert pour la communauté scientifique tout en construisant, autour de lui, une couche produit avec infrastructure cloud, accès géré et outils d'aide à la décision destinés aux entreprises. Cette architecture à deux niveaux, fondation ouverte d'un côté et services commerciaux Microsoft Weather de l'autre, vise à connecter les avancées de recherche aux données, à l'infrastructure et aux flux de travail opérationnels dont les organisations ont besoin. La démarche s'inscrit dans une tendance plus vaste de l'industrie vers des modèles de fondation ouverts pour l'observation de la Terre, où plusieurs acteurs technologiques cherchent désormais à concilier recherche académique publiable et exploitation commerciale à grande échelle des mêmes modèles.

UELes agences meteorologiques et acteurs europeens de l'energie, l'agriculture ou la gestion des risques climatiques pourraient exploiter ce modele open source, mais aucune entite francaise ou europeenne n'est directement impliquee dans cette annonce.

RechercheActu
1 source
Le guide de terrain sur Fable
457Latent Space 

Le guide de terrain sur Fable

Thariq, connu pour sa série de blog "Field Guide to Fable", a bouleversé en une seule nuit le contenu de sa conférence prévue pile le jour du relancement de Fable, pour livrer les conseils les plus pertinents possibles avant la fin de la subvention d'abonnement, effective dès le lendemain. Diffusée le 6 juillet 2026, son intervention se décompose en quatre parties: une introduction, un segment sur le "unhobbling" de Claude, un autre sur la recherche des angles morts, puis une réflexion sur le deuil lié à la productivité en programmation et enfin un plaidoyer contre les compromis. Au même moment, Tencent a publié Hunyuan Hy3, un modèle ouvert sous licence Apache 2.0: une architecture MoE de 295 milliards de paramètres dont 21 milliards actifs, 192 experts avec routage top-8, de l'attention GQA, un contexte de 256 000 tokens et une couche MTP de 3,8 milliards de paramètres pour le décodage spéculatif. La newsletter AI News, qui a analysé 12 subreddits et 544 comptes Twitter sur la période du 4 au 6 juillet, a largement couvert ces deux actualités alors que la sortie de GPT-5.6 Sol Ultra reste attendue par l'ensemble du secteur. L'enjeu pour les développeurs est de comprendre que les limites d'un modèle viennent souvent moins de ses capacités réelles que du cadre d'usage qu'on lui impose: prompts et contraintes doivent être révisés à chaque nouvelle génération pour éviter de brider artificiellement le modèle, un phénomène que Thariq illustre par l'efficacité redoutée du HTML brut face à Claude. Pour Hy3, l'impact est immédiat et concret: le support natif dans vLLM était disponible dès le lancement, avec parseurs d'outils et de raisonnement, décodage spéculatif MTP, et compatibilité validée sur GPU Nvidia et AMD. Tencent a même intégré ses noyaux de production dans vLLM, avec des gains allant jusqu'à 2,95 fois en débit sur les séquences de longueur mixte, et des réductions de latence de 24% sur le temps avant premier token et 17% sur le temps par token. Cet engouement a poussé Teknium à rendre Hy3 gratuit pendant deux semaines sur Nous Portal. Ces annonces s'inscrivent dans une compétition de plus en plus vive entre laboratoires open source, Hy3 étant immédiatement comparé à GLM-5.2, certains estimant que Tencent rejoint désormais le tout premier rang des acteurs ouverts si les résultats de benchmarks se confirment, tandis que d'autres continuent de préférer GLM-5.2 en usage réel. Le contexte plus large reste marqué par une accélération générale, entre les nouveaux modèles de General Intuition et de Shunyu Yao, et l'attente de GPT-5.6 Sol Ultra, dans un secteur où AI News, désormais intégrée à Latent Space, continue de documenter ces mouvements semaine après semaine.

LLMsActu
1 source
Amazon Nova permet de masquer automatiquement les données personnelles dans les images
458AWS ML Blog 

Amazon Nova permet de masquer automatiquement les données personnelles dans les images

Amazon a dévoilé un nouveau pipeline de rédaction automatique des informations personnelles identifiables (PII) dans les images, construit autour de son modèle de fondation Nova 2 Lite, disponible sur Amazon Bedrock. Ce système multimodal rapide et économique agit comme chef d'orchestre d'une chaîne de traitement complexe, en coordonnant deux outils spécialisés : le modèle de segmentation open source SAM 3 de Meta, déployé sur Amazon SageMaker AI, et le service de reconnaissance optique de caractères Amazon Textract. Concrètement, lorsque Nova identifie un élément visuel sensible dans une image, comme un visage partiellement visible, un reflet sur une surface polie ou une plaque d'immatriculation, il délègue la délimitation précise des contours à SAM 3. Lorsqu'il détecte du texte potentiellement sensible, comme un nom, un numéro d'identification ou une adresse figurant sur un document posé sur un bureau, il fait appel à Textract pour extraire le texte et ses coordonnées, avant d'évaluer lui-même ce qui constitue réellement une information sensible en tenant compte du contexte global de l'image. Cette approche répond à un problème concret et coûteux pour les entreprises : le partage de données contenant des PII, que ce soit en interne, avec des partenaires, ou pour l'entraînement de modèles de machine learning, expose à des obligations légales strictes sous des réglementations comme le RGPD européen ou la norme PCI DSS pour les données de paiement. Une rédaction insuffisante peut entraîner des sanctions réglementaires, des atteintes à la réputation et une perte de confiance des clients. Or les outils de masquage classiques échouent souvent face aux cas limites propres aux images non structurées, contrairement au texte : un visage capturé en bordure de cadre, un panneau de rue partiellement visible qui devient identifiable une fois combiné à d'autres indices visuels, ou un document lisible dans une photo grand angle. En confiant à Nova la compréhension contextuelle de ce qui constitue ou non une PII, Amazon affirme pouvoir atteindre une précision au pixel près tout en préservant la valeur globale de l'image, un compromis difficile à obtenir avec des outils de masquage à usage unique. Cette annonce s'inscrit dans la stratégie plus large d'Amazon Web Services visant à positionner sa famille de modèles Nova, et particulièrement Nova 2 Lite, comme un coordinateur intelligent capable de piloter des workflows d'analyse d'image complexes plutôt que de tout faire lui-même. En s'appuyant sur SAM 3, un modèle que Meta a rendu open source pour la segmentation d'objets à partir de prompts textuels ou visuels, et sur Textract, son propre service d'OCR déjà éprouvé, AWS mise sur une architecture modulaire où chaque composant fait ce qu'il fait de mieux. Ce pipeline vise en priorité les cas d'usage les plus délicats, comme les empreintes digitales, les cartes d'identité ou les plaques d'immatriculation photographiées sous des angles arbitraires, des scénarios où la conformité réglementaire exige une fiabilité quasi totale. Reste à voir comment ce type d'architecture multi-modèles se comportera en production à grande échelle, et si d'autres fournisseurs cloud proposeront des approches similaires combinant raisonnement contextuel et outils de segmentation spécialisés.

UELes entreprises europeennes soumises au RGPD pourraient s'appuyer sur cet outil AWS pour faciliter la conformite lors du partage ou de l'entrainement de modeles sur des images contenant des donnees personnelles.

OutilsOutil
1 source
Les logiciels d'inférence NVIDIA permettent le coût par token le plus bas
459NVIDIA AI Blog 

Les logiciels d'inférence NVIDIA permettent le coût par token le plus bas

NVIDIA vient de publier une analyse détaillée de la façon dont sa pile logicielle d'inférence réduit le coût par token pour les entreprises qui déploient des modèles d'IA en production. Sur la plateforme Blackwell, cette pile logicielle a déjà permis de réduire le coût des tokens jusqu'à 5 fois sur le modèle DeepSeek V4 en l'espace d'un seul mois. Des acteurs majeurs de l'inférence l'utilisent déjà à grande échelle : Baseten a utilisé la bibliothèque open source TensorRT-LLM de NVIDIA pour servir DeepSeek V4 Pro sur des GPU Blackwell, obtenant jusqu'à 50 % de tokens par seconde supplémentaires. Cognition s'appuie sur le framework Dynamo pour orchestrer ses GPU d'inférence et scaler ses charges de travail de reinforcement learning sans devoir construire cette infrastructure depuis zéro. Together AI a utilisé TensorRT-LLM pour aider Cursor à accélérer le chemin entre optimisations de modèles et endpoints de production pour son expérience de code en temps réel. Ce qui est en jeu dépasse la simple performance brute. Là où les charges de travail web traditionnelles suivaient des chemins logiciels prévisibles, l'IA agentique génère des workflows distribués et à état persistant qui mobilisent simultanément des LLM, des outils, de la mémoire et des centaines de sous-agents sur des GPU, CPU et systèmes de stockage hétérogènes. Une seule requête utilisateur peut se transformer en un problème de calcul distribué couvrant des milliers de tâches. Dans ce contexte, le logiciel devient le facteur déterminant : c'est lui qui transforme la complexité en coût maîtrisé ou, à défaut, en capacité gaspillée. NVIDIA affirme que l'empilement de ses optimisations, serving disaggregé, parallélisme d'experts sur NVLink, précision NVFP4 et prédiction multi-token, peut multiplier le débit par 20 lorsqu'elles sont combinées en système cohérent. La stratégie de NVIDIA repose sur trois couches intégrées : l'orchestration de la production (serving distribué, autoscaling, gestion mémoire), l'accélération applicative (fusion de kernels, chevauchement calcul-communication) et l'accès matériel abstrait (exposer les capacités GPU et réseau sans que les développeurs aient à gérer chaque instruction bas niveau). Ce modèle de co-conception logiciel-matériel est au coeur de la thèse défendue par NVIDIA face à la concurrence croissante des TPU de Google ou des puces custom d'Amazon et Microsoft. Alors que les entreprises basculent de pilotes IA vers de véritables usines de tokens à grande échelle, la capacité à améliorer continûment le coût par token via des mises à jour logicielles, sans changer le matériel, devient un avantage compétitif structurel. Les résultats publiés par SemiAnalysis InferenceX sur les systèmes GB300 NVL72 avec SGLang et Dynamo illustrent que cet écart se creuse déjà.

💬 Ce qui me frappe ce n'est pas le x5 sur DeepSeek V4, c'est que NVIDIA gagne maintenant sa bataille après la vente du GPU. Le vrai avantage compétitif, c'est de pouvoir baisser le coût par token via une mise à jour logicielle, sans toucher au matériel : ça change la donne face aux TPU de Google ou aux puces maison d'Amazon. Reste que le x20 annoncé empile plein d'optimisations testées en labo, faudra voir ce que ça donne sur de vraies charges agentiques avec des milliers de sous-agents qui tournent en même temps.

InfrastructureActu
1 source
Meta Brain2Qwerty v2 : L’IA qui traduit vos pensées en texte sans implant cérébral
460Le Big Data 

Meta Brain2Qwerty v2 : L’IA qui traduit vos pensées en texte sans implant cérébral

Meta a présenté Brain2Qwerty v2, une version améliorée de son système de décodage cérébral capable de transformer des signaux neuronaux en texte tapé, sans aucune intervention chirurgicale. Pour fonctionner, le dispositif s'appuie sur un scanner MEG (magnétoencéphalographie) porté sur la tête, qui capte les infimes champs magnétiques produits par l'activité cérébrale pendant que l'utilisateur imagine taper sur un clavier. À la différence de la première version, qui décodait les lettres une par une, Brain2Qwerty v2 est capable d'interpréter des caractères, des mots et des phrases entières simultanément, grâce à une combinaison de Transformers, de réseaux neuronaux convolutifs et de grands modèles de langage agissant comme un correcteur contextuel. Le modèle a été entraîné sur environ 22 000 phrases produites par neuf volontaires, chacun ayant passé près de dix heures sous scanner. Résultat : une précision moyenne de 61 % dans la reconnaissance des mots, avec un pic à 78 % pour le meilleur participant et plus de la moitié des phrases décodées comportant une seule erreur. Pour les personnes atteintes de paralysie ou privées de la parole, cette avancée représente une piste sérieuse vers une communication autonome sans chirurgie. Les interfaces cerveau-ordinateur les plus précises, comme celles de Neuralink, nécessitent des électrodes implantées directement dans le cortex, avec tous les risques opératoires que cela implique. Brain2Qwerty v2 démontre qu'une approche entièrement non invasive peut produire des résultats comparables, même si les taux de précision restent encore en deçà des systèmes implantés. Pour l'industrie neurotechnologique au sens large, ce résultat déplace les lignes : il prouve que la précision de lecture cérébrale n'est pas l'apanage exclusif des implants, et ouvre un axe de recherche distinct. Meta s'inscrit dans une course technologique qui réunit des acteurs très différents : Neuralink côté implants, BrainGate pour la recherche académique, et désormais Meta sur le segment non invasif. L'entreprise a choisi de publier en open source le code d'entraînement et l'ensemble de données, une décision qui devrait accélérer les travaux d'autres laboratoires. Les obstacles restent néanmoins considérables : les scanners MEG sont des équipements encombrants, extrêmement coûteux et confinés aux environnements de recherche. Aucune perspective de produit grand public n'est envisageable à court terme. Mais le signal envoyé est clair : les interfaces cerveau-ordinateur sans chirurgie cessent d'être de la science-fiction pour devenir un domaine d'ingénierie à part entière, et Meta entend y jouer un rôle central.

UELa mise en open source du code d'entraînement et des données pourrait accélérer les travaux des laboratoires européens en neurotechnologie, sans impact direct identifiable sur la France ou l'UE à court terme.

RecherchePaper
1 source
Prime Intellect publie prime-rl 0.6.0 pour entraîner des modèles MoE à mille milliards de paramètres sur des tâches RL à base d'agents
461MarkTechPost 

Prime Intellect publie prime-rl 0.6.0 pour entraîner des modèles MoE à mille milliards de paramètres sur des tâches RL à base d'agents

Prime Intellect a publié la version 0.6.0 de son framework open source prime-rl, conçu pour entraîner des modèles de langage de très grande taille via du reinforcement learning asynchrone. Cette mise à jour majeure cible spécifiquement les modèles Mixture-of-Experts (MoE) à l'échelle du trillion de paramètres, avec un focus sur des tâches dites "agentiques" longues et complexes, comme la résolution autonome de bugs logiciels. Pour illustrer les capacités du framework, l'équipe a entraîné GLM-5, le modèle de l'organisation zai-org, sur des tâches d'ingénierie logicielle (SWE) avec des séquences allant jusqu'à 131 000 tokens. Résultat : des temps d'étape inférieurs à cinq minutes, des batchs de 256 rollouts, le tout sur seulement 28 noeuds H200, une efficacité matérielle remarquable pour cette classe de modèles. Le framework est également compatible avec d'autres modèles MoE massifs comme Kimi-K2.7-Code de Moonshot AI ou le Nemotron-3-Ultra-550B de NVIDIA. Ce type d'infrastructure répond à un problème concret du reinforcement learning à grande échelle : les tâches agentiques génèrent des "outliers" temporels, certains rollouts de code pouvant s'étirer sur plusieurs heures. Dans un système synchrone classique, les GPU restent à l'arrêt en attendant la fin de ces longues exécutions avant chaque mise à jour de politique. prime-rl résout ce goulot d'étranglement en découplant complètement le moteur d'inférence du moteur d'entraînement : les deux fonctionnent et scalent indépendamment, avec un unique point de synchronisation au moment de la mise à jour des poids. Côté inférence, le système combine calcul en FP8 avec les kernels DeepEP et DeepGEMM, un "Wide Expert Parallelism" répartissant les experts sur 32 GPU ou plus, une séparation des workers de prefill et de decode, et un système de gestion hiérarchique du cache KV avec offloading vers CPU ou disque. Le mécanisme "Router Replay" (R3) est particulièrement notable : il rejoue les décisions de routage de l'inférence directement sur le trainer, réduisant le décalage KL d'un ordre de grandeur. Cette publication s'inscrit dans une course à la scalabilité du post-training par RL, accélérée par le succès des modèles de raisonnement comme DeepSeek-R1 ou les modèles de la série o1 d'OpenAI. L'approche MoE est devenue centrale pour atteindre des capacités de niveau "trillion de paramètres" sans exploser les coûts de calcul à l'inférence, mais elle impose des contraintes d'orchestration redoutables, notamment la coordination des experts entre des dizaines de GPU. Prime Intellect, qui se positionne sur l'entraînement distribué open source, mise sur prime-rl pour démocratiser l'accès à ces techniques jusqu'ici réservées aux grands laboratoires disposant de clusters propriétaires. La compatibilité avec Slurm et des routeurs comme NVIDIA Dynamo suggère une orientation claire vers des déploiements en production à l'échelle industrielle.

UELes laboratoires et startups européens travaillant sur le post-training par RL peuvent bénéficier de cet outil open source pour entraîner des modèles MoE à très grande échelle sans dépendre de clusters propriétaires.

💬 Le vrai problème du RL agentique, c'est pas la puissance brute, c'est les rollouts qui s'étirent sur des heures et laissent les GPU à l'arrêt. prime-rl règle ça en découplant complètement inférence et entraînement, avec un seul point de synchro, et leur mécanisme R3 réduit le décalage KL d'un ordre de grandeur. Un labo européen sans cluster propriétaire a désormais un chemin crédible vers le post-training RL à l'échelle trillion.

InfrastructureOpinion
1 source
Startup IA Baseten : une levée de 1,5 milliard de dollars en préparation
462Le Big Data 

Startup IA Baseten : une levée de 1,5 milliard de dollars en préparation

Baseten, startup américaine spécialisée dans l'inférence IA et fondée en 2019 à San Francisco par Tuhin Srivastava, Amir Haghighat et Pankaj Gupta, serait sur le point de finaliser une levée de fonds de 1,5 milliard de dollars qui valoriserait l'entreprise à 13 milliards de dollars. L'opération, révélée par le Wall Street Journal, impliquerait un consortium d'investisseurs de premier plan comprenant Spark Capital, Sands Capital, Altimeter Capital et Wellington Management. Ce qui rend cette transaction particulièrement frappante, c'est sa rapidité : en janvier 2026, Baseten bouclait déjà une série E de 300 millions de dollars à 5 milliards de valorisation, elle-même précédée d'une série D de 150 millions quelques mois plus tôt. En moins de six mois, la valorisation de la startup aurait ainsi progressé de 160 %. À noter toutefois que cette nouvelle opération reposerait sur une structure de "valorisation fractionnée" : certains investisseurs se seraient positionnés à 13 milliards, d'autres autour de 11 milliards, une pratique de plus en plus courante dans l'écosystème IA pour attirer des capitaux tout en affichant des chiffres ambitieux. Cette trajectoire fulgurante illustre un basculement structurel dans la chaîne de valeur de l'intelligence artificielle. L'entraînement des grands modèles a longtemps concentré l'essentiel des investissements et de l'attention médiatique, mais c'est désormais l'inférence, c'est-à-dire l'exécution concrète des modèles à chaque requête utilisateur, qui devient le nerf de la guerre économique. À mesure que les entreprises déploient des applications génératives à grande échelle, les coûts d'inférence deviennent un facteur déterminant de rentabilité. Baseten propose d'optimiser cet acheminement en orientant les requêtes vers les modèles les plus adaptés selon le rapport performance-coût, favorisant parfois des alternatives open source face aux modèles propriétaires dominants. Pour les entreprises dont les usages IA se généralisent, cette optimisation peut représenter des économies considérables. Baseten s'inscrit dans un segment d'infrastructure IA en pleine consolidation, aux côtés d'acteurs comme Together AI, Fireworks AI ou Modal, tous en compétition pour capter la demande croissante d'exécution de modèles à moindre coût. La startup avait su se distinguer en attirant des clients entreprises cherchant à maîtriser leurs dépenses opérationnelles liées à l'IA, un positionnement qui prend de la valeur à mesure que la phase d'expérimentation laisse place au déploiement industriel. Si cette levée se concrétise, Baseten disposerait des ressources pour accélérer son développement commercial et renforcer ses capacités techniques à un moment où la demande d'inférence optimisée ne montre aucun signe de ralentissement. La prochaine étape logique pour une startup à cette valorisation serait une introduction en bourse, mais dans un marché aussi volatile, les fondateurs pourraient préférer consolider leur position avant de franchir ce cap.

💬 160% de valorisation en six mois, ça ressemble à de la fièvre, mais le fond est solide : l'inférence est en train de dépasser l'entraînement comme centre de gravité économique de l'IA. Quand tu déploies à grande échelle, c'est là que la facture explose, et les entreprises commencent à vraiment le sentir passer. La "valorisation fractionnée" à 11 ou 13 milliards selon les investisseurs, c'est un détail qui dit beaucoup sur comment ces deals se fabriquent.

BusinessOpinion
1 source
Un concurrent d'OpenClaw fait son apparition
463The Information AI 

Un concurrent d'OpenClaw fait son apparition

Hermes, l'outil d'agent IA développé par Nous Research, vient de dépasser OpenClaw sur un indicateur clé : le nombre de nouveaux contributeurs GitHub au cours des 30 derniers jours, selon les données compilées par ClawCharts, qui suit la croissance des agents IA open source. Ce chiffre reflète l'engagement actif des développeurs autour d'un projet, et le fait qu'Hermes y surpasse OpenClaw constitue un signal notable dans un secteur en pleine ébullition. Comme OpenClaw, Hermes est un logiciel d'agent IA qui s'exécute localement sur l'appareil de l'utilisateur, capable d'automatiser des tâches courantes : rédiger du code, effectuer des recherches web, envoyer des emails ou des messages WhatsApp. Nous Research, fondée en 2023, a levé 70 millions de dollars auprès d'investisseurs tels que Paradigm, OSS Capital et Distributed Global. Ce qui distingue Hermes de ses concurrents, c'est sa capacité à s'améliorer automatiquement au fil du temps. L'agent génère lui-même des "compétences", sortes de fiches mémo décrivant comment accomplir une tâche donnée. Ces instructions sont créées automatiquement lorsqu'une tâche nécessite plus de cinq "appels d'outils" (accès au web, à Gmail, à Discord, etc.) ou lorsque l'agent trouve une solution après plusieurs tentatives infructueuses. Ce mécanisme d'apprentissage autonome pourrait représenter un avantage décisif pour les utilisateurs qui répètent régulièrement les mêmes workflows complexes, sans avoir à configurer manuellement leur agent. OpenClaw avait marqué les esprits en début d'année en s'imposant comme une référence open source dans le domaine des agents IA autonomes. Mais le projet peine encore à franchir le cap d'un outil expérimental pour devenir un logiciel fiable et stable, ce qui ouvre la porte à des alternatives sérieuses. Outre Hermes, d'autres concurrents émergent, comme NemoClaw de Nvidia ou Genspark Claw, chacun cherchant à capter une communauté de développeurs en forte croissance. La bataille pour s'imposer comme standard des agents IA locaux ne fait que commencer, et la dynamique des contributeurs GitHub suggère que la domination d'OpenClaw est loin d'être acquise.

OutilsOutil
1 source
NVIDIA SkillSpector : analyser les compétences IA pour détecter les risques de sécurité
464MarkTechPost 

NVIDIA SkillSpector : analyser les compétences IA pour détecter les risques de sécurité

NVIDIA a publié SkillSpector, un outil d'analyse statique conçu pour détecter les risques de sécurité dans les "skills" d'intelligence artificielle avant leur déploiement dans des flux de travail réels. Disponible en open source sur GitHub, il s'installe via pip et nécessite Python 3.12 minimum. L'outil s'appuie sur LangGraph, le framework d'orchestration d'agents de LangChain, pour faire tourner un pipeline d'analyse programmatique. Les résultats sont exportables au format SARIF (Static Analysis Results Interchange Format), une norme industrielle utilisée par des outils comme GitHub Advanced Security. Le tutoriel officiel démontre son fonctionnement à travers quatre types de menaces représentatives : un skill inoffensif servant de référence, un script d'exfiltration de variables d'environnement vers un serveur distant, un module d'exécution dynamique de code via exec() et eval(), et un fichier Markdown contenant une tentative d'injection de prompt visant à contourner les consignes de sécurité d'un LLM. La prolifération des agents IA dans les environnements professionnels crée un vecteur d'attaque nouveau et peu documenté : les "skills" ou plugins tiers qu'on branche sur ces agents. Un skill malveillant ou mal écrit peut exfiltrer des secrets, exécuter du code arbitraire, ou manipuler le comportement d'un modèle de langage via du texte caché dans sa documentation. SkillSpector répond directement à ce risque en permettant aux équipes de sécurité et aux développeurs d'auditer automatiquement ces composants avant intégration, sans avoir besoin d'en analyser manuellement le code. L'export SARIF facilite l'intégration dans les pipelines CI/CD existants, ce qui rend l'outil compatible avec les workflows DevSecOps déjà en place dans les grandes organisations. Le contexte est celui d'une industrialisation rapide des architectures agentiques : les entreprises assemblent des systèmes IA en connectant des dizaines de skills et d'outils tiers, souvent sans processus de revue rigoureux. NVIDIA, acteur central de l'infrastructure IA avec ses GPU et son écosystème logiciel NIM, se positionne ici sur la couche sécurité de cette stack. L'initiative s'inscrit dans une tendance plus large où les grands acteurs technologiques, de Microsoft à Google, cherchent à établir des standards autour des agents autonomes. Le format SARIF, déjà adopté par l'écosystème open source, suggère une volonté d'interopérabilité plutôt qu'un outil propriétaire fermé. La prochaine étape naturelle serait l'intégration d'une analyse sémantique par LLM pour détecter des injections de prompt plus sophistiquées, une capacité que le tutoriel évoque explicitement comme extension possible du framework.

UELes équipes de sécurité européennes développant des architectures agentiques peuvent intégrer cet outil open source dans leurs pipelines CI/CD pour auditer les composants tiers, une démarche qui s'aligne avec les exigences de robustesse imposées par l'AI Act pour les systèmes IA à haut risque.

SécuritéOpinion
1 source
Vercel lance Eve, un framework open-source d'agents IA où chaque agent correspond à un répertoire de fichiers
465MarkTechPost 

Vercel lance Eve, un framework open-source d'agents IA où chaque agent correspond à un répertoire de fichiers

Vercel a publié eve, un framework open source sous licence Apache-2.0, disponible en tant que package npm, destiné à la création, l'exécution et le déploiement d'agents d'intelligence artificielle en production. L'entreprise affirme faire déjà tourner plus d'une centaine d'agents sur ce même framework. Son principe central repose sur une approche dite "filesystem-first" : un agent est modélisé comme un répertoire de fichiers sur disque, chaque fichier correspondant à une capacité précise. Le plus petit agent fonctionnel ne requiert que deux fichiers, un pour définir le modèle utilisé (par exemple anthropic/claude-opus-4.8) et un fichier instructions.md servant de prompt système. Les fonctionnalités embarquées incluent l'exécution durable avec points de reprise automatiques, un environnement sandboxé pour le code généré par l'agent, un mécanisme d'approbation humaine pour les actions sensibles, et des connexions sécurisées vers des services tiers comme Slack, GitHub, Snowflake, Salesforce, Notion ou Linear. Un même agent peut être exposé simultanément sur plusieurs canaux, qu'il s'agisse de HTTP, Slack, Discord, Teams, Telegram ou Twilio, à partir d'une seule définition. Ce lancement répond à un problème récurrent dans les équipes qui développent des agents : chaque projet recrée from scratch la même infrastructure de base, gestion des sessions, sandboxing, approbations, connexions API. Eve standardise cette structure sous forme d'une convention de répertoires stricte, éliminant le code répétitif et réduisant le temps de mise en production. Les développeurs ajoutent une capacité en déposant simplement un fichier dans le bon sous-répertoire ; le framework détecte et intègre automatiquement ces ajouts lors du build, sans enregistrement manuel. La durabilité des sessions, qui survivent aux crashs et aux redéploiements en reprenant exactement là où elles s'étaient arrêtées, réduit considérablement la charge opérationnelle pour les équipes gérant des agents à grande échelle. Eve s'inscrit dans un mouvement plus large visant à industrialiser le déploiement d'agents IA, une étape que la plupart des équipes traversent encore de façon artisanale. En open-sourçant son framework interne, Vercel adopte une stratégie comparable à celle qu'il avait employée avec Next.js : proposer une couche d'abstraction susceptible de devenir un standard de facto, tout en restant étroitement liée à son infrastructure pour les déploiements en production. La concurrence est dense dans cet espace, avec LangGraph, CrewAI, AutoGen et le récent Agent Development Kit de Google ciblant tous le même besoin. L'approche "répertoire comme contrat" d'eve se distingue par sa lisibilité et sa convention forte, plus proche de la philosophie Next.js que des frameworks d'orchestration classiques. Les suites probables incluent une adoption croissante dans les équipes utilisant déjà Vercel, et une intégration plus poussée avec Vercel AI Gateway pour le routage multi-modèle.

OutilsOutil
1 source
Paralléliser le décodage spéculatif avec P-EAGLE sur Amazon SageMaker AI
466AWS ML Blog 

Paralléliser le décodage spéculatif avec P-EAGLE sur Amazon SageMaker AI

Amazon Web Services a mis en open source une nouvelle méthode d'inférence appelée P-EAGLE (Parallel-EAGLE), désormais intégrée nativement dans Amazon SageMaker JumpStart pour accélérer le déploiement de grands modèles de langage en production. Basée sur la technique du décodage spéculatif, P-EAGLE transforme une étape jusqu'ici séquentielle en opération entièrement parallèle : au lieu de générer les tokens candidats un par un via plusieurs passes successives, elle les prédit tous simultanément en une seule passe vers l'avant. Sur des GPU NVIDIA B200 avec quantification FP8, des benchmarks réalisés sur le modèle Qwen3-Coder-30B-A3B-Instruct montrent des gains allant jusqu'à 1,69x de débit supplémentaire par rapport à EAGLE-3, le framework de référence précédent. À une concurrence de 1, P-EAGLE avec K=11 tokens spéculatifs atteint 1 167 tokens de sortie par seconde, contre 955 pour EAGLE-3 et seulement 294 sans spéculation. Cette avancée répond à un problème concret qui freinait les déploiements à grande échelle : plus on voulait spéculer loin dans la séquence, plus la latence augmentait de façon linéaire, annulant une partie du gain. P-EAGLE casse cette contrainte en remplissant les positions intermédiaires avec des marqueurs appris, permettant de prédire plusieurs tokens à la fois sans coût séquentiel supplémentaire. Pour les entreprises qui servent des millions de requêtes quotidiennes sur des modèles de code ou de génération longue, un gain de 1,69x de débit se traduit directement en réduction de coûts d'infrastructure ou en capacité à absorber davantage de trafic sans redimensionner le parc de GPU. L'intégration dans SageMaker JumpStart simplifie encore l'adoption : les développeurs peuvent déployer un endpoint optimisé P-EAGLE sans gérer manuellement les kernels CUDA sous-jacents ni les configurations de serving distribué. Le décodage spéculatif existe depuis plusieurs années comme technique d'optimisation d'inférence, et EAGLE en était devenu l'implémentation la plus performante, avec EAGLE-3 introduisant des prédictions directes de tokens et la fusion de représentations issues de plusieurs couches du modèle cible. Mais toutes ces versions conservaient une limite architecturale fondamentale héritée de l'autoregressivité du modèle brouillon. AWS a contourné ce plafond avec P-EAGLE, qu'il a choisi de reverser à la communauté open source plutôt que d'en faire un avantage exclusif. La méthode s'inscrit dans une compétition intense entre fournisseurs cloud pour offrir l'inférence la plus rapide et la moins coûteuse, notamment sur les modèles de code et de raisonnement qui génèrent des séquences longues. Avec son intégration SageMaker, AWS positionne P-EAGLE comme la voie par défaut pour les déploiements de modèles open-weight en production, au moment où des modèles comme Qwen3 et leurs successeurs s'imposent comme alternatives sérieuses aux modèles propriétaires.

UELes équipes européennes déployant des grands modèles en production sur infrastructure cloud peuvent bénéficier indirectement d'une réduction des coûts d'inférence GPU.

InfrastructureActu
1 source
Préhension universelle pour humanoïdes
467arXiv cs.RO 

Préhension universelle pour humanoïdes

Des chercheurs ont publié HUG (Human Universal Grasping), un modèle de flow-matching qui génère des saisies robotiques diversifiées à partir d'une unique image RGB-D capturée par caméra stéréo. Pour l'entraîner, ils ont constitué 1M-HUGs, un dataset égocentrique de 1 million de frames (27,8 heures, 41 bâtiments) capturées via smart glasses, couvrant 6 707 instances d'objets distincts. Le modèle fusionne données RGB et profondeur pour prédire une saisie paramétrée par la translation et la rotation du poignet ainsi que la pose MANO de la main, retargetable zero-shot vers différentes mains robotiques. Sur HUG-Bench, un benchmark de 90 objets répartis en cinq catégories géométriques avec des maillages 3D à l'échelle métrique, HUG surpasse les baselines état de l'art de +23% et +34% sur 30 objets réels testés dans plusieurs environnements domestiques. L'argument central est méthodologique : plutôt que de passer par la télé-opération ou la démonstration robotique, les auteurs exploitent les données humaines natives, disponibles à très grande échelle et sans infrastructure spécialisée. La capacité de retargeting zero-shot vers des mains mécaniques hétérogènes est l'argument industriel clé : si elle tient hors conditions de lab, elle réduit significativement le coût d'adaptation d'un modèle de manipulation à un nouveau hardware. Ces résultats sont toutefois à nuancer : le papier est un preprint arXiv non encore évalué par les pairs, et les performances annoncées ont été mesurées sur un benchmark construit par les auteurs eux-mêmes, sans audit indépendant à ce stade. HUG s'inscrit dans une lignée de travaux sur la généralisation de la saisie incluant GraspNet, Contact-GraspNet et les approches par diffusion comme DexDiffuser, et adopte une logique de capture égocentrique proche des pipelines de Stanford (Mobile ALOHA) ou Berkeley (DROID dataset), qui visent à décorréler la collecte de données du hardware robotique cible. Le code, les données, le benchmark et les checkpoints sont publiés en open source sur grasping.io. Les prochaines validations logiques concerneraient des bras industriels (UR, Franka) sur des scénarios de bin-picking ou d'assemblage non structuré, où la généralisation de la saisie reste un verrou majeur pour l'intégration à grande échelle.

RobotiquePaper
1 source
Z.ai lance GLM-5.2 : contexte de 1 million de tokens, deux niveaux d'effort de raisonnement, sans benchmarks au lancement
468MarkTechPost 

Z.ai lance GLM-5.2 : contexte de 1 million de tokens, deux niveaux d'effort de raisonnement, sans benchmarks au lancement

Z.ai a dévoilé le 13 juin 2026 GLM-5.2, troisième sortie majeure de sa gamme GLM-5 après GLM-5 (11 février), GLM-5-Turbo (15 mars) et GLM-5.1 (7 avril), soit quatre modèles de premier plan dédiés au codage en environ quatre mois. La caractéristique phare de ce nouveau modèle est sa fenêtre de contexte de 1 000 000 de tokens, une variante que Z.ai désigne glm-5.2[1m] dans sa propre configuration, contre 200 000 tokens pour GLM-5.1, soit une multiplication par cinq. Chaque réponse peut générer jusqu'à 131 072 tokens en sortie. Le modèle introduit également deux niveaux d'effort de raisonnement, High et Max, ce dernier étant recommandé par Z.ai pour les tâches de codage complexes en plusieurs étapes. Z.ai n'a publié aucun score de référence au lancement: ni SWE-bench, ni Terminal-Bench, ni Code Arena. La licence est MIT, mais les poids du modèle ne seront diffusés que la semaine suivante. Cette fenêtre d'un million de tokens transforme concrètement le travail d'un agent de codage. L'agent peut désormais conserver un dépôt de taille moyenne entier en mémoire de travail, fichiers sources, tests, configuration et historique de conversation compris, évitant ainsi les résumés permanents qu'imposent les fenêtres plus réduites. En pratique, cela ouvre la voie à des refactorisations à l'échelle d'un dépôt complet: un agent peut charger un pipeline de données Python de quarante fichiers et suivre les dépendances entre fichiers en une seule session, sans avoir à recharger le code. Le modèle vise aussi les exécutions autonomes de longue haleine, ces boucles soutenues de planification, d'exécution, de test et de correction; à titre de comparaison, GLM-5.1 enchaînait environ 1 700 étapes d'agent en une session, avec des boucles autonomes pouvant durer jusqu'à huit heures. GLM-5.2 se présente enfin comme un remplaçant direct de Claude Code, l'utilisateur n'ayant qu'à changer l'URL de base et l'identifiant du modèle, et permet d'analyser de longs documents, spécifications, journaux ou transcriptions dépassant les 200 000 tokens. Sur le plan technique, Z.ai n'a pas détaillé l'architecture de GLM-5.2 dans ses supports de lancement, mais selon les notes de la communauté, la base GLM-5 repose sur un modèle Mixture-of-Experts de 744 milliards de paramètres, dont 40 milliards sont activés par token, une ossature que GLM-5.1 avait conservée en réorientant seulement son post-entraînement. L'absence de tout chiffre de performance au lancement détonne dans un secteur où les classements façonnent la perception des modèles, d'autant que GLM-5.1 affichait un score de 58,4 sur SWE-bench Pro; la communication de Z.ai s'est concentrée sur la disponibilité, le contexte étendu et la feuille de route open source plutôt que sur les comparaisons. Ce positionnement illustre la cadence effrénée d'un acteur chinois qui multiplie les sorties pour s'imposer comme alternative crédible aux modèles propriétaires occidentaux, en misant à la fois sur une licence MIT permissive et sur une compatibilité directe avec les outils existants. Reste à voir si les benchmarks, attendus avec la publication des poids, confirmeront que cette fenêtre d'un million de tokens s'accompagne des gains de qualité que la concurrence exigera.

LLMsOpinion
1 source
À l'intérieur de XRZero-G0, un nouveau jeu de données ouvert de 2 000 heures pour la recherche en robotique
469Robotics Business Review 

À l'intérieur de XRZero-G0, un nouveau jeu de données ouvert de 2 000 heures pour la recherche en robotique

X Square Robot a mis en open source XRZero-G0, un système de collecte de données robotiques combinant un casque VR PICO 4 à tracking spatial inside-out, une caméra frontale et deux caméras poignet, ainsi qu'une paire de grippers physiques duals, un gripper en H à actionnement par pression et un gripper en G à entraînement digital. Le dispositif assure une estimation de pose 6-DOF à précision millimétrique et intègre un parsing spatiotemporel embarqué pour synchroniser flux visuels, données de trajectoire et annotations langagières. En parallèle, la société publie le G0-Dataset : 2 000 heures de démonstrations humaines multimodales, disponibles sur HuggingFace avec le code source sur GitHub. Sous conditions expérimentales contrôlées, X Square Robot annonce une réduction des besoins en données réelles pouvant atteindre un facteur 20x : environ 10 épisodes collectés sans robot, combinés à un seul épisode sur robot réel, suffiraient à égaler les performances d'un entraînement purement issu de données robotiques. L'enjeu est direct pour les équipes qui développent des politiques de manipulation dextre : le goulot d'étranglement de l'embodied AI n'est pas le compute, c'est la donnée de qualité à grande échelle. XRZero-G0 formalise ce que le secteur cherche depuis plusieurs années, une pipeline fermée "collecte-inspection-entraînement-évaluation" qui filtre automatiquement les trajectoires invalides via cinématique inverse corps entier avec contraintes de collision et de limites articulaires, et valide par rejeu réel sur robot avant d'intégrer les épisodes à l'entraînement. Si les chiffres de réduction 20x se confirment sur des tâches variées hors conditions de labo, cela change structurellement l'économie de déploiement des VLA (Vision-Language-Action models) : les industriels pourraient composer leurs datasets sans immobiliser de flotte robotique pendant des semaines. Le transfert cross-embodiment revendiqué, démontration humaine transférable à des plateformes non vues à l'entraînement, reste la promesse la plus forte, et la plus à vérifier indépendamment. X Square Robot s'inscrit dans un mouvement plus large de standardisation de la collecte de données robotiques, aux côtés d'initiatives comme Open-X Embodiment (Google DeepMind, 2023), DROID (Berkeley, 2024) ou les efforts de Physical Intelligence autour de pi0. Le positionnement open source du G0-Dataset rappelle la stratégie d'Hugging Face avec LeRobot, visant à créer une infrastructure commune de benchmarking. Aucun concurrent européen direct n'est impliqué ici, bien qu'Enchanted Tools et Wandercraft opèrent sur des segments adjacents (interaction et mobilité bipède) qui pourraient bénéficier de telles ressources de préentraînement. Les prochaines étapes annoncées incluent l'utilisation du dataset pour du préentraînement à grande échelle et des expériences de transfert cross-embodiment, sans timeline commerciale précisée, ce projet reste pour l'instant dans le périmètre recherche.

UELes équipes R&D françaises et européennes (Enchanted Tools, Wandercraft) pourraient exploiter le G0-Dataset open source pour le préentraînement de leurs modèles VLA, réduisant potentiellement leur dépendance à la collecte de données robotiques en flotte, si le facteur 20x se confirme hors conditions contrôlées.

RobotiqueOpinion
1 source
Inférence ML chiffrée de bout en bout avec Amazon SageMaker AI et le chiffrement homomorphe
470AWS ML Blog 

Inférence ML chiffrée de bout en bout avec Amazon SageMaker AI et le chiffrement homomorphe

Amazon Web Services propose une nouvelle approche pour exécuter des modèles de machine learning dans le cloud sans jamais exposer les données traitées, même au fournisseur d'infrastructure. La méthode repose sur le chiffrement homomorphe intégral (FHE, pour Fully Homomorphic Encryption), une technique cryptographique qui permet d'effectuer des calculs directement sur des données chiffrées, sans jamais les déchiffrer. Concrètement, un client envoie une requête chiffrée à un modèle hébergé sur Amazon SageMaker AI, le modèle produit une prédiction chiffrée, et seul le client peut déchiffrer le résultat final. La bibliothèque open source concrete-ml, compatible avec l'API scikit-learn, sert de couche de haut niveau pour entraîner et déployer ces modèles FHE sans avoir à coder les algorithmes cryptographiques à la main. L'enjeu est considérable pour plusieurs secteurs régulés. Dans le domaine médical, un assureur pourrait déployer un modèle prédictif sur des données diagnostiques de patients sans que ces données quittent le contrôle du médecin, en conformité avec les réglementations sur la vie privée. Dans le secteur énergétique, une entreprise pétrolière pourrait analyser des photos satellites de sites sensibles géopolitiquement sans les confier en clair à un tiers. Un opérateur télécom pourrait filtrer des e-mails clients pour détecter du spam sans violer les obligations de protection des communications personnelles. Dans tous ces cas, le cloud fournit la puissance de calcul, mais reste cryptographiquement aveugle au contenu traité, y compris Amazon lui-même, selon AWS. Cette publication fait suite à un premier article d'AWS qui démontrait le FHE appliqué à SageMaker en construisant manuellement un algorithme de régression linéaire via la bibliothèque bas niveau SEAL. L'approche présentée ici est plus généraliste : concrete-ml prend en charge plusieurs types de modèles standards et s'intègre directement dans les workflows SageMaker existants, via des conteneurs personnalisés. Le FHE se distingue également des environnements d'exécution confidentiels comme AWS Nitro Enclaves, où les données sont déchiffrées dans un enclave isolé avant traitement. Avec le FHE, aucun déchiffrement n'a lieu nulle part dans la chaîne. Le principal frein reste la performance, le FHE est significativement plus lent que le calcul en clair, ce qui limite pour l'instant son usage aux modèles relativement simples, mais la progression rapide des bibliothèques spécialisées laisse entrevoir des applications plus larges à moyen terme.

UECette technique répond directement aux exigences du RGPD en permettant aux entreprises européennes de sous-traiter des inférences ML à des clouds américains sans jamais exposer leurs données sensibles au fournisseur.

SécuritéTuto
1 source
Il abandonne ses abonnements IA pour un Mac Mini et économise 2 500 $ par an
471Le Big Data 

Il abandonne ses abonnements IA pour un Mac Mini et économise 2 500 $ par an

Un développeur vétéran a publié début juin 2026 le détail de son infrastructure IA personnelle : deux Mac Mini équipés de puces Apple Silicon, acquis pour un total de 1 198 dollars, qui remplacent intégralement un stack d'abonnements cloud lui coûtant 210 dollars par mois. Sur ces machines, il fait tourner l'agent open source Hermes ainsi que plusieurs modèles de langage en local, couvrant ses besoins en programmation, rédaction et analyse. Sa facture d'électricité liée à cette configuration s'élève à deux ou trois dollars mensuels. Le calcul est direct : une fois le matériel amorti, l'économie annuelle atteint environ 2 500 dollars, soit le prix d'un abonnement combinant ChatGPT Pro, Claude Code, Gemini Advanced et GitHub Copilot, des outils devenus des lignes budgétaires standard pour les développeurs actifs. L'impact le plus immédiat concerne les professionnels qui utilisent l'IA de façon intensive et qui accumulent plusieurs abonnements premium en parallèle. Pour eux, le retour sur investissement d'une configuration locale devient concret en moins d'un an. Au-delà du coût, le contrôle des données constitue un avantage distinct : les documents, le code source et les données sensibles ne transitent jamais par des serveurs externes, ce qui répond directement aux exigences de confidentialité dans des contextes professionnels réglementés ou compétitifs. Cette approche représente aussi un signal pour l'industrie : la proposition de valeur du cloud IA repose jusqu'ici sur la commodité et la puissance brute, mais l'Apple Silicon a réduit l'écart de performances au point que le calcul économique bascule pour une catégorie croissante d'utilisateurs. Cette tendance s'inscrit dans un mouvement plus large porté par la démocratisation des modèles open source et par la montée en puissance des puces ARM optimisées pour l'inférence. Apple a délibérément conçu l'Apple Silicon avec une mémoire unifiée à haute bande passante qui avantage précisément les charges de travail LLM, et la communauté open source a suivi avec des outils comme Ollama ou llama.cpp rendant le déploiement local accessible sans infrastructure spécialisée. La limite reste réelle : les modèles locaux disponibles sur deux Mac Mini ne rivalisent pas avec GPT-4o ou Claude Opus sur les tâches les plus complexes, et la mise en place requiert des compétences techniques que l'utilisateur moyen ne possède pas. La plupart des observateurs anticipent donc un modèle hybride : l'inférence locale pour les tâches répétitives et courantes, les API cloud pour les raisonnements lourds ponctuels. Ce que cette configuration démontre surtout, c'est que la dépendance totale aux abonnements cloud n'est plus une fatalité pour les développeurs qui savent ce qu'ils font.

UELes développeurs et entreprises européens soumis au RGPD disposent ici d'un argument concret supplémentaire : une configuration locale garantit que le code source et les données personnelles ne transitent jamais par des serveurs hors UE.

InfrastructureOpinion
1 source
AgentOps : déployer des agents IA à grande échelle avec Amazon Bedrock AgentCore
472AWS ML Blog 

AgentOps : déployer des agents IA à grande échelle avec Amazon Bedrock AgentCore

Amazon Web Services a présenté AgentOps, une nouvelle discipline opérationnelle pour déployer, gérer et améliorer les agents IA en production, en s'appuyant sur sa plateforme Amazon Bedrock AgentCore. Publié début juin 2026, ce cadre de référence s'articule autour de quatre piliers : gouvernance et sécurité, construction et opérations, évaluation, et observabilité. Bedrock AgentCore permet de déployer des agents IA compatibles avec n'importe quel modèle de langage et n'importe quel framework open source, en passant du développement local à la production sans gérer d'infrastructure. AWS propose une architecture de référence complète couvrant l'ensemble du cycle de vie DevOps adapté aux agents : planification, développement, construction, test, déploiement et maintenance. Le besoin derrière AgentOps est concret : contrairement aux pipelines classiques, les agents IA prennent des décisions autonomes et non déterministes, ce qui rend le débogage difficile, les coûts imprévisibles et le contrôle qualité complexe. AgentOps répond à ces défis en traitant chaque agent, outil et configuration mémoire comme un artefact versionné avec son propre pipeline CI/CD. L'évaluation s'effectue à quatre niveaux : l'outil individuel, le tour de conversation, le résultat de session et le système global, aussi bien en développement qu'en production. L'observabilité couvre quatre couches de télémétrie pour tracer chaque décision d'agent, surveiller les baisses de qualité et mesurer le coût par interaction. Ce lancement s'inscrit dans une course industrielle autour de l'IA agentique, où AWS, Google, Microsoft et OpenAI cherchent à proposer des plateformes complètes pour industrialiser le déploiement d'agents. La complexité opérationnelle croissante, notamment la gestion des identités d'agents, des protocoles d'authentification inter-agents (A2A), du Model Context Protocol (MCP) et des mécanismes de contrôle humain (human-in-the-loop), pousse les entreprises à chercher des cadres structurés. Amazon Bedrock AgentCore se positionne comme une réponse cloud-native à ces enjeux, en intégrant nativement sécurité, registre d'outils, gestion de l'état et limites d'exécution. Les suites prévisibles incluent l'adoption de ces pratiques AgentOps dans les grandes organisations, ainsi qu'une pression croissante sur les équipes DevOps pour adapter leurs outils et processus à la nature non déterministe des systèmes agentiques.

UELes entreprises françaises et européennes déployant des agents IA sur AWS peuvent adopter ce cadre AgentOps pour structurer leurs pipelines CI/CD et leur observabilité, sans impact réglementaire spécifique à la France ou l'UE.

OutilsActu
1 source
De l'idée à l'application IA : créer des assistants de recherche intelligents avec Strands
473AWS ML Blog 

De l'idée à l'application IA : créer des assistants de recherche intelligents avec Strands

Amazon Web Services a publié Strands Agents, un framework open source sous licence Apache 2.0 qui permet de construire un assistant de recherche IA fonctionnel en une trentaine de lignes de Python. L'outil s'appuie sur les modèles fondamentaux d'Amazon Bedrock pour doter les agents d'une capacité de raisonnement autonome, sans avoir à coder manuellement chaque étape logique. AWS affirme déjà utiliser Strands Agents en production dans plusieurs de ses propres services, notamment Amazon Q et AWS Glue. L'annonce s'accompagne de la présentation de Kiro, un environnement de développement intégré alimenté par l'IA, qui intègre un mécanisme d'extensions appelé "Kiro Powers" : plus de cinquante modules préconfigurés couvrant la conception, le déploiement, la sécurité et l'observabilité, installables en un clic. Le module Strands, par exemple, embarque la documentation du SDK, des guides de démarrage et les patterns d'API corrects pour que Kiro puisse générer des agents fiables dès le premier essai. L'enjeu est de taille pour les équipes de développement : orchestrer plusieurs appels d'API, gérer l'état des conversations et construire des agents capables de planifier leurs actions représentait jusqu'ici un chantier réservé aux spécialistes du traitement du langage naturel et des systèmes distribués. Strands Agents casse cette barrière grâce à une approche model-driven où c'est le LLM lui-même qui prend en charge la logique et l'enchaînement des outils, le développeur n'ayant plus qu'à fournir un prompt et une liste de fonctions décorées avec @tool. Le framework est agnostique en matière de fournisseur : il fonctionne avec Amazon Bedrock, Anthropic et OpenAI, et supporte des architectures allant du simple agent isolé aux réseaux multi-agents hiérarchiques. Les réponses en streaming temps réel le rendent particulièrement adapté aux interfaces interactives. Cette publication s'inscrit dans une offensive plus large d'AWS pour capter les développeurs dans l'écosystème d'agents IA, un marché en pleine structuration où Google, Microsoft et Anthropic proposent leurs propres frameworks et plateformes. En rendant Strands open source et en le couplant à un IDE maison, AWS mise sur l'effet de réseau et la fidélisation par les outils plutôt que par le seul accès aux modèles. La compatibilité native avec AWS Lambda et IAM Identity Center facilite le passage du prototype à la production sans réécriture, ce qui constitue un argument décisif pour les entreprises déjà ancrées dans l'écosystème cloud d'Amazon. Les prochaines étapes probables incluent l'extension de la bibliothèque de Kiro Powers par la communauté et l'intégration plus étroite de Strands avec d'autres services AWS d'analyse et d'automatisation.

UELes équipes de développement européennes peuvent adopter Strands Agents pour accélérer leurs projets d'agents IA, mais l'intégration native avec Lambda et IAM renforce la dépendance à l'écosystème AWS, ce qui soulève des questions de souveraineté numérique pour les entreprises françaises et européennes.

OutilsOutil
1 source
Tutoriel : implémenter GBrain, la couche mémoire auto-câblée de Garry Tan (Y Combinator) pour agents IA
474MarkTechPost 

Tutoriel : implémenter GBrain, la couche mémoire auto-câblée de Garry Tan (Y Combinator) pour agents IA

Garry Tan, président-directeur général de Y Combinator, a publié en open source GBrain, une couche de mémoire persistante conçue pour les agents IA. La version actuelle, v0.38.2.0, est disponible sous licence MIT sur GitHub. Conçu pour alimenter ses propres agents OpenClaw et Hermes, GBrain ingère des notes, e-mails, réunions et tweets, puis construit automatiquement un graphe de connaissances typé, sans aucun appel LLM pour l'extraction des relations. La base de production de Tan contient aujourd'hui 146 646 pages, 24 585 personnes, 5 339 entreprises et 66 tâches cron autonomes. Sur son propre benchmark BrainBench, un corpus de 240 pages en prose dense, GBrain atteint 49,1 % de précision à 5 résultats (P@5) et 97,9 % de rappel à 5 résultats (R@5), soit un gain de 31,4 points de P@5 par rapport au même système sans la couche graphe. Techniquement, il repose sur une base PostgreSQL embarquée (PGLite, Postgres 17 compilé en WASM avec pgvector), sans serveur ni Docker, et combine recherche vectorielle, recherche par mots-clés BM25 et fusion de rangs réciproques (RRF), avec un reclasseur ZeroEntropy. Le problème que GBrain résout est fondamental : aujourd'hui, la quasi-totalité des agents IA recommencent à zéro à chaque session. Aucune mémoire des décisions passées, des personnes rencontrées, des projets en cours. GBrain apporte une mémoire structurée, cohérente et interrogeable, ce qui transforme un agent stateless en système capable de raisonner sur des informations accumulées dans le temps. Le graphe typé, avec des relations comme worksat, founded, investedin ou advises, permet des requêtes sémantiques bien au-delà de la simple similarité vectorielle. Un serveur MCP expose 74 outils qui permettent à Claude Code, Cursor ou Windsurf de lire et écrire directement dans le cerveau de l'agent. Pour les développeurs qui construisent des pipelines d'automatisation ou des assistants personnels, c'est une infrastructure clé en main qui évite de réinventer la persistance. L'initiative s'inscrit dans une tendance plus large : après des années de promesses autour des agents IA autonomes, l'industrie bute sur les problèmes pratiques de mémoire, de contexte et de continuité. Des solutions comme MemGPT ou des frameworks de type RAG ont tenté de combler ce vide, mais restent souvent complexes à déployer. GBrain mise sur la simplicité opérationnelle, un seul processus local sans infrastructure externe, et sur l'absence d'appels LLM coûteux pour la construction du graphe. Le fait que le créateur soit Garry Tan, figure centrale de l'écosystème startup mondial, donne au projet une visibilité et une crédibilité immédiates. La prochaine étape pour la communauté sera de tester GBrain sur des corpus réels à grande échelle et de mesurer ses limites dans des environnements multi-agents partagés.

💬 C'est le genre de projet qui règle un vrai problème sans chercher à faire le buzz. Un graphe de connaissances typé, construit sans appels LLM, sur une base Postgres locale sans Docker, c'est exactement ce qu'on attendait depuis deux ans. Reste à voir si les 49 % de précision tiennent sur un corpus métier réel, parce que les benchmarks maison sont rarement les meilleurs témoins.

OutilsOutil
1 source
Le cofondateur d'OpenAI Andrej Karpathy annonce qu'il rejoint Anthropic
475VentureBeat AI 

Le cofondateur d'OpenAI Andrej Karpathy annonce qu'il rejoint Anthropic

Andrej Karpathy, chercheur en intelligence artificielle de 39 ans et co-fondateur originel d'OpenAI, a annoncé le mardi 19 mai rejoindre Anthropic, l'un des principaux laboratoires concurrents dans la course aux modèles de langage avancés. Dans un message publié sur X, il a déclaré : "J'ai rejoint Anthropic. Je pense que les prochaines années à la frontière des LLMs seront particulièrement déterminantes. Je suis très enthousiaste de rejoindre l'équipe et de revenir à la R&D." Nicholas Joseph, directeur du préentraînement chez Anthropic et lui-même ancien d'OpenAI, a précisé que Karpathy intégrera son équipe pour y construire un groupe dédié à l'utilisation de Claude afin d'accélérer la recherche en préentraînement. L'annonce est tombée le jour même de l'ouverture de Google I/O à Mountain View, en Californie. Le recrutement de Karpathy représente un signal fort pour Anthropic dans un secteur où la course aux talents est aussi intense que la course aux modèles. Karpathy est l'une des figures les plus respectées et les plus influentes du domaine, à la fois pour ses contributions techniques et pour sa capacité à vulgariser des concepts complexes. Son arrivée dans l'équipe de préentraînement pourrait accélérer significativement les recherches sur les fondations des prochaines générations de Claude. Pour l'industrie, cela confirme qu'Anthropic, malgré une image plus discrète qu'OpenAI, est capable d'attirer les profils les plus convoités du secteur. Le parcours de Karpathy illustre à lui seul l'évolution de l'IA moderne. Docteur de Stanford sous la direction de Fei-Fei Li, il a été l'un des onze membres fondateurs d'OpenAI en décembre 2015, avant de diriger de 2017 à 2022 l'équipe de vision par ordinateur d'Autopilot chez Tesla, où il supervisait l'étiquetage des données, l'entraînement des réseaux de neurones et leur déploiement sur les puces custom de l'entreprise. De retour chez OpenAI entre 2023 et 2024, il a travaillé sur le midtraining et la génération de données synthétiques, deux domaines directement liés à son nouveau rôle. Depuis son départ d'OpenAI en 2024, il s'était consacré à l'éducation publique sur les LLMs et à des projets open source, dont Eureka Labs, une école "native IA" lancée en juillet 2024, et des outils comme autoresearch et le LLM Knowledge Base. Sa dernière phrase dans l'annonce officielle, précisant qu'il compte "reprendre son travail sur l'éducation en temps voulu", laisse ouverte la question de l'avenir de ces initiatives à mesure qu'il intègre un laboratoire dont les modèles et outils restent majoritairement propriétaires.

💬 Karpathy chez Anthropic, c'est le recrutement le plus fort de l'année dans le secteur. Il comprend la stack de bout en bout, du GPU au produit, et il sait expliquer ce qu'il fait sans jargon, ce qui est loin d'être commun à ce niveau. La note sur l'éducation qu'il compte "reprendre en temps voulu", bon, faut espérer que ça reste plus qu'une intention.

LiteLLM Agent Platform : une infrastructure Kubernetes auto-hébergée pour sandboxes d'agents isolés et gestion de sessions en production
476MarkTechPost 

LiteLLM Agent Platform : une infrastructure Kubernetes auto-hébergée pour sandboxes d'agents isolés et gestion de sessions en production

BerriAI, la société à l'origine de la passerelle LiteLLM AI Gateway, vient de publier en open source une nouvelle infrastructure appelée LiteLLM Agent Platform, conçue pour déployer des agents d'intelligence artificielle en production à grande échelle. La plateforme est principalement écrite en TypeScript (92,8 %), s'appuie sur un tableau de bord Next.js tournant sur le port 3000, et utilise PostgreSQL comme base de données persistante. Elle repose sur Kubernetes via le CRD (Custom Resource Definition) kubernetes-sigs/agent-sandbox pour gérer des environnements d'exécution isolés, et supporte le développement local grâce à kind (Kubernetes in Docker), qui simule un cluster complet sans infrastructure cloud. Le démarrage local ne requiert que deux commandes : bin/kind-up.sh pour provisionner le cluster, puis docker compose up pour lancer les services. Le problème central que résout cette plateforme est celui de la persistance d'état et de l'isolation dans les déploiements multi-équipes. Un agent IA est par nature stateful : il conserve l'historique de session, les résultats d'appels d'outils et le raisonnement intermédiaire entre chaque échange. Si le conteneur qui l'héberge plante ou est remplacé lors d'un déploiement, tout cet état disparaît. En parallèle, des équipes différentes ont besoin d'environnements distincts, avec des secrets, des outils et des périmètres d'accès spécifiques, ce qui interdit de tout regrouper dans un seul conteneur partagé. LiteLLM Agent Platform répond à ces deux contraintes : elle garantit la continuité de session à travers les redémarrages de pods, et fournit des sandboxes isolés par équipe et par contexte. La gestion des variables d'environnement illustre cette philosophie : toute variable préfixée CONTAINERENV dans le fichier .env est injectée dans chaque sandbox en supprimant le préfixe, permettant de transmettre des secrets comme GITHUB_TOKEN sans modifier les images de conteneur. Cette sortie s'inscrit dans une tendance plus large de l'industrie à professionnaliser l'infrastructure agentique, jusqu'ici souvent gérée de manière artisanale. BerriAI maintient également un dépôt séparé, litellm-agent-runtime, décrit comme un runtime générique pour agents de code tournant dans des machines virtuelles provisionnées à la volée par le proxy LiteLLM. La plateforme intègre aussi un système de harnais sous harnesses/opencode, permettant de faire tourner des agents comme Claude Code ou OpenAI Codex dans des sandboxes isolés, avec un proxy Vault pour la gestion des credentials. L'enjeu est de permettre aux entreprises de passer d'expérimentations locales à des déploiements robustes en production, sans avoir à construire elles-mêmes cette couche d'infrastructure. La disponibilité en open source abaisse la barrière d'entrée et pourrait accélérer l'adoption de workflows agentiques dans des contextes professionnels exigeants.

💬 Le vrai problème en prod agentique, c'est pas le modèle, c'est que ton agent perd tout son contexte dès que le pod redémarre. BerriAI a construit exactement la couche qui manquait, avec isolation par équipe, persistance de session et un démarrage local en deux commandes. Bon, ça reste du Kubernetes sous le capot, donc faut pas se raconter d'histoires sur la complexité opérationnelle.

OutilsActu
1 source
Les meilleurs agents IA pour le développement logiciel : classement par benchmarks
477MarkTechPost 

Les meilleurs agents IA pour le développement logiciel : classement par benchmarks

En l'espace d'un an et demi, les agents de codage IA sont passés du simple complètement automatique à des systèmes entièrement autonomes capables de lire des issues GitHub, naviguer dans des bases de code multi-fichiers, écrire des correctifs, exécuter des tests et ouvrir des pull requests sans qu'un humain tape une seule ligne. Début 2026, environ 85 % des développeurs déclarent utiliser régulièrement une forme d'assistance IA pour coder. Le marché s'est structuré en quatre grandes familles : les agents terminaux, les IDE natifs IA, les ingénieurs autonomes hébergés dans le cloud, et les frameworks open source permettant de choisir librement son modèle. Chaque outil se réclame du meilleur, mais les benchmarks invoqués pour le prouver ne mesurent pas toujours les mêmes choses, et certains ont perdu toute crédibilité. Le coup de tonnerre est venu le 23 février 2026, quand l'équipe Frontier Evals d'OpenAI a annoncé qu'elle cessait de publier ses scores sur SWE-bench Verified, le benchmark de référence du secteur depuis mi-2024. Ce test soumet des agents à 500 vraies issues GitHub tirées de dépôts Python populaires, en mesurant leur capacité à comprendre le problème, naviguer le code, générer un correctif et valider les tests, sans intervention humaine. L'audit d'OpenAI a porté sur 138 des problèmes les plus difficiles, répartis sur 64 sessions indépendantes : 59,4 % présentaient des cas de test fondamentalement défectueux ou insolubles, exigeant par exemple des noms de fonctions précis absents de l'énoncé. Plus grave encore, les auditeurs ont constaté que les trois grands modèles frontière, GPT-5.2, Claude Opus 4.5 et Gemini 3 Flash, étaient capables de reproduire mot pour mot les solutions de référence à partir du seul identifiant de tâche, confirmant une contamination systématique des données d'entraînement. La conclusion d'OpenAI est sans appel : les progrès mesurés sur SWE-bench Verified ne reflètent plus d'améliorations réelles dans le développement logiciel. OpenAI recommande désormais SWE-bench Pro comme successeur. Ce nouveau benchmark contient 1 865 tâches réparties en trois sous-ensembles : 731 tâches publiques, 858 tâches en set caché, et 276 tâches commerciales issues de 18 bases de code propriétaires de startups. Les scores y sont nettement plus bas qu'en Verified : lorsque Scale AI avait évalué les modèles frontière avec un scaffold unifié SWE-Agent, le meilleur résultat n'atteignait pas 25 % (GPT-5 à 23,3 %). Les chiffres publiés aujourd'hui par les labs sont bien supérieurs grâce à des harness optimisés : OpenAI annonce GPT-5.5 à 58,6 % sur le set public, Anthropic revendique 64,3 % pour Claude Opus 4.7, et Google affiche 54,2 % pour Gemini 3.1 Pro. La difficulté à comparer ces résultats, obtenus avec des configurations très différentes, illustre le défi central du marché en 2026 : choisir son agent de codage exige désormais de décrypter les benchmarks autant que les fonctionnalités.

UELes développeurs français et européens utilisant des agents de codage IA doivent recalibrer leurs critères de sélection face à l'invalidité confirmée du benchmark SWE-bench Verified et adopter SWE-bench Pro comme nouvelle référence comparative.

💬 Le coup de balai sur SWE-bench Verified était attendu, mais que les modèles reproduisent les solutions mot pour mot depuis l'identifiant de tâche, c'est quand même un niveau au-dessus. SWE-bench Pro repart à 23% avec un scaffold unifié, ce qui donne une image plus juste de là où on en est vraiment. Les 58-64% qu'annoncent les labs maintenant, c'est avec leurs propres harness optimisés, donc compare qui peut.

LLMsOutil
1 source
OpenClaw vs Hermes Agent : Nous Research domine le classement mondial d'OpenRouter avec son agent auto-améliorant
478MarkTechPost 

OpenClaw vs Hermes Agent : Nous Research domine le classement mondial d'OpenRouter avec son agent auto-améliorant

Hermes Agent, développé par Nous Research sous licence MIT, a dépassé OpenClaw pour s'imposer à la première place du classement mondial des agents et applications sur OpenRouter au 10 mai 2026. L'agent génère désormais 224 milliards de tokens quotidiens sur la plateforme, contre 186 milliards pour OpenClaw, un écart significatif qui illustre une adoption massive en seulement quelques mois. Lancé en février 2026, Hermes a enchaîné les versions majeures à un rythme soutenu : la v0.9.0 a ajouté le support Android/Termux et 16 plateformes de messagerie, la v0.11.0 a livré une réécriture complète de l'interface en React/Ink ainsi que l'intégration d'AWS Bedrock, de NVIDIA NIM et de GPT-5.5. La v0.13.0 "Tenacity", publiée le 7 mai 2026, introduit un tableau Kanban multi-agents avec détection de tâches zombies, une commande /goal pour maintenir un objectif sur plusieurs tours de conversation, et Google Chat comme 20e plateforme supportée, le tout en 1 556 commits et 761 pull requests fusionnées depuis le lancement. Ce basculement de leadership révèle deux philosophies opposées sur ce que doit être un agent IA. OpenClaw mise sur la portée maximale via une passerelle WebSocket centrale connectant plus de 50 canaux (Telegram, Discord, Slack, WhatsApp, Signal, etc.). Hermes parie sur la valeur cumulée : après chaque tâche, l'agent analyse sa propre performance et génère automatiquement des fichiers de compétences réutilisables, stockés dans une base SQLite FTS5 combinée à des instantanés d'identité persistants. Plus l'agent tourne longtemps, plus il s'optimise pour les workflows spécifiques de son utilisateur. Ce modèle "do, learn, improve" semble résonner fortement avec les développeurs qui cherchent un agent capable d'évoluer plutôt qu'un simple routeur de messages. La comparaison sécuritaire entre les deux projets est également instructive. OpenClaw a accumulé neuf CVE en quatre jours en mars 2026, dont un à 9,9/10 selon le score CVSS ; un audit de Koi Security sur 2 857 compétences ClawHub a identifié 341 entrées malveillantes, et SecurityScorecard a signalé des dizaines de milliers d'instances publiquement exposées. Hermes n'est pas exempt de vulnérabilités, plusieurs CVE ont été publiés fin avril 2026, dont CVE-2026-7113, une absence d'authentification sur l'endpoint webhooks en version 0.8.0, mais la v0.13.0 a corrigé huit failles critiques, dont l'activation par défaut de la rédaction des données sensibles et des correctifs sur les flux OAuth. Le contexte plus large est celui d'une compétition ouverte qui s'intensifie : depuis le départ du fondateur d'OpenClaw chez OpenAI en février 2026 et la mise sous tutelle du projet via une fondation sponsorisée par OpenAI, Hermes bénéficie d'un momentum à la fois technique et symbolique dans l'écosystème open source.

💬 224 milliards de tokens par jour, c'est pas rien. Ce qui me frappe surtout dans cette histoire, c'est moins le chiffre que l'architecture : un agent qui génère ses propres fichiers de compétences après chaque tâche et s'optimise en continu, c'est le modèle qu'on attendait depuis un moment. Et bon, 9 CVE en quatre jours chez OpenClaw dont un à 9,9, ça aide à faire le tri.

OutilsOutil
1 source
OpenAI déploie GPT-5.5 Instant : moins d’erreurs, plus de puissance
479Le Big Data 

OpenAI déploie GPT-5.5 Instant : moins d’erreurs, plus de puissance

OpenAI a lancé GPT-5.5 Instant le 5 mai 2026, un nouveau modèle qui remplace progressivement GPT-5.3 Instant sur l'ensemble des offres ChatGPT. Le déploiement, annoncé par Sam Altman sur X, devrait être finalisé en deux jours. La mise à jour apporte trois améliorations majeures : une réduction de 52,5 % des hallucinations sur des sujets sensibles comme la médecine et le droit, des scores en hausse sur des questions scientifiques de niveau avancé ainsi qu'en mathématiques, et des réponses jusqu'à 30 % plus courtes. Le ton devient également plus naturel et plus chaleureux, selon la communication officielle d'OpenAI. Ces changements ont des conséquences concrètes pour les millions d'utilisateurs qui s'appuient quotidiennement sur ChatGPT dans des contextes professionnels ou académiques. La baisse des hallucinations est particulièrement significative dans des domaines où une réponse erronée peut avoir des conséquences réelles : un médecin qui vérifie un protocole, un juriste qui cherche une référence, un étudiant qui prépare un exposé. La concision accrue réduit le temps de lecture et améliore l'efficacité des échanges, une demande explicite de nombreux utilisateurs que l'entreprise dit avoir entendue. La personnalisation renforcée, qui exploite plus intelligemment les conversations passées, les fichiers et les données connectées, rapproche le modèle d'un assistant véritablement adaptatif plutôt que d'un outil générique. OpenAI évolue dans un contexte de concurrence intense, face à Google Gemini, Anthropic Claude et les modèles open source qui gagnent rapidement en maturité. La course ne porte plus seulement sur la puissance brute des modèles, mais aussi sur leur fiabilité et leur utilisabilité au quotidien, deux dimensions où les critiques contre ChatGPT s'étaient accumulées ces derniers mois. Sur la question de la mémoire et de la vie privée, OpenAI a ajouté une fonctionnalité permettant aux utilisateurs de consulter, modifier ou supprimer les informations utilisées pour personnaliser les réponses, une concession notable aux préoccupations croissantes autour de la confidentialité des données. Les performances annoncées restent à confirmer dans des usages réels prolongés, loin des benchmarks contrôlés, mais la direction prise par GPT-5.5 Instant témoigne d'un repositionnement stratégique clair : moins de puissance spectaculaire sur le papier, plus de crédibilité et de praticité dans l'usage réel.

UELes professionnels européens des secteurs médical et juridique utilisant ChatGPT bénéficieront de la réduction annoncée des hallucinations, sans impact réglementaire ou institutionnel spécifique pour la France ou l'UE.

NVIDIA et ServiceNow s'associent pour développer des agents IA autonomes pour les entreprises
480NVIDIA AI Blog 

NVIDIA et ServiceNow s'associent pour développer des agents IA autonomes pour les entreprises

Lors de la conférence ServiceNow Knowledge 2026, Jensen Huang, fondateur et PDG de NVIDIA, est monté sur scène aux côtés de Bill McDermott, PDG de ServiceNow, pour annoncer l'extension de leur collaboration dans le domaine de l'intelligence artificielle en entreprise. Au coeur de cette annonce figure Project Arc, un agent autonome de bureau conçu pour fonctionner en continu et évoluer de façon autonome, destiné aux travailleurs du savoir comme les développeurs, les équipes IT et les administrateurs systèmes. Contrairement aux agents IA classiques, Project Arc s'intègre nativement à la plateforme ServiceNow via ServiceNow Action Fabric, et s'appuie sur OpenShell, un moteur d'exécution open source développé par NVIDIA permettant de déployer des agents dans des environnements sandbox gouvernés par des politiques de sécurité. L'agent peut accéder aux systèmes de fichiers locaux, aux terminaux et aux applications installées sur un poste de travail, et exécuter des tâches complexes en plusieurs étapes que l'automatisation traditionnelle ne peut pas prendre en charge. Ce partenariat marque un tournant dans la manière dont les grandes entreprises envisagent l'IA. Jusqu'ici cantonnée à la génération de texte ou au raisonnement assisté, l'intelligence artificielle passe désormais à l'action de façon autonome, durable et auditable. Pour les organisations, l'enjeu est considérable : déployer des agents capables d'agir sur de vraies infrastructures sans exposer des données sensibles ni contourner les règles de conformité. Project Arc répond à cette exigence en combinant l'AI Control Tower de ServiceNow, qui assure la gouvernance et la traçabilité de chaque action, avec le runtime sécurisé OpenShell de NVIDIA, qui définit précisément ce qu'un agent peut voir, quels outils il peut utiliser et comment chaque action est isolée du reste du système. L'annonce s'inscrit dans une tendance de fond : après des années d'investissements massifs dans les grands modèles de langage, les acteurs technologiques cherchent à concrétiser l'IA agentique dans des environnements professionnels réels. NVIDIA et ServiceNow misent sur un écosystème ouvert, fondé sur les modèles Nemotron de NVIDIA et des compétences spécialisées développées pour les ServiceNow AI Specialists, pour permettre aux entreprises d'adapter ces systèmes à leurs propres données et processus métier. Les deux sociétés co-développent également NOWAI-Bench, une suite de benchmarks ouverte pour évaluer les performances des agents IA en entreprise, intégrée à la bibliothèque NVIDIA NeMo Gym. L'environnement EnterpriseOps-Gym, l'un des plus exigeants du secteur, fait partie de cet effort pour établir des standards communs dans une course à l'agentique qui mobilise désormais tous les grands acteurs du cloud et de l'infrastructure.

UELes entreprises européennes pourraient déployer Project Arc en s'appuyant sur ses mécanismes de gouvernance et de traçabilité pour répondre aux exigences d'auditabilité imposées par l'AI Act.

OutilsOutil
1 source
Moonshot AI open-source FlashKDA : noyaux CUTLASS pour Kimi Delta Attention et benchmarks H20
481MarkTechPost 

Moonshot AI open-source FlashKDA : noyaux CUTLASS pour Kimi Delta Attention et benchmarks H20

Moonshot AI, la startup chinoise derrière le chatbot Kimi.ai, vient de publier en open source FlashKDA (Flash Kimi Delta Attention), une bibliothèque de kernels GPU haute performance construite sur CUTLASS, la librairie de templates CUDA de NVIDIA. Disponible sur GitHub sous licence MIT, FlashKDA est une implémentation de production du mécanisme d'attention Kimi Delta Attention (KDA), le composant central du modèle hybride Kimi Linear. Sur des GPU NVIDIA H20, la bibliothèque atteint des gains de vitesse de prefill allant de 1,72x à 2,22x par rapport à la référence flash-linear-attention, et s'intègre directement comme backend de remplacement dans cette même librairie. Les prérequis techniques sont CUDA 12.9 et PyTorch 2.4, avec un ciblage exclusif de l'architecture Hopper (SM90 et supérieur), ce qui englobe les H100 et H20. L'enjeu est concret : Kimi Linear est un modèle à 48 milliards de paramètres totaux dont seulement 3 milliards sont activés à l'inférence. Son architecture repose sur un ratio de trois couches KDA pour une couche d'attention globale de type MLA (Multi-Head Latent Attention), ce qui réduit l'utilisation du cache KV de 75 % lors de la génération sur de longues séquences. À un million de tokens de contexte, ce design offre un débit de décodage jusqu'à six fois supérieur à celui d'une architecture full-attention classique. FlashKDA est précisément le kernel CUDA qui rend ce gain possible lors de la phase de prefill, en exploitant les Tensor Cores de NVIDIA via CUTLASS pour optimiser le calcul matriciel à basse précision (bf16). Ce travail s'inscrit dans une vague de recherche intense sur les mécanismes d'attention linéaire, motivée par le problème fondamental de la complexité quadratique de l'attention softmax standard : plus le contexte est long, plus les coûts de calcul explosent. KDA est la réponse de Moonshot AI à ce défi, en raffinant l'architecture Gated DeltaNet avec un mécanisme de gating par canal plus fin, ce qui améliore l'utilisation de la mémoire d'état finie des RNN. Le support du batching à longueur variable via des séquences cumulatives (cu_seqlens) et la gestion d'états récurrents initiaux et finaux facilitent son usage en production pour l'inférence multi-tour. En publiant FlashKDA sous licence MIT, Moonshot AI permet à d'autres équipes de reproduire et construire sur cette architecture, au moment même où la course à l'inférence longue séquence s'intensifie entre les grands laboratoires mondiaux.

UEImpact indirect : les équipes de recherche et startups IA européennes disposant de GPU Hopper (H100/H20) peuvent intégrer FlashKDA (licence MIT) pour accélérer leurs travaux sur l'inférence longue séquence, sans dépendance à une solution propriétaire.

InfrastructureOpinion
1 source
MiMo-Embodied : rapport technique du modèle de fondation X-Embodied
482arXiv cs.RO 

MiMo-Embodied : rapport technique du modèle de fondation X-Embodied

Xiaomi a publié en open source MiMo-Embodied, un modèle fondamental dit "cross-embodied" conçu pour unifier deux domaines jusqu'ici distincts : la conduite autonome et l'IA incarnée (robots, agents physiques). Selon le rapport technique associé, le modèle établit de nouveaux records sur 29 benchmarks au total, 17 en IA incarnée, couvrant la planification de tâches, la prédiction d'affordance et la compréhension spatiale, et 12 en conduite autonome, sur la perception environnementale, la prédiction d'état et la planification de trajectoire. Il surpasse à la fois les modèles open source, les modèles propriétaires et les systèmes spécialisés sur ces évaluations. Le code et les poids sont disponibles sur GitHub sous l'organisation XiaomiMiMo. Ce qui rend ce résultat notable, c'est que les deux domaines ont longtemps été traités séparément : un robot domestique et un véhicule autonome semblent peu comparables. Or MiMo-Embodied démontre qu'ils partagent suffisamment de structure sous-jacente, compréhension de l'espace, planification d'action, interaction avec un environnement physique, pour se renforcer mutuellement lors de l'entraînement. Cette synergie, appelée "transfert positif", signifie qu'apprendre à conduire rend le modèle meilleur pour manipuler des objets, et vice versa. Pour l'industrie, cela ouvre la voie à des modèles généraux capables de s'adapter à plusieurs types de corps ou de véhicules sans être réentraînés depuis zéro. L'approche repose sur un entraînement multi-étapes, une construction soigneuse des données d'entraînement, et un affinage par chain-of-thought (CoT) combiné à du reinforcement learning, des techniques popularisées par les grands modèles de langage mais ici appliquées à des agents physiques. Xiaomi s'inscrit ainsi dans une course internationale au modèle fondamental robotique, aux côtés de Google, Physical Intelligence ou Tesla pour Optimus. La publication en open source constitue un signal fort : l'entreprise mise sur la recherche communautaire pour accélérer le développement, tout en positionnant ses propres écosystèmes matériels, smartphones, robots, voitures connectées, comme terrain d'application naturel.

RobotiquePaper
1 source
Les robots humanoïdes apprennent la manipulation polyvalente par simulation tactile
483arXiv cs.RO 

Les robots humanoïdes apprennent la manipulation polyvalente par simulation tactile

Des chercheurs ont présenté un nouveau système d'apprentissage pour robots humanoïdes capable de manipuler des objets avec une dextérité inédite, en intégrant le sens du toucher comme modalité centrale. Baptisé HTD (Humanoid Transformer with Touch Dreaming), ce modèle multimodal de type encodeur-décodeur Transformer combine la vision multi-caméras, la proprioception et la détection tactile pour permettre à un robot humanoïde d'accomplir des tâches nécessitant des contacts physiques complexes et fréquents. Testé sur cinq tâches réelles impliquant des manipulations délicates, HTD affiche une amélioration relative de 90,9 % du taux de succès moyen par rapport aux approches concurrentes les plus solides. L'enjeu central de ce travail est de résoudre l'un des défis les plus persistants de la robotique humanoïde : la coordination entre stabilité du corps entier, agilité des mains et conscience du contact physique. Dans les environnements réels, un robot qui saisit un objet fragile ou manipule un outil doit constamment ajuster sa prise en fonction des forces ressenties, une capacité que les systèmes purement visuels peinent à développer. Grâce à la technique du "touch dreaming", la politique apprise ne se contente pas de prédire des séquences d'actions, elle anticipe également les forces futures exercées par les articulations des mains et les états tactiles latents à venir, ce qui l'oblige à construire des représentations internes riches et sensibles au contact. Les expériences d'ablation confirment que cette prédiction dans l'espace latent est plus efficace que la prédiction brute des données tactiles, avec un gain relatif de 30 % supplémentaire en taux de succès. L'architecture repose sur un contrôleur de la partie basse du corps entraîné par apprentissage par renforcement, qui assure la stabilité posturale pendant les manipulations complexes. La collecte de données de démonstration s'effectue via un système de téléopération en réalité virtuelle qui intègre à la fois des mains dextères et des capteurs tactiles, permettant de recueillir des interactions riches en contact sans étape de pré-entraînement tactile séparée. Ce travail, dont les matériaux sont publiés en open source, s'inscrit dans une tendance plus large de la recherche en robotique visant à doter les humanoïdes de capacités sensori-motrices proches de celles des humains, condition indispensable avant un déploiement dans des environnements domestiques ou industriels non contrôlés.

RobotiqueOpinion
1 source
PokeVLA : un modèle vision-langage-action compact enrichi d'une connaissance globale du monde
484arXiv cs.RO 

PokeVLA : un modèle vision-langage-action compact enrichi d'une connaissance globale du monde

Des chercheurs ont publié PokeVLA, un nouveau modèle de fondation léger conçu pour la manipulation robotique, présenté dans un article déposé sur arXiv fin avril 2026. Le système repose sur une architecture Vision-Language-Action (VLA) qui intègre la compréhension visuelle et linguistique directement dans l'apprentissage des actions physiques d'un robot. Pour y parvenir, l'équipe a développé une approche en deux étapes : d'abord, un modèle vision-langage compact baptisé PokeVLM est pré-entraîné sur un jeu de données soigneusement constitué de 2,4 millions d'échantillons couvrant l'ancrage spatial, les affordances et le raisonnement incarné ; ensuite, des représentations spécifiques à la manipulation sont injectées dans l'espace d'action via un apprentissage sémantique multi-vues, un alignement géométrique et un module d'action inédit. Les expériences montrent des performances de pointe sur le benchmark LIBERO-Plus ainsi qu'en déploiement réel, surpassant les modèles comparables en taux de réussite et en robustesse face à diverses perturbations. Le code, les poids du modèle et les scripts de préparation des données seront rendus publics. Ce travail s'attaque à deux limites majeures des modèles VLA existants : leur inefficacité computationnelle et leur faible capacité à raisonner à haut niveau sur l'espace et les objets. En proposant un modèle à la fois compact et performant, PokeVLA ouvre la voie à des robots capables de comprendre leur environnement de manière plus fine sans nécessiter des ressources matérielles considérables. Pour l'industrie de la robotique, cela signifie que des systèmes plus accessibles pourraient atteindre des niveaux de fiabilité jusqu'ici réservés aux modèles volumineux, accélérant potentiellement l'adoption dans des contextes réels comme la logistique, la fabrication ou les soins à domicile. Les modèles VLA connaissent une montée en puissance rapide depuis que des travaux comme RT-2 de Google ou OpenVLA ont démontré l'intérêt de combiner grands modèles de langage et contrôle moteur. La tendance générale pousse vers des modèles toujours plus grands, mais PokeVLA prend le contre-pied en cherchant la compacité sans sacrifier les capacités. La mise en open source annoncée est stratégique : elle permettra à la communauté académique de reproduire les résultats et d'itérer rapidement, ce qui pourrait accélérer l'émergence de robots généralistes abordables dans les prochaines années.

RobotiqueActu
1 source
Agents IA autonomes : les meilleurs outils à installer en local sur son PC
485Le Big Data 

Agents IA autonomes : les meilleurs outils à installer en local sur son PC

Les agents IA autonomes capables de s'exécuter directement sur un ordinateur personnel constituent une nouvelle génération d'outils radicalement différents des chatbots classiques. Contrairement à ces derniers, ils ne se contentent pas de répondre à des questions : ils planifient et exécutent des missions complexes de façon indépendante, en décomposant un objectif large en étapes logiques, en vérifiant leurs propres résultats et en ajustant leur stratégie en cas d'erreur. Sur le plan technique, ces systèmes s'appuient sur un modèle de langage (LLM) comme moteur de raisonnement, couplé à une mémoire de suivi et à des outils d'action concrets, lecture de fichiers, navigation web, exécution de code. Des frameworks comme LangChain, CrewAI ou AutoGen structurent ces opérations, tandis que des applications comme GPT4All (développée par Nomic AI) ou Ollama permettent de faire tourner localement des modèles comme Llama 3 ou Mistral. Le choix du modèle dépend directement du matériel disponible : un modèle de 7 milliards de paramètres quantifié (Q4/Q5) exige environ 8 Go de VRAM, quand la précision standard (fp16) double ce besoin, et les modèles de 13 à 34 milliards de paramètres requièrent au moins 24 Go. L'intérêt principal de cette exécution en local réside dans la souveraineté des données et l'indépendance opérationnelle. Les documents sensibles ne quittent jamais le disque dur, ce qui supprime les risques liés aux fuites de données sur des serveurs tiers. L'absence de connexion internet requise élimine également les pannes dépendant de services cloud, les frais d'API et les abonnements mensuels. Pour les professionnels manipulant des données confidentielles, données médicales, juridiques, financières, cette rupture avec le cloud représente un changement de paradigme concret. Les outils comme Lain Agent ciblent les utilisateurs non techniques sous Windows sans configuration avancée, tandis qu'AutoGen ou LangChain offrent aux développeurs une flexibilité totale pour connecter ces agents à des systèmes Git, des bases de données ou des pipelines d'automatisation. Ce mouvement vers l'IA locale s'inscrit dans une tendance plus large de démocratisation matérielle accélérée par la montée en puissance des GPU grand public et des puces NPU intégrées dans les processeurs modernes. Pendant des années, exécuter un LLM performant nécessitait une infrastructure serveur hors de portée du particulier. La quantification des modèles et l'optimisation des runtimes comme Ollama ont radicalement abaissé cette barrière. Les acteurs impliqués sont aussi bien des laboratoires de recherche open source (Meta avec Llama, Mistral AI) que des startups spécialisées dans l'outillage local (Nomic AI). La prochaine étape logique sera l'intégration native de ces agents dans les systèmes d'exploitation et les environnements de développement, rendant l'autonomie locale accessible sans aucune configuration technique préalable.

UEMistral AI (entreprise française) est citée comme acteur clé du mouvement open source local, et la souveraineté des données mise en avant répond directement aux contraintes RGPD pesant sur les entreprises européennes.

OutilsOutil
1 source
486Ben's Bites 

Big lab leaks

Anthropic a discrètement laissé filtrer ses prochaines ambitions : selon des informations issues d'une fuite récente, la société travaille à l'intégration de fonctionnalités de développement d'applications full-stack directement dans Claude, comparables à ce que propose Lovable. Une fuite similaire aurait également concerné Codex d'OpenAI avant d'être supprimée. Pendant ce temps, Anthropic officialise plusieurs annonces concrètes : Claude Cowork, sorti de sa préversion après douze semaines et des millions d'utilisateurs, est désormais disponible en accès général. Claude for Word entre en bêta, permettant de rédiger, modifier et réviser des documents depuis le volet latéral de Word, avec les modifications affichées sous forme de suivi des changements, réservé aux plans Team et Enterprise. Côté Claude Code, une nouvelle commande /ultraplan permet de construire et d'éditer un plan depuis le web pour l'exécuter ensuite dans le terminal. Un outil Monitor permet désormais à Claude de surveiller des événements en arrière-plan plutôt que de vérifier en boucle, réduisant significativement la consommation de tokens. OpenAI, de son côté, a lancé un plan à 100 dollars par mois offrant cinq fois la puissance de calcul du plan standard à 20 dollars, avec un bonus temporaire doublant ce ratio jusqu'au 31 mai. Ces annonces illustrent une accélération brutale de la course à l'agent autonome. L'intégration de capacités full-stack dans Claude signifierait qu'Anthropic cherche à court-circuiter les outils tiers comme Lovable ou Cursor pour capturer la chaîne complète du développement logiciel. La notion de "headless SaaS" commence à circuler dans l'industrie pour désigner les produits conçus pour être utilisés par des agents plutôt que par des humains. Le PDG de Box a résumé la pression naissante : les entreprises évinceront les fournisseurs qui ne facilitent pas l'accès économique de leurs produits aux agents. La concurrence pousse aussi OpenAI à remodeler sa grille tarifaire autour de la puissance de calcul brute, un signal clair que la performance des modèles dépend désormais autant des ressources allouées que des paramètres entraînés. Cette évolution s'inscrit dans un contexte où l'écosystème agentic se structure rapidement. Vercel publie un template open source pour construire des agents de code, Cursor permet désormais à ses agents cloud d'annexer des captures d'écran à leurs pull requests sur GitHub, et Cloudflare rend ses environnements sandbox disponibles en accès général avec terminal, interpréteur et aperçu en direct. La conférence AI Engineer a vu des prises de position radicalement opposées, de "le code est un passif" à des appels à ralentir le rythme d'adoption. L'industrie n'a pas encore tranché, mais les grands labos, eux, ont visiblement choisi leur camp.

UELes développeurs et entreprises français utilisant Claude peuvent tester dès maintenant Claude Cowork (accès général) et Claude for Word (bêta Team/Enterprise), tandis que la montée du 'headless SaaS' agentic pourrait contraindre les éditeurs logiciels européens à adapter leurs produits pour un accès par agents.

OutilsOutil
1 source
487MarkTechPost 

NVIDIA et l'Université du Maryland lancent Audio Flamingo Next (AF-Next), un grand modèle audio-langage ouvert et puissant

Des chercheurs de NVIDIA et de l'Université du Maryland ont publié Audio Flamingo Next (AF-Next), le modèle le plus puissant de la série Audio Flamingo et l'un des grands modèles audio-langage (LALM) open source les plus avancés à ce jour. AF-Next est disponible en trois variantes spécialisées : AF-Next-Instruct pour les questions-réponses générales, AF-Next-Think pour le raisonnement multi-étapes complexe, et AF-Next-Captioner pour la description détaillée de contenus audio. L'architecture repose sur quatre composants : un encodeur audio AF-Whisper (basé sur Whisper, pré-entraîné sur un corpus plus large incluant de la parole multilingue), un adaptateur MLP à deux couches, un backbone LLM Qwen-2.5-7B à 7 milliards de paramètres avec une fenêtre de contexte étendue à 128 000 tokens, et un module de synthèse vocale en streaming. Une innovation clé est l'introduction des Rotary Time Embeddings (RoTE), qui ancrent chaque token audio à son horodatage réel plutôt qu'à sa position dans la séquence, ce qui améliore significativement le raisonnement temporel sur de longs enregistrements. L'entraînement a mobilisé plus d'un million d'heures de données audio. AF-Next représente une avancée concrète pour toutes les applications nécessitant une compréhension fine de l'audio : transcription de réunions longues, analyse de podcasts, surveillance sonore, ou encore assistants vocaux capables de raisonner sur le contexte temporel d'une conversation. La technique dite de Temporal Audio Chain-of-Thought oblige le modèle à ancrer chaque étape de raisonnement à un timestamp précis avant de produire une réponse, ce qui réduit les hallucinations et améliore la fiabilité sur des enregistrements longs. Pour entraîner cette capacité, les chercheurs ont constitué AF-Think-Time, un jeu de données d'environ 43 000 exemples issus de bandes-annonces, résumés de films, histoires à suspense et conversations multi-participants, avec une moyenne de 446 mots par chaîne de raisonnement. L'audio a toujours été le parent pauvre du multimodal : là où les modèles vision-langage comme GPT-4V ou LLaVA ont rapidement mûri, les équivalents audio peinaient à traiter simultanément parole, sons environnementaux et musique, surtout sur de longues durées. AF-Next s'attaque directement à cette lacune en proposant une architecture unifiée et entièrement ouverte, à l'heure où les grands laboratoires comme OpenAI et Google gardent leurs modèles audio les plus puissants propriétaires. En publiant les poids du modèle et le dataset AF-Think-Time, NVIDIA et l'Université du Maryland offrent à la communauté de recherche une base solide pour faire progresser l'audio compréhension ouverte, un domaine stratégique pour les prochaines générations d'interfaces vocales et d'agents autonomes capables d'agir sur des flux audio en temps réel.

💬 L'audio était vraiment le grand oublié du multimodal, et là c'est NVIDIA qui comble le trou avec une architecture ouverte. Les Rotary Time Embeddings pour ancrer les tokens à leur timestamp réel, c'est le genre de détail qui change tout quand tu travailles sur des enregistrements longs. Reste à voir si les 128k tokens de contexte tiennent vraiment en pratique, mais les poids sont là, le dataset aussi, bonne base.

LLMsOpinion
1 source
Onyx : une alternative à Claude, plus puissante, open-source et locale ?
488Le Big Data 

Onyx : une alternative à Claude, plus puissante, open-source et locale ?

Onyx est une plateforme d'intelligence artificielle open source qui a franchi le cap des 20 000 étoiles sur GitHub début avril 2026, attirant l'attention des équipes techniques à la recherche d'alternatives aux solutions propriétaires comme Claude d'Anthropic. Conçue pour s'installer en self-hosting via Docker, elle fonctionne comme une couche d'orchestration complète : elle se connecte à plus de 40 sources de données d'entreprise (stockage, messagerie, gestion de projet), indexe les contenus en continu et dialogue avec n'importe quel LLM, qu'il s'agisse de modèles cloud, d'API externes ou de modèles tournant entièrement en local. Sur les benchmarks de recherche approfondie, Onyx affiche des scores supérieurs à plusieurs solutions propriétaires, en combinant recherche sémantique, indexation permanente et exploration web intégrée pour produire des réponses contextualisées et traçables. L'enjeu concret est la souveraineté technologique des organisations. En permettant de choisir librement le modèle sous-jacent selon chaque usage et d'optimiser les coûts sans dépendre d'un fournisseur unique, Onyx élimine le risque de verrouillage propriétaire qui préoccupe de nombreux DSI et responsables de la sécurité informatique. Les réponses ne reposent plus sur des données d'entraînement génériques, mais sur les documents internes réels de l'entreprise, synchronisés en temps réel. Dans des environnements professionnels où chaque réponse doit être justifiable et auditable, cette traçabilité représente un avantage opérationnel direct. L'outil "Craft" intégré pousse la logique plus loin : il permet de générer non seulement des documents, mais aussi des tableaux de bord, des applications web et des visualisations à partir des données internes, dans des environnements isolés garantissant la confidentialité. Le lancement d'Onyx s'inscrit dans une dynamique plus large de professionnalisation de l'IA open source, portée par des projets comme LangChain, Ollama ou LlamaIndex, qui ont progressivement rendu accessibles des capacités jusqu'alors réservées aux grandes plateformes cloud. Face à la montée en puissance de Claude, GPT-4o et Gemini, une partie de l'écosystème technique cherche à construire des infrastructures IA qui restent sous contrôle de l'organisation. Onyx mise sur la dimension collaborative pour se différencier davantage : la plateforme gère des rôles, des accès granulaires et des agents automatisés configurables avec des règles précises, la rapprochant d'un système applicatif complet plutôt que d'un simple assistant conversationnel. La prochaine étape pour le projet sera de démontrer sa robustesse à l'échelle dans des environnements de production critiques, un terrain où les solutions propriétaires conservent encore une avance significative en matière de support et de garanties contractuelles.

UELes organisations européennes soucieuses de souveraineté numérique et de conformité RGPD peuvent déployer Onyx en self-hosting pour garder leurs données internes hors des clouds américains.

OutilsOutil
1 source
Les 4 derniers métiers qui résisteront à l'IA dans la tech
489Latent Space 

Les 4 derniers métiers qui résisteront à l'IA dans la tech

L'intelligence artificielle est en train de remodeler en profondeur les organigrammes des entreprises technologiques. Yoni Rechtman, dans sa newsletter 99D, propose un cadre conceptuel pour penser les nouveaux rôles post-IA dans le travail en col blanc, que Karri Saarinen, PDG de Linear, a popularisé en l'analogisant aux rôles de jeu d'équipe apparus dans World of Warcraft. Cette semaine a aussi été marquée par plusieurs avancées majeures côté outils : Anthropic a intégré l'utilisation de l'ordinateur (computer use) directement dans Claude Code, permettant à l'agent d'ouvrir des applications, de cliquer dans des interfaces et de tester ce qu'il vient de construire depuis la ligne de commande — une fonctionnalité en préversion pour les abonnés Pro et Max. Parallèlement, OpenAI a publié un plugin Codex pour Claude Code, capable de déclencher des revues de code, des contre-analyses adversariales et des flux de "sauvetage" depuis l'outillage d'Anthropic, en utilisant un abonnement ChatGPT. OpenAI a également révélé que les tâches Codex lancées vers 23h ont 60 % de chances de durer plus de trois heures, confirmant la tendance à déléguer refactorisations et planifications à des agents en arrière-plan. Ces évolutions ont des conséquences très concrètes sur la façon dont les équipes de développement travaillent. L'intégration de computer use dans Claude Code ferme la boucle entre l'écriture du code, son exécution et la vérification visuelle de l'interface — ce que plusieurs ingénieurs décrivent comme la pièce manquante pour une itération fiable sur les applications. Le fait qu'OpenAI et Anthropic rendent leurs outils interopérables via un plugin standard signale que les stacks de développement évoluent vers des architectures composables plutôt que des produits monolithiques. Par ailleurs, Theo a démontré qu'Opus obtient environ 20 % de meilleures performances dans Cursor que dans Claude Code, soulignant que la qualité du harness — l'environnement d'exécution et d'orchestration — est désormais une variable de premier ordre, parfois plus déterminante que les capacités intrinsèques du modèle lui-même. Dans l'écosystème open source, Nous Research a publié une mise à jour majeure de Hermes Agent qui a provoqué une vague de migrations depuis des configurations concurrentes. Les nouveaux profils multi-agents permettent à chaque bot de disposer de sa propre mémoire, de ses compétences et de son historique, transformant Hermes d'un assistant personnel en une abstraction de système d'exploitation pour agents. Autour de ce noyau se construit un écosystème : opentraces.ai propose un flux CLI pour publier des traces d'agents sur Hugging Face à des fins d'évaluation et de fine-tuning ; d'autres projets permettent aux agents de journaliser leurs décisions, de se fine-tuner sur leur propre historique et de basculer vers des modèles moins coûteux. La bataille entre infrastructure d'agents ouverte et propriétaire s'intensifie, avec des acteurs comme Clément Delangue d'Hugging Face qui prennent position publiquement dans ce débat structurant pour l'avenir du secteur.

UEClément Delangue d'Hugging Face (entreprise française) s'implique publiquement dans le débat structurant sur l'infrastructure d'agents ouverte vs propriétaire, un enjeu direct pour la souveraineté numérique européenne.

OutilsOutil
1 source
Microsoft AI lance Harrier-OSS-v1 : une nouvelle famille de modèles d'embeddings multilingues atteignant l'état de l'art sur Multilingual MTEB v2
490MarkTechPost 

Microsoft AI lance Harrier-OSS-v1 : une nouvelle famille de modèles d'embeddings multilingues atteignant l'état de l'art sur Multilingual MTEB v2

Microsoft a publié Harrier-OSS-v1, une famille de trois modèles d'embedding de texte multilingues qui décrochent les meilleurs scores du moment sur le benchmark Multilingual MTEB v2, la référence principale pour évaluer la qualité des représentations vectorielles de texte. La famille comprend trois variantes : un modèle de 270 millions de paramètres, un de 0,6 milliard, et un de 27 milliards. Tous trois partagent une fenêtre de contexte de 32 768 tokens — soit entre 32 et 64 fois celle des modèles classiques comme les dérivés de BERT — et produisent des embeddings de dimensions variables (1 024, 2 048 ou 5 376 selon la taille). Les modèles sont disponibles en open source sur HuggingFace. Ce lancement représente une rupture technique notable dans le domaine des embeddings. Contrairement aux architectures encodeur bidirectionnelles qui dominent ce secteur depuis BERT en 2018, Harrier repose sur une architecture décodeur-seulement, identique à celle des grands modèles de langage modernes. Pour obtenir un vecteur représentatif d'un texte entier, le modèle utilise le mécanisme de last-token pooling : l'état caché du dernier token de la séquence sert de représentation agrégée, puis est normalisé. La fenêtre de 32k tokens est particulièrement précieuse pour les systèmes RAG (Retrieval-Augmented Generation), où l'obligation de découper de longs documents en petits morceaux dégrade souvent la cohérence sémantique. Par ailleurs, les modèles plus petits (270M et 0,6B) ont été entraînés par distillation de connaissance à partir de modèles enseignants plus grands, leur permettant d'atteindre des performances supérieures à ce que leur taille laisserait espérer — un avantage concret pour les déploiements contraints en mémoire ou en latence. La course aux embeddings multilingues s'intensifie depuis que les applications RAG et la recherche sémantique sont devenues des composantes centrales des produits IA en entreprise. Microsoft entre sur ce terrain avec une approche instruction-tuned : pour obtenir les performances annoncées, chaque requête doit être précédée d'une instruction décrivant la tâche (par exemple, "Retrieve semantically similar text"), tandis que les documents sont encodés sans instruction. Ce design permet au modèle d'adapter dynamiquement son espace vectoriel selon le cas d'usage — recherche web, mining de traductions, classification. Face à des concurrents comme Cohere, Voyage AI ou les modèles E5 de Microsoft lui-même, Harrier-OSS-v1 se positionne comme une option open source sérieuse couvrant une gamme de tailles adaptée à des contraintes très différentes, du serveur embarqué au cluster GPU haute capacité.

UELes modèles open source multilingues couvrant les langues européennes permettent aux équipes R&D et entreprises de déployer des systèmes RAG performants sans dépendance à une API propriétaire.

LLMsActu
1 source
Salesforce publie VoiceAgentRAG : un routeur mémoire à deux agents qui réduit la latence de récupération RAG vocale de 316x
491MarkTechPost 

Salesforce publie VoiceAgentRAG : un routeur mémoire à deux agents qui réduit la latence de récupération RAG vocale de 316x

Salesforce AI Research a publié VoiceAgentRAG, une architecture open source à double agent conçue pour résoudre l'un des problèmes les plus critiques des assistants vocaux : la latence de récupération des données. Dans un système RAG (Retrieval-Augmented Generation) classique, chaque requête vers une base vectorielle distante introduit entre 50 et 300 millisecondes de délai réseau — un délai qui, pour la voix, consume la totalité du budget disponible avant même que le modèle de langage commence à générer une réponse. VoiceAgentRAG réduit ce délai de récupération de 316 fois, passant de 110 ms à 0,35 ms, grâce à un cache sémantique local. Sur 200 requêtes testées avec Qdrant Cloud comme base vectorielle distante, le système atteint un taux de cache hit global de 75 % (79 % sur les tours de conversation où le cache est déjà chaud), économisant 16,5 secondes de temps de récupération au total. Ce gain de performance change fondamentalement ce qui est possible dans les interfaces vocales alimentées par l'IA. Maintenir une conversation naturelle exige une réponse en moins de 200 millisecondes — contrainte que les systèmes RAG standards ne peuvent pas respecter en production. En découplant la récupération des documents de la génération de réponse, VoiceAgentRAG permet aux agents vocaux d'accéder à une base de connaissances étendue sans sacrifier la fluidité conversationnelle. L'architecture est compatible avec les principaux fournisseurs LLM (OpenAI, Anthropic, Gemini, Ollama) et les systèmes d'embedding courants, ce qui facilite son intégration dans des stacks existants. Les scénarios de conversation thématiquement cohérents, comme la comparaison de fonctionnalités, atteignent jusqu'à 95 % de cache hit ; les scénarios plus volatils descendent à 45-55 %. L'architecture repose sur deux agents parallèles coordonnés par un bus d'événements asynchrone. Le « Fast Talker » gère le chemin critique : il interroge d'abord un cache FAISS en mémoire, et ne fait appel à la base distante qu'en cas d'échec, avant de mettre le résultat en cache pour les tours suivants. Le « Slow Thinker » opère en arrière-plan : il analyse une fenêtre glissante des six derniers tours de conversation pour anticiper trois à cinq sujets probables et pré-charger les documents correspondants avant que l'utilisateur ne pose sa prochaine question. Une subtilité technique notable : le Slow Thinker génère des descriptions stylistiquement proches des documents sources plutôt que des questions, alignant ainsi les embeddings de prédiction sur ceux des textes réels dans la base. Le cache utilise un seuil de similarité cosinus de 0,40 pour les correspondances et une politique d'éviction LRU avec une durée de vie de 300 secondes. Publié en open source sur arXiv (2603.02206), VoiceAgentRAG marque une étape concrète vers des agents vocaux capables de raisonner sur des bases documentaires larges en temps réel.

RecherchePaper
1 source
Chroma lance Context-1 : un modèle de recherche à base d'agents de 20 milliards de paramètres pour la récupération multi-saut et la gestion du contexte
492MarkTechPost 

Chroma lance Context-1 : un modèle de recherche à base d'agents de 20 milliards de paramètres pour la récupération multi-saut et la gestion du contexte

Chroma, l'entreprise derrière la base de données vectorielle open source du même nom, a lancé Context-1, un modèle de recherche agentique de 20 milliards de paramètres conçu pour résoudre l'un des problèmes les plus tenaces des systèmes RAG (Retrieval-Augmented Generation) modernes. Dérivé de l'architecture Mixture of Experts gpt-oss-20B et affiné par apprentissage supervisé combiné à du renforcement via CISPO, ce modèle ne joue pas le rôle d'un moteur de raisonnement généraliste : il agit comme un sous-agent de recherche ultra-spécialisé. Concrètement, face à une question complexe nécessitant plusieurs étapes de raisonnement, Context-1 décompose la requête en sous-questions ciblées, exécute des appels d'outils en parallèle — 2,56 appels en moyenne par tour — et parcourt itérativement un corpus documentaire via des outils comme searchcorpus (hybride BM25 + recherche dense), grepcorpus et readdocument, avant de transmettre les passages pertinents à un modèle frontier pour la réponse finale. L'innovation la plus significative de Context-1 est ce que Chroma appelle le "Self-Editing Context" : le modèle ne se contente pas de chercher, il gère activement sa propre fenêtre de contexte. Au fil de la recherche, les documents s'accumulent — beaucoup s'avèrent redondants ou hors sujet. Plutôt que de se noyer dans ce bruit, Context-1 a été entraîné avec une précision de pruning de 0,94 : il exécute proactivement une commande prunechunks pour éliminer les passages inutiles en cours de recherche. Ce mécanisme lui permet de maintenir une fenêtre de contexte de 32 000 tokens propre et efficace, là où les modèles généralistes "s'étranglent" sur des chaînes de raisonnement longues. Le découplage entre la logique de recherche — traditionnellement gérée par le développeur — et la génération de réponse représente un changement architectural majeur pour les équipes qui construisent des pipelines RAG en production. Pour entraîner et évaluer ce type de modèle, Chroma a également publié en open source son outil de génération de données synthétiques, context-1-data-gen. Ce pipeline produit des tâches multi-hop dans quatre domaines — recherche web, dépôts SEC (10-K, 20-F), brevets USPTO et corpus d'emails (Enron, fichiers Epstein) — selon un processus structuré en quatre étapes : Explorer, Vérifier, Distraire, Indexer. L'astuce centrale est l'injection de "distracteurs thématiques", des documents apparemment pertinents mais logiquement inutiles, qui forcent le modèle à raisonner plutôt qu'à faire du simple matching de mots-clés. Ce faisant, Chroma s'attaque à un angle mort bien connu des benchmarks statiques, et positionne Context-1 comme compétitif face à GPT-5 sur les tâches de recherche complexes — tout en étant nettement moins coûteux à faire tourner pour des volumes industriels.

OutilsOpinion
1 source
Les prix des H100 s'envolent
493Latent Space 

Les prix des H100 s'envolent

Depuis décembre 2025, les prix de location des GPU H100 de Nvidia repartent fortement à la hausse, effaçant la correction observée début 2025 après le choc DeepSeek R1. Selon le commentateur Dylan sur le podcast Dwarkesh, les H100 valent aujourd'hui davantage qu'il y a trois ans, au moment de leur lancement. Cette inversion de tendance intervient alors que la plupart des acteurs du secteur tablaient sur une dépréciation progressive sur quatre à sept ans. Les raisons avancées sont multiples : une pénurie générale de puces haut de gamme, l'émergence des modèles de raisonnement de décembre 2025, et l'amélioration spectaculaire des logiciels d'inférence, qui rendent une puce de quatre ans beaucoup plus efficace qu'elle ne l'était à sa sortie. Ce retournement a des implications directes sur la rentabilité des centres de données spécialisés en IA. Les modèles économiques construits sur l'hypothèse d'une dépréciation rapide du matériel se trouvent bousculés : un H100 loué plus cher que prévu change profondément les équations de coût par token pour les opérateurs cloud et les startups qui ne possèdent pas leur propre infrastructure. En parallèle, Anthropic serait sur le point de bénéficier d'un financement de Google pour la construction d'un centre de données — selon le Financial Times — ce qui illustre que la compétition frontier est désormais autant une question de capacité électrique et de capital que d'algorithmes. Ce contexte tendu se double d'une semaine chargée pour Anthropic : une fuite interne sur un système baptisé « Claude Mythos » a révélé l'existence d'un nouveau niveau d'abonnement nommé Capybara, décrit comme supérieur à Claude Opus 4.6, plus grand et plus intelligent, avec des scores nettement améliorés en programmation, raisonnement académique et cybersécurité. Le déploiement serait freiné par des contraintes de coût et de sécurité, et la spéculation va bon train autour d'un modèle de classe 10 000 milliards de paramètres évoqué par le PDG Dario Amodei. Pendant ce temps, côté open source, Zhipu a ouvert l'accès à GLM-5.1 à tous les utilisateurs de son offre coding, et la communauté constate que l'écart entre modèles fermés et ouverts n'a jamais été aussi réduit. Des utilisateurs rapportent avoir remplacé des abonnements TTS payants par des modèles locaux comme Qwen 3.5 14B, ou avoir fait tourner Qwen3.5-35B dans 24 Go de VRAM avec seulement 1 % de perte de performance grâce à la quantification — signe que l'économie de l'inférence locale devient viable pour un nombre croissant de cas d'usage professionnels.

UELa hausse des prix des H100 alourdit les coûts d'exploitation des opérateurs cloud et startups européens sans infrastructure propre, fragilisant les modèles économiques construits sur une dépréciation rapide du matériel.

InfrastructureActu
1 source
L'avenir de l'IA entre ouverture et propriétaire
494NVIDIA AI Blog 

L'avenir de l'IA entre ouverture et propriétaire

L'intelligence artificielle s'impose comme l'infrastructure technologique centrale de notre époque, portée par un écosystème diversifié de modèles — grands et petits, ouverts et propriétaires, généralistes et spécialisés. Lors d'une session spéciale consacrée aux modèles ouverts à la conférence NVIDIA GTC, Jensen Huang, fondateur et PDG de NVIDIA, a résumé la situation en une phrase : « Propriétaire versus open source n'est pas un débat. C'est propriétaire et open source. » Pour illustrer cet engagement, NVIDIA a annoncé la création de la Nemotron Coalition, une collaboration mondiale inédite regroupant des laboratoires d'IA et des développeurs de modèles pour faire avancer les modèles fondamentaux ouverts. Le premier projet issu de cette coalition sera un modèle de base codéveloppé par Mistral AI et NVIDIA, dont les membres apporteront données, évaluations et expertise sectorielle. Les modèles Nemotron ont déjà été téléchargés plus de 45 millions de fois sur Hugging Face, plateforme sur laquelle NVIDIA est désormais la plus grande organisation avec près de 4 000 membres d'équipe. Plusieurs panels réunissant des figures majeures du secteur — dont Mira Murati (Thinking Machines Lab), Aravind Srinivas (Perplexity), Michael Truell (Cursor) et Arthur Mensch (Mistral) — ont dégagé des tendances clés. Les agents IA s'apprêtent à devenir de véritables collègues capables de mener des tâches complexes sur plusieurs jours. L'IA n'est plus un modèle unique mais un système orchestré : « ce que vous voulez, c'est une orchestra multimodale, multi-modèles et multi-cloud », a déclaré Srinivas. L'ouverture des modèles est présentée comme un moteur d'innovation indispensable, aussi bien pour les grandes entreprises que pour la recherche académique. Murati a insisté sur ce point : « il y a beaucoup d'études à mener qui ne peuvent pas être réalisées uniquement dans les grands laboratoires — c'est là que l'ouverture est précieuse, elle fait avancer la science de l'intelligence. » Cette dynamique s'inscrit dans un tournant structurel où chaque secteur — santé, finance, industrie — a besoin d'une IA adaptée à ses données et workflows spécifiques, rendant la coexistence de modèles ouverts et propriétaires non seulement inévitable, mais souhaitable pour accélérer l'innovation à tous les niveaux.

UEMistral AI, acteur français majeur, est cofondateur de la Nemotron Coalition aux côtés de NVIDIA, ce qui renforce son rôle stratégique dans l'écosystème mondial des modèles ouverts.

LLMsActu
1 source
Déployer des agents vocaux avec Pipecat et Amazon Bedrock AgentCore Runtime – Partie 1
495AWS ML Blog 

Déployer des agents vocaux avec Pipecat et Amazon Bedrock AgentCore Runtime – Partie 1

Amazon Web Services et Pipecat ont publié un guide détaillé sur le déploiement d'agents vocaux intelligents en production, s'appuyant sur la nouvelle infrastructure Amazon Bedrock AgentCore Runtime. La solution combine Pipecat, un framework open source spécialisé dans les pipelines audio temps réel, avec l'environnement serverless d'AWS pour permettre des conversations vocales naturelles sur le web, le mobile et la téléphonie. L'architecture prend en charge trois protocoles de transport réseau : WebSockets, WebRTC et l'intégration téléphonique classique. Chaque session de conversation tourne dans des microVMs isolées, avec une capacité de session continue allant jusqu'à 8 heures, et une mise à l'échelle automatique face aux pics de trafic. Le runtime impose l'usage de conteneurs ARM64 (Graviton), ce qui nécessite que les images Docker soient compilées spécifiquement pour l'architecture linux/arm64. Ce que change cette combinaison est significatif pour les équipes qui déploient des agents en production : elle élimine plusieurs problèmes récurrents liés aux architectures vocales temps réel, notamment la gigue audio, les contraintes de montée en charge, et les coûts liés au sur-provisionnement. La facturation à l'usage actif — et non à la capacité réservée — réduit directement les coûts d'infrastructure inactive. Sur le plan technique, la latence reste le défi central : une conversation naturelle exige une réponse inférieure à une seconde de bout en bout. Pour y parvenir, le système mise sur le streaming bidirectionnel à deux niveaux — entre le client et l'agent d'une part, et entre l'agent et les modèles de langage d'autre part. Le choix du modèle est déterminant : AWS recommande Amazon Nova Sonic pour les pipelines speech-to-speech, ou Nova Lite dans une approche en cascade (STT → LLM → TTS), tous deux optimisés pour minimiser le Time-to-First-Token. La plateforme intègre également de l'observabilité native pour tracer le raisonnement de l'agent et ses appels d'outils. Ce premier volet d'une série de publications s'adresse aux développeurs déjà familiers des architectures vocales en cascade et speech-to-speech. Il fait suite à un article précédent d'AWS comparant Amazon Nova Sonic aux approches en cascade, et pose les bases techniques pour les déploiements Pipecat sur AgentCore Runtime.

OutilsTuto
1 source
496ZDNET FR 

Chainguard met tout en œuvre pour rétablir la confiance dans les logiciels développés par l'IA – voici comment

Chainguard élargit son périmètre de sécurité au-delà de l'open source traditionnel pour couvrir les logiciels open-core, les compétences des agents IA et les GitHub Actions. L'entreprise cherche à restaurer la confiance dans les logiciels générés par l'IA, un enjeu critique alors que les chaînes d'approvisionnement logicielles deviennent de plus en plus automatisées. Cette extension reflète la montée en puissance des risques liés aux workflows CI/CD et aux agents IA dans les environnements de développement modernes.

UELes entreprises européennes utilisant des pipelines CI/CD et des agents IA sont concernées par ces risques de sécurité dans la chaîne d'approvisionnement logicielle.

OutilsActu
1 source
497Latent Space 

[AINews] MiniMax 2.7 : GLM-5 atteint l'état de l'art à un tiers du coût

MiniMax lance M2.7, un modèle open source chinois qui atteint les performances de GLM-5 (50 sur l'Intelligence Index d'Artificial Analysis) à seulement un tiers de son coût — 0,30 $/1,20 $ par million de tokens. Le modèle affiche 56,22 % sur SWE-Pro et 57 % sur Terminal Bench 2, se classe au-dessus de MiMo-V2-Pro et Kimi K2.5, et intègre une première capacité d'auto-évolution capable de gérer 30 à 50 % de son propre workflow de développement. Concurrent direct, Xiaomi MiMo-V2-Pro s'impose aussi comme modèle de raisonnement API-only avec 1M tokens de contexte et une efficacité token supérieure à ses pairs.

LLMsActu
1 source
Nvidia craque pour OpenClaw
498Ben's Bites 

Nvidia craque pour OpenClaw

Nvidia prévoit de générer plus de 1 000 milliards de dollars de ventes via ses puces IA phares d'ici fin 2027, et a lancé NemoClaw, une stack open source ajoutant des contrôles de confidentialité et sécurité à OpenClaw. OpenAI annonce que Codex dépasse 2 millions d'utilisateurs actifs hebdomadaires et que l'usage de son API a augmenté de 20 % depuis la sortie de GPT-5.4, tandis que Manus (récemment acquis par Meta) a lancé une application desktop concurrente mais avec des résultats décevants lors des tests. La fenêtre de contexte d'un million de tokens de Claude est désormais disponible en général.

UELe lancement de NemoClaw avec contrôles de confidentialité et sécurité pourrait faciliter l'adoption des outils Nvidia dans les entreprises européennes soumises au RGPD.

LLMsActu
1 source
Comment l'économie de l'IA multi-agents influence l'automatisation des entreprises
499AI News 

Comment l'économie de l'IA multi-agents influence l'automatisation des entreprises

NVIDIA a lancé Nemotron 3 Super, une architecture open source de 120 milliards de paramètres (12 milliards actifs) conçue pour les systèmes d'IA multi-agents en entreprise, offrant jusqu'à 5× plus de débit et 2× plus de précision que son prédécesseur. Le modèle combine des couches Mamba, des transformers classiques et une technique d'experts spécialisés pour réduire les deux principaux freins à l'automatisation : la « taxe de raisonnement » (coût élevé des agents autonomes) et l'explosion du contexte (jusqu'à +1 500 % de tokens par rapport aux formats standards). Avec une fenêtre de contexte d'un million de tokens, les agents peuvent charger un codebase entier ou des milliers de pages de rapports financiers en mémoire, éliminant la dérive d'objectif et accélérant l'inférence jusqu'à 4× par rapport aux configurations FP8 sur Hopper.

BusinessOutil
1 source
Ai2 : développer une IA physique grâce aux données de simulation virtuelle
500AI News 

Ai2 : développer une IA physique grâce aux données de simulation virtuelle

L'Allen Institute for AI (Ai2) a développé MolmoBot, un modèle de manipulation robotique entraîné entièrement sur des données synthétiques, sans recourir aux démonstrations téléopérées coûteuses utilisées par des projets comme RT-1 de Google DeepMind (130 000 épisodes sur 17 mois). Grâce à leur système MolmoSpaces et au moteur physique MuJoCo sur 100 GPU Nvidia A100, l'équipe a généré 1,8 million de trajectoires d'entraînement, soit un débit 4 fois supérieur à la collecte réelle. Cette approche, selon le CEO Ali Farhadi, vise à démocratiser la robotique en offrant des outils open source à toute la communauté de recherche mondiale.

RobotiquePaper
1 source