Aller au contenu principal

Dossier Open weight & Open source — page 11

831 articles · page 11 sur 17

Le mouvement open-weight : DeepSeek, Mistral, Gemma, Qwen et Llama. La fracture stratégique entre laboratoires fermés et écosystème ouvert.

Le benchmark de Datalab Marker v2 face à MinerU, Docling et Liteparse
501MarkTechPost OutilsOutil

Le benchmark de Datalab Marker v2 face à MinerU, Docling et Liteparse

Datalab a publié Marker 2, une réécriture complète de son pipeline open source de conversion de documents. L'outil transforme des fichiers PDF, image, PPTX, DOCX, XLSX, HTML et EPUB en Markdown, JSON, HTML ou en chunks structurés. Cette nouvelle version s'appuie sur trois composants développés ces derniers mois par l'équipe Datalab: Surya OCR 2, un modèle léger de détection de mise en page de 20 millions de paramètres, et une version reconstruite de pdftext, trois fois plus rapide que la précédente. Le résultat principal provient du benchmark olmOCR-bench, développé par Allen AI (Ai2): le mode "balanced" de Marker 2 obtient un score global de 76,0% et de 83,5% sur les PDF nativement numériques, avec un débit soutenu de 2,9 pages par seconde sur un seul GPU B200. À titre de comparaison, MinerU, avec son moteur "pipeline", plafonne à 72,7% pour 0,54 page par seconde, tandis que Docling atteint 50,3% à 2,1 pages par seconde sur le même test. Marker 2 propose désormais trois modes de conversion distincts. Le mode balanced confie la mise en page au VLM Surya et relance l'OCR sur la page entière dès que le texte intégré est de mauvaise qualité: c'est le mode le plus précis, calibré pour tourner sur GPU. Le mode fast utilise un détecteur de mise en page léger (rf-detr/onnx) combiné à pdftext, avec un recours minimal et ciblé au VLM, pour 66,6% de score mais un coût bien plus faible. Le mode --disableocr se contente d'extraire le texte natif sans aucun appel au VLM et tourne entièrement sur CPU, avec 43,6% de score mais un débit de 23,7 pages par seconde. Le choix du mode est désormais automatique selon le matériel disponible. Sur le plan architectural, de nombreux processus CPU légers partagent désormais un seul serveur d'inférence Surya, ce qui permet au débit de suivre la capacité du serveur plutôt que la mémoire vidéo de chaque processus: Datalab indique que le mode balanced atteint ainsi environ 2,9 pages par seconde en charge concurrente, contre 0,3 page par seconde en traitement isolé sur le même matériel. Cette architecture rend Marker 2 pertinent aussi bien pour les équipes disposant de GPU que pour celles limitées au CPU. Le benchmark olmOCR-bench repose sur 1403 PDF et environ 8400 tests de réussite ou d'échec, répartis sur huit catégories couvrant le rendu des formules mathématiques, la structure des tableaux, l'ordre de lecture, les en-têtes et pieds de page, ou encore les anciens documents scannés. Toutes les mesures proviennent des propres tests de Datalab, reproductibles via le dépôt Marker qui inclut aussi des scripts pour MinerU, Docling et LiteParse. Face à MinerU, son concurrent le plus proche architecturalement, Marker 2 balanced devance de peu sur les PDF nativement numériques (83,5% contre 83,3%) mais creuse un écart net en débit, 5,4 fois supérieur pour un score plus élevé. Cette mise à jour s'accompagne de changements techniques à anticiper avant migration: Python 3.10 minimum, passage de Poetry à uv avec hatchling comme backend de build, et suppression du convertisseur d'extraction structurée, remplacé par l'API hébergée ou l'option --usellm.

1 source
« Évaluer les agents IA : un modèle de production avec Strands et AgentCore »
502AWS ML Blog 

« Évaluer les agents IA : un modèle de production avec Strands et AgentCore »

Motorway, une place de marché britannique de voitures d'occasion en ligne, organise chaque jour une enchère où jusqu'à 8 000 concessionnaires se disputent jusqu'à 2 500 véhicules. L'entreprise a collaboré avec l'équipe AWS Prototyping and AI Customer Engineering (PACE) pour développer un agent IA de recherche de stock destiné à ses concessionnaires, capable de remplacer des heures de filtrage manuel par de simples requêtes en langage naturel. Ensemble, elles ont construit un pipeline d'évaluation de bout en bout qui a fait chuter le taux de résultats erronés d'une requête sur huit à une sur cinquante, tout en réduisant le temps de détection des problèmes de plusieurs heures à quelques minutes seulement. L'agent repose sur le SDK Strands Agents combiné à Amazon Bedrock AgentCore, le service entièrement géré d'AWS pour déployer et exploiter des agents IA à grande échelle. Il expose huit outils associant un filtrage structuré sur plus de 89 attributs de véhicules à une recherche par similarité vectorielle, propulsée par la base LanceDB et les embeddings Amazon Titan Text Embeddings V2. Un concessionnaire peut désormais demander « des SUV diesel à moins de 25 000 livres près de mon site » ou « quelque chose de sportif et automatique pour une famille », plutôt que de parcourir des fichiers CSV et des filtres rigides pendant des heures. Le système absorbe environ 1 500 utilisateurs simultanés aux heures de pointe. Cette fiabilité n'est pas un détail cosmétique : de l'argent réel est en jeu à chaque enchère. Une erreur de sélection d'outil par l'agent renvoie de mauvais résultats et érode la confiance des concessionnaires ; une mauvaise interprétation sémantique fait remonter des annonces hors sujet ; une dérive du contexte au fil d'une conversation à plusieurs tours fait perdre les critères affinés par l'utilisateur ; et la nature non déterministe des réponses rend les tests à essai unique peu fiables. Une requête aussi banale que « voitures essence, hybrides et électriques de moins de cinq ans » exige déjà que l'agent interprète correctement plusieurs contraintes combinées. Sans méthode d'évaluation rigoureuse, ces failles restent invisibles jusqu'à ce qu'un concessionnaire tombe sur un résultat absurde, avec un impact direct sur la confiance et, potentiellement, sur les transactions. AWS a publié un dépôt compagnon documentant une méthodologie transposable à d'autres agents, au-delà de son propre écosystème. Elle repose sur une évaluation en deux temps : des tests réalisés en amont du déploiement avec la bibliothèque open source strands-agents-evals, puis une surveillance en production via Amazon Bedrock AgentCore Evaluations. S'y ajoute un cadre à trois niveaux, évaluant l'usage des outils, le raisonnement et la qualité des réponses, ainsi qu'un pipeline de déploiement en cinq étapes doté de portes de qualité qui bloquent une mise en production si les métriques passent sous un seuil défini, notamment via l'indicateur pass^k mesurant la constance des réponses. Le déploiement initial prend de 30 à 45 minutes, son adaptation à un autre domaine deux à trois heures, pour un coût d'environ 5 à 10 dollars de calcul via Bedrock. Le dépôt applique par ailleurs des rôles IAM à privilèges minimaux et stocke les clés API dans AWS Systems Manager Parameter Store plutôt que dans des variables d'environnement.

OutilsActu
1 source
Brex a bâti sa politique sur les agents IA en observant leur comportement réel, plutôt qu'en fixant des règles a priori
503VentureBeat AI 

Brex a bâti sa politique sur les agents IA en observant leur comportement réel, plutôt qu'en fixant des règles a priori

Bex, l'entreprise fintech dirigée par son cofondateur et PDG Pedro Franceschi, a développé une plateforme interne baptisée CrabTrap pour sécuriser le déploiement d'agents IA autonomes à grande échelle. Le constat de départ : les frameworks agentiques comme OpenClaw, largement adoptés, n'ont pas encore fait leurs preuves en environnement d'entreprise, notamment parce que les agents ont besoin d'identifiants réels (clés API, jetons OAuth, comptes de service) pour être réellement utiles, et que les garde-fous traditionnels échouaient à contrôler ce que ces agents faisaient concrètement de ces accès. CrabTrap fonctionne comme un proxy HTTP/HTTPS open source qui intercepte l'intégralité du trafic réseau généré par les agents, applique des règles de politique déterministes, puis fait appel à un LLM arbitre pour les requêtes atypiques, avant d'approuver ou de refuser chaque demande. Selon Franceschi, cet arbitre ne se déclenche que pour la longue traîne de requêtes inhabituelles ou d'points de terminaison inconnus, soit moins de 3% du trafic pour un agent mature. Cette approche change la manière dont les entreprises devraient penser la gouvernance des agents IA : au lieu de multiplier les permissions au niveau du SDK ou les garde-fous propres à chaque modèle, Franceschi plaide pour un plan de contrôle réseau centralisé qui apprend du comportement réel des agents en conditions réelles. Le problème qu'il identifie est une tension fondamentale : plus un agent devient capable, plus il devient dangereux, et plus on le sécurise, moins il devient utile. Les solutions existantes lui paraissaient insuffisantes : les jetons API finement scopés limitent les abus en marge mais restreignent aussi les fonctionnalités, les garde-fous sémantiques sont facilement contournés par des injections de prompt dès que l'agent est connecté à internet, et donner uniquement un accès en lecture rend les agents inoffensifs mais inutiles pour des tâches significatives. À l'inverse, un accès en écriture large multiplie les risques d'hallucinations aux conséquences bien réelles en production. Les passerelles MCP, elles, n'appliquent leurs politiques qu'au trafic transitant par ce protocole spécifique. C'est ce vide que Brex a voulu combler en ciblant la couche transport, jugée jusque-là sous-investie par l'industrie. En opérant à ce niveau, CrabTrap reste agnostique vis-à-vis du framework, du langage et de l'API utilisés, sans nécessiter le moindre wrapper SDK ni intégration outil par outil : il suffit de configurer les variables d'environnement HTTPPROXY et HTTPSPROXY pour que chaque requête sortante de l'agent transite par le proxy avant d'atteindre sa destination. Franceschi précise toutefois que ce choix ne repose pas sur l'idée que la couche réseau serait la seule réponse au problème, mais s'inscrit dans une logique de sécurité par couches successives, où le transport vient compléter les autres dispositifs déjà en place plutôt que les remplacer.

💬 CrabTrap, c'est l'aveu qu'on cherchait la sécurité au mauvais étage depuis deux ans : tout le monde peaufinait des garde-fous côté modèle, alors que le vrai verrou passe par le réseau, la seule couche qu'un agent ne peut pas contourner pour être utile. Moins de 3% du trafic qui remonte jusqu'à l'arbitre LLM chez un agent mature, ça dit une chose simple : sécuriser l'intention d'un agent, c'est du flan dès qu'il touche à internet, sécuriser sa tuyauterie, ça marche. Reste à voir si Brex ouvre vraiment le code sérieusement ou si c'est de la com, mais déplacer le problème vers la couche transport, c'est le genre de pragmatisme qu'on attendait depuis un moment.

SécuritéActu
1 source
Roblox Build, une IA créateur de jeux sur mobile ! Tout savoir
504Le Big Data 

Roblox Build, une IA créateur de jeux sur mobile ! Tout savoir

Roblox a dévoilé Build, un nouvel outil de création intégré directement à son application mobile, qui permet de générer un jeu jouable à partir d'une simple description textuelle, sans passer par l'éditeur Roblox Studio. Il suffit à l'utilisateur de saisir le nom d'un jeu ou d'un personnage pour que le service produise un point de départ modifiable, testable et partageable entre amis. L'outil s'appuie sur une combinaison de modèles d'intelligence artificielle open source et propriétaires, capables de générer mécaniques de jeu, personnages, sons et styles visuels. David Baszucki, le dirigeant de Roblox, présente Build comme une nouvelle façon de créer directement depuis son téléphone. L'alpha publique doit s'ouvrir le 28 juillet 2026, d'abord en Nouvelle-Zélande avant une extension progressive à d'autres régions, et sera limitée aux utilisateurs vérifiés âgés d'au moins neuf ans. Une version de base restera gratuite, certaines fonctionnalités avancées devenant payantes. Cette annonce marque un tournant pour Roblox, qui compte des millions d'utilisateurs quotidiens et cherche à élargir son vivier de créateurs au-delà des studios expérimentés déjà familiers de Roblox Studio. En rendant la création aussi simple qu'un message texte, la plateforme espère abaisser radicalement la barrière technique qui freinait jusqu'ici les amateurs souhaitant concevoir leurs propres univers. Pour l'industrie du jeu vidéo, cela confirme une tendance de fond où l'IA générative devient un outil de production accessible au grand public, et pas seulement aux développeurs professionnels. Roblox précise toutefois que chaque jeu créé via Build devra passer un contrôle de sécurité avant sa diffusion aux utilisateurs de seize ans et plus, et que les productions suivront le même classement que les autres contenus de la plateforme, fondé sur la fidélisation des joueurs. L'IA fournit donc un tremplin technique, mais ne garantit ni visibilité ni succès automatique. Build s'inscrit dans la continuité du slogan historique de Roblox, "vous créez le jeu", lancé il y a près de vingt ans et désormais doté d'une portée bien plus concrète grâce à l'IA. Un projet démarré sur mobile pourra être poursuivi dans Roblox Studio puis repris ensuite sur smartphone, assurant une continuité entre les deux environnements plutôt qu'un simple gadget isolé. Parallèlement, Roblox déploie trois agents IA destinés à ses créateurs les plus actifs et déjà expérimentés sur Studio : un agent de test qui détecte les bugs avant publication, un agent d'analyse capable de répondre à des questions en langage naturel sur les données de jeu, et un agent de recommandation suggérant des ajustements pour améliorer l'engagement. Cette double stratégie, simplifier l'accès pour les novices tout en outillant davantage les équipes chevronnées, illustre la manière dont les grandes plateformes de jeu misent désormais sur l'intelligence artificielle pour stimuler à la fois le volume et la qualité des contenus générés par leurs communautés.

OutilsOutil
1 source
Les LLM sont pris dans une routine de pensée uniforme : cette startup veut les en sortir
505MIT Technology Review 

Les LLM sont pris dans une routine de pensée uniforme : cette startup veut les en sortir

Voici l'article traduit et résumé : Le studio australien Springboards a développé un modèle de langage baptisé Flint, conçu pour rompre avec l'uniformité des réponses que produisent les grands chatbots comme ChatGPT, Claude ou Gemini face à des questions ouvertes. Pip Bingemann, cofondateur et PDG de Springboards, illustre le problème avec un test simple : demander à un modèle un nombre aléatoire entre 1 et 10 renvoie presque systématiquement 7, puis 3 ou 4, puis 8 ou 9 lors des tentatives suivantes. Lors d'une démonstration, ChatGPT et Claude ont tous deux répondu 7, tandis que Flint donnait un nombre décimal comme 3,7916. Même schéma avec un type de voiture : ChatGPT et Claude citent généralement Toyota ou Honda, quand Flint propose un Ford F-150. Sur un slogan publicitaire pour les chaussures New Balance, Claude et ChatGPT ont tous deux produit "Run your way", contre "Built to last, run to win" pour Flint. Selon Bingemann, "la plupart des modèles de langage luttent contre les hallucinations, nous les accueillons à bras ouverts". Ce phénomène de conformisme, ou "groupthink", commence à attirer l'attention de la recherche. En novembre, une équipe a publié une étude intitulée "Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)", récompensée du prix du meilleur article à la conférence NeurIPS. En interrogeant 25 modèles différents, dont ceux des principales entreprises américaines ainsi que des modèles open source chinois et autres, à 50 reprises chacun sur une métaphore du temps, les chercheurs ont obtenu 1 250 réponses dont la grande majorité se résumait à des variations de "le temps est une rivière" ou "le temps est un tisserand". Kieran Browne, cofondateur et directeur technique de Springboards, explique que cette répétition est partout dès qu'on y prête attention, alors que l'interface conversationnelle donne l'illusion d'un échange personnalisé. Il cite l'exemple d'un nom de groupe de musique : la plupart des modèles proposent des mots comme "glass", "neon", "velvet" ou "static". Un test avec ChatGPT a ainsi produit une liste de 56 suggestions dominées par "Glass Harbor", "Static Empire", "Neon Hearts" et "Velvet Echo", tandis que Gemini livrait 15 propositions dont "Static Horizon". Cette homogénéité s'expliquerait par le fait que la plupart des modèles actuels sont entraînés de façon similaire, sur des données similaires, pour accomplir des tâches similaires. Si cette convergence ne pose pas de problème pour du code ou de la recherche factuelle, elle devient un frein dès qu'il s'agit de brainstorming ou de planification créative, comme organiser un voyage. En misant sur la diversité plutôt que sur la suppression des hallucinations, Springboards cherche à ouvrir un nouveau créneau face aux géants du secteur, misant sur le constat que l'information "perdue" par les modèles dominants reste accessible, mais simplement biaisée par leurs choix d'entraînement.

💬 Ça confirme un truc que je sens depuis des mois sans savoir le nommer : les grands modèles ne sont pas juste biaisés, ils sont clonés les uns sur les autres. La preuve est presque comique : demande un nombre au hasard, une marque de voiture, un slogan, et ChatGPT comme Claude sortent quasi toujours la même réponse, ce qui montre que leur créativité affichée n'est qu'une moyenne statistique déguisée en réponse originale. Le pari de Flint est malin (transformer l'hallucination en feature plutôt qu'en bug), mais je doute que ça suffise face à des géants qui, eux, ont la distribution.

LLMsPaper
1 source
La Banque d'Angleterre revoit ses règles sur l'IA autonome dans la finance
506AI News 

La Banque d'Angleterre revoit ses règles sur l'IA autonome dans la finance

Voici l'article traduit et résumé : La Banque d'Angleterre examine si son cadre réglementaire actuel peut encadrer l'usage de l'intelligence artificielle agentique dans la finance, notamment dans les paiements, le trading, la cybersécurité et les opérations internes. La vice-gouverneure Sarah Breeden, s'exprimant lors du Forum de la Banque centrale européenne au Portugal, a indiqué que les réglementations existantes n'ont pas été conçues pour des agents IA capables d'agir sans instruction humaine directe. Selon elle, exiger une supervision humaine sur chaque action de ces systèmes n'est pas réaliste en pratique. Ces agents diffèrent des outils de trading automatisés traditionnels car ils peuvent poursuivre des objectifs et prendre des décisions de façon quasi autonome. Un rapport 2026 du Cambridge Centre for Alternative Finance révèle que 81% des entreprises de services financiers interrogées adoptent l'IA à un certain niveau, et 52% des répondants du secteur intègrent déjà activement l'IA agentique, principalement pour l'automatisation des processus, la visualisation de données, l'ingénierie logicielle et la gestion des connaissances. L'usage dans le trading reste pour l'instant concentré sur des tâches opérationnelles à faible risque. Ce virage réglementaire compte car l'IA agentique change fondamentalement la nature du risque financier. Breeden a qualifié la cyber-résilience de préoccupation prioritaire pour la stabilité financière, évoquant un "changement d'échelle" dans les capacités cyber liées à l'IA : ces systèmes peuvent enchaîner des séquences d'actions à grande échelle et grande vitesse, ce qui renforce autant les défenses des équipes de sécurité que les capacités d'attaque des acteurs malveillants. Elle a souligné que les modèles open source ne sont retardés que de quatre à huit mois par rapport aux modèles fermés les plus avancés, limitant l'efficacité des restrictions de diffusion. Le FMI partage cette inquiétude : les attaques permises par l'IA peuvent se propager rapidement à travers des infrastructures numériques partagées, provoquant des perturbations simultanées chez plusieurs institutions à la fois, un scénario que les superviseurs doivent désormais anticiper plutôt que traiter au cas par cas. Cette réflexion s'inscrit dans un contexte où les autorités cherchent à adapter leurs outils de supervision face à une adoption rapide et déjà généralisée de l'IA agentique. La Banque d'Angleterre envisage un renforcement des exigences de reprise d'activité pour les systèmes centraux, avec plusieurs pistes à l'étude : permettre à une banque de reprendre les fonctions essentielles d'une autre en cas de défaillance, mettre en place des dispositifs assurant la continuité des services critiques si les systèmes centraux d'une entreprise sont compromis, ou encore doter les acteurs clés de systèmes de secours séparés capables de reconstruire rapidement une infrastructure compromise. Tobias Adrian, conseiller financier et directeur du département des marchés de capitaux du FMI, a également averti des risques sérieux que pose l'IA pour la cyber-résilience, selon Central Banking. Ces échanges illustrent une prise de conscience croissante parmi les régulateurs financiers : la question n'est plus de savoir si l'IA agentique doit être encadrée, mais comment le faire sans entraver son adoption déjà bien engagée dans le secteur.

UELes régulateurs européens suivent de près ce débat britannique sur l'encadrement de l'IA agentique dans la finance, qui pourrait influencer les futures orientations de supervision au sein de l'UE.

RégulationReglementation
1 source
Sia devient partenaire fondateur du nouvel OpenAI Partner Network
507Le Big Data 

Sia devient partenaire fondateur du nouvel OpenAI Partner Network

Le cabinet de conseil international Sia a été sélectionné comme partenaire fondateur de l'OpenAI Partner Network, un programme mondial lancé par OpenAI et soutenu par un investissement de 150 millions de dollars. Annoncée le 18 juin 2026, cette initiative réunit un cercle restreint de partenaires triés sur le volet, capables d'accompagner les entreprises dans l'adoption opérationnelle des technologies d'OpenAI. Sia rejoint ainsi ce premier cercle aux côtés d'un nombre limité d'acteurs mondiaux, une reconnaissance qui s'appuie sur une collaboration déjà établie entre les deux organisations. Le cabinet revendique des projets menés auprès d'organisations internationales de plus de 10 000 collaborateurs, notamment des déploiements de ChatGPT Enterprise à grande échelle couvrant plusieurs métiers et zones géographiques, mais aussi des accompagnements auprès de PME cherchant à intégrer l'IA dans leurs opérations quotidiennes. Ce partenariat vise à résoudre un blocage concret que rencontrent aujourd'hui la majorité des grandes entreprises : la difficulté à dépasser le stade de l'expérimentation pour extraire une valeur économique mesurable de l'IA. L'enjeu n'est plus de multiplier les pilotes et preuves de concept, mais d'intégrer des outils comme ChatGPT et Codex directement dans les flux de travail métiers, avec des objectifs chiffrés de productivité. Sia prévoit notamment d'accompagner les directions technologiques dans l'utilisation de Codex pour accélérer les cycles de développement logiciel et moderniser les pratiques d'ingénierie, tout en inscrivant ces déploiements dans des cadres de gouvernance, de sécurité et de contrôle adaptés aux exigences réglementaires et opérationnelles des grandes organisations. Ce programme s'inscrit dans une phase charnière pour OpenAI, qui cherche à structurer son marché enterprise et à garantir des déploiements réussis auprès des grands comptes, condition indispensable à la monétisation durable de ses modèles. Face à une concurrence croissante de Microsoft, Google et des acteurs open source, OpenAI mise sur un réseau de partenaires intégrateurs pour éviter que ses technologies restent cantonnées à des usages superficiels. Pour Sia, dont le positionnement sur l'IA d'entreprise s'est renforcé ces dernières années, cette intégration au sein du Partner Network consolide son rôle de prescripteur dans un marché du conseil en transformation IA en pleine consolidation. Les organisations les plus avancées ne se distinguent plus par le nombre d'outils déployés, mais par leur capacité à identifier des cas d'usage à forte valeur ajoutée et à repenser leurs processus en profondeur, une approche que Sia entend désormais industrialiser à l'échelle mondiale avec le soutien direct d'OpenAI.

UESia Partners, cabinet de conseil fondé à Paris, consolide son positionnement sur le marché français et européen en tant que partenaire officiel d'OpenAI pour accompagner les grandes organisations dans le déploiement opérationnel de ChatGPT Enterprise et Codex.

💬 Le vrai défi pour les grandes boîtes, c'est pas l'accès à l'outil, c'est de savoir quoi en faire une fois que c'est déployé. Sia rentre dans ce premier cercle OpenAI parce qu'il y a un marché massif à prendre : des milliers d'organisations coincées entre leurs POC qui ne passent jamais en prod et des directions qui réclament des résultats chiffrés. Les 150 millions derrière le programme, c'est OpenAI qui reconnaît que sa monétisation enterprise dépend de partenaires intégrateurs, pas de ses modèles seuls.

BusinessActu
1 source
MiniMax Sparse Attention (MSA) : attention block-sparse à deux branches pour un MoE de 109 milliards de paramètres
508MarkTechPost 

MiniMax Sparse Attention (MSA) : attention block-sparse à deux branches pour un MoE de 109 milliards de paramètres

MiniMax a publié MSA (MiniMax Sparse Attention), une nouvelle méthode d'attention parcimonieuse construite sur la base de l'architecture Grouped Query Attention (GQA). L'équipe de recherche l'a intégrée et testée dans un modèle Mixture-of-Experts de 109 milliards de paramètres, entraîné sur un budget de 3 000 milliards de tokens avec des données multimodales natives. Le résultat concret est MiniMax-M3, un modèle de production désormais disponible, accompagné d'un noyau d'inférence publié en open source. Le principe de MSA repose sur deux étapes : une branche Index qui sélectionne les blocs de tokens clé-valeur pertinents pour chaque requête, et une branche Principale qui applique l'attention softmax exacte uniquement sur ces blocs sélectionnés. Chaque requête consulte 16 blocs de 128 tokens, soit un budget fixe de 2 048 tokens clé-valeur, quelle que soit la longueur du contexte. Un noyau optimisé rend cette sélection 5,1 fois plus rapide que torch.topk à 128 000 tokens de contexte, et 3,7 fois plus rapide que le noyau radix-select de TileLang. L'enjeu technique est direct : l'attention standard en softmax a un coût quadratique par rapport à la longueur du contexte, ce qui signifie que doubler la fenêtre de contexte quadruple le coût de calcul. MSA court-circuite ce problème en fixant le coût par requête à O(kBk), indépendamment de la taille du contexte, là où l'attention GQA dense maintient un coût en O(N). Pour les modèles qui traitent des documents longs, du code étendu ou des corpus multimodaux, cela représente un gain concret en vitesse et en coût d'inférence. La méthode préserve par construction le contexte local immédiat de chaque requête, un bloc local étant toujours inclus dans la sélection, tout en permettant aux différents groupes d'attention de couvrir des régions éloignées du contexte de manière indépendante. La course aux longues fenêtres de contexte est l'un des fronts les plus actifs du développement des grands modèles de langage en 2025 et 2026. Plusieurs laboratoires, dont Anthropic, Google DeepMind et Meta, ont publié des travaux sur des architectures d'attention efficaces pour dépasser les 100 000 tokens. MiniMax, entreprise chinoise fondée en 2021 et valorisée à plusieurs milliards de dollars, s'impose ici avec une approche originale : plutôt que de remplacer l'attention, MSA la raffine de l'intérieur en greffant la sélection parcimonieuse sur GQA sans modifier l'architecture principale. Deux modes d'entraînement sont proposés, soit un départ depuis zéro (MSA-PT, après 40 milliards de tokens de préchauffage), soit une conversion d'un checkpoint dense entraîné sur 2 600 milliards de tokens (MSA-CPT, suivi de 400 milliards de tokens supplémentaires), ce qui facilite l'adoption par des équipes disposant déjà de modèles en production.

RecherchePaper
1 source
Qwen-RobotSuite : trois modèles d'IA incarnée pour la manipulation VLA, la modélisation du monde et la navigation
509MarkTechPost 

Qwen-RobotSuite : trois modèles d'IA incarnée pour la manipulation VLA, la modélisation du monde et la navigation

L'équipe Qwen, la division IA d'Alibaba, a publié Qwen-Robot-Suite, une collection de trois modèles d'IA incarnée destinés à la robotique. Les trois modèles sont distincts et ciblent des problèmes différents : Qwen-RobotManip est un modèle Vision-Language-Action (VLA) pour la manipulation physique, construit sur le backbone Qwen3.5-4B ; Qwen-RobotWorld est un modèle de simulation vidéo du monde réel, doté de 60 couches MMDiT et d'un encodeur Qwen2.5-VL gelé ; Qwen-RobotNav, disponible en versions 2B, 4B et 8B, est dédié à la navigation mobile et s'appuie sur Qwen3-VL. RobotManip et RobotNav sont déjà accompagnés de dépôts GitHub publics. Pour alimenter RobotManip, l'équipe a constitué un corpus d'environ 38 100 heures de données de manipulation, exclusivement issues de jeux de données open source et de vidéos humaines, dont 24 808 heures générées synthétiquement à partir de démonstrations à la première personne converties en trajectoires robotiques sur 15 plateformes différentes. Cette publication s'attaque à l'un des obstacles fondamentaux de la robotique moderne : la fragmentation des données. Chaque robot utilise des formats d'observation et d'action incompatibles, ce qui rend quasi impossible le transfert d'une politique entraînée sur un bras vers un autre. RobotManip résout ce problème via un cadre d'alignement unifié reposant sur un vecteur d'état canonique de 80 dimensions avec masquage binaire par dimension, une paramétrisation des actions en delta dans le référentiel caméra, et un mécanisme d'adaptation en contexte qui lit l'historique d'exécution récent pour identifier l'embodiment sans mettre à jour les paramètres du modèle. RobotWorld, quant à lui, utilise le langage comme interface d'action unifiée pour prédire des séquences vidéo futures, tandis que RobotNav expose une interface d'observation contrôlable pour générer des trajectoires de points de passage en navigation. Ces travaux s'inscrivent dans une course mondiale à la robotique fondationnelle, portée par des acteurs comme Google DeepMind avec RT-2, Physical Intelligence avec pi0, ou encore Tesla avec Optimus. Qwen adopte ici une stratégie modulaire plutôt qu'un modèle généraliste unique, en pariant sur la spécialisation par domaine tout en partageant un même écosystème de backbones de vision-langage. L'accent mis sur des données entièrement open source et des pipelines de synthèse automatisée indique une volonté de démocratiser l'entraînement de politiques robotiques sans dépendre de coûteuses collectes propriétaires. La mise à disposition des codes sources pour deux des trois modèles suggère que Qwen cherche à fédérer une communauté de recherche autour de ces fondations, dans un domaine ou la donnée reste le principal goulot d'étranglement.

RobotiqueOpinion
1 source
Atoms : un outil de vibe coding qui utilise des agents IA pour créer, déployer et promouvoir votre app, sans code
510MarkTechPost 

Atoms : un outil de vibe coding qui utilise des agents IA pour créer, déployer et promouvoir votre app, sans code

Atoms, un outil de création d'applications sans code, est lancé par l'équipe derrière MetaGPT, le framework multi-agents open source fort de 68 700 étoiles sur GitHub et de 11 publications dans des conférences majeures en intelligence artificielle. Plutôt qu'un simple générateur de code, la plateforme se structure comme une équipe virtuelle de huit agents spécialisés : Iris pour la recherche de marché, Emma pour la spécification produit, Bob pour l'architecture, Alex pour le développement, Sarah pour le SEO, Adrian pour les campagnes Google Ads, David pour l'analyse de données, et Mike comme chef d'équipe chargé de coordonner l'ensemble et de valider les étapes clés avec l'utilisateur. Atoms inclut également un « Race Mode » qui soumet chaque instruction à plusieurs modèles frontiers en parallèle et propose le meilleur résultat, avec une précision améliorée jusqu'à trois fois selon l'entreprise. Chaque application déployée est livrée avec authentification, base de données en temps réel, paiements Stripe et hébergement scalable en un clic. La vraie rupture qu'apporte Atoms ne porte pas sur la génération de code, désormais banalisée, mais sur l'ensemble du cycle de vie d'un produit numérique. La majorité des outils de vibe coding permettent de produire une démo convaincante, puis laissent l'utilisateur seul face au référencement, à la distribution et à la monétisation. Atoms intègre ces dimensions nativement : pages SEO générées et indexées automatiquement, campagnes Google Ads lancées et optimisées depuis la plateforme, et insights analytiques remontés par un agent dédié. Pour un entrepreneur non-technique, cela permet de passer d'une idée à un produit commercial opérationnel sans sous-traiter chaque brique séparément. Le code reste entièrement exportable ou synchronisable avec GitHub, évitant tout effet de dépendance à la plateforme. Cette approche s'inscrit dans l'essor du vibe coding, popularisé par Andrej Karpathy début 2025, qui postule que l'IA permet à quiconque de formuler une idée de construire une application sans écrire une ligne de code. MetaGPT, socle technique d'Atoms, est l'un des projets multi-agents les plus cités en recherche académique, ce qui confère à la plateforme une crédibilité rare dans un secteur souvent dominé par des startups sans ancrage scientifique. Le marché reste néanmoins très concurrentiel, avec Lovable, Bolt, Replit ou Cursor qui ciblent des segments adjacents. Atoms parie sur l'intégration verticale totale, de la validation d'idée jusqu'à l'acquisition payante, comme principal facteur de différenciation. La question ouverte reste la qualité réelle des applications en production à grande échelle, et le degré d'autonomie laissé à l'utilisateur face aux décisions stratégiques prises par les agents.

OutilsOutil
1 source
Kimi K2.7-Code réduit les tokens de raisonnement de 30 %, mais les praticiens contestent les benchmarks
511VentureBeat AI 

Kimi K2.7-Code réduit les tokens de raisonnement de 30 %, mais les praticiens contestent les benchmarks

Moonshot AI a publié cette semaine Kimi K2.7-Code, une mise à jour open source de sa famille de modèles de codage K2. Construit sur la même architecture mixture-of-experts à un trillion de paramètres que son prédécesseur K2.6, le modèle est disponible sous licence Modified MIT, téléchargeable sur HuggingFace et déployable via vLLM ou SGLang. Il s'intègre via une API compatible OpenAI, ce qui facilite la migration pour les équipes déjà en production avec K2.6. La principale promesse de Moonshot AI : une réduction de 30 % des tokens de raisonnement ("thinking tokens") par rapport à K2.6, ce qui se traduirait directement par une baisse des coûts d'inférence dans les workflows agentiques. Sur ses propres benchmarks propriétaires, l'entreprise annonce des gains de 21,8 % sur Kimi Code Bench v2, 11 % sur Program Bench et 31,5 % sur MLS Bench Lite. Sur le plan technique, le modèle génère désormais du code bas niveau en l'écrivant directement, là où K2.6 s'appuyait sur des wrappers de bibliothèques existantes, une approche censée améliorer la généralisation sur Rust, Go et Python. Le problème, soulevé immédiatement par des praticiens, est que ces chiffres proviennent exclusivement de benchmarks internes à Moonshot. Le chercheur Elliot Arledge a testé K2.7-Code face à K2.6 et à Claude Fable 5 sur KernelBench-Hard, un benchmark public spécialisé dans l'optimisation de kernels GPU, et a publié ses logs complets. Son verdict : "K2.7 est plus honnête, mais pas plus capable." Sur cinq des six problèmes testés, K2.7-Code a bien produit des kernels Triton réels là où K2.6 utilisait des wrappers, mais deux de ces kernels ont échoué à cause de bugs du modèle lui-même. Sur le kernel MoE, le score a même régressé, passant de 0,222 à 0,157 par rapport à K2.6. Claude Fable 5, lui, "arrive en tête sur chaque cellule où il n'échoue pas honnêtement", note Arledge. Sugumaran Balasubramaniyan, développeur d'un routeur de tâches pour la plateforme Hermes Agent, a interpellé Moonshot directement : "Avec tout le respect dû, chaque modèle 'progresse' de deux chiffres sur sa propre suite de tests." Il a rappelé que K2.6 ne score que 24 % sur DeepSWE, un benchmark indépendant bien plus discriminant, au même niveau que GPT-5.4-mini, et a demandé si K2.7-Code serait soumis au même test. Cette situation illustre un problème structurel dans l'évaluation des modèles de codage : la prolifération des benchmarks propriétaires rend les comparaisons quasi impossibles, tandis que des outils indépendants comme DeepSWE, qui produit un écart de 70 points entre modèles contre seulement 30 pour SWE-Bench Pro, restent sous-utilisés. Moonshot AI avait réussi une percée remarquée en avril lorsque K2.6 était arrivé en tête du classement hebdomadaire d'OpenRouter, fondé sur les décisions réelles de routage des développeurs. K2.7-Code, lui, n'a pas encore été soumis à ce type de validation externe. Pour les équipes en production, la bonne nouvelle est concrète : la réduction des tokens de raisonnement est testable immédiatement via l'API compatible OpenAI, sans refonte d'architecture. Mais la question de savoir si ces gains se maintiennent sur des tâches réelles, et si le modèle dépasse effectivement K2.6 sur des benchmarks indépendants, reste entière.

💬 Tout le monde annonce des gains à deux chiffres sur sa propre suite de tests, et Moonshot ne fait pas exception. La bonne nouvelle, c'est que la réduction de tokens de raisonnement est testable directement via l'API, sans refonte d'archi. K2.6 score 24 % sur DeepSWE au niveau de GPT-5.4-mini, alors avant de migrer, je veux voir K2.7 passer les mêmes épreuves.

LLMsOpinion
1 source
La stratégie IA de MassMutual : contrats de 12 mois, 30 % de gains de productivité, zéro dépendance
512VentureBeat AI 

La stratégie IA de MassMutual : contrats de 12 mois, 30 % de gains de productivité, zéro dépendance

MassMutual, l'un des plus grands assureurs américains, a repensé en profondeur sa stratégie d'adoption de l'intelligence artificielle en imposant une règle simple mais radicale : aucun contrat avec un fournisseur d'IA ne dépasse douze mois. Sears Merritt, directeur des systèmes d'information de MassMutual, a détaillé cette approche lors du podcast VB Beyond the Pilot, en soulignant que l'objectif est de préserver la capacité à changer de modèle à mesure que le marché évolue. Les résultats concrets sont déjà mesurables : la productivité des développeurs a augmenté d'environ 30 %, et les workflows du centre de contact client, refondus grâce à l'IA, ont vu les temps de résolution passer de dix minutes à une minute, tandis que les coûts associés sont passés de plusieurs dollars à quelques centimes par interaction. Cette architecture de la flexibilité a des implications majeures pour les directions informatiques des grandes entreprises. En évitant de s'engager sur le long terme avec un seul fournisseur, MassMutual se donne la liberté d'adopter les meilleurs outils disponibles à chaque étape, qu'il s'agisse de modèles propriétaires de pointe ou de solutions open source, que Merritt considère comme centrales dans l'évolution future de l'IA en entreprise. Chaque projet est conditionné à des critères de succès définis en amont, et non à de simples métriques d'adoption, ce qui permet de décider objectivement de passer à l'échelle ou d'abandonner une expérimentation. L'entreprise collecte également des données granulaires sur les usages, les performances des modèles et les coûts, avec l'objectif à terme d'acheminer automatiquement chaque tâche vers le modèle le plus adapté selon sa complexité et son coût. Ce positionnement s'inscrit dans un contexte où les grandes entreprises peinent à transformer leurs pilotes IA en déploiements industriels pérennes. MassMutual illustre une voie alternative : investir d'abord dans une infrastructure agnostique vis-à-vis des fournisseurs, encourager l'expérimentation interne large en donnant accès à une gamme de modèles, et accepter de payer plus cher pour un modèle plus lent quand la qualité des réponses le justifie. Pour arbitrer ces choix, l'entreprise utilise un cadre appelé "trust score", qui croise les retours des utilisateurs avec des métriques opérationnelles pour évaluer si une réponse générée par l'IA améliore réellement les résultats. À l'heure où OpenAI, Anthropic, Google et les modèles open source comme ceux de Meta se livrent une concurrence intense, MassMutual parie que la valeur durable réside moins dans le choix du bon modèle aujourd'hui que dans la capacité à en changer demain.

BusinessOpinion
1 source
Amazon Nova Sonic : évaluer un agent vocal à grande échelle, sans microphone
513AWS ML Blog 

Amazon Nova Sonic : évaluer un agent vocal à grande échelle, sans microphone

Amazon a publié le Nova Sonic Test Harness, un framework open source conçu pour automatiser les tests des agents vocaux construits sur son modèle Amazon Nova Sonic. Jusqu'ici, la seule méthode disponible pour les équipes de développement consistait à faire parler physiquement une personne à l'agent et à écouter les réponses, scénario par scénario. Avec 50 scénarios de conversation testés sur 3 personas utilisateurs distincts, cela représente 150 tests manuels, chacun prenant plusieurs minutes en temps réel. Multiplié par chaque modification de prompt ou de configuration d'outil, le coût en temps devient prohibitif. Le harness résout ce problème en simulant des conversations complètes multi-tours sans microphone, en évaluant les résultats via des techniques de jugement par LLM, et en détectant les cas d'hallucination audio, c'est-à-dire les situations où le texte généré et l'audio produit divergent, par exemple "15h00" à l'écrit contre "15h30" à l'oral. L'enjeu est considérable pour les entreprises qui déploient des agents vocaux dans des flux critiques comme la prise de rendez-vous, la gestion de commandes ou le support client. Sans framework d'évaluation automatisé, l'optimisation des prompts devient un travail à l'aveugle : impossible de savoir si une modification améliore ou dégrade le comportement de l'agent sur l'ensemble des cas d'usage avant un déploiement en production. Le harness permet désormais de lancer une suite de régression complète avant chaque mise à jour, de mesurer si l'agent gère correctement les cas limites sur des centaines de scénarios, et de détecter des régressions subtiles, comme un agent qui cesserait de confirmer une réservation, avant qu'un vrai client ne les rencontre. Les agents vocaux posent des défis techniques fondamentalement différents des chatbots textuels, ce qui explique pourquoi les outils d'évaluation existants ne s'adaptent pas directement. Les modèles speech-to-speech maintiennent une connexion full-duplex persistante avec flux audio et texte bidirectionnels simultanés, incompatible avec les outils HTTP classiques. Leurs réponses sont non-déterministes, le comportement pertinent se manifeste sur plusieurs tours de conversation, et les sessions expirent après environ huit minutes, nécessitant une gestion de la reconnexion et du replay d'historique. Amazon positionne Nova Sonic comme sa réponse aux besoins croissants des entreprises en matière d'interfaces vocales intelligentes, un marché en forte expansion où Google, Microsoft et des acteurs spécialisés comme ElevenLabs se disputent les contrats. La publication en open source du harness vise à abaisser la barrière d'adoption en offrant aux développeurs un outil de test professionnel dès le départ.

OutilsOutil
1 source
Dépasser l'IA informelle, par Carina Hong (Axiom Math)
514Latent Space 

Dépasser l'IA informelle, par Carina Hong (Axiom Math)

En 2025, Axiom, une startup fondée seulement sept mois plus tôt, a réussi à résoudre les 12 problèmes du Putnam, l'un des concours mathématiques universitaires les plus difficiles au monde, avec un score de 12/12 (8/12 dans le temps imparti). À titre de comparaison, les meilleurs étudiants humains plafonnent autour de 110/120, DeepSeek avait atteint 103/120, et la médiane des participants se situe habituellement à 0 ou 1 point. Carina Hong, PDG d'Axiom, défend une approche radicalement différente de la majorité des laboratoires d'IA : la vérification formelle des preuves mathématiques via le langage Lean, un système qui permet de valider mécaniquement qu'un raisonnement est correct, de la même façon qu'un compilateur vérifie du code. La startup a par ailleurs publié en open source AXLE, une suite d'outils interactifs basés sur Lean pour explorer et manipuler des preuves. Sur le benchmark ProofGen Verina, qui mesure la capacité à générer du code accompagné de sa preuve de correction, Axiom revendique un score de 99 % (187 sur 189). L'enjeu dépasse largement les olympiades mathématiques. En mi-2026, Claude Code d'Anthropic et Codex d'OpenAI dominent le marché du développement logiciel assisté par IA, confirmant le pari d'Anthropic sur le code. Mais Hong estime que la maîtrise du code, aussi impressionnante soit-elle, ne suffit pas à atteindre l'AGI : des lacunes subsistent dans les capacités de raisonnement rigoureux. La vérification formelle offre quelque chose qu'aucune autre approche ne fournit encore : un signal de récompense binaire et fiable pour l'entraînement par renforcement. Plutôt que de s'appuyer sur des heuristiques statistiques comme RLHF ou GRPO, un système peut simplement vérifier si une preuve est valide, exactement comme on compile et teste du code. C'est un avantage considérable pour la qualité et la fiabilité des modèles. Hong illustre sa philosophie par l'exemple de Srinivasa Ramanujan, le mathématicien autodidacte indien dont l'intuition était prodigieuse, mais qui ne formulait pas ses résultats en preuves rigoureuses. Lorsque G.H. Hardy l'a convaincu de formaliser ses démonstrations, Ramanujan a lui-même progressé, car la rigueur l'a forcé à articuler des détails qui ouvrent de nouvelles voies. Surtout, ses preuves sont devenues transmissibles et cumulables : d'autres pouvaient s'appuyer dessus pour aller plus loin. C'est précisément ce que Hong appelle "composer l'intelligence" plutôt que de l'accumuler. Dans un secteur où les grands modèles rivalisent sur des benchmarks de coding et de raisonnement général, Axiom parie que la prochaine frontière se jouera sur la capacité à produire des raisonnements vérifiables de bout en bout, une approche qui pourrait s'avérer décisive à mesure que l'IA s'attaque à des domaines exigeant une fiabilité absolue.

RecherchePaper
1 source
Data Formulator 0.7 : l'analyse de données d'entreprise par IA
515Microsoft Research 

Data Formulator 0.7 : l'analyse de données d'entreprise par IA

Microsoft Research a publié Data Formulator 0.7, une nouvelle version de son système open source d'analyse de données alimenté par l'intelligence artificielle, destiné aux équipes entreprise. Cette mise à jour introduit une fonctionnalité centrale appelée Data Connectors, qui permet d'établir des connexions persistantes et réutilisables avec une large gamme de sources de données : bases de données relationnelles, entrepôts de données, systèmes BI, stockages objets et fichiers locaux. Les connexions sont gérées de façon centralisée, avec authentification, prévisualisation et gestion des métadonnées intégrées, ce qui évite aux équipes plateforme de reconstruire manuellement les mêmes intégrations à chaque projet. Des agents IA contextuels prennent ensuite en charge la préparation des données, l'exploration analytique et la génération de visualisations, sans que les utilisateurs aient besoin de maîtriser SQL ou la programmation. L'enjeu est significatif pour les entreprises qui jonglent quotidiennement avec des données éparpillées entre dizaines d'outils hétérogènes. Jusqu'ici, avant même de commencer une analyse, les équipes devaient gérer manuellement les permissions, préparer les métadonnées et assembler des pipelines pour croiser des sources disparates. Data Formulator 0.7 réduit ce fardeau en proposant un espace de travail unifié où les agents IA ont accès à l'ensemble du contexte analytique : sources connectées, tableaux chargés, graphiques précédents et objectif de l'utilisateur. En une seule interaction, un agent peut inspecter des données, écrire et exécuter du code dans un environnement isolé, générer des spécifications de graphiques et expliquer ses résultats étape par étape. Lorsqu'une requête est ambiguë, il pose des questions de clarification avant d'agir. Cela rend l'analyse complexe accessible aux experts métier qui n'ont pas de profil technique, tout en produisant un code vérifiable et reproductible pour chaque résultat. Data Formulator est développé par Microsoft Research dans un contexte où la demande d'outils d'analyse assistée par IA explose dans les grandes organisations. Les interfaces conversationnelles classiques, comme les chatbots généralistes, montrent leurs limites face aux workflows analytiques longs et ramifiés : elles manquent de mémoire persistante, d'accès aux données d'entreprise et de continuité de contexte entre les sessions. Data Formulator 0.7 tente de combler ce fossé avec un espace de travail multimodal et itératif où les équipes peuvent affiner leurs analyses au fil du temps et les partager en interne. Le projet est open source, ce qui laisse la porte ouverte à des contributions de la communauté et à une adoption progressive dans des environnements techniques variés. La prochaine étape naturelle sera d'observer comment cette approche s'intègre avec les infrastructures de données existantes des grands groupes, notamment face à des concurrents comme Databricks, Snowflake ou les outils BI traditionnels qui développent eux aussi leurs propres couches IA.

OutilsOutil
1 source
Les journaux de requêtes SQL donnent aux agents IA le contexte nécessaire pour éviter les jointures halluccinées
516VentureBeat AI 

Les journaux de requêtes SQL donnent aux agents IA le contexte nécessaire pour éviter les jointures halluccinées

DataHub lance ce jeudi une nouvelle couche baptisée Context Intelligence, conçue pour résoudre l'un des problèmes les plus concrets des agents IA en entreprise : les erreurs de jointure sur des entrepôts de données massifs. Le déclencheur est parlant. Lorsque l'équipe data de Miro a branché ses agents IA directement sur son environnement Snowflake, ceux-ci produisaient de mauvaises réponses dans plus de 65 % des cas. La cause n'était pas le modèle de langage, mais l'absence de contexte : avec plus de 10 000 tables et aucune couche sémantique pour orienter les requêtes, les agents ne pouvaient pas savoir quelles données correspondaient à quelles questions métier. Context Intelligence répond à ce problème en exploitant les journaux de requêtes SQL existants pour construire un index sémantique, exposé ensuite aux agents via MCP, LangChain, le Google Agent Development Kit et CrewAI. La technologie s'appuie sur la même infrastructure d'extraction de logs que DataHub utilise depuis des années pour la traçabilité des données dans ses quelque 3 000 déploiements en production dans le monde. L'enjeu est considérable pour les équipes data des grandes organisations. Aujourd'hui, les agents IA qui génèrent du SQL à la volée n'ont accès qu'aux schémas bruts, sans connaître les jointures qui ont déjà fonctionné, les métriques validées par les équipes métier, ou la logique éprouvée encodée dans des années de requêtes d'analystes. Context Intelligence renverse cette logique : le moteur filtre les journaux de requêtes pour extraire ce que Shirshanka Das, co-fondateur et CTO de DataHub, appelle les "golden queries", c'est-à-dire les requêtes de haute qualité et les pipelines planifiés représentant une logique métier validée. Ces requêtes sont ensuite inversées en définitions textuelles structurées, appelées "semantic anchors", qui constituent la base de récupération dont les agents disposent avant de générer du SQL. Une couche de validation humaine, Context Hub, permet aux experts métier de réviser les définitions proposées, de résoudre les conflits entre équipes qui calculent la même métrique différemment, et de simuler l'impact des changements avant publication. DataHub est une société fondée par l'équipe qui a construit l'outil éponyme en open source chez LinkedIn, où Das a dirigé l'infrastructure data pendant près de onze ans. Le projet open source, mis à disposition du public début 2020 après six ans de développement interne, compte aujourd'hui plus de 15 000 contributeurs. PostgreSQL est la source la plus connectée dans la base mondiale de déploiements DataHub, devant MySQL, Oracle, Snowflake et Google BigQuery, avec plus de 100 sources de métadonnées supportées. Ce capital d'infrastructure est précisément ce qui distingue Context Intelligence d'une solution construite from scratch : les capacités d'extraction et de parsing de requêtes SQL mobilisées ici ont été forgées en production, pas pour ce lancement. "La couche de consommation a changé : ce ne sont plus des humains, ce sont des agents", résume Das. Le cas Miro illustre la suite logique : avec un index sémantique ancré dans l'historique réel des requêtes, les agents ont pu naviguer dans les 10 000 tables Snowflake avec une précision radicalement supérieure.

OutilsOutil
1 source
CogVLA : un modèle vision-langage-action aligné sur la cognition par routage et sparsification guidés par instructions
517arXiv cs.RO 

CogVLA : un modèle vision-langage-action aligné sur la cognition par routage et sparsification guidés par instructions

Une équipe rattachée au laboratoire JiuTian-VL a publié CogVLA (Cognition-Aligned Vision-Language-Action), une architecture VLA conçue pour réduire les coûts computationnels des modèles robotiques actuels sans sacrifier les performances. Le système repose sur trois modules successifs: EFA-Routing, qui injecte les instructions dans l'encodeur visuel pour compresser les tokens visuels de façon sélective; LFP-Routing, qui élague au niveau du LLM les tokens visuellement ancrés mais jugés non pertinents à l'action visée; et CAtten (Coupled Attention), qui combine attention causale vision-langage avec décodage d'action bidirectionnel en parallèle. Sur le benchmark LIBERO, CogVLA affiche un taux de succès de 97,4%, et 70,0% sur des tâches robotiques réelles. Comparé à OpenVLA, il réduit les coûts d'entraînement d'un facteur 2,5 et la latence d'inférence d'un facteur 2,8. Le code est publié en open source sur GitHub. L'écart entre les 97,4% obtenus sur benchmark et les 70,0% en conditions réelles mérite d'être noté: il reflète le sim-to-real gap persistant que les VLA n'ont pas encore résolu à grande échelle, et nuance les performances annoncées. Sur le fond, CogVLA s'attaque à un problème structurel du domaine: les architectures VLA actuelles, construites sur des VLM de grande taille, exigent un post-training intensif et souffrent d'une latence d'inférence qui freine leur déploiement industriel. La réduction de 2,8x de la latence est potentiellement significative pour les applications temps réel comme la manipulation sur ligne de production ou le pick-and-place à cadence élevée, bien que les conditions de test exactes ne soient pas détaillées dans le papier. La réduction de 2,5x du coût d'entraînement abaisse la barrière d'entrée pour les équipes sans infrastructure GPU de grande échelle. Les VLA (Vision-Language-Action models) représentent l'une des approches les plus actives de la robotique généraliste, associant la compréhension sémantique des LLM à la génération directe de commandes motrices. Les références du domaine incluent Pi-0 (Physical Intelligence), OpenVLA (UC Berkeley), GR00T N2 (NVIDIA) et RT-2 (Google DeepMind). CogVLA se positionne explicitement contre OpenVLA comme baseline de comparaison sur les benchmarks LIBERO. Publié sur arXiv en version 3 (identifiant 2508.21046), ce travail reste à ce stade une contribution académique: aucun partenariat industriel ni calendrier de déploiement n'est mentionné. Il s'inscrit néanmoins dans une tendance de fond visant à rendre les VLA plus légers et plus rapides, condition nécessaire pour leur adoption dans des contextes de production réels.

RobotiqueOpinion
1 source
Les fournisseurs d'inférence connaissent-ils un essor ?
518The Information AI 

Les fournisseurs d'inférence connaissent-ils un essor ?

Il y a moins d'un an, les fournisseurs d'inférence spécialisés suscitaient un scepticisme marqué dans l'industrie de l'IA. Des startups comme Fireworks AI, Baseten et Together AI, qui louent des serveurs Nvidia à des développeurs d'applications et les aident à déployer des modèles open source, avaient connu une croissance rapide, mais semblaient fragilisées face à la concurrence des grands fournisseurs cloud. Ces derniers disposent en effet d'un avantage structurel majeur : ils possèdent leurs propres puces, là où les fournisseurs d'inférence doivent d'abord les louer à AWS, Google ou Azure avant de les revendre à leurs clients, ce qui comprime mécaniquement leurs marges brutes. Pourtant, le discours dominant a changé. Ces acteurs spécialisés semblent aujourd'hui trouver leur place dans un écosystème où la demande d'inférence explose, portée par la multiplication des applications IA en production. Leur proposition de valeur, flexibilité, optimisation technique, et support des modèles open source, répond à des besoins que les clouds généralistes satisfont moins bien, notamment pour les équipes cherchant à éviter l'enfermement propriétaire et à contrôler précisément leurs coûts d'inférence. Ce retournement s'inscrit dans une dynamique plus large : avec la prolifération des modèles open source performants comme Llama ou Mistral, les développeurs disposent désormais d'alternatives crédibles aux API propriétaires d'OpenAI ou Anthropic. Les fournisseurs d'inférence se positionnent comme l'infrastructure neutre de ce marché alternatif, pariant sur le fait que la fragmentation des modèles leur garantit une demande structurelle durable face aux géants du cloud.

UELa montée en puissance des fournisseurs d'inférence open source renforce l'écosystème autour de Mistral (entreprise française), offrant aux développeurs européens une infrastructure neutre pour déployer des modèles sans dépendance aux API propriétaires.

InfrastructureOpinion
1 source
Agent vocal scalable avec Amazon Nova Sonic : multi-agents, outils et segmentation de session
519AWS ML Blog 

Agent vocal scalable avec Amazon Nova Sonic : multi-agents, outils et segmentation de session

Amazon a présenté une série de patrons architecturaux pour concevoir des agents vocaux scalables, s'appuyant sur trois composants clés : Amazon Nova Sonic, Amazon Bedrock AgentCore Runtime et le framework open source Strands Agents. Nova Sonic est un modèle de fondation capable de conduire des conversations vocales naturelles en temps réel, avec compréhension du ton et du flux conversationnel. AgentCore Runtime constitue un environnement d'hébergement serverless pour agents IA : on y déploie un agent comme contenaire, et la plateforme gère automatiquement la mise à l'échelle, l'isolation de sessions via microVM, la facturation et le streaming WebSocket bidirectionnel authentifié. Strands Agents, via sa classe BidiAgent, sert de couche d'intégration qui simplifie la gestion du cycle de vie du flux audio et le routage des appels d'outils. Trois patrons d'intégration sont détaillés pour répondre aux défis concrets des équipes : latence élevée, coordination multi-agents et gestion de l'audio en temps réel. Le premier patron, AgentCore Gateway, expose la logique métier existante comme des outils discrets appelables directement par Nova Sonic, sans couche de raisonnement intermédiaire, ce qui minimise la latence. Un exemple concret : quand un utilisateur demande son solde bancaire, le modèle sélectionne l'outil approprié, passe les paramètres et restitue le résultat vocalement en quelques centaines de millisecondes. Le deuxième patron, l'agent-as-tool ou sous-agent, permet de composer plusieurs agents spécialisés, chacun encapsulant un domaine métier distinct, l'agent principal les invoquant comme de simples fonctions. Le troisième patron, la segmentation de sessions, isole les prompts, la mémoire et les permissions selon le contexte, renforçant les frontières de sécurité tout en permettant la réutilisation des composants. Ces annonces s'inscrivent dans une tendance de fond : le passage des assistants vocaux monolithiques vers des architectures composables, où des agents légers et spécialisés collaborent plutôt qu'un seul modèle omniscient tente de tout gérer. Amazon s'aligne ici sur le protocole MCP (Model Context Protocol), standard open source en cours d'adoption dans l'industrie pour l'interopérabilité des outils d'agents. AgentCore Gateway agit comme hôte managé de serveurs MCP, identifiés par des ARN AWS. L'enjeu commercial est direct : les entreprises déployant des centres de contacts ou des assistants vocaux à grande échelle cherchent à réduire le temps avant le premier audio (time-to-first-audio) tout en maintenant fiabilité et conformité. AWS positionne ainsi Bedrock comme socle d'infrastructure pour la prochaine génération d'expériences vocales IA en production.

UELes équipes européennes déployant des centres de contact vocaux peuvent adopter ces patrons via AWS Bedrock, mais aucun acteur ou régulateur européen n'est directement impliqué.

OutilsOutil
1 source
Compresser et évaluer des LLMs affinés par instruction avec FP8, GPTQ et SmoothQuant via llmcompressor
520MarkTechPost 

Compresser et évaluer des LLMs affinés par instruction avec FP8, GPTQ et SmoothQuant via llmcompressor

Un tutoriel technique publié récemment propose une implémentation complète pour compresser et évaluer des modèles de langage ajustés par instruction, en comparant trois méthodes de quantification post-entraînement : FP8 dynamique, GPTQ W4A16, et SmoothQuant combiné à GPTQ W8A8. Le point de départ est le modèle Qwen2.5-0.5B-Instruct de l'entreprise chinoise Alibaba, utilisé en baseline FP16. L'ensemble du pipeline repose sur la bibliothèque open source llmcompressor, associée à compressed-tensors et à l'écosystème HuggingFace Transformers. Chaque variante compressée est évaluée selon cinq critères mesurables : taille sur disque, latence de génération, débit en tokens par seconde, perplexité sur WikiText-2, et qualité subjective des réponses générées. La valeur concrète de ce travail réside dans la mise en évidence des compromis réels entre performance et efficacité pour le déploiement en production. La quantification réduit la mémoire GPU nécessaire et accélère l'inférence, deux contraintes centrales pour toute équipe souhaitant servir un LLM à moindre coût. En passant de FP16 à FP8 ou à W4A16, on peut diviser la taille du modèle par deux ou plus, avec un impact variable sur la perplexité selon la méthode choisie. SmoothQuant, qui lisse les distributions d'activation avant de quantifier, permet d'appliquer une quantification 8 bits sur les poids et les activations simultanément, ce qui se traduit par un meilleur rapport qualité-compression que la quantification naïve. Pour les équipes qui doivent faire tourner des modèles sur du matériel contraint, comme un GPU T4 de Google Colab, ces différences ne sont pas théoriques mais directement opérationnelles. La quantification post-entraînement s'est imposée comme l'une des réponses pratiques à l'explosion de la taille des modèles de langage depuis 2022. Là où le fine-tuning quantifié (QAT) nécessite de réentraîner le modèle, le PTQ agit après coup sur les poids déjà entraînés, ce qui le rend bien plus accessible. Des outils comme llmcompressor, développé par la startup Neural Magic (rachetée par Red Hat en 2024), ou AWQ et GGUF popularisés par llama.cpp, ont démocratisé ces techniques. Le choix de Qwen2.5 comme modèle de référence est révélateur : avec 0,5 milliard de paramètres, il reste assez léger pour tourner sur un GPU grand public tout en étant représentatif des architectures modernes. Les prochaines étapes naturelles de ce type de travail incluent l'extension à des modèles plus grands, l'intégration de frameworks de serving comme vLLM ou TGI, et la comparaison avec des approches de pruning structuré ou de distillation.

UELes techniques de quantification présentées permettent aux équipes européennes de servir des LLMs sur du matériel contraint sans dépendre d'infrastructures cloud coûteuses, s'appuyant sur l'écosystème HuggingFace Transformers, dont la startup est à forte présence en France.

LLMsTuto
1 source
Applications de streaming vocal en temps réel avec Amazon Nova Sonic et WebRTC
521AWS ML Blog 

Applications de streaming vocal en temps réel avec Amazon Nova Sonic et WebRTC

Amazon a mis en ligne une solution combinant son modèle vocal Nova Sonic et le service Kinesis Video Streams WebRTC pour construire des applications de streaming vocal en temps réel. Nova Sonic repose sur une architecture dite "speech-to-speech" : contrairement aux pipelines traditionnels qui enchaînent reconnaissance vocale, traitement du langage et synthèse vocale en modules séparés, le modèle unifie ces trois étapes en un seul bloc, ce qui réduit significativement la latence. Il propose plusieurs styles de voix, une forte conscience contextuelle et des interfaces d'outils permettant de le connecter à des agents externes. Côté protocole, WebRTC est retenu comme couche de transport : il établit des connexions pair-à-pair directes sans plugin supplémentaire, gère automatiquement le débit adaptatif (ABR), la correction d'erreur en avance (FEC) et les problèmes de jitter, et reste compatible avec Chrome, Firefox, Safari, Edge, Android et iOS. AWS fournit également des exemples open source pour accélérer le démarrage des projets. L'intérêt de cette combinaison est concret : dans des environnements à connectivité instable, WebRTC ajuste dynamiquement le bitrate pour éviter les coupures et maintenir la qualité audio, tandis que Nova Sonic prend en charge la conversation multilingue naturelle, permettant aux utilisateurs d'interagir dans leur propre langue sans friction. Les deux services étant entièrement gérés par AWS, ils se dimensionnent automatiquement, sans que les équipes techniques aient à gérer l'infrastructure sous-jacente. Cela abaisse la barrière d'entrée pour les startups qui ne peuvent pas se permettre des efforts de compatibilité cross-browser ou des architectures de scalabilité complexes. Les cas d'usage visés sont variés : véhicules connectés avec traduction en temps réel pour les conducteurs, usines intelligentes avec communication vocale interculturelle, robotique de service client multilingue, objets connectés domestiques contrôlables vocalement dans plusieurs langues. Cette publication s'inscrit dans une compétition intense autour des interfaces vocales IA temps réel, où OpenAI avec sa Voice API, Google avec Gemini Live et des acteurs comme ElevenLabs se disputent le marché des agents conversationnels. Amazon positionne Nova Sonic comme une réponse intégrée dans son écosystème AWS, en s'appuyant sur l'infrastructure Kinesis Video Streams déjà utilisée par de nombreuses entreprises pour la vidéosurveillance et l'IoT. L'architecture présentée supporte également des intégrations avec des sources de données via RAG (Retrieval Augmented Generation), le protocole MCP (Model Context Protocol) et Strands Agents, ce qui laisse entrevoir des déploiements hybrides mêlant voix, données métier en temps réel et orchestration d'agents autonomes. La mise à disposition d'exemples open source suggère qu'AWS cherche à constituer rapidement une communauté de développeurs autour de Nova Sonic avant que la concurrence ne consolide ses propres standards.

OutilsOutil
1 source
Des agents avec recherche web grâce à Strands et Exa
522AWS ML Blog 

Des agents avec recherche web grâce à Strands et Exa

AWS a publié une intégration native entre son SDK open source Strands Agents et le moteur de recherche Exa, permettant aux agents IA d'accéder au web en temps réel sans couche de post-traitement. Cette combinaison expose deux outils principaux : exasearch, qui effectue des recherches sémantiques avec prise en charge de catégories comme les articles d'actualité, les publications de recherche ou les dépôts de code, et exaget_contents, qui récupère le contenu complet de pages web ciblées. Le SDK Strands Agents, distribué en open source par AWS, repose sur une architecture pilotée par le modèle : plutôt que de définir des workflows figés, le développeur fournit un modèle de langage, un prompt système et une liste d'outils, puis c'est le modèle lui-même qui décide quels outils appeler, dans quel ordre, et quand la tâche est accomplie. Le SDK embarque déjà plus de 40 outils préconstruits couvrant la gestion de fichiers, l'exécution de code, les API AWS, la mémoire et la recherche web. Pour les développeurs qui construisent des agents dédiés à la veille, à la vérification des faits ou à l'intelligence concurrentielle, cette intégration élimine un obstacle persistant : la plupart des API de recherche généralistes renvoient des pages HTML chargées de balisage et des snippets courts optimisés pour la navigation humaine, ce qui oblige à construire des couches supplémentaires de parsing, de nettoyage et de reclassement avant de pouvoir injecter ces données dans une fenêtre de contexte LLM. Exa résout ce problème à la source en fournissant un contenu propre, structuré et directement exploitable. Concrètement, un agent peut enchaîner plusieurs appels de recherche, accumuler les résultats dans son historique de conversation et raisonner sur l'ensemble pour produire une réponse finale, sans que le développeur n'ait à orchestrer chaque étape manuellement. Exa se distingue des moteurs traditionnels par son approche sémantique : une requête comme "startups développant des solutions climatiques" retourne effectivement des entreprises du secteur, même si leurs pages ne contiennent pas cette formulation exacte, car le moteur travaille sur la similarité de sens plutôt que sur la correspondance de mots-clés. Le SDK supporte également le Model Context Protocol (MCP), ce qui facilite l'ajout de tout nouveau serveur d'outils sans travail d'intégration supplémentaire. L'intégration Exa est disponible via le package strands-agents-tools et s'ajoute à la liste d'outils en une ligne de code. Dans un contexte où les agents IA peinent encore à accéder à des informations récentes et fiables, cette combinaison d'un framework agentique piloté par le modèle et d'un moteur de recherche conçu pour les LLM ouvre des perspectives concrètes pour des cas d'usage comme l'analyse de marché, la recherche documentaire automatisée ou le suivi de l'actualité technologique en temps réel.

OutilsOutil
1 source
9 meilleurs outils IA pour le développement piloté par les specs en 2026 : Kiro, BMAD, GSD et plus encore
523MarkTechPost 

9 meilleurs outils IA pour le développement piloté par les specs en 2026 : Kiro, BMAD, GSD et plus encore

En 2026, le développement piloté par les spécifications (SDD pour spec-driven development) s'impose comme une réponse structurelle à un problème croissant dans les équipes de développement augmentées par l'IA : générer du code rapidement ne sert à rien si ce code ne correspond pas aux besoins réels du système. Un classement des neuf outils les plus utilisés pour mettre en oeuvre cette approche met en lumière trois acteurs majeurs. AWS Kiro (kiro.dev) est un IDE agentique qui guide les développeurs en trois phases formalisées, Exigences, Design et Tâches, et produit trois artefacts structurés. Il utilise la notation EARS pour les user stories et un système de hooks événementiels qui déclenchent automatiquement des vérifications (tests, mises à jour de documentation, scans de sécurité) à chaque sauvegarde de fichier. Côté modèles, Kiro s'appuie sur un routeur automatique combinant Claude Sonnet, Qwen, DeepSeek, GLM et MiniMax. GitHub Spec Kit (93 000 étoiles, version 0.8.7 publiée le 7 mai 2026) est l'option open source la plus adoptée, compatible avec plus de 30 agents dont Claude Code, Copilot et Gemini CLI. BMAD-METHOD, lui, orchestre plus de 12 agents spécialisés couvrant l'ensemble du cycle de développement logiciel ; sa version 6.6.0, sortie le 29 avril 2026, totalise 46 700 étoiles et 5 500 forks sur GitHub. L'enjeu central de ces outils est de renverser la logique de travail habituelle : au lieu de coder d'abord et d'affiner ensuite, le développeur formalise son intention en amont, et le code devient une sortie générée à partir de cette spécification. Pour les équipes professionnelles, cela réduit significativement le risque de divergence entre ce qui est produit et ce qui était réellement attendu, un problème qui coûte cher en retours arrière et en dette technique. Kiro s'adresse aux équipes qui veulent un environnement familier (il est construit sur Code OSS), tandis que Spec Kit convient aux équipes souhaitant conserver leur IDE existant. BMAD-METHOD cible des projets plus complexes nécessitant une coordination entre rôles distincts (product management, architecture, QA, etc.). Ce mouvement vers le SDD reflète une maturité croissante dans l'usage de l'IA en développement logiciel. La première vague d'outils misait sur la vitesse brute de génération de code ; la deuxième, celle que ces neuf outils incarnent, mise sur la cohérence et la traçabilité. GitHub a résumé la philosophie de Spec Kit en une formule : le code est désormais la sortie de dernier kilomètre, l'intention est la source de vérité. BMAD introduit avec sa V6 une équipe d'agents multi-plateformes, permettant à la même configuration de fonctionner indifféremment sur Claude Code, Cursor ou Codex. La convergence de ces approches suggère que la prochaine bataille dans les outils de développement ne se jouera pas sur la qualité du code généré, mais sur la qualité des spécifications qui le précèdent.

💬 La première vague d'outils IA misait sur la vitesse brute, et on a tous couru après. Bon, résultat : du code généré en 10 minutes qu'on passe 3 heures à corriger parce que la spec était dans la tête du dev et nulle part ailleurs. Kiro et Spec Kit ne règlent pas tout, mais l'idée de formaliser l'intention avant le code, c'est le truc qu'on aurait dû faire dès le départ.

OutilsOutil
1 source
Propulser le siècle américain : Chris Wright et Ian Buck de NVIDIA sur la mission Genesis
524NVIDIA AI Blog 

Propulser le siècle américain : Chris Wright et Ian Buck de NVIDIA sur la mission Genesis

Le secrétaire américain à l'Énergie Chris Wright et Ian Buck, vice-président d'NVIDIA chargé du HPC et de l'hyperscale, se sont exprimés jeudi lors de l'AI+ Expo organisée par le SCSP à Washington. Leur message central : la compétitivité américaine dans l'intelligence artificielle passe par la maîtrise de l'énergie. Au coeur du dispositif figure la Genesis Mission, programme du Département de l'Énergie (DOE) visant à appliquer l'IA à la découverte scientifique. NVIDIA en est l'un des partenaires industriels clés, fort selon Buck de vingt ans de collaboration avec les laboratoires nationaux américains. Concrètement, NVIDIA et le DOE construisent ensemble deux supercalculateurs à l'Argonne National Laboratory : le premier, baptisé Equinox, est actuellement en cours d'installation avec 10 000 GPU Grace Blackwell ; le second, Solstice, mobilisera 100 000 GPU de la prochaine génération Vera Rubin, pour une puissance de 5 000 exaflops, soit cinq fois la capacité cumulée de l'ensemble du classement TOP500 des supercalculateurs mondiaux. NVIDIA a également entraîné un modèle open source sur 1,5 million d'articles de physique, puis affiné sur 100 000 publications dédiées à la fusion nucléaire, pour produire un agent IA interrogeable par les chercheurs du DOE. L'enjeu est double : accélérer la recherche scientifique fondamentale et résoudre, par la même occasion, le problème énergétique que l'IA elle-même crée. Wright a souligné que si les États-Unis ont triplé leur production pétrolière et doublé leur production de gaz naturel au cours des vingt dernières années, la production d'électricité, elle, a à peine progressé. Or l'électricité est précisément le vecteur énergétique dont dépend l'IA. Sans une infrastructure électrique capable de croître rapidement, ce sont les progrès de l'IA eux-mêmes qui pourraient être freinés, a prévenu le secrétaire. Pour répondre à cette contrainte, le DOE s'appuie sur les trois piliers du réseau électrique américain : gaz naturel, nucléaire et charbon. Wright a annoncé que trois petits réacteurs modulaires (SMR) entreront en service avant le 4 juillet prochain, avec de nouveaux grands réacteurs et des SMR supplémentaires attendus dans la foulée. Un bureau stratégique dédié à la fusion nucléaire a également été créé au sein du département, avec des programmes de recherche que Wright décrit comme "hyperchargés" grâce aux capacités de calcul que l'IA apporte désormais. Jensen Huang, PDG de NVIDIA, a lui résumé la chaîne de valeur de l'IA comme un gâteau à cinq couches, dont l'énergie constitue la base. La Genesis Mission incarne cette logique de boucle vertueuse : l'IA finance et accélère les sciences de l'énergie, qui à leur tour alimentent l'infrastructure dont l'IA a besoin pour continuer à progresser.

InfrastructureActu
1 source
Les agents IA ratent toutes les discussions de votre équipe. SageOX propose une infrastructure de contexte pour agents autonomes
525VentureBeat AI 

Les agents IA ratent toutes les discussions de votre équipe. SageOX propose une infrastructure de contexte pour agents autonomes

SageOX, une startup de Seattle fondée par des vétérans ayant construit l'infrastructure originale d'AWS EC2 et EBS, est sortie du mode furtif en annonçant un tour de financement de 15 millions de dollars mené par Canaan, avec la participation d'A.Capital, Pioneer Square Labs et Founders' Co-op. L'entreprise, dirigée par Ajit Banerjee, ancien ingénieur chez Hugging Face, Meta, Amazon et Apple, commercialise ce qu'elle appelle une "infrastructure de contexte agentique" : un système conçu pour garder les agents IA aussi informés que les employés humains sur les décisions, discussions et objectifs d'une équipe. La suite produit repose sur deux composants principaux : l'Ox Dot, un petit appareil physique placé dans les espaces partagés qui enregistre réunions et séances de travail d'une simple pression, et l'Ox CLI, un outil en ligne de commande open source sous licence MIT qui permet aux assistants de codage comme Claude Code ou Codex d'interroger la mémoire collective de l'équipe avant d'écrire du code. Le problème que SageOX cherche à résoudre est celui du "drift" des agents, c'est-à-dire leur tendance à s'écarter des intentions réelles de l'équipe parce qu'ils démarrent chaque tâche sans historique ni contexte. Si une équipe décide en réunion d'utiliser un schéma d'authentification précis, l'agent de codage l'ignorera complètement, sauf si quelqu'un le lui précise explicitement dans chaque prompt. L'Ox Dot capture audio, transcrit et identifie les intervenants, puis distille ces échanges en une mémoire d'équipe accessible aux humains et aux agents. Sa fonctionnalité "Auto Rewind" permet même de capturer rétrospectivement une conversation informelle qui s'est tenue sans enregistrement, évitant la perte de décisions prises lors d'échanges spontanés. La commande ox agent prime intègre ensuite cet historique directement dans le contexte de travail des agents. Le problème de l'"ingénierie du contexte" est l'un des défis majeurs non résolus de l'ère agentique. À mesure que les grands fournisseurs de modèles comme OpenAI, Anthropic ou Google descendent dans la chaîne de valeur en proposant leurs propres agents métier, la question de comment équiper ces agents d'un contexte riche et fidèle à la réalité d'une organisation reste entière. SageOX parie que la réponse n'est pas dans le prompt engineering ou la documentation statique, mais dans une couche d'infrastructure dédiée qui capte le contexte là où il se forme naturellement : conversations, tableaux blancs, standups. Ryan Snodgrass, CTO et ancien d'Amazon, pousse même plus loin en remettant en question les principes classiques de gestion de code source, estimant que les historiques "propres" de commits sont souvent contre-productifs pour les agents. La startup s'attaque ainsi à un marché encore peu balisé, à l'intersection de la collaboration d'équipe et de l'orchestration agentique.

OutilsOutil
1 source
Le problème des gobelins d'OpenAI : pourquoi il compte et comment libérer les vôtres
526VentureBeat AI 

Le problème des gobelins d'OpenAI : pourquoi il compte et comment libérer les vôtres

Le 27 avril 2026, un développeur utilisant le pseudonyme @arb8020 sur X a mis au jour un passage pour le moins étrange dans le dépôt GitHub open source de Codex, l'outil de codage d'OpenAI. Dans un fichier nommé models.json, une directive répétée quatre fois concernant GPT-5.5 ordonnait au modèle de ne jamais parler de "gobelins, gnomes, ratons laveurs, trolls, ogres, pigeons ou autres animaux ou créatures" sauf si le sujet était "absolument et sans ambiguïté pertinent" pour la requête de l'utilisateur. La publication est devenue virale en quelques heures sur Reddit et X, suscitant une vague de spéculations : des utilisateurs rapportaient que GPT-5.5 qualifiait spontanément les bugs techniques de "gremlins", ou que certains agents basés sur le modèle semblaient "obsédés par les gobelins", comme l'a illustré Barron Roth, Senior Project Manager chez Google, avec une capture d'écran de son agent OpenClaw. Sam Altman lui-même a rejoint la discussion, publiant avec humour une capture d'un prompt demandant de "lancer l'entraînement de GPT-6 avec des gobelins supplémentaires". Cette affaire dépasse le simple anecdote. Elle met en lumière les limites encore mal comprises du Reinforcement Learning from Human Feedback (RLHF), la technique centrale qui permet d'aligner les grands modèles de langage sur les préférences humaines. Comme l'ont noté des chercheurs sur Hacker News, il s'agit d'un "problème de l'éléphant rose" : interdire explicitement à un modèle de penser à quelque chose peut paradoxalement renforcer la saillance de ce concept dans son mécanisme d'attention. Pour une entreprise valorisée à plus de 300 milliards de dollars et dont les modèles sont utilisés par des millions de professionnels, voir une directive aussi surprenante s'infiltrer en production souligne à quel point le comportement émergent des LLMs reste difficile à contrôler, même avec des équipes de pointe. OpenAI a répondu dès le lendemain avec un billet de blog officiel intitulé "Where the goblins came from", apportant une explication technique. La cause n'est pas un bug classique, mais un effet de bord inattendu de la fonctionnalité de personnalisation introduite dans ChatGPT en juillet 2025. Contrairement à ce que l'on pourrait supposer, cette personnalisation (modes Professionnel, Amical, Efficace, Candide, etc.) n'est pas appliquée après l'entraînement du modèle, mais intégrée directement dans le pipeline d'entraînement de bout en bout des modèles GPT. C'est précisément cette intégration profonde qui a produit des comportements non anticipés, forçant l'équipe à ajouter des instructions correctives explicites dans le fichier de configuration. L'incident illustre un défi structurel pour tout le secteur : plus les modèles sont personnalisables et entraînés de manière holistique, plus les interactions entre objectifs distincts deviennent imprévisibles.

UELes développeurs et entreprises européens utilisant GPT-5.5 peuvent être exposés à des comportements émergents imprévus, mais l'impact reste indirect et mondial sans spécificité France/UE.

LLMsOpinion
1 source
MotionBricks : mouvements temps réel évolutifs via modèle génératif latent modulaire et primitives intelligentes
527arXiv cs.RO 

MotionBricks : mouvements temps réel évolutifs via modèle génératif latent modulaire et primitives intelligentes

Des chercheurs ont présenté MotionBricks, un nouveau cadre de génération de mouvements en temps réel capable de modéliser plus de 350 000 clips d'animation avec un seul modèle unifié. Publié sur arXiv, le système repose sur deux composants centraux : un backbone génératif modulaire à espace latent, conçu pour fonctionner sous contraintes de calcul sévères, et des "smart primitives", une interface unifiée permettant de contrôler navigation et interactions avec les objets. Les performances annoncées sont remarquables : 15 000 images par seconde à une latence de 2 millisecondes, sur des jeux de données open source et propriétaires de tailles variées. Le système a également été déployé sur le robot humanoïde Unitree G1, démontrant son applicabilité au contrôle robotique en temps réel. L'enjeu principal de MotionBricks est de combler le fossé persistant entre la recherche en synthèse de mouvement et les contraintes de production industrielle. Jusqu'ici, les méthodes génératives modernes, pourtant puissantes, se dégradaient fortement dès qu'elles devaient opérer en temps réel avec un large répertoire de compétences de mouvement. MotionBricks résout ce problème en permettant à des applications de se construire en mode "plug-and-play", comme assembler des briques, sans nécessiter de connaissances expertes en animation. Le contrôle multimodal fin, commandes de vitesse, sélection de style, keyframes précis, que les modèles existants pilotés par texte ou tags ne pouvaient pas offrir, devient ici accessible de manière intuitive. La synthèse de mouvements procédurale et les arbres d'animation traditionnels dominent encore les moteurs de jeux et la production 3D temps réel, faute d'alternatives génératives assez rapides et flexibles. Des projets comme Motion Diffusion Model ou MDM ont démontré la qualité des approches diffusion, mais butaient précisément sur les contraintes de latence. MotionBricks s'inscrit dans un courant plus large visant à rendre les modèles génératifs opérationnels en production, avec des implications directes pour l'industrie du jeu vidéo, les studios d'animation et la robotique humanoïde, un secteur en pleine accélération avec des acteurs comme Boston Dynamics, Figure AI ou Unitree.

UELes studios d'animation et développeurs de jeux vidéo européens pourraient à terme bénéficier de cette technologie pour produire des personnages animés en temps réel sans expertise spécialisée en animation.

RecherchePaper
1 source
OpenPodcar2 : un véhicule ROS2 robuste pour la recherche en conduite autonome
528arXiv cs.RO 

OpenPodcar2 : un véhicule ROS2 robuste pour la recherche en conduite autonome

Une équipe de chercheurs vient de publier les spécifications complètes d'OpenPodcar2, une plateforme de véhicule autonome open source construite à partir d'un scooter de mobilité électrique du commerce, équipé d'un toit rigide. Ce projet, qui fait suite à une première version baptisée OpenPodcar, intègre désormais une électronique renforcée et une interface complète avec ROS2, le système d'exploitation robotique de référence. La plateforme repose sur trois composants principaux : des instructions de montage détaillées accompagnées d'une liste complète de matériaux, une intégration avec la carte mécatronique généraliste OSH R4 ainsi qu'un environnement de simulation Gazebo, et enfin des implémentations logicielles de haut niveau incluant la pile nav2, qui assure la cartographie autonome (SLAM) et le pilotage du véhicule entre deux positions en évitant les obstacles. Le coût total de construction est estimé à environ 7 000 dollars avec des composants neufs, ou 2 000 dollars en réutilisant un scooter d'occasion. Le véhicule peut transporter un passager humain ou une charge équivalente à une vitesse maximale de 15 km/h. L'intérêt d'OpenPodcar2 réside dans l'équilibre qu'il propose entre utilité réelle, sécurité, coût et robustesse, un compromis rarement atteint dans ce domaine. Concrètement, le véhicule est suffisamment compact pour être garé dans un laboratoire de recherche standard, tout en étant assez solide pour envisager des cas de déploiement réels, comme un service de taxi autonome dit "dernier kilomètre" ou le transport de conteneurs de livraison dans des centres-villes. Cela ouvre des perspectives directes pour les chercheurs qui cherchent à tester des algorithmes de navigation sur un vrai véhicule sans investir des centaines de milliers de dollars. Le projet s'inscrit dans une tendance plus large de démocratisation des plateformes de recherche en véhicules autonomes. La montée en puissance de ROS2 comme standard dans la robotique mobile a rendu possible des intégrations logicielles plus stables et interopérables qu'avec la génération précédente. En abaissant drastiquement le seuil d'accès matériel et logiciel, OpenPodcar2 pourrait permettre à des laboratoires universitaires disposant de budgets limités de mener des travaux qui étaient jusqu'ici réservés à des acteurs industriels ou à de grands centres de recherche. La publication complète des plans et du code source favorise également la reproductibilité scientifique et la collaboration communautaire autour de ces systèmes.

UELes laboratoires universitaires européens à budget limité pourraient adopter cette plateforme open source pour conduire des recherches en navigation autonome sans investissement matériel prohibitif.

RobotiqueActu
1 source
Créer des agents Strands avec les modèles SageMaker AI et MLflow
529AWS ML Blog 

Créer des agents Strands avec les modèles SageMaker AI et MLflow

Amazon Web Services a publié un guide technique détaillant la construction d'agents d'intelligence artificielle en combinant trois de ses outils : le SDK open source Strands Agents, les endpoints de modèles Amazon SageMaker AI, et la plateforme d'observabilité MLflow hébergée sur SageMaker Serverless. Le SDK Strands, à approche pilotée par le modèle, permet de créer un agent fonctionnel en quelques lignes de code en associant un modèle de langage, un prompt système et un ensemble d'outils. Les modèles sont déployés via SageMaker JumpStart, un hub machine learning qui permet d'évaluer et de sélectionner rapidement des modèles de fondation selon des critères de qualité et de responsabilité prédéfinis. L'intégration de MLflow permet ensuite de tracer les appels d'agents, de versionner les modèles et d'implémenter des tests A/B entre plusieurs variantes de modèles pour en évaluer les performances à l'aide de métriques objectives. Cette architecture répond à un besoin concret des grandes entreprises qui ne peuvent pas se contenter des services de modèles entièrement gérés : contrôle précis sur les instances de calcul, politiques de mise à l'échelle, configuration réseau compatible avec les architectures de sécurité existantes, et conformité en matière de résidence des données. Là où Amazon Bedrock simplifie l'accès aux modèles de fondation en masquant l'infrastructure, SageMaker AI laisse à l'organisation la maîtrise de l'endroit et de la manière dont l'inférence se produit, ce qui est décisif pour les secteurs réglementés comme la finance ou la santé. La couche MLflow ajoute une dimension industrielle : les équipes peuvent comparer les performances de différents modèles dans des conditions réelles, réduire les coûts en sélectionnant le modèle le plus efficace pour chaque tâche, et maintenir un historique d'expériences exploitable dans le temps. La publication de ce guide s'inscrit dans une course plus large pour capter les déploiements d'agents IA en production. AWS répond ainsi à la demande croissante des équipes MLOps qui veulent bénéficier de la commodité du cloud tout en conservant une maîtrise fine de l'infrastructure, une position souvent impossible avec les APIs gérées de type Bedrock ou OpenAI. Strands Agents, rendu open source par Amazon, concurrence directement des frameworks comme LangChain ou CrewAI, avec l'avantage d'une intégration native dans l'écosystème AWS. L'accent mis sur les tests A/B et l'évaluation continue des agents signale que le secteur entre dans une phase de maturité : il ne s'agit plus seulement de faire fonctionner un agent, mais de le mesurer, le comparer, et l'améliorer de façon systématique en production.

UECette architecture de déploiement d'agents avec contrôle fin sur la résidence des données répond aux exigences du RGPD, la rendant pertinente pour les secteurs réglementés européens comme la finance et la santé.

OutilsOutil
1 source
VistaBot : manipulation robotique robuste aux points de vue grâce à la synthèse de vues spatio-temporelles
530arXiv cs.RO 

VistaBot : manipulation robotique robuste aux points de vue grâce à la synthèse de vues spatio-temporelles

Des chercheurs ont publié VistaBot, un framework de manipulation robotique ciblant un angle mort des politiques end-to-end actuelles : leur fragilité face aux changements de point de vue de caméra entre entraînement et déploiement. La préprint arXiv 2604.21914, déposée en avril 2026, décrit une architecture en trois modules : estimation de géométrie 4D, synthèse de vue par diffusion vidéo, et planification d'actions en espace latent, sans recalibration de caméra requise au moment du déploiement. Intégré dans deux politiques de référence du domaine, ACT (Action Chunking Transformer) et π₀ (la politique diffusion-based de Physical Intelligence), VistaBot améliore la métrique VGS (View Generalization Score, introduite par les auteurs) de 2,79x par rapport à ACT et de 2,63x par rapport à π₀, en simulation et en environnement réel. Le code et les modèles seront publiés en open source. La dépendance à un point de vue fixe constitue un frein structurel au déploiement des bras manipulateurs en conditions industrielles : une caméra repositionnée ou partiellement obstruée peut invalider un modèle entier sans mécanisme de compensation. VistaBot répond en synthétisant dynamiquement des vues alternatives via un modèle de diffusion vidéo, puis en planifiant les actions dans l'espace latent de ces vues synthétisées, sans recollecte de données depuis le nouvel angle. Pour un intégrateur ou un COO industriel, cela réduit directement le coût de reconfiguration sur ligne. L'introduction du VGS comble également un vide méthodologique : le domaine ne disposait pas de benchmark standardisé pour comparer la robustesse cross-view entre politiques, rendant les comparaisons entre travaux difficiles. Le problème de robustesse aux points de vue est documenté en imitation learning depuis plusieurs années, mais les solutions disponibles exigeaient soit une augmentation intensive des données, soit une calibration caméra explicite à chaque reconfiguration. Physical Intelligence, fondée en 2023, a développé π₀ comme politique généraliste de manipulation. D'autres acteurs comme Google DeepMind (RT-2 et ses successeurs), Figure AI (Figure 03) ou 1X Technologies ciblent des architectures VLA à plus large spectre sans traiter spécifiquement cet axe de robustesse aux vues. VistaBot reste une contribution académique préliminaire : la préprint n'est pas encore revue par les pairs, les tâches réelles évaluées ne sont pas décrites en détail, et les gains annoncés devront être confirmés par des reproductions indépendantes une fois le code disponible.

RobotiquePaper
1 source
Fermeture de boucle efficace en SLAM LiDAR par cartes de densité de nuages de points
531arXiv cs.RO 

Fermeture de boucle efficace en SLAM LiDAR par cartes de densité de nuages de points

Des chercheurs ont publié sur arXiv une nouvelle méthode de détection de fermeture de boucle pour les robots mobiles autonomes équipés de capteurs LiDAR, sous le nom de code MapClosures. Le système résout un problème fondamental de la cartographie robotique : lorsqu'un robot repasse par un endroit déjà visité, il doit reconnaître ce lieu et corriger l'accumulation d'erreurs de positionnement, un phénomène appelé dérive globale. La pipeline présentée génère des cartes locales à partir des nuages de points LiDAR, les aligne avec un module dédié à la gestion du terrain, puis produit des projections à vue aérienne en préservant la densité des points. Des descripteurs de caractéristiques ORB sont extraits de ces projections et stockés dans un arbre de recherche binaire pour accélérer les requêtes. Un mécanisme d'élagage par auto-similarité permet d'éviter les faux positifs dans les environnements répétitifs, comme des couloirs ou des rangées d'arbres. Le code source est disponible en open source sur GitHub, dans le dépôt PRBonn/MapClosures. L'impact de cette approche est particulièrement significatif pour les applications de robotique en extérieur, livraison autonome, inspection industrielle, véhicules tout-terrain, où la précision cartographique sur de longues distances est critique. Contrairement à de nombreuses solutions existantes qui dépendent d'un type précis de capteur ou d'un profil de mouvement spécifique, MapClosures fonctionne avec des LiDAR aux résolutions, champs de vision et patterns de scan très différents. Cela réduit considérablement les coûts d'intégration pour les équipes qui changent de matériel ou déploient plusieurs types de robots sur un même système. Le SLAM (Simultaneous Localization and Mapping) est un défi ouvert depuis plusieurs décennies en robotique, et la fermeture de boucle en est l'un des maillons les plus fragiles, surtout en environnements non structurés. Les travaux proviennent du laboratoire PRBonn, associé à l'Université de Bonn, acteur reconnu dans la recherche en perception robotique. En rendant la méthode agnostique au capteur et en publiant le code librement, les auteurs visent une adoption large dans la communauté académique et industrielle. Les prochaines étapes pourraient inclure l'intégration avec des systèmes de fusion multi-capteurs et des tests à plus grande échelle dans des environnements dynamiques urbains.

UEIssu du laboratoire PRBonn de l'Université de Bonn (Allemagne), ce travail open source renforce la compétitivité européenne en robotique mobile et peut bénéficier directement aux équipes françaises et européennes développant des robots autonomes ou des véhicules LiDAR.

RechercheActu
1 source
Créez votre premier agent en quelques minutes : nouvelles fonctionnalités d'Amazon Bedrock AgentCore
532AWS ML Blog 

Créez votre premier agent en quelques minutes : nouvelles fonctionnalités d'Amazon Bedrock AgentCore

Amazon a annoncé de nouvelles fonctionnalités pour Bedrock AgentCore, sa plateforme de développement d'agents IA, qui promettent de réduire drastiquement le temps nécessaire pour passer d'une idée à un agent fonctionnel. La pièce maîtresse de cette mise à jour est le "managed agent harness", une couche d'infrastructure gérée qui permet de déclarer et lancer un agent en trois appels d'API seulement, sans écrire de code d'orchestration. Le développeur n'a qu'à définir quel modèle utiliser, quels outils appeler et quelles instructions suivre : AgentCore assemble automatiquement le calcul, la mémoire, les identités et la sécurité. La plateforme est compatible avec les frameworks déjà en usage dans l'industrie : LangGraph, LlamaIndex, CrewAI et Strands Agents, le framework open source d'AWS qui propulse le harness. AgentCore gère également la persistance de l'état de session sur un système de fichiers durable, ce qui permet à un agent de suspendre une tâche en cours et de la reprendre exactement là où il s'était arrêté. Jusqu'ici, construire l'infrastructure sous-jacente d'un agent, compute, sandbox d'exécution de code, connexions sécurisées aux outils, stockage persistant, gestion des erreurs, représentait plusieurs jours de travail avant de pouvoir tester la moindre logique métier. Avec AgentCore, tester une variante d'agent, changer de modèle ou ajouter un outil devient une modification de configuration et non une réécriture de code. Rodrigo Moreira, VP Engineering chez VTEX, l'un des premiers utilisateurs, confirme que ce qui prenait auparavant des jours de mise en place peut désormais être validé en quelques minutes. Cette accélération du cycle de prototypage est particulièrement significative pour les équipes produit qui veulent itérer rapidement sur la logique agent sans s'embourber dans la plomberie backend. Les patterns "human-in-the-loop", souvent coûteux à implémenter, deviennent pratiques grâce à la persistance native de session, sans nécessiter de refonte architecturale ultérieure. La sortie de ces fonctionnalités s'inscrit dans une concurrence féroce entre les grands fournisseurs cloud pour capter les équipes qui industrialisent l'IA agentique. AWS fait le pari que les développeurs adoptent plus facilement un service géré s'il supprime la friction initiale tout en restant extensible : lorsque les besoins d'orchestration personnalisée ou de coordination multi-agents se précisent, il suffit de basculer d'une configuration déclarative vers du code, sur la même plateforme, avec la même pipeline de déploiement et le même isolement microVM. La prochaine étape annoncée, déployer et opérer les agents depuis le même terminal, vise à unifier le cycle complet de développement, de la première idée jusqu'à la production, dans un seul environnement sans rupture d'outil.

UELes équipes de développement françaises et européennes peuvent réduire leur temps de prototypage d'agents IA, accélérant l'industrialisation de l'IA agentique pour les entreprises du continent.

OutilsOutil
1 source
533AWS ML Blog 

Traçabilité de bout en bout avec DVC et Amazon SageMaker AI MLflow

Les équipes de machine learning en production font face à un problème récurrent : retracer précisément l'origine d'un modèle déployé. Quelle version du jeu de données l'a entraîné ? Peut-on reproduire à l'identique un modèle mis en production il y a six mois ? Amazon Web Services propose une réponse concrète en combinant trois outils : DVC (Data Version Control), Amazon SageMaker AI et SageMaker AI MLflow Apps. L'architecture s'articule en quatre étapes : un job SageMaker Processing prétraite les données brutes et les versionne via DVC en les poussant vers Amazon S3 ; un job SageMaker Training clone le dépôt DVC à un tag Git précis, récupère le dataset exact via dvc pull, entraîne le modèle et enregistre tout dans MLflow. Chaque run MLflow stocke un identifiant datagitcommit_id, soit le hash DVC pointant vers le dataset exact dans S3. Le modèle entraîné est ensuite enregistré dans le MLflow Model Registry et peut être déployé sur un endpoint SageMaker. La chaîne de traçabilité complète devient alors : modèle en production → run MLflow → commit DVC → dataset dans Amazon S3. Cet enchaînement répond à un besoin critique dans les secteurs régulés : santé, services financiers, véhicules autonomes. Dans ces domaines, les exigences d'audit imposent de relier chaque modèle déployé à ses données d'entraînement précises, et de pouvoir exclure à la demande des enregistrements individuels des futurs cycles d'entraînement. Sans ce niveau de traçabilité, une question apparemment simple, "quelles données ont servi à entraîner le modèle actuellement en production ?", peut mobiliser plusieurs jours d'enquête dans des logs dispersés, des notebooks et des buckets S3. La solution proposée réduit ce risque opérationnel en rendant la traçabilité structurelle plutôt qu'optionnelle. DVC est un outil open source gratuit qui étend Git pour gérer des datasets volumineux et des artefacts ML que Git seul ne peut pas versionner. MLflow, de son côté, assure le suivi des expériences, le registre des modèles et la lignée. Les deux outils couvrent chacun la moitié du problème de traçabilité, et leur combinaison ferme la boucle. L'implémentation requiert un compte AWS avec des permissions sur SageMaker, S3, CodeCommit et IAM, Python 3.11 ou 3.12, et le SDK SageMaker v3.4.0 minimum. Les notebooks utilisent AWS CodeCommit comme backend Git pour les métadonnées DVC, mais l'architecture est compatible avec GitHub, GitLab ou Bitbucket moyennant un simple remplacement de l'URL remote. AWS publie des notebooks d'accompagnement permettant de déployer les deux patterns décrits, traçabilité au niveau du dataset et traçabilité au niveau de l'enregistrement individuel, directement dans un compte AWS existant.

UELa traçabilité structurelle décrite répond directement aux exigences de documentation et d'auditabilité imposées par l'AI Act européen pour les systèmes d'IA à haut risque dans les secteurs régulés (santé, finance, véhicules autonomes).

OutilsTuto
1 source
IA embarquée : optimiser la mémoire pour faire tourner de grands modèles sur NVIDIA Jetson
534NVIDIA Developer Blog 

IA embarquée : optimiser la mémoire pour faire tourner de grands modèles sur NVIDIA Jetson

L'article source est tronqué (coupé après le premier paragraphe). Je vais rédiger à partir du contenu visible et des faits techniques documentés sur ce sujet, en restant factuel. --- La démocratisation des modèles d'IA générative open source crée une nouvelle pression sur les plateformes embarquées : les développeurs veulent désormais faire tourner des modèles de plusieurs milliards de paramètres directement sur des robots et agents autonomes opérant dans le monde physique, sans connexion permanente au cloud. Sur les modules NVIDIA Jetson Orin, la contrainte principale est la mémoire unifiée partagée entre CPU et GPU, plafonnée à 64 Go sur le Jetson AGX Orin et à 8 ou 16 Go sur les variantes Orin NX et Nano. Des techniques comme la quantification INT4 et INT8 via TensorRT-LLM, le paged KV cache et le flash attention permettent de faire tourner des modèles comme Llama 3 8B, Mistral 7B ou Phi-3 sur ces plateformes avec des compromis mesurés sur la précision. L'enjeu n'est pas académique : pour les intégrateurs robotiques et les OEM industriels, la capacité à exécuter un VLA (Vision-Language-Action model) localement sans latence réseau est un prérequis pour la manipulation en environnement non structuré, l'inspection autonome ou la navigation en entrepôt. La quantification agressive réduit l'empreinte mémoire d'un facteur 4 à 8x par rapport au FP16, mais introduit une dégradation de précision qu'il faut valider tâche par tâche. NVIDIA positionne cette optimisation comme un élément central de sa stack Physical AI via l'écosystème Isaac ROS. La plateforme Jetson est déployée dans des centaines de produits robotiques en production, des AMR d'entrepôt aux bras collaboratifs et drones d'inspection industrielle. Sur le segment concurrent, Qualcomm pousse ses puces RB3/RB5 avec le moteur Hexagon NPU, et Hailo (Israël) vise spécifiquement l'inférence embarquée légère. La prochaine étape pour NVIDIA sera l'intégration native de GR00T N2, son modèle de fondation humanoïde, sur Jetson Thor, une puce annoncée pour les robots humanoïdes haut de gamme et attendue dans les déploiements pilotes courant 2025-2026.

AutreOpinion
1 source
535AWS ML Blog 

Amazon SageMaker AI accélère l'inférence d'IA générative avec les instances G7e

Amazon Web Services a annoncé la disponibilité des instances G7e sur Amazon SageMaker AI, une nouvelle génération de serveurs d'inférence propulsés par les GPU NVIDIA RTX PRO 6000 Blackwell Server Edition. Ces instances sont disponibles en configurations de 1, 2, 4 et 8 GPU, chaque carte offrant 96 Go de mémoire GDDR7. Concrètement, une instance G7e.2xlarge à GPU unique peut désormais héberger des modèles open source de 35 milliards de paramètres comme Qwen3.5-35B ou GPT-OSS-120B, tandis qu'une configuration à 8 GPU (G7e.48xlarge) atteint 768 Go de mémoire GPU totale et peut faire tourner des modèles de 300 milliards de paramètres sur un nœud unique. La bande passante réseau grimpe à 1 600 Gbps via EFA, soit quatre fois plus que la génération G6e et seize fois plus que les G5. Ces chiffres ont une implication directe pour les équipes d'ingénierie : des modèles qui nécessitaient auparavant plusieurs machines interconnectées peuvent désormais s'exécuter sur un seul nœud, supprimant la latence inter-nœuds et la complexité opérationnelle associée. Les performances d'inférence sont jusqu'à 2,3 fois supérieures à celles des G6e. Pour les applications temps réel comme les chatbots, les pipelines RAG ou les workflows agentiques, cette densité mémoire combinée à une bande passante CPU-GPU quatre fois plus élevée se traduit par des temps de réponse plus courts sous charge élevée. Les modèles multimodaux et de génération d'images, souvent limités par des erreurs de mémoire insuffisante sur les générations précédentes, bénéficient également directement de ce doublement de la capacité par GPU. Cette annonce s'inscrit dans une course aux accélérateurs cloud que se livrent AWS, Google et Microsoft, chacun cherchant à proposer les GPU les plus récents de NVIDIA au plus vite après leur lancement. Les puces Blackwell de NVIDIA, dont la RTX PRO 6000 Server Edition fait partie, représentent la cinquième génération de Tensor Cores avec support natif de la précision FP4, permettant de réduire encore la consommation mémoire pour les grands modèles. Le support de NVIDIA GPUDirect RDMA via EFAv4 ouvre également la voie à des scénarios d'inférence multi-nœuds à faible latence, jusqu'ici peu pratiques sur les instances G-series. À mesure que les modèles de langage et les systèmes agentiques continuent de grossir en taille et en complexité, la capacité à les déployer efficacement sur infrastructure managée comme SageMaker devient un avantage concurrentiel décisif pour les entreprises qui cherchent à maîtriser leurs coûts d'exploitation tout en montant en puissance.

UELes équipes techniques européennes utilisant Amazon SageMaker dans les régions AWS EU peuvent désormais déployer des modèles jusqu'à 300 milliards de paramètres sur un seul nœud, réduisant la complexité opérationnelle et les coûts d'inférence pour les applications temps réel.

InfrastructureActu
1 source
NVIDIA lance Ising : sa première famille de modèles d'IA quantique ouverts pour systèmes hybrides quantique-classique
536MarkTechPost 

NVIDIA lance Ising : sa première famille de modèles d'IA quantique ouverts pour systèmes hybrides quantique-classique

NVIDIA a lancé Ising, la première famille de modèles d'IA quantique ouverts au monde, conçue pour aider chercheurs et entreprises à construire des processeurs quantiques capables de faire tourner des applications réelles. La famille comprend deux composants distincts : Ising Calibration, un modèle de langage visuel qui interprète en temps réel les mesures des processeurs quantiques et ajuste automatiquement le système pour le maintenir en fonctionnement optimal, réduisant les temps de calibration de plusieurs jours à quelques heures ; et Ising Decoding, disponible en deux variantes de réseau de neurones convolutif 3D optimisées respectivement pour la vitesse et la précision, qui effectuent le décodage d'erreurs quantiques en temps réel. Ising Decoding se montre jusqu'à 2,5 fois plus rapide et 3 fois plus précis que pyMatching, l'actuel standard open source du secteur. Dès le premier jour, des organisations comme IonQ, IQM Quantum Computers, Infleqtion, le Fermi National Accelerator Laboratory, Harvard, Sandia National Laboratories, l'Université de Chicago et une douzaine d'autres acteurs académiques et commerciaux ont déjà adopté ces outils. L'enjeu est considérable : le principal frein au déploiement concret de l'informatique quantique n'est pas la puissance brute des processeurs, mais leur extrême sensibilité aux perturbations extérieures. Les qubits, unités de calcul fondamentales, accumulent des erreurs à une vitesse qui rend tout calcul utile quasiment impossible sans une calibration rigoureuse et une correction d'erreurs en temps réel. Ces deux opérations étaient jusqu'ici manuelles, lentes et difficiles à mettre à l'échelle. En automatisant ces processus critiques par l'IA, NVIDIA s'attaque directement au goulot d'étranglement qui sépare les démonstrateurs de laboratoire des machines véritablement opérationnelles. Une réduction des temps de calibration de plusieurs jours à quelques heures représente un gain de productivité transformateur pour les équipes de recherche. Ising s'inscrit dans la stratégie plus large de NVIDIA pour positionner ses GPU au coeur de l'informatique hybride quantique-classique. Les modèles Ising complètent CUDA-Q, la plateforme logicielle de NVIDIA pour les workflows hybrides, et s'intègrent avec NVQLink, l'interconnexion matérielle GPU-QPU développée par l'entreprise pour permettre une communication à faible latence entre processeurs graphiques et unités quantiques. Cette approche suit la même philosophie que CUDA pour l'accélération GPU : coupler étroitement calcul classique et calcul accéléré. Alors que des acteurs comme IBM, Google et des startups spécialisées investissent massivement dans la course au quantique, NVIDIA parie sur une stratégie de plateforme transversale, agnostique aux technologies de qubits, qui lui permet de s'imposer comme couche d'infrastructure indispensable quelle que soit la technologie gagnante.

UEIQM Quantum Computers (Finlande, UE) figure parmi les premiers adoptants, ce qui pourrait accélérer le développement de processeurs quantiques en Europe.

💬 La calibration des qubits qui passe de plusieurs jours à quelques heures, c'est le vrai goulot d'étranglement du quantique, et c'est la première fois qu'on voit une solution à la hauteur du problème. NVIDIA fait exactement ce qu'ils ont fait avec CUDA : s'imposer comme couche d'infra incontournable avant même de savoir quelle technologie va gagner. Harvard, Fermi Lab, IQM dès le premier jour, ça ne s'invente pas.

InfrastructureActu
1 source
537AWS ML Blog 

Série Nova Forge SDK, partie 2 : guide pratique pour affiner les modèles Nova avec le mélange de données

Amazon a publié la deuxième partie de sa série de guides pratiques sur le Nova Forge SDK, consacrée au fine-tuning de ses modèles Nova grâce à une technique appelée data mixing. Le processus se déroule en cinq étapes : configuration de l'environnement, préparation des données, configuration de l'entraînement, lancement du modèle, puis évaluation. L'infrastructure requise est conséquente : le guide utilise quatre instances ml.p5.48xlarge sur Amazon SageMaker HyperPod, des machines GPU haut de gamme, accompagnées d'un cluster Kubernetes (EKS), d'un suivi d'expériences via MLflow, et d'un stockage S3. Le SDK lui-même s'installe via pip sous le nom amzn-nova-forge et s'appuie sur des outils comme HuggingFace, pandas et PyArrow. L'enjeu central de cette approche est de préserver les capacités générales d'un modèle tout en l'adaptant à un domaine métier spécifique. Amazon illustre ce point avec des chiffres concrets : en mélangeant des données clients avec des jeux de données curés par Amazon, le modèle fine-tuné a maintenu des scores quasi identiques au MMLU (un benchmark de référence en compréhension générale) tout en gagnant 12 points de F1 sur une tâche de classification "Voice of Customer" portant sur 1 420 catégories. À l'inverse, un modèle open source fine-tuné uniquement sur les données clients a perdu presque toutes ses capacités générales, un résultat rédhibitoire pour un déploiement en production. Ce guide s'inscrit dans une tendance de fond : rendre le fine-tuning de grands modèles de langage accessible aux entreprises sans qu'elles aient à sacrifier la robustesse générale de ces systèmes. Amazon, comme ses concurrents Google et Microsoft, cherche à ancrer ses clients dans son écosystème cloud en proposant des outils clés en main pour personnaliser ses modèles propriétaires. Le Nova Forge SDK est encore en accès restreint, nécessitant un onboarding spécifique et un bucket S3 privé fourni par Amazon. La complexité de l'infrastructure requise, notamment la mise en place d'un cluster HyperPod avec des instances p5, place clairement cette solution dans le segment entreprise plutôt que dans celui des équipes indépendantes. La suite de la série devrait aborder l'évaluation approfondie et le déploiement des modèles fine-tunés.

LLMsOutil
1 source
538VentureBeat AI 

NanoClaw et Vercel simplifient les règles et validations pour agents IA dans 15 applications de messagerie

NanoCo, la startup privée issue du projet open source NanoClaw, a annoncé le 17 avril 2026 un partenariat stratégique avec Vercel et OneCLI pour lancer NanoClaw 2.0, un système de contrôle humain intégré directement dans l'infrastructure des agents IA autonomes. Concrètement, ce système intercepte toute action sensible d'un agent, modification d'infrastructure cloud, envoi d'email, virement bancaire, et envoie une demande d'approbation interactive à l'utilisateur sur l'une des 15 applications de messagerie supportées : Slack, WhatsApp, Telegram, Microsoft Teams, Discord, Google Chat, iMessage, Messenger, Instagram, X, GitHub, Linear, Matrix, Email et Webex. L'utilisateur reçoit une carte native dans son application habituelle et approuve ou refuse en un seul tap. Ce mécanisme repose sur la combinaison du Chat SDK de Vercel, qui unifie le déploiement sur toutes ces plateformes depuis une seule base de code TypeScript, et du Rust Gateway d'OneCLI, qui intercepte les requêtes sortantes avant qu'elles n'atteignent le service cible. L'enjeu central de cette annonce est la résolution d'un problème de sécurité fondamental qui bloquait l'adoption enterprise des agents IA : jusqu'ici, utiliser un agent vraiment utile obligeait à lui confier des clés API réelles et des permissions larges, exposant les systèmes à des erreurs catastrophiques par hallucination ou compromission. NanoClaw 2.0 bascule d'une sécurité "au niveau applicatif", où c'est l'agent lui-même qui demande la permission, et pourrait donc manipuler l'interface, à une sécurité "au niveau infrastructure", totalement indépendante du modèle. Gavriel Cohen, cofondateur de NanoCo et ancien ingénieur chez Wix.com, résume le risque précédent ainsi : un agent malveillant ou compromis pourrait inverser les boutons "Approuver" et "Refuser" dans sa propre interface de validation. Avec le nouveau système, l'agent ne voit jamais les vraies clés API ; il manipule uniquement des clés fictives ("placeholder"), et le gateway Rust injecte les credentials réels chiffrés uniquement après approbation humaine explicite. NanoClaw avait été lancé le 31 janvier 2026 comme réponse minimaliste aux frameworks d'agents jugés trop complexes et intrinsèquement non sécurisés, notamment par leur absence de sandboxing. Les agents tournent dans des conteneurs Docker ou Apple Container strictement isolés, ce qui constitue le socle technique de toute la chaîne de contrôle. Ce partenariat avec Vercel et OneCLI représente la première tentative d'établir un standard d'infrastructure partagé pour la gouvernance des agents autonomes en entreprise, un marché encore largement non normalisé. Les cas d'usage prioritaires visés sont les équipes DevOps, qui pourraient valider des changements d'infrastructure via Slack, et les équipes finance, qui pourraient approuver des paiements batch via WhatsApp. La prochaine étape logique sera de savoir si d'autres frameworks d'agents, LangChain, AutoGen, CrewAI, adopteront des mécanismes similaires, ou si NanoClaw parviendra à s'imposer comme référence de facto pour la supervision humaine dans les pipelines agentiques d'entreprise.

SécuritéActu
1 source
539VentureBeat AI 

L'IA tient-elle ses promesses ? Transformer l'élan vers l'IA en valeur mesurable

Les grandes entreprises traversent aujourd'hui ce que Brian Gracely, directeur de la stratégie de portefeuille chez Red Hat, appelle le moment "Day 2" de l'intelligence artificielle : la phase où les pilotes cèdent la place à la production, et où les questions de coût, de gouvernance et de rentabilité deviennent plus complexes que la construction des systèmes eux-mêmes. Lors d'une session de l'AI Impact Tour de VentureBeat, Gracely a illustré cette réalité avec un exemple frappant : des clients qui détiennent 50 000 licences de Microsoft Copilot sans savoir précisément ce que leurs employés en tirent, tout en payant pour ce qu'il décrit comme "le calcul informatique le plus cher du monde, parce que ce sont des GPU". Après deux ou trois cycles budgétaires consacrés à l'IA générative, les directions d'entreprise ne demandent plus "peut-on construire quelque chose ?" mais "obtenons-nous ce pour quoi nous payons ?" Le problème central n'est pas seulement le coût brut de l'infrastructure GPU : c'est l'absence d'instrumentation permettant de relier les dépenses aux résultats concrets, rendant quasi impossible la justification des renouvellements de contrats à grande échelle. Cette prise de conscience provoque un changement stratégique profond dans la manière dont les entreprises envisagent leur rapport à l'IA. Le modèle dominant des deux dernières années, payer un fournisseur au token, au siège ou à l'appel API en lui déléguant toute l'infrastructure, est de plus en plus remis en question. Gracely résume cette évolution : plutôt que d'être purement "consommateur de tokens", certaines organisations cherchent à devenir "productrices de tokens", en évaluant quels usages justifient de posséder ou louer directement des GPU, et si les cas d'usage nécessitent vraiment les modèles les plus avancés ou si des modèles ouverts plus légers suffisent. Cette décision n'est pas binaire : elle dépend de la tolérance au risque, de la nature des charges de travail et de la maturité de chaque organisation. Le paradoxe auquel font face les responsables financiers est bien réel. Le PDG d'Anthropic, Dario Amodei, a estimé que les coûts d'inférence chutent d'environ 60 % par an, et l'émergence de modèles open source comme DeepSeek a considérablement élargi les alternatives stratégiques disponibles. Pourtant, la baisse du coût unitaire ne se traduit pas par une réduction des factures totales : l'usage s'accélère à un rythme qui compense largement les gains d'efficacité. C'est une manifestation du paradoxe de Jevons, principe économique selon lequel l'amélioration de l'efficacité d'une ressource tend à augmenter sa consommation globale plutôt qu'à la réduire. Une entreprise qui triple son utilisation de l'IA pendant que les coûts diminuent de moitié dépense encore davantage qu'avant. Pour les décideurs, cela signifie que la maturité de l'IA en entreprise passe désormais par une discipline opérationnelle rigoureuse, et non plus par l'enthousiasme des premières expérimentations.

BusinessOpinion
1 source
540MarkTechPost 

Tutoriel Google ADK : pipeline multi-agents pour chargement de données, tests statistiques, visualisation et rapports en Python

Google a publié son Agent Development Kit (ADK), un framework Python open source permettant de construire des systèmes multi-agents capables de réaliser des analyses de données complexes de bout en bout. Un tutoriel détaillé illustre comment assembler un pipeline complet en Python, en utilisant Google ADK aux côtés de bibliothèques établies comme pandas, numpy, scipy, matplotlib et seaborn, ainsi que le modèle GPT-4o-mini d'OpenAI via l'interface LiteLLM. Le système s'articule autour d'un agent analyste central qui orchestre plusieurs agents spécialisés, chacun responsable d'une tâche précise : chargement des données, exploration statistique, tests d'hypothèses, transformations de tableaux, génération de visualisations et production de rapports. L'installation ne nécessite que quelques commandes pip, et l'accès à l'API est sécurisé dès le départ via des variables d'environnement ou les secrets Colab. Ce type d'architecture multi-agents représente un changement concret dans la façon dont les data scientists et les équipes analytiques peuvent automatiser leurs flux de travail. Plutôt que d'enchaîner manuellement des scripts disparates, un agent coordinateur distribue les tâches à des spécialistes, ce qui rend le pipeline modulaire, testable et extensible sans réécriture complète. L'utilisation d'un DataStore centralisé sous forme de singleton garantit que tous les agents partagent le même état et que les résultats intermédiaires restent accessibles tout au long du processus. Pour les entreprises qui manipulent régulièrement de grands volumes de données, ce modèle réduit la friction opérationnelle et ouvre la voie à des analyses reproductibles pilotées par des LLMs, sans dépendre d'une infrastructure lourde. L'annonce s'inscrit dans une tendance plus large : depuis début 2025, plusieurs acteurs majeurs ont lancé leurs propres frameworks d'agents IA, notamment Microsoft avec AutoGen, Anthropic avec son Model Context Protocol, et OpenAI avec ses Assistants API. Google ADK se distingue par son intégration native avec l'écosystème Google Cloud et sa compatibilité avec des modèles tiers via LiteLLM, ce qui le rend agnostique au fournisseur. Le tutoriel cible explicitement un usage en production, avec gestion des erreurs, sérialisation JSON robuste et sessions en mémoire via InMemorySessionService. La prochaine étape logique serait l'intégration avec des sources de données réelles, des bases de données SQL ou des API métier, transformant ce pipeline pédagogique en socle d'une véritable plateforme d'analyse autonome.

OutilsOutil
1 source
Cognichip lève 60 M$ pour confier la conception des puces à l’IA
541Le Big Data 

Cognichip lève 60 M$ pour confier la conception des puces à l’IA

La startup américaine Cognichip a annoncé avoir levé 60 millions de dollars pour développer une intelligence artificielle capable de concevoir des puces électroniques. Ce tour de table, mené par Seligman Ventures, porte le total des fonds levés par l'entreprise à 93 millions de dollars depuis sa fondation en 2024. Parmi les nouveaux investisseurs figure Lip-Bu Tan, PDG d'Intel, qui rejoint le conseil d'administration aux côtés d'Umesh Padval, associé-gérant chez Seligman. Fondée par Faraj Aalaei, Cognichip développe un modèle d'apprentissage profond spécialisé dans la conception de semi-conducteurs, avec l'ambition affichée de réduire les coûts de développement de plus de 75 % et de diviser par deux les délais de mise sur le marché. L'enjeu est considérable : concevoir une puce moderne prend entre trois et cinq ans, dont deux ans rien que pour la phase de conception, avant même que la fabrication ne démarre. Avec des composants comme le GPU Blackwell de Nvidia intégrant 104 milliards de transistors, la complexité atteint des niveaux qui rendent ce calendrier difficilement tenable. Faraj Aalaei pointe un risque structurel : le marché évolue parfois plus vite que les puces elles-mêmes, rendant un produit potentiellement obsolète avant sa sortie. L'approche de Cognichip consiste à transposer dans le monde du silicium ce que l'IA fait déjà pour les développeurs logiciels, en automatisant les tâches répétitives et en accélérant les itérations de conception. Si les promesses se concrétisent, c'est tout le calendrier de l'industrie des semi-conducteurs qui pourrait être revu. Cognichip opère dans un secteur où les données sont rares et jalousement gardées : contrairement aux développeurs logiciels qui partagent leur code en open source, les concepteurs de puces protègent leurs travaux avec soin. Pour contourner cet obstacle, la startup a constitué ses propres jeux de données en combinant données synthétiques et contenus sous licence, tout en proposant aux fabricants des mécanismes permettant d'entraîner les modèles sur leurs données internes sans les exposer. Elle s'appuie aussi sur des standards ouverts comme l'architecture RISC-V, qu'elle a utilisée lors d'un hackathon avec des étudiants de l'Université d'État de San José. La startup reste cependant discrète sur ses avancées concrètes : aucune puce conçue avec son système n'a encore été présentée publiquement, et ses clients demeurent confidentiels. Elle devra surtout convaincre face aux géants établis du secteur, Synopsys et Cadence Design Systems, qui couvrent déjà l'intégralité du cycle de vie d'un composant avec leurs propres outils d'automatisation.

InfrastructureActu
1 source
Comment installer un modèle LLM type ChatGPT sur PC ou Mac en local ? Voici le guide ultime pour tous
542Frandroid 

Comment installer un modèle LLM type ChatGPT sur PC ou Mac en local ? Voici le guide ultime pour tous

Frandroid a publié un guide complet destiné au grand public pour installer et faire tourner un grand modèle de langage (LLM) en local, sur PC Windows ou Mac, sans nécessiter de connexion internet ni de compte sur des services cloud comme ChatGPT. Le tutoriel s'adresse explicitement aux non-spécialistes, avec des outils comme Ollama ou LM Studio qui permettent de télécharger et lancer des modèles open source en quelques commandes. L'intérêt est multiple : confidentialité totale des données, fonctionnement hors ligne, et absence de coûts d'abonnement. Pour les professionnels manipulant des documents sensibles ou les développeurs souhaitant tester des modèles sans quota d'API, l'IA locale représente une alternative sérieuse aux offres SaaS. La qualité des résultats dépend toutefois de la puissance matérielle disponible, notamment de la RAM et du GPU. Ce type de guide émerge dans un contexte où l'écosystème open source des LLM s'est considérablement démocratisé depuis 2023, porté par des modèles comme LLaMA (Meta), Mistral ou Gemma (Google). Des outils d'interface accessibles ont réduit la barrière technique, rendant l'IA locale viable pour un public bien au-delà des chercheurs et ingénieurs. La tendance devrait s'amplifier à mesure que les modèles s'optimisent pour tourner sur du matériel grand public.

UELe guide valorise explicitement Mistral (entreprise française) parmi les modèles recommandés, et répond aux préoccupations de souveraineté numérique européenne en permettant un traitement des données entièrement local, sans dépendance aux services cloud américains.

OutilsTuto
1 source
L'approbation d'une IA de détection de la dépression par la FDA n'est pas simple
543The Verge AI 

L'approbation d'une IA de détection de la dépression par la FDA n'est pas simple

La startup californienne Kintsugi, fondée il y a sept ans, vient d'annoncer sa fermeture après avoir échoué à obtenir l'autorisation de la FDA pour son outil d'intelligence artificielle capable de détecter des signes de dépression et d'anxiété dans la voix humaine. Faute de clairance réglementaire obtenue dans les délais, l'entreprise a décidé de rendre la majeure partie de sa technologie disponible en open source. Certains composants pourraient trouver une seconde vie en dehors du secteur médical, notamment pour détecter les deepfakes audio. L'évaluation de la santé mentale repose encore aujourd'hui quasi exclusivement sur des questionnaires remplis par les patients et des entretiens cliniques, contrairement à la médecine physique qui s'appuie sur des analyses biologiques ou des imageries. L'approche de Kintsugi était radicalement différente : son logiciel n'analysait pas ce qu'une personne disait, mais la manière dont elle le disait, en cherchant dans les modulations vocales des marqueurs de troubles psychiques. Cette technologie représentait une promesse réelle de dépistage précoce et objectif, accessible sans infrastructure médicale lourde. Le parcours de Kintsugi illustre la difficulté structurelle d'introduire des outils d'IA dans le domaine médical aux États-Unis. La FDA soumet les dispositifs de diagnostic à des exigences strictes de validation clinique, un processus long et coûteux qui épuise souvent les ressources des startups avant qu'elles n'atteignent le marché. L'abandon de cette technologie au profit de l'open source pourrait néanmoins permettre à des chercheurs ou d'autres entreprises de poursuivre ces travaux, dans un contexte où la détection automatisée de la santé mentale reste un enjeu médical et technologique majeur.

UELe cas Kintsugi illustre les obstacles que rencontreront les startups européennes soumises à l'AI Act, qui classe les outils d'IA diagnostique médicale en risque élevé avec des exigences de validation clinique tout aussi contraignantes.

RégulationReglementation
1 source
NVIDIA AI présente ProRL Agent : une infrastructure d'apprentissage par renforcement pour agents LLM à grande échelle
544MarkTechPost 

NVIDIA AI présente ProRL Agent : une infrastructure d'apprentissage par renforcement pour agents LLM à grande échelle

NVIDIA a présenté ProRL Agent, une infrastructure open source conçue pour entraîner des agents LLM multi-tours par apprentissage par renforcement (RL) à grande échelle. Publiée via un article de recherche (arXiv:2603.18815), cette solution adopte une philosophie « Rollout-as-a-Service » : le service de rollout fonctionne comme un serveur HTTP autonome, totalement découplé de la boucle d'entraînement. Le système s'appuie sur un pipeline asynchrone en trois étapes — initialisation des environnements sandbox, exécution des trajectoires d'agent, évaluation des résultats — chaque étape disposant de son propre pool de workers pour maximiser le débit. Pour la compatibilité avec les clusters HPC sous Slurm, ProRL Agent utilise Singularity plutôt que Docker, permettant une exécution sans droits root. Des optimisations de bas niveau réduisent drastiquement la latence des outils : remplacement de tmux par un terminal pseudo-TTY direct (latence bash réduite de 0,78 s à 0,42 s), connexion directe aux kernels IPython via API in-process, et remplacement du TCP par des sockets Unix pour la communication interne aux conteneurs. Le problème que résout cette architecture est fondamental pour quiconque entraîne des agents LLM modernes : les tâches multi-tours impliquent des interactions répétées avec des environnements externes (dépôts de code, systèmes d'exploitation, outils) qui sont intensives en I/O, tandis que la mise à jour du modèle est intensive en GPU. Les frameworks existants — SkyRL, VeRL-Tool, Agent Lightning, rLLM, GEM — fusionnent ces deux phases dans un même processus, créant des conflits de ressources qui dégradent l'efficacité matérielle et compliquent la maintenance. ProRL Agent élimine ces interférences en rendant le trainer entièrement agnostique à l'infrastructure de rollout, et introduit en prime un mécanisme de réutilisation du cache de préfixes via un load balancer min-heap sur les backends vLLM, accélérant l'inférence sur les longues séquences multi-tours. Autre innovation notable : la communication en token IDs de bout en bout, qui évite les dérives de re-tokenisation entre rollout et training — une source de bugs silencieux dans les pipelines RL existants. Ce travail s'inscrit dans une course industrielle intense pour rendre l'entraînement RL des agents LLM praticable à l'échelle. Depuis les succès de DeepSeek-R1 et des modèles de raisonnement d'OpenAI, le RL appliqué aux LLM est devenu un axe stratégique majeur, mais les infrastructures peinent à suivre la complexité des tâches agentiques longues. NVIDIA, avec ses GPU dominants dans les data centers, a un intérêt direct à proposer des solutions qui maximisent l'utilisation de son matériel. ProRL Agent inclut également une implémentation optimisée de DAPO (Dynamic Advantage Policy Optimization), un algorithme récent qui améliore la stabilité de l'entraînement. La prochaine étape sera de voir si cette infrastructure est adoptée par la communauté de recherche ou si elle reste un outil interne à NVIDIA pour ses propres expérimentations sur les agents autonomes.

RecherchePaper
1 source
Vidéo du vendredi : le robot bipède Roadrunner sort du lot
545IEEE Spectrum AI 

Vidéo du vendredi : le robot bipède Roadrunner sort du lot

Un nouveau robot bipède à roues baptisé « Roadrunner » a été dévoilé par le Robotics and AI Institute : pesant environ 15 kg, il peut basculer de manière fluide entre une configuration de roues côte à côte et une configuration en ligne, tout en intégrant des modes de marche à pied. Ses jambes entièrement symétriques lui permettent d'orienter ses genoux vers l'avant ou vers l'arrière pour contourner des obstacles. Un seul algorithme de contrôle gère l'ensemble des modes de locomotion, et plusieurs comportements complexes — comme se relever depuis le sol ou tenir en équilibre sur une seule roue — ont été déployés directement sur le matériel sans entraînement supplémentaire. En parallèle, la NASA a officialisé deux missions robotiques majeures : SkyFall, qui enverra une flotte d'hélicoptères de nouvelle génération sur Mars pour repérer des sites d'atterrissage humains et cartographier les réserves de glace souterraine, et MoonFall, qui déploiera quatre drones mobiles autour du pôle sud lunaire pour préparer l'arrivée des astronautes Artemis. Les drones lunaires opéreront de manière autonome pendant 14 jours terrestres, explorant notamment des zones constamment dans l'ombre. Par ailleurs, des chercheurs du MIT Media Lab et du Politecnico di Bari ont présenté dans Science Robotics des « muscles à fibres électrofluidiques » — des actionneurs souples qui déplacent un liquide par champ électrique, sans pièces mobiles, intégrables directement dans des textiles. Ces avancées illustrent une convergence de tendances qui redéfinissent la robotique mobile. Le Roadrunner incarne une nouvelle génération de robots à locomotion multimodale capables de s'adapter dynamiquement à leur environnement, réduisant le besoin de systèmes spécialisés distincts pour chaque terrain. Les missions SkyFall et MoonFall représentent quant à elles une montée en puissance des robots autonomes dans l'exploration spatiale : là où Ingenuity était un démonstrateur technologique unique, la NASA passe désormais à des flottes coordonnées avec des objectifs opérationnels concrets. Les muscles artificiels du MIT ouvrent une voie vers des robots portables et des exosquelettes textiles, avec des applications potentielles en médecine de rééducation et en assistance aux personnes âgées. Le contexte général est celui d'une accélération sans précédent de la recherche en robotique incarnée. Le robot quadrupède open-source MEVIUS2, comparable en taille au Spot de Boston Dynamics et capable de grimper des escaliers, montre que la robotique avancée se démocratise via l'open source. Boston Dynamics, de son côté, met en avant ses protocoles de tests de fiabilité pour les performances live de Spot, signalant une maturité commerciale croissante. La démonstration d'un cadre de planification multi-robots coordonnant simultanément 40 engins terrestres et aériens illustre enfin que la robotique en essaim sort progressivement des laboratoires. La compétition internationale s'intensifie, portée par des institutions académiques, des agences spatiales et des acteurs privés qui convergent vers les mêmes jalons : autonomie, robustesse et déploiement à grande échelle.

UELe Politecnico di Bari (Italie) co-signe la recherche sur les muscles à fibres électrofluidiques publiée dans Science Robotics, illustrant la contribution européenne aux actionneurs souples pour exosquelettes et rééducation.

RobotiqueActu
1 source
OpenAI abandonne finalement le « mode adulte » et les tchats érotiques dans ChatGPT
546Le Monde Pixels 

OpenAI abandonne finalement le « mode adulte » et les tchats érotiques dans ChatGPT

OpenAI a officiellement renoncé à déployer un « mode adulte » dans ChatGPT, abandonnant un projet qui avait brièvement suscité l'espoir — et la controverse — dans certains cercles de l'industrie. La société avait exploré la possibilité de permettre des conversations à caractère érotique sur sa plateforme, notamment via des opérateurs tiers accédant à l'API, avant de décider de ne pas franchir le pas à grande échelle sur le produit grand public. Cette décision prive les créateurs de contenus pour adultes d'un outil potentiellement lucratif, mais elle protège OpenAI d'un risque réputationnel et réglementaire considérable. Avec ChatGPT utilisé par plus de 300 millions de personnes hebdomadaires, dont des mineurs, intégrer des fonctionnalités explicites aurait exposé l'entreprise à des poursuites, des restrictions d'app stores et des pressions politiques dans de nombreux pays. Le calcul commercial est clair : le marché du contenu adulte ne compense pas les risques pour la marque principale. OpenAI s'inscrit ici dans une tension plus large que traversent tous les grands fournisseurs d'IA générative : jusqu'où assouplir les garde-fous sans compromettre l'adoption institutionnelle et les partenariats stratégiques ? Des concurrents comme Character.ai ou des modèles open source ont choisi la voie opposée, captant une niche que les acteurs dominants refusent d'occuper. Cette frilosité des plateformes mainstream laisse le terrain libre à des alternatives moins régulées, posant in fine la question de la gouvernance du contenu sexuel généré par IA à l'échelle mondiale.

UELa gouvernance du contenu sexuel généré par IA reste un enjeu pour les régulateurs européens, notamment dans le cadre de l'AI Act et du DSA, qui devront encadrer les plateformes moins régulées qui occupent ce terrain.

SécuritéOpinion
1 source
Vercel lance JSON-Render : un framework d'interface générative pour la composition pilotée par l'IA
547InfoQ AI 

Vercel lance JSON-Render : un framework d'interface générative pour la composition pilotée par l'IA

Vercel a mis en open source json-render, un nouveau framework de génération d'interfaces utilisateur piloté par l'intelligence artificielle. Publié sous licence Apache 2.0, cet outil permet à des modèles de langage de composer des interfaces graphiques structurées à partir d'instructions en langage naturel. Concrètement, un développeur définit un catalogue de composants — boutons, formulaires, cartes, listes — et le modèle d'IA sélectionne et assemble ces blocs selon le contexte de la requête. Le framework est compatible avec plusieurs environnements frontend, ce qui lui confère une portée technique large dès sa sortie. L'enjeu principal est de permettre aux applications d'IA de ne plus se limiter à du texte brut, mais de produire des interfaces dynamiques et contextuelles sans intervention manuelle d'un développeur à chaque étape. Pour les équipes qui construisent des agents ou des assistants intégrés à des produits web, cela ouvre la voie à des expériences utilisateurs generatives : l'interface s'adapte à la demande en temps réel, réduisant le besoin de coder chaque scénario à l'avance. La sortie de json-render intervient dans un contexte de foisonnement autour des « generative UI », un concept popularisé notamment par Vercel lui-même avec sa bibliothèque AI SDK et les React Server Components. La communauté accueille l'initiative avec un mélange d'enthousiasme et de réserve : certains saluent la simplicité de l'approche, d'autres pointent ses divergences avec des standards existants comme les spécifications de composants structurés déjà portées par d'autres acteurs. La question de la compatibilité et de la standardisation dans l'écosystème reste ouverte.

OutilsOutil
1 source
Amazon Bedrock propose l'ajustement par renforcement via des API compatibles OpenAI : guide technique
548AWS ML Blog 

Amazon Bedrock propose l'ajustement par renforcement via des API compatibles OpenAI : guide technique

Amazon Bedrock, la plateforme cloud d'IA d'AWS, propose depuis décembre 2025 le Reinforcement Fine-Tuning (RFT), une méthode avancée de personnalisation de modèles de langage. Le service a d'abord été lancé avec les modèles Nova d'Amazon, avant d'être étendu en février 2026 aux modèles open source comme OpenAI GPT OSS 20B et Qwen 3 32B. Concrètement, le RFT permet d'entraîner un modèle à partir d'un petit ensemble de prompts — sans avoir besoin de milliers d'exemples étiquetés — en lui faisant générer plusieurs réponses possibles, puis en lui attribuant des scores selon la qualité de chaque réponse. Le modèle apprend ensuite à privilégier les stratégies qui produisent les meilleurs résultats. L'exemple utilisé dans le tutoriel est le dataset mathématique GSM8K, appliqué au modèle gpt-oss-20B hébergé sur Bedrock. Ce qui distingue le RFT du fine-tuning supervisé classique, c'est sa capacité d'apprentissage en boucle fermée : le modèle génère lui-même les réponses sur lesquelles il s'entraîne, plutôt que de mémoriser des paires entrée-sortie figées. Cette approche est particulièrement puissante pour des tâches vérifiables comme les mathématiques ou la génération de code, où la correction peut être évaluée automatiquement sans intervention humaine. Au fil de l'entraînement, le modèle rencontre naturellement des scénarios de plus en plus complexes, ce qui lui permet de s'améliorer en continu sans que l'équipe doive constituer et annoter un dataset massif en amont. Le résultat : des gains de performance significatifs sur des tâches complexes comme le raisonnement logique ou les conversations multi-tours. Le Reinforcement Learning appliqué aux LLMs est la technique qui a permis à des modèles comme ChatGPT d'aligner leurs réponses sur les préférences humaines — une méthode connue sous le nom de RLHF. Amazon Bedrock l'industrialise ici en automatisant tout le pipeline, de l'authentification au déploiement d'une fonction de récompense via Lambda, jusqu'à l'inférence sur le modèle personnalisé.

OutilsTuto
1 source
L'agent d'utilisation informatique d'AI2 peut exécuter des actions en ligne
549AI Business 

L'agent d'utilisation informatique d'AI2 peut exécuter des actions en ligne

L'Allen Institute for AI (AI2) a lancé un agent open source capable d'utiliser un ordinateur et d'exécuter des actions en ligne au nom des utilisateurs. Cet agent de type "computer use" peut accomplir des tâches autonomement, bien qu'il présente certaines limitations.

OutilsOutil
1 source
Comment les agents IA autonomes deviennent sécurisés par conception grâce à NVIDIA OpenShell
550NVIDIA AI Blog 

Comment les agents IA autonomes deviennent sécurisés par conception grâce à NVIDIA OpenShell

NVIDIA lance OpenShell, un runtime open source intégré à l'NVIDIA Agent Toolkit, conçu pour exécuter des agents autonomes dans des sandboxes isolées avec des politiques de sécurité appliquées au niveau système — hors de portée des agents eux-mêmes. Cette architecture empêche les agents de contourner les contraintes, de fuiter des identifiants ou des données sensibles, même en cas de compromission. NVIDIA collabore avec Cisco, CrowdStrike, Google Cloud, Microsoft Security et TrendAI pour aligner la gestion des politiques runtime à l'échelle des entreprises, tandis que NemoClaw fournit une stack de référence open source combinant OpenShell et les modèles Nemotron pour déployer des assistants IA personnels auto-évolutifs.

OutilsActu
1 source