Apprentissage par renforcement efficace via la…

SpaCeFormer : segmentation 3D d'instances à vocabulaire ouvert, rapide et sans propositions

57

1arXiv cs.RO

SpaCeFormer : segmentation 3D d'instances à vocabulaire ouvert, rapide et sans propositions

Des chercheurs ont publié SpaCeFormer, un nouveau modèle de segmentation d'instances 3D en vocabulaire ouvert capable d'analyser une scène entière en seulement 0,14 seconde, soit 100 à 1000 fois plus vite que les pipelines existants combinant vision 2D et reconstruction 3D. Le modèle repose sur un transformeur dit « space-curve » sans proposition préalable, qui combine une attention par fenêtres spatiales avec une sérialisation via la courbe de Morton pour produire des caractéristiques cohérentes dans l'espace. Un décodeur amélioré par RoPE prédit ensuite directement les masques d'instances à partir de requêtes apprises, sans faire appel à des propositions de régions externes. Pour l'entraîner, les auteurs ont constitué SpaCeFormer-3M, le plus grand jeu de données de segmentation 3D en vocabulaire ouvert jamais créé : 3 millions de légendes cohérentes sur plusieurs vues, couvrant 604 000 instances issues de 7 400 scènes. Ce dataset atteint un rappel de masques 21 fois supérieur aux approches monovues précédentes, soit 54,3 % contre 2,5 % à un seuil IoU supérieur à 0,5. Les performances obtenues sur les benchmarks de référence illustrent un saut qualitatif significatif. Sur ScanNet200, SpaCeFormer atteint un score mAP zero-shot de 11,1, soit 2,8 fois mieux que la meilleure méthode sans proposition antérieure. Sur ScanNet++ et Replica, il dépasse respectivement 22,9 et 24,1 mAP, surpassant tous les modèles précédents y compris ceux exploitant des entrées 2D multi-vues. Cette combinaison de vitesse et de précision ouvre la voie à des applications temps réel dans des environnements non structurés, où les catégories d'objets ne peuvent pas être définies à l'avance. La segmentation d'instances 3D en vocabulaire ouvert est une brique fondamentale pour la robotique autonome et la réalité augmentée ou virtuelle : un robot ou un casque AR doit pouvoir identifier et délimiter n'importe quel objet dans une scène, même inconnu. Les méthodes antérieures souffraient soit d'une latence prohibitive liée à l'agrégation de sorties de modèles fondationnaux sur plusieurs centaines de secondes, soit d'une fragmentation des masques due à l'absence de cohérence multi-vues. SpaCeFormer résout les deux verrous simultanément, et la mise à disposition publique du dataset SpaCeFormer-3M devrait accélérer les travaux de la communauté sur ce problème.

RecherchePaper

1 source

Attribution du crédit par modélisation des récompenses en apprentissage par renforcement hors ligne orienté objectifs

57

2arXiv cs.RO

Attribution du crédit par modélisation des récompenses en apprentissage par renforcement hors ligne orienté objectifs

Une équipe de chercheurs a publié une nouvelle méthode d'apprentissage par renforcement baptisée Occupancy Reward Shaping (ORS), conçue pour résoudre l'un des problèmes les plus tenaces du domaine : l'attribution du crédit. Dans les environnements à récompenses rares, un agent autonome peut enchaîner des dizaines d'actions avant d'obtenir un signal de succès ou d'échec, ce qui rend extrêmement difficile l'identification des décisions qui ont réellement conduit au résultat. L'article, publié sur arXiv sous la référence 2604.20627, propose d'extraire la géométrie temporelle du monde à partir de modèles génératifs, puis de la convertir en une fonction de récompense auxiliaire via le transport optimal. Appliquée à 13 tâches de locomotion et de manipulation à long horizon, ORS améliore les performances de 2,2 fois en moyenne par rapport aux approches existantes. La méthode a également été testée sur un problème réel et exigeant : le contrôle du plasma dans trois configurations de réacteur à fusion nucléaire de type Tokamak. L'impact potentiel de cette avancée est significatif pour tous les systèmes autonomes qui doivent apprendre à partir de données collectées offline, c'est-à-dire sans interaction en temps réel avec l'environnement. Les robots industriels, les systèmes de planification médicale ou les agents de contrôle de processus physiques complexes sont directement concernés. La garantie théorique centrale d'ORS, que le remodelage de la récompense ne modifie pas la politique optimale, est cruciale : elle signifie que la méthode accélère l'apprentissage sans introduire de biais ou de comportements indésirables, ce qui est un prérequis pour toute application dans des contextes à risque élevé comme la fusion nucléaire. L'attribution du crédit temporel est un problème fondamental de l'apprentissage par renforcement depuis ses origines, et de nombreuses approches ont tenté de le contourner via des récompenses intermédiaires conçues à la main ou des architectures récurrentes. ORS se distingue en exploitant les modèles de monde génératifs, qui connaissent un regain d'intérêt depuis les travaux de DeepMind et d'autres laboratoires sur la planification basée sur des modèles. En combinant ces modèles avec le transport optimal, un outil mathématique issu de la théorie de la mesure, les auteurs ouvrent une voie systématique pour encoder la structure géométrique de n'importe quel environnement. Le code source est disponible publiquement sur GitHub, ce qui facilitera l'adoption et les travaux de réplication dans la communauté.

UELa méthode ORS, validée sur des réacteurs Tokamak, pourrait intéresser le projet ITER hébergé à Cadarache (France), principal programme mondial de fusion nucléaire financé par l'UE.

RecherchePaper

1 source

Fermeture de boucle efficace en SLAM LiDAR par cartes de densité de nuages de points

56

3arXiv cs.RO

Fermeture de boucle efficace en SLAM LiDAR par cartes de densité de nuages de points

Des chercheurs ont publié sur arXiv une nouvelle méthode de détection de fermeture de boucle pour les robots mobiles autonomes équipés de capteurs LiDAR, sous le nom de code MapClosures. Le système résout un problème fondamental de la cartographie robotique : lorsqu'un robot repasse par un endroit déjà visité, il doit reconnaître ce lieu et corriger l'accumulation d'erreurs de positionnement, un phénomène appelé dérive globale. La pipeline présentée génère des cartes locales à partir des nuages de points LiDAR, les aligne avec un module dédié à la gestion du terrain, puis produit des projections à vue aérienne en préservant la densité des points. Des descripteurs de caractéristiques ORB sont extraits de ces projections et stockés dans un arbre de recherche binaire pour accélérer les requêtes. Un mécanisme d'élagage par auto-similarité permet d'éviter les faux positifs dans les environnements répétitifs, comme des couloirs ou des rangées d'arbres. Le code source est disponible en open source sur GitHub, dans le dépôt PRBonn/MapClosures. L'impact de cette approche est particulièrement significatif pour les applications de robotique en extérieur, livraison autonome, inspection industrielle, véhicules tout-terrain, où la précision cartographique sur de longues distances est critique. Contrairement à de nombreuses solutions existantes qui dépendent d'un type précis de capteur ou d'un profil de mouvement spécifique, MapClosures fonctionne avec des LiDAR aux résolutions, champs de vision et patterns de scan très différents. Cela réduit considérablement les coûts d'intégration pour les équipes qui changent de matériel ou déploient plusieurs types de robots sur un même système. Le SLAM (Simultaneous Localization and Mapping) est un défi ouvert depuis plusieurs décennies en robotique, et la fermeture de boucle en est l'un des maillons les plus fragiles, surtout en environnements non structurés. Les travaux proviennent du laboratoire PRBonn, associé à l'Université de Bonn, acteur reconnu dans la recherche en perception robotique. En rendant la méthode agnostique au capteur et en publiant le code librement, les auteurs visent une adoption large dans la communauté académique et industrielle. Les prochaines étapes pourraient inclure l'intégration avec des systèmes de fusion multi-capteurs et des tests à plus grande échelle dans des environnements dynamiques urbains.

UEIssu du laboratoire PRBonn de l'Université de Bonn (Allemagne), ce travail open source renforce la compétitivité européenne en robotique mobile et peut bénéficier directement aux équipes françaises et européennes développant des robots autonomes ou des véhicules LiDAR.

RechercheActu

1 source

Des actions à la compréhension : interprétabilité conformale des concepts temporels dans les agents LLM

55

4arXiv cs.RO

Des actions à la compréhension : interprétabilité conformale des concepts temporels dans les agents LLM

Des chercheurs ont publié un article (arXiv:2604.19775) présentant un nouveau cadre d'interprétabilité pour les agents basés sur des grands modèles de langage (LLM). Baptisé "conformal interpretability framework for temporal tasks", ce système combine la modélisation des récompenses étape par étape avec la prédiction conforme, une méthode statistique rigoureuse, pour étiqueter les représentations internes du modèle à chaque instant : succès, échec ou dérive du raisonnement. Des sondes linéaires sont ensuite entraînées sur ces représentations afin d'identifier des directions latentes dans l'espace d'activation du modèle, des vecteurs qui correspondent à des notions cohérentes de réussite ou d'échec. Les expériences ont été menées sur deux environnements interactifs simulés, ScienceWorld et AlfWorld, et confirment que ces concepts temporels sont linéairement séparables. Cette capacité à "lire" ce qui se passe à l'intérieur d'un agent LLM en cours d'action représente une avancée concrète pour la fiabilité des systèmes autonomes. Jusqu'ici, les agents capables de planification multi-étapes restaient des boîtes noires : impossible de savoir, avant la fin d'une tâche, si le modèle était en train de dériver ou de raisonner correctement. Ce cadre ouvre la voie à une détection précoce des défaillances, mais aussi à des interventions actives : les auteurs montrent des résultats préliminaires indiquant qu'il est possible de "piloter" l'agent vers les directions de succès identifiées, améliorant ainsi ses performances en cours d'exécution. L'interprétabilité des LLM est devenue l'un des chantiers les plus actifs de la recherche en IA, notamment sous la pression des exigences de transparence portées par des régulateurs comme la Commission européenne. Ce travail s'inscrit dans un mouvement plus large qui cherche à dépasser la simple observation des sorties pour comprendre les mécanismes internes, en particulier dans des tâches séquentielles où l'erreur peut se propager et s'amplifier. Les outils développés ici pourraient à terme être intégrés dans des systèmes de supervision d'agents déployés dans des contextes critiques, que ce soit en robotique, en assistance médicale ou en automatisation industrielle.

UECe cadre d'interprétabilité pourrait faciliter la conformité à l'AI Act européen, qui impose des exigences de transparence et d'explicabilité pour les systèmes d'IA à haut risque déployés dans l'UE.

RecherchePaper

1 source

Apprentissage par renforcement efficace via la dynamique de Koopman linéaire pour les systèmes robotiques non linéaires

À lire aussi

SpaCeFormer : segmentation 3D d'instances à vocabulaire ouvert, rapide et sans propositions

Attribution du crédit par modélisation des récompenses en apprentissage par renforcement hors ligne orienté objectifs

Fermeture de boucle efficace en SLAM LiDAR par cartes de densité de nuages de points

Des actions à la compréhension : interprétabilité conformale des concepts temporels dans les agents LLM