Aller au contenu principal
RechercheApple Machine Learning · 1 min de lecture

RayRoPE : encodage positionnel projectif par rayons pour l'attention multi-vues

Source originale ↗·

Des chercheurs en vision par ordinateur présentent RayRoPE, une nouvelle méthode d'encodage positionnel destinée aux transformeurs multi-vues, ces modèles qui traitent simultanément des tokens issus de plusieurs images prises sous différents angles avec une caméra localisée dans l'espace. L'objectif est de doter chaque patch d'image d'une position unique tout en permettant une attention invariante aux transformations rigides SE(3), c'est à dire insensible aux rotations et translations de la scène filmée, avec une similarité à plusieurs fréquences. La méthode s'appuie sur le rayon optique associé à chaque patch, mais au lieu d'utiliser uniquement sa direction, comme le font les approches existantes, RayRoPE exploite un point prédit le long de ce rayon pour encoder la position de manière adaptée à la géométrie réelle de la scène.

Cette avancée technique cible un problème central pour les systèmes de vision par ordinateur en 3D, comme la reconstruction de scènes, la génération de vues nouvelles ou la navigation robotique à partir de plusieurs caméras. Les chercheurs montrent que les schémas d'encodage existants, qu'ils soient absolus ou relatifs, échouent à combiner simultanément unicité, invariance géométrique et adaptabilité à la structure de la scène observée. En comblant cette lacune, RayRoPE pourrait améliorer la précision et la robustesse des modèles qui doivent raisonner sur la position relative d'objets capturés sous des angles multiples.

Ces travaux s'inscrivent dans une dynamique de recherche plus large autour des encodages positionnels rotatifs, popularisés par RoPE dans les modèles de langage, désormais adaptés aux données visuelles tridimensionnelles. À mesure que les applications de perception multi-caméra se multiplient, en robotique, en réalité augmentée ou dans les véhicules autonomes, la capacité des transformeurs à comprendre la géométrie 3D sous-jacente aux images devient un enjeu de recherche majeur, ouvrant la voie à des architectures encore plus fidèles à la structure réelle du monde observé.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

ARETE : estimation de topologie par encodage rastérisé basé sur l'attention, sur données HSV de flottes de véhicules participatives
1arXiv cs.RO 

ARETE : estimation de topologie par encodage rastérisé basé sur l'attention, sur données HSV de flottes de véhicules participatives

Des chercheurs ont publié ARETE (Attention-based Rasterized Encoding for Topology Estimation), un nouveau système capable de générer automatiquement des cartes haute définition pour la conduite autonome à partir de données collectées par une flotte de véhicules en circulation. La méthode repose sur un modèle de type DETR (Detection Transformer), une architecture d'apprentissage profond initialement développée pour la détection d'objets, ici adaptée pour prédire la topologie des routes. Concrètement, le système extrait des tuiles locales à partir des trajectoires GPS agrégées de nombreux véhicules, transforme ces données en représentations rasterisées encodant à la fois la présence et la direction de chaque trajectoire, puis prédit les lignes centrales de voies et les séparateurs de lignes sous forme vectorisée. Les expériences ont été conduites sur un dataset interne ainsi que sur les jeux de données publics nuScenes et nuPlan, deux références du secteur. L'enjeu est considérable pour l'industrie de la conduite autonome : les cartes HD constituent une couche d'information critique pour la planification de trajectoire, la localisation précise et la prise de décision en temps réel des véhicules autonomes. Les maintenir à jour est un problème opérationnel majeur, car les routes évoluent en permanence. En exploitant des données crowdsourcées issues de flottes existantes plutôt que des capteurs LiDAR embarqués coûteux ou des équipes de cartographie dédiées, ARETE ouvre une voie vers une mise à jour continue et à grande échelle des cartes, potentiellement bien moins onéreuse que les approches traditionnelles. La génération de cartes HD à partir de données participatives n'est pas nouvelle, mais les approches précédentes peinent souvent à extraire des représentations structurées et précises des voies depuis des trajectoires bruitées et hétérogènes. L'originalité d'ARETE réside dans la transformation HSV des trajectoires agrégées, qui permet de mieux coder la directionnalité du trafic, couplée à l'architecture attention-based qui gère nativement les relations spatiales complexes entre voies. Des acteurs comme Waymo, Mobileye ou TomTom investissent massivement dans des pipelines similaires, et cette publication suggère que la communauté académique converge vers des solutions hybrides combinant données crowdsourcées et apprentissage profond structuré comme alternative crédible aux relevés terrain.

UELes résultats pourraient intéresser les acteurs européens de la cartographie HD comme TomTom, qui investissent dans des pipelines similaires de mise à jour automatisée des cartes pour véhicules autonomes.

RecherchePaper
1 source
Affordance-R1 : apprentissage par renforcement pour le raisonnement sur les affordances dans les LLM multimodaux
2arXiv cs.RO 

Affordance-R1 : apprentissage par renforcement pour le raisonnement sur les affordances dans les LLM multimodaux

Des chercheurs ont présenté Affordance-R1, un nouveau modèle d'intelligence artificielle conçu pour permettre aux robots de déterminer précisément comment saisir et manipuler des objets dans leur environnement. Publiée sur arXiv (référence 2508.06206), cette étude introduit le premier cadre unifié d'affordance grounding combinant l'apprentissage par renforcement avec un raisonnement de type chaîne de pensée (Chain-of-Thought, CoT). Le système s'appuie sur une variante de l'optimisation politique appelée GRPO (Group Relative Policy Optimization) et a été entraîné sur un nouveau jeu de données spécialement constitué pour l'occasion, baptisé ReasonAff. Malgré l'absence de données de raisonnement explicite durant l'entraînement, le modèle parvient à une généralisation zéro-shot convaincante et développe des capacités de raisonnement émergentes lors de l'inférence. Le code et le jeu de données sont disponibles publiquement sur GitHub. Cette avancée concerne directement la robotique incarnée, l'interaction humain-robot et la manipulation d'objets en environnement ouvert. L'enjeu central est la capacité d'un robot à identifier, sans entraînement préalable sur un objet donné, quelle zone précise saisir ou activer pour accomplir une tâche, par exemple tenir une tasse par son anse ou appuyer sur le bouton d'un appareil. Jusqu'ici, les modèles existants échouaient à transférer cette compréhension d'un objet à un autre, faute d'un raisonnement structuré. Affordance-R1 comble ce manque en permettant une généralisation hors-domaine (OOD), ce qui pourrait accélérer le déploiement de robots polyvalents dans des environnements industriels, domestiques ou médicaux. Le concept d'affordance, emprunté à la psychologie cognitive, désigne les actions qu'un objet permet naturellement à un agent. Dans le domaine de la robotique IA, le défi est d'apprendre à un modèle à percevoir ces possibilités d'action de façon générique, sans dépendre d'une liste exhaustive d'objets connus. Les approches précédentes reposaient sur de la supervision directe, limitant leur adaptabilité face à des situations inédites. L'utilisation du GRPO, une méthode d'apprentissage par renforcement popularisée notamment par DeepSeek, représente ici un changement de paradigme : plutôt que d'enseigner explicitement le raisonnement, on récompense le modèle selon des critères de format, de perception et de cognition. Cette approche rejoint une tendance plus large visant à doter les grands modèles multimodaux d'une véritable capacité de planification physique dans le monde réel.

RecherchePaper
1 source
EL3DD : diffusion 3D latente étendue pour la manipulation multi-tâches guidée par le langage
3arXiv cs.RO 

EL3DD : diffusion 3D latente étendue pour la manipulation multi-tâches guidée par le langage

Des chercheurs ont présenté EL3DD (Extended Latent 3D Diffusion), un cadre de politique visuomotrice conçu pour permettre aux robots d'exécuter des tâches de manipulation physique à partir de commandes en langage naturel. Le système fusionne des entrées visuelles et textuelles au sein de modèles de diffusion pour produire des trajectoires robotiques précises, en s'appuyant sur des démonstrations de référence pendant l'entraînement. Évalué sur le benchmark CALVIN, référence standard pour la manipulation robotique multi-tâches, le modèle affiche des performances améliorées sur l'ensemble des tâches testées et un taux de réussite accru sur les séquences longues, c'est-à-dire lorsque plusieurs tâches sont enchaînées consécutivement. L'approche étend un modèle existant grâce à des embeddings améliorés et à l'adaptation de techniques issues de la génération d'images par diffusion. Cette avancée est significative pour le domaine de la robotique généraliste, car la capacité à comprendre le langage naturel et à l'appliquer à des tâches physiques dans des environnements humains reste l'un des verrous majeurs du secteur. Le gain sur les séquences longues est particulièrement notable: dans des applications réelles, un robot domestique ou industriel doit enchaîner plusieurs gestes sans intervention humaine, et chaque erreur dans la séquence se propage aux suivantes. Un taux de réussite accru sur ces horizons prolongés rapproche les systèmes actuels d'une utilisabilité concrète hors laboratoire, que ce soit en logistique, en chirurgie assistée ou dans les services à domicile. La recherche s'inscrit dans un mouvement plus large d'application des modèles de diffusion, rendus célèbres par leur efficacité en génération d'images avec des systèmes comme Stable Diffusion ou DALL-E, au contrôle robotique. Le dataset CALVIN, utilisé pour l'évaluation, est conçu pour tester la généralisation des robots à des environnements variés et à des instructions formulées de multiples façons. EL3DD contribue ainsi au développement de politiques robotiques multi-tâches généralisables, un enjeu central pour des acteurs comme Google DeepMind, Physical Intelligence ou de nombreux laboratoires académiques travaillant sur les robots de prochaine génération.

RechercheActu
1 source
Exploitation de la platitude différentielle pour la commande prédictive par apprentissage de systèmes affines multi-entrées contraints
4arXiv cs.RO 

Exploitation de la platitude différentielle pour la commande prédictive par apprentissage de systèmes affines multi-entrées contraints

Des chercheurs ont publié sur arXiv une nouvelle approche de contrôle automatique pour les systèmes robotiques à dynamique incertaine, exploitant une propriété mathématique appelée platitude différentielle. Le contrôleur proposé repose sur une combinaison d'apprentissage machine et de commande prédictive par modèle (MPC), et se distingue des solutions existantes par sa capacité à gérer simultanément des systèmes à entrées multiples, des contraintes sur les commandes et des contraintes d'état dans l'espace plat. Techniquement, l'architecture repose sur une extension du système et une formulation diagonale par blocs du coût, permettant de résoudre le problème de contrôle en seulement deux optimisations convexes séquentielles, tout en offrant des garanties probabilistes de stabilité via un critère de Lyapunov. L'apport principal est d'ordre computationnel : la méthode atteint des performances comparables à un contrôleur MPC basé sur des processus gaussiens (GP-MPC), référence de l'état de l'art, mais en étant plusieurs fois plus rapide en temps de calcul. Pour les applications robotiques en temps réel, notamment les drones, les bras manipulateurs ou les véhicules autonomes, cette réduction de charge de calcul est déterminante. Elle permet d'envisager des boucles de contrôle plus rapides, des plateformes embarquées moins puissantes, ou des horizons de prédiction plus longs sans compromettre la réactivité du système. Les expériences sur matériel réel confirment un suivi de trajectoire compétitif, validant la transposabilité de l'approche au-delà de la simulation. La platitude différentielle est une propriété bien connue en automatique, exploitée depuis les années 1990 pour simplifier la planification de trajectoires dans des systèmes comme les quadrotors ou les voitures. Jusqu'ici, les travaux combinant flatness et apprentissage machine se heurtaient à des limitations majeures : absence de gestion des contraintes d'entrée, restriction aux systèmes mono-entrée, ou dépendance à une plateforme spécifique. Cette publication généralise l'approche à une classe beaucoup plus large de systèmes non linéaires, ouvrant la voie à des contrôleurs apprenants suffisamment efficaces pour quitter les bancs de simulation et équiper des robots industriels ou autonomes en conditions réelles.

RecherchePaper
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic