RobotiqueArs Technica AI13sem· 1 min de lecture

GEN-1 : le modele robotique passe de 99 % de fiabilite, du pliage de cartons a la reparation d aspirateurs

La startup Generalist a dévoilé GEN-1, un modèle d'intelligence artificielle physique capable d'accomplir une large gamme de tâches manuelles avec un taux de fiabilité atteignant 99 %. Pliage de cartons, réparation d'aspirateurs, manipulation d'objets fragiles : autant de gestes qui nécessitaient jusqu'ici la dextérité propre aux mains humaines. GEN-1 se distingue également par sa capacité à improviser face aux imprévus, en combinant des connaissances issues de domaines différents pour résoudre des problèmes inédits en temps réel.

Ce niveau de fiabilité marque un tournant dans la robotique industrielle. Atteindre les 99 % sur des tâches physiques variées, c'est franchir le seuil qui sépare un prototype de démonstration d'un système déployable en conditions réelles. Pour les entreprises manufacturières, logistiques ou de maintenance, cela ouvre la voie à une automatisation de tâches jusque-là réservées aux opérateurs humains, sans pour autant exiger des environnements ultra-contrôlés. L'impact potentiel touche aussi bien les chaînes d'assemblage que les services de réparation à domicile.

GEN-1 s'appuie sur le modèle précédent de Generalist, GEN-0, présenté en novembre dernier comme une preuve de concept démontrant que les lois de mise à l'échelle -- bien connues dans le domaine des grands modèles de langage -- s'appliquent aussi à la robotique : plus de données et de calcul en pré-entraînement améliorent les performances post-entraînement. Mais contrairement aux LLM, qui ont pu s'alimenter de milliards de textes disponibles sur Internet, les modèles robotiques manquent de données sur la manipulation d'objets. Pour combler ce vide, Generalist a développé des "data hands", des pinces portables qui capturent les micro-mouvements et les informations visuelles lors de tâches manuelles réalisées par des humains. La société affirme avoir ainsi collecté plus d'un demi-million d'heures d'interactions physiques, représentant des pétaoctets de données d'entraînement.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1Next INpact

Robots domestiques : la collecte de données d’entraînement passe par le ménage gratuit

La startup allemande MicroAGI a lancé à New York un service baptisé Shift qui propose le nettoyage gratuit d'appartements par des professionnels, en échange d'un consentement précis : les agents portent des caméras filmant chacun de leurs gestes pendant l'intervention. Ces vidéos constituent des données d'entraînement pour des intelligences artificielles destinées à piloter des robots domestiques. L'entreprise rémunère par ailleurs des volontaires 20 dollars de l'heure pour enregistrer leurs tâches quotidiennes chez eux ou au travail. Au premier trimestre 2026, MicroAGI affirme avoir versé plus de 5 millions de dollars à 10 000 "opérateurs" répartis dans une dizaine de pays. Ce modèle répond à un problème structurel que toute l'industrie de la robotique humanoïde bute sur le même mur : l'absence de corpus de données équivalent à ce dont disposent les modèles de langage. Là où une IA générative peut s'alimenter de milliards de textes produits par l'humanité, un robot domestique a besoin de voir des milliers d'heures de mains humaines en train de frotter, plier, trier, saisir. Le constructeur 1X l'a illustré concrètement avec son humanoïde Neo, qui dépend encore régulièrement d'un téléopérateur humain pour accomplir certaines tâches chez le client. Shift contourne le problème en finançant la collecte par la valeur même des enregistrements, transformant le nettoyage en une transaction data contre service. La question de la vie privée est au coeur du modèle, et MicroAGI la gère avec des promesses techniques et juridiques dont la robustesse reste à éprouver. Les caméras floutent automatiquement visages, documents, écrans et pièces d'identité directement à la capture, avant tout téléversement. L'entreprise invoque le RGPD pour garantir un droit à l'effacement, mais considère simultanément que les données anonymisées échappent au champ des lois sur la protection des données, une position juridique contestable. Shift s'inscrit dans une tendance plus large de "travail du clic" appliqué à la robotique, où des entreprises comme Scale AI ou Labeling Tech ont construit des modèles comparables pour d'autres types de données. Avec des investissements massifs dans les humanoïdes chez Figure, Apptronik ou Tesla, la compétition pour ces corpus d'entraînement va s'intensifier, et les appartements new-yorkais ne seront vraisemblablement pas les derniers à servir de terrain de collecte.

UELa startup allemande MicroAGI invoque le RGPD pour légitimer sa collecte de données dans des domiciles privés, mais sa position juridique sur l'anonymisation des données est contestable et pourrait attirer l'attention des autorités européennes de protection des données.

RobotiqueOpinion

1 source

2arXiv cs.RO

Apprentissage des intentions humaines à partir de démonstrations massives pour la manipulation robotique

Des chercheurs ont publié MoT-HRA, un nouveau cadre d'apprentissage robotique capable d'extraire des intentions humaines à partir de vidéos brutes pour les transférer à des bras robotiques. Pour entraîner le système, l'équipe a constitué HA-2.2M, un jeu de données massif de 2,2 millions d'épisodes reconstruit à partir de vidéos hétérogènes d'humains en train de manipuler des objets. Ces données ont été traitées via un pipeline en quatre étapes : filtrage centré sur les mains, reconstruction spatiale 3D, segmentation temporelle et alignement avec du langage naturel. Le modèle décompose ensuite la manipulation en trois experts couplés : un expert vision-langage qui prédit une trajectoire 3D indépendante du corps, un expert d'intention qui modélise le mouvement de la main selon le format MANO comme prior latent, et un expert fin qui traduit cette représentation en séquences d'actions concrètes pour le robot. L'enjeu est de taille : les robots peinent aujourd'hui à généraliser leurs apprentissages hors des conditions d'entraînement, un problème connu sous le nom de "distribution shift". MoT-HRA améliore significativement la plausibilité des mouvements générés et la robustesse du contrôle précisément dans ces situations dégradées, là où les approches classiques échouent. En apprenant non pas ce que fait la main, mais pourquoi elle le fait, le système produit des comportements plus cohérents et transférables à différents robots sans nécessiter de réentraînement spécifique par plateforme. Ce travail s'inscrit dans une tendance forte de la robotique actuelle : exploiter les milliards d'heures de vidéos humaines disponibles sur internet pour former des politiques de contrôle sans recourir à des démonstrations téléopérées coûteuses. Le défi technique central est de séparer dans ces vidéos ce qui relève de l'intention (invariant au corps) de ce qui relève de la mécanique propre à chaque main ou bras. Le mécanisme de partage d'attention et de transfert clé-valeur en lecture seule utilisé dans MoT-HRA est une réponse architecturale directe à ce problème d'interférence. Les résultats sur des tâches réelles ouvrent la voie à des robots capables d'apprendre depuis YouTube autant que depuis un laboratoire.

RobotiquePaper

1 source

3arXiv cs.RO

SPEAR-1 : dépasser les limites des démonstrations robotiques grâce à la compréhension 3D

Des chercheurs de l'INSAIT ont présenté SPEAR-1, un modèle de fondation robotique capable de surpasser ou d'égaler des systèmes de pointe comme π0-FAST et π0.5 tout en utilisant vingt fois moins de démonstrations robotiques. Entraîné sur environ 45 millions de séquences vidéo issues de 24 jeux de données Open X-Embodiment, le modèle repose sur SPEAR-VLM, un modèle vision-langage doté d'une compréhension 3D capable de déduire les coordonnées spatiales d'objets à partir d'une simple image 2D. Les poids du modèle ainsi que les données annotées en 3D sont disponibles en accès libre sur spear.insait.ai. L'enjeu central de SPEAR-1 est la généralisation : là où la plupart des modèles robotiques peinent à s'adapter à de nouveaux environnements ou de nouvelles tâches une fois leur entraînement terminé, SPEAR-1 y parvient avec une fraction des données habituellement nécessaires. Cette efficacité représente un gain considérable pour les équipes de recherche et les industriels : collecter des démonstrations robotiques est coûteux, lent et difficile à mettre à l'échelle. En substituant une partie de ces données par des images ordinaires annotées en 3D, les chercheurs ouvrent une voie beaucoup moins contraignante vers des robots polyvalents. Le verrou que SPEAR-1 tente de lever est bien connu dans le domaine : les grands modèles vision-langage sur lesquels reposent aujourd'hui la plupart des systèmes robotiques ont été pré-entraînés sur des données 2D issues d'internet, sans capacité de raisonnement spatial en trois dimensions, pourtant indispensable pour agir dans le monde physique. Plutôt que de combler ce fossé en accumulant massivement des données robotiques, SPEAR-1 enrichit des images non robotiques avec des annotations 3D pour doter le modèle de base de cette compétence manquante. Cette approche s'inscrit dans une course mondiale à la robotique généraliste, où des acteurs comme Physical Intelligence, Google DeepMind et Figure AI investissent massivement pour créer des robots capables de s'adapter à des tâches variées sans reprogrammation.

UEINSAIT, institution européenne basée en Bulgarie, publie SPEAR-1 en open source, donnant aux chercheurs et industriels européens un accès direct à un modèle robotique de pointe nécessitant vingt fois moins de démonstrations que les systèmes concurrents.

💬 Le vrai problème de la robotique généraliste, c'est pas les modèles, c'est la data : collecter des démos robot coûte cher, ça prend du temps, et ça ne se met pas à l'échelle. SPEAR-1 contourne ça en substituant une bonne partie de ces démos par des images ordinaires annotées en 3D, et si ça tient hors du labo, c'est une avancée sérieuse pour des équipes qui n'ont pas les moyens de Physical Intelligence. Open source en plus, depuis l'Europe.

RobotiquePaper

1 source

4arXiv cs.RO

Les modèles vision-langage-action en robotique : panorama des jeux de données, benchmarks et moteurs de données

Une équipe de chercheurs a publié sur arXiv (référence 2604.23001) une analyse exhaustive de l'état des données dans les modèles Vision-Langage-Action (VLA) appliqués à la robotique. Ces modèles, qui permettent à un robot de percevoir son environnement visuel, d'interpréter des instructions en langage naturel et d'exécuter des actions physiques, connaissent des progrès spectaculaires depuis deux ans. Pourtant, selon les auteurs, le vrai goulot d'étranglement n'est pas l'architecture des modèles : c'est l'infrastructure des données. L'étude passe en revue trois dimensions clés, les jeux de données, les benchmarks d'évaluation, et les moteurs de génération de données, en cartographiant systématiquement leurs forces et leurs lacunes. Ce travail met en lumière un problème fondamental qui freine toute la discipline : collecter des données robotiques de haute fidélité coûte extrêmement cher, ce qui pousse les équipes vers des données synthétiques moins réalistes. Les benchmarks actuels, censés mesurer les capacités des robots, peinent à évaluer deux compétences pourtant cruciales, la généralisation compositionnelle (combiner des tâches apprises pour en résoudre de nouvelles) et le raisonnement sur des séquences longues. Autrement dit, les robots paraissent performants dans les tests, mais restent fragiles face à des situations légèrement différentes de celles rencontrées lors de l'entraînement. Pour les industriels et les laboratoires qui investissent massivement dans la robotique autonome, ce décalage entre métriques et réalité représente un risque concret. Le domaine de l'IA incarnée (embodied AI) est aujourd'hui dominé par des acteurs comme Google DeepMind, Meta, Physical Intelligence ou encore des équipes universitaires qui rivalisent pour entraîner des robots généralistes. Les auteurs identifient quatre défis ouverts : aligner les représentations visuelles et textuelles, améliorer la supervision multimodale, mieux évaluer le raisonnement, et générer des données à grande échelle sans perdre en réalisme physique. Leur conclusion est nette : traiter l'infrastructure de données comme un objet de recherche à part entière, et non comme un arrière-plan technique, est la condition pour que les prochaines générations de VLA tiennent leurs promesses hors des laboratoires.

RobotiqueOpinion

1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic