Aller au contenu principal

Robots humanoïdes· sujet

554 articlesmis à jour le 6 mai 2026

L'industrie des robots humanoïdes : Unitree, Fauna Robotics, Tesla Optimus, Chery, Sony, défis techniques et premiers déploiements en entreprise.

Hub d'actualité sur Robots humanoïdes, agrégé en continu depuis 72 sources éditoriales. Pour les analyses long-form, voir /analyses.

Les robots humanoïdes sont passés en 2026 du laboratoire à l'usine. Boston Dynamics Atlas exécute des séquences complexes (« mieux que certains gymnastes » selon le mot d'avril 2026), un robot NVIDIA tient un poste de 8 heures en usine Siemens à 60 bacs par heure, Unitree R1 est commercialisé sur AliExpress à 5 900 dollars. La courbe d'adoption industrielle s'accélère.

Trois fronts émergent. Le front industriel : déploiements ciblés sur des tâches répétitives (logistique, palettisation, inspection) où le ROI est démontrable. Le front grand public : Unitree à 5 900 $ rend l'humanoïde abordable, mais l'usage reste exploratoire. Le front géopolitique : la Chine annonce 8 500 robots IA pour son réseau électrique, démontrant une capacité d'industrialisation hors USA.

Côté écosystème logiciel, la bataille des plateformes humanoïdes se structure rapidement. NVIDIA pousse Isaac + Project GR00T (le « modèle de fondation pour humanoïdes »). Meta annonce vouloir devenir « l'Android des humanoïdes » avec une stack logicielle open. Google travaille avec Boston Dynamics depuis l'acquisition de 2013. Tesla joue le vertical intégré. Apple n'est pas annoncé sur ce segment mais ses brevets en motricité robotique se sont multipliés en 2025-2026. Le résultat : pas de standard unique, fragmentation forte, opportunité importante pour la couche logicielle qui s'imposera.

Pourquoi Robots humanoïdes compte

Les humanoïdes comptent parce qu'ils représentent l'extension physique de l'IA agentique. Le même argumentaire qui structure les agents logiciels (autonomie, capacité, sécurité) s'applique au monde physique avec des enjeux nouveaux : intégrité physique des humains autour, responsabilité juridique en cas d'incident, pression sur l'emploi industriel.

L'angle stratégique : Meta cherche à devenir « l'Android des robots humanoïdes », fournissant la couche logicielle commune que les fabricants matériels (Unitree, Figure, Boston Dynamics) intègrent. Si la stratégie réussit, on assiste à une convergence entre la guerre des plateformes IA et la guerre des plateformes hardware — où Apple (vertical), Google (horizontal), Meta (open + agentique), NVIDIA (compute), Amazon (logistique) jouent chacun leur carte.

L'autre angle souvent sous-estimé : la dimension emploi. La Chine annonce 8 500 robots IA pour son réseau électrique. Si la même cadence se reproduit aux US et en Europe, les premières filières concernées (logistique, palettisation, inspection légère) verront le remplacement humain accélérer dès 2027-2028. La régulation européenne (AI Act, transposition nationale) commence à intégrer cette dimension dans le débat — pas encore avec des règles dures, mais avec des obligations de transparence + impact assessments. Les syndicats français (CGT logistique, CFDT industrie) ont commencé à demander des observatoires sectoriels en avril 2026.

Chronologie

  1. 2013Google rachète Boston Dynamics — premier signal du marché humanoïde grand public
  2. 2024Tesla Optimus, Figure 02, Boston Dynamics Atlas refonte électrique : démarrage de la course commerciale
  3. Janv 2025Tesla démontre Optimus en démo grand public à CES
  4. Mar 2025Unitree H1 démontre une marche grand public
  5. Sept 2025Figure annonce des pilotes BMW + Mercedes en chaîne d'assemblage
  6. Févr 2026NVIDIA présente Project GR00T (modèle de fondation humanoïde) au GTC
  7. Avr 2026Unitree R1 commercialisé sur AliExpress à 5 900 $ (premier humanoïde grand public abordable)
  8. Avr 2026Robot humanoïde NVIDIA tient un poste 8h en usine Siemens à 60 bacs/heure
  9. 29 avr 2026La Chine prévoit 8 500 robots IA pour son réseau électrique (investissement milliardaire)
  10. Avr 2026Premiers observatoires syndicaux français (CGT, CFDT) sur l'impact emploi des humanoïdes industriels
  11. 4 mai 2026Meta veut devenir l'Android des robots humanoïdes (positionnement plateforme logicielle)
  12. 5 mai 2026Top Robots Avril 2026 : usine, sport, salon — l'IA prend le contrôle
  13. 6 mai 2026Vidéo : Atlas (Boston Dynamics) bouge mieux que certains gymnastes

Cinq articles essentiels

Sélection éditoriale. Ces cinq pièces couvrent les angles les plus utiles pour comprendre Robots humanoïdes en 2026.

  1. Atlas (Boston Dynamics) bouge mieux que certains gymnastes : la démonstration que la maturité physique n'est plus le verrou.

  2. Robot humanoïde NVIDIA tient un poste 8h en usine Siemens à 60 bacs/heure : le ROI industriel démontré.

  3. Unitree R1 sur AliExpress à 5 900 $ : le moment où l'humanoïde devient grand public.

  4. Meta veut devenir l'Android des robots humanoïdes : la guerre des plateformes logicielles s'étend au matériel.

  5. La Chine prévoit 8 500 robots IA pour son réseau électrique : la dimension géopolitique de l'industrialisation.

  6. Top Robots Avril 2026 : la photographie complète de la course humanoïde au moment où elle bascule du laboratoire à l'usine.

Questions fréquentes

Quels sont les principaux fabricants de robots humanoïdes en 2026 ?

Tesla (Optimus), Figure, Boston Dynamics (Atlas), Unitree (H1, R1), Apptronik (Apollo), Fauna Robotics, 1X (Eve), Agility Robotics (Digit), Sony (annoncé). La Chine pousse Unitree, UBTech, Fourier Intelligence. Le japonais Sony et le sud-coréen Samsung préparent des entrées en 2026.

Combien coûte un robot humanoïde en 2026 ?

Du grand public au pro : Unitree R1 à 5 900 $ sur AliExpress (entrée de gamme). Tesla Optimus à ~30 000 $ promesse, déploiement progressif. Figure 02 et Boston Dynamics Atlas en B2B (~100-200 000 $). Les usages professionnels (logistique, inspection) sont les premiers à déployer en volume.

Quels sont les déploiements industriels concrets ?

NVIDIA en Siemens (palettisation, 60 bacs/heure, postes 8h). Amazon en logistique (Digit chez Agility). BMW et Mercedes pilote Figure. La Chine annonce 8 500 robots pour son réseau électrique. La courbe est ~10x volumétrique chaque année depuis 2024.

Qui fournit l'IA des humanoïdes ?

Stratégies divergentes : NVIDIA fournit le hardware + une couche logicielle (Isaac, Project GR00T). Meta vise « l'Android humanoïde » (open). Google travaille avec Boston Dynamics. Tesla utilise du propriétaire. Les startups (Figure, Apptronik) bâtissent souvent leur propre stack. La fragmentation est forte.

Quel est l'impact emploi attendu ?

Court terme (2026-2027) : impact marginal — quelques milliers de robots déployés mondialement, dans des contextes industriels où la pénurie de main-d'œuvre est déjà aiguë (logistique, manufacturing). Moyen terme (2028-2030) : pression réelle sur les emplois physiques répétitifs et bas qualifiés. Long terme : dépend de la vitesse de chute des coûts. Les prévisions sérieuses s'accordent sur un déploiement en millions d'unités d'ici 2032-2035 dans les pays riches.

Quels acteurs européens sur les humanoïdes ?

Marginal sur le matériel — pas d'équivalent européen de Tesla Optimus / Figure / Unitree. Plus présent côté composants : capteurs (Sony France, Aebi-Schmidt, ABB), motorisation (Schneider Electric, Bosch), batteries (Verkor, ACC). Côté logiciel : Mistral et Aleph Alpha pourraient fournir la couche IA cognitive, mais ne se positionnent pas frontalement sur l'humanoïde. La voie probable : intégrateurs européens spécialisés (Siemens, Schneider) plutôt que constructeurs end-to-end.

Toute l'actualité Robots humanoïdes

Flux automatique. Articles classés par pertinence, agrégés en continu.

Le premier robot humanoïde de BYD, c’est imminent
1Frandroid RobotiqueActu

Le premier robot humanoïde de BYD, c’est imminent

Le premier robot humanoïde signé BYD sera dévoilé en août dans l'espace Di Space de Zhengzhou, en Chine, a confirmé le constructeur automobile. Contrairement à une simple présentation conceptuelle, cette apparition publique portera sur un prototype physique fonctionnel, marquant l'entrée officielle de BYD dans la course à la robotique humanoïde. Zhengzhou abrite déjà d'importantes installations industrielles du groupe, ce qui en fait un lieu logique pour cette démonstration technologique. Les détails techniques précis du robot, comme ses capacités motrices, son autonomie ou ses cas d'usage envisagés, restent pour l'instant limités, BYD ayant choisi de distiller l'information progressivement avant l'événement d'août. Cette annonce confirme l'intérêt grandissant des constructeurs automobiles chinois pour la robotique humanoïde, un secteur jusqu'ici dominé par des acteurs comme Tesla avec son robot Optimus ou des spécialistes chinois comme Unitree. Pour BYD, numéro un mondial des véhicules électriques, cette diversification illustre une stratégie de convergence entre expertise en batteries, moteurs électriques et intelligence artificielle embarquée, des compétences déjà mobilisées dans l'automobile. L'enjeu dépasse le simple coup de communication: un robot humanoïde crédible pourrait ouvrir des débouchés dans la logistique industrielle, l'assemblage en usine ou les services, des marchés où la main-d'œuvre robotisée devient un argument compétitif majeur face à la concurrence internationale. Le contexte plus large est celui d'une course effrénée entre géants technologiques et industriels chinois pour dominer la robotique humanoïde, secteur jugé stratégique par Pékin dans ses plans de développement technologique national. Des entreprises comme Xiaomi, Huawei ou encore des start-up spécialisées multiplient les annonces ces derniers mois, chacune cherchant à démontrer sa maîtrise de technologies clés comme les actionneurs, la vision par ordinateur ou les modèles d'IA embarqués. L'arrivée de BYD, acteur disposant de moyens financiers et industriels considérables, pourrait accélérer cette compétition et redistribuer les cartes face aux pionniers américains du secteur.

1 source
Startup robotique Tacta dévoile sa main (et son gant)
2The Information AI 

Startup robotique Tacta dévoile sa main (et son gant)

Vikram Pavate, cofondateur et directeur général de Tacta Systems, a ouvert pour la première fois les portes de son siège de Palo Alto à des observateurs extérieurs. Cette startup américaine de robotique, âgée de trois ans, a levé 75 millions de dollars tout en restant volontairement discrète jusqu'ici. Son produit central repose sur des gants spécialisés que des travailleurs portent au quotidien, au bureau comme à la maison, pour enregistrer précisément leurs mouvements de mains. Ces données servent ensuite à entraîner des modèles d'intelligence artificielle physique destinés aux robots humanoïdes. Tacta a également développé une main robotique à trois doigts, montée sur un bras industriel du commerce, lui-même fixé sur une base mobile à roulettes. Cette approche répond à un problème central du secteur de la robotique humanoïde: le manque criant de données d'entraînement pour que les modèles d'IA apprennent à manipuler des objets avec la dextérité humaine. Selon Pavate, ce qui rend les humains si performants dans les tâches à forte valeur ajoutée tient avant tout à leurs mains. En misant sur cette conviction, Tacta fait un pari stratégique fort: plutôt que de construire un robot humanoïde complet, l'entreprise concentre tous ses efforts sur la main, laissant le reste du corps à d'autres acteurs du secteur. Cette spécialisation pourrait accélérer le développement de robots réellement capables d'automatiser des tâches manuelles complexes dans l'industrie et les foyers. Cette stratégie s'inscrit dans une tendance plus large de la robotique: plusieurs entreprises explorent désormais des dispositifs portables, comme les gants captant les mouvements, pour contourner la pénurie de données réelles nécessaires à l'entraînement des modèles physiques. Alors que des géants comme Tesla, Figure ou Boston Dynamics investissent dans des humanoïdes complets, Tacta parie sur une approche modulaire et spécialisée. Reste à savoir si cette stratégie de niche, centrée sur la main, permettra à la startup de s'imposer face à des concurrents mieux financés et de transformer ses gants collecteurs de données en avantage commercial durable sur le marché naissant des robots physiques.

💬 Tacta a raison sur un truc : dans l'humanoïde, tout le monde raconte des histoires de bras et de jambes alors que le vrai goulot d'étranglement c'est la main, celle qui manipule les objets avec la dextérité qu'aucun modèle n'a encore. Parier sur le gant plutôt que sur le robot complet, c'est malin, ça évite de brûler du cash sur un corps entier pendant que la concurrence galère sur la même friction de données. Reste que 75 millions face à Tesla ou Figure, c'est pas gagné, et vendre une main toute seule à des industriels qui veulent un robot fini, ça reste un pari commercial risqué.

RobotiqueActu
1 source
Unitree : cette IA apprend aux robots humanoïdes à gérer seuls les tâches du quotidien
3Le Big Data 

Unitree : cette IA apprend aux robots humanoïdes à gérer seuls les tâches du quotidien

Il y a environ 40 mètres d'écart entre le titre du poste et le sujet réel : c'est un article, pas une tâche de code. Je le résume directement. Unitree a dévoilé un nouveau modèle d'intelligence artificielle baptisé UnifoLM-OminiA-0.3, destiné à ses robots humanoïdes. Contrairement à l'approche classique qui consiste à entraîner un robot pour chaque tâche spécifique, ce modèle unique gère simultanément de nombreux scénarios différents. Il combine en temps réel plusieurs sources d'information : l'analyse visuelle via les caméras, la compréhension des commandes vocales et l'interprétation de l'environnement. Unitree qualifie cette approche d'interaction « omni-modale », c'est-à-dire une intelligence capable de traiter plusieurs types de données à la fois pour prendre la meilleure décision possible. Une vidéo de démonstration d'environ deux minutes illustre ces capacités : le robot identifie un coussin mal placé et le repositionne, récupère une boîte de médicaments précise en tenant compte de sa couleur et de son emplacement, range des vêtements dans une panière, place des assiettes dans un lave-vaisselle, et contrôle un lit médicalisé tout en s'arrêtant immédiatement sur commande vocale. Ce qui distingue cette annonce des précédentes démonstrations robotiques, ce n'est pas la nature des tâches elles-mêmes, déjà réalisées par d'autres machines en environnement contrôlé, mais la capacité du modèle à enchaîner plusieurs opérations en comprenant le contexte global, sans reprogrammation entre chaque étape. Un robot équipé de ce système ne se contente plus de chercher un objet à saisir : il identifie ses caractéristiques précises, planifie son geste, puis ajuste sa trajectoire si un obstacle survient en cours de route. Pour l'industrie de la robotique domestique et de service, cette avancée représente un pas vers des machines réellement utilisables au quotidien, capables de s'adapter à des environnements changeants plutôt que de répéter des séquences figées apprises à l'avance. Unitree met également en avant la robustesse de son système, censé maintenir une exécution stable même lorsqu'un élément extérieur perturbe le robot en pleine action. Cette annonce s'inscrit dans une course plus large que se livrent les fabricants de robots humanoïdes pour doter leurs machines d'une véritable autonomie décisionnelle, un enjeu central pour transformer des prototypes spectaculaires en produits réellement déployables chez les particuliers ou en entreprise. Unitree, fabricant chinois déjà reconnu pour ses robots quadrupèdes et humanoïdes à prix relativement accessibles, cherche ainsi à se distinguer sur le terrain de l'intelligence embarquée plutôt que sur la seule mécanique. L'enjeu des mois à venir sera de vérifier si ces capacités tiennent leurs promesses hors des vidéos de démonstration, dans des environnements domestiques réels bien plus imprévisibles, avec des objets, des obstacles et des demandes humaines qui ne suivent aucun script préétabli.

RobotiqueActu
1 source
Pourquoi l’Europe pourrait devenir le premier marché mondial des robots humanoïdes
4FrenchWeb 

Pourquoi l’Europe pourrait devenir le premier marché mondial des robots humanoïdes

Le secteur des robots humanoïdes est en train de passer du stade de simple vitrine technologique à celui d'industrie naissante. Depuis deux ans, les annonces s'enchaînent : Tesla accélère le développement de son robot Optimus, Figure AI a commencé à déployer ses premiers modèles directement sur des sites industriels, et la Chine voit émerger des dizaines de fabricants capables de produire ces machines à des coûts de plus en plus bas, grâce à une chaîne d'approvisionnement locale déjà rodée sur l'électronique et la robotique. Dans ce contexte de course mondiale entre les Etats-Unis et la Chine, une question émerge : quelle place reste-t-il pour l'Europe, qui n'a pour l'instant produit aucun acteur comparable à Tesla ou Figure AI sur ce segment. C'est justement là que se joue l'enjeu principal : plutôt que de rivaliser sur la fabrication, l'Europe pourrait s'imposer comme le principal marché de déploiement de ces robots. Son tissu industriel dense, ses usines automobiles et logistiques, ainsi que sa pénurie de main-d'œuvre dans certains secteurs manuels en font un terrain d'adoption particulièrement favorable. Pour les industriels européens, l'enjeu n'est plus seulement de suivre l'innovation américaine ou chinoise, mais de décider rapidement quels partenaires équiper en priorité, ce qui pourrait redessiner les rapports de force entre fournisseurs de robots et donneurs d'ordre. Cette dynamique s'inscrit dans une compétition technologique plus large entre les Etats-Unis, qui misent sur l'innovation portée par des entreprises comme Tesla et Figure AI, et la Chine, qui mise sur les volumes et la baisse des coûts de production. L'Europe, dépourvue de champion national dans ce domaine, devra choisir entre importer massivement ces technologies ou tenter de construire sa propre filière industrielle, une décision dont dépendra sa position dans cette nouvelle chaîne de valeur mondiale.

UEL'Europe pourrait s'imposer comme premier marché de déploiement des robots humanoïdes grâce à son tissu industriel et sa pénurie de main-d'œuvre, mais devra choisir entre importer ces technologies ou construire sa propre filière industrielle.

💬 Le vrai coup de billard, c'est que l'Europe n'a pas besoin de fabriquer un Optimus pour peser dans cette histoire. Elle a des usines qui tournent déjà et personne pour les faire tourner, ça change tout sur qui a le rapport de force. Selon Le Fil IA, le prochain champion des robots humanoïdes ne sera peut-être pas celui qui les construit, mais celui qui décide où ils vont travailler en premier. Reste à voir si les industriels européens jouent groupés ou si chacun négocie dans son coin, et ça, ça sent le retard classique made in Europe.

RobotiqueOpinion
1 source
Une tour à 15 274 €, deux GPU AMD et aucun abonnement cloud : on a testé l’IA locale à son maximum [Sponso]
5Numerama 

Une tour à 15 274 €, deux GPU AMD et aucun abonnement cloud : on a testé l’IA locale à son maximum [Sponso]

Une configuration à 15 274 euros, assemblée sous un bureau et équipée de deux cartes graphiques AMD, a été testée pour évaluer ce qu'une machine dédiée à l'intelligence artificielle peut réellement accomplir en local, sans recourir au moindre service cloud. L'objectif de ce test, mené en collaboration avec AMD, était de faire fonctionner une chaîne complète de production logicielle d'IA, de l'entraînement à l'inférence, entièrement sur du matériel physique installé chez l'utilisateur. Le contenu a été produit par les rédacteurs indépendants de l'entité Humanoid xp, sans intervention de la rédaction de Numerama, dans le cadre d'un partenariat commercial clairement identifié. Cette démarche illustre un intérêt croissant pour les infrastructures d'IA locales, à contre-courant du modèle dominant fondé sur les abonnements aux plateformes cloud comme AWS, Azure ou Google Cloud. Pour les professionnels et les entreprises soucieux de maîtriser leurs coûts récurrents, leurs données sensibles ou leur dépendance à des fournisseurs tiers, une tour équipée de GPU AMD représente une alternative tangible, même si l'investissement initial reste conséquent. Cela change la donne pour les studios, les chercheurs ou les PME qui veulent expérimenter avec des modèles d'IA sans exposer leurs données à des serveurs externes ni subir la facturation à l'usage. Le marché du matériel dédié à l'IA locale s'est intensifié ces dernières années, porté par la demande de puissance de calcul pour l'entraînement et l'inférence de modèles toujours plus lourds. AMD y voit une opportunité de concurrencer Nvidia, acteur dominant du secteur, en misant sur des configurations multi-GPU accessibles aux particuliers avertis et aux petites structures. Ce type de démonstration commerciale s'inscrit dans une bataille plus large pour convaincre les utilisateurs que l'IA locale peut rivaliser, en performance comme en autonomie, avec les offres cloud des géants du secteur.

💬 Une tour à 15 000 balles pour causer IA sans dépendre du cloud, c'est le genre de démo commerciale qu'on regarde avec un sourcil levé, financée par AMD pour vendre du multi-GPU. Mais le vrai signal derrière, c'est que le prix d'entrée pour sortir du modèle abonnement-cloud devient un calcul économique sérieux, pas juste un fantasme de geek paranoïaque des données. Reste à voir si une PME normale a vraiment besoin de ça, parce que pour la plupart, un bon abonnement API reste largement moins cher que d'amortir une tour à cinq chiffres.

InfrastructureActu
1 source
Hyundai : les salariés se révoltent contre l’arrivée des robots humanoïdes
6Le Big Data 

Hyundai : les salariés se révoltent contre l’arrivée des robots humanoïdes

Hyundai a annoncé en janvier son intention d'introduire des robots humanoïdes Atlas, développés par sa filiale Boston Dynamics, dans son usine de Géorgie à partir de 2028. En mai, le groupe a présenté à ses investisseurs un plan bien plus ambitieux : le déploiement de plus de 25 000 robots humanoïdes sur l'ensemble de ses sites de production automobile. Cette annonce a déclenché une mobilisation chez les salariés sud-coréens du constructeur, qui ont voté en faveur d'un mouvement de grève. « Nous sommes inquiets pour la sécurité de l'emploi à cause des robots », a déclaré un représentant syndical au Financial Times, précisant que les démonstrations et vidéos montrant les progrès rapides de ces machines alimentent les craintes des employés. Le syndicat coréen des métallurgistes réclame d'être consulté avant tout déploiement de robots ou de systèmes d'intelligence artificielle dans les usines du groupe, ainsi qu'une prime exceptionnelle équivalente à environ un tiers du bénéfice annuel de Hyundai, soit près de 27 000 dollars par salarié pour les 73 000 employés du groupe. Cette contestation illustre une tension de fond entre l'accélération de l'automatisation industrielle et la protection de l'emploi, dans un secteur où les marges de manœuvre syndicales restent fortes. Hyundai assure de son côté que les robots humanoïdes seront cantonnés aux tâches les plus pénibles ou dangereuses, laissant aux salariés les missions nécessitant une intervention humaine plus fine. Mais les représentants des employés restent sceptiques face à des promesses qu'ils jugent insuffisantes pour garantir le maintien des effectifs à long terme. L'enjeu dépasse le seul cas Hyundai : il interroge la manière dont les constructeurs automobiles, en pleine course à la robotisation, vont négocier avec leurs salariés les conditions d'introduction de ces nouvelles technologies, et qui captera les gains de productivité qu'elles promettent. Le syndicat de Hyundai a déjà brandi la menace d'une grève lors de précédentes négociations salariales sans pour autant aller jusqu'à l'arrêt total de la production, la dernière grève générale du groupe remontant à 2018. La demande de prime exceptionnelle s'inscrit dans un contexte particulier : plusieurs grands groupes industriels sud-coréens, à commencer par Samsung, ont récemment versé d'importantes primes à leurs employés grâce à des bénéfices dopés par l'essor de l'intelligence artificielle, nourrissant un sentiment de frustration chez les salariés de Hyundai. Pour Kim Pil-soo, professeur de génie automobile à l'université Daelim, certaines revendications syndicales ont toutefois peu de chances d'aboutir. Cette friction s'inscrit dans une dynamique plus large : les robots humanoïdes gagnent du terrain dans l'industrie, qu'il s'agisse de Japan Airlines pour le transport de bagages à l'aéroport de Haneda, de la poste chinoise pour le tri du courrier, ou de BMW, qui en teste dans son usine de Leipzig et y voit l'avenir de la production automobile.

UEBMW teste déjà des robots humanoïdes similaires dans son usine de Leipzig, ce qui montre que cette dynamique de robotisation et les tensions sociales associées concernent aussi l'industrie automobile européenne.

SociétéActu
1 source
La Corée du Sud investit 1 000 milliards de dollars dans la production de puces mémoire et les robots humanoïdes
7Ars Technica AI 

La Corée du Sud investit 1 000 milliards de dollars dans la production de puces mémoire et les robots humanoïdes

Le gouvernement sud-coréen et ses plus grands groupes technologiques ont annoncé le 29 juin 2026 un investissement commun de 1 000 milliards de dollars destiné à financer plusieurs mégaprojets stratégiques. Ce plan couvre trois axes prioritaires : l'expansion de la production de puces mémoire, la construction de nouveaux centres de données dédiés à l'IA, et le déploiement commercial de robots humanoïdes d'ici 2028. C'est le président Lee Jae Myung qui a lui-même présenté ce programme dans un discours télévisé, affirmant que « les semi-conducteurs, l'IA physique et les centres de données IA constituent le triple axe d'un grand bond en avant ». Le constructeur automobile Hyundai, via sa filiale Boston Dynamics, figure parmi les acteurs centraux du volet robotique, avec l'ambition de déployer des robots humanoïdes dans ses usines pour remplacer les tâches les plus pénibles dès 2028. Cet investissement massif arrive à un moment où Samsung et SK Hynix, les deux géants coréens de la mémoire, enregistrent des profits et des valorisations boursières records, portés par la demande explosive de l'industrie IA en puces HBM et DRAM. Mais cette demande a également créé une tension sévère sur les approvisionnements mondiaux, entraînant des pénuries et une hausse des prix pour les équipements électroniques grand public. Augmenter les capacités de production permettrait non seulement de consolider les positions coréennes, mais aussi de stabiliser un marché mondial sous pression. Sur le front robotique, l'enjeu est tout aussi concret : les usines automobiles manquent de main-d'oeuvre pour les tâches répétitives et dangereuses, et les humanoïdes de Boston Dynamics représentent une réponse industrielle crédible. La Corée du Sud s'inscrit ainsi dans une course géopolitique intense autour des technologies d'IA et de semi-conducteurs, où les États-Unis, la Chine, le Japon et Taiwan cherchent tous à sécuriser leur indépendance technologique. Le président Lee a explicitement formulé l'urgence en ces termes : « Nous devons sécuriser les éléments clés de l'IA plus vite que n'importe quel autre pays. » Ce plan de 1 000 milliards constitue la réponse coréenne à cette compétition, avec une stratégie intégrée qui lie la puissance en semiconducteurs à l'essor de l'IA et à la robotique industrielle, trois domaines appelés à se renforcer mutuellement dans les années à venir.

UEL'augmentation des capacités coréennes de production de puces HBM et DRAM pourrait stabiliser l'approvisionnement mondial et freiner la hausse des prix qui pèse sur les fabricants européens d'équipements électroniques et d'infrastructures IA.

💬 Quand les profits battent des records, tu réinvestis tout de suite. Je comprends la logique: puces HBM, data centers IA, robots humanoïdes dans les usines, les trois se nourrissent mutuellement et Séoul l'a bien cerné. Hyundai qui déploie des Boston Dynamics dans ses propres lignes d'assemblage d'ici 2028, c'est la boucle verticale que les Américains n'ont pas encore fermée.

InfrastructureOpinion
1 source
Liquid AI lance LFM2.5-230M avec support llama.cpp, MLX, vLLM, SGLang et ONNX pour l'inférence sur appareil
8MarkTechPost 

Liquid AI lance LFM2.5-230M avec support llama.cpp, MLX, vLLM, SGLang et ONNX pour l'inférence sur appareil

Liquid AI a lancé son modèle le plus compact à ce jour, le LFM2.5-230M, un modèle texte de 230 millions de paramètres disponible en open-weight sur Hugging Face. La startup publie deux versions : un modèle de base pour le fine-tuning et une version instruction-tuned prête à l'emploi. Le modèle repose sur l'architecture LFM2, combinant huit blocs de convolution LIV à double porte et six blocs d'attention groupée (GQA), un agencement hybride conçu pour maximiser la vitesse d'inférence sur CPU. Il a été pré-entraîné sur 19 000 milliards de tokens, puis affiné en trois étapes : supervision par distillation depuis le modèle frère LFM2.5-350M, optimisation par préférence directe (DPO), et apprentissage par renforcement multi-domaine. Il tourne à 213 tokens par seconde sur un Samsung Galaxy S25 Ultra et à 42 tokens par seconde sur un Raspberry Pi 5, avec une empreinte mémoire de 293 à 375 Mo en quantification 4-bit. La compatibilité est immédiate avec llama.cpp, MLX, vLLM, SGLang et ONNX. Ce modèle s'impose sur des tâches précises : le suivi d'instructions et l'extraction de données structurées. Sur le benchmark IFEval, il obtient 71,71 points, devançant nettement le Qwen3.5-0.8B (59,94) et le Gemma 3 1B (63,49), deux modèles pourtant trois à quatre fois plus lourds. Sur CaseReportBench, un test d'extraction clinique, il score 22,51 contre 2,28 pour Gemma 3 1B. Concrètement, cela ouvre la voie à des pipelines de traitement massif, Liquid AI cite l'exemple de 100 000 rapports cliniques parsés localement en champs structurés, sans coût d'API par token. Le modèle a également été déployé sur un robot humanoïde Unitree G1, tournant entièrement sur le module embarqué NVIDIA Jetson Orin, où il traduit des instructions en langage naturel en séquences d'appels d'outils invoquant les primitives du framework SONIC de NVIDIA. Liquid AI, fondée en 2023 à partir de travaux du MIT sur les réseaux neuronaux à états liquides, s'est positionnée dès le départ sur des architectures alternatives aux transformers classiques. Le LFM2.5-230M s'inscrit dans une stratégie de couverture du spectre complet, des petits modèles embarqués aux grands modèles cloud. La société est transparente sur les limites : ce modèle n'est pas recommandé pour les tâches de raisonnement avancé, la génération de code ou les mathématiques complexes, son score MMLU-Pro de 20,25 reste très en deçà du Qwen3.5-0.8B (37,42). La vraie bataille se joue sur les appareils de périphérie, robots, hubs domotiques, assistants mobiles, où la taille du modèle et la vitesse d'inférence priment sur la polyvalence. Avec la montée des architectures agentiques embarquées, la capacité à faire tourner un modèle capable d'enchaîner des appels d'outils en local, sans latence réseau ni dépendance cloud, devient un avantage concurrentiel réel.

UELe traitement local de données sensibles (médicales, juridiques) sans appel API cloud représente un atout concret pour la conformité RGPD des entreprises européennes.

💬 42 tokens par seconde sur un Raspberry Pi 5, et sur le suivi d'instructions, ce 230M dépasse des modèles trois à quatre fois plus lourds. Liquid AI ne cache pas les limites (raisonnement, maths, code, c'est non), mais ils ont visé un créneau précis et ça tient. Quand tu peux parser 100 000 rapports cliniques en local sans passer par le cloud et sans frais d'API, les architectures agentiques embarquées commencent à peser vraiment.

LLMsOpinion
1 source
Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert
9arXiv cs.RO 

Humanoid Everyday : un jeu de données robotique complet pour la manipulation humanoïde en monde ouvert

Une équipe de recherche a publié sur arXiv (identifiant 2510.08807v2) Humanoid Everyday, un jeu de données massif dédié à l'apprentissage de la manipulation par les robots humanoïdes en conditions ouvertes. Le dataset compile 10 300 trajectoires et plus de 3 millions de frames couvrant 260 tâches réparties en 7 catégories larges : manipulation dextère d'objets, interaction humain-humanoïde, actions intégrant de la locomotion bipède, et d'autres scénarios du quotidien. Les données sont multimodales, RGB, profondeur, LiDAR, retour tactile, accompagnées d'annotations en langage naturel. La collecte repose sur un pipeline de télé-opération supervisée par des humains, optimisé pour maximiser le débit tout en maintenant la qualité des démonstrations. Les auteurs publient simultanément une plateforme d'évaluation cloud permettant à des équipes extérieures de déployer leurs propres politiques de contrôle et d'obtenir des métriques comparables dans un environnement standardisé. Ce dataset comble un vide structurel dans la recherche robotique : la quasi-totalité des benchmarks existants (Open X-Embodiment, DROID, BridgeData V2) ciblent des bras fixes, et les rares datasets humanoïdes disponibles se limitent à des environnements contrôlés, un faible nombre de tâches, et excluent généralement la locomotion et l'interaction avec des personnes. Pour un intégrateur ou un décideur industriel, la portée pratique est double : des données hétérogènes permettent d'entraîner des politiques plus généralisables, notamment des architectures VLA (vision-language-action) ; la plateforme d'évaluation cloud offre pour la première fois un cadre reproductible pour comparer des méthodes d'apprentissage par imitation ou par renforcement sur des tâches humanoïdes réalistes. L'article analyse aussi les performances de plusieurs politiques de référence, en identifiant leurs forces et limites par catégorie. La publication intervient dans un contexte de forte concurrence autour des données d'entraînement pour humanoïdes. Physical Intelligence (Pi-0, π0.5), NVIDIA (GR00T N2), Unitree et Figure AI misent chacun sur des datasets propriétaires pour différencier leurs politiques de contrôle. Côté recherche ouverte, AgiBot World et RH20T ont posé des jalons, mais restent limités dans leur couverture humanoïde. Humanoid Everyday est rendu entièrement public, dataset, code de collecte et plateforme d'évaluation inclus, ce qui en fait une ressource directement exploitable par des laboratoires et startups sans accès à des infrastructures de collecte massives. Les auteurs présentent cette release comme un socle pour de futurs agents incarnés généralistes, sans préciser d'échéancier pour des suites expérimentales.

UELes équipes de recherche et startups européennes en robotique humanoïde peuvent exploiter directement ce dataset open-source, 10 300 trajectoires, 260 tâches, plateforme d'évaluation cloud, sans investir dans une infrastructure de collecte massive, ce qui réduit la barrière d'entrée face aux acteurs américains et asiatiques disposant de données propriétaires.

💬 Le vrai sujet ici, c'est pas juste le volume (10 300 trajectoires, bon), c'est que les benchmarks humanoïdes existants ignoraient presque tous la locomotion et l'interaction avec des humains réels depuis le début. Des acteurs comme Pi-0 ou GR00T N2 misaient sur leurs données propriétaires comme avantage concurrentiel, et une release open-source de cette ampleur vient rogner ce levier directement. Reste à voir si ça tient face à des politiques entraînées en conditions réelles, mais pour des labos sans infrastructure de collecte massive, ça change le rapport de force.

RobotiqueOpinion
1 source
DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent
10arXiv cs.RO 

DREAM-Chunk : regroupement d'actions réactif avec modèle du monde latent

DREAM-Chunk (arXiv:2606.18589, juin 2026) est une méthode d'inférence conçue pour corriger une fragilité structurelle des modèles vision-language-action (VLA) : l'exécution en boucle ouverte lors de l'action chunking. Ce paradigme, devenu standard dans les VLA actuels, consiste à inférer à basse fréquence un bloc d'actions (un "chunk") que le robot exécute séquentiellement à haute fréquence, sans rétroaction intermédiaire. Dès qu'un chunk est lancé, le robot le suit à l'aveugle, vulnérable aux perturbations dynamiques, aux erreurs matérielles et à l'observabilité partielle. DREAM-Chunk adresse ce problème sans modifier ni réentraîner la politique sous-jacente : à l'inférence, il génère plusieurs chunks candidats, simule leurs trajectoires dans un espace latent via un world model léger, et sélectionne celui dont l'état prédit correspond le mieux à l'observation réelle. La méthode est validée sur le benchmark Kinetix et sur quatre tâches de manipulation couvrant deux plateformes robotiques et deux architectures VLA distinctes. L'intérêt pratique est direct pour les intégrateurs industriels qui déploient des VLA pré-entraînés sans accès au pipeline d'entraînement : DREAM-Chunk s'insère comme une couche plug-and-play, sans fine-tuning requis. La méthode s'inscrit dans la tendance du test-time compute scaling, bien établie côté LLM mais encore naissante en robotique physique, où dépenser davantage de calcul à l'inférence peut compenser les limites d'un modèle sans passer par un nouveau cycle d'entraînement coûteux. Les résultats montrent que les gains augmentent avec le nombre de chunks candidats échantillonnés, et que l'avantage est particulièrement marqué lorsque les démonstrations contiennent des comportements correctifs, ce qui soulève une question pratique sur la composition des datasets de démo. Les world models latents en robotique ont une longue tradition (DREAMER, TD-MPC2, DreamerV3), mais leur couplage avec des VLA basés sur le chunking reste récent. Physical Intelligence avec pi-0, Figure AI et des équipes de Stanford, CMU et Berkeley explorent simultanément comment améliorer la robustesse en déploiement sans réentraînement complet. DREAM-Chunk se distingue par son caractère agnostique au modèle sous-jacent, ce qui facilite son adoption sur des architectures hétérogènes. La prochaine étape logique serait une validation sur des plateformes commerciales à manipulation dextre (Fourier GR1, Unitree G1) et des tâches à dynamiques hautement stochastiques comme l'assemblage de précision. Le papier ne mentionne ni partenaires industriels ni pilotes commerciaux annoncés.

💬 Le test-time compute scaling arrive enfin en robotique physique, et DREAM-Chunk en est un premier signal propre : générer des trajectoires candidates, simuler dans un espace latent, choisir la meilleure, sans toucher au modèle sous-jacent. Le chunking en boucle ouverte, c'est le point faible silencieux de tous les VLA actuels (ça marche dans 80% des cas, alors on n'en parle pas trop). Pour les intégrateurs qui déploient sans accès au pipeline d'entraînement, une couche qui corrige à l'inférence sans réentraîner, c'est la pièce manquante.

RobotiqueOpinion
1 source
Alibaba dévoile des cerveaux IA conçus pour équiper la prochaine génération de robots
11Interesting Engineering 

Alibaba dévoile des cerveaux IA conçus pour équiper la prochaine génération de robots

Alibaba a annoncé en juin 2026 le lancement de la suite Qwen-Robot, sa première famille de modèles d'IA dite "embodied", développée par son Tongyi Lab et actuellement en phase de pilote avec des clients entreprise d'Alibaba Cloud. La suite repose sur trois modèles spécialisés : Qwen-RobotNav pour la navigation et le suivi de cibles, Qwen-RobotManip pour la manipulation d'objets physiques, et Qwen-RobotWorld pour la modélisation de l'environnement et la prédiction des conséquences d'actions. Le groupe a également publié Qwen-RobotClaw, un framework d'agents qui expose les modèles Qwen-Robot comme outils accessibles à des agents LLM, ainsi que Chat2Robot, une plateforme open-source en navigateur pour tester des interactions avec des robots physiques. Sur le plan des performances déclarées, Qwen-RobotManip a été entraîné sur plus de 38 000 heures de données open-source et a obtenu sur le benchmark RoboChallenge un process score de 59,83 avec un taux de succès de tâches de 45 % dans la catégorie "généraliste". La démonstration de navigation a mis en scène un quadrupède Unitree Go2 équipé d'un NVIDIA Jetson Thor et d'une seule caméra basse résolution, atteignant une latence d'inférence de 196 millisecondes dans un appartement inconnu, sans carte préchargée. Ces résultats méritent d'être lus avec prudence : un taux de succès de 45 % sur un benchmark réel, s'il est confirmé en conditions non contrôlées, reste modeste mais significatif pour un modèle généraliste. Le vrai signal industriel n'est pas le score brut, c'est l'approche architecturale : au lieu de fusionner indifféremment données de navigation, bras robotiques, caméras et véhicules autonomes, Alibaba a opté pour une spécialisation par modalité, évitant les conflits d'apprentissage que génère le mélange hétérogène de données physiques. Pour les intégrateurs et décideurs B2B, la disponibilité via Alibaba Cloud en pilote marque un premier pas vers la commercialisation d'une couche d'IA robotique as-a-service, potentiellement utilisable sur du matériel tiers sans pipeline de training propriétaire. Alibaba entre dans une course déjà engagée par plusieurs acteurs de premier plan. Aux États-Unis, Google DeepMind fait avancer Gemini Robotics sur des architectures Vision-Language-Action (VLA) similaires, tandis que Physical Intelligence (Pi-0), Figure AI (Figure 03) et Boston Dynamics misent sur des pipelines de données propriétaires et des déploiements industriels réels. NVIDIA pousse son framework GR00T N2 comme socle hardware-logiciel pour l'humanoid. Côté chinois, Unitree et Agibot ont déjà des robots en production, mais sans la couche LLM intégrée qu'Alibaba apporte. L'open-sourcing de Chat2Robot et les pilotes cloud suggèrent une stratégie d'écosystème : capter les développeurs et intégrateurs autour des modèles Qwen-Robot avant que le marché des robots généraux ne se consolide, probablement d'ici 2027-2028 selon les timelines annoncées par les principaux concurrents.

UEL'entrée d'Alibaba dans l'IA robotique cloud-as-a-service intensifie la pression concurrentielle mondiale, sans déploiement ni partenariat européen annoncé à ce stade.

💬 45 % de réussite sur un benchmark généraliste, c'est pas brillant, je sais, mais tu regardes au mauvais endroit. Le vrai signal, c'est l'architecture : trois modèles spécialisés par modalité plutôt qu'un gros fourre-tout, parce que mélanger navigation, manipulation et caméras dans le même pipeline, ça crée des conflits d'apprentissage que tout le monde a sous-estimés depuis le début. Alibaba ne cherche pas à gagner les benchmarks robotiques, ils cherchent à s'installer comme la couche cloud entre le matériel tiers et l'IA physique avant que le marché se consolide.

RobotiqueOpinion
1 source
Autonomique déploie des robots semi-humanoïdes et de l'IA chez un équipementier automobile canadien de rang 1
12Robotics Business Review 

Autonomique déploie des robots semi-humanoïdes et de l'IA chez un équipementier automobile canadien de rang 1

Autonomique Inc., startup californienne fondée en 2024 et issue des laboratoires de SRI International (Menlo Park), annonce le passage en déploiement industriel de sa plateforme d'IA physique chez F&P Manufacturing, équipementier automobile Tier 1 canadien basé à Tottenham, Ontario, spécialisé dans les systèmes de chassis et de suspension. La société ne commercialise pas de robot propre mais une couche logicielle hardware-agnostique conçue pour ajouter dextérité et raisonnement à des bras industriels existants, issus notamment de Denso, Staubli et RealMan Robotics. Son PDG, Vikrant Tomar, docteur en IA et ancien fondateur de Fluent.ai, insiste sur la distinction entre démonstration et production : les métriques annoncées (temps de cycle, précision, réduction de rebuts) restent à ce stade déclaratifs, sans données publiques indépendantes pour les valider. Le déploiement chez F&P est présenté comme un pilote progressant vers une industrialisation, non comme un rollout à l'échelle déjà opérationnel. L'intérêt technique réside dans l'architecture dite "généraliste-spécialiste" : plutôt qu'un unique modèle vision-langage-action (VLA) monolithique, la plateforme orchestre dynamiquement des compétences déterministes (apprentissage par renforcement en ligne pour les insertions de précision, par exemple) et des modèles VLA plus flexibles pour gérer les anomalies ou les tâches non prévues. Cette approche répond à une critique structurelle du secteur : les VLA génériques peinent à tenir les cadences et la répétabilité exigées en production réelle. Si Autonomique tient ses promesses chez F&P, ce serait un signal concret que le sim-to-real gap peut être comblé sur des workflows multi-étapes en environnement industriel contraint, sans recours à des end-effectors coûteux comme les mains robotiques polyarticulées. Autonomique s'appuie sur des licences de technologies SRI, dont le système de télé-opération déjà utilisé par l'armée américaine pour le déminage et par des laboratoires pharmaceutiques en salles blanches, ce qui donne à sa base de données d'entraînement une provenance inhabituelle pour une startup robotique. Ses concurrents directs dans le segment "software layer for industrial arms" incluent Covariant (racheté par Amazon), Machina Labs ou Physical Intelligence (Pi-0), tandis que des acteurs comme 1X Technologies ou Figure AI ciblent l'humanoïde complet, segment qu'Autonomique juge prématuré pour la production. Les prochaines étapes annoncées : extensions de partenariats avec Holiday Robotics et Rainbow Robotics, discussions en cours avec des développeurs d'humanoïdes, et réplication du blueprint F&P sur d'autres lignes et sites. Aucun acteur européen ou français n'est impliqué à ce stade.

💬 La couche logicielle sur bras existants, c'est le seul modèle qui colle vraiment avec la réalité des usines : pas besoin de remplacer le hardware. L'architecture généraliste-spécialiste d'Autonomique (déterminisme pour les tâches de précision, VLA pour gérer les exceptions) s'attaque enfin au problème que personne n'avait résolu proprement en prod réelle. Reste à valider les chiffres sur la durée, parce que pour l'instant c'est Autonomique qui parle d'Autonomique.

RobotiqueOpinion
1 source
ACE-Ego-0 : unification des données égocentrées humaines et robotiques pour le préentraînement VLA
13arXiv cs.RO 

ACE-Ego-0 : unification des données égocentrées humaines et robotiques pour le préentraînement VLA

Pré-publiée sur arXiv en juin 2026 (identifiant 2606.17200), ACE-EGO-0 est un cadre de pretraining pour modèles Vision-Langage-Action (VLA) qui exploite conjointement 4 530 heures de données robotiques et de simulation, et 1 480 heures de vidéos égocentrées humaines converties en pseudo-trajectoires robot. Le pipeline automatise la transformation de vidéos à la première personne en séquences d'actions au format démonstration téléopérée, en représentant les mouvements dans l'espace caméra plutôt que dans un référentiel corporel. Pour atténuer le bruit inhérent à ces pseudo-labels, un objectif d'entraînement reliability-aware concentre la supervision sur les segments les plus fiables via une perte auxiliaire dédiée. Évalué sur RoboCasa GR1 TableTop (robot humanoïde GR1 de Fourier Intelligence) et RoboTwin 2.0, ACE-EGO-0 atteint les meilleures performances publiées sur les deux benchmarks et démontre, selon les auteurs, un transfert vers la manipulation bimanuelle en conditions réelles. L'apport central est la résolution d'un problème structurel : les divergences d'espaces d'action, de morphologie et de dynamiques temporelles entre humains et robots rendaient jusqu'ici l'entraînement conjoint instable ou contre-productif. En unifiant la représentation via des actions caméra-space et un time-aligned action chunking avec morphology conditioning, les auteurs montrent que des jeux de données égocentrés existants comme Ego4D ou EPIC-Kitchens peuvent fournir un signal complémentaire valide à grande échelle. Pour les équipes R&D en robotique, l'implication pratique est directe : réduire significativement le coût de collecte de trajectoires robot, l'un des principaux goulots d'étranglement du déploiement VLA à l'échelle industrielle. La course aux politiques robotiques généralisables s'est accélérée depuis Pi-0 de Physical Intelligence (novembre 2024), OpenVLA et RT-2 de Google DeepMind. Des travaux antérieurs comme Dobb-E ou Human2Robot avaient déjà exploré les données humaines égocentrées comme supervision complémentaire, mais sans framework unifié à cette échelle ni évaluation systématique. ACE-EGO-0 propose une recette reproductible évaluée sur deux benchmarks de référence, dont RoboTwin 2.0, particulièrement pertinent car la manipulation bimanuelle reste un défi ouvert pour les humanoïdes commerciaux tels que Figure 03, Optimus Gen 3 ou Unitree H1. La prépublication ne mentionne ni partenaire industriel ni déploiement annoncé : ACE-EGO-0 est pour l'instant une contribution de recherche, pas un produit livrable.

RechercheOpinion
1 source
Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée
14TechNode 

Alibaba dévoile Qwen-Robot : trois modèles fondation pour l'IA incarnée

Alibaba a publié mardi une suite robotique composée de trois modèles fondamentaux : Qwen-RobotNav, Qwen-RobotManip et Qwen-RobotWorld. Qwen-RobotNav étend les capacités vision-langage à la robotique mobile en unifiant quatre tâches au sein d'un même framework : suivi d'instructions, navigation orientée objectif, tracking de cible et conduite autonome. Qwen-RobotManip standardise l'espace état-action et représente le mouvement de l'effecteur terminal sous forme de poses incrémentielles dans le référentiel caméra, une approche conçue pour faciliter la généralisation multi-plateforme. Ce modèle a été entraîné sur plus de 38 100 heures de données entièrement open source. Qwen-RobotWorld, le troisième composant, fonctionne comme un world model généraliste : il prédit des états futurs physiquement cohérents via une interface en langage naturel, couvrant simultanément la navigation, la conduite et la manipulation depuis un seul modèle. L'approche modulaire mais unifiée est la proposition de valeur centrale de cette suite. Un world model unique opérant sur trois domaines d'action représente une architecture qui, si elle tient ses promesses en conditions réelles, réduirait significativement les coûts d'intégration pour les équipes robotiques industrielles. L'utilisation de données entièrement open source pour Qwen-RobotManip est un signal notable dans un secteur où les datasets propriétaires constituent souvent un avantage concurrentiel défensif : Alibaba positionne ainsi Qwen-Robot davantage comme une infrastructure partagée que comme un produit fermé. Réserve importante cependant : l'annonce ne s'accompagne d'aucun benchmark public (RLBench, LIBERO, CARLA) ni de déploiement physique documenté. Il s'agit d'une publication de modèles, pas d'un produit shipé. L'équipe Qwen d'Alibaba est reconnue pour ses modèles multimodaux (Qwen2.5-VL, QwQ), mais ce lancement marque son entrée explicite dans l'embodied AI. Le terrain est disputé : Google DeepMind pousse ses dérivés de RT-2, Physical Intelligence a publié Pi-0 et Pi-0.5, Hugging Face soutient l'initiative LeRobot, et NVIDIA propose GR00T N2 comme backbone pour les robots humanoïdes partenaires. Côté chinois, Unitree, Agibot et Zhiyuan Robot accélèrent eux aussi leurs pipelines VLA (vision-language-action). La prochaine étape pour Alibaba sera de démontrer des résultats sur des plateformes matérielles réelles ; faute de quoi, Qwen-Robot restera un framework académique parmi d'autres dans une course déjà très chargée.

UEImpact indirect sur l'écosystème européen : la suite open-source d'Alibaba accentue la pression concurrentielle sur les initiatives VLA portées par des acteurs à ancrage européen comme Hugging Face (LeRobot), sans déploiement physique documenté en Europe à ce stade.

RobotiqueOpinion
1 source
Eno : le nouveau robot de Genesis AI préfère être utile plutôt que joli
15Le Big Data 

Eno : le nouveau robot de Genesis AI préfère être utile plutôt que joli

La startup française Genesis AI a dévoilé le 16 juin 2026 Eno, son premier robot à usage général, conçu pour les environnements industriels plutôt que pour séduire le grand public. Contrairement aux humanoïdes développés par Tesla, Boston Dynamics ou les fabricants chinois qui dominent l'actualité robotique, Eno adopte une base à roues et un tronc ajustable en hauteur, sans jambes articulées ni visage expressif. Ce choix de design délibéré s'explique par une logique simple : la majorité des usines, laboratoires et hôpitaux ne comportent ni escaliers ni obstacles nécessitant une locomotion bipède. Les roues offrent stabilité, vitesse et économie d'énergie supérieures. C'est au niveau des mains qu'Eno se distingue réellement : Genesis AI a déjà démontré leur capacité à jouer du piano, résoudre un Rubik's Cube et manipuler des objets délicats avec une précision comparable à la dextérité humaine. Ces capacités reposent sur GENE, le modèle d'intelligence artificielle maison, qui permet au robot d'interpréter un objectif global, de planifier les étapes, de conserver le contexte en mémoire et d'adapter ses actions en temps réel, sans intervention opérateur à chaque étape. Les premiers déploiements industriels sont prévus avant la fin de l'année 2026. L'enjeu d'Eno dépasse le gadget technologique : il incarne un pari industriel sur ce que la robotique autonome peut réellement apporter aux entreprises à court terme. En ciblant d'abord l'industrie manufacturière, la logistique et les laboratoires, Genesis AI vise des secteurs où la pénurie de main-d'œuvre qualifiée et la répétitivité des tâches rendent l'automatisation économiquement justifiable. L'autonomie cognitive permise par GENE, si elle tient ses promesses sur le terrain, représente un saut qualitatif par rapport aux robots industriels classiques qui n'exécutent que des séquences préprogrammées. Pour les utilisateurs finaux, cela signifie potentiellement des lignes de production reconfigurables sans reprogrammation lourde, et une réduction des coûts d'intégration. Genesis AI s'inscrit dans une course mondiale à la robotique généraliste où les investissements se chiffrent en milliards : Figure AI, 1X Technologies, Apptronik ou encore Agility Robotics ont tous levé des fonds considérables ces deux dernières années, majoritairement aux États-Unis. La startup française choisit une approche pragmatique face à ces géants, en pariant sur la fonctionnalité plutôt que sur l'esthétique humanoïde. Son partenariat avec LG CNS lui ouvre des portes pour tester Eno dans des environnements industriels américains, ce qui sera crucial pour valider le modèle à l'international. À plus long terme, l'entreprise envisage des déploiements dans les hôpitaux, hôtels et domiciles, des marchés au potentiel énorme mais aux contraintes réglementaires et de sécurité nettement plus exigeantes. Tout dépendra des résultats des premières missions industrielles prévues d'ici fin 2026.

UEGenesis AI, startup française, positionne la France dans la course mondiale à la robotique industrielle autonome avec des premiers déploiements industriels prévus avant fin 2026.

RobotiqueOpinion
1 source
Kawasaki Robotics dévoile sa plateforme d'IA physique RL030N à Automate
16Robotics Business Review 

Kawasaki Robotics dévoile sa plateforme d'IA physique RL030N à Automate

Kawasaki Robotics dévoilera la semaine prochaine, lors du salon Automate 2026 à Chicago (McCormick Place, stand S-2201), sa nouvelle plateforme RL030N, un bras robotique à 8 degrés de liberté (DoF) conçu pour les applications d'IA physique. L'entreprise présentera également deux robots industriels inédits, le MXP360L dédié à la manutention lourde et le BA013L, ainsi que sa technologie d'inspection Pulseboard brevetée. Le RL030N se distingue des bras six axes conventionnels par un axe supplémentaire en configuration dite "plongeoir" ("diving board") : une extension supplémentaire qui permet d'atteindre des positions en espace confiné sans tomber en singularité, c'est-à-dire sans perdre le contrôle du couple cinématique inverse. Selon Paul Marcovecchio, directeur des industries générales chez Kawasaki Robotics (siège américain à Wixom, Michigan), cette articulation maintient également la pleine capacité de charge sur toute l'amplitude de mouvement, un compromis que les bras traditionnels étirent ne peuvent généralement pas tenir. La plateforme repose sur l'API temps réel ouverte KRNX de Kawasaki et supporte l'évitement d'obstacles, la planification de mouvement complexe et l'orchestration externe, c'est-à-dire le pilotage du robot par un superviseur logiciel tiers. L'intérêt industriel de la RL030N réside dans le pont qu'elle tente de construire entre les robots industriels fiables et les exigences de dextérité des nouveaux systèmes d'IA physique. Plusieurs startups ont développé des logiciels de planification de mouvement avancés, mais se heurtaient aux limites cinématiques des plateformes existantes ou à des latences incompatibles avec le contrôle temps réel. Kawasaki répond à cette demande en offrant un matériel pensé dès la conception pour être commandé par des orchestrateurs externes, ce qui réduit la friction d'intégration pour les éditeurs de VLA (Vision-Language-Action models) ou de systèmes de manipulation adaptative. La posture de Kawasaki est délibérément pragmatique : l'entreprise évite le discours "humanoid-first" et mise sur des robots industriels éprouvés reconvertis pour l'IA physique, un pari sur la robustesse plutôt que sur la rupture spectaculaire. Kawasaki Robotics opère dans l'automatisation industrielle depuis 1969, filiale de Kawasaki Heavy Industries, conglomérat japonais actif dans l'aéronautique, le ferroviaire et les véhicules récréatifs. Cette origine manufacture-first explique le discours centré sur les résultats concrets plutôt que sur les benchmarks de laboratoire. Sur un marché où Boston Dynamics, Agility Robotics, Figure ou 1X Technologies concentrent l'attention médiatique autour de l'humanoïde, Kawasaki choisit un positionnement différent : bras industriel augmenté, compatible physique AI, déployable immédiatement dans des lignes existantes. Automate 2026 sera le premier test public de la RL030N ; aucun calendrier de disponibilité commerciale ni tarif n'ont été communiqués à ce stade, ce qui en fait pour l'instant une annonce de salon plutôt qu'un produit disponible à la commande.

UEKawasaki dispose d'une filiale européenne (KRE, Allemagne) et équipe les lignes de production EU, mais la RL030N est présentée exclusivement sur le marché américain sans calendrier ni partenariat européen annoncé.

RobotiqueOpinion
1 source
ADAPT : entraînement de politique analytique intégrant les perturbations pour la locomotion humanoïde
17arXiv cs.RO 

ADAPT : entraînement de politique analytique intégrant les perturbations pour la locomotion humanoïde

Une équipe de chercheurs a publié le 16 juin 2026 sur arXiv (2606.16542) une méthode baptisée ADAPT (Analytical Disturbance-Aware Policy Training), destinée à améliorer la robustesse locomotrice des robots humanoïdes soumis à des perturbations externes. Le système a été validé sur un Unitree G1 dans trois scénarios représentatifs : poussées au niveau du torse, perturbations en posture statique, et charges asymétriques appliquées aux mains. Dans chaque cas, ADAPT surpasse une politique de référence basée uniquement sur la proprioception (capteurs internes articulaires), avec un meilleur suivi de vitesse et une meilleure stabilité, y compris face à des perturbations hors distribution, c'est-à-dire non rencontrées lors de l'entraînement. La méthode n'exige aucun capteur de force/couple externe : elle s'appuie uniquement sur la dynamique interne du robot pour estimer en ligne les résidus de force et de couple appliqués au corps entier. L'intérêt technique d'ADAPT tient à son observateur de perturbations analytique, fondé sur la physique du corps rigide plutôt que sur un réseau de neurones ou une large randomisation de domaine. Les approches existantes présentent chacune un défaut structurel : la randomisation de domaine dégrade la précision, les objectifs de force spécifiques à une tâche limitent la transférabilité, et les estimateurs appris depuis l'historique de mouvement peinent hors distribution. ADAPT contourne ces compromis en fournissant à la politique un signal d'entrée explicite et physiquement fondé sur les forces et couples perturbateurs estimés, ce qui lui permet de se généraliser à des scénarios jamais vus. Un bénéfice secondaire notable : en pénalisant les perturbations inférées au niveau des articulations inférieures, le système favorise une locomotion plus légère, réduisant les impacts au sol, ce qui peut prolonger la durée de vie mécanique et améliorer la discrétion sonore en milieu de travail. Le Unitree G1 est une plateforme humanoïde commerciale abordable, largement utilisée dans la recherche sur la locomotion apprise, ce qui confère à ces résultats une portée pratique directe. Ce travail s'inscrit dans une tendance plus large où les laboratoires cherchent à combler le fossé sim-to-real sans ajouter de capteurs coûteux, une contrainte forte pour les déploiements industriels à grande échelle. Côté concurrence, des approches similaires ont été explorées par des équipes travaillant sur Boston Dynamics Atlas, Agility Robotics Digit et les humanoïdes Figure et 1X, mais souvent avec des capteurs de force dédiés. ADAPT représente une direction sensorless qui, si elle se confirme sur d'autres plateformes, pourrait simplifier l'intégration matérielle. L'article étant un preprint arXiv non encore évalué par les pairs, la reproductibilité reste à confirmer indépendamment, et les conditions exactes des expériences (vitesses testées, amplitude des poussées) ne sont pas précisées dans le résumé disponible.

RobotiquePaper
1 source
Préhension universelle pour humanoïdes
18arXiv cs.RO 

Préhension universelle pour humanoïdes

Des chercheurs ont publié HUG (Human Universal Grasping), un modèle de flow-matching qui génère des saisies robotiques diversifiées à partir d'une unique image RGB-D capturée par caméra stéréo. Pour l'entraîner, ils ont constitué 1M-HUGs, un dataset égocentrique de 1 million de frames (27,8 heures, 41 bâtiments) capturées via smart glasses, couvrant 6 707 instances d'objets distincts. Le modèle fusionne données RGB et profondeur pour prédire une saisie paramétrée par la translation et la rotation du poignet ainsi que la pose MANO de la main, retargetable zero-shot vers différentes mains robotiques. Sur HUG-Bench, un benchmark de 90 objets répartis en cinq catégories géométriques avec des maillages 3D à l'échelle métrique, HUG surpasse les baselines état de l'art de +23% et +34% sur 30 objets réels testés dans plusieurs environnements domestiques. L'argument central est méthodologique : plutôt que de passer par la télé-opération ou la démonstration robotique, les auteurs exploitent les données humaines natives, disponibles à très grande échelle et sans infrastructure spécialisée. La capacité de retargeting zero-shot vers des mains mécaniques hétérogènes est l'argument industriel clé : si elle tient hors conditions de lab, elle réduit significativement le coût d'adaptation d'un modèle de manipulation à un nouveau hardware. Ces résultats sont toutefois à nuancer : le papier est un preprint arXiv non encore évalué par les pairs, et les performances annoncées ont été mesurées sur un benchmark construit par les auteurs eux-mêmes, sans audit indépendant à ce stade. HUG s'inscrit dans une lignée de travaux sur la généralisation de la saisie incluant GraspNet, Contact-GraspNet et les approches par diffusion comme DexDiffuser, et adopte une logique de capture égocentrique proche des pipelines de Stanford (Mobile ALOHA) ou Berkeley (DROID dataset), qui visent à décorréler la collecte de données du hardware robotique cible. Le code, les données, le benchmark et les checkpoints sont publiés en open source sur grasping.io. Les prochaines validations logiques concerneraient des bras industriels (UR, Franka) sur des scénarios de bin-picking ou d'assemblage non structuré, où la généralisation de la saisie reste un verrou majeur pour l'intégration à grande échelle.

RobotiquePaper
1 source
ROVE : l'apprentissage par renforcement pour débloquer les interventions humaines dans la manipulation par humanoïdes
19arXiv cs.RO 

ROVE : l'apprentissage par renforcement pour débloquer les interventions humaines dans la manipulation par humanoïdes

Une équipe de chercheurs a publié fin juin 2026 ROVE (Reinforcement learning for humanoid VLA post-training with imperfect human interventions), un framework de renforcement dédié à l'amélioration des modèles Vision-Language-Action (VLA) sur robots humanoïdes à partir d'interventions humaines imparfaites. Le principe : un opérateur prend la main sur le robot lors des phases d'échec, générant des trajectoires correctives qui servent ensuite à affiner le modèle. Le problème bien identifié par les auteurs est que ces interventions humaines sont souvent hésitantes, sous-optimales, voire erronées, ce qui rend l'imitation naïve contre-productive. ROVE introduit deux mécanismes centraux : un pipeline human-in-the-loop capable de collecter simultanément des données de déploiement autonome et d'intervention, et une méthode d'estimation de valeur dite "optimiste" (Optimistic Value Estimation, OVE) qui filtre les comportements à haute valeur depuis des trajectoires de qualité mixte. Le framework intègre également des vidéos d'expériences humaines cross-embodiment pour enrichir la supervision sur les modes de défaillance et de récupération rares. Sur des tâches réelles de manipulation à contact-riche et fine-grained, ROVE surpasse les baselines par apprentissage par expérience et s'améliore de manière consistante à chaque itération rollout-intervention. L'enjeu central ici est la scalabilité du déploiement humanoïde en conditions réelles. Les modèles VLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA -- ont démontré des capacités de généralisation remarquables, mais leur post-training sur hardware humanoïde reste un goulot d'étranglement : la cinématique whole-body et le contrôle de mains dextères compliquent radicalement la collecte de données téléopérées de qualité. ROVE invalide l'hypothèse selon laquelle l'intervention humaine doit être experte pour être utile : OVE permet d'extraire un signal d'avantage informatif même depuis des démonstrations imparfaites, ce qui signifie qu'on peut utiliser des opérateurs non-spécialistes pour améliorer continûment le modèle en production. C'est un changement de paradigme potentiellement significatif pour les intégrateurs : la qualité du déploiement n'est plus bornée par la disponibilité d'experts en téléopération. Ce travail s'inscrit dans une vague de recherches sur le RLHF appliqué à la robotique physique, après les travaux pionniers sur l'imitation par intervention (HATO, HITL-TAMER) et les approches par feedback correctif. Les humanoïdes ciblés restent non précisés dans l'abstract (preprint arXiv, les détails hardware seront à vérifier dans le papier complet), mais les résultats sur tâches contact-rich suggèrent une applicabilité aux plateformes type Figure 03, Unitree H1/G1 ou Agility Digit. Le positionnement concurrentiel est clair : là où Physical Intelligence mise sur la qualité des données téléopérées en amont, ROVE parie sur la rectification en boucle fermée en aval. Les prochaines étapes probables incluent des tests à plus grande échelle et une évaluation sur plusieurs architectures VLA, mais en l'état de preprint, aucun déploiement commercial n'est annoncé.

RechercheOpinion
1 source
FARM : retrouver n'importe quel objet grâce à la mémoire spatiale relationnelle
20arXiv cs.RO 

FARM : retrouver n'importe quel objet grâce à la mémoire spatiale relationnelle

Des chercheurs ont publié FARM (Find Anything using Relational Spatial Memory), un système de mémoire spatiale pour robots capable de localiser des objets en temps réel via des requêtes en langage naturel exprimant des relations contextuelles, du type "la grande lampe sous la cible de fléchettes et à gauche de l'affiche". Le système construit une carte sémantique compacte à 5-10 Hz intégrant géométrie, descripteurs visuels-linguistiques et indices de point de vue. Évalué sur 44 000 requêtes couvrant 67 scènes intérieures et extérieures de 15 à 15 000 m², FARM améliore le Recall@5 de 164 % et le Recall@10 de 224 % par rapport aux méthodes existantes. Une étape de réordonnancement par VLM améliore encore l'Accuracy@1 de 35 %. Le système tourne en temps réel et a été validé en boucle fermée sur un robot quadrupède fonctionnant uniquement avec capteurs et calcul embarqués. L'enjeu dépasse la simple localisation d'objet: dans des entrepôts, habitations ou espaces industriels, un robot doit résoudre des ambiguïtés entre objets similaires via des relations contextuelles, ce que les mémoires de niveau objet seul ne permettent pas. FARM structure explicitement les contraintes spatiales par des prédicats relationnels plutôt qu'en les laissant implicites dans un raisonnement end-to-end sur des historiques de frames. Pour les intégrateurs et décideurs B2B, c'est une brique critique: les robots de service, de picking ou de logistique doivent être pilotables par instruction verbale sans expertise technique. Les gains à +224 % sur Recall@10 sont significatifs, bien que les conditions précises de benchmark, scènes contrôlées ou environnements non-stagés, ne soient pas détaillées dans la publication. Ce travail se situe à l'intersection de la cartographie sémantique 3D (systèmes type ConceptFusion ou OpenScene), des graphes de scène neuronaux et des VLM multimodaux. La combinaison mémoire open-vocabulary et prédicats relationnels explicites distingue FARM des approches end-to-end qui saturent dans les scènes denses. Sur le plan concurrentiel, des acteurs comme Boston Dynamics, Unitree et des laboratoires tels que Stanford ou CMU explorent des approches similaires pour la navigation sémantique. En Europe, des projets de robots de service ou d'assistance, dont des initiatives françaises liées à l'ANR ou des spin-offs comme Enchanted Tools travaillant sur l'interaction homme-robot, pourraient directement intégrer ce type de composant. La prochaine étape décisive sera de valider FARM dans des environnements dynamiques où les objets se déplacent et les relations spatiales évoluent en continu.

UEDes projets européens de robotique de service et des acteurs comme Enchanted Tools pourraient intégrer FARM comme brique de perception sémantique, mais aucun déploiement direct en France/UE n'est confirmé à ce stade.

💬 Ce qui m'accroche, c'est pas les chiffres, c'est que le robot comprend "la lampe sous la cible de fléchettes". C'est exactement ce qui plantait tous les systèmes de mémoire objet précédents, ils encodaient les objets mais pas les relations spatiales entre eux, et c'est pourtant ce qu'on exprime naturellement quand on parle à un robot. Les +224% sur les benchmarks sont solides, bon, reste à voir si ça tient dans une vraie usine où les objets bougent en permanence.

RechercheOpinion
1 source
Piloter l'apprentissage par renforcement génératif vers un contrôleur robotique stable
21arXiv cs.RO 

Piloter l'apprentissage par renforcement génératif vers un contrôleur robotique stable

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.16572) SteerGenPO, un cadre d'apprentissage par renforcement en espace latent destiné à transformer une politique générative entraînée, basée sur la diffusion ou les flux normalisants, en un contrôleur robotique déterministe et stable. Le système a été évalué sur six benchmarks Isaac Lab d'NVIDIA et sur une tâche de locomotion avec le robot humanoïde Unitree G1, avec des résultats supérieurs aux baselines RL classiques et génératives selon les auteurs. Il s'agit d'une publication académique en pré-impression, sans déploiement industriel annoncé ni validation terrain au-delà du G1. Le verrou technique adressé est connu : les politiques de diffusion accumulent des variations d'action à chaque pas de temps, ce qui dégrade la stabilité sur des systèmes robotiques à haute dimensionnalité. SteerGenPO sépare architecturalement exploration et contrôle : l'échantillonnage stochastique reste actif à l'entraînement pour diversifier les proposals d'actions, mais au déploiement, un acteur latent appris prédit une entrée déterministe et dépendante de l'état qui pilote la politique générative sans bruit résiduel. Pour les intégrateurs, la proposition n'exige pas de réentraîner la politique depuis zéro : elle greffe un mécanisme de pilotage sur un checkpoint pré-entraîné existant, ce qui ouvre la voie à l'exploitation de modèles fondation tout en garantissant la reproductibilité des trajectoires en production. Ce travail s'inscrit dans la compétition intense autour des politiques génératives en robotique. Physical Intelligence avec Pi-0 (2024) et NVIDIA avec GR00T N2 (2025) ont validé l'approche VLA-diffusion en environnements contrôlés, mais les questions sur la robustesse à l'inférence longue restent ouvertes. Boston Dynamics, Agility Robotics et Figure AI privilégient des pipelines de contrôle plus classiques pour la fiabilité en production. SteerGenPO propose une voie médiane : capitaliser sur la richesse exploratoire des modèles génératifs sans en subir l'instabilité au déploiement. Aucune timeline, partenariat industriel ni essai terrain n'est mentionné dans le préprint ; les prochaines validations naturelles porteraient sur la manipulation dextère et des tests sim-to-real approfondis.

RobotiqueOpinion
1 source
Politiques VLA auto-améliorantes : lissage d'actions robuste aux artefacts par bruit de diffusion sélectionné
22arXiv cs.RO 

Politiques VLA auto-améliorantes : lissage d'actions robuste aux artefacts par bruit de diffusion sélectionné

Des chercheurs publient sur arXiv (référence 2606.14084) une méthode baptisée SDN (Selected Diffusion Noise), conçue pour améliorer à l'inférence les politiques VLA (Vision-Language-Action) basées sur la diffusion, sans nécessiter de réentraînement. SDN opère dans l'espace du bruit de diffusion en sélectionnant dynamiquement des vecteurs de bruit maximalement séparés d'un ensemble de référence, ce qui réduit la dépendance aux corrélations visuelles parasites, tout en filtrant les candidats produisant des trajectoires d'action plus cohérentes. La méthode a été évaluée sur deux benchmarks de simulation (Google Robot, Widow-X) et deux jeux de données réels, sur plusieurs politiques VLA majeures dont pi0 (Physical Intelligence), Groot-N1.5 et Groot-N1.6 (NVIDIA). Les gains annoncés sont de +8 points de taux de succès en simulation et +10 points en conditions réelles, avec une réduction mesurable du "action jitter", c'est-à-dire l'instabilité des trajectoires articulaires. Ces résultats sont issus d'un preprint non encore évalué par les pairs. L'intérêt pratique tient à l'approche "training-free" : SDN s'applique à l'inférence sans modifier les paramètres du modèle, ce qui permet d'améliorer un système déjà déployé sans refondre le pipeline ML ni supporter les coûts d'un réentraînement. Pour un intégrateur ou un décideur achetant une solution robotique basée sur une politique VLA, ce type de méthode représente un levier de fiabilité à faible coût opérationnel. La robustesse maintenue sous des observations avec occultation partielle (object-masked observations) est également pertinente pour les environnements industriels réels. SDN s'inscrit dans la tendance plus large des techniques d'optimisation test-time appliquées aux modèles génératifs, analogues au best-of-N sampling dans les LLMs. Les politiques VLA basées sur la diffusion, popularisées par Physical Intelligence (pi0, pi0.5) et NVIDIA Isaac (GR00T N1.5, N1.6), sont devenues en 2025-2026 la référence de facto en manipulation robotique généraliste. Elles héritent toutefois d'une sensibilité aux artefacts visuels hors distribution et d'une certaine instabilité d'action, deux problèmes que SDN cible directement. L'abstract ne mentionne ni affiliation institutionnelle ni dépôt de code public, ce qui limite pour l'instant la reproductibilité et les comparaisons indépendantes. Les prochaines étapes naturelles seraient une validation sur plateformes humanoïdes complètes (Figure, 1X, Unitree H1) et des benchmarks de manipulation plus diversifiés que Widow-X ou Google Robot.

UELes intégrateurs européens déployant des solutions robotiques basées sur des politiques VLA (pi_0, GR00T) pourraient bénéficier de cette méthode d'optimisation sans réentraînement, mais aucun acteur FR/EU n'est directement impliqué dans ces travaux.

RechercheOpinion
1 source
Prometheus : ce que prépare la nouvelle startup de Jeff Bezos
23Ars Technica AI 

Prometheus : ce que prépare la nouvelle startup de Jeff Bezos

Jeff Bezos a officiellement lancé Prometheus en novembre dernier en tant que co-PDG aux côtés du co-fondateur Vik Bajaj, et la startup vient de boucler une nouvelle levée de fonds de 12 milliards de dollars, portant sa valorisation à 41 milliards. Cela fait suite à un premier tour de 6,2 milliards de dollars l'année précédente. Les investisseurs comprennent des noms de premier plan comme JPMorgan Chase, Goldman Sachs et BlackRock, auxquels s'ajoute une contribution personnelle significative de Bezos lui-même. L'entreprise compte actuellement 150 employés. Une grande partie de ces capitaux sera consacrée à l'achat de puissance de calcul, Bezos ayant confié à CNBC que l'activité est "très gourmande en calcul" et nécessite la création de vastes ensembles de données. Prometheus se positionne sur le créneau de l'IA physique, une discipline qui applique les principes du deep learning, ceux-là mêmes qui alimentent les grands modèles de langage et l'IA générative, à des domaines concrets comme la robotique et la fabrication industrielle. L'enjeu est considérable : si les LLM ont révolutionné le traitement du langage et de l'image, l'IA physique ambitionne de faire de même avec le monde réel, en dotant les machines d'une capacité à percevoir, raisonner et agir dans des environnements non structurés. Pour l'industrie manufacturière, la logistique et la robotique, les retombées potentielles sont massives. La démarche de Bezos s'inscrit dans une vague plus large d'investissements colossaux dans l'IA physique, un domaine où figurent aussi des acteurs comme Figure AI, Physical Intelligence ou encore Boston Dynamics. Avec 18,2 milliards de dollars levés en deux tours, Prometheus dispose d'une puissance de feu rare pour une startup aussi jeune, lui permettant de construire les infrastructures de données et de calcul nécessaires à l'entraînement de modèles complexes. Les détails sur les produits concrets restent encore flous, mais l'ampleur du financement et le profil des investisseurs institutionnels signalent des ambitions industrielles de long terme.

UEL'afflux massif de capitaux américains dans l'IA physique pourrait à terme fragiliser la compétitivité de l'industrie manufacturière et robotique européenne face à des acteurs bien mieux capitalisés.

💬 18 milliards levés pour 150 employés, ça fait réfléchir sur l'échelle du truc. L'IA physique, c'est le pari que les LLM n'étaient que le début, et que la vraie disruption arrive dans les usines et les entrepôts, pas dans les chatbots. Reste à voir ce que Prometheus sort concrètement, parce que pour l'instant on a surtout une valorisation vertigineuse et des slides.

RobotiqueOpinion
1 source
GenHOI : interaction humanoïde-objet sensible aux contacts par imitation de vidéos générées, sans entraînement spécifique
24arXiv cs.RO 

GenHOI : interaction humanoïde-objet sensible aux contacts par imitation de vidéos générées, sans entraînement spécifique

Une équipe de chercheurs propose GenHOI (arXiv:2606.12995, juin 2026), un cadre logiciel permettant à des robots humanoïdes d'interagir avec des objets variés en mode zéro-shot, sans entraînement spécifique à la tâche ni données de démonstration physique. Le système prend en entrée une commande en langage naturel et une image du premier plan de la scène robot-objet reconstruite en simulation, à partir desquels un modèle génératif produit une vidéo d'interaction synthétique orientée tâche. Cette vidéo est analysée pour identifier les événements de contact pertinents et estimer les régions de contact main-objet, encodés sous forme de contraintes géométriques centrées sur l'objet. Ces contraintes servent de priors d'optimisation pour raffiner la trajectoire de référence extraite de la vidéo 2D, résolvant l'ambiguïté d'échelle inhérente à la génération vidéo, et adaptent une trajectoire unique à des poses relatives robot-objet non vues à l'entraînement. Un contrôleur de suivi en boucle fermée assure l'exécution finale. Les tâches validées en simulation et en réel incluent la saisie de boîtes, le transport bimanuel asymétrique d'une chaise, le soulèvement d'une table par en-dessous et l'enveloppement d'objets cylindriques. Il s'agit d'un preprint académique, pas d'un produit déployé. L'enjeu central est la rupture avec le paradigme d'entraînement par tâche, principal goulot d'étranglement du déploiement industriel des humanoïdes. Les approches existantes exigent soit des centaines d'heures de collecte de démonstrations physiques par tâche, soit rejouent des trajectoires rigides incapables de s'adapter à des variations de pose ou d'objet. GenHOI contourne ces deux limites en substituant la génération vidéo à la démonstration réelle, tout en maintenant une conscience physique du contact via des contraintes géométriques explicites. La capacité d'adaptation à des configurations inédites robot-objet sans réentraînement est particulièrement significative pour les intégrateurs industriels devant déployer rapidement un humanoïde sur de nouvelles références produit. La problématique de l'interaction humanoïde-objet est activement travaillée par plusieurs acteurs concurrents : Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, et les équipes de Figure AI ou Boston Dynamics opèrent dans un espace voisin, mais s'appuient majoritairement sur du fine-tuning tâche par tâche ou du reinforcement learning avec simulateurs massivement parallèles. GenHOI se positionne comme une approche complémentaire, plus légère en données, exploitant la capacité des générateurs vidéo récents à produire des séquences physiquement plausibles. La principale limite non adressée est la robustesse à l'échelle sur des centaines de tâches distinctes et la gestion des objets déformables. Les prochaines étapes naturelles seraient une évaluation sur des plateformes commerciales comme l'Unitree G1 ou l'Agility Digit, et une intégration avec des policies de bas niveau plus génériques.

RechercheOpinion
1 source
IA incarnée : la correspondance proprioceptive-visuelle permet aux robots humanoïdes de se distinguer d'autrui
25arXiv cs.RO 

IA incarnée : la correspondance proprioceptive-visuelle permet aux robots humanoïdes de se distinguer d'autrui

Des chercheurs ont publié en juin 2026 un préprint sur arXiv (2606.13222) décrivant un système permettant à un robot humanoïde d'apprendre à se distinguer des autres agents présents dans son environnement, sans recourir à des étiquettes d'identité ni à des modèles cinématiques prédéfinis. Le mécanisme repose sur la correspondance proprioceptive-visuelle : le robot corrèle ses propres états articulaires avec ce qu'il perçoit visuellement, ce qui lui permet d'identifier ses propres membres parmi d'autres corps en mouvement. À partir de cette capacité, le système construit automatiquement un modèle prédictif de soi qui associe les configurations articulaires à une représentation d'occupation corporelle en trois dimensions. Le système a été validé dans des scènes multi-agents impliquant soit des humains, soit des robots morphologiquement identiques, et supporte des tâches aval concrètes : atteinte de cibles, planification de mouvement avec évitement de collision, et retargeting de mouvement humain-robot. L'enjeu pratique est significatif pour les intégrateurs déployant des humanoïdes en environnements partagés. Jusqu'ici, la distinction soi/autrui dans les robots était traitée soit par des marqueurs extérieurs, soit par des modèles cinématiques codés en dur, deux approches qui échouent dès que le robot opère aux côtés d'agents inconnus ou de copies identiques de lui-même. Que cette capacité puisse émerger d'un signal d'apprentissage auto-supervisé, sans annotation, contredit l'hypothèse selon laquelle la conscience corporelle nécessite une ingénierie explicite. La robustesse face à des robots morphologiquement identiques est particulièrement notable : c'est précisément le scénario qui se généralise dans les lignes d'assemblage où plusieurs unités du même modèle cohabitent. Le problème de la représentation de soi chez les robots est un sujet actif depuis les travaux fondateurs sur le « miroir robotique », mais les approches précédentes restaient limitées à des configurations contrôlées. Côté concurrent, des équipes chez Figure AI, Boston Dynamics et Sanctuary AI travaillent sur des architectures d'apprentissage incarné, mais peu publient sur la distinction soi/autrui en contexte multi-agent. Ce travail reste à ce stade un preprint non évalué par les pairs ; aucun déploiement industriel ni partenariat n'est annoncé. Les auteurs publient une page projet avec démonstrations vidéo, ce qui permettra d'évaluer la robustesse hors conditions de laboratoire.

RobotiquePaper
1 source
THEKER lève 85 millions de dollars : l’Europe produit enfin ses candidats à la robotique généraliste
26FrenchWeb 

THEKER lève 85 millions de dollars : l’Europe produit enfin ses candidats à la robotique généraliste

La startup barcelonaise THEKER a annoncé une levée de fonds de 85 millions de dollars, s'imposant comme l'un des paris les plus ambitieux de l'écosystème européen sur la robotique généraliste. Ce financement, dont les détails du tour et des investisseurs n'ont pas été précisés dans l'annonce publique, intervient alors que le secteur de l'intelligence physique connaît une accélération notable des investissements à l'échelle mondiale. THEKER développe des robots capables d'accomplir une grande variété de tâches dans des environnements non structurés, une approche dite "généraliste" qui contraste avec les robots industriels traditionnels, conçus pour des tâches répétitives et prédéfinies. Ce financement marque un tournant pour la scène technologique européenne, longtemps absente de la course à la robotique avancée dominée par des acteurs américains comme Figure AI ou Physical Intelligence, et asiatiques comme Unitree. Pour l'industrie, l'enjeu est considérable : des robots capables de s'adapter à des contextes variés pourraient transformer la logistique, les soins, la construction et l'agriculture sans nécessiter de reprogrammation coûteuse. THEKER représente ainsi un signal que l'Europe peut produire des challengers crédibles dans ce segment stratégique. Après trois années dominées par les modèles de langage, les data centers et les agents logiciels, les capitaux se redirigent désormais vers l'intelligence physique, c'est-à-dire la capacité des machines à agir dans le monde réel. Plusieurs facteurs alimentent cette tendance : la maturité des modèles de fondation multimodaux, la baisse des coûts des composants mécaniques et la pression des industriels cherchant à automatiser dans un contexte de pénurie de main-d'oeuvre. THEKER devra démontrer que ses robots tiennent leurs promesses hors des laboratoires, face à une compétition mondiale qui se densifie rapidement.

UETHEKER, startup barcelonaise, s'impose comme l'un des premiers challengers européens crédibles dans la robotique généraliste, un secteur stratégique jusqu'ici dominé par des acteurs américains et asiatiques.

RobotiqueOpinion
1 source
Hong Kong ouvre une supérette… entièrement gérée par un robot humanoïde
27Le Big Data 

Hong Kong ouvre une supérette… entièrement gérée par un robot humanoïde

Hong Kong s'apprête à inaugurer son premier commerce de proximité entièrement piloté par un robot humanoïde baptisé « Xiao Gai ». Développé par une entreprise chinoise spécialisée dans l'intelligence artificielle incarnée, ce magasin automatisé de neuf mètres carrés ouvrira ses portes sur le front de mer de Hung Hom, dans un format capsule modulaire inspiré du concept « Galaxy Space Capsule » déjà exploité dans le district de Haidian, à Pékin. Xiao Gai fonctionnera vingt-quatre heures sur vingt-quatre, sept jours sur sept, capable d'accueillir les clients, de les guider dans leurs achats et de converser dans plusieurs langues pour servir aussi bien les résidents que les touristes. Les rayons proposeront des snacks, des articles de collection et certains médicaments en vente libre. Le projet a été annoncé publiquement par le secrétaire aux Finances de Hong Kong, Paul Chan, dans son blog hebdomadaire, signal clair d'un soutien institutionnel. Il s'agit de la première implantation de cette entreprise en dehors de la Chine continentale. L'impact potentiel de ce déploiement est loin d'être anecdotique. Selon la société elle-même, l'installation de ces capsules robotisées génère une hausse de fréquentation comprise entre 30 % et 40 % pour les zones commerciales environnantes, un argument de poids pour les promoteurs immobiliers et les collectivités cherchant à revitaliser des espaces urbains. Le précédent pékinois est éloquent : le point de vente de Haidian aurait attiré près de 1 000 clients par jour depuis son ouverture début août. Pour les villes qui les accueillent, ces capsules fonctionnent autant comme vitrine technologique que comme commerce de proximité, renforçant leur image de modernité auprès des investisseurs et des visiteurs internationaux. Cette ouverture à Hong Kong s'inscrit dans une dynamique d'expansion rapide des robots humanoïdes dans les espaces commerciaux, portée par les progrès récents en traitement du langage naturel et en robotique embarquée. La Chine a pris une avance notable dans ce domaine, multipliant les expérimentations de robots en situation réelle dans la distribution, la restauration et les services aux particuliers. Hong Kong, carrefour entre Chine continentale et marchés internationaux, représente une vitrine stratégique pour valider ce modèle à l'export. L'entreprise ne cache d'ailleurs pas ses ambitions : elle prévoit de déployer cent capsules similaires dans dix villes au cours des prochains mois. La question qui se pose désormais concerne moins la faisabilité technique que l'acceptation sociale et les conséquences sur l'emploi dans un secteur de la distribution déjà sous pression.

RobotiqueActu
1 source
NEURA ROBOTICS lève 1,2 milliard d’euros : la robotique devient le nouveau pari stratégique de l’Europe
28FrenchWeb 

NEURA ROBOTICS lève 1,2 milliard d’euros : la robotique devient le nouveau pari stratégique de l’Europe

Neura Robotics, startup allemande spécialisée dans la robotique humanoïde, vient d'annoncer une levée de fonds de 1,4 milliard de dollars, soit environ 1,2 milliard d'euros, portant sa valorisation à près de 6 milliards d'euros. L'opération regroupe un consortium d'investisseurs aussi large qu'inédit : Amazon, NVIDIA et Qualcomm côté tech, Bosch et Schaeffler côté industrie allemande, la Banque européenne d'investissement comme acteur public, auxquels s'ajoutent plusieurs fonds financiers internationaux. Il s'agit du plus grand tour de financement jamais réalisé pour une entreprise européenne de robotique. Ce signal dépasse la simple performance financière. La présence simultanée de géants technologiques américains, de champions industriels allemands et d'une institution publique européenne traduit une convergence rare : le robot humanoïde n'est plus un projet de laboratoire, il devient une infrastructure industrielle crédible. Pour Amazon, qui déploie déjà des robots dans ses entrepôts, l'enjeu est d'intégrer des machines capables de remplacer la main humaine dans les tâches non automatisées. Pour NVIDIA et Qualcomm, c'est un débouché majeur pour leurs puces d'IA embarquée. Fondée par David Reger, Neura Robotics s'inscrit dans une course mondiale qui oppose désormais les Américains Figure AI, Agility Robotics et Boston Dynamics aux acteurs chinois en pleine montée en puissance. L'Europe, longtemps absente de ce segment, tente d'y placer un champion. Ce financement donne à Neura les moyens d'accélérer la production et de conquérir des clients industriels avant que la fenêtre de leadership ne se referme.

UEUne startup allemande lève 1,2 milliard d'euros avec le soutien de la Banque européenne d'investissement et des industriels allemands Bosch et Schaeffler, positionnant l'Europe comme acteur crédible dans la course mondiale aux robots humanoïdes industriels.

💬 La liste des investisseurs dit tout : Amazon, NVIDIA, Bosch et la BEI dans le même tour, ça ne ressemble plus à un pari de VC, ça ressemble à une infrastructure qui se construit. L'Europe avait besoin d'un champion dans cette course aux humanoïdes, Neura pourrait être lui, bon, sur le papier du moins. Reste à voir si 1,2 milliard suffit à tenir le rythme face aux acteurs américains et chinois qui n'ont pas attendu.

RobotiqueOpinion
1 source
Tye Brady (Amazon) : les robots du futur « se fondront dans le décor »
29La Tribune 

Tye Brady (Amazon) : les robots du futur « se fondront dans le décor »

Tye Brady, directeur technologique d'Amazon Robotics, a dévoilé les grandes ambitions d'Amazon en matière d'automatisation lors d'une récente intervention publique. L'entreprise opère déjà une flotte de plus d'un million de robots dans ses centres logistiques à travers le monde, et a annoncé un investissement de 10 milliards d'euros pour moderniser ses entrepôts européens dans les années à venir. L'objectif affiché : élargir considérablement le champ d'action de ces machines, notamment en les dotant d'une capacité de compréhension du langage naturel. Cette évolution représente un saut qualitatif majeur pour l'industrie logistique. Des robots capables de comprendre des instructions en langage courant, et non plus seulement des commandes codées, pourraient opérer de manière bien plus autonome et flexible aux côtés des travailleurs humains. Pour Amazon, cela signifie une réduction des coûts opérationnels à grande échelle, mais aussi une pression accrue sur l'emploi dans des secteurs déjà fragilisés par l'automatisation. Brady résume la vision par une formule : les robots du futur « se fondront dans le décor », discrets et omniprésents à la fois. Amazon n'est pas seul sur ce terrain : des acteurs comme Boston Dynamics, Figure ou Agility Robotics développent des robots humanoïdes visant les mêmes environnements industriels. L'intégration du traitement du langage naturel dans la robotique, rendue possible par les avancées des grands modèles de langage, est devenue l'enjeu central de la prochaine génération de systèmes automatisés. L'investissement européen d'Amazon s'inscrit dans ce contexte de course technologique, avec des implications réglementaires et sociales que Bruxelles commencera sans doute à encadrer plus fermement.

UEAmazon investit 10 milliards d'euros dans la modernisation de ses entrepôts européens, avec des implications directes sur l'emploi dans la logistique en France et des pressions réglementaires croissantes pour Bruxelles.

💬 Un million de robots déjà en prod, et là ils annoncent qu'ils veulent qu'ils comprennent le langage naturel, comme si c'était juste le prochain patch. C'est la bascule qui rend le reste sérieux : des robots qui s'adaptent aux instructions humaines au lieu de forcer les humains à s'adapter aux robots. Les 10 milliards en Europe, c'est pas de la com, c'est la mise de départ d'une course où Bruxelles va très vite devoir choisir entre réguler et regarder.

RobotiqueOpinion
1 source
Contrôle corps entier généraliste et adaptable pour la locomotion de divers humanoïdes
30arXiv cs.RO 

Contrôle corps entier généraliste et adaptable pour la locomotion de divers humanoïdes

Des chercheurs ont publié sur arXiv (référence 2602.05791) un framework baptisé XHugWBC, conçu pour entraîner un contrôleur de locomotion whole-body universel sur une large distribution de morphologies humanoïdes, puis le déployer en zero-shot sur des robots non vus durant l'entraînement. Les expériences couvrent douze humanoïdes simulés et sept robots réels. Le système repose sur trois briques techniques : une randomisation morphologique physiquement cohérente (masse des segments, longueur des membres, inertie), des espaces d'observation et d'action alignés sémantiquement entre châssis hétérogènes, et une architecture de politique qui encode explicitement les propriétés morphologiques et dynamiques de chaque instance. L'entraînement est unique, "one-time training" : aucun fine-tuning par robot n'est requis à l'inférence. L'enjeu industriel est direct. Aujourd'hui, chaque équipe robotique entraîne ses contrôleurs de locomotion depuis zéro pour chaque châssis, ce qui représente des semaines de simulation et d'itérations sim-to-real. XHugWBC déplace ce coût vers une phase d'entraînement généraliste unique, ouvrant la voie à un modèle de déploiement où un intégrateur peut adopter un nouveau châssis humanoïde sans reconstruire l'intégralité de sa stack de contrôle. La validation sur sept robots physiques est plus convaincante que les résultats purement simulés habituels, même si la nature exacte des tâches testées et les taux de succès détaillés ne figurent pas dans le résumé disponible. La capacité de transfert zero-shot sur morphologies inédites renforce l'hypothèse que les biais structuraux appris sur distributions larges surpassent les politiques spécialisées sur certains régimes de locomotion, ce que le secteur débattait encore il y a dix-huit mois. Ce travail s'inscrit dans un mouvement vers les contrôleurs dits "fondation" pour la robotique incarnée. En manipulation, des systèmes comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) ont déjà exploré la généralisation cross-embodiment sur bras et effecteurs; l'extension à la locomotion whole-body humanoïde est plus contrainte par la stabilité dynamique. Les acteurs du secteur, Figure Robotics (Figure 03), Unitree (G1, H1), Agility Robotics (Digit), Fourier Intelligence et 1X Technologies, maintiennent tous des pipelines de contrôle propriétaires et spécialisés. Si XHugWBC tient ses promesses à l'échelle, il réduirait significativement la barrière à l'entrée pour les nouveaux constructeurs, notamment les acteurs européens comme Enchanted Tools (Mirokaï) ou Wandercraft, qui ne disposent pas des ressources d'entraînement des géants américains. Le preprint n'a pas encore fait l'objet d'une évaluation par les pairs.

UELes constructeurs humanoïdes français Wandercraft et Enchanted Tools (Mirokaï) sont explicitement identifiés comme bénéficiaires potentiels, ce framework pouvant réduire significativement leurs coûts d'entraînement de locomotion sans nécessiter les ressources des géants américains.

💬 C'est le genre de papier qui résout un vrai problème industriel : chaque robot humanoïde qui sort oblige aujourd'hui à tout réentraîner depuis zéro. Sept robots physiques en zero-shot, c'est pas du tout la même chose que des résultats simulés, ça valide quelque chose de sérieux. Pour Wandercraft ou Enchanted Tools, bien plus contraints en ressources que Figure ou Unitree, ce type de contrôleur généraliste c'est du concret.

RobotiqueOpinion
1 source
Agir sur ce que l'on voit : vers une navigation sociale sûre dans les modèles vision-langage-action (VLA)
31arXiv cs.RO 

Agir sur ce que l'on voit : vers une navigation sociale sûre dans les modèles vision-langage-action (VLA)

Des chercheurs ont publié le 10 juin 2026 sur arXiv (2606.10495) SALSA, un framework de post-entraînement en deux étapes destiné à rendre les modèles Vision-Language-Action (VLA) capables de naviguer en sécurité parmi des piétons. Sans aucune annotation humaine, la méthode réduit les quasi-collisions de 86,4 % et fait passer la précision de reconnaissance des situations sociales critiques de 53 % à 93 %, mesurée sur le dataset SCAND et lors de déploiements en conditions réelles. SALSA opère en deux temps : une étape d'alignement comportemental social connecte les représentations internes des couches intermédiaires du VLA à sa tête d'action, via un entraînement sur des paires scènes humain/objet contrefactuelles pour casser les raccourcis de saillance visuelle ; une étape d'alignement temporel de sécurité génère automatiquement une supervision sur le risque futur pour permettre une évitement anticipatoire, avant que le danger ne soit imminent, plutôt que purement réactif. L'intérêt principal de ce résultat est de démontrer que les VLA pré-entraînés encodent déjà, dans leurs représentations latentes, la distinction piéton/obstacle et des signaux de collision future, mais que le behavior cloning classique échoue à traduire ces signaux en actions appropriées. Pour les intégrateurs et décideurs industriels, cela signifie que des robots équipés de VLA existants (Pi-0, OpenVLA, GR00T N2) peuvent être rendus plus sûrs en navigation sociale sans réentraînement complet ni pipeline d'annotation coûteux. Le caractère annotation-free est industriellement significatif : il supprime le goulot d'étranglement du labeling humain qui freine le passage à l'échelle des approches d'apprentissage pour la navigation sociale. La navigation sociale en robotique mobile est un problème ouvert depuis une décennie : les approches classiques (Social Force Model, ORCA) ignorent le contexte sémantique, tandis que les méthodes RLHF nécessitent une récompense dense difficile à définir. SALSA s'inscrit dans une vague de travaux post-entraînement sur les VLA, aux côtés de méthodes comme DPO appliqué à la robotique et les pipelines de fine-tuning de Physical Intelligence. Les concurrents directs incluent les approches à modules de détection piéton explicites (Spot de Boston Dynamics, Nav2 avec costmaps sociaux) et les frameworks d'apprentissage par renforcement socialement conscients. Les chercheurs valident sur déploiement réel, mais sans préciser le matériel robotique utilisé ni les conditions d'environnement, un point à surveiller avant toute généralisation industrielle.

RechercheOpinion
1 source
Mettre à l'échelle l'apprentissage par renforcement robotique avec NVIDIA Isaac Lab sur Amazon SageMaker AI
32AWS ML Blog 

Mettre à l'échelle l'apprentissage par renforcement robotique avec NVIDIA Isaac Lab sur Amazon SageMaker AI

NVIDIA et Amazon Web Services ont publié un guide technique détaillant comment entraîner des politiques de comportement pour le robot humanoïde Unitree H1 en utilisant NVIDIA Isaac Lab sur Amazon SageMaker AI. La solution s'appuie sur deux options de calcul complémentaires : SageMaker HyperPod, une infrastructure distribuée managée pour des clusters persistants, et SageMaker Training Jobs, une approche entièrement à la demande où les instances GPU sont provisionnées à la volée puis supprimées à la fin du job. Le code complet est disponible publiquement sur GitHub. L'objectif est de permettre aux équipes robotique de lancer des entraînements par renforcement (RL) à grande échelle, aussi bien en phase d'expérimentation rapide qu'en production sur de longues durées, sans gérer eux-mêmes l'infrastructure de calcul. Cette publication répond à un défi concret : l'entraînement par renforcement pour des comportements complexes, comme la locomotion humanoïde sur terrain accidenté, est extrêmement gourmand en GPU. Un seul run d'entraînement peut durer de quelques heures à plusieurs jours. SageMaker HyperPod intègre un agent de surveillance de santé sur chaque nœud, capable de détecter automatiquement les pannes matérielles, de remplacer les instances défaillantes et de reprendre l'entraînement depuis le dernier checkpoint, sans intervention humaine. Le système publie en parallèle des centaines de métriques de cluster vers Amazon Managed Service for Prometheus, visualisables dans des dashboards Grafana préconfigurés, couvrant l'utilisation GPU, la mémoire, le débit réseau et les performances par tâche. Pour les expériences courtes, SageMaker Training Jobs élimine tout coût de calcul inactif entre les runs, chaque job ne consommant de ressources que le temps de son exécution. L'IA physique bascule progressivement de la recherche vers la production industrielle. Les robots sont désormais formés dans des simulations haute-fidélité accélérées par GPU avant leur déploiement en usine, en entrepôt ou dans des centres logistiques, parce que l'entraînement en conditions réelles reste lent, coûteux et risqué. Cette simulation compresse des mois d'apprentissage en quelques heures, mais déplace le problème vers la gestion du calcul distribué. C'est précisément le créneau que cherchent à occuper AWS et NVIDIA avec cette intégration : en abstraisant la couche infrastructure, ils permettent aux ingénieurs de se concentrer sur la conception des politiques de comportement robotique plutôt que sur la configuration des clusters. SageMaker HyperPod supporte l'orchestration via Amazon EKS ou Slurm, avec un système de quotas fins par instance, GPU entier ou partition MIG (NVIDIA Multi-Instance GPU), couvrant les accélérateurs, les vCPU et la mémoire. La prochaine étape logique sera l'extension de ces pipelines aux modèles de fondation robotique, qui nécessitent des infrastructures similaires mais à une échelle encore supérieure.

RobotiqueActu
1 source
NVIDIA et LG Group construisent une usine IA pour entraîner des robots et alimenter la mobilité du futur
33Interesting Engineering 

NVIDIA et LG Group construisent une usine IA pour entraîner des robots et alimenter la mobilité du futur

NVIDIA et le groupe sud-coréen LG ont annoncé lors du Computex 2026 un partenariat stratégique multisectoriel visant à construire un écosystème d'intelligence artificielle physique couvrant la robotique industrielle, les robots domestiques, la mobilité autonome et les infrastructures de calcul. La collaboration mobilise plusieurs entités du conglomérat LG : LG Electronics, LG CNS, LG Innotek, LG Uplus et LG Energy Solution, chacune apportant un périmètre spécifique. Concrètement, LG prévoit de déployer NVIDIA Isaac Sim et Isaac Lab dans ses workflows robotique pour entraîner ses robots domestiques en environnements virtuels avant tout déploiement physique, et d'explorer le modèle de fondation GR00T pour renforcer leurs capacités de raisonnement. LG Electronics construit par ailleurs ce qu'il appelle une "data factory pour l'IA physique", utilisant les world models NVIDIA Cosmos pour générer des datasets synthétiques destinés à la robotique et à l'automatisation industrielle. Sur le volet infrastructure, LG Uplus s'engage à construire des centres de données à grande échelle compatibles avec les dernières générations de GPU NVIDIA, LG Electronics travaillera sur des technologies de refroidissement liquide alignées avec la plateforme NVIDIA DSX, et LG Energy Solution évalue des architectures d'alimentation en courant continu 800 volts pour les installations nouvelle génération. L'intérêt de ce partenariat pour les décideurs industriels tient moins à l'annonce elle-même qu'à ce qu'elle révèle sur la maturité du cycle de développement robotique. L'adoption d'Isaac Sim comme environnement d'entraînement primaire signale que le sim-to-real gap, longtemps le principal obstacle au déploiement à grande échelle, est considéré comme suffisamment maîtrisé pour structurer une chaîne industrielle dessus. La création d'une data factory synthétique répond à l'un des goulots d'étranglement les plus critiques du secteur : la rareté des données labellisées de qualité pour entraîner des VLA (Vision-Language-Action models). Pour les intégrateurs et les COO industriels, le message est que les outils de simulation et les modèles de fondation convergent vers une stack unifiée, ce qui devrait réduire les coûts et délais de portage de nouvelles applications robotiques. Il convient toutefois de noter que l'annonce reste au stade de la feuille de route : aucun chiffre de déploiement, aucun timeline de livraison ni prix n'ont été communiqués. Le contexte de ce rapprochement est celui d'une course mondiale à l'IA physique dans laquelle NVIDIA cherche à s'imposer comme couche d'infrastructure universelle face à des concurrents comme Boston Dynamics Atlas (désormais intégré chez Hyundai), Figure AI avec son modèle Helix, ou encore Physical Intelligence (pi-0) côté recherche. LG, de son côté, investit depuis plusieurs années dans la robotique de service avec ses robots CLOi, sans avoir encore atteint une adoption commerciale significative. Le groupe fait aussi face à la pression de concurrents coréens comme Samsung, qui développe ses propres robots domestiques avec Ballie. Les prochaines étapes annoncées incluent l'intégration des technologies NVIDIA DRIVE dans les systèmes ADAS de LG Electronics pour les véhicules définis par logiciel, et le déploiement de la plateforme d'automatisation industrielle de LG CNS enrichie de briques NVIDIA. La concrétisation de ces engagements sur les 12 à 24 prochains mois sera le véritable indicateur de la profondeur du partenariat.

UECe partenariat accélère la convergence vers une stack NVIDIA (Isaac Sim, GR00T, Cosmos) comme infrastructure d'entraînement robotique de référence, forçant les intégrateurs et OEM européens à évaluer leur alignement avec cet écosystème dans leurs roadmaps 2026-2027.

💬 Le truc intéressant, c'est pas le deal NVIDIA-LG, c'est ce qu'il révèle : le sim-to-real gap est maintenant considéré comme suffisamment sous contrôle pour construire une filière industrielle dessus. Isaac Sim comme environnement d'entraînement primaire dans une data factory à l'échelle d'un conglomérat coréen, ça signale un vrai changement de maturité, pas juste un POC de plus. Sur le papier, du moins, parce qu'aucun chiffre ni calendrier n'a filtré.

RobotiqueOpinion
1 source
MotionWAM : vers des modèles fondation action-monde pour la loco-manipulation humanoïde en temps réel
34arXiv cs.RO 

MotionWAM : vers des modèles fondation action-monde pour la loco-manipulation humanoïde en temps réel

Des chercheurs présentent MotionWAM (arXiv:2606.09215), un World Action Model (WAM) temps réel pour la loco-manipulation humanoïde, validé sur neuf tâches physiques avec un Unitree G1 piloté par une unique caméra égocentrique. Contrairement aux architectures dominantes qui séparent une politique pour les bras et un contrôleur pour la locomotion, le système prédit des tokens de mouvement corps-entier dans un espace d'action unifié couvrant locomotion, déplacements du torse, régulation de hauteur, interaction plantaire et manipulation des mains. Pour atteindre le temps réel, MotionWAM conditionne la politique sur les features intermédiaires de débruitage d'un modèle monde vidéo, évitant le débruitage itératif complet sur des latents haute dimension, goulot d'étranglement des WAMs antérieurs. Sur le hardware réel, le système dépasse de plus de 30 points les baselines Vision-Language-Action (VLA) entraînées sur les mêmes démonstrations et réalise des tâches d'interaction plantaire inatteignables par les politiques haut/bas-corps découplées. Le paradigme hiérarchique haut/bas-corps, présent dans des systèmes comme GR00T N2 (NVIDIA) et de nombreuses architectures humanoïdes commerciales, contraint les jambes à un simple rôle d'équilibre déconnecté de la manipulation. MotionWAM démontre sur matériel réel que cette contrainte n'est pas une fatalité et valide que des modèles monde pré-entraînés sur vidéo peuvent réduire la dépendance aux démonstrations robotiques coûteuses. Les métriques restent à contextualiser: neuf tâches sur un seul embodiment, sans publication de temps de cycle ni de robustesse aux variations de scène, restent loin d'une validation industrielle. Les WAMs appliqués à la robotique s'appuient sur des travaux antérieurs en manipulation tabletop (UniSim, Genie de Google DeepMind); MotionWAM étend ces techniques à la commande humanoïde corps-entier. Face aux approches VLA dominantes dans les publications de référence, notamment pi-0 (Physical Intelligence) et GR00T N2, cette architecture propose une alternative centrée sur la dynamique vidéo pré-entraînée. Les prochaines étapes naturelles concernent la validation multi-embodiment et des déploiements industriels semi-structurés, où la variabilité des environnements constituera le vrai test de maturité.

RobotiqueOpinion
1 source
HERO : saisie visuelle d'objets à vocabulaire ouvert par contrôle corps entier d'un humanoïde
35arXiv cs.RO 

HERO : saisie visuelle d'objets à vocabulaire ouvert par contrôle corps entier d'un humanoïde

Des chercheurs ont publié sur arXiv (référence 2602.16705, version 3) un système de manipulation locomotrice pour humanoïdes baptisé HERO (Humanoid End-Effector Residual cOntrol), conçu pour saisir des objets du quotidien sans liste prédéfinie de cibles. Le système fonctionne en open-vocabulary : il identifie visuellement les objets via des images RGB-D et des grands modèles de vision, puis planifie et exécute la saisie en temps réel. L'innovation centrale est une politique de suivi de l'effecteur terminal (EE) dite "résidual-aware", qui combine trois composants : une cinématique inverse pour convertir les cibles résiduelles de l'EE en trajectoires de référence, un modèle neuronal de cinématique directe entraîné en simulation, et un mécanisme de ré-planification dynamique. Ce pipeline réduit l'erreur de suivi de l'effecteur à 2,44 cm, soit une amélioration annoncée de 5,5x par rapport à la meilleure méthode antérieure. Les tests en environnements réels, bureaux, cafés, démontrent la saisie de mugs, pommes et jouets sur des surfaces allant de 43 à 92 cm de hauteur. L'approche modulaire de HERO rompt avec la tendance dominante des méthodes end-to-end monolithiques (apprentissage par imitation, sim-to-real intégral) qui peinent à généraliser sans retraining massif. En séparant la compréhension de scène, déléguée aux fondations vision, du contrôle moteur précis, entraîné entièrement en simulation, les auteurs obtiennent une généralisation out-of-distribution plus robuste sur de nouveaux environnements. Pour un intégrateur, cela signifie potentiellement moins de données de démonstration à collecter par site de déploiement. Les 2,44 cm d'erreur restent trop élevés pour des tâches d'assemblage de précision, mais suffisants pour le pick-and-place d'objets courants. La métrique "5,5x meilleure" mérite réserve : les conditions exactes du benchmark ne sont pas détaillées dans l'abstract. Ce travail s'inscrit dans une course dense sur le contrôle loco-manipulation des humanoïdes. Physical Intelligence avec Pi-0, Figure AI avec Figure 03, Agility Robotics avec Digit, et Unitree explorent tous des pipelines combinant grands modèles de vision-langage-action (VLA) et contrôle fin de l'effecteur. La question du sim-to-real gap reste le principal verrou non résolu dans le secteur pour les tâches de manipulation dextre, et HERO propose une réponse architecturale partielle en hybridant cinématique classique et apprentissage neuronal, une direction explorée également par des équipes européennes comme Wandercraft sur leurs plateformes bipèdes. Aucun partenariat industriel ni timeline de déploiement n'est mentionné : il s'agit pour l'instant d'un résultat de recherche, pas d'un produit commercialisé.

UEDes équipes européennes comme Wandercraft explorent des architectures similaires sur le contrôle bipède ; l'approche hybride de HERO (cinématique classique + apprentissage neuronal) peut informer leurs pipelines de R&D, mais l'impact reste indirect, sans déploiement ni partenariat industriel européen associé.

RobotiquePaper
1 source
Generalist lève 400 millions de dollars pour développer ses modèles d'IA généralistes
36The Robot Report 

Generalist lève 400 millions de dollars pour développer ses modèles d'IA généralistes

Generalist AI Inc. a annoncé une levée de fonds de 400 millions de dollars, portant son financement total à plus de 500 millions depuis sa création en 2024. Le tour a été mené par Radical Ventures, avec de nouveaux entrants incluant 8VC, Union Square Ventures, Hanabi Capital et Norwest, auxquels s'ajoutent les investisseurs historiques NVentures (NVIDIA), Boldstart Ventures, Spark Capital et Bezos Expeditions. Parmi les investisseurs individuels figurent Fei-Fei Li, Eric Yuan (PDG de Zoom), Bin Lin et Naval Ravikant. Basée à San Mateo, en Californie, la startup développe des modèles fondamentaux destinés à des robots généralistes, capables d'opérer sur différentes architectures matérielles. En novembre 2025, elle avait lancé GEN-0, présenté comme le premier modèle à appliquer les lois de mise à l'échelle (scaling laws) à la robotique physique. En avril 2026, elle a publié GEN-1, avec des métriques communiquées par la société elle-même: taux de succès moyen de 99 % sur des tâches où les modèles précédents atteignaient 64 %, vitesse d'exécution environ trois fois supérieure sur des manipulations dextères, et seulement une heure de données robotiques nécessaires par compétence apprise. Ces chiffres, s'ils se confirment en conditions industrielles réelles, représenteraient un changement structurel pour la commercialisation de la robotique généraliste. Le principal verrou du secteur reste logiciel: la plupart des intégrateurs investissent encore des semaines de collecte de données pour chaque nouvelle tâche. Un modèle nécessitant une heure de données par compétence transformerait radicalement l'économie du déploiement. Cela dit, les métriques publiées proviennent exclusivement des communications internes de Generalist AI, sans validation indépendante ni précision sur les conditions de benchmark ou la nature des tâches testées. Le concept de "data flywheel", selon lequel les déploiements chez des clients industriels génèrent les données qui alimentent le modèle suivant, est éprouvé dans le logiciel; sa transposition à la robotique physique, avec ses contraintes de sécurité et de variabilité du monde réel, reste à démontrer à l'échelle. Generalist AI a été fondée en 2024 par Pete Florence (CEO), Andy Zeng (Chief Scientist) et Andrew Barry (CTO), trois chercheurs issus des milieux académiques et industriels de la robotique. La startup s'inscrit dans un marché en forte compétition: Physical Intelligence avec son modèle Pi-0, Figure AI avec le Figure 03, Boston Dynamics, Apptronik et 1X Technologies ciblent tous le même segment des modèles d'IA généralistes pour robots physiques. En Europe, Enchanted Tools et Wandercraft progressent sur des verticales plus ciblées. Avec cette levée, Generalist AI prévoit d'accélérer le développement de modèles de nouvelle génération, d'étendre son infrastructure d'entraînement et de renforcer son moteur de collecte de données physiques. La prochaine étape observable sera la documentation de déploiements industriels concrets chez des clients identifiés, seul critère qui permettra de distinguer les performances en laboratoire de la viabilité commerciale annoncée.

UELa montée en puissance de Generalist AI accentue la pression concurrentielle sur les acteurs européens comme Enchanted Tools et Wandercraft, dont les verticales ciblées et les capacités de financement ne sont pas comparables aux 500 M$ levés par cette startup américaine en moins de deux ans.

💬 500 millions en deux ans, c'est du sérieux. Ce qui m'intéresse vraiment, c'est pas le chèque, c'est cette histoire d'une heure de données par compétence apprise (contre des semaines pour les intégrateurs actuels). Si ça tient en conditions industrielles, tu changes complètement l'économie du déploiement robotique, mais tous les chiffres sortent de chez eux sans validation externe, donc faut voir les premiers clients réels avant de s'emballer.

BusinessOpinion
1 source
Amazon développe un robot d'entrepôt que les employés peuvent piloter à la voix
37The Verge 

Amazon développe un robot d'entrepôt que les employés peuvent piloter à la voix

Amazon a présenté une nouvelle version de Proteus, son robot de manutention autonome déployé dans ses entrepôts, capable désormais de recevoir des instructions en langage naturel. Là où les opérateurs devaient auparavant passer par un logiciel spécialisé pour programmer les déplacements de l'engin, ils peuvent désormais lui communiquer des tâches verbalement, comme à un collègue. Le robot, au format bas et trapézoïdal conçu pour déplacer de lourds chariots à travers les allées logistiques, conserve le même châssis que le modèle original annoncé en 2022, la nouveauté est exclusivement logicielle, portée par une surcouche IA. L'enjeu est significatif pour les opérations à grande échelle : éliminer la friction de programmation réduit le temps de formation des opérateurs et permet une réaffectation dynamique des robots sans intervention IT. C'est aussi un signal clair sur la direction qu'Amazon prend dans la course à l'automatisation de ses 1 000+ centres de distribution aux États-Unis, où la pression syndicale et les coûts de main-d'oeuvre accélèrent les déploiements robotiques. Cela dit, l'annonce reste pour l'instant au stade de démonstration capacitaire : Amazon ne communique pas de chiffres de déploiement, de taux d'erreur ni de benchmarks de cycle time dans des conditions réelles. Proteus fait partie d'un portefeuille robotique Amazon qui inclut Sequoia (tri de petits colis), Sparrow (picking d'articles) et Cardinal (manutention de caisses). Sur le volet langage naturel appliqué aux robots industriels, Amazon rejoint une tendance portée par Boston Dynamics (Spot) et Intrinsic (filiale Alphabet), qui intègrent des interfaces LLM pour réduire la barrière à la programmation en atelier. Les prochaines étapes annoncées par Amazon restent vagues, sans timeline précise ni volume de déploiement confirmé.

UEAmazon opère des entrepôts en France et en Europe ; l'adoption à grande échelle d'interfaces LLM sur robots industriels pourrait accélérer la pression à l'automatisation dans la logistique EU et influencer les standards d'intégration des opérateurs locaux.

RobotiqueOpinion
1 source
M3imic : apprentissage d'un contrôleur corps entier polyvalent pour l'imitation multimodale de mouvements
38arXiv cs.RO 

M3imic : apprentissage d'un contrôleur corps entier polyvalent pour l'imitation multimodale de mouvements

Des chercheurs de Renforce Dynamics ont publié le 5 juin 2026 sur arXiv un article présentant M3imic (Multi-Modal Mimic), un contrôleur corps entier destiné aux robots humanoïdes. L'objectif : unifier dans une seule politique d'apprentissage par renforcement trois types de références de mouvement jusqu'ici traités séparément, les trajectoires articulaires du robot (angles de joints), les trajectoires de pose humaine capturées par motion capture, et les poses d'effecteurs terminaux (end-effector poses). Le système exploite des encodeurs spécialisés par modalité pour projeter ces données hétérogènes dans un espace latent commun, puis entraîne une politique unique à grande échelle en simulation. Les expériences sont conduites sur le robot humanoïde Unitree G1 : en simulation, la politique atteint un taux de succès maximal de 98,42 % sur un jeu de test non vu, et un transfert sim-to-réel est démontré sans réentraînement spécifique à chaque modalité. Le code source est disponible publiquement sur GitHub. Le problème que M3imic cherche à résoudre est structurel : les contrôleurs corps entier existants traitent la locomotion et la manipulation comme deux domaines distincts, avec des formats de données incompatibles, des vecteurs denses d'angles articulaires d'un côté, des poses 6-DOF d'effecteurs creuses de l'autre. Forcer une seule politique à ingérer ces deux représentations sans architecture dédiée dégrade les performances. M3imic propose une solution architecturale rather than une solution de données : un espace latent partagé avec encodeurs par modalité, ce qui permet à une même politique de piloter aussi bien la marche que la manipulation sans compromis de performance. Pour les intégrateurs et équipes robotiques, cela réduit potentiellement le coût de développement en éliminant le besoin de pipelines parallèles par type de tâche. Le robot cible, le Unitree G1, est un humanoïde commercialisé depuis 2024 à environ 16 000 dollars, devenu une plateforme de référence pour la recherche en locomotion et loco-manipulation grâce à son accessibilité. Renforce Dynamics est un laboratoire ou startup dont M3imic constitue l'une des premières publications publiques. Dans le paysage concurrent, les approches comparables incluent les travaux de Berkeley Humanoid (Pi-0 de Physical Intelligence), les contrôleurs corps entier de CMU et ETH Zurich, et les politiques VLA de Figure AI, tous confrontés au même défi du sim-to-real gap sur tâches mixtes locomotion-manipulation. M3imic se positionne explicitement sur l'unification multimodale plutôt que sur la performance brute d'une seule tâche. Les prochaines étapes naturelles seraient des déploiements en environnement non structuré et une évaluation sur des humanoïdes à plus haute cinématique (plus de DOF, payload supérieur).

RobotiqueOpinion
1 source
NVIDIA lance Cosmos 3 : un modèle de fondation à deux tours mêlant raisonnement physique, génération de mondes et d'actions
39MarkTechPost 

NVIDIA lance Cosmos 3 : un modèle de fondation à deux tours mêlant raisonnement physique, génération de mondes et d'actions

NVIDIA a publié Cosmos 3, une nouvelle famille de modèles d'IA fondationnels conçus pour les systèmes d'IA physique, robots, véhicules autonomes et systèmes de surveillance industrielle. La particularité de cette version réside dans son architecture dite Mixture-of-Transformers (MoT) à deux tours, qui réunit pour la première fois dans un seul modèle trois capacités jusqu'ici séparées : le raisonnement physique, la génération de monde (vidéo, images, son) et la génération d'actions. NVIDIA a publié en open source les poids, scripts d'entraînement, outils de déploiement et jeux de données. Deux échelles sont disponibles au lancement : Cosmos3-Nano (16 milliards de paramètres, basé sur Qwen3-VL 8B) pour l'inférence sur GPU workstation comme la RTX PRO 6000, et Cosmos3-Super (64 milliards de paramètres, basé sur Qwen3-VL 32B) pour les datacenters équipés de GPU Hopper ou Blackwell. Des variantes spécialisées accompagnent cette sortie, dont Super Text2Image, Super Image2Video et Nano-Policy-DROID. L'unification de ces trois capacités dans un seul modèle représente un changement structurel pour les équipes qui développent des systèmes robotiques ou de conduite autonome. Jusqu'ici, il fallait orchestrer plusieurs modèles distincts, un pour percevoir, un pour prédire, un pour agir, ce qui multipliait la complexité d'intégration et les points de défaillance. Cosmos 3 propose un flux cohérent : la tour "reasoner" (un VLM autorégressif qui comprend images, vidéos et texte) conditionne la tour "generator" (diffusion pour la vidéo et les actions), l'information circulant dans un seul sens. Les équipes de robotique temps réel peuvent faire tourner le Nano sur du matériel de terrain, tandis que les équipes de R&D génèrent des données synthétiques à grande échelle avec le Super. Sur les benchmarks, Cosmos 3 domine VANTAGE-Bench et le leaderboard TAR (Traffic Anomaly Reasoning) dans leurs catégories respectives. Cette sortie s'inscrit dans la stratégie d'NVIDIA visant à s'imposer comme infrastructure logicielle de l'IA physique, au-delà de la simple vente de GPU. Les versions précédentes de Cosmos fragmentaient les capacités ; Cosmos 3 consolide l'approche autour d'un socle commun initialisé depuis les poids Qwen3-VL de l'écosystème open source. Le modèle gère nativement des entrées texte, image, vidéo et tableaux d'actions JSON, et produit des sorties allant jusqu'à 720p à 24 FPS avec son stéréo AAC 48 kHz, pour une durée maximale d'environ 12,5 secondes. Il supporte une gamme d'embodiments robotiques (caméra, véhicule, bras simple ou double, humanoïde), chacun avec des dimensions d'action fixes. Face à la montée en puissance de Google DeepMind, Boston Dynamics et des startups robotiques chinoises, NVIDIA mise sur l'open source et la verticalisation logicielle pour ancrer son écosystème dans les prochaines années de déploiement d'IA physique.

UELes équipes européennes de robotique et de véhicules autonomes peuvent accéder gratuitement à un modèle de fondation unifié pour l'IA physique, réduisant la complexité d'intégration et les coûts de R&D pour les industriels actifs dans l'automatisation et la mobilité autonome.

💬 Orchestrer trois modèles séparés pour percevoir, prédire et agir, c'était le quotidien douloureux des équipes robotique, et Cosmos 3 règle ça proprement. L'open source complet, poids + scripts + datasets, c'est pas de la comm, NVIDIA construit une base logicielle sur laquelle personne ne pourra se passer d'eux dans 3 ans. Reste à voir si le Nano tient en conditions réelles, parce que sur les benchmarks c'est toujours plus joli qu'en prod.

RobotiqueOpinion
1 source
Human2Humanoid : transfert de mouvement multi-morphologie assisté par la physique pour robots humanoïdes
40arXiv cs.RO 

Human2Humanoid : transfert de mouvement multi-morphologie assisté par la physique pour robots humanoïdes

Une équipe de recherche a publié le 3 juin 2026 sur arXiv (référence 2606.03476) un framework baptisé Human2Humanoid, conçu pour transférer automatiquement des mouvements humains vers des robots humanoïdes sans nécessiter de données d'entraînement appariées. La méthode, entièrement non supervisée, a été validée sur le robot Unitree G1, un humanoïde à 23 degrés de liberté commercialisé par la société chinoise Unitree Robotics. L'architecture repose sur un réseau adversarial de type CycleGAN couplé à un réseau de convolution sur graphes sensible à la topologie squelettique, permettant de capturer les caractéristiques motrices dépendantes de la structure anatomique. Pour compenser les écarts de proportions entre morphologies humaine et robotique, les auteurs introduisent une fonction de perte dite "morphology-invariant end-effector consistency" qui aligne les trajectoires normalisées des effecteurs terminaux (mains et pieds) afin de préserver la sémantique du mouvement d'un corps à l'autre. Des contraintes de faisabilité physique explicites sont également imposées pour reproduire les patterns de contact de la séquence source et limiter les artefacts cinématiques. Ce travail s'attaque à un goulot d'étranglement majeur du secteur humanoïde : le retargeting de mouvement est fondamental pour le télé-opération, l'apprentissage par imitation et l'interaction homme-robot, mais les approches supervisées exigent des corpus de données appariées humain-robot quasi inexistants à grande échelle. En supprimant cette contrainte, Human2Humanoid ouvre la voie à l'exploitation de bibliothèques de capture de mouvement (mocap) existantes sans phase de labellisation. Les résultats expérimentaux indiquent que la méthode surpasse les approches concurrentes sur deux critères clés : contrôlabilité en aval (la politique apprise est plus exploitable pour des tâches réelles) et faisabilité physique (moins de violations de contraintes, meilleure reproductibilité des contacts). C'est un signal positif dans un contexte où le fossé démo-réalité reste la critique récurrente du secteur. Le retargeting de mouvement humain vers robot est un champ de recherche actif depuis plusieurs années, alimenté par la course aux humanoïdes commerciaux. Unitree, positionné comme fournisseur de plateformes matérielles accessibles face à Boston Dynamics, Figure AI (modèle Figure 03), Tesla (Optimus Gen 3) ou Agility Robotics, bénéficie directement de ce type de contribution académique qui enrichit l'écosystème logiciel autour de son G1. Du côté des méthodes concurrentes, on trouve notamment des approches à base de réseaux de retargeting supervisés ou de politiques d'imitation directe comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Human2Humanoid n'est pas encore un produit déployé : c'est une contribution de recherche fondamentale, sans annonce de pilote industriel associée. Les prochaines étapes naturelles seraient une validation sur d'autres plateformes humanoïdes et une intégration dans des pipelines d'apprentissage par renforcement ou d'imitation à grande échelle.

RobotiquePaper
1 source
Humanoid-GPT : mise à l'échelle des données et de la structure pour le suivi de mouvement zéro-shot
41arXiv cs.RO 

Humanoid-GPT : mise à l'échelle des données et de la structure pour le suivi de mouvement zéro-shot

Une équipe de chercheurs présente Humanoid-GPT, un Transformer de style GPT avec attention causale, entraîné sur un corpus de 2 milliards de frames de capture de mouvement pour le contrôle du corps entier de robots humanoïdes. Publiée en juin 2026 sur arXiv (preprint, non encore évaluée par les pairs), l'étude décrit un pré-entraînement sur un corpus retargeté qui unifie l'ensemble des jeux de données mocap publics majeurs et des enregistrements internes à grande échelle. L'objectif central est la généralisation zero-shot: le modèle doit suivre des mouvements hautement dynamiques et s'adapter à des tâches de contrôle inédites sans réentraînement spécifique. L'approche s'attaque au compromis agility-generalization qui bride les trackers MLP peu profonds, architecture dominante jusqu'ici mais limitée par la rareté des données d'entraînement. En scalant simultanément les données et la capacité du modèle, Humanoid-GPT prétend résoudre ces deux dimensions avec un unique modèle génératif. Si ces résultats se confirment à la validation indépendante, le résumé restant vague sur les benchmarks exacts et les conditions expérimentales, cela réduirait concrètement le coût de déploiement pour les intégrateurs de systèmes humanoïdes qui doivent aujourd'hui entraîner des politiques séparées pour chaque tâche ou morphologie de robot. Cette contribution s'inscrit dans la tendance au scaling des politiques de contrôle humanoïde: NVIDIA avec GR00T N2, Physical Intelligence avec pi-0 et pi-0.5, ou Berkeley Humanoid ont chacun montré que les Transformers absorbent massivement des données de démonstration pour produire des politiques plus généralisables. Humanoid-GPT se positionne spécifiquement sur le motion tracking en amont des pipelines d'action, plutôt que sur la manipulation de bout en bout. L'absence d'affiliation institutionnelle visible dans le résumé et la nature preprint du document invitent à la prudence sur les affirmations de "new performance frontier"; les benchmarks comparatifs et la revue par les pairs seront déterminants pour l'adoption dans la communauté.

RobotiqueOpinion
1 source
PHASER : rejeu d'expérience sémantique et par phase pour les modèles VLA
42arXiv cs.RO 

PHASER : rejeu d'expérience sémantique et par phase pour les modèles VLA

Des chercheurs ont publié sur arXiv (référence 2606.03598) un framework de continual learning baptisé PHASER (Phase-Aware and Semantic Experience Replay), conçu pour les modèles Vision-Language-Action (VLA) appliqués à la manipulation robotique. L'architecture est agnostique au backbone sous-jacent et a été évaluée sur trois modèles VLA distincts dans les suites de benchmarks LIBERO, une référence du domaine. Sur le scénario LIBERO-Goal CL (continual learning), PHASER atteint un taux de succès moyen (Average Success Rate, ASR) de 87,8 % en fin d'entraînement, soit un gain de 31 points de pourcentage par rapport à l'experience replay uniforme standard avec le même budget mémoire. Le problème que PHASER attaque est celui de l'oubli catastrophique : lorsqu'un robot apprend séquentiellement de nouvelles compétences gestuelles, les représentations antérieures se dégradent rapidement dans les poids du modèle. L'experience replay classique échoue parce qu'il échantillonne uniformément, sous-représentant les sous-phases courtes mais critiques d'une trajectoire de manipulation (la saisie, le transfert, la dépose), un phénomène que les auteurs nomment "phase starvation". PHASER corrige cela avec deux mécanismes : une allocation mémoire par phase (capacity allocation) pour garantir une couverture équilibrée de tous les sous-comportements, et un routage dynamique qui priorise les phases historiques à haut risque d'oubli. Un troisième composant, Auto-PC, automatise la détection des frontières temporelles entre sous-phases par analyse non supervisée des signaux d'action, validée ensuite par un VLM, évitant ainsi l'annotation manuelle coûteuse. Les VLA, qui conditionnent les actions du robot sur du langage naturel et des images, sont devenus un axe central de la robotique généraliste, portés notamment par des modèles comme OpenVLA (UC Berkeley), pi0 (Physical Intelligence) ou RT-2 (Google DeepMind). L'un des verrous majeurs à leur déploiement industriel reste précisément la capacité à apprendre de nouvelles tâches sans régression sur les anciennes, prérequis pour tout robot polyvalent en atelier. PHASER reste pour l'instant une contribution de recherche évaluée en simulation, mais son caractère agnostique au backbone en fait un candidat naturel pour une intégration dans des pipelines d'entraînement continuel sur des plateformes hardware comme Figure 02, Unitree G1 ou Boston Dynamics Atlas.

RechercheOpinion
1 source
OpenEAI-Platform : une plateforme open source unifiée matériel-logiciel pour l'IA incarnée
43arXiv cs.RO 

OpenEAI-Platform : une plateforme open source unifiée matériel-logiciel pour l'IA incarnée

Des chercheurs ont déposé sur arXiv (2606.03392) OpenEAI-Platform, une plateforme open-source couplant un bras robotique à 6+1 degrés de liberté (DDL), OpenEAI-Arm, et un modèle vision-langage-action (VLA), OpenEAI-VLA. OpenEAI-Arm s'appuie sur des plans mécaniques ouverts et une commande conforme (compliant control) destinée à réduire le coût de fabrication tout en maintenant la précision de manipulation. OpenEAI-VLA est construit sur Qwen3-VL-4B d'Alibaba avec une tête d'action Diffusion Transformer, entraîné en deux phases sur des jeux de données exclusivement ouverts. Sur quatre tâches de manipulation réelles, il atteint des taux de réussite comparables à pi0 de Physical Intelligence, un modèle pré-entraîné à bien plus grande échelle. OpenEAI-Arm surpasse par ailleurs deux bras commerciaux 6+1 DDL évalués sous la même politique de contrôle. Plans, codes, modèles et pipelines d'entraînement seront publiés intégralement après acceptation de l'article en revue. L'intérêt de ces résultats est double. Côté hardware, un bras open-source moins coûteux qui surpasse des équipements commerciaux constitue un levier direct pour les laboratoires et intégrateurs à budget contraint. Côté VLA, approcher les performances de pi0 avec nettement moins de données de pré-entraînement conteste l'hypothèse selon laquelle des politiques de manipulation robustes nécessitent impérativement des corpus massifs et propriétaires. L'architecture combinant un modèle vision-langage compact (4 milliards de paramètres) et une tête diffusion semble offrir un rapport performance-données plus favorable que prévu, ce qui intéresse directement les équipes cherchant à déployer des robots polyvalents sans infrastructure de collecte industrielle. OpenEAI-VLA s'appuie sur Qwen3-VL-4B (Alibaba, 2025) et l'architecture Diffusion Transformer popularisée par pi0 (Physical Intelligence, 2024) pour générer des actions robotiques continues. La plateforme s'inscrit dans un segment croissant de projets ouverts pour la manipulation, aux côtés de LeRobot (Hugging Face) et ALOHA (Stanford), face à des acteurs commerciaux comme Figure AI, Boston Dynamics ou 1X Technologies. Son positionnement vise explicitement la reproductibilité et la collecte de données à l'échelle, deux goulots d'étranglement identifiés par la communauté robotique. Aucun déploiement industriel ni partenariat n'est annoncé : OpenEAI-Platform est un prétirage, et l'accès aux ressources complètes reste conditionnel à l'acceptation de l'article.

UELes équipes de recherche et laboratoires européens à budget contraint pourraient exploiter cette plateforme matériel-logiciel open source pour accélérer leurs travaux en manipulation robotique sans infrastructure de collecte de données industrielle.

💬 Un bras robot open-source qui surpasse du hardware commercial, c'est déjà solide. Ce qui m'intéresse encore plus, c'est que leur VLA s'approche des perfs de pi0 avec des datasets entièrement ouverts et un modèle à 4B paramètres, ce qui fracasse l'idée qu'il faut absolument un corpus propriétaire massif pour faire de la manipulation sérieuse. Bon, c'est un prétirage pour l'instant, les ressources complètes sortent après acceptation de l'article.

RobotiqueOpinion
1 source
Nvidia dévoile son robot humanoïde Isaac GR00T… et il déchire grave
44Le Big Data 

Nvidia dévoile son robot humanoïde Isaac GR00T… et il déchire grave

Nvidia a présenté le 1er juin 2026, lors du Computex à Taipei, son robot humanoïde de référence baptisé Isaac GR00T Reference Humanoid Robot. Développé en partenariat avec Unitree, spécialiste chinois de la robotique, et Sharpa, entreprise singapourienne experte en mains robotiques, ce système repose sur le corps humanoïde H2 Plus d'Unitree, 1,80 mètre, 68 kilogrammes, 31 degrés de liberté. Les mains tactiles à cinq doigts de Sharpa ajoutent 22 degrés de liberté chacune, portant le total à 75 points d'articulation sur l'ensemble du corps. Chaque bras peut soulever 7 kilogrammes en continu, avec des pics à 15 kilogrammes. Le cerveau du système est le calculateur Jetson Thor, basé sur l'architecture Blackwell de Nvidia, capable de dépasser 2 000 téraflops dédiés à l'IA. Le robot embarque le modèle GR00T 1.7 dès sa sortie de boîte, et une batterie de 0,972 kWh offrirait environ trois heures d'autonomie, selon des sources non confirmées officiellement par Nvidia. L'enjeu de cette annonce dépasse largement le robot lui-même. Nvidia ne vend pas un produit commercial destiné aux entreprises ou aux particuliers, mais une plateforme de référence pour la recherche. L'idée est de fournir aux laboratoires un socle matériel et logiciel unifié, comparable à ce qu'un PC de référence représente pour l'informatique grand public : éviter que chaque équipe perde des mois à assembler et intégrer ses propres composants, pour se concentrer sur ce qui compte, à savoir développer des algorithmes, des comportements et des capacités cognitives. Stanford Robotics Center, ETH Zurich, Ai2 de Seattle et le laboratoire de robotique de l'UC San Diego figurent parmi les premiers partenaires confirmés. La disponibilité pour les développeurs et laboratoires intéressés est prévue d'ici fin 2026. Cette initiative s'inscrit dans une bataille industrielle et géopolitique de grande ampleur autour de la robotique humanoïde. Des acteurs comme Boston Dynamics, Figure, Tesla avec Optimus, ou encore 1X Technologies investissent massivement dans ce domaine, perçu comme le prochain grand marché de l'IA physique. Nvidia, jusqu'ici positionné comme fournisseur de puissance de calcul, tente avec Isaac GR00T de devenir la couche d'infrastructure incontournable de toute la filière robotique mondiale. L'absence notable d'institutions chinoises parmi les premiers partenaires, alors même qu'Unitree est un acteur chinois central du projet, révèle la tension géopolitique qui traverse ce secteur. En standardisant la plateforme de recherche, Nvidia espère non seulement accélérer les progrès scientifiques, mais aussi s'imposer comme le standard de référence avant que ses concurrents ne définissent les leurs.

UEETH Zurich figure parmi les premiers laboratoires partenaires confirmés, ouvrant aux chercheurs européens un accès potentiel à cette plateforme de référence en robotique humanoïde d'ici fin 2026.

💬 Ce qui m'intéresse, c'est pas le robot, c'est le coup qu'essaie de rejouer Nvidia. Imposer une plateforme de référence à la recherche avant que le marché se structure, c'est exactement comme ça que CUDA est devenu incontournable il y a vingt ans. L'absence des labos chinois dans les premiers partenaires alors qu'Unitree est au coeur du hardware, ça dit tout sur où se joue vraiment la bataille.

RobotiqueOpinion
1 source
LEGS : affinage de VLA sans téléopération pour la loco-manipulation humanoïde dans un monde Gaussian Splatting incarné
45arXiv cs.RO 

LEGS : affinage de VLA sans téléopération pour la loco-manipulation humanoïde dans un monde Gaussian Splatting incarné

Des chercheurs présentent LEGS (Loco-manipulation via Embodied Gaussian Splatting), un simulateur hybride qui combine un avant-plan en maillage 3D avec un arrière-plan photoréaliste en Gaussian Splatting 3D (3DGS) pour entraîner des politiques vision-langage-action (VLA) sur humanoïdes sans téleopération humaine. Un générateur procédural de primitives de mouvement produit automatiquement des démonstrations annotées à grande échelle, tandis qu'une calibration colorimétrique à deux étapes aligne le rendu simulé avec la caméra réelle du robot. Sur un Unitree G1, sur trois tâches de saisie-dépose de difficulté croissante et avec trois architectures VLA (ψ₀, π₀.5 et GR00T N1.6), une politique entraînée exclusivement sur données LEGS égale ou dépasse, selon les auteurs, une politique entraînée sur démonstrations téleopérées. La couverture d'une nouvelle scène coûterait plus de quinze fois moins qu'une collecte par téleopération, une affirmation à vérifier hors du cadre expérimental : les résultats restent au stade de préprint arXiv (2606.01458) non soumis à revue par les pairs. Le résultat le plus structurant est la réduction effective du fossé simulation-réalité pour la loco-manipulation humanoïde corps entier, un problème que les simulateurs à maillage seul n'avaient pas résolu jusqu'ici. L'ablation le confirme : supprimer le fond 3DGS au profit d'un environnement mesh-only dégrade significativement les transferts, établissant le rendu photoréaliste comme facteur déterminant et non accessoire. Sous variations combinées d'apparence d'objet et de scène (scénario LEGS-AUG), la politique LEGS maintient son taux de succès tandis que la politique téleopérée échoue entièrement, ce qui valide empiriquement que les VLA nécessitent une diversité visuelle synthétique pour généraliser. Pour les intégrateurs et équipes robotiques, cela ouvre une voie scalable vers de nouveaux environnements industriels sans mobiliser d'opérateurs dédiés. LEGS s'appuie sur la technique 3DGS, popularisée en 2023 pour la reconstruction photoréaliste de scènes à partir d'images, et l'adapte en fond simulé pour l'entraînement de politiques. Les architectures testées incluent π₀.5 de Physical Intelligence et GR00T N1.6 de NVIDIA, deux acteurs centraux de l'espace VLA humanoïde, aux côtés desquels Boston Dynamics, Figure AI, Agility Robotics et Tesla Optimus avancent sur leurs propres pipelines de données synthétiques. Le Unitree G1, l'un des humanoïdes commerciaux les plus accessibles du marché, ancre les expériences dans un contexte potentiellement déployable. Les suites logiques incluent l'extension au-delà du pick-and-place, la publication du code et des données, et des tests en environnements industriels réels pour valider la robustesse hors laboratoire.

UELes équipes européennes en robotique humanoïde (CEA-List, INRIA, startups FR) pourraient adopter cette approche pour réduire drastiquement les coûts de collecte de données VLA sans téleopération, mais aucun acteur européen n'est impliqué dans l'étude.

RobotiqueOpinion
1 source
PHASOR : représentations d'actions universelles ancrées en phase pour les humanoïdes
46arXiv cs.RO 

PHASOR : représentations d'actions universelles ancrées en phase pour les humanoïdes

Une équipe de chercheurs a publié sur arXiv (2606.01851) PHASOR, un cadre de représentation d'actions conçu pour l'apprentissage de politiques sur robots humanoïdes. Le problème ciblé est fondamental : les méthodes actuelles produisent des espaces latents opaques, non structurés et liés à une plateforme spécifique. PHASOR exploite la périodicité intrinsèque du mouvement en le factorisant en deux composantes : un manifold de phase capturant les structures cycliques via des coefficients FFT (transformée de Fourier rapide), et une branche de pose conditionnant ce manifold sur les configurations non périodiques. Combiné à une distillation de sémantique de mouvement, le système produit un espace de représentations agnostique à l'embodiment, pré-entraîné sur des données de mouvement humain et transférable à plusieurs plateformes humanoïdes de morphologies différentes. L'enjeu industriel est direct. Les architectures actuelles obligent à ré-entraîner les politiques à chaque changement de plateforme matérielle, un coût élevé pour les intégrateurs gérant des flottes hétérogènes. PHASOR traite l'espace d'embedding d'actions comme un objet de conception à part entière : la qualité de la politique émerge de la qualité de la représentation. Les résultats publiés montrent des gains cohérents sur les tâches robotiques en aval et une forte capacité de récupération cross-embodiment, c'est-à-dire qu'un mouvement appris sur un robot peut être retrouvé et transféré à un autre. Il s'agit toutefois d'un preprint sans revue par les pairs, ce qui invite à rester prudent sur la portée des benchmarks présentés. La question du transfert inter-embodiment est au coeur de la compétition humanoïde. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), NVIDIA (GR00T N2) et Agility Robotics développent chacun des architectures de politiques rarement compatibles entre elles. Des travaux comme RT-2 ou OpenVLA avaient montré l'utilité du pré-entraînement sur données humaines pour la vision et le langage, mais l'espace d'actions restait un angle mort. PHASOR s'attaque directement à ce manque. Les prochaines étapes naturelles passeraient par une validation sur plateformes physiques, Unitree H1/H2 ou Apollo d'Apptronik en tête, et une confrontation avec des benchmarks standardisés comme HumanoidBench.

RecherchePaper
1 source
NVIDIA dévoile une plateforme complète pour robots humanoïdes, robotaxis et usines intelligentes
47Interesting Engineering 

NVIDIA dévoile une plateforme complète pour robots humanoïdes, robotaxis et usines intelligentes

Lors du GTC Taipei, NVIDIA a dévoilé une plateforme full-stack destinée aux robots humanoïdes, aux véhicules autonomes et à l'automatisation industrielle. Le cœur de l'annonce est Cosmos 3, un omnimodèle fondational open-source construit sur une architecture mixture-of-transformers, capable de traiter simultanément texte, images, vidéo, son et commandes d'action dans un seul système. Il se décline en Cosmos 3 Super, orienté haute précision pour la robotique et les véhicules autonomes, et Cosmos 3 Nano, optimisé pour l'inférence rapide. NVIDIA lance également l'Isaac GR00T Reference Humanoid Robot, un design de référence intégrant le robot Unitree H2 Plus, les mains articulées Sharpa, le calculateur embarqué Jetson Thor et la pile logicielle GR00T, adopté par Ai2, ETH Zurich, Stanford Robotics Center et UC San Diego. La collaboration avec TSMC porte les bibliothèques CUDA-X dans la fab pour la lithographie computationnelle, la simulation de transistors et l'inspection de plaquettes à l'échelle nanométrique. Alpamayo 2 Super, un modèle de raisonnement à 32 milliards de paramètres, cible quant à lui les applications robotaxi. La cohérence verticale de la plateforme est sa principale valeur ajoutée : NVIDIA prétend désormais couvrir l'intégralité de la chaîne de valeur de l'IA physique, de la génération de données synthétiques à la simulation, jusqu'au déploiement en production. Pour les équipes R&D en robotique humanoïde, GR00T Reference Robot réduit potentiellement plusieurs mois d'intégration hardware/software. Cosmos 3 s'attaque par ailleurs au sim-to-real gap en proposant un world model capable de générer des environnements d'entraînement réalistes, l'un des verrous structurels du secteur. Cela dit, les benchmarks avancés ("meilleur modèle ouvert" sur plusieurs évaluations) émanent de NVIDIA lui-même sans validation tierce, ce qui invite à une lecture prudente. L'intégration dans la fab TSMC est plus tangible : des gains d'efficacité mesurables dans la détection de défauts nanométriques signalent une adoption industrielle réelle, pas seulement un proof-of-concept. NVIDIA construit ce positionnement depuis plusieurs années via Isaac Sim, Omniverse et la famille GR00T N2 présentée en 2025. Sur le marché des humanoïdes, les concurrents directs incluent Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0), Boston Dynamics (Atlas) et Agility Robotics (Digit). Le choix du robot Unitree H2 Plus, acteur chinois concurrent sur le segment humanoïde, comme base matérielle du design de référence NVIDIA est notable. En Europe, Enchanted Tools (Miroki, France) et Wandercraft pourraient tirer parti de Cosmos 3 pour la génération de données d'entraînement, même si aucun partenariat public n'a été annoncé. Les prochaines étapes incluent l'accès des institutions de recherche à GR00T Reference Robot et la disponibilité de Cosmos 3 via NVIDIA NGC ; aucune tarification ni date de commercialisation n'a été communiquée pour l'ensemble de la plateforme.

UEEnchanted Tools et Wandercraft pourraient exploiter Cosmos 3 pour la génération de données d'entraînement, et ETH Zurich figure parmi les partenaires de recherche du GR00T Reference Robot, mais aucun déploiement commercial en Europe n'est confirmé à ce stade.

💬 NVIDIA ne vend plus du silicium, il vend une plateforme verticale, de la simulation jusqu'au robot en prod. Le détail qui m'a accroché : le choix d'Unitree, concurrent chinois direct, comme base matérielle du robot de référence GR00T. C'est soit du pragmatisme pur, soit une façon de dire que l'avantage NVIDIA est dans le software, pas le hardware.

RobotiqueOpinion
1 source
« Des dizaines de milliards de robots d’ici 10 à 20 ans » : la prédiction folle de Nvidia
48Frandroid 

« Des dizaines de milliards de robots d’ici 10 à 20 ans » : la prédiction folle de Nvidia

Un cadre dirigeant de Nvidia a affirmé que le nombre de robots sur Terre dépassera un jour celui des êtres humains, prédisant l'émergence de dizaines de milliards d'appareils dans un horizon de dix à vingt ans. Cette déclaration, rapportée par Frandroid, illustre l'ambition vertigineuse avec laquelle le géant américain des semi-conducteurs positionne désormais la robotique physique au coeur de sa stratégie de croissance. L'enjeu dépasse largement la provocation chiffrée : Nvidia cherche à s'imposer comme la colonne vertébrale computationnelle de la prochaine vague industrielle. L'entreprise a déjà lancé Project GR00T, un modèle fondateur pour robots humanoïdes, et sa plateforme Isaac pour la simulation et l'entraînement robotique. Si des dizaines de milliards de robots nécessitent des puces, des logiciels et des infrastructures d'entraînement, Nvidia se retrouve en position de fournisseur incontournable, reproduisant à l'échelle physique le rôle qu'elle joue aujourd'hui dans l'IA générative. Cette prédiction s'inscrit dans une course mondiale où Tesla, Figure AI, 1X Technologies et Boston Dynamics parient tous sur l'humanoides à grande échelle. Les gouvernements chinois et américain y voient un enjeu de souveraineté industrielle. La question n'est donc plus de savoir si les robots envahiront les usines, les entrepôts et les foyers, mais à quelle vitesse, et qui contrôlera la chaîne de valeur, des capteurs aux modèles d'IA embarqués, en passant par les puces qui les font tourner.

RobotiqueOpinion
1 source
Nvidia mise sur l'IA physique au GTC Taipei : nouveau modèle de monde, cerveau de conduite et robot humanoïde open source
49The Decoder 

Nvidia mise sur l'IA physique au GTC Taipei : nouveau modèle de monde, cerveau de conduite et robot humanoïde open source

Lors du GTC Taipei, Nvidia a dévoilé plusieurs modèles destinés à accélérer son offensive dans l'IA physique. La conférence a été marquée par trois annonces majeures : Cosmos 3, un nouveau modèle de monde (world model) de dernière génération, Alpamayo 2 Super, une version considérablement élargie du modèle de conduite autonome, et une plateforme de référence ouverte pour robots humanoïdes. Ces annonces s'inscrivent dans la stratégie de Jensen Huang de faire de Nvidia le fournisseur incontournable de l'infrastructure pour les systèmes physiques intelligents. Ces outils visent des marchés en pleine explosion : la robotique industrielle, les véhicules autonomes et les systèmes de surveillance vidéo intelligents. Un world model comme Cosmos 3 permet à des robots ou des voitures autonomes de simuler leur environnement et d'anticiper les conséquences de leurs actions, une brique fondamentale pour passer de la démonstration laboratoire au déploiement à grande échelle. La plateforme humanoïde ouverte, quant à elle, vise à standardiser le développement matériel et logiciel pour les constructeurs de robots à deux jambes, réduisant les coûts d'entrée pour les startups du secteur. Nvidia capitalise ici sur sa domination dans les GPU d'entraînement pour étendre son empreinte vers l'inférence embarquée et les systèmes temps-réel. La concurrence s'intensifie avec des acteurs comme Qualcomm et Intel sur les puces pour véhicules autonomes, tandis que des entreprises comme Figure, Boston Dynamics ou 1X Technologies attendent des plateformes logicielles communes pour accélérer leurs développements. GTC Taipei confirme que Nvidia ne veut pas seulement alimenter les data centers de l'IA, il veut aussi être le cerveau des machines qui bougent.

UELes constructeurs automobiles européens (Renault, Stellantis, BMW, Volkswagen) et les startups robotiques européennes pourraient bénéficier de la plateforme humanoïde ouverte pour réduire leurs coûts d'entrée et accélérer leurs développements en robotique industrielle et véhicules autonomes.

RobotiqueOpinion
1 source
Diffusion à double flux pour un modèle vision-langage-action augmenté par modèle du monde
50arXiv cs.RO 

Diffusion à double flux pour un modèle vision-langage-action augmenté par modèle du monde

Une équipe de chercheurs propose DUST (DUal-STream diffusion), un framework qui augmente les modèles vision-langage-action (VLA) avec un world model pour améliorer l'apprentissage de politiques robotiques. L'architecture repose sur un transformer de diffusion multimodal qui maintient des flux séparés pour chaque modalité (vision et action) tout en permettant un partage de connaissances inter-modal. Techniquement, DUST introduit des perturbations de bruit indépendantes, une perte flow matching découplée pour apprendre les relations causales entre modalités, et une méthode d'échantillonnage asynchrone des tokens action et vision. Sur les benchmarks simulés RoboCasa et GR-1, DUST affiche des gains allant jusqu'à 6 % par rapport aux meilleures références VLA et world-modeling actuelles, avec une amélioration supplémentaire de 2 à 5 % via le scaling à l'inférence. Sur tâches réelles avec le bras Franka Research 3, le système surpasse les baselines de 10 % en taux de succès. Le point critique ici est la gestion du "modality gap" : prédire simultanément des états visuels futurs et des séquences d'actions est un problème ouvert, car les deux modalités ont des structures temporelles et sémantiques très différentes. DUST contourne ce problème en maintenant des flux distincts plutôt qu'en les fusionnant naïvement, ce qui préserve les propriétés propres à chaque modalité. Le gain de 10 % en conditions réelles est notable, mais reste à interpréter avec prudence : les expériences portent sur un seul robot (Franka Research 3) et les tâches réelles ne sont pas détaillées dans l'abstract, ce qui limite la généralisation. La capacité de transfer learning à partir de vidéos sans annotations d'actions ouvre en revanche une voie concrète pour réduire le coût de collecte de données. DUST s'inscrit dans une vague de travaux qui cherchent à doter les VLA d'une forme de "prévoyance" via des world models, en écho à des approches comme GR-1 (Humanoid VLA de Shanghai AI Lab) ou Pi-0 de Physical Intelligence. La tendance lourde est de combiner la puissance des LLM pour le raisonnement avec des modèles prédictifs du monde physique, pour réduire le sim-to-real gap et permettre une généralisation hors distribution. La prochaine étape logique serait de tester DUST sur des morphologies robotiques hétérogènes et des tâches de manipulation longue durée, ce que le joint-training avec des datasets humains et robots suggère comme direction.

RechercheOpinion
1 source

Suivre Robots humanoïdes en continu

Recevez chaque jour les articles essentiels du sujet. Pas de bruit, pas de spam.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic