Aller au contenu principal
RobotiqueVentureBeat AI · 2 min de lecture

À Waymo, un projet d'IA n'est pas prêt tant que ses évaluations ne le sont pas, peu importe la performance du modèle

Source originale ↗·

Voici l'article traduit et résumé :

Waymo, la filiale de conduite autonome d'Alphabet issue de Google, a dépassé les 220 millions de miles parcourus en mode entièrement autonome, sans conducteur humain à bord, avec un taux de blessures graves lors d'accidents 17 fois inférieur à celui des conducteurs humains sur la même distance, selon les chiffres de l'entreprise. Manasi Joshi, directrice de l'ingénierie pour l'intelligence des systèmes et le machine learning chez Waymo, a détaillé lors de la conférence VB Transform 2026 la méthode employée pour entraîner, tester et déployer l'IA à cette échelle. Son principe central, qu'elle appelle le « développement centré sur l'évaluation », consiste à faire de l'évaluation un élément permanent de l'ingénierie plutôt qu'une simple vérification finale avant mise en production. Chez Waymo, la maturité d'un projet se juge d'ailleurs directement à la maturité de ses évaluations : tests menés pendant l'entraînement des modèles, après l'entraînement, puis au sein de simulations en boucle ouverte et en boucle fermée couvrant des milliards de miles synthétiques.

Cette approche a des implications directes pour toute entreprise qui déploie des agents IA, que ce soit pour le service client, l'assistance au code ou la finance : si une organisation ne peut pas mesurer fiablement la performance de son système, elle n'est probablement pas prête à le mettre en production. Joshi insiste sur le fait que l'évaluation ne s'arrête pas au lancement mais doit se poursuivre en continu, à mesure que les modèles sous-jacents, les processus métier, le comportement des utilisateurs et les données évoluent. Elle recommande aussi de lier ces évaluations à des résultats métier concrets plutôt qu'à de simples benchmarks génériques du secteur, et rappelle que la fiabilité d'une mesure de qualité dépend entièrement de la qualité des données d'évaluation utilisées pour l'établir.

Chez Waymo, la sécurité reste l'objectif prioritaire de cette hiérarchie d'évaluation, nourrie par des journaux de conduite propriétaires, certaines données tierces et des simulations réalistes. Des jeux de données et des métriques spécifiques sont choisis pour les situations impliquant des usagers vulnérables, des passages à niveau ou des zones de travaux. Joshi transpose ce principe à toute entreprise : il faut tester non seulement les requêtes courantes que gèrent bien les agents IA, mais aussi les cas rares où une erreur peut coûter cher sur le plan financier, juridique, sécuritaire ou réputationnel. Enfin, Waymo ne laisse jamais la décision finale aux seuls systèmes automatisés : des revues de mise en production impliquent une supervision humaine étendue, et des responsables sécurité internes valident chaque déploiement logiciel et chaque extension de zone de service. « Ce n'est pas piloté par l'IA de façon totalement automatisée, sans aucune supervision humaine », a-t-elle rappelé. « Des vies humaines sont en jeu. »

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Les paris comme méthode d'évaluation des performances sim-to-real
1arXiv cs.RO 

Les paris comme méthode d'évaluation des performances sim-to-real

Une équipe de chercheurs a publié sur arXiv (référence 2604.24018) une nouvelle approche pour évaluer les performances des robots sans multiplier les tests physiques coûteux. Le problème central est bien connu dans le domaine : tester un robot dans le monde réel est lent, onéreux et parfois dangereux, ce qui rend difficile la comparaison d'algorithmes, la validation de contrôleurs ou la prise de décisions réglementaires. Les chercheurs proposent une méthode fondée sur un mécanisme de "pari" (betting) pour estimer avec précision le comportement réel d'un robot à partir de données issues de simulateurs. Ils démontrent notamment son efficacité sur une tâche concrète de préhension et dépose d'objets (pick-and-place) par un bras robotique, en utilisant des distributions synthétiques comme substitut au monde réel. Cette approche présente un intérêt pratique majeur pour l'industrie robotique et les laboratoires de recherche. Contrairement aux méthodes existantes qui tentent soit de réduire la variance statistique (par échantillonnage d'importance), soit de corriger les biais introduits par les simulateurs, le mécanisme de pari proposé peut, sous certaines conditions théoriques démontrées, surpasser l'estimateur Monte Carlo classique. Les chercheurs fournissent également des règles de décision concrètes pour diagnostiquer en temps réel si la stratégie de pari fonctionne comme prévu, ce qui rend la méthode utilisable en pratique et pas seulement en théorie. Le fossé entre simulation et réalité, le fameux "sim-to-real gap", est l'un des obstacles majeurs au déploiement industriel des robots autonomes. Les simulateurs modernes restent imparfaits : ils modélisent mal les contacts, les frottements ou les imprécisions mécaniques, ce qui introduit des biais systématiques dans les évaluations. La plupart des travaux existants cherchent à corriger ces biais après coup ; cette publication propose au contraire de les intégrer dans un cadre probabiliste cohérent dès la conception de l'évaluation. Le code source est disponible sur GitHub (ISUSAIL/Bet4Sim2Real), ce qui facilite la reproduction des résultats et l'adoption par la communauté.

RobotiqueActu
1 source
Genesis AI lance Nyx, Quadrants et Genesis World 1.0, une plateforme physique pour évaluer les modèles de robotique à grande échelle
2MarkTechPost 

Genesis AI lance Nyx, Quadrants et Genesis World 1.0, une plateforme physique pour évaluer les modèles de robotique à grande échelle

Genesis AI a lancé Genesis World 1.0, une plateforme de simulation conçue pour accélérer le développement des modèles de fondation en robotique. La suite se compose de quatre éléments : un moteur physique, Nyx (un moteur de rendu par lancer de rayons en temps réel), Quadrants (un compilateur Python vers GPU), et une interface de simulation. Le problème que tente de résoudre cette plateforme est concret : évaluer une politique robotique sur une centaine de tâches avec plusieurs centaines d'épisodes chacune nécessite normalement plus de 200 heures de fonctionnement continu avec un opérateur humain et un seul robot. Genesis World 1.0 ramène cette même évaluation à moins de 30 minutes, sans intervention humaine ni matériel physique, avec une reproductibilité bit à bit des résultats. C'est un gain d'environ deux ordres de grandeur sur le temps de cycle d'évaluation. Ce bond de performance change fondamentalement la manière dont les équipes de recherche peuvent comparer des variantes de modèles. Jusqu'ici, la lenteur de l'évaluation réelle obligeait à faire des choix brutaux sur le nombre de checkpoints testés, biaisant de facto les décisions de développement. Genesis AI a délibérément choisi d'utiliser la simulation pour l'évaluation avant de l'utiliser pour la génération de données d'entraînement, et ce pour une raison méthodologique précise : si entraînement et évaluation partagent la même distribution simulée, un gain de performance peut simplement refléter une meilleure adaptation au simulateur, et non un progrès réel. L'approche retenue, baptisée "zero-shot real-to-sim", consiste à évaluer en simulation des politiques entraînées exclusivement sur des données réelles. Les résultats de corrélation sont probants : la corrélation de Pearson entre les performances en simulation et sur robot physique atteint 0,8996 (intervalle de confiance à 95 % : [0,7439 ; 0,9314]), calculée sur trois variantes de modèles (Small, Medium, Large), 14 tâches et 200 épisodes par tâche, avec un million d'itérations bootstrap. Le Mean Maximum Rank Violation (MMRV) s'établit à 0,0166, ce qui signifie que le simulateur préserve fidèlement le classement relatif des modèles entre eux. Genesis AI évolue dans un secteur en pleine structuration, où des acteurs comme Google DeepMind, Physical Intelligence ou encore Boston Dynamics investissent massivement dans les modèles de fondation pour la robotique généraliste. La qualité du simulateur est devenue un avantage compétitif direct : Genesis revendique un écart de réalité réduit de 45 % par rapport au meilleur simulateur concurrent, mesuré par le score FID sur leur jeu de données. Pour diagnostiquer précisément les sources de divergence simulation-réalité, l'équipe a construit un banc de test côte à côte permettant de faire fonctionner simultanément le simulateur et un robot physique depuis la même initialisation, en permutant les sources d'observations (caméra, proprioception) pour isoler si les écarts viennent de la physique, du rendu, des communications ou du contrôle. Nyx, le moteur de rendu intégré, vise des images 1080p sans bruit en moins de 4 millisecondes sur un GPU grand public haut de gamme, en s'appuyant sur le lancer de rayons matériel et des splats gaussiens 3D pour les zones où la reconstruction en maillage reste insuffisante.

💬 200 heures d'évaluation robotique ramenées à 30 minutes, c'est pas un gain marginal, c'est un changement de paradigme dans la façon dont on peut itérer sur les modèles. Ce qui m'intéresse surtout, c'est leur choix de séparer les distributions d'entraînement et d'évaluation : simuler les deux ensemble, c'est se mentir à soi-même, et ils l'ont compris. Bon, la corrélation à 0,89 est impressionnante sur le papier, reste à voir si ça tient sur des tâches vraiment hors distribution.

RobotiqueActu
1 source
NVIDIA lance Cosmos 3 : un modèle de fondation à deux tours mêlant raisonnement physique, génération de mondes et d'actions
3MarkTechPost 

NVIDIA lance Cosmos 3 : un modèle de fondation à deux tours mêlant raisonnement physique, génération de mondes et d'actions

NVIDIA a publié Cosmos 3, une nouvelle famille de modèles d'IA fondationnels conçus pour les systèmes d'IA physique, robots, véhicules autonomes et systèmes de surveillance industrielle. La particularité de cette version réside dans son architecture dite Mixture-of-Transformers (MoT) à deux tours, qui réunit pour la première fois dans un seul modèle trois capacités jusqu'ici séparées : le raisonnement physique, la génération de monde (vidéo, images, son) et la génération d'actions. NVIDIA a publié en open source les poids, scripts d'entraînement, outils de déploiement et jeux de données. Deux échelles sont disponibles au lancement : Cosmos3-Nano (16 milliards de paramètres, basé sur Qwen3-VL 8B) pour l'inférence sur GPU workstation comme la RTX PRO 6000, et Cosmos3-Super (64 milliards de paramètres, basé sur Qwen3-VL 32B) pour les datacenters équipés de GPU Hopper ou Blackwell. Des variantes spécialisées accompagnent cette sortie, dont Super Text2Image, Super Image2Video et Nano-Policy-DROID. L'unification de ces trois capacités dans un seul modèle représente un changement structurel pour les équipes qui développent des systèmes robotiques ou de conduite autonome. Jusqu'ici, il fallait orchestrer plusieurs modèles distincts, un pour percevoir, un pour prédire, un pour agir, ce qui multipliait la complexité d'intégration et les points de défaillance. Cosmos 3 propose un flux cohérent : la tour "reasoner" (un VLM autorégressif qui comprend images, vidéos et texte) conditionne la tour "generator" (diffusion pour la vidéo et les actions), l'information circulant dans un seul sens. Les équipes de robotique temps réel peuvent faire tourner le Nano sur du matériel de terrain, tandis que les équipes de R&D génèrent des données synthétiques à grande échelle avec le Super. Sur les benchmarks, Cosmos 3 domine VANTAGE-Bench et le leaderboard TAR (Traffic Anomaly Reasoning) dans leurs catégories respectives. Cette sortie s'inscrit dans la stratégie d'NVIDIA visant à s'imposer comme infrastructure logicielle de l'IA physique, au-delà de la simple vente de GPU. Les versions précédentes de Cosmos fragmentaient les capacités ; Cosmos 3 consolide l'approche autour d'un socle commun initialisé depuis les poids Qwen3-VL de l'écosystème open source. Le modèle gère nativement des entrées texte, image, vidéo et tableaux d'actions JSON, et produit des sorties allant jusqu'à 720p à 24 FPS avec son stéréo AAC 48 kHz, pour une durée maximale d'environ 12,5 secondes. Il supporte une gamme d'embodiments robotiques (caméra, véhicule, bras simple ou double, humanoïde), chacun avec des dimensions d'action fixes. Face à la montée en puissance de Google DeepMind, Boston Dynamics et des startups robotiques chinoises, NVIDIA mise sur l'open source et la verticalisation logicielle pour ancrer son écosystème dans les prochaines années de déploiement d'IA physique.

UELes équipes européennes de robotique et de véhicules autonomes peuvent accéder gratuitement à un modèle de fondation unifié pour l'IA physique, réduisant la complexité d'intégration et les coûts de R&D pour les industriels actifs dans l'automatisation et la mobilité autonome.

💬 Orchestrer trois modèles séparés pour percevoir, prédire et agir, c'était le quotidien douloureux des équipes robotique, et Cosmos 3 règle ça proprement. L'open source complet, poids + scripts + datasets, c'est pas de la comm, NVIDIA construit une base logicielle sur laquelle personne ne pourra se passer d'eux dans 3 ans. Reste à voir si le Nano tient en conditions réelles, parce que sur les benchmarks c'est toujours plus joli qu'en prod.

RobotiqueOpinion
1 source
Cadre cinématique pour évaluer les configurations de pincement en robotique, sans modèle d'objet ni de contact
4arXiv cs.RO 

Cadre cinématique pour évaluer les configurations de pincement en robotique, sans modèle d'objet ni de contact

Des chercheurs ont publié sur arXiv (référence 2604.20692) un cadre d'évaluation cinématique permettant d'analyser les configurations de pincement des mains robotiques sans avoir recours à des modèles d'objets ni à des modèles de force de contact. La méthode repose sur le calcul de l'espace de travail atteignable par chaque bout de doigt à partir des configurations articulaires, puis sur la détection de configurations de pincement réalisables en évaluant les relations géométriques entre les paires de bouts de doigts. Quatre structures cinématiques différentes de main ont été comparées afin d'examiner leur influence sur les configurations de pincement possibles. Pour les concepteurs de mains robotiques, cet apport est concret : il devient possible d'évaluer la dextérité de préhension d'un prototype dès les premières phases de conception, sans avoir à modéliser les objets à saisir ni à simuler les forces de contact. Ces étapes, traditionnellement coûteuses en temps de calcul et en données, constituaient un frein majeur à l'itération rapide sur les designs. En permettant une évaluation fondée uniquement sur la structure cinématique de la main, le framework ouvre la voie à des cycles de développement plus courts et à une comparaison objective entre différentes architectures mécaniques. La robotique de manipulation traverse une période d'intense compétition, portée par l'essor des robots humanoïdes et des bras industriels autonomes. Les mains robotiques dotées d'une dextérité fine restent l'un des grands défis non résolus du secteur, que ce soit pour des usages industriels ou médicaux. Les méthodes d'évaluation existantes supposent généralement que l'objet à manipuler est connu à l'avance, ce qui les rend peu utiles lors des premières étapes de conception matérielle. Ce travail s'inscrit dans un courant de recherche visant à abstraire l'évaluation de la dextérité, et pourrait à terme être intégré dans des outils de conception assistée par ordinateur pour accélérer le développement de nouvelles générations de mains robotiques polyvalentes.

RobotiqueActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic