À Waymo, un projet d'IA n'est pas prêt tant que ses évaluations ne le sont pas, peu importe la performance du modèle
Voici l'article traduit et résumé :
Waymo, la filiale de conduite autonome d'Alphabet issue de Google, a dépassé les 220 millions de miles parcourus en mode entièrement autonome, sans conducteur humain à bord, avec un taux de blessures graves lors d'accidents 17 fois inférieur à celui des conducteurs humains sur la même distance, selon les chiffres de l'entreprise. Manasi Joshi, directrice de l'ingénierie pour l'intelligence des systèmes et le machine learning chez Waymo, a détaillé lors de la conférence VB Transform 2026 la méthode employée pour entraîner, tester et déployer l'IA à cette échelle. Son principe central, qu'elle appelle le « développement centré sur l'évaluation », consiste à faire de l'évaluation un élément permanent de l'ingénierie plutôt qu'une simple vérification finale avant mise en production. Chez Waymo, la maturité d'un projet se juge d'ailleurs directement à la maturité de ses évaluations : tests menés pendant l'entraînement des modèles, après l'entraînement, puis au sein de simulations en boucle ouverte et en boucle fermée couvrant des milliards de miles synthétiques.
Cette approche a des implications directes pour toute entreprise qui déploie des agents IA, que ce soit pour le service client, l'assistance au code ou la finance : si une organisation ne peut pas mesurer fiablement la performance de son système, elle n'est probablement pas prête à le mettre en production. Joshi insiste sur le fait que l'évaluation ne s'arrête pas au lancement mais doit se poursuivre en continu, à mesure que les modèles sous-jacents, les processus métier, le comportement des utilisateurs et les données évoluent. Elle recommande aussi de lier ces évaluations à des résultats métier concrets plutôt qu'à de simples benchmarks génériques du secteur, et rappelle que la fiabilité d'une mesure de qualité dépend entièrement de la qualité des données d'évaluation utilisées pour l'établir.
Chez Waymo, la sécurité reste l'objectif prioritaire de cette hiérarchie d'évaluation, nourrie par des journaux de conduite propriétaires, certaines données tierces et des simulations réalistes. Des jeux de données et des métriques spécifiques sont choisis pour les situations impliquant des usagers vulnérables, des passages à niveau ou des zones de travaux. Joshi transpose ce principe à toute entreprise : il faut tester non seulement les requêtes courantes que gèrent bien les agents IA, mais aussi les cas rares où une erreur peut coûter cher sur le plan financier, juridique, sécuritaire ou réputationnel. Enfin, Waymo ne laisse jamais la décision finale aux seuls systèmes automatisés : des revues de mise en production impliquent une supervision humaine étendue, et des responsables sécurité internes valident chaque déploiement logiciel et chaque extension de zone de service. « Ce n'est pas piloté par l'IA de façon totalement automatisée, sans aucune supervision humaine », a-t-elle rappelé. « Des vies humaines sont en jeu. »
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




