Une conversation d'agent IA peut sembler parfaite tout en étant défaillante, selon des dirigeants de LangChain, Conviva et CoreWeave à VB Transform 2026
Lors de la conférence VB Transform 2026, trois dirigeants ont détaillé un changement profond dans la manière dont les entreprises évaluent leurs agents d'intelligence artificielle. Harrison Chase, PDG de LangChain, Hui Zhang, directrice technique et cofondatrice de Conviva, et Emmanuel Turlay, directeur ingénierie chez CoreWeave, ont expliqué qu'une conversation isolée avec un agent IA peut sembler parfaite une fois notée individuellement, tout en masquant un produit fondamentalement défaillant. Zhang a illustré ce phénomène avec un exemple concret du secteur retail : un client demande à un agent une chaussure de course avant un semi-marathon, l'agent pose des questions de clarification, puis le client achète une paire. Prise isolément, cette interaction paraît irréprochable. Mais à l'échelle de l'ensemble des utilisateurs, le taux de questions de clarification posées par l'agent pour cette catégorie de produit s'est révélé trois fois supérieur à la normale, et le taux de clients finalisant leur achat en dehors de la conversation cinq fois plus élevé. Aucun de ces deux signaux n'est visible en examinant une seule conversation : ils n'apparaissent qu'en comparant des cohortes d'utilisateurs à une référence, une méthode que Zhang appelle l'analyse contrastive.
Ce constat pousse les entreprises à revoir en profondeur leurs pratiques d'évaluation des agents IA, un enjeu majeur alors que ces systèmes se généralisent dans des fonctions critiques comme le service client ou les ventes. Harrison Chase a mis en garde contre ce qu'il appelle la "paralysie de l'évaluation" : des équipes tellement obsédées par la construction d'un jeu de tests exhaustif avant le lancement qu'elles n'osent jamais déployer leur produit. Pour lui, les critères d'évaluation ne doivent plus être un test ponctuel, mais un cahier des charges vivant, comparable à un document de spécifications produit qui évolue avec l'usage réel. Emmanuel Turlay a partagé une expérience similaire : malgré une couverture de tests proche de 100 %, des bugs continuaient d'apparaître en production. Sa recommandation est d'inverser la logique habituelle, en mettant en place une surveillance large et permanente dès le lancement, puis en identifiant les catégories de défaillances réelles avant de construire des tests ciblés autour de ces problèmes précis. Cette approche a aussi des implications financières : une fois un problème identifié et une solution validée avec le modèle le plus performant disponible, Turlay recommande de réduire progressivement la taille du modèle utilisé pour la surveillance continue, ce qui permet de maîtriser les coûts sans sacrifier la fiabilité.
Ces débats s'inscrivent dans une tension plus large qui traverse toute l'industrie de l'IA générative : celle entre l'automatisation du jugement et la révision humaine. Que l'évaluation soit confiée à un grand modèle de langage ("LLM-as-judge") ou à un autre agent IA ("agent-as-judge"), méthode qui n'a pas remplacé la première malgré son essor, Hui Zhang souligne un dilemme fondamental. Les méthodes automatisées sont facilement duplicables à grande échelle mais restent difficiles à ancrer dans la réalité du terrain, tandis que l'évaluation humaine est fiable mais impossible à généraliser à tous les volumes de trafic. "Toute l'industrie fait face à ce choix entre deux maux", a résumé Zhang. Ces échanges reflètent une maturation du secteur des agents IA, où les premières vagues de déploiement ont révélé que les méthodes de test héritées du développement logiciel classique ne suffisent pas à garantir la fiabilité de systèmes dont le comportement varie selon le contexte conversationnel. La recherche d'un deuxième type de donnée, celle qui capture ce qui se passe avant, entre et après chaque échange avec l'agent, et non plus seulement le contenu de la conversation elle-même, s'annonce comme le prochain chantier structurant pour les entreprises qui déploient ces technologies à grande échelle.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




