Aller au contenu principal
Une conversation d'agent IA peut sembler parfaite tout en étant défaillante, selon des dirigeants de LangChain, Conviva et CoreWeave à VB Transform 2026
OutilsVentureBeat AI · 3 min de lecture

Une conversation d'agent IA peut sembler parfaite tout en étant défaillante, selon des dirigeants de LangChain, Conviva et CoreWeave à VB Transform 2026

Source originale ↗·

Lors de la conférence VB Transform 2026, trois dirigeants ont détaillé un changement profond dans la manière dont les entreprises évaluent leurs agents d'intelligence artificielle. Harrison Chase, PDG de LangChain, Hui Zhang, directrice technique et cofondatrice de Conviva, et Emmanuel Turlay, directeur ingénierie chez CoreWeave, ont expliqué qu'une conversation isolée avec un agent IA peut sembler parfaite une fois notée individuellement, tout en masquant un produit fondamentalement défaillant. Zhang a illustré ce phénomène avec un exemple concret du secteur retail : un client demande à un agent une chaussure de course avant un semi-marathon, l'agent pose des questions de clarification, puis le client achète une paire. Prise isolément, cette interaction paraît irréprochable. Mais à l'échelle de l'ensemble des utilisateurs, le taux de questions de clarification posées par l'agent pour cette catégorie de produit s'est révélé trois fois supérieur à la normale, et le taux de clients finalisant leur achat en dehors de la conversation cinq fois plus élevé. Aucun de ces deux signaux n'est visible en examinant une seule conversation : ils n'apparaissent qu'en comparant des cohortes d'utilisateurs à une référence, une méthode que Zhang appelle l'analyse contrastive.

Ce constat pousse les entreprises à revoir en profondeur leurs pratiques d'évaluation des agents IA, un enjeu majeur alors que ces systèmes se généralisent dans des fonctions critiques comme le service client ou les ventes. Harrison Chase a mis en garde contre ce qu'il appelle la "paralysie de l'évaluation" : des équipes tellement obsédées par la construction d'un jeu de tests exhaustif avant le lancement qu'elles n'osent jamais déployer leur produit. Pour lui, les critères d'évaluation ne doivent plus être un test ponctuel, mais un cahier des charges vivant, comparable à un document de spécifications produit qui évolue avec l'usage réel. Emmanuel Turlay a partagé une expérience similaire : malgré une couverture de tests proche de 100 %, des bugs continuaient d'apparaître en production. Sa recommandation est d'inverser la logique habituelle, en mettant en place une surveillance large et permanente dès le lancement, puis en identifiant les catégories de défaillances réelles avant de construire des tests ciblés autour de ces problèmes précis. Cette approche a aussi des implications financières : une fois un problème identifié et une solution validée avec le modèle le plus performant disponible, Turlay recommande de réduire progressivement la taille du modèle utilisé pour la surveillance continue, ce qui permet de maîtriser les coûts sans sacrifier la fiabilité.

Ces débats s'inscrivent dans une tension plus large qui traverse toute l'industrie de l'IA générative : celle entre l'automatisation du jugement et la révision humaine. Que l'évaluation soit confiée à un grand modèle de langage ("LLM-as-judge") ou à un autre agent IA ("agent-as-judge"), méthode qui n'a pas remplacé la première malgré son essor, Hui Zhang souligne un dilemme fondamental. Les méthodes automatisées sont facilement duplicables à grande échelle mais restent difficiles à ancrer dans la réalité du terrain, tandis que l'évaluation humaine est fiable mais impossible à généraliser à tous les volumes de trafic. "Toute l'industrie fait face à ce choix entre deux maux", a résumé Zhang. Ces échanges reflètent une maturation du secteur des agents IA, où les premières vagues de déploiement ont révélé que les méthodes de test héritées du développement logiciel classique ne suffisent pas à garantir la fiabilité de systèmes dont le comportement varie selon le contexte conversationnel. La recherche d'un deuxième type de donnée, celle qui capture ce qui se passe avant, entre et après chaque échange avec l'agent, et non plus seulement le contenu de la conversation elle-même, s'annonce comme le prochain chantier structurant pour les entreprises qui déploient ces technologies à grande échelle.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

AWS et Workato veulent faire passer les agents IA de la conversation à l’action
1Le Big Data 

AWS et Workato veulent faire passer les agents IA de la conversation à l’action

AWS et Workato viennent de renforcer leur partenariat autour d'Enterprise MCP, une offre conçue pour permettre aux agents IA d'exécuter de véritables actions en entreprise plutôt que de se limiter à générer du texte. Concrètement, les deux sociétés combinent la plateforme d'intégration WorkatoONE, qui centralise plus de 14 000 systèmes d'entreprise, avec les services d'IA d'AWS, notamment Amazon Bedrock, Amazon SageMaker et AWS Lambda. Cette architecture s'appuie sur le Model Context Protocol (MCP), un standard qui simplifie la connexion entre les modèles d'IA et les outils métiers, en évitant les développements sur mesure jusqu'ici nécessaires pour relier un agent à plusieurs applications. Workato a par ailleurs obtenu la spécialisation AWS AI Competency dans la catégorie des outils d'IA agentique, une reconnaissance qui vise les systèmes capables de planifier, raisonner et exécuter de manière autonome des tâches complexes en plusieurs étapes. Les deux partenaires citent déjà des cas d'usage dans la finance, l'informatique, les ventes, les ressources humaines et l'expérience client. L'enjeu dépasse la simple prouesse technique. Jusqu'à présent, les agents conversationnels savaient répondre à des questions ou rédiger du contenu, mais restaient impuissants dès qu'il fallait interagir avec des systèmes fragmentés, bases de données, logiciels métiers, processus internes, sans créer de failles de sécurité ni perdre le contrôle sur ce que l'agent est autorisé à faire. Enterprise MCP cherche justement à donner davantage d'autonomie aux agents tout en maintenant des garde-fous stricts sur les données consultables et les actions déclenchables. Pour les entreprises, cela signifie la possibilité de déléguer des tâches réelles, par exemple à une équipe financière qui a besoin qu'un agent consulte plusieurs systèmes, analyse un contexte métier puis déclenche une opération, sans multiplier les développements d'intégration coûteux et risqués en matière de gouvernance. Cette initiative s'inscrit dans un mouvement plus large où les pilotes d'IA générative, après avoir démontré la capacité des modèles à produire du contenu, peinent encore à prouver un retour sur investissement tangible faute de passage à l'action concrète. En misant sur l'orchestration de Workato et l'infrastructure d'AWS, les deux groupes espèrent transformer les agents IA en véritables exécutants capables d'intervenir dans les opérations quotidiennes des organisations. Reste à voir si cette approche convaincra les entreprises encore prudentes face aux risques opérationnels et de sécurité que soulève l'autonomisation croissante de ces systèmes.

💬 MCP standardisé sur 14 000 connecteurs, ça change la donne : le vrai coût des agents IA en entreprise, ça n'a jamais été le modèle, c'est l'intégration. AWS et Workato attaquent enfin ce chantier-là plutôt que de sortir un énième LLM plus malin. Reste que donner à un agent le droit de déclencher des actions dans des systèmes critiques, c'est un pari sur la gouvernance autant que sur la technique, et ça, MCP ne le résout pas tout seul.

OutilsOutil
1 source
Comment l’IA transforme la gestion de chantier en 2026 ?
2Le Big Data 

Comment l’IA transforme la gestion de chantier en 2026 ?

Moins de 10 % des entreprises du bâtiment utilisent aujourd'hui l'intelligence artificielle dans leur gestion opérationnelle, mais 70 % prévoient de franchir le pas dans les prochains mois, soit 15 points de plus qu'il y a un an selon le baromètre Orisha Construction. Le marché mondial de l'IA appliquée à la construction devrait atteindre 4,5 milliards de dollars en 2026. Concrètement, six applications transforment déjà le quotidien des professionnels : la génération automatique de devis, la prédiction des retards, l'optimisation de planning, l'analyse de photos par vision par ordinateur, les chatbots clients pour artisans, et la détection d'anomalies de sécurité. Sur le seul volet du chiffrage, un artisan qui dictait vocalement ses paramètres peut aujourd'hui obtenir un devis structuré en 45 minutes au lieu de quatre heures, avec des relances automatisées (email J+3, SMS J+7, appel J+14) qui font passer le taux de transformation de 15 à 30 %. Les solutions SaaS concernées démarrent entre 150 et 250 euros par mois pour un indépendant, avec un retour sur investissement atteint en trois à quatre mois. L'impact dépasse la simple productivité administrative. En croisant données météo, disponibilité des ressources et historiques de sinistres, les algorithmes de prédiction permettent d'identifier une rupture d'approvisionnement trois semaines à l'avance, laissant le temps de mobiliser un fournisseur alternatif sans perdre un seul jour de chantier. McKinsey et Orisha estiment que cette approche réduit de 15 à 25 % les coûts liés aux erreurs, reprises et retards. Sur le terrain, des drones et caméras fixes capturent quotidiennement l'avancement réel, que l'IA quantifie sans relevé manuel. Les équipements de protection individuelle non portés sont détectés instantanément sur les images, réduisant les risques d'accidents et les responsabilités juridiques. Pour les artisans, un chatbot répond aux demandes de devis en dehors des heures ouvrées, supprimant les pertes de contrats par manque de réactivité. Le paradoxe du secteur est bien connu : la construction affiche une productivité qui progresse d'à peine 1 % par an depuis des décennies, malgré une pression croissante liée à la volatilité des prix des matériaux, la pénurie de compagnons qualifiés et une réglementation de plus en plus dense. C'est précisément cette accumulation de contraintes qui pousse les acteurs à chercher des gains opérationnels rapides et mesurables, plutôt que des transformations structurelles longues. Des éditeurs comme Trustup Pro intègrent déjà plusieurs de ces briques dans des logiciels de suivi de chantier tout-en-un. La prochaine étape, déjà en cours dans les grandes entreprises, est l'interconnexion de ces outils avec les ERP et les plateformes de sous-traitance, pour que le conducteur de travaux dispose d'un tableau de bord prédictif unifié plutôt que d'une série d'alertes isolées.

UELe secteur du bâtiment français est directement visé, avec des éditeurs tricolores comme Orisha Construction et Trustup Pro qui commercialisent déjà ces briques IA à destination des artisans et conducteurs de travaux.

💬 Le bâtiment stagne à +1 % de productivité par an depuis trente ans, et d'un coup 70 % des boîtes seraient prêtes à basculer. Ce chiffre vient d'un éditeur qui vend ces solutions, garde ça en tête. Mais les cas d'usage tiennent la route : 45 minutes pour un devis au lieu de 4 heures, ROI à 3 mois pour 150 euros par mois, c'est le genre de gain mesurable qui convainc un artisan, pas un DSI.

OutilsOutil
1 source
☕️ Alexa+, l’agent conversationnel d’Amazon, peut désormais générer des podcasts par IA
3Next INpact 

☕️ Alexa+, l’agent conversationnel d’Amazon, peut désormais générer des podcasts par IA

Amazon a annoncé une nouvelle fonctionnalité pour Alexa+, son assistant conversationnel dopé à l'intelligence artificielle : la génération de podcasts à la demande, disponible dès maintenant pour les utilisateurs basés aux États-Unis. L'agent peut produire en quelques minutes un épisode audio complet sur n'importe quel sujet, sans qu'il soit nécessaire de fournir des documents ou de préparer quoi que ce soit. Le format reprend le modèle popularisé par Google NotebookLM, avec une conversation simulée entre deux co-animateurs de synthèse. Pour alimenter ces productions, Amazon s'appuie sur des partenariats avec plus de 200 sources d'actualité, dont Associated Press, Reuters, le Washington Post, TIME, Forbes, Business Insider, Politico, USA Today, des publications de Condé Nast, Hearst et Vox, ainsi que plus de 200 journaux locaux américains. La fonctionnalité est incluse sans surcoût pour les abonnés Amazon Prime ; les non-membres peuvent y accéder pour 19,99 dollars par mois. Cette capacité marque un tournant dans la manière dont les assistants vocaux peuvent traiter et restituer l'information. Jusqu'ici cantonnée aux réponses factuelles et aux tâches utilitaires, Alexa+ entre dans le registre du contenu éditorial long-format, personnalisé en temps réel selon les intérêts de l'utilisateur. Les cas d'usage annoncés sont variés : actualité, loisirs, préparation de voyages, reconversion professionnelle, approfondissement de sujets scolaires. Pour les médias partenaires, l'accord représente une nouvelle forme de distribution, bien que les montants financiers n'aient pas été divulgués. Pour les utilisateurs, c'est une façon de consommer de l'information dense sans effort de recherche, à la manière d'un briefing audio personnalisé. Cette annonce s'inscrit dans une dynamique plus large d'intégration de l'IA générative dans les assistants grand public, accélérée depuis l'émergence des grands modèles de langage. Amazon, qui reconnaît qu'Alexa a déjà répondu à des dizaines de milliards de questions, cherche à transformer son assistant en véritable agent capable de produire du contenu original et contextualisé, et non plus seulement de réciter des informations. La référence directe à NotebookLM de Google n'est pas anodine : elle signale une compétition frontale sur le segment des outils d'apprentissage et d'information audio générés par IA. La question des droits des éditeurs reste cependant en suspens, les termes financiers des partenariats n'étant pas communiqués, dans un contexte où les négociations entre médias et plateformes d'IA font l'objet de tensions croissantes à l'échelle mondiale.

UELa fonctionnalité est exclusivement disponible aux États-Unis, sans impact direct pour les utilisateurs ou éditeurs français, bien que les tensions croissantes sur les droits éditoriaux dans les partenariats IA-médias constituent un enjeu parallèle en Europe.

OutilsOutil
1 source
ChatGPT peut désormais écouter et parler en même temps, rendant les conversations avec l'IA plus naturelles
4The Decoder 

ChatGPT peut désormais écouter et parler en même temps, rendant les conversations avec l'IA plus naturelles

ChatGPT peut désormais écouter et parler en même temps grâce à GPT-Live, une nouvelle architecture full-duplex développée par OpenAI. Concrètement, l'assistant vocal n'a plus besoin d'attendre la fin de la phrase de l'utilisateur pour commencer à répondre, ce qui rend les échanges beaucoup plus fluides. Pour les questions complexes, le système bascule discrètement en arrière-plan vers GPT-5.5, un modèle plus puissant, avant de restituer la réponse à l'oral. GPT-Live-1, la version complète, est déjà disponible pour les abonnés payants de ChatGPT, tandis qu'une version allégée, GPT-Live-1-mini, équipe les comptes gratuits. L'accès via l'API doit suivre dans les prochaines semaines. Cette avancée technique change concrètement la nature des interactions vocales avec l'IA. Jusqu'ici, les assistants conversationnels fonctionnaient sur un mode séquentiel rigide : l'utilisateur parle, puis attend, puis l'IA répond. Avec le full-duplex, les interruptions, hésitations et reformulations en cours de phrase deviennent possibles, comme dans une vraie conversation humaine. Pour les usages professionnels comme l'assistance client ou la dictée assistée, cela réduit la friction et améliore l'expérience perçue, un facteur clé alors que les entreprises cherchent à déployer des agents vocaux plus naturels. Cette évolution s'inscrit dans la course entre grands acteurs de l'IA générative pour rendre les interfaces vocales indiscernables d'une conversation humaine, un terrain où Google et son assistant Gemini, ainsi que d'autres concurrents, investissent également massivement. Le choix d'OpenAI de combiner un modèle léger pour la fluidité conversationnelle et un modèle lourd, GPT-5.5, pour la profondeur de raisonnement illustre une stratégie d'architecture hybride qui pourrait s'imposer comme standard. Reste à voir comment cette technologie se comportera à grande échelle une fois ouverte aux développeurs via l'API, et si la latence promise tiendra ses promesses en conditions réelles d'usage.

OutilsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic