DeepAmbigQA : des questions multi-étapes ambiguës pour évaluer la complétude des réponses des LLM
Les modèles de langage (LLM) dotés d'outils de recherche intégrés obtiennent de bons résultats sur les questions-réponses en domaine ouvert, mais peinent à fournir des réponses complètes face à des questions complexes. Un exemple typique cité par les chercheurs à l'origine de ce travail : « Quel acteur du film Heat a remporté au moins un Oscar ? » Répondre correctement exige deux capacités distinctes : distinguer plusieurs films portant le même titre, puis parcourir et croiser les informations concernant un grand nombre d'acteurs pour rassembler toutes les preuves pertinentes. Or les benchmarks existants évaluent rarement ces deux difficultés conjointement. Pour combler ce manque, les auteurs présentent DeepAmbigQAGen, un pipeline de génération automatique de données conçu pour construire des questions à la fois ambiguës et multi-étapes, donnant naissance au jeu de données DeepAmbigQA.
Cette approche cible un angle mort important des évaluations actuelles de LLM. La plupart des benchmarks mesurent la justesse d'une réponse unique, sans vérifier si le modèle a identifié l'ensemble complet des réponses valides lorsque la question s'y prête. Pour les assistants de recherche basés sur des LLM, les outils de veille automatisée ou les moteurs de questions-réponses d'entreprise, cette lacune peut se traduire par des réponses partielles présentées comme exhaustives, un risque particulièrement critique dans des usages où l'exhaustivité compte autant que l'exactitude.
Ce travail s'inscrit dans un mouvement plus large visant à rendre les benchmarks de LLM plus proches des usages réels, où l'ambiguïté et la nécessité de croiser plusieurs sources sont la norme plutôt que l'exception. En automatisant la génération de questions combinant homonymie et raisonnement multi-sauts, les chercheurs ouvrent la voie à une évaluation plus rigoureuse de la complétude des réponses, un critère encore peu exploré face à la course actuelle aux agents de recherche propulsés par des LLM.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




