Aller au contenu principal
Recherche · Paper ·

Keenable AI publie NEEDLE en open source : un benchmark de recherche mis à jour chaque heure

Keenable AI a publié en open source NEEDLE, un benchmark d'évaluation des API de recherche web conçu pour rester "vivant" plutôt que figé. Le problème que ce projet cherche à résoudre est simple à énoncer: si un agent de recherche dispose d'un outil de récupération de pages et que les réponses attendues figurent dans un jeu de données public, il peut aller chercher directement la bonne réponse pendant l'évaluation au lieu de démontrer une vraie capacité de recherche, ou pire, connaître déjà la réponse grâce à sa mémoire paramétrique. NEEDLE régénère donc ses requêtes automatiquement: toutes les heures pour les requêtes d'actualité, à partir d'environ 124 flux RSS et de Google Trends, et quotidiennement pour les requêtes financières, académiques, juridiques et rares, puisées dans les données XBRL de la SEC, Wikidata, GLEIF, arXiv, Europe PMC, CourtListener et des journaux d'agents publics comme DeepResearchGym, OpenResearcher et LRAT. Quinze API de recherche sont testées avec le même protocole et notées par rapport à "ultimate", un moteur oracle qui agrège les résultats de tous les moteurs testés. L'outil est distribué comme une simple ligne de commande Python, installée via uv sync et pilotée par deux sous-commandes, generate et run; il nécessite une clé OpenRouter pour le jugement et une clé par moteur testé, et tourne aussi bien sur un ordinateur portable qu'en intégration continue.

3 min de lecturePertinence 53

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

L'intérêt de NEEDLE est de séparer deux problèmes que les classements habituels confondent: un mauvais score peut venir d'un moteur qui classe mal des résultats pourtant disponibles, ou d'un marché entier incapable de retrouver la bonne information, même en cumulant tous les fournisseurs. Cette distinction compte directement pour les entreprises qui construisent des agents IA reposant sur la recherche web, car elle permet de choisir un fournisseur sur des critères de qualité réelle plutôt que sur des annonces marketing. Les premiers résultats publiés, moyennés sur sept jours jusqu'au 28 août 2026, montrent une hiérarchie nette: en finance, le sujet est presque résolu, avec Exa à 0,910, Keenable à 0,872, Perplexity à 0,871 et Google à 0,847, pour un plafond oracle de 0,965. En recherche académique, l'écart est bien plus large, de 0,310 pour Tavily à 0,774 pour Keenable, pour un plafond de 0,869, l'explication tenant au fait que les requêtes basées sur un titre sont plus faciles que celles portant sur le contenu d'un article. La catégorie la plus difficile, celle des entités rares qui ressemble le plus au trafic réel des agents IA, place Exa en tête avec seulement 55,7 % du score oracle atteint.

Ce projet s'inscrit dans la montée en puissance des agents de recherche autonomes et des API spécialisées pour modèles de langage, un marché où évoluent notamment Exa, Perplexity, Google, Tavily et Keenable elle-même. À mesure que ces agents gagnent en autonomie et en accès direct aux données, les benchmarks classiques deviennent vulnérables à la contamination, ce qui pousse les concepteurs d'évaluations à privilégier des sources publiques renouvelées en continu plutôt que des jeux de données statiques. En rendant son code et ses flux de requêtes reproductibles, Keenable AI ouvre la voie à une comparaison continue et vérifiable des moteurs de recherche destinés aux agents IA, et met en évidence une marge de progression importante, en particulier sur les requêtes rares et les cas d'usage réels, là où les besoins des futurs agents autonomes se feront le plus sentir.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

NEEDLE, c'est le genre de truc qu'on attendait depuis 2 ans : un benchmark qui se régénère toutes les heures au lieu de figer un jeu de données que tout le monde finit par mémoriser. La vraie info est dans les chiffres, pas dans le concept : sur les requêtes rares, qui ressemblent le plus au trafic réel d'un agent IA, le meilleur moteur (Exa) ne récupère que 55,7% de ce qu'un oracle cumulant tous les fournisseurs trouverait, ce qui montre que le marché de la recherche pour agents IA est encore loin d'être mûr. La finance est quasi résolue, l'académique et le rare restent des trous béants, retiens surtout ça avant de choisir un fournisseur sur une plaquette marketing.

À lire ensuite

01OpenAI publie LifeSciBench, un benchmark de 750 tâches pour évaluer les modèles d'IA sur la recherche en sciences du vivant45MarkTechPostRecherche 02Perplexity AI publie WANDR, un benchmark ouvert pour évaluer les agents de recherche capables d'explorer largement et en profondeur35MarkTechPostRecherche 03Meta AI publie NeuralBench : un framework open source pour évaluer les modèles NeuroIA sur 36 tâches EEG et 94 jeux de données46MarkTechPostRecherche 
Dossier · Agents IASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.