Aller au contenu principal
Au-delà de la similarité sémantique: Introduction du pipeline d'acquisition généralisable d'Agencer NVIDIA NeMo
RechercheHuggingFace Blog · 1 min de lecture

Au-delà de la similarité sémantique: Introduction du pipeline d'acquisition généralisable d'Agencer NVIDIA NeMo

Source originale ↗·

NVIDIA franchit une nouvelle étape dans le domaine de la recherche d'informations avec son système NeMo Retriever, qui dépasse les approches traditionnelles basées sur la simple similarité sémantique. Plutôt que de se contenter de comparer des vecteurs d'embeddings, ce nouveau système introduit un pipeline dit "d'agir-recherche généralisable" (agentic retrieval), capable d'adapter dynamiquement sa stratégie d'interrogation selon la nature de la tâche.

L'enjeu est considérable pour les entreprises qui déploient des systèmes RAG (Retrieval-Augmented Generation) à grande échelle. Les pipelines classiques peinent à maintenir une précision élevée sur des bases documentaires volumineuses ou hétérogènes, là où les requêtes nécessitent plusieurs étapes de raisonnement. En intégrant une logique d'agent dans le processus de récupération, NeMo Retriever entend répondre à ce point de défaillance fréquent des architectures IA en production.

Le système repose sur l'idée que la recherche d'information ne doit pas être une opération unique et statique, mais un processus itératif où l'agent reformule, affine et enchaîne les requêtes jusqu'à atteindre le résultat optimal. Cette approche améliore la précision des résultats sur des tâches complexes impliquant de grandes bases de données textuelles, selon NVIDIA, qui positionne cette innovation dans sa suite d'outils destinés aux développeurs d'applications IA d'entreprise.

La généralisation de tels pipelines agentiques dans les infrastructures RAG représente une tendance de fond pour 2026 : après l'engouement pour les embeddings, l'industrie se tourne vers des architectures plus dynamiques où la récupération de contexte devient elle-même un processus intelligent, réduisant les hallucinations et augmentant la fiabilité des modèles en conditions réelles.

Impact France/UE

L'innovation d'NVIDIA NeMo Retriever, avec son pipeline d'acquisition généralisable, améliore significativement l'efficacité de recherche dans les grandes bases de données textuelles, potentiellement bénéficiant à des entreprises européennes comme SAP ou OVHcloud, qui gèrent et analysent de vastes quantités de données.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

« IA sans environnement : génération de données synthétiques pour agents d'appel API »
1Apple Machine Learning 

« IA sans environnement : génération de données synthétiques pour agents d'appel API »

L'entraînement d'agents basés sur des grands modèles de langage (LLM) capables d'appeler des API nécessite d'énormes volumes de trajectoires d'interaction de haute qualité. Jusqu'à présent, la collecte de ces données à grande échelle imposait de disposer d'environnements entièrement fonctionnels, avec des API exécutables et des bases de données backend réalistes et pré-remplies, un obstacle majeur qui limitait fortement la scalabilité du processus. Pour contourner cette contrainte, une équipe de recherche propose une nouvelle approche de génération de données synthétiques ne nécessitant aucun environnement réel, en exploitant les LLM eux-mêmes comme des modèles du monde numérique générés à la volée. En ne partant que des spécifications des API, sans backend ni base de données préexistante, la méthode produit des trajectoires simulant fidèlement les interactions entre un agent et un environnement à état, c'est-à-dire un système qui évolue et garde en mémoire les effets des actions précédentes. Cette avancée change potentiellement la donne pour le développement d'agents IA capables d'utiliser des outils et des API externes, une capacité de plus en plus centrale dans les architectures d'agents autonomes. En supprimant le besoin de construire et maintenir des environnements de test complexes et coûteux, cette méthode pourrait considérablement réduire le temps et les ressources nécessaires pour entraîner de tels agents, tout en permettant de générer des données d'entraînement plus diversifiées et à moindre coût. Pour les équipes de recherche et les entreprises qui développent des assistants IA orientés action, cela représente un gain potentiel important en termes de rapidité de développement et de couverture des cas d'usage. Le goulot d'étranglement identifié par les auteurs, la nécessité de bases de données backend réalistes pour chaque scénario testé, est un frein connu dans le domaine de l'entraînement d'agents IA, où la qualité des données d'apprentissage détermine directement la fiabilité des systèmes déployés en production. Cette approche s'inscrit dans une tendance plus large consistant à utiliser les LLM non seulement comme agents mais aussi comme simulateurs de leur propre environnement d'entraînement, une piste qui pourrait s'étendre à d'autres domaines nécessitant des données d'interaction complexes, comme la navigation web ou l'automatisation de tâches multi-étapes.

RecherchePaper
1 source
L'ajustement fin du RAG peut réduire silencieusement la précision de récupération de 40 %, mettant les pipelines à base d'agents en danger
2VentureBeat AI 

L'ajustement fin du RAG peut réduire silencieusement la précision de récupération de 40 %, mettant les pipelines à base d'agents en danger

Des chercheurs de Redis ont publié une étude révélant qu'affiner les modèles d'embeddings pour améliorer la précision d'un système RAG peut réduire silencieusement la qualité de récupération générale jusqu'à 40 %. Le papier, intitulé "Training for Compositional Sensitivity Reduces Dense Retrieval Generalization", a été conduit par Srijith Rajamohan, responsable de la recherche en IA chez Redis, et ses coauteurs. L'équipe a testé ce qui se produit lorsqu'on entraîne un modèle d'embedding à détecter des phrases quasi-identiques mais de sens opposé, par exemple une négation qui inverse complètement la signification d'une phrase. Résultat : cette sensibilité compositionnelle améliore effectivement la précision ciblée, mais détruit la capacité du modèle à récupérer correctement des documents sur des sujets variés qu'il n'a pas appris à traiter spécifiquement. La dégradation atteint 8 à 9 % sur les petits modèles, et jusqu'à 40 % sur un modèle d'embedding de taille intermédiaire actuellement utilisé en production dans de nombreuses entreprises. Les conséquences sont particulièrement sévères pour les pipelines agentiques, où une erreur de récupération ne renvoie pas seulement une mauvaise réponse mais déclenche une cascade d'actions incorrectes en aval. Rajamohan résume le problème central : une forte similarité sémantique ne garantit pas une correspondance exacte d'intention. Les modèles d'embeddings compressent une phrase entière en un seul point dans un espace vectoriel à haute dimension, ce qui fonctionne bien pour la correspondance thématique large, mais échoue quand deux phrases aux mots presque identiques ont des significations opposées. En affinant le modèle pour éloigner ces phrases structurellement différentes, on lui retire l'espace vectoriel qu'il utilisait pour la récupération générale. Les deux objectifs se disputent les mêmes dimensions. L'étude note également que certaines erreurs, notamment les confusions de liaisons grammaticales (quel modificateur s'applique à quel mot dans un contrat, par exemple), ne s'améliorent presque pas avec cet entraînement ciblé, précisément là où une erreur coûte le plus cher. Ce qui rend le problème difficile à diagnostiquer, c'est que les métriques d'évaluation mesurent uniquement la tâche entraînée, pas la régression sur la récupération générale. Elle n'apparaît qu'en production. Les solutions habituelles, comme la recherche hybride combinant embeddings et mots-clés, ou le passage à un modèle plus grand, ne règlent pas le problème architectural sous-jacent. Rajamohan est explicite : "On ne peut pas s'en sortir par la taille." La recherche suggère que les équipes enterprise doivent choisir explicitement entre précision compositionnelle et généralisation large, plutôt que d'optimiser pour l'une en ignorant l'impact sur l'autre. L'enjeu dépasse le seul RAG classique, car les architectures agentiques qui prolifèrent en 2025 et 2026 amplifient chaque erreur de récupération en décision opérationnelle.

UELes entreprises européennes déployant des pipelines RAG agentiques en production sont exposées à ce risque de dégradation silencieuse et doivent revoir leur stratégie d'évaluation des embeddings.

RecherchePaper
1 source
L'IA aide les scientifiques à concevoir la prochaine génération de médicaments
3MIT Technology Review 

L'IA aide les scientifiques à concevoir la prochaine génération de médicaments

AstraZeneca généralise l'intelligence artificielle à l'ensemble de son processus de conception de médicaments biologiques, ces thérapies fabriquées à partir de protéines modifiées plutôt que par synthèse chimique, utilisées pour traiter la plupart des maladies aiguës et chroniques majeures. Puja Sapra, vice-présidente senior et responsable de l'ingénierie biologique en R&D et de la découverte de cibles en oncologie chez AstraZeneca, explique que chaque étape du travail scientifique, de la conception à l'analyse en passant par la fabrication et les tests, est désormais assistée par le calcul informatique. Le laboratoire suit une boucle dite « construire, mesurer, apprendre » : des algorithmes génèrent ou classent des molécules candidates par ordre de probabilité de succès, ce qui permet aux chercheurs de concentrer leurs ressources de laboratoire uniquement sur les candidats les mieux notés. Selon une estimation du cabinet McKinsey, l'IA générative combinée à d'autres outils computationnels pourrait réduire les délais de découverte de médicaments de jusqu'à 50 %. Cette approche change concrètement la donne pour l'industrie pharmaceutique, où le développement d'un nouveau médicament prend habituellement plusieurs années et représente un investissement considérable, avec un taux d'échec très élevé parmi les candidats explorés. En réduisant les cycles d'essai-erreur et en resserrant la boucle de rétroaction entre conception et test en laboratoire, l'IA permet à AstraZeneca de s'attaquer à des cibles thérapeutiques longtemps jugées inatteignables, ce que Sapra résume par la formule « rendre médicamentable ce qui ne l'était pas ». Au-delà du gain de temps, ces outils ouvrent la voie à une nouvelle génération de biomédicaments capables de viser simultanément plusieurs cibles biologiques ou de délivrer un traitement de façon précise vers des cellules spécifiques, alors que les biologiques traditionnels ne visaient généralement qu'une seule voie pathologique à la fois. Pour les patients, cela représente un potentiel thérapeutique significatif dans des maladies jusque-là difficiles à traiter. Cette transformation s'appuie sur ce que Sapra appelle un véritable « fossé de données » : la qualité de tout modèle d'IA dépend directement de la richesse des données biologiques utilisées pour l'entraîner. Chaque expérience en laboratoire, qu'elle réussisse ou échoue, génère un signal exploitable. AstraZeneca dit avoir constitué un portefeuille de données propriétaires et multimodales couvrant plusieurs aires thérapeutiques et types de médicaments, incluant structures moléculaires, mesures de liaison, profils de sécurité et résultats de fabrication, afin d'affiner des modèles d'IA de pointe avec des jeux d'entraînement plus riches et représentatifs. L'entreprise a également investi dans des technologies de criblage approfondi pour produire, en volume, les données nécessaires à la validation continue de ses modèles, une stratégie qui s'inscrit dans la course plus large de l'industrie pharmaceutique vers ce que certains décrivent comme un moteur de découverte scientifique autonome.

UEAstraZeneca, groupe pharmaceutique anglo-suédois disposant d'importantes activités de R&D en Europe, illustre une tendance qui pourrait renforcer la compétitivité de l'industrie pharmaceutique européenne dans la course mondiale à l'IA appliquée à la découverte de médicaments.

RechercheActu
1 source
M²-VLA : améliorer les VLA pour la manipulation robotique généraliste par mélange de couches et méta-compétences
4arXiv cs.RO 

M²-VLA : améliorer les VLA pour la manipulation robotique généraliste par mélange de couches et méta-compétences

Une équipe de chercheurs vient de publier sur arXiv (référence 2604.24182) un nouveau système baptisé M²-VLA, conçu pour améliorer la polyvalence des robots guidés par des modèles vision-langage-action. Contrairement à l'approche dominante qui consiste à affiner intégralement ces modèles sur des tâches robotiques spécifiques, M²-VLA exploite directement un grand modèle vision-langage (VLM) comme colonne vertébrale, sans le réentraîner de bout en bout. Le système introduit deux innovations architecturales : une stratégie dite Mixture of Layers (MoL), qui extrait sélectivement les informations critiques dans les couches denses du modèle, et un Meta Skill Module (MSM), qui intègre des biais inductifs pour accélérer l'apprentissage de trajectoires de mouvements dans un contexte de capacité de calcul limitée. Les résultats ont été validés à la fois dans des environnements simulés et dans des conditions réelles. L'enjeu central que résout cette architecture est ce qu'on appelle l'oubli catastrophique : lorsqu'un modèle pré-entraîné est spécialisé par fine-tuning pour une tâche robotique précise, il perd progressivement ses capacités de généralisation acquises durant le pré-entraînement. En préservant le VLM intact et en lui greffant des modules dédiés, M²-VLA permet aux robots d'aborder des situations inédites sans réentraînement, ce qu'on qualifie de généralisation zéro-shot. Cette propriété est déterminante pour l'industrie : un bras robotique déployé en usine ou en logistique doit pouvoir s'adapter à des variantes de tâches sans que chaque nouveau scénario exige de nouvelles données annotées et un cycle de réentraînement coûteux. Le domaine des modèles vision-langage-action connaît une intense activité de recherche depuis que des systèmes comme RT-2 de Google DeepMind ont démontré qu'un LLM pouvait piloter un robot à partir d'instructions en langage naturel. La tension entre spécialisation et généralisation reste le principal point de friction : les modèles fins performent bien sur leurs tâches d'entraînement mais échouent dès que le contexte change légèrement. M²-VLA s'inscrit dans un courant qui cherche à résoudre cette tension en traitant le VLM comme un socle immuable, à la manière du paradigme d'adaptation par adaptateurs (LoRA, adapters) en NLP. L'équipe promet de rendre le code et les modèles pré-entraînés publiquement disponibles, ce qui devrait permettre à la communauté robotique d'évaluer ces résultats et de les étendre à de nouveaux environnements.

RechercheOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic