Aller au contenu principal
Au-delà de la précision : quantifier la fragilité en production causée par les variables excessives, redondantes et peu informatives en régression
RechercheMarkTechPost · 1 min de lecture

Au-delà de la précision : quantifier la fragilité en production causée par les variables excessives, redondantes et peu informatives en régression

Source originale ↗·

Ajouter davantage de variables à un modèle de régression peut sembler bénéfique, mais en pratique cela introduit des risques structurels cachés : instabilité des coefficients, signaux faibles confondus avec de vrais patterns, et fragilité accrue en production due aux dépendances multiples sur les pipelines de données. Lorsque des variables sont corrélées ou peu informatives, l'optimiseur peine à distribuer les poids de manière cohérente, rendant le modèle imprévisible au déploiement. L'article illustre ce problème avec un dataset de prix immobiliers en comparant des modèles "tout-en-un" à des alternatives plus sobres et stables, en utilisant Ridge Regression, scikit-learn et pandas.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

La compression de contexte devient viable en production : une nouvelle technique réduit les entrées des LLM par 16 sans perte de précision
1VentureBeat AI 

La compression de contexte devient viable en production : une nouvelle technique réduit les entrées des LLM par 16 sans perte de précision

Une équipe de chercheurs issue de six institutions américaines, NYU, Columbia, Princeton, l'Université du Maryland, Harvard et le Lawrence Livermore National Laboratory, a publié cette semaine un article présentant les Latent Context Language Models (LCLMs), une nouvelle famille de modèles encodeur-décodeur capables de compresser le contexte d'entrée avant qu'il n'atteigne le décodeur. Résultat : une réduction du contexte jusqu'à 16 fois, avec des sorties générées 8,8 fois plus rapidement que les méthodes actuelles de référence sur le benchmark RULER. À un taux de compression de 4x, la précision atteint 91,76 % contre 94,41 % sans compression, soit moins de 3 points de perte pour diviser la taille du contexte par quatre. À 16x, où 93,75 % des tokens d'entrée sont supprimés, la précision descend à 75,06 %, mais surpasse encore toutes les méthodes de compression KV cache testées au même ratio. L'architecture repose sur un encodeur de 0,6 milliard de paramètres couplé à un décodeur de 4 milliards, entraîné sur plus de 350 milliards de tokens. Les modèles sont disponibles en open source sur HuggingFace. Ce travail s'attaque à un goulot d'étranglement croissant dans les systèmes d'IA en production : plus un agent fonctionne longtemps, plus il accumule de tokens issus de documents récupérés, de traces de raisonnement et d'historique de conversation, et plus la mémoire et le calcul nécessaires explosent. Contrairement aux méthodes de compression KV cache dominantes, qui chargent quand même le cache complet avant d'en supprimer des entrées, les LCLMs compriment la séquence de tokens en amont, ce qui réduit directement la charge côté décodeur. « Notre objectif était d'entraîner des modèles de bout en bout capables de gérer des contextes très longs de manière efficace et précise. Si vous y parvenez, tout devient moins cher et plus rapide », explique Micah Goldblum, co-responsable du projet et chercheur à Columbia. Les gains se confirment aussi sur des entrées courtes : sur GSM8K, un benchmark de problèmes mathématiques, les LCLMs surpassent toutes les autres méthodes testées, quel que soit le taux de compression. La compression de contexte n'est pas un problème nouveau, mais la plupart des solutions existantes souffrent d'un compromis rédhibitoire en production : soit elles dégradent trop la précision, soit les économies de mémoire ne se traduisent pas en gains de vitesse réels dans les infrastructures de déploiement standard. Les LCLMs sont conçus pour s'intégrer directement dans une architecture agentique existante, il suffit de faire passer les documents récupérés par le compresseur avant de les injecter dans le contexte du modèle. L'équipe a également démontré comment construire des agents capables de décompresser sélectivement les passages pertinents, à la manière d'un lecteur qui parcourt rapidement un texte avant de zoomer sur les détails utiles. Avec la montée en puissance des systèmes d'agents longs et des pipelines RAG à grande échelle, ce type de compression en amont pourrait devenir une brique technique incontournable pour maîtriser les coûts d'inférence.

UELes startups et entreprises européennes développant des agents IA ou des pipelines RAG pourraient bénéficier indirectement de cette technique open source pour réduire leurs coûts d'inférence sans impact spécifique à la France ou à l'UE.

💬 Moins de 3 points de précision pour diviser le contexte par 4, c'est le compromis qu'on attendait pour que ça tienne en prod. Ce qui tranche avec les approches KV cache, c'est que la compression se fait en amont du décodeur : les gains se traduisent en vitesse réelle, pas juste en mémoire sur le papier. Si tu fais du RAG ou de l'agentique, ça vaut le détour sur HuggingFace cette semaine.

RecherchePaper
1 source
DIAL : découpler intention et action par modélisation latente du monde pour les VLA de bout en bout
2arXiv cs.RO 

DIAL : découpler intention et action par modélisation latente du monde pour les VLA de bout en bout

Des chercheurs ont publié DIAL (Decoupling Intent and Action via Latent World Modeling), un nouveau cadre d'apprentissage pour les modèles Vision-Langage-Action (VLA) dédiés à la robotique. Le principe repose sur une séparation explicite entre l'intention de haut niveau et l'exécution motrice, via un goulot d'étranglement d'intention latente différentiable. Un module System-2, basé sur un grand modèle de langage visuel (VLM), génère une représentation interne de ce que le robot devrait percevoir dans le futur, une prévision visuelle latente qui encode l'intention. Un module léger System-1 traduit ensuite cette intention en actions motrices précises grâce à une dynamique inverse latente. L'entraînement se déroule en deux phases: un échauffement découplé pour stabiliser chaque module séparément, puis une optimisation conjointe de bout en bout. Sur le benchmark RoboCasa GR1 Tabletop, DIAL établit un nouvel état de l'art en nécessitant dix fois moins de démonstrations que les méthodes concurrentes. Ce gain d'efficacité est décisif dans un domaine où la collecte de données de démonstration reste coûteuse et chronophage. Réduire d'un ordre de grandeur le nombre d'exemples nécessaires change l'équation économique du déploiement de robots autonomes en environnements industriels ou domestiques. DIAL démontre également une généralisation zero-shot robuste: lors de déploiements réels sur un robot humanoïde, le système parvient à manipuler des objets et des configurations jamais rencontrés à l'entraînement, sans données supplémentaires. Cette capacité de transfert constitue l'un des verrous les plus difficiles de la robotique moderne. Le développement des VLA s'est accéléré ces deux dernières années avec l'essor des grands modèles multimodaux. La plupart des approches existantes utilisent toutefois le VLM comme simple encodeur, le connectant directement à une couche d'action, ce qui dégrade ses représentations sémantiques et introduit une instabilité à l'entraînement. DIAL corrige cette limite structurelle en exploitant pleinement les capacités de raisonnement du VLM pour la planification, tout en préservant ses connaissances pré-entraînées grâce au découplage. L'approche s'inscrit dans une tendance plus large visant à doter les robots d'une capacité à planifier avant d'agir, et pourrait accélérer l'adoption de systèmes capables de s'adapter à de nouveaux environnements sans réentraînement coûteux.

RecherchePaper
1 source
Quantification de l'incertitude pour l'appel de fonctions dans les LLM
3Apple Machine Learning 

Quantification de l'incertitude pour l'appel de fonctions dans les LLM

Les modèles de langage (LLM) sont de plus en plus déployés pour accomplir de manière autonome des tâches concrètes, notamment grâce au paradigme dit du "function calling", qui leur permet d'appeler des outils externes pour agir sur le monde réel. Ce mécanisme est aujourd'hui largement utilisé pour doter les LLM de capacités d'usage d'outils, que ce soit pour interroger une base de données, exécuter du code ou déclencher une action dans une application tierce. Le problème soulevé par des chercheurs est qu'un appel de fonction incorrect peut avoir des conséquences graves, en particulier lorsque l'action déclenchée est irréversible, comme un virement bancaire ou la suppression de données. Face à ce risque, les auteurs proposent d'évaluer la confiance du modèle dans la justesse d'un appel de fonction avant même de l'exécuter, via des méthodes de quantification de l'incertitude, ou "Uncertainty Quantification" (UQ). Cette approche change la donne pour les entreprises qui intègrent des agents IA autonomes dans leurs systèmes de production. Plutôt que de laisser un modèle exécuter aveuglément chaque action qu'il génère, la quantification de l'incertitude permettrait de détecter en amont les appels de fonction douteux et de les soumettre à une validation humaine ou de les bloquer purement et simplement. Pour les secteurs sensibles comme la finance, la santé ou la gestion de données critiques, ce type de garde-fou pourrait devenir un prérequis avant tout déploiement à grande échelle d'agents capables d'agir sans supervision constante. Cette recherche s'inscrit dans un mouvement plus large de la communauté IA visant à rendre les agents autonomes plus fiables et plus sûrs, alors que leur adoption s'accélère dans les entreprises. Les mécanismes de function calling, bien que puissants, restent une source de fragilité: un modèle peut mal interpréter une requête, halluciner des paramètres ou choisir le mauvais outil. En couplant ces systèmes à des méthodes de quantification de l'incertitude, les chercheurs espèrent ouvrir la voie à des agents capables d'évaluer eux-mêmes leur propre fiabilité, une étape jugée essentielle avant de leur confier des tâches à fort enjeu.

RecherchePaper
1 source
Au-delà de la similarité sémantique: Introduction du pipeline d'acquisition généralisable d'Agencer NVIDIA NeMo
4HuggingFace Blog 

Au-delà de la similarité sémantique: Introduction du pipeline d'acquisition généralisable d'Agencer NVIDIA NeMo

NVIDIA franchit une nouvelle étape dans le domaine de la recherche d'informations avec son système NeMo Retriever, qui dépasse les approches traditionnelles basées sur la simple similarité sémantique. Plutôt que de se contenter de comparer des vecteurs d'embeddings, ce nouveau système introduit un pipeline dit "d'agir-recherche généralisable" (agentic retrieval), capable d'adapter dynamiquement sa stratégie d'interrogation selon la nature de la tâche. L'enjeu est considérable pour les entreprises qui déploient des systèmes RAG (Retrieval-Augmented Generation) à grande échelle. Les pipelines classiques peinent à maintenir une précision élevée sur des bases documentaires volumineuses ou hétérogènes, là où les requêtes nécessitent plusieurs étapes de raisonnement. En intégrant une logique d'agent dans le processus de récupération, NeMo Retriever entend répondre à ce point de défaillance fréquent des architectures IA en production. Le système repose sur l'idée que la recherche d'information ne doit pas être une opération unique et statique, mais un processus itératif où l'agent reformule, affine et enchaîne les requêtes jusqu'à atteindre le résultat optimal. Cette approche améliore la précision des résultats sur des tâches complexes impliquant de grandes bases de données textuelles, selon NVIDIA, qui positionne cette innovation dans sa suite d'outils destinés aux développeurs d'applications IA d'entreprise. La généralisation de tels pipelines agentiques dans les infrastructures RAG représente une tendance de fond pour 2026 : après l'engouement pour les embeddings, l'industrie se tourne vers des architectures plus dynamiques où la récupération de contexte devient elle-même un processus intelligent, réduisant les hallucinations et augmentant la fiabilité des modèles en conditions réelles.

UEL'innovation d'NVIDIA NeMo Retriever, avec son pipeline d'acquisition généralisable, améliore significativement l'efficacité de recherche dans les grandes bases de données textuelles, potentiellement bénéficiant à des entreprises européennes comme SAP ou OVHcloud, qui gèrent et analysent de vastes quantités de données.

RechercheOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic