Le routeur Switchyard de Nvidia réaffecte les modèles IA en cours de tâche et réduit les coûts d'un tiers dans ses propres tests
Nvidia a dévoilé mardi deux nouveautés destinées aux entreprises qui font tourner des agents IA en continu : Nemotron 3.5 Lightning, un modèle ouvert de type mélange d'experts (mixture-of-experts) de 30 milliards de paramètres conçu pour des tâches d'agents spécialisées à fort volume, et NeMo Switchyard, une bibliothèque open source qui répartit chaque étape d'un flux de travail d'agent vers le modèle le mieux adapté. Selon Nvidia, Lightning produit des résultats jusqu'à quatre fois plus rapides que des modèles comparables de sa catégorie, et accomplit des tâches agentiques environ 30 % plus vite que Qwen3.6-35B, à précision équivalente. Associé à Switchyard, l'ensemble maintiendrait un niveau de performance proche des modèles de pointe tout en réduisant les coûts de référence à environ un tiers de ceux d'une utilisation exclusive d'Opus 4.8. Kari Briski, vice-présidente de l'IA générative chez Nvidia, a présenté cette combinaison comme la force d'un "système de modèles" capable d'associer le bon modèle à chaque étape d'un flux de travail.
Résumé et traduction réalisés par Le Fil IA à partir de VentureBeat AI. Lire l'article original →
Cette annonce s'attaque à un problème concret pour les entreprises : envoyer systématiquement chaque tâche à un modèle de pointe fait exploser la facture, mais construire sa propre logique de routage vers des modèles moins chers devient un projet d'ingénierie à part entière, à maintenir à chaque évolution des flux de travail. Switchyard propose plusieurs stratégies de routage, notamment un routeur aléatoire, un routeur basé sur l'état de l'agent, ou un routeur par classification, et peut évaluer la verbosité prévisible d'un modèle, c'est-à-dire le nombre de tokens qu'il produit généralement pour une tâche donnée, afin d'orienter le travail vers l'option la moins coûteuse avant même l'appel. La bibliothèque s'intègre à des solutions de routage existantes comme OpenRouter ou LiteLLM plutôt que de les remplacer, ce qui limite le travail d'intégration pour les équipes techniques.
Cette sortie intervient dans une période particulièrement dense pour les modèles ouverts : depuis le printemps, Alibaba, Moonshot, Zhipu et DeepSeek ont publié des modèles chinois compétitifs, certains proches du niveau des modèles de pointe tout en étant moins chers ou plus légers que ceux des laboratoires américains. Meta a accentué cette pression en publiant son propre modèle agentique ouvert de 30 milliards de paramètres, Muse Glimmer. Sur le segment du routage, Switchyard affronte surtout Not Diamond, qui alimente déjà le mode automatique d'OpenRouter, et RouteLLM, un cadre open source développé par UC Berkeley et LMSYS ; aucun des deux ne propose son propre modèle. Le pari de Nvidia consiste à contrôler à la fois le modèle et le routeur sous une même licence ouverte, un positionnement que ni un simple routeur ni un modèle isolé ne peuvent reproduire.
Pas d'impact direct sur la France/UE