Aller au contenu principal
Outils · Outil ·

Le routeur Switchyard de Nvidia réaffecte les modèles IA en cours de tâche et réduit les coûts d'un tiers dans ses propres tests

Nvidia a dévoilé mardi deux nouveautés destinées aux entreprises qui font tourner des agents IA en continu : Nemotron 3.5 Lightning, un modèle ouvert de type mélange d'experts (mixture-of-experts) de 30 milliards de paramètres conçu pour des tâches d'agents spécialisées à fort volume, et NeMo Switchyard, une bibliothèque open source qui répartit chaque étape d'un flux de travail d'agent vers le modèle le mieux adapté. Selon Nvidia, Lightning produit des résultats jusqu'à quatre fois plus rapides que des modèles comparables de sa catégorie, et accomplit des tâches agentiques environ 30 % plus vite que Qwen3.6-35B, à précision équivalente. Associé à Switchyard, l'ensemble maintiendrait un niveau de performance proche des modèles de pointe tout en réduisant les coûts de référence à environ un tiers de ceux d'une utilisation exclusive d'Opus 4.8. Kari Briski, vice-présidente de l'IA générative chez Nvidia, a présenté cette combinaison comme la force d'un "système de modèles" capable d'associer le bon modèle à chaque étape d'un flux de travail.

2 min de lecturePertinence 60
Source

Résumé et traduction réalisés par Le Fil IA à partir de VentureBeat AI. Lire l'article original →

Cette annonce s'attaque à un problème concret pour les entreprises : envoyer systématiquement chaque tâche à un modèle de pointe fait exploser la facture, mais construire sa propre logique de routage vers des modèles moins chers devient un projet d'ingénierie à part entière, à maintenir à chaque évolution des flux de travail. Switchyard propose plusieurs stratégies de routage, notamment un routeur aléatoire, un routeur basé sur l'état de l'agent, ou un routeur par classification, et peut évaluer la verbosité prévisible d'un modèle, c'est-à-dire le nombre de tokens qu'il produit généralement pour une tâche donnée, afin d'orienter le travail vers l'option la moins coûteuse avant même l'appel. La bibliothèque s'intègre à des solutions de routage existantes comme OpenRouter ou LiteLLM plutôt que de les remplacer, ce qui limite le travail d'intégration pour les équipes techniques.

Cette sortie intervient dans une période particulièrement dense pour les modèles ouverts : depuis le printemps, Alibaba, Moonshot, Zhipu et DeepSeek ont publié des modèles chinois compétitifs, certains proches du niveau des modèles de pointe tout en étant moins chers ou plus légers que ceux des laboratoires américains. Meta a accentué cette pression en publiant son propre modèle agentique ouvert de 30 milliards de paramètres, Muse Glimmer. Sur le segment du routage, Switchyard affronte surtout Not Diamond, qui alimente déjà le mode automatique d'OpenRouter, et RouteLLM, un cadre open source développé par UC Berkeley et LMSYS ; aucun des deux ne propose son propre modèle. Le pari de Nvidia consiste à contrôler à la fois le modèle et le routeur sous une même licence ouverte, un positionnement que ni un simple routeur ni un modèle isolé ne peuvent reproduire.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01ACRouter choisit le modèle d'IA le plus adapté à chaque tâche, réduisant les coûts de 2,6 fois par rapport à un usage exclusif d'Opus43VentureBeat AIOutils 02Les agents IA apprennent en cours de tâche, mais pas pour toute l'équipe39VentureBeat AIOutils 03Fireworks AI lance Nexus, une couche de routage qui bascule le code de routine vers des modèles ouverts pour réduire les coûts41MarkTechPostOutils 
Dossier · NVIDIASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.