Nvidia lance Nemotron 3.5 Lightning : Claude pourrait devenir beaucoup trop cher
Nvidia a présenté le 11 août 2026 Nemotron 3.5 Lightning, un modèle en poids ouverts de type mixture-of-experts à 30 milliards de paramètres dont seulement 3 milliards activés à chaque passage, doté d'un contexte d'un million de tokens et déployable sur un DGX Spark, une carte H100 ou une GeForce RTX 5090. L'entreprise revendique jusqu'à quatre fois plus de vitesse et 30% de temps en moins sur des tâches agentiques face à des modèles ouverts comparables, avec poids et recettes d'entraînement publiés sous licence OpenMDW-1.1 sur Hugging Face. L'annonce s'accompagne de NeMo Switchyard, une bibliothèque qui choisit automatiquement quel modèle doit traiter chaque étape d'un agent selon la difficulté, le coût ou la latence, réservant les modèles premium comme Claude Opus aux tâches les plus complexes. Testé avec LangChain sur 145 tâches agentiques multi-étapes, ce routage entre Lightning et Claude Opus 4.8 a réduit le coût de 74%, avec seulement 7% des appels envoyés au modèle frontier, pour environ six points de précision perdus. Artificial Analysis attribue par ailleurs à Lightning un score de 24 sur son Intelligence Index, équivalent à gpt-oss-120b obtenu avec environ quatre fois moins de paramètres, et mesure près de 670 tokens par seconde avec les poids finaux au format NVFP4.
Résumé et traduction réalisés par Le Fil IA à partir de Le Big Data. Lire l'article original →
Cette annonce vise le coût d'exploitation des agents IA en entreprise, où les tâches répétitives (appels d'outils, validation de résultats, revue de code) finissent par exploser la facture lorsqu'elles sont envoyées à un modèle frontier comme Claude Opus. En confiant l'essentiel du volume à Lightning et en ne remontant vers un modèle premium que les cas réellement difficiles, Switchyard promet de diviser les coûts par plusieurs sans sacrifier la qualité globale, selon les chiffres avancés par Nvidia. La licence ouverte permet en plus un hébergement local, un argument qui compte pour les entreprises réticentes à envoyer leur propriété intellectuelle vers une API externe. Pour Anthropic et les autres fournisseurs de modèles premium, le risque est de voir leur usage réduit aux seules tâches complexes, pendant que Nvidia capte l'essentiel du volume avec du matériel et des modèles qu'il maîtrise de bout en bout.
Cette sortie s'inscrit dans une stratégie à double face : fin juin 2026, Nvidia avait annoncé l'arrivée de Claude sur ses GPU Blackwell Ultra, consolidant sa position de fournisseur d'infrastructure incontournable pour Anthropic. Six semaines plus tard, l'entreprise propose aux mêmes clients un moyen de limiter leur recours à Claude en misant sur ses propres modèles Nemotron, dont Lightning est présenté comme le successeur de Nemotron 3 Nano 30B. Sur le terrain des modèles ouverts concurrents, Qwen3.6 35B et Muse Glimmer restent devant Lightning sur l'intelligence générale mesurée par Artificial Analysis, qui a publié ses propres résultats indépendants dès le lancement. La suite dépendra de l'adoption réelle de Switchyard par les équipes qui construisent des agents en production, et de la réponse des fournisseurs de modèles premium face à cette pression nouvelle sur les prix.
Les entreprises europeennes construisant des agents IA pourraient reduire leurs couts et repondre a des exigences de souverainete des donnees grace a l'hebergement local de ce modele ouvert.