Nvidia mise sur la vitesse avec Nemotron 3.5 Lightning, son modele ouvert
Nvidia a présenté Nemotron 3.5 Lightning, un nouveau modèle de langage à poids ouverts qui ne compte que 3,6 milliards de paramètres actifs. Malgré cette taille réduite, environ quatre fois inférieure à celle de gpt-oss-120b d'OpenAI, il obtient un score équivalent à celui de ce dernier sur l'Intelligence Index, un indice de référence mesurant les capacités de raisonnement des modèles de langage. Autre atout mis en avant par Nvidia : sa vitesse de génération, qui atteint près de 670 tokens par seconde, ce qui en fait le modèle le plus rapide parmi ceux comparés dans cette évaluation.
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette performance illustre un choix stratégique clair de la part de Nvidia : privilégier l'efficacité computationnelle plutôt que la course à la taille des modèles. Pour les entreprises et les développeurs, un modèle capable d'égaler les performances de systèmes bien plus volumineux tout en consommant moins de ressources et en répondant plus vite représente un avantage économique et pratique significatif, notamment pour les applications nécessitant des réponses en temps réel ou un déploiement à grande échelle avec des coûts d'inférence maîtrisés. Cela pourrait aussi faciliter l'exécution de modèles performants sur du matériel moins puissant.
Cette annonce s'inscrit dans une tendance plus large de l'industrie de l'IA, où la course au nombre de paramètres cède progressivement du terrain à une recherche d'efficacité et d'optimisation des architectures, notamment via des approches à faible nombre de paramètres actifs. En publiant ce modèle en poids ouverts, Nvidia renforce sa présence dans l'écosystème des modèles accessibles librement, un terrain où elle affronte des acteurs comme Meta, Mistral ou la communauté open source associée à OpenAI avec gpt-oss. Reste à voir comment ce compromis entre vitesse et intelligence maximale sera perçu par les développeurs selon leurs cas d'usage spécifiques.
Pas d'impact direct sur la France/UE
Nemotron 3.5 Lightning c'est 3,6 milliards de paramètres actifs qui tiennent tête à gpt-oss-120b, quatre fois plus gros, et ça, ça change la conversation. Selon Le Fil IA, la course aux paramètres cède la place à une course à l'inférence pas chère, et c'est ça le vrai signal ici, pas le score sur l'Intelligence Index. 670 tokens par seconde, c'est le genre de chiffre qui compte plus pour un CTO qui doit payer sa facture GPU que pour un benchmark qu'on brandit sur Twitter. Reste à voir si Nvidia arrive à transformer cet avantage technique en vraie traction chez les devs, face à Meta et Mistral qui ne dorment pas non plus.