NVIDIA Nemotron 3.5 Lightning et NeMo Switchyard rendent l'IA à base d'agents plus rapide et efficace
NVIDIA a annoncé l'extension de sa famille de modèles Nemotron 3 avec le lancement de Nemotron 3.5 Lightning, un modèle ouvert à mélange d'experts de 30 milliards de paramètres, présenté comme le plus efficace de sa catégorie pour les charges de travail agentiques de longue durée. Ce lancement fait suite à Nemotron 3 Nano et s'accompagne de la sortie de NeMo Switchyard, une bibliothèque open source de routage intelligent qui dirige automatiquement chaque requête vers le modèle le plus adapté au sein des outils agentiques existants, sans que les développeurs aient à réécrire leurs applications. Selon NVIDIA, Nemotron 3.5 Lightning offre une vitesse de sortie jusqu'à 4 fois supérieure et accomplit les tâches agentiques 30% plus vite que les modèles concurrents de sa catégorie, tout en conservant une précision de niveau frontière d'après les benchmarks PinchBench. Le modèle a été développé avec la contribution de la Nemotron Coalition, qui a fourni méthodologies d'évaluation, logiciels d'inférence et jeux de données, et peut être post-entraîné via NVIDIA NeMo puis déployé sur des PC RTX, des systèmes DGX Spark, DGX Station, Jetson, des stations de travail RTX PRO, des data centers ou le cloud.
Résumé et traduction réalisés par Le Fil IA à partir de NVIDIA AI Blog. Lire l'article original →
Cette annonce illustre la transition de l'IA générative, des simples chatbots vers des agents autonomes fonctionnant en continu, une évolution qui pousse les entreprises à privilégier des modèles ouverts offrant un contrôle total sur leur déploiement. Plusieurs acteurs ont déjà personnalisé Nemotron 3.5 Lightning pour leurs besoins: CrowdStrike pour la cybersécurité, Harvey en partenariat avec Trajectory pour les services juridiques, et CodeRabbit avec Baseten pour la revue de code. Lila Sciences l'utilise pour améliorer le raisonnement agentique dans les sciences physiques et du vivant, tandis que Fastino Labs rapporte des gains de précision dans le développement logiciel, la finance et la santé. Pour les entreprises, cela ouvre la possibilité de traiter des tâches spécialisées à haut volume, comme la surveillance d'alertes de sécurité ou le support facturation, avec des temps de réponse rapides et en gardant la maîtrise de la confidentialité des données, sans dépendre systématiquement d'un modèle propriétaire hébergé dans le cloud.
Cette stratégie s'inscrit dans une architecture que NVIDIA qualifie de système de modèles: un modèle de raisonnement frontière, comme Nemotron 3 Ultra ou GPT-5.6, planifie et orchestre un flux de travail complexe, tandis que des modèles plus petits et spécialisés comme Nemotron 3.5 Lightning exécutent des tâches ciblées à grande échelle. NeMo Switchyard répond justement au problème du routage entre ces différents modèles. Cette approche modulaire, portée par la Nemotron Coalition et un écosystème de partenaires industriels, illustre la concurrence croissante entre NVIDIA et les fournisseurs de modèles fermés pour s'imposer comme la couche d'infrastructure de référence des agents IA d'entreprise, avec des déploiements possibles aussi bien sur du matériel local que dans le cloud.
Pas d'impact direct sur la France/UE