NVIDIA Nemotron 3.5 Lightning désormais disponible sur Amazon SageMaker JumpStart
Amazon Web Services a annoncé la disponibilité du modèle NVIDIA Nemotron 3.5 Lightning sur Amazon SageMaker JumpStart, permettant son déploiement sans configuration manuelle de l'infrastructure de serving. Ce modèle ouvert, distillé à partir du modèle de pointe NVIDIA Nemotron 3 Ultra et développé avec la Nemotron Coalition, repose sur une architecture hybride de type Mixture-of-Experts (MoE). Il compte 30 milliards de paramètres au total, dont seulement 3 milliards actifs par passage, ce qui lui permet de fonctionner sur un seul GPU compatible. NVIDIA le présente comme le modèle ouvert le plus rapide de sa catégorie pour les agents fonctionnant en continu, avec un débit jusqu'à 4 fois supérieur et une complétion des tâches jusqu'à 30 % plus rapide sur les charges de travail agentiques à fort volume. Le modèle gère un contexte pouvant atteindre 1 million de tokens, traite uniquement du texte en entrée et en sortie, et s'appuie sur un mécanisme de décodage spéculatif appelé DFlash pour réduire la latence par token. Sur les benchmarks publiés, la version NVFP4 reste proche de la version BF16 : 81,62 contre 81,94 sur MMLU Pro, 75,57 contre 75,44 sur GPQA Diamond, 52,80 contre 51,56 sur SWE-bench Verified, ou encore 72,88 contre 71,88 sur IFBench, selon des évaluations réalisées par NVIDIA avec des protocoles publiés sur NeMo Gym.
Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →
Cette annonce illustre une approche que NVIDIA et AWS présentent comme un système multi-modèles pour les architectures agentiques. Tous les appels ne nécessitent pas un modèle frontière : planifier un flux de travail complexe ou orchestrer des sous-agents exige un raisonnement de haut niveau, mais classer une alerte, extraire des champs d'un formulaire ou vérifier un enregistrement par rapport à une politique peut être confié à un modèle plus petit et spécialisé, alors que ces tâches représentent souvent l'essentiel du volume d'appels. En routant ces étapes répétitives vers un modèle comme Lightning plutôt que vers un modèle frontière, les entreprises peuvent réduire à la fois les coûts et la latence des agents autonomes qui tournent en permanence, sans sacrifier la précision sur les tâches spécialisées. Pour les équipes qui construisent des agents à grande échelle, cela ouvre la voie à des architectures plus économiques et plus réactives.
Ce lancement s'inscrit dans une stratégie plus large de NVIDIA autour de la famille Nemotron, pensée comme un ensemble modulaire de modèles ouverts dont les poids peuvent être récupérés, personnalisés et déployés librement. L'outil NeMo Switchyard, s'il fait partie de la pile technique d'une entreprise, permet de router automatiquement chaque étape d'un flux de travail vers le modèle le plus adapté au sein d'un pool choisi, avec Lightning positionné sur les étapes à fort volume et à faible complexité. L'intégration à SageMaker JumpStart simplifie l'adoption pour les clients AWS, dans un contexte de concurrence croissante entre fournisseurs cloud et fabricants de puces pour équiper les architectures agentiques d'entreprise à moindre coût.
Pas d'impact direct sur la France/UE