Aller au contenu principal
Outils · Outil ·

NVIDIA Nemotron 3.5 Lightning désormais disponible sur Amazon SageMaker JumpStart

Amazon Web Services a annoncé la disponibilité du modèle NVIDIA Nemotron 3.5 Lightning sur Amazon SageMaker JumpStart, permettant son déploiement sans configuration manuelle de l'infrastructure de serving. Ce modèle ouvert, distillé à partir du modèle de pointe NVIDIA Nemotron 3 Ultra et développé avec la Nemotron Coalition, repose sur une architecture hybride de type Mixture-of-Experts (MoE). Il compte 30 milliards de paramètres au total, dont seulement 3 milliards actifs par passage, ce qui lui permet de fonctionner sur un seul GPU compatible. NVIDIA le présente comme le modèle ouvert le plus rapide de sa catégorie pour les agents fonctionnant en continu, avec un débit jusqu'à 4 fois supérieur et une complétion des tâches jusqu'à 30 % plus rapide sur les charges de travail agentiques à fort volume. Le modèle gère un contexte pouvant atteindre 1 million de tokens, traite uniquement du texte en entrée et en sortie, et s'appuie sur un mécanisme de décodage spéculatif appelé DFlash pour réduire la latence par token. Sur les benchmarks publiés, la version NVFP4 reste proche de la version BF16 : 81,62 contre 81,94 sur MMLU Pro, 75,57 contre 75,44 sur GPQA Diamond, 52,80 contre 51,56 sur SWE-bench Verified, ou encore 72,88 contre 71,88 sur IFBench, selon des évaluations réalisées par NVIDIA avec des protocoles publiés sur NeMo Gym.

2 min de lecturePertinence 44
Source

Résumé et traduction réalisés par Le Fil IA à partir de AWS ML Blog. Lire l'article original →

Cette annonce illustre une approche que NVIDIA et AWS présentent comme un système multi-modèles pour les architectures agentiques. Tous les appels ne nécessitent pas un modèle frontière : planifier un flux de travail complexe ou orchestrer des sous-agents exige un raisonnement de haut niveau, mais classer une alerte, extraire des champs d'un formulaire ou vérifier un enregistrement par rapport à une politique peut être confié à un modèle plus petit et spécialisé, alors que ces tâches représentent souvent l'essentiel du volume d'appels. En routant ces étapes répétitives vers un modèle comme Lightning plutôt que vers un modèle frontière, les entreprises peuvent réduire à la fois les coûts et la latence des agents autonomes qui tournent en permanence, sans sacrifier la précision sur les tâches spécialisées. Pour les équipes qui construisent des agents à grande échelle, cela ouvre la voie à des architectures plus économiques et plus réactives.

Ce lancement s'inscrit dans une stratégie plus large de NVIDIA autour de la famille Nemotron, pensée comme un ensemble modulaire de modèles ouverts dont les poids peuvent être récupérés, personnalisés et déployés librement. L'outil NeMo Switchyard, s'il fait partie de la pile technique d'une entreprise, permet de router automatiquement chaque étape d'un flux de travail vers le modèle le plus adapté au sein d'un pool choisi, avec Lightning positionné sur les étapes à fort volume et à faible complexité. L'intégration à SageMaker JumpStart simplifie l'adoption pour les clients AWS, dans un contexte de concurrence croissante entre fournisseurs cloud et fabricants de puces pour équiper les architectures agentiques d'entreprise à moindre coût.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01NVIDIA Nemotron 3 Ultra est désormais disponible sur Amazon SageMaker JumpStart47AWS ML BlogLLMs 02NVIDIA Nemotron 3 Nano Omni est désormais disponible sur Amazon SageMaker JumpStart51AWS ML BlogLLMs 03Le modèle tabulaire NEXUS de Fundamental est désormais disponible sur Amazon SageMaker JumpStart40AWS ML BlogOutils 
Dossier · NVIDIASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.