Aller au contenu principal
Nvidia avait finalement besoin de Groq
LLMsThe Information AI · 1 min de lecture

Nvidia avait finalement besoin de Groq

Source originale ↗·

Nvidia vient d'annoncer lors de sa conférence annuelle GTC, au San Jose Convention Center, l'intégration de la technologie du fabricant de puces IA Groq dans ses systèmes de GPU. Cette collaboration vise spécifiquement à gérer des tâches d'inférence IA spécialisées, comme la génération de code, des tâches pour lesquelles les GPU de Nvidia ne s'avèrent pas suffisamment performants seuls.

C'est une admission tacite mais significative de la part du leader incontesté du marché des puces IA : ses GPU, malgré leur domination écrasante du secteur, présentent des limites sur certaines des charges de travail les plus critiques de l'IA moderne. L'inférence spécialisée est précisément le domaine où des architectures alternatives, comme celle de Groq avec ses LPU (Language Processing Units), démontrent des avantages concurrentiels réels en termes de latence et de débit.

Ce qui rend l'annonce particulièrement frappante, c'est le contraste avec les déclarations passées du PDG Jensen Huang, qui avait tenu des propos ouvertement condescendants à l'égard de Groq en janvier dernier. Quelques semaines plus tard, Nvidia intègre officiellement sa technologie dans ses propres systèmes. La conférence elle-même illustre l'atmosphère de ferveur autour de l'entreprise : des robots humanoïdes accueillent les visiteurs, des sweaters à l'effigie de Jensen Huang s'arrachent, et le fournisseur cloud Nebius, spécialisé dans la location de GPU Nvidia, animait un bar avec des cocktails aux noms évocateurs comme le GPU Spritz ou le Ryes of the Machines.

Ce partenariat signal potentiellement un tournant dans la stratégie de Nvidia : plutôt que de prétendre à l'omnipotence de ses GPU, l'entreprise semble désormais prête à construire des systèmes hybrides pour répondre aux exigences croissantes et diversifiées des applications IA.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

« L’AGI est déjà là » : la phrase choc de NVIDIA qui fait l’effet d’un séisme
1Le Big Data 

« L’AGI est déjà là » : la phrase choc de NVIDIA qui fait l’effet d’un séisme

Jensen Huang, le PDG de NVIDIA, a créé la stupeur dans l'industrie technologique en affirmant lors d'un entretien avec le podcasteur Lex Fridman : « Je pense que nous avons atteint l'AGI. » Une déclaration qui rompt brutalement avec le consensus scientifique, selon lequel l'Intelligence Artificielle Générale, une machine capable d'égaler l'humain dans toute tâche cognitive, resterait hors de portée pour encore des décennies. La clé pour comprendre cette affirmation réside dans la définition retenue par Huang, qui est délibérément économique plutôt que philosophique. Fridman lui soumet un critère précis : une IA capable de fonder une entreprise technologique valorisée à 1 milliard de dollars. Huang adopte cette mesure et la détourne vers une vision ultra-capitaliste : si une machine génère de la valeur économique de façon autonome, même via un influenceur virtuel viral ou une application sociale éphémère monétisée à 50 centimes par utilisateur, alors elle satisfait le critère de « généralité ». C'est une pirouette sémantique assumée, mais qui pointe vers un vrai tournant technique. Ce tournant, c'est le passage des chatbots passifs aux agents IA autonomes : des systèmes auxquels on confie un objectif global (créer, coder, publier, monétiser) et qui décomposent les tâches sans intervention humaine. Yann LeCun, scientifique en chef chez Meta, reste sceptique et rappelle régulièrement que les modèles actuels n'atteignent pas l'intelligence d'un chat. Mais Huang contourne volontairement ce débat pour imposer une grille de lecture purement opérationnelle et productive. Sur la question du remplacement des emplois, Huang se veut paradoxalement rassurant : interrogé sur la capacité de ces agents à reproduire NVIDIA elle-même, il répond que « les chances sont de zéro pour cent ». L'IA excelle dans l'exécution de tâches sophistiquées mais isolées ; la gestion de systèmes humains complexes, d'organisations et de décisions stratégiques à long terme reste hors de sa portée actuelle. La déclaration de Huang ressemble donc moins à une annonce scientifique qu'à un signal fort envoyé aux marchés et aux investisseurs : l'ère des agents autonomes est ouverte.

LLMsOpinion
1 source
Nvidia : Jensen Huang déclare avoir atteint l'AGI
2The Verge AI 

Nvidia : Jensen Huang déclare avoir atteint l'AGI

Jensen Huang, PDG de Nvidia, a déclaré lors d'un épisode du podcast Lex Fridman diffusé lundi : « Je pense que nous avons atteint l'AGI ». Cette affirmation, formulée sans détour, relance un débat qui agite l'industrie depuis plusieurs années autour de l'intelligence artificielle générale, soit une IA dont les capacités égalent ou dépassent celles de l'humain. L'AGI reste un concept volontairement flou, et c'est précisément ce flou qui en fait un sujet aussi sensible. Ces derniers mois, plusieurs dirigeants de la tech avaient tenté de s'en distancer, préférant inventer leur propre terminologie, jugée moins surmédiatisée et plus précise, bien que ces nouveaux termes recouvrent en pratique les mêmes réalités. Que Jensen Huang choisisse d'employer le mot directement marque donc une rupture de ton notable dans le secteur. La déclaration intervient dans un contexte où Nvidia s'est imposé comme le fournisseur incontournable de l'infrastructure IA mondiale, ses puces GPU étant au cœur de quasiment tous les grands modèles de langage en cours de développement. Prendre position sur l'AGI n'est donc pas anodin : cela positionne l'entreprise, et son PDG, au centre d'un débat philosophique et stratégique qui dépasse la seule ingénierie. La portée exacte de l'affirmation de Huang reste à préciser : s'agit-il d'une conviction personnelle, d'un signal envoyé aux investisseurs, ou d'une tentative de redéfinir les attentes du marché ? La communauté tech et les chercheurs en IA devraient réagir, d'autant que la définition même de l'AGI, et la question de savoir si elle a vraiment été atteinte, fait l'objet de désaccords profonds parmi les experts.

LLMsActu
1 source
NVIDIA accélère DiffusionGemma de Google DeepMind pour l'IA locale
3NVIDIA AI Blog 

NVIDIA accélère DiffusionGemma de Google DeepMind pour l'IA locale

Google DeepMind a lancé DiffusionGemma, un modèle de langage expérimental open source qui abandonne la génération séquentielle au profit d'une approche par diffusion. Construit sur l'architecture Gemma 4, un modèle mixture-of-experts de 26 milliards de paramètres n'activant que 3,8 milliards par étape, DiffusionGemma génère jusqu'à 256 tokens en parallèle à chaque passe plutôt qu'un seul à la fois. NVIDIA a optimisé ce modèle pour l'ensemble de sa gamme matérielle, et les chiffres sont frappants : 1 000 tokens par seconde sur une carte H100, 150 tokens/sec sur le DGX Spark, 800 tokens/sec sur la DGX Station, et environ quatre fois plus vite qu'un modèle autorégressif équivalent en usage mono-utilisateur. Le modèle est disponible sous licence Apache 2.0 avec un support immédiat dans Hugging Face Transformers, vLLM et Unsloth, et s'exécute entièrement en local sans coût par token. Cette vitesse change concrètement l'expérience pour les développeurs, chercheurs et passionnés d'IA qui font tourner des workflows agentiques ou des assistants interactifs. Les modèles autorégressifs classiques sont fondamentalement limités par la bande passante mémoire en usage mono-utilisateur : le GPU attend plus qu'il ne calcule. L'approche par diffusion retourne l'équation. En traitant un bloc de 256 tokens d'un coup, DiffusionGemma exploite pleinement les Tensor Cores de NVIDIA, conçus pour des calculs matriciels denses en parallèle. Les boucles agentiques, les chats interactifs et les assistants embarqués peuvent désormais répondre à la vitesse à laquelle un développeur pense et itère. Le modèle tourne localement sur les GPU GeForce RTX, les stations de travail RTX PRO 6000, le DGX Spark avec ses 128 Go de mémoire unifiée, et la DGX Station avec ses 748 Go de mémoire cohérente. L'approche par diffusion pour le texte s'inspire du domaine de la génération d'images, où le principe consiste à débruiter progressivement un signal aléatoire pour obtenir un résultat cohérent. Appliquée au langage, cette méthode restait jusqu'ici expérimentale et peu compétitive face aux LLM autorégressifs dominant le marché. DiffusionGemma marque une étape plus sérieuse : Google DeepMind lui apporte une base architecturale solide avec Gemma 4, et NVIDIA l'optimisation matérielle nécessaire pour en faire un outil pratique dès le premier jour. Un support llama.cpp pour les GeForce RTX grand public est annoncé prochainement, ce qui pourrait rendre la génération ultra-rapide accessible au plus grand nombre sans infrastructure cloud. Si les performances en qualité de génération se confirment à l'usage, le modèle pourrait bousculer les hypothèses de base sur lesquelles repose l'architecture de tous les grands LLM actuels.

UELa disponibilité sous licence Apache 2.0 et l'exécution locale sans coût par token ouvrent de nouvelles options pour les développeurs et chercheurs européens souhaitant déployer des workflows agentiques sans dépendance au cloud.

LLMsActu
1 source
550 milliards de paramètres : NVIDIA dévoile son plus gros modèle open source
4Le Big Data 

550 milliards de paramètres : NVIDIA dévoile son plus gros modèle open source

NVIDIA a lancé le 4 juin 2026 Nemotron 3 Ultra, son plus grand modèle open source à ce jour avec 550 milliards de paramètres. Ce modèle repose sur une architecture hybride Mamba-2 et Transformer organisée en système Mixture-of-Experts (MoE), ce qui lui permet de n'activer que les ressources nécessaires à chaque instant. Selon NVIDIA, cette conception permet une inférence jusqu'à cinq fois plus rapide que certains modèles ouverts concurrents, tout en réduisant le coût des tâches agentiques complexes jusqu'à 30 %. Sur les benchmarks de productivité pour agents IA, Nemotron 3 Ultra atteint 91 %, avec des résultats solides également sur le suivi d'instructions, le travail professionnel et la gestion de très longs contextes. Le modèle est disponible dès maintenant et optimisé pour les frameworks Hermes Agent, LangChain et OpenClaw. Ce lancement marque un pari stratégique clair de NVIDIA sur le marché des agents IA autonomes, considéré comme la prochaine rupture majeure du secteur. Contrairement à un chatbot classique, un agent IA peut planifier ses actions en séquence, utiliser des outils externes, corriger ses erreurs en cours d'exécution et mener des tâches complexes avec une intervention humaine minimale. En rendant un modèle de cette envergure accessible en open source, NVIDIA permet aux développeurs de le modifier, l'affiner et l'intégrer dans des projets de programmation, de recherche ou d'automatisation sans dépendance à une API propriétaire. C'est un argument de poids face aux modèles fermés de OpenAI ou Anthropic, et une invitation directe aux entreprises souhaitant garder le contrôle de leur infrastructure IA. NVIDIA s'inscrit dans une course effrénée au modèle frontier open source qui s'est intensifiée depuis que Meta a popularisé le format avec la série LLaMA. L'entreprise, dont la domination sur le matériel GPU lui confère une position unique, cherche désormais à peser aussi sur la couche logicielle et modèles. Nemotron 3 Ultra n'est toutefois pas sans limites : sur des benchmarks spécialisés en programmation ou en planification à très long terme, des modèles comme GLM 5.1 ou Kimi K2.6 conservent des avantages mesurables. Aucun acteur ne détient encore la formule universelle pour les agents autonomes, et la compétition reste ouverte. Les prochains mois diront si Nemotron 3 Ultra trouve une adoption réelle dans les projets d'infrastructure IA, ou s'il reste une vitrine de puissance technique dans un catalogue déjà très encombré.

UELes développeurs et entreprises européens peuvent déployer Nemotron 3 Ultra en local sans dépendance à une API propriétaire américaine, ce qui s'inscrit dans les enjeux de souveraineté numérique portés par l'UE.

💬 NVIDIA avait les GPU, ils veulent maintenant les modèles aussi. L'architecture MoE, la compatibilité native LangChain et Hermes Agent, 550 milliards de paramètres sans dépendance à une API fermée : pour les équipes qui cherchent à garder le contrôle de leur infra, l'offre est vraiment difficile à contourner. Sur la prog avancée et la planification longue, GLM 5.1 ou Kimi K2.6 gardent une longueur d'avance sur certains benchmarks, mais NVIDIA vient de se poser sérieusement sur la couche modèle, pas juste sur le silicium.

LLMsActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic