Nvidia affirme que son Groq 3 LPX est quatre fois plus rapide que Cerebras, mais le calcul est plus complexe
Nvidia a annoncé le passage en production complète de sa puce d'inférence Groq 3 LPX, avec des performances annoncées de 3 400 tokens par seconde sur le modèle Gemma 4 31B, soit quatre fois plus rapide que les puces concurrentes de Cerebras. Mais selon The Register, ce chiffre masque une différence structurelle importante : Nvidia doit mobiliser au moins 64 accélérateurs pour atteindre ce débit, alors que Cerebras y parvient avec seulement un ou deux processeurs. La comparaison brute de vitesse cache donc un écart considérable en matière de ressources matérielles nécessaires.
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette nuance change la donne pour les entreprises qui choisissent leur infrastructure d'inférence IA. Un débit élevé obtenu grâce à un déploiement massif de puces n'a pas la même valeur économique qu'une performance équivalente obtenue avec du matériel minimal, notamment en termes de coût, de consommation énergétique et d'espace en data center. Pour les fournisseurs de services d'IA générative, le rapport performance par puce, et non la vitesse absolue, devient le critère déterminant pour évaluer la rentabilité d'un déploiement à grande échelle.
Cette annonce s'inscrit dans une compétition de plus en plus tendue sur le marché des puces spécialisées pour l'inférence, où Nvidia, longtemps dominant sur l'entraînement des modèles, cherche à consolider sa position face à des acteurs comme Cerebras qui misent sur des architectures radicalement différentes, avec des puces géantes capables de traiter des modèles entiers sans les répartir sur des dizaines d'unités. Une question reste ouverte : comment cette nouvelle architecture de Nvidia se comportera-t-elle face aux modèles de mélange d'experts (MoE) de grande taille, de plus en plus répandus dans l'industrie, ce qui déterminera si l'avantage annoncé se maintient en conditions réelles.
Pas d'impact direct sur la France/UE