Aller au contenu principal
InfrastructureLatent Space · 2 min de lecture

Mégakernels : morts et de nouveau bien vivants

Source originale ↗·
Mégakernels : morts et de nouveau bien vivants
▶ Voir sur YouTube

Une discussion animée sur les megakernels a marqué l'épisode de la veille du podcast Inference Engineering Masterclass, relayée par la newsletter AINews dans son édition du 3-4 août 2026, qui dépouille chaque jour une douzaine de subreddits et plus de 500 comptes Twitter liés à l'IA. Les megakernels désignent des noyaux de calcul GPU entièrement fusionnés en un seul bloc, une technique conçue pour réduire la latence de lancement et améliorer le chevauchement entre kernels lors de l'inférence des grands modèles de langage. Selon Ali, un des intervenants, l'approche atteint ses limites face au parallélisme tensoriel : quand une matrice est répartie sur plusieurs GPU, des opérations non linéaires comme le softmax exigent malgré tout une communication entre puces, ce qu'un kernel fusionné ne peut pas éviter. Le débat évoque aussi les nouvelles spécifications de l'architecture Rubin de Nvidia, présentées publiquement par un responsable technique du groupe, conçues pour limiter les effets des "straggler CTAs" (unités de calcul en retard) qui justifiaient historiquement le recours aux megakernels, notamment grâce à des "dependency triggers" décrits par l'ingénieur Nvidia Kyle Kranen. Le même jour, Stuart Sul, coauteur du projet megakernel original aux côtés de Ben Spector (créateur de ThunderKittens, dans le groupe de recherche de Dan Fu) et désormais responsable d'une équipe chez Cursor, a publié un megakernel open source baptisé Mixture of Kittens, revendiquant un gain de 41 % de tokens traités par seconde.

L'enjeu est directement financier. Les intervenants soulignent qu'à l'échelle des grands fournisseurs d'inférence, un tel gain de performance représenterait des économies de plusieurs milliards de dollars, le calcul GPU restant le principal poste de coût du secteur. Mais le consensus qui se dégage du débat reste prudent : aucun fournisseur d'inférence sérieux n'exploiterait en production un kernel fusionné à la main de 67 000 lignes de code, jugé trop complexe à maintenir et à optimiser face à des kernels modulaires comme ceux de TensorRT-LLM, qui permettent d'optimiser chaque composant séparément tout en les faisant tourner en parallèle. Plusieurs praticiens cités affirment que même les entreprises ayant investi dans des megakernels finissent souvent par ne pas les déployer en production, faute de gains suffisants au regard de la complexité d'ingénierie imposée.

Ce débat prolonge une tension plus ancienne entre deux philosophies d'optimisation de l'inférence : la fusion extrême, qui vise à éliminer tout surcoût de lancement, contre la modularité, qui privilégie la flexibilité et l'optimisation composant par composant. Des contraintes physiques persistantes, reconnues par les intervenants du podcast, expliquent pourquoi Nvidia ajuste la conception de ses futures puces Rubin en fonction des pratiques observées chez les concepteurs de kernels, sans pour autant faire des megakernels une direction dominante. La publication du projet Mixture of Kittens par l'équipe de Stuart Sul chez Cursor montre toutefois que la recherche sur la fusion de kernels reste active, même si elle est désormais perçue comme une niche plus expérimentale qu'industrielle. Cette édition d'AINews, qui fait maintenant partie de la newsletter Latent Space, couvre par ailleurs d'autres actualités de la semaine, dont le lancement par Alibaba de Qwen3.8-Max, présenté comme un modèle "meilleur et moins cher" rapidement intégré aux écosystèmes d'agents Hermes Agent et Nous Research, aux côtés d'autres sorties comme Alpamayo 2 Super, Pokee-Isaac, Maple-Preview et Shieldstral.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

L'IA atteint le mur de la mémoire : il lui faut un nouveau niveau de contexte
1VentureBeat AI 

L'IA atteint le mur de la mémoire : il lui faut un nouveau niveau de contexte

L'intelligence artificielle fait face à un nouveau goulot d'étranglement en 2026, et ce n'est plus la puissance de calcul des GPU. Selon Jeff Harthorn, responsable de la recherche appliquée en IA chez Solidigm, le vrai frein est désormais la gestion du contexte, la mémoire persistante qui doit survivre entre les sessions d'inférence. "Les GPU sont devenus bien moins chers par FLOP, les architectures de modèles et les moteurs d'inférence sont plus efficaces. Mais ce qui a crû plus vite que tout, c'est le contexte", explique-t-il. Les fenêtres de contexte ont explosé en taille, les systèmes d'IA agentiques enchaînent désormais des dizaines voire des centaines d'appels de modèles successifs, et les entreprises exigent que les états d'inférence persistent entre les sessions à des fins d'audit, de gouvernance et de réutilisation. Ces trois tendances se cumulent et propulsent les volumes de données contextuelles bien au-delà de ce que les architectures mémoire existantes peuvent absorber. Cette évolution a des conséquences directes sur les coûts et le retour sur investissement des infrastructures d'IA en entreprise. Quand les données de cache KV (Key-Value), les informations qui permettent à un modèle de retrouver et réutiliser le contexte d'une interaction, ne sont pas disponibles dans un tier de stockage rapide, le système est obligé de les recalculer à chaque session. Ce processus de "re-prefill" mobilise des cycles GPU entiers sans produire aucun nouveau token, autrement dit sans créer aucune valeur. "Si votre stockage n'est pas à la hauteur, votre ROI en souffre directement", souligne Ace Stryker, directeur marketing IA chez Solidigm. L'architecture de stockage héritée de l'ère de l'entraînement, séquentielle, dominée par les grandes écritures en bloc, n'est tout simplement pas adaptée aux accès fins et latence-sensibles que requiert l'inférence moderne. La réponse qui émerge est une nouvelle couche dédiée, baptisée CMX par Nvidia, qui s'intercale entre la mémoire HBM des GPU et le stockage réseau en masse. Ce tier intermédiaire, constitué de SSD haute performance et haute densité optimisés pour les charges d'inférence, est conçu pour héberger et servir rapidement le cache KV ainsi que les données de récupération utilisées dans les architectures RAG. Solidigm fait partie des fabricants de stockage qui développent des produits SSD spécifiquement taillés pour cette architecture. Jusqu'ici, le stockage était traité comme une commodité dans les plans d'infrastructure IA, on cherchait simplement le meilleur prix au gigaoctet. Ce paradigme est en train de changer en profondeur, à mesure que les systèmes agentiques persistants font du stockage un composant critique de la chaîne de performance des grands modèles de langage.

InfrastructureActu
1 source
SK Hynix en Bourse aux États-Unis : la mémoire HBM devient le nouvel or noir de l’IA
2Le Big Data 

SK Hynix en Bourse aux États-Unis : la mémoire HBM devient le nouvel or noir de l’IA

SK Hynix a déposé une demande de cotation aux États-Unis visant à lever environ 28 milliards de dollars, soit près de 43 000 milliards de wons, selon des documents réglementaires cités par Reuters. L'opération porte sur 17,79 millions de nouvelles actions représentées par des certificats de dépôt négociés au Nasdaq. Plusieurs grands investisseurs ont déjà manifesté un intérêt qui pourrait atteindre 7 milliards de dollars. Ce serait l'une des plus importantes levées de fonds mondiales par émission d'actions de l'année. Le groupe coréen s'est imposé comme un fournisseur clé de mémoire à large bande passante, la HBM, utilisée dans les infrastructures d'intelligence artificielle de Nvidia et de Google. Les capitaux récoltés doivent financer la construction de nouvelles usines en Corée du Sud ainsi que l'achat d'équipements de fabrication de puces de pointe, dont des systèmes de lithographie ultraviolette extrême produits par ASML. L'action SK Hynix affiche une progression d'environ 260% depuis le début de l'année 2026, portée par l'essor de la demande en IA malgré la volatilité récente des valeurs du secteur mémoire. Cette opération illustre un basculement stratégique dans l'industrie de l'IA, où la puissance de calcul des processeurs ne suffit plus à elle seule. Pour entraîner et exécuter de grands modèles, les accélérateurs doivent déplacer d'énormes volumes de données à très grande vitesse, et c'est précisément ce que permet la HBM en rapprochant plusieurs couches de mémoire pour démultiplier la quantité de données accessible aux processeurs. Ce composant est devenu aussi stratégique que difficile à remplacer, au point que les clients cherchent désormais à sécuriser leurs approvisionnements sur plusieurs années. Pour les entreprises qui investissent massivement dans l'IA, le coût d'une infrastructure ne dépend plus seulement du nombre de GPU achetés : la disponibilité de la mémoire, son débit et sa capacité à alimenter les accélérateurs pèsent directement sur le prix et le calendrier des projets de data centers. Cette envolée s'inscrit dans un contexte de tensions plus larges sur le marché mondial de la mémoire. La concentration des investissements sur les produits HBM les plus avancés tend l'équilibre sur d'autres segments, la demande des data centers stimulant aussi la DRAM pour serveurs et les solutions NAND destinées au stockage d'entreprise, ce qui a déjà fait grimper les prix des puces mémoire et commence à affecter d'autres marchés, des smartphones aux PC. Face à ces enjeux, Séoul a dévoilé un programme de 576 milliards de dollars consacré aux semi-conducteurs, signe que la Corée du Sud considère désormais la chaîne d'approvisionnement en mémoire comme un enjeu de souveraineté industrielle autant que commercial, dans une course mondiale où Samsung et Micron cherchent eux aussi à accélérer leurs propres capacités de production HBM.

InfrastructureActu
1 source
Micron et Anthropic s’allient pour renforcer l’infrastructure IA de nouvelle génération
3Le Big Data 

Micron et Anthropic s’allient pour renforcer l’infrastructure IA de nouvelle génération

Micron Technology et Anthropic ont annoncé le 22 juin 2026 un accord stratégique multidimensionnel qui couvre quatre axes : la co-conception d'architectures de mémoire et de stockage optimisées pour l'IA, un contrat d'approvisionnement à long terme portant sur l'ensemble du portefeuille de solutions pour centres de données de Micron, le déploiement interne de Claude dans les équipes de Micron, et une participation financière du fabricant de semi-conducteurs au tour de financement Série H d'Anthropic. Les deux entreprises travailleront conjointement sur les technologies de mémoire HBM (High Bandwidth Memory), les modules DRAM haute performance et les SSD destinés aux data centers, ces composants étant au cœur des infrastructures utilisées pour entraîner et faire tourner les modèles Claude. Tom Brown, cofondateur d'Anthropic et responsable des ressources de calcul, a souligné que la mémoire et le stockage jouent désormais un rôle central dans l'efficacité des systèmes d'entraînement et d'inférence de l'entreprise. L'accord illustre un changement de paradigme dans l'industrie de l'IA : les performances d'un modèle dépendent autant de l'infrastructure matérielle sous-jacente que des avancées algorithmiques. Si les GPU concentrent souvent l'attention, la capacité à les alimenter en données à très haute vitesse est devenue un facteur déterminant pour les coûts, les performances et la consommation énergétique des infrastructures à grande échelle. En optimisant directement les sous-systèmes mémoire utilisés par Anthropic, les deux partenaires cherchent à réduire le coût unitaire de chaque requête traitée par Claude, un levier concurrentiel décisif à mesure que le marché de l'IA générative se masse-marketise. L'accord d'approvisionnement sécurise par ailleurs la croissance d'Anthropic sur plusieurs années, limitant les risques de pénurie de composants critiques dans un marché en tension. Ce partenariat s'inscrit dans une stratégie plus large d'Anthropic visant à consolider ses fondations matérielles face à l'accélération de la demande autour de Claude. Reuters relevait récemment qu'Anthropic a multiplié les accords destinés à renforcer ses capacités de calcul, au moment même où le laboratoire enchaîne les levées de fonds record pour rivaliser avec OpenAI et Google DeepMind. Pour Micron, l'opération représente une opportunité de positionner ses technologies HBM comme composants de référence dans les futures générations d'infrastructure IA, un marché en croissance explosive. La collaboration technique directe avec un laboratoire de premier plan lui permet d'anticiper les besoins des prochains modèles et d'adapter son offre bien en amont, transformant un client potentiel en co-développeur.

InfrastructureOpinion
1 source
Google prévoit une nouvelle puce « Frozen » pour exécuter ses modèles d'IA bien plus efficacement
4The Information AI 

Google prévoit une nouvelle puce « Frozen » pour exécuter ses modèles d'IA bien plus efficacement

Google prépare une nouvelle puce serveur qui intégrerait directement l'architecture de son modèle d'intelligence artificielle Gemini, afin de faire fonctionner ses modèles de façon beaucoup plus efficace, selon deux personnes proches du dossier. Ce processeur, surnommé en interne "Frozen v2", vise à répondre à une pénurie importante de capacité de calcul IA, une situation qui a généré des tensions internes chez Google et contraint Google Cloud à refuser des contrats avec des clients externes. Les équipes travaillant sur ce projet estiment que la puce pourrait être six à dix fois plus efficace que la dernière génération de puces IA maison de Google, mesurée en nombre de tokens (l'unité de base de consommation d'un modèle d'IA) traités par unité d'énergie consommée. Cette avancée serait déterminante pour l'activité cloud de Google, confrontée à une demande croissante qu'elle peine actuellement à satisfaire. Une puce nettement plus économe en énergie permettrait de servir davantage d'utilisateurs et d'entreprises clientes sans multiplier les investissements en infrastructure, tout en réduisant les coûts d'exploitation liés à l'IA. Cela renforcerait aussi la position de Google face à ses concurrents dans la course aux semi-conducteurs spécialisés, où la disponibilité de puces performantes est devenue un facteur clé de compétitivité. Ce projet s'inscrit dans la lignée des puces maison de Google, conçues depuis plusieurs années pour réduire sa dépendance aux fabricants externes comme Nvidia. La spécificité de "Frozen v2" est d'intégrer directement le modèle Gemini dans la conception matérielle, une approche de co-conception censée maximiser les gains d'efficacité. Cette pénurie de capacité de calcul touche l'ensemble du secteur, où Google, Microsoft, Amazon et OpenAI se disputent des ressources limitées pour entraîner et déployer leurs modèles à grande échelle.

UELes entreprises européennes clientes de Google Cloud pourraient bénéficier indirectement d'une meilleure disponibilité de capacité de calcul IA si cette puce réduit la pénurie actuelle.

InfrastructureActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic