Aller au contenu principal
Meta lance KernelEvolve, un agent IA pour optimiser les infrastructures d'entraînement
InfrastructureMeta Engineering ML · 2 min de lecture

Meta lance KernelEvolve, un agent IA pour optimiser les infrastructures d'entraînement

Source originale ↗·

Meta a présenté KernelEvolve, un système d'optimisation de kernels piloté par intelligence artificielle, développé en interne pour accélérer ses modèles de publicité et d'IA générative. Intégré à l'agent Ranking Engineer Agent, KernelEvolve automatise la création et l'optimisation de kernels, ces programmes bas niveau qui traduisent les opérations de haut niveau d'un modèle en instructions spécifiques à chaque puce. Le système cible une infrastructure hétérogène composée de GPU NVIDIA, de GPU AMD, de CPU classiques et des puces MTIA, les accélérateurs personnalisés de Meta. Les résultats publiés sont substantiels : plus de 60 % d'amélioration du débit d'inférence pour le modèle publicitaire Andromeda sur GPU NVIDIA, et plus de 25 % de gain en débit d'entraînement sur les puces MTIA. Des travaux qui auraient normalement demandé plusieurs semaines à des ingénieurs spécialisés ont été accomplis en quelques heures. L'article associé sera présenté au 53e International Symposium on Computer Architecture (ISCA) 2026.

L'enjeu est direct et massif : Meta sert chaque jour des milliards d'expériences alimentées par l'IA, des recommandations personnalisées aux assistants génératifs. Chaque requête d'entraînement ou d'inférence repose sur une couche de kernels hautement optimisés, et à mesure que les modèles gagnent en complexité et que le parc matériel se diversifie, le nombre de configurations possibles explose, atteignant des milliers de combinaisons selon le hardware, l'architecture du modèle et le type d'opérateur. L'optimisation manuelle par des experts ne peut plus suivre ce rythme, créant un goulot d'étranglement critique qui freine l'adoption de nouveaux matériels et ralentit les cycles d'itération des modèles. KernelEvolve résout ce problème en traitant l'optimisation comme une recherche automatisée : un environnement d'évaluation dédié teste chaque kernel candidat, renvoie les diagnostics au LLM, et pilote une exploration continue sur des centaines d'alternatives, dépassant les performances des kernels écrits à la main par des experts humains.

Cette initiative s'inscrit dans une tendance de fond chez les grandes plateformes technologiques : déléguer des tâches d'ingénierie de bas niveau à des agents IA pour absorber la complexité croissante des infrastructures de calcul. Meta fait face à la même contrainte que Google, Microsoft ou Amazon, accélérer sans cesse les modèles tout en maîtrisant les coûts de calcul sur un parc matériel qui ne cesse de se diversifier. KernelEvolve génère des kernels dans des langages aussi bien de haut niveau comme Triton ou CuteDSL que de bas niveau comme CUDA, HIP ou MTIA C++, ce qui lui confère une portabilité rare. À terme, ce type d'agent pourrait devenir standard dans l'industrie, réduisant drastiquement le besoin d'ingénieurs spécialisés en optimisation matérielle et accélérant la mise en production de nouvelles architectures de modèles sur des puces encore inconnues.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

NVIDIA et Marvell s’unissent pour révolutionner les infrastructures IA
1Le Big Data 

NVIDIA et Marvell s’unissent pour révolutionner les infrastructures IA

NVIDIA et Marvell Technology ont annoncé un partenariat stratégique majeur, scellé par un investissement de 2 milliards de dollars de NVIDIA dans Marvell. L'accord s'articule autour de NVLink Fusion, une plateforme modulaire permettant de construire des infrastructures d'IA semi-personnalisées. Concrètement, Marvell apportera des XPU (processeurs accélérés sur mesure) et un réseau évolutif compatible, tandis que NVIDIA fournit l'ensemble de son arsenal matériel : processeurs Vera, cartes réseau ConnectX, DPU BlueField, interconnexion NVLink, commutateurs Spectrum-X et capacité de calcul déployable en rack. Le titre Marvell a bondi de 11 % dès l'annonce mardi, signe que les marchés ont immédiatement perçu la portée de l'accord. Le partenariat couvre également les réseaux télécoms, via NVIDIA Aerial AI-RAN, avec des ambitions sur la 5G et la future 6G, ainsi que sur des technologies d'interconnexion optique et de photonique sur silicium pour améliorer les performances et réduire la consommation énergétique. Pour les entreprises qui développent leurs propres puces d'accélération, NVLink Fusion ouvre la voie à des architectures hybrides entièrement compatibles avec l'écosystème NVIDIA, GPU, réseau et stockage compris. C'est un changement structurel : jusqu'ici, intégrer des composants tiers dans une infrastructure NVIDIA relevait du casse-tête d'interopérabilité. Désormais, les hyperscalers, opérateurs télécom et acteurs du cloud pourront combiner des XPU Marvell avec la stack NVIDIA sans friction. Pour les utilisateurs finaux, l'impact est indirect mais réel : des modèles d'IA générative plus complexes pourront tourner à moindre latence, ce qui se traduit par des services de recommandation, de création de contenu ou de simulation plus réactifs. Dans les télécoms, l'alliance prépare le terrain pour des réseaux 5G/6G capables de supporter des usages exigeants comme la télémédecine en temps réel ou les véhicules autonomes. Ce rapprochement s'inscrit dans un contexte de demande explosive en capacité de calcul, portée par la généralisation de l'IA générative et l'explosion des volumes de données. Jensen Huang, PDG de NVIDIA, parle lui-même d'une "ère de supercalcul" en cours d'avènement. Face à cette pression, les grandes entreprises technologiques mondiales s'engagent dans une course à la construction de centres de calcul dédiés, et NVIDIA cherche à s'imposer comme la colonne vertébrale incontournable de ces infrastructures. Marvell, de son côté, se repositionne comme fournisseur clé de silicium personnalisé pour l'IA, un marché en pleine effervescence où Amazon, Google et Microsoft développent déjà leurs propres puces. L'investissement de 2 milliards de dollars de NVIDIA dans Marvell est autant un signal industriel qu'une manœuvre défensive : consolider l'écosystème avant que les alternatives ne s'imposent.

UELes opérateurs télécom et fournisseurs cloud européens pourront intégrer des architectures hybrides XPU Marvell / stack NVIDIA sans friction, accélérant leurs déploiements 5G/6G et d'IA générative.

💬 NVIDIA ne se contente plus de vendre des GPU, il construit le système nerveux de toute l'infrastructure IA. NVLink Fusion, c'est le genre de coup qu'on voit venir mais dont on mesure mal l'ampleur : permettre à Marvell (et demain à d'autres) de brancher leurs puces custom directement dans l'écosystème NVIDIA, c'est verrouiller le marché de façon beaucoup plus subtile qu'un simple rachat. Les 2 milliards d'investissement, c'est pas de la philanthropie, c'est de la consolidation défensive avant qu'AMD ou les hyperscalers in-house ne s'imposent.

InfrastructureOpinion
1 source
2Meta Engineering ML 

Les agents IA unifiés de Meta optimisent les performances à grande échelle

Meta a développé une plateforme d'agents IA unifiée pour automatiser la détection et la résolution des problèmes de performance à l'échelle de son infrastructure mondiale, qui sert plus de 3 milliards d'utilisateurs. Ce programme, baptisé Capacity Efficiency Program, repose sur des agents capables d'encoder l'expertise de ses ingénieurs seniors en compétences réutilisables et composables. Résultat concret : des centaines de mégawatts (MW) de puissance électrique récupérés, soit de quoi alimenter des centaines de milliers de foyers américains pendant un an. L'outil interne FBDetect détecte chaque semaine des milliers de régressions de performance, et les agents IA prennent désormais en charge leur résolution automatisée, compressant environ dix heures d'investigation manuelle en trente minutes. Les agents vont même jusqu'à générer des pull requests prêtes à révision, couvrant l'intégralité du chemin depuis la détection d'une opportunité d'optimisation jusqu'à la correction du code. L'impact est double : économique et opérationnel. Côté défense, chaque régression non résolue rapidement se traduit par une consommation électrique supplémentaire qui s'accumule sur l'ensemble du parc de serveurs de Meta. Côté offensif, les agents permettent désormais d'explorer proactivement des optimisations dans un nombre croissant de domaines produits, des opportunités que les ingénieurs n'auraient jamais le temps de traiter manuellement. Le programme peut ainsi augmenter sa capacité de livraison de mégawatts sans augmenter proportionnellement les effectifs humains, ce qui représente un levier de scalabilité majeur pour une infrastructure de cette taille. Libérés des tâches d'investigation répétitives, les ingénieurs peuvent se concentrer sur l'innovation produit. Ce projet s'inscrit dans une tendance plus large chez les grandes plateformes technologiques : automatiser la gestion de la complexité interne à mesure que l'infrastructure croît plus vite que les équipes humaines. Chez Meta, la découverte clé a été que l'offense (recherche proactive d'optimisations) et la défense (détection de régressions) partagent la même structure de problème, ce qui a permis de construire une plateforme unique plutôt que deux systèmes séparés. L'interface d'outils standardisée est au cœur de l'architecture : elle permet aux agents de combiner investigation de données de profilage, consultation de documentation interne, analyse des déploiements récents et recherche de discussions liées. L'objectif à terme est un moteur d'efficacité autonome où l'IA gère la longue traîne des problèmes de performance, un modèle qui pourrait inspirer d'autres hyperscalers confrontés aux mêmes contraintes d'échelle.

InfrastructureActu
1 source
L'infrastructure IA doit évoluer pour l'expérience des agents (Akshat Bubna, CTO de Modal)
3Latent Space 

L'infrastructure IA doit évoluer pour l'expérience des agents (Akshat Bubna, CTO de Modal)

Modal, la plateforme cloud spécialisée dans l'infrastructure pour l'intelligence artificielle, vient de boucler une levée de série C de 355 millions de dollars, un signal fort de la traction prise par l'entreprise depuis sa série A de seulement 17 millions de dollars il y a deux ans. Dans un épisode du podcast Latent Space, le directeur technique de Modal, Akshat Bubna, est revenu avec les animateurs swyx et Vibhu sur l'évolution de la plateforme, née comme un simple runtime plus performant avant de devenir un cloud entièrement pensé pour les charges de travail liées à l'IA. Bubna y détaille l'arsenal technique déployé par Modal: fonctions serverless, infrastructure pilotée par décorateurs, inférence élastique pour des modèles personnalisés en audio, vidéo, robotique et biologie computationnelle, snapshotting de GPU, décodage spéculatif via une technologie maison baptisée DeFlash, ainsi que des sandboxes réseau avec adressage IPv6 privé et support RDMA pour l'entraînement multi-nœuds. Modal s'appuie désormais sur un pool de capacité réparti chez 17 fournisseurs cloud différents, une stratégie de "supercloud" censée absorber les pics de demande propres aux workloads d'IA. L'argument central de Bubna est que l'infrastructure cloud historique, conçue pour des développeurs humains capables de lire une documentation, de raisonner sur du YAML et d'interpréter un tableau de bord, ne convient plus à l'ère des agents autonomes. Contrairement à un humain qui peut combler les zones d'ombre d'un système avec son propre jugement, un agent a besoin d'un environnement beaucoup plus resserré: un espace pour écrire du code, l'exécuter, inspecter les résultats, modifier la configuration, déboguer et recommencer, avec des boucles de rétroaction rapides et un contexte complet. Ce changement de paradigme, que Modal résume par le passage d'une "expérience développeur" à une "expérience agent", a des conséquences concrètes pour l'industrie: les entraînements par renforcement peuvent nécessiter jusqu'à 100 000 sandboxes simultanées, et les agents en production exigent des garde-fous stricts ainsi qu'une observabilité renforcée, potentiellement plus importante que la simple lecture du code qu'ils génèrent. Ce virage s'inscrit dans un constat plus large partagé par Bubna: Kubernetes, l'outil d'orchestration dominant depuis une décennie, n'a jamais été conçu pour des charges de travail aussi explosives et gourmandes en calcul que celles générées par l'IA moderne, qu'il s'agisse d'inférence élastique, de sursauts GPU, de post-entraînement ou d'agents fonctionnant en arrière-plan. Modal a d'ailleurs intégré le support GPU avant même le lancement de ChatGPT, anticipant ce basculement. L'entreprise mise désormais sur des concepts comme les Auto Endpoints pour simplifier le déploiement d'inférences optimisées, sur des sandboxes accompagnées de sidecars réseau, et sur une approche dite d'"auto-recherche" où des agents peuvent eux-mêmes lancer des expériences guidées par des modèles sur des GPU. Cette levée de fonds massive doit permettre à Modal de renforcer sa capacité de calcul et de consolider sa position face à des concurrents comme Databricks, Daytona, Railway ou E2B sur ce marché émergent du cloud pour agents.

💬 J'y vois surtout un aveu: l'infra cloud pensée pour des humains qui lisent une doc ne tient plus face à des agents qui ont besoin de boucles de rétroaction en continu, exécuter, inspecter, recommencer. Bon, sur le papier ça justifie la levée à 355 millions, mais 100 000 sandboxes simultanées pour du RL, ça sent surtout la facture qui explose. Reste à voir si Modal tient la distance face à Databricks et E2B, ou si c'est juste une fenêtre de tir avant que les hyperscalers rattrapent le coup.

InfrastructureActu
1 source
NVIDIA Vera Rubin maximise l'intelligence par dollar pour les charges post-entraînement, une métrique clé pour l'IA à base d'agents
4NVIDIA AI Blog 

NVIDIA Vera Rubin maximise l'intelligence par dollar pour les charges post-entraînement, une métrique clé pour l'IA à base d'agents

Un athlète professionnel ne se distingue pas pendant le match, mais dans l'intervalle entre deux matchs, quand il ajuste sa technique face à un nouvel adversaire. NVIDIA applique cette logique à l'intelligence artificielle agentique avec sa plateforme Vera Rubin, conçue pour maximiser ce que l'entreprise appelle "l'intelligence par dollar" lors du post-entraînement, cette phase qui affine un modèle après son apprentissage initial sur des données brutes. Contrairement à un modèle génératif qui répond simplement à une requête, un modèle agentique doit planifier, utiliser différents outils et se rétablir seul face aux imprévus rencontrés en cours de tâche. Cet apprentissage repose sur des techniques de renforcement (RL) : le modèle rédige une tentative de réponse lors d'une passe avant (inférence), cette tentative est notée, puis la leçon tirée met à jour les poids du modèle lors d'une passe arrière. NVIDIA a illustré cette approche avec Nemotron 3 Ultra, un modèle ouvert à mixture d'experts de 550 milliards de paramètres, entraîné via la bibliothèque NeMo RL, qui a obtenu un score de 71,7% sur SWE-bench Verified, un benchmark de référence pour l'évaluation du codage en conditions réelles. Cette évolution change fondamentalement l'économie du calcul dans l'industrie de l'IA. Le post-entraînement n'est plus une étape ponctuelle de finition mais un processus continu, car les environnements dans lesquels opèrent les agents évoluent en permanence : les outils utilisés changent d'une semaine à l'autre, des cas limites imprévus par les jeux de test apparaissent en production, et chaque déploiement implique son propre code, ses propres règles et son propre environnement. L'empreinte de calcul ne grossit donc pas parce qu'une seule exécution devient plus lourde, mais parce que ces cycles d'entraînement ne s'arrêtent jamais. Pour les entreprises qui construisent et déploient des agents IA, cela signifie que la valeur d'un modèle ne se mesure plus seulement au coût par token généré lors de l'inférence, mais à la capacité de continuer à investir dans son intelligence à mesure que son environnement de production change, un enjeu direct pour la rentabilité de ces systèmes à grande échelle. Cette approche s'inscrit dans un effort plus large de NVIDIA pour transformer le post-entraînement, longtemps considéré comme un travail de recherche artisanal, en infrastructure reproductible à l'échelle industrielle. Les bibliothèques ouvertes NeMo Gym, pour créer des environnements d'entraînement, et NeMo RL, pour l'entraînement distribué, visent à orchestrer des milliers d'environnements générant des tentatives en parallèle, avec vérification des récompenses et mise à jour des poids en continu, tout en maintenant les accélérateurs pleinement utilisés. L'enjeu stratégique pour NVIDIA est de positionner sa plateforme matérielle Vera Rubin comme le socle indispensable de cette nouvelle génération de calcul intensif, où le coût par token d'inférence et l'intelligence construite par dollar investi deviennent deux mesures complémentaires plutôt que concurrentes. À mesure que les entreprises technologiques déploient des agents IA de plus en plus autonomes dans des environnements réels, la capacité à financer et industrialiser ce cycle d'apprentissage continu pourrait devenir un facteur déterminant de compétitivité dans le secteur.

💬 Bon, sur le papier c'est malin : NVIDIA arrête de vendre le post-entraînement comme une finition ponctuelle et le repositionne comme un flux continu, parce que les agents en prod rencontrent sans cesse des cas que personne n'avait testés. Le vrai message, c'est que le coût par token à l'inférence ne dit plus grand-chose tout seul, ce qui compte c'est le coût pour continuer à réentraîner le modèle chaque fois que son environnement change. Ça sent la stratégie commerciale évidente derrière (vendre du Vera Rubin en continu plutôt qu'un pic ponctuel), mais l'intuition économique tient : les boîtes qui déploient des agents vont payer pour l'apprentissage permanent, pas juste pour la réponse.

InfrastructureActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic