Aller au contenu principal
Red Hat et NVIDIA dévoilent une nouvelle infrastructure dédiée aux agents IA
InfrastructureLe Big Data · 2 min de lecture

Red Hat et NVIDIA dévoilent une nouvelle infrastructure dédiée aux agents IA

Source originale ↗·

Red Hat et NVIDIA ont annoncé le 8 juin 2026, à l'occasion du Red Hat Summit 2026, une série d'évolutions majeures de leur plateforme conjointe Red Hat AI Factory. L'objectif affiché est de permettre aux entreprises de faire passer leurs agents IA autonomes du stade expérimental à la production à grande échelle. Parmi les nouveautés figurent l'intégration d'OpenShell, un projet open source initié par NVIDIA qui fournit un environnement d'exécution isolé pour agents autonomes, ainsi qu'un nouveau modèle MaaS (Model as a Service) gouverné offrant un accès à des modèles comme NVIDIA Nemotron via des interfaces compatibles avec les standards OpenAI. La plateforme embarque également un système de gestion du cycle de vie fondé sur MLflow, qui trace chaque appel aux modèles, les outils sollicités et les étapes de raisonnement des agents. En matière de sécurité, des capacités de calcul confidentiel basées sur NVIDIA Confidential Computing permettent désormais d'exécuter des conteneurs confidentiels au sein de Red Hat OpenShift, disponibles en préversion technologique.

Cette annonce s'adresse directement aux entreprises qui butent sur les obstacles concrets à l'adoption industrielle de l'IA agentique : sécurité des données, auditabilité des décisions, conformité réglementaire. Contrairement aux assistants conversationnels classiques, les agents autonomes interagissent avec de multiples systèmes, exécutent des tâches complexes sur la durée et prennent des décisions sans intervention humaine permanente, ce qui exige un cadre de gouvernance nettement plus robuste. La traçabilité offerte par MLflow répond à une demande pressante des directions juridiques et de conformité, qui doivent justifier les actions automatisées de leurs systèmes IA. L'architecture zero-trust et le calcul confidentiel visent quant à eux à protéger les charges de travail sensibles, même dans des environnements cloud hybrides où les données circulent entre infrastructures on-premise et cloud public.

Ce partenariat entre Red Hat et NVIDIA s'inscrit dans une compétition croissante entre les grands acteurs du cloud hybride et des semi-conducteurs pour imposer leurs stacks comme infrastructure standard de l'IA d'entreprise. NVIDIA, dont les GPU dominent l'entraînement des modèles, cherche à étendre son influence vers les couches logicielles de déploiement et de gouvernance, tandis que Red Hat apporte son positionnement historique dans les environnements OpenShift et son crédit auprès des DSI des grandes entreprises. La standardisation de la gouvernance des agents via OpenShell est particulièrement stratégique : celui qui contrôle la couche de politique d'exécution des agents contrôle de fait l'ensemble de l'écosystème applicatif qui s'y connecte. Les prochaines étapes passeront par l'intégration native d'OpenShell à l'écosystème Red Hat, avec une disponibilité générale attendue après la préversion actuelle.

Impact France/UE

Les entreprises européennes soumises à l'AI Act peuvent s'appuyer sur la traçabilité MLflow et le calcul confidentiel pour répondre aux exigences d'auditabilité et de gouvernance des systèmes d'IA à haut risque.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

NVIDIA et Marvell s’unissent pour révolutionner les infrastructures IA
1Le Big Data 

NVIDIA et Marvell s’unissent pour révolutionner les infrastructures IA

NVIDIA et Marvell Technology ont annoncé un partenariat stratégique majeur, scellé par un investissement de 2 milliards de dollars de NVIDIA dans Marvell. L'accord s'articule autour de NVLink Fusion, une plateforme modulaire permettant de construire des infrastructures d'IA semi-personnalisées. Concrètement, Marvell apportera des XPU (processeurs accélérés sur mesure) et un réseau évolutif compatible, tandis que NVIDIA fournit l'ensemble de son arsenal matériel : processeurs Vera, cartes réseau ConnectX, DPU BlueField, interconnexion NVLink, commutateurs Spectrum-X et capacité de calcul déployable en rack. Le titre Marvell a bondi de 11 % dès l'annonce mardi, signe que les marchés ont immédiatement perçu la portée de l'accord. Le partenariat couvre également les réseaux télécoms, via NVIDIA Aerial AI-RAN, avec des ambitions sur la 5G et la future 6G, ainsi que sur des technologies d'interconnexion optique et de photonique sur silicium pour améliorer les performances et réduire la consommation énergétique. Pour les entreprises qui développent leurs propres puces d'accélération, NVLink Fusion ouvre la voie à des architectures hybrides entièrement compatibles avec l'écosystème NVIDIA — GPU, réseau et stockage compris. C'est un changement structurel : jusqu'ici, intégrer des composants tiers dans une infrastructure NVIDIA relevait du casse-tête d'interopérabilité. Désormais, les hyperscalers, opérateurs télécom et acteurs du cloud pourront combiner des XPU Marvell avec la stack NVIDIA sans friction. Pour les utilisateurs finaux, l'impact est indirect mais réel : des modèles d'IA générative plus complexes pourront tourner à moindre latence, ce qui se traduit par des services de recommandation, de création de contenu ou de simulation plus réactifs. Dans les télécoms, l'alliance prépare le terrain pour des réseaux 5G/6G capables de supporter des usages exigeants comme la télémédecine en temps réel ou les véhicules autonomes. Ce rapprochement s'inscrit dans un contexte de demande explosive en capacité de calcul, portée par la généralisation de l'IA générative et l'explosion des volumes de données. Jensen Huang, PDG de NVIDIA, parle lui-même d'une "ère de supercalcul" en cours d'avènement. Face à cette pression, les grandes entreprises technologiques mondiales s'engagent dans une course à la construction de centres de calcul dédiés, et NVIDIA cherche à s'imposer comme la colonne vertébrale incontournable de ces infrastructures. Marvell, de son côté, se repositionne comme fournisseur clé de silicium personnalisé pour l'IA — un marché en pleine effervescence où Amazon, Google et Microsoft développent déjà leurs propres puces. L'investissement de 2 milliards de dollars de NVIDIA dans Marvell est autant un signal industriel qu'une manœuvre défensive : consolider l'écosystème avant que les alternatives ne s'imposent.

UELes opérateurs télécom et fournisseurs cloud européens pourront intégrer des architectures hybrides XPU Marvell / stack NVIDIA sans friction, accélérant leurs déploiements 5G/6G et d'IA générative.

💬 NVIDIA ne se contente plus de vendre des GPU, il construit le système nerveux de toute l'infrastructure IA. NVLink Fusion, c'est le genre de coup qu'on voit venir mais dont on mesure mal l'ampleur : permettre à Marvell (et demain à d'autres) de brancher leurs puces custom directement dans l'écosystème NVIDIA, c'est verrouiller le marché de façon beaucoup plus subtile qu'un simple rachat. Les 2 milliards d'investissement, c'est pas de la philanthropie, c'est de la consolidation défensive avant qu'AMD ou les hyperscalers in-house ne s'imposent.

InfrastructureOpinion
1 source
Micron et Anthropic s’allient pour renforcer l’infrastructure IA de nouvelle génération
2Le Big Data 

Micron et Anthropic s’allient pour renforcer l’infrastructure IA de nouvelle génération

Micron Technology et Anthropic ont annoncé le 22 juin 2026 un accord stratégique multidimensionnel qui couvre quatre axes : la co-conception d'architectures de mémoire et de stockage optimisées pour l'IA, un contrat d'approvisionnement à long terme portant sur l'ensemble du portefeuille de solutions pour centres de données de Micron, le déploiement interne de Claude dans les équipes de Micron, et une participation financière du fabricant de semi-conducteurs au tour de financement Série H d'Anthropic. Les deux entreprises travailleront conjointement sur les technologies de mémoire HBM (High Bandwidth Memory), les modules DRAM haute performance et les SSD destinés aux data centers, ces composants étant au cœur des infrastructures utilisées pour entraîner et faire tourner les modèles Claude. Tom Brown, cofondateur d'Anthropic et responsable des ressources de calcul, a souligné que la mémoire et le stockage jouent désormais un rôle central dans l'efficacité des systèmes d'entraînement et d'inférence de l'entreprise. L'accord illustre un changement de paradigme dans l'industrie de l'IA : les performances d'un modèle dépendent autant de l'infrastructure matérielle sous-jacente que des avancées algorithmiques. Si les GPU concentrent souvent l'attention, la capacité à les alimenter en données à très haute vitesse est devenue un facteur déterminant pour les coûts, les performances et la consommation énergétique des infrastructures à grande échelle. En optimisant directement les sous-systèmes mémoire utilisés par Anthropic, les deux partenaires cherchent à réduire le coût unitaire de chaque requête traitée par Claude, un levier concurrentiel décisif à mesure que le marché de l'IA générative se masse-marketise. L'accord d'approvisionnement sécurise par ailleurs la croissance d'Anthropic sur plusieurs années, limitant les risques de pénurie de composants critiques dans un marché en tension. Ce partenariat s'inscrit dans une stratégie plus large d'Anthropic visant à consolider ses fondations matérielles face à l'accélération de la demande autour de Claude. Reuters relevait récemment qu'Anthropic a multiplié les accords destinés à renforcer ses capacités de calcul, au moment même où le laboratoire enchaîne les levées de fonds record pour rivaliser avec OpenAI et Google DeepMind. Pour Micron, l'opération représente une opportunité de positionner ses technologies HBM comme composants de référence dans les futures générations d'infrastructure IA, un marché en croissance explosive. La collaboration technique directe avec un laboratoire de premier plan lui permet d'anticiper les besoins des prochains modèles et d'adapter son offre bien en amont, transformant un client potentiel en co-développeur.

InfrastructureOpinion
1 source
NVIDIA Blackwell domine le premier benchmark d'infrastructure pour agents autonomes d'IA
3NVIDIA AI Blog 

NVIDIA Blackwell domine le premier benchmark d'infrastructure pour agents autonomes d'IA

Artificial Analysis a publié AgentPerf, le premier benchmark sectoriel conçu spécifiquement pour évaluer les infrastructures d'IA agentique. Dans ce premier tour de résultats, la plateforme NVIDIA GB300 NVL72, basée sur l'architecture Blackwell Ultra, s'impose comme le système le plus performant : elle peut faire tourner jusqu'à 20 fois plus d'agents par mégawatt que l'ancienne génération HGX H200 (Hopper), quel que soit le seuil de qualité de service retenu (20 ou 60 tokens par seconde par agent). Le modèle de référence utilisé pour ce test est DeepSeek V4 Pro, un grand modèle de type mixture-of-experts représentatif des LLM qui propulsent aujourd'hui les agents les plus capables. La distinction entre IA conversationnelle et IA agentique est au coeur de cette initiative. Un chatbot classique réalise un seul appel LLM par échange : c'est un sprint. Un agent, lui, enchaîne des dizaines voire des centaines d'appels LLM entrelacés d'appels à des outils externes, compilation de code, recherche en base de données, navigation web, en transmettant à chaque étape un contexte de plus en plus long. La complexité n'est pas additive, elle est multiplicative. Les benchmarks d'inférence existants ne mesuraient qu'un seul appel LLM isolé et n'avaient pas été conçus pour capturer cette réalité. Pour une entreprise qui déploie des agents à grande échelle, les métriques pertinentes sont la réactivité des agents, le nombre d'instances simultanées supportées, et surtout le volume de travail utile produit par dollar et par watt investis. La performance du GB300 NVL72 repose sur une co-conception poussée de l'ensemble de la pile logicielle et matérielle. Le système interconnecte 72 GPU en une seule unité rack, ce qui permet aux grands modèles MoE comme DeepSeek V4 Pro de distribuer leur exécution efficacement. Les noyaux CUDA chevauchent communication et calcul pour absorber la latence de coordination entre experts. TensorRT-LLM sépare le traitement des entrées de la génération des sorties afin d'optimiser chaque phase indépendamment. AgentPerf lui-même est construit à partir de trajectoires réelles d'agents de codage opérant sur des dépôts publics couvrant plus de 12 langages de programmation, avec des longueurs de séquences, des délais d'appels d'outils et des patterns représentatifs de la production. Ce benchmark arrive à un moment où l'industrie bascule massivement vers des architectures agentiques, et où le choix d'infrastructure devient un avantage concurrentiel direct pour quiconque déploie ces systèmes à l'échelle.

UELes entreprises et cloud providers européens déployant des agents IA à grande échelle peuvent utiliser ce benchmark pour orienter leurs décisions d'achat de matériel.

💬 Vingt fois plus d'agents par mégawatt, c'est pas anodin. Ce qui m'intéresse surtout dans ce benchmark, c'est qu'il mesure enfin ce qui compte vraiment : pas un seul appel LLM en isolation, mais des chaînes complètes avec des dizaines d'appels et du contexte qui s'accumule à chaque étape. Reste à voir si ça se confirme sur des tâches moins lisses que du code sur des dépôts publics.

InfrastructureActu
1 source
NVIDIA ouvre son informatique IA à grande échelle et invite ses partenaires à soutenir le développement de l'infrastructure IA
4NVIDIA AI Blog 

NVIDIA ouvre son informatique IA à grande échelle et invite ses partenaires à soutenir le développement de l'infrastructure IA

NVIDIA a dévoilé un nouveau modèle économique destiné à ouvrir l'accès à ses infrastructures de calcul aux startups d'IA, créateurs de modèles, entreprises et organismes de recherche qui manquaient jusqu'ici de capital pour financer des équipements aussi coûteux. Ce dispositif repose sur un partage de revenus avec des "AI clouds" partenaires : ces fournisseurs de cloud vendront des services alimentés par la technologie NVIDIA, l'entreprise percevant à la fois le revenu classique lié à la vente de matériel et une part des revenus générés par la capacité mise à disposition. Deux entreprises figurent parmi les premières à s'engager dans ce cadre. Sharon AI va déployer jusqu'à 40 000 GPU NVIDIA Grace Blackwell GB300, dans ce que son cofondateur et PDG James Manning décrit comme une étape clé de la mission de l'entreprise pour offrir une infrastructure de calcul IA souveraine et à grande échelle. Firmus, de son côté, construit un site "DSX AI factory" à Batam, en Indonésie, dont la puissance devrait atteindre 360 mégawatts pour jusqu'à 170 000 GPU NVIDIA. Selon Tim Rosenfield, co-PDG de Firmus Technologies, les entreprises spécialisées en IA ont besoin d'un accès à une infrastructure de calcul évolutive, économe en énergie et en coûts, pour rester compétitives à l'échelle mondiale. Cette initiative répond à un changement structurel de la demande en calcul : l'IA passe désormais du stade de l'entraînement de modèles à celui de la production à grande échelle, avec des "usines à IA" qui doivent tourner en continu pour générer des tokens en volume. Or les jeunes pousses du secteur peinaient à obtenir des financements pour ce type d'infrastructure, même lorsqu'elles disposaient d'engagements clients à long terme, faute de garanties suffisantes pour les prêteurs. En alignant ses intérêts économiques sur ceux des clouds partenaires, NVIDIA espère accélérer l'adoption de ses plateformes par le segment le plus dynamique du marché, tout en s'assurant un flux de revenus récurrent indexé sur l'usage réel. Pour les créateurs de modèles, fournisseurs d'inférence et plateformes d'agents, cela signifie un accès plus rapide à du calcul accéléré de bout en bout, sans avoir à attendre les longues étapes de sélection de site, d'approvisionnement énergétique, de construction et de mise en service du matériel. Des acteurs déjà bien installés dans l'écosystème, comme Baseten, Fireworks AI et Together AI, illustrent où se dirige la demande : ils ont besoin d'un accès immédiat à de la capacité cloud pour l'entraînement, le post-entraînement, l'ajustement fin et l'inférence agentique à fort volume, au service de développeurs et d'entreprises qui déploient l'IA en production. Leurs clients recherchent un accès fiable à du calcul NVIDIA à mesure que leur usage grandit, tout en gardant une flexibilité commerciale pour passer du stade pilote à la production. Ce nouveau modèle s'inscrit dans la stratégie plus large de NVIDIA de structurer un réseau mondial de partenaires cloud et d'usines à IA, conçu pour soutenir la montée en puissance rapide de l'intelligence artificielle générative et agentique dans les prochaines années.

💬 NVIDIA ne vend plus juste des puces, il devient actionnaire de la demande : en prenant une part des revenus de ses clouds partenaires, il aligne son intérêt sur le taux d'usage réel des GPU, pas sur le seul volume de vente. Bon, sur le papier ça débloque enfin les startups qui avaient les clients mais pas les garanties bancaires pour financer une usine à IA. Reste que ça renforce encore la dépendance de tout l'écosystème inférence à un seul fournisseur, et ça, ça devrait inquiéter plus de monde que ça n'en a l'air.

InfrastructureActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic