Aller au contenu principal
À 45°C, une percée pour refroidir les plus grandes machines de l'IA
InfrastructureNVIDIA AI Blog · 2 min de lecture

À 45°C, une percée pour refroidir les plus grandes machines de l'IA

Source originale ↗·

La nouvelle génération de serveurs IA de NVIDIA, la plateforme Rubin, franchit un cap technologique en devenant la première infrastructure de calcul à atteindre 100 % de refroidissement liquide, chaque puce, chaque composant réseau, sans le moindre ventilateur. Le liquide de refroidissement circule dans un circuit fermé à une température pouvant atteindre 45 degrés Celsius, soit 13 degrés de plus que la température habituelle d'un jacuzzi. Cette architecture est formalisée dans le NVIDIA DSX AI Factory Reference Design, un guide de référence pour concevoir, construire et exploiter l'ensemble de la pile d'infrastructure d'une usine d'IA. Ali Heydari, directeur du refroidissement et de l'infrastructure de centres de données chez NVIDIA, résume l'ambition : « Nous avons éliminé d'énormes quantités de consommation électrique et pratiquement toute consommation d'eau. »

L'enjeu économique et environnemental est considérable. Historiquement, le seul refroidissement représente jusqu'à 40 % de la consommation électrique d'un centre de données, l'un des postes où les gains d'efficacité ont le plus d'impact. Les estimations sectorielles indiquent qu'augmenter la température des systèmes de refroidissement d'un seul degré réduit les coûts énergétiques associés d'environ 4 %. À l'échelle d'une installation hyperscale de 50 mégawatts, le passage à une infrastructure entièrement refroidie par liquide génère plus de 4 millions de dollars d'économies annuelles sur les coûts d'énergie et d'eau. Plus frappant encore : les centres de données conventionnels à refroidissement par air consomment environ 2,6 millions de gallons d'eau par mégawatt et par an via leurs tours de refroidissement évaporatives. L'architecture à 45°C de NVIDIA ramène ce chiffre à zéro dans la plupart des conditions climatiques, grâce à des refroidisseurs à sec en circuit fermé qui n'ont pas besoin de chiller la majorité de l'année.

Ce virage technologique s'inscrit dans une trajectoire inévitable. Pendant des décennies, l'industrie a cru qu'un centre de données froid était un centre de données efficace, une idée désormais caduque face à la densité de puissance des puces IA modernes. Richard Whitmore, président et PDG de Motivair, la division de refroidissement avancé de Schneider Electric, partenaire de longue date de NVIDIA, le dit sans détour : « Une fois que la consommation par puce a dépassé un certain seuil, le refroidissement liquide est devenu obligatoire. » Comme la plateforme Rubin impose le 100 % liquide à l'ensemble de l'écosystème, chaque opérateur de cloud et exploitant de centre de données qui s'y connecte adopte de facto cette nouvelle norme. L'ère du refroidissement par air pour l'IA de pointe touche à sa fin.

Impact France/UE

Les opérateurs de centres de données français et européens devront planifier une migration vers le refroidissement liquide pour rester compétitifs et se conformer aux objectifs d'efficacité énergétique et hydrique imposés par les réglementations européennes sur les data centers.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1Meta Engineering ML 

Les agents IA unifiés de Meta optimisent les performances à grande échelle

Meta a développé une plateforme d'agents IA unifiée pour automatiser la détection et la résolution des problèmes de performance à l'échelle de son infrastructure mondiale, qui sert plus de 3 milliards d'utilisateurs. Ce programme, baptisé Capacity Efficiency Program, repose sur des agents capables d'encoder l'expertise de ses ingénieurs seniors en compétences réutilisables et composables. Résultat concret : des centaines de mégawatts (MW) de puissance électrique récupérés, soit de quoi alimenter des centaines de milliers de foyers américains pendant un an. L'outil interne FBDetect détecte chaque semaine des milliers de régressions de performance, et les agents IA prennent désormais en charge leur résolution automatisée, compressant environ dix heures d'investigation manuelle en trente minutes. Les agents vont même jusqu'à générer des pull requests prêtes à révision, couvrant l'intégralité du chemin depuis la détection d'une opportunité d'optimisation jusqu'à la correction du code. L'impact est double : économique et opérationnel. Côté défense, chaque régression non résolue rapidement se traduit par une consommation électrique supplémentaire qui s'accumule sur l'ensemble du parc de serveurs de Meta. Côté offensif, les agents permettent désormais d'explorer proactivement des optimisations dans un nombre croissant de domaines produits, des opportunités que les ingénieurs n'auraient jamais le temps de traiter manuellement. Le programme peut ainsi augmenter sa capacité de livraison de mégawatts sans augmenter proportionnellement les effectifs humains, ce qui représente un levier de scalabilité majeur pour une infrastructure de cette taille. Libérés des tâches d'investigation répétitives, les ingénieurs peuvent se concentrer sur l'innovation produit. Ce projet s'inscrit dans une tendance plus large chez les grandes plateformes technologiques : automatiser la gestion de la complexité interne à mesure que l'infrastructure croît plus vite que les équipes humaines. Chez Meta, la découverte clé a été que l'offense (recherche proactive d'optimisations) et la défense (détection de régressions) partagent la même structure de problème, ce qui a permis de construire une plateforme unique plutôt que deux systèmes séparés. L'interface d'outils standardisée est au cœur de l'architecture : elle permet aux agents de combiner investigation de données de profilage, consultation de documentation interne, analyse des déploiements récents et recherche de discussions liées. L'objectif à terme est un moteur d'efficacité autonome où l'IA gère la longue traîne des problèmes de performance, un modèle qui pourrait inspirer d'autres hyperscalers confrontés aux mêmes contraintes d'échelle.

InfrastructureActu
1 source
Que faudra-t-il pour construire le plus grand data center du monde ?
2IEEE Spectrum AI 

Que faudra-t-il pour construire le plus grand data center du monde ?

La course aux data centers géants s'emballe. Meta a annoncé en juin 2025 la construction d'Hyperion, un campus de data centers en Louisiane d'une puissance cible de 5 gigawatts, le plus ambitieux jamais planifié. Son PDG Mark Zuckerberg a décrit l'empreinte du projet comme couvrant « une partie significative de la surface de Manhattan ». La première phase, à 2 GW, doit être opérationnelle d'ici 2030. Ce projet s'inscrit dans une vague sans précédent de construction d'infrastructures numériques, directement liée à l'explosion de la demande en IA. Selon Michael Guckes, économiste en chef chez ConstructConnect, les dépenses mondiales en data centers ont dépassé 27 milliards de $ à fin juillet 2025, et devraient atteindre 60 milliards de $ sur l'année complète. Hyperion représente à lui seul environ 10 milliards de $, soit une part considérable du total. Cette dynamique oblige ingénieurs et architectes à innover en matière de calcul, de refroidissement et de réseau à des échelles qui auraient semblé inimaginables il y a cinq ans. La construction d'un tel campus implique des défis techniques inédits. Avant de poser la première fondation, les équipes réalisent des centaines, voire des milliers de prélèvements de sol pour évaluer sa stabilité et sa conductivité thermique, un facteur crucial selon Amanda Carter, responsable technique chez Stantec, car une résistivité thermique élevée empêche la dissipation de chaleur des infrastructures électriques enterrées. À l'intérieur, les racks Nvidia GB200 NVL72, chacun pesant plus d'1,5 tonne, mesurant plus de 2,2 mètres de haut et consommant jusqu'à 120 kilowatts, imposent des dalles en béton renforcé plus épaisses que la norme. Si Hyperion atteint ses 5 GW, le campus pourrait héberger plus de 41 000 systèmes rack, soit plus de 3 millions de GPU. Les enjeux environnementaux et sociaux tempèrent toutefois l'enthousiasme. La construction mobilise d'importants flux de travailleurs temporaires et génère nuisances sonores, trafic et pollution locales. Sur le long terme, la consommation énergétique en continu des data centers IA pourrait émettre l'équivalent de dizaines de millions de tonnes de CO₂ par an aux États-Unis seulement, selon une étude récente. Ces préoccupations n'ont pas ralenti la cadence : les grandes entreprises technologiques avancent à marche forcée, convaincues que la domination en IA se joue désormais sur la puissance brute d'infrastructure.

UELes mégaprojets de data centers américains alimentent le débat européen sur la sobriété énergétique et les émissions CO₂ liées à l'IA, renforçant les discussions autour de la réglementation européenne sur l'efficacité énergétique des centres de données.

InfrastructureOpinion
1 source
Terafab : Elon Musk dévoile son plan pour créer la plus grande usine de puces mondiale
3Le Big Data 

Terafab : Elon Musk dévoile son plan pour créer la plus grande usine de puces mondiale

Elon Musk lance Terafab, un projet de méga-usine de semi-conducteurs qu'il présente comme la plus grande jamais construite. Annoncé sur X, le projet vise à produire jusqu'à un térawatt de puissance de calcul par an, une échelle inédite dans l'industrie des puces. L'objectif affiché : mettre fin à la dépendance vis-à-vis des fonderies étrangères et répondre à l'explosion des besoins en calcul liés à l'IA, la robotique et les infrastructures spatiales. L'enjeu est stratégique. Selon Musk, les capacités combinées des leaders mondiaux comme TSMC, Samsung et Micron ne couvriraient qu'environ 2 % des besoins futurs de ses propres entreprises. Ce chiffre illustre une réalité plus large : les grands acteurs technologiques sont structurellement dépendants de chaînes d'approvisionnement qu'ils ne maîtrisent pas. Terafab s'inscrit dans une logique de verticalisation totale, produire soi-même, à grande échelle, pour ne plus subir les contraintes du marché. Implanté à Austin, au Texas, Terafab serait une coentreprise entre Tesla, SpaceX et xAI. Chaque entité y trouve un intérêt direct : Tesla pour ses véhicules autonomes et ses robots Optimus, xAI pour l'entraînement de ses modèles, et SpaceX pour ses systèmes embarqués. Le projet prévoit deux catégories de puces, des puces terrestres classiques et des puces durcies capables de fonctionner dans l'espace, en lien avec l'ambition d'un data center orbital et d'une constellation de satellites. Le coût estimé dépasse les 20 de milliards de $, et la complexité technique reste un obstacle majeur : rivaliser avec les décennies d'expertise de TSMC en lithographie avancée ne s'improvise pas, et une telle usine nécessite plusieurs années avant d'être pleinement opérationnelle. La crédibilité du projet reste à démontrer. L'écart entre la vision annoncée et la réalité industrielle est considérable, et Musk n'en est pas à sa première promesse d'envergure à calendrier incertain. Reste que la direction est cohérente avec sa stratégie globale : concentrer dans ses mains les briques technologiques fondamentales, énergie, calcul, transport, espace, pour construire un empire industriel intégré verticalement.

UEAccentue la dépendance structurelle de l'Europe en semi-conducteurs avancés au moment où l'UE tente de développer sa propre capacité de production via l'European Chips Act.

InfrastructureActu
1 source
4AI News 

IBM : une gouvernance rigoureuse de l'IA protège les marges des entreprises

Rob Thomas, vice-président senior et directeur commercial d'IBM, a récemment exposé une thèse structurante pour les décideurs technologiques : les logiciels suivent une trajectoire prévisible, passant du statut de produit à celui de plateforme, puis d'infrastructure fondamentale. Chaque transition modifie radicalement les règles du jeu. IBM estime que l'intelligence artificielle franchit actuellement ce dernier seuil dans l'architecture des grandes entreprises, passant d'un outil expérimental à une couche opérationnelle centrale, intégrée dans la sécurité réseau, la génération de code, les décisions automatisées et la création de valeur commerciale. Cette évolution a été mise en lumière par la préversion de Claude Mythos, le nouveau modèle d'Anthropic capable, selon l'entreprise, de détecter et exploiter des vulnérabilités logicielles à un niveau comparable aux meilleurs experts humains. Face à ce pouvoir, Anthropic a lancé le projet Glasswing, une initiative sélective visant à placer ces capacités en priorité entre les mains des équipes de défense réseau. Pour IBM, cette réalité crée une exposition opérationnelle majeure pour toute organisation dont la stratégie repose sur des modèles d'IA fermés et propriétaires. Lorsqu'un système autonome peut rédiger des exploits et influencer l'environnement de sécurité global, concentrer la compréhension de ces systèmes chez un petit nombre de fournisseurs devient un risque structurel grave. Les architectures opaques génèrent également des frictions concrètes : connecter un modèle propriétaire à des bases de données vectorielles d'entreprise ou à des lacs de données sensibles crée des goulots d'étranglement de débogage considérables. Quand un modèle produit des sorties anormales ou que le taux d'hallucination augmente, les équipes techniques n'ont pas la visibilité interne nécessaire pour déterminer si l'erreur provient du pipeline de génération augmentée par récupération ou des poids du modèle de base. S'y ajoutent des problèmes de latence liés à l'intégration d'architectures sur site avec des modèles cloud verrouillés, ainsi que des coûts de calcul liés aux appels API continus qui érodent précisément les marges que ces systèmes sont censés préserver. La thèse d'IBM s'inscrit dans un débat plus large sur l'avenir de l'IA en entreprise : à l'ère des modèles-produits, la fermeture était une stratégie défendable et lucrative. À l'ère de l'IA-infrastructure, elle devient un handicap compétitif et sécuritaire. Aucun fournisseur unique ne peut anticiper tous les vecteurs d'attaque, les défaillances système ou les besoins opérationnels d'un écosystème aussi hétérogène que celui des grandes entreprises. IBM plaide donc pour une gouvernance ouverte et inspectable de l'IA, où la priorité n'est plus seulement ce que les modèles peuvent faire, mais comment ils sont construits, audités et améliorés dans la durée. Dans ce contexte, des initiatives comme Glasswing d'Anthropic signalent une prise de conscience sectorielle, mais la question de qui contrôle et comprend réellement ces infrastructures critiques reste entière.

UELa thèse d'IBM sur la gouvernance ouverte de l'IA s'aligne avec les exigences de l'AI Act européen en matière de transparence et d'auditabilité des systèmes IA déployés dans des infrastructures critiques.

InfrastructureOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic