Aller au contenu principal

Infrastructure — page 4

383 articles · page 4 sur 8

Infrastructure IA : data centers, puces GPU/TPU, cloud computing, énergie et hardware.

Micron dépasse les 1 000 milliards de dollars grâce à la demande en IA
151Le Big Data InfrastructureOpinion

Micron dépasse les 1 000 milliards de dollars grâce à la demande en IA

Micron Technology a franchi pour la première fois le seuil symbolique des 1 000 milliards de dollars de capitalisation boursière le 26 mai 2026, après une séance boursière historique où son action a bondi de 19 %. Ce bond spectaculaire a été déclenché par une révision radicale des prévisions de la banque UBS, qui a quasiment triplé son objectif de cours pour Micron, passant de 535 à 1 625 dollars par action. Pour replacer l'ampleur de ce mouvement : il y a seulement quelques semaines, la valorisation du groupe dépassait à peine les 700 milliards de dollars, et il y a moins de 14 mois, elle s'établissait autour de 60 milliards. Depuis le début de l'année, l'action a plus que triplé, enregistrant une progression de l'ordre de 1 350 % en 413 jours. UBS justifie cette revalorisation par un changement structurel du marché de la mémoire, avec des contrats de long terme et des modèles de prix désormais plus stables. Ce franchissement du trillion illustre une bascule profonde dans la façon dont les investisseurs lisent le marché des semi-conducteurs. Le secteur de la mémoire vive (DRAM) et de la mémoire à haute bande passante (HBM) était historiquement considéré comme cyclique et volatil, soumis à des effondrements de prix réguliers. L'IA générative est en train de modifier cette équation : entraîner des modèles de grande taille, les stocker et les faire tourner en temps réel exige des quantités massives de mémoire haute performance. La demande mondiale dépasse désormais les capacités de production disponibles, ce qui permet aux fabricants d'augmenter leurs prix et de sécuriser des contrats pluriannuels. Pour les hyperscalers, les opérateurs de centres de données et les éditeurs de logiciels IA, cela signifie une pression accrue sur les coûts d'infrastructure et la nécessité de sécuriser leurs approvisionnements bien à l'avance. Pendant des années, NVIDIA et ses GPU ont capté l'essentiel de l'attention et des capitaux dans la chaîne de valeur IA. Micron incarne désormais un deuxième front : celui des infrastructures mémoire sans lesquelles les modèles ne peuvent tout simplement pas fonctionner. Le groupe américain n'est pas seul à en profiter, SK Hynix et Samsung Electronics se trouvent dans une position similaire, mais sa montée en puissance illustre une recomposition plus large de l'écosystème. Des entreprises comme AMD, Marvell Technology et Qualcomm atteignent également de nouveaux sommets, tandis qu'Intel tente de rattraper son retard. Si la dynamique se confirme, la mémoire avancée pourrait devenir un facteur aussi déterminant que les GPU dans la compétition mondiale autour de l'IA, transformant durablement les rapports de force entre fabricants de puces, fournisseurs cloud et développeurs de modèles.

UELa hausse structurelle des prix de la mémoire HBM et la sécurisation de contrats pluriannuels par les hyperscalers risquent d'alourdir les coûts d'infrastructure IA pour les opérateurs cloud et entreprises tech européens.

Les fournisseurs d'inférence connaissent-ils un essor ?
152The Information AI 

Les fournisseurs d'inférence connaissent-ils un essor ?

Il y a moins d'un an, les fournisseurs d'inférence spécialisés suscitaient un scepticisme marqué dans l'industrie de l'IA. Des startups comme Fireworks AI, Baseten et Together AI, qui louent des serveurs Nvidia à des développeurs d'applications et les aident à déployer des modèles open source, avaient connu une croissance rapide, mais semblaient fragilisées face à la concurrence des grands fournisseurs cloud. Ces derniers disposent en effet d'un avantage structurel majeur : ils possèdent leurs propres puces, là où les fournisseurs d'inférence doivent d'abord les louer à AWS, Google ou Azure avant de les revendre à leurs clients, ce qui comprime mécaniquement leurs marges brutes. Pourtant, le discours dominant a changé. Ces acteurs spécialisés semblent aujourd'hui trouver leur place dans un écosystème où la demande d'inférence explose, portée par la multiplication des applications IA en production. Leur proposition de valeur, flexibilité, optimisation technique, et support des modèles open source, répond à des besoins que les clouds généralistes satisfont moins bien, notamment pour les équipes cherchant à éviter l'enfermement propriétaire et à contrôler précisément leurs coûts d'inférence. Ce retournement s'inscrit dans une dynamique plus large : avec la prolifération des modèles open source performants comme Llama ou Mistral, les développeurs disposent désormais d'alternatives crédibles aux API propriétaires d'OpenAI ou Anthropic. Les fournisseurs d'inférence se positionnent comme l'infrastructure neutre de ce marché alternatif, pariant sur le fait que la fragmentation des modèles leur garantit une demande structurelle durable face aux géants du cloud.

UELa montée en puissance des fournisseurs d'inférence open source renforce l'écosystème autour de Mistral (entreprise française), offrant aux développeurs européens une infrastructure neutre pour déployer des modèles sans dépendance aux API propriétaires.

InfrastructureOpinion
1 source
Le CPU Vera de NVIDIA s'affirme comme un concurrent redoutable
153NVIDIA AI Blog 

Le CPU Vera de NVIDIA s'affirme comme un concurrent redoutable

Les premiers benchmarks publics du processeur Vera de NVIDIA, publiés le 27 mai 2026 par le site spécialisé Phoronix, révèlent des performances qui pourraient redessiner le paysage des processeurs pour centres de données. Le CPU Vera, conçu autour de 88 cœurs personnalisés baptisés Olympus et compatibles avec l'architecture Armv9.2, affiche une bande passante mémoire de 1,2 To/s grâce à un sous-système LPDDR5X de deuxième génération. Le tout dans une enveloppe thermique de 450 watts pour le processeur, avec moins de 30 watts dédiés à la mémoire. Les tests couvrent un large spectre de charges de travail : compilation de code, compression de fichiers, transcodage vidéo, Python, Java et gestion de bases de données. Michael Larabel, fondateur de Phoronix, conclut sans ambages : "C'est la concurrence la plus redoutable jamais vue face aux processeurs Intel et AMD x86_64." Ces résultats ont une portée directe pour les entreprises qui construisent des infrastructures d'IA agentique, c'est-à-dire des systèmes où des agents autonomes exécutent simultanément du code, interrogent des bases de données et orchestrent des pipelines complexes. Sur le test STREAM TRIAD, Vera soutient 90% de sa bande passante mémoire de pointe, un taux qu'aucun autre processeur testé par Phoronix n'a atteint, tout en délivrant plus de quatre fois la bande passante mémoire par cœur comparé aux CPU x86 traditionnels. La société Prime Intellect a confirmé, dans des tests séparés, que Vera maintient une bande passante élevée et une latence mémoire faible et stable à mesure que le nombre de processus parallèles augmente. Pour les opérateurs d'infrastructures IA, cela se traduit par moins de serveurs nécessaires pour un même volume de travail, et une facture énergétique réduite. NVIDIA a présenté Vera comme la réponse architecturale au virage vers l'IA agentique, qui impose aux processeurs des contraintes différentes de celles du deep learning classique : moins de calcul matriciel massif, davantage de traitement séquentiel, de branchements conditionnels et d'accès mémoire dispersés. Par rapport au processeur Grace de génération précédente, Vera affiche un gain de 1,6x en moyenne géométrique sur l'ensemble des benchmarks Phoronix, une progression que Larabel qualifie de "constamment au-delà de ce qu'on attend d'une génération à l'autre". Ce lancement intervient dans un contexte où AMD EPYC et Intel Xeon dominent encore les data centers d'entreprise, mais où NVIDIA cherche à imposer ses propres CPU aux côtés de ses GPU dans des plateformes intégrées. La prochaine étape sera de voir si ces performances en benchmark se confirment dans des déploiements de production à grande échelle, notamment dans les grandes fermes d'IA où le coût total par inférence reste le critère ultime.

UELes opérateurs de centres de données européens pourraient réduire leur consommation énergétique et le nombre de serveurs nécessaires pour leurs charges IA agentique, un avantage concret dans le contexte des objectifs européens de sobriété numérique.

InfrastructureActu
1 source
Construire des systèmes multi-agents LangGraph serverless et scalables sur AWS avec Amazon Bedrock AgentCore
154AWS ML Blog 

Construire des systèmes multi-agents LangGraph serverless et scalables sur AWS avec Amazon Bedrock AgentCore

Amazon Web Services a présenté une architecture de référence pour déployer des systèmes multi-agents d'IA générative à grande échelle sur AWS, en combinant LangGraph, AWS Lambda, AWS Step Functions et les deux nouveaux services Amazon Bedrock AgentCore Memory et AgentCore Observability. L'approche repose sur une infrastructure entièrement serverless : les agents LangGraph sont packagés dans des conteneurs Docker exécutés sur Lambda, ce qui permet une montée en charge automatique sans gestion d'infrastructure. Pour illustrer le concept, AWS décrit un système concret de révision de campagnes marketing orchestrant trois agents spécialisés en parallèle, un agent "persona reviewer" qui évalue la résonance du contenu auprès de différents profils démographiques, un agent "validator" qui vérifie la conformité juridique et les chartes de marque, et un agent "finalizer" qui synthétise les retours en recommandations actionnables. Une interface React permet aux utilisateurs de télécharger leurs documents et de consulter les résultats en temps réel. Ce type d'architecture répond à un problème concret que rencontrent les entreprises en production : les agents IA performants en démo s'effondrent souvent sous la charge réelle, perdent le contexte entre les sessions et restent des boîtes noires difficiles à déboguer. AgentCore Memory résout la question de la mémoire en offrant à la fois un contexte conversationnel à court terme et une base de connaissances persistante entre sessions. AgentCore Observability capture quant à lui chaque invocation avec ses entrées et sorties LLM, la latence, et les métriques de chaîne d'outils sur l'ensemble des composants distribués. Pour les équipes en charge de systèmes critiques, c'est un changement de paradigme : il devient possible d'auditer exactement comment un agent a raisonné, quelle décision il a prise à quelle étape, et pourquoi. Cette publication s'inscrit dans une accélération visible chez AWS pour proposer une pile complète d'IA agentique cloud-native, face à la concurrence de Google (Vertex AI Agents) et Microsoft (Azure AI Foundry). LangGraph, développé par LangChain, s'impose progressivement comme standard de facto pour l'orchestration d'agents grâce à son modèle d'exécution en graphe orienté qui rend le flux de contrôle déterministe, parallélisable et conditionnel. L'intégration native avec Lambda et Step Functions est particulièrement stratégique pour les charges de travail "bursty" typiques des agents IA, où la demande est imprévisible et les coûts d'une infrastructure dédiée permanente seraient prohibitifs. La prochaine étape logique pour AWS sera d'étendre ces patterns à des workflows plus complexes impliquant des boucles de feedback humain et des agents à longue durée de vie, un segment encore largement inexploré en production.

InfrastructureActu
1 source
Comment les agentic databases redéfinissent l’IA en entreprise ?
155Le Big Data 

Comment les agentic databases redéfinissent l’IA en entreprise ?

Un nouveau concept s'impose dans les stratégies technologiques des grandes entreprises : les agentic databases. Selon une étude récente citée dans l'article, 95 % des dirigeants souhaitent transformer leur organisation en véritable plateforme d'IA et de données d'ici trois ans. Ces bases de données de nouvelle génération ne se contentent plus de stocker des informations : elles deviennent des couches actives capables d'alimenter des agents IA autonomes, de conserver leur mémoire opérationnelle et d'optimiser leurs performances en continu. Concrètement, elles doivent gérer simultanément des données relationnelles classiques, des contenus non structurés, des historiques conversationnels, de la mémoire d'agents et des données vectorielles pour la recherche sémantique. Des technologies comme PostgreSQL regagnent du terrain grâce à leur flexibilité, leur écosystème open source et leur capacité à gérer ces charges de travail hybrides. L'enjeu est considérable pour les entreprises. Aujourd'hui, la plupart fonctionnent encore avec des architectures fragmentées : données dispersées entre plusieurs outils, agents IA opérant dans des environnements cloisonnés, équipes techniques qui passent plus de temps à connecter des systèmes qu'à développer de nouveaux usages métier. Les organisations qui ont su centraliser leurs données, leurs flux et leurs agents dans une infrastructure cohérente obtiennent un retour sur investissement nettement supérieur et déploient davantage d'applications couvrant plusieurs fonctions, de la finance aux ventes en passant par le juridique. La différence de performance entre ces leaders et le reste du marché ne tient pas à la qualité des modèles LLM utilisés, mais à leur capacité à construire une couche de données unifiée fournissant un contexte fiable et une mémoire persistante aux agents. Chaque nouvel agent enrichit alors progressivement la base de connaissances commune, générant un cercle vertueux d'automatisation où les performances s'améliorent avec l'usage. Cette évolution répond aussi à une contrainte technique fondamentale : les infrastructures de données traditionnelles n'ont tout simplement pas été conçues pour des systèmes qui agissent, raisonnent et exécutent des tâches de manière autonome. La latence devient critique à mesure que les agents s'intègrent dans les opérations métier en temps réel, poussant les entreprises à adopter des systèmes de stockage multiniveaux capables de prioriser les données chaudes. Les agents doivent désormais non seulement répondre à des requêtes, mais comprendre des intentions et exécuter des actions complexes en chaîne, ce qui exige des mécanismes d'indexation hybrides avancés. L'agentic database n'est donc pas un produit unique mais une architecture complète, et les acteurs qui la maîtriseront en premier disposeront d'un avantage compétitif structurel difficile à rattraper.

InfrastructureOpinion
1 source
☕️ Les agences de renseignement américaines à court de puissance de calcul pour leurs IA
156Next INpact 

☕️ Les agences de renseignement américaines à court de puissance de calcul pour leurs IA

La Maison Blanche aurait approuvé une enveloppe de 9 milliards de dollars destinée à doter les agences de renseignement américaines en puces IA de dernière génération, selon des informations rapportées par le New York Times. Ce financement, qui doit encore passer par le Congrès, vise à permettre à la CIA, la NSA et leurs homologues de faire tourner les modèles d'intelligence artificielle les plus récents sur des infrastructures à la hauteur. L'administration Trump aurait par ailleurs déjà redirigé 800 millions de dollars pour accélérer des achats de capacités de calcul en urgence. Parallèlement, la Maison Blanche aurait autorisé la NSA à continuer d'exploiter Mythos, le modèle le plus avancé d'Anthropic, dans le cadre d'un contrat classifié en préparation qui inclurait des restrictions sur le traitement de données concernant des citoyens américains. Les agences américaines se retrouvent dans la même situation que n'importe quel acteur privé : les infrastructures capables d'accueillir les grands modèles d'OpenAI, d'Anthropic ou de Google affichent complet, et les composants les plus puissants, comme les puces Grace Blackwell de NVIDIA, exigent des centres de données dotés de systèmes d'alimentation massifs. Or les réseaux infonuagiques classifiés du gouvernement, dont ceux opérés par AWS, ne peuvent pas être modernisés rapidement. Les agences n'auraient tout simplement pas anticipé les besoins en calcul de ces modèles, et les délais de déploiement restent incompressibles même avec de l'argent disponible. Résultat : les 800 millions déjà mobilisés représentent une goutte d'eau face à l'ampleur des besoins réels, et les 9 milliards supplémentaires n'arriveraient pas immédiatement sur le terrain. Cette situation s'inscrit dans une séquence de tensions entre Washington et les labos d'IA. Le Pentagone avait exigé un accès très large aux modèles avancés d'Anthropic pour ses opérations classifiées, ce qu'Anthropic a refusé, une affaire encore devant les tribunaux. Le DoD a finalement constitué un cercle de fournisseurs IA pour ses opérations secret défense, retenant OpenAI, Google, Microsoft et AWS, mais laissant Anthropic à l'écart, du moins officiellement. Le Pentagone qualifiait même l'entreprise de "risque" pour la chaîne d'approvisionnement et la sécurité nationale, ce qui rend d'autant plus notable la décision d'autoriser la NSA à continuer d'utiliser Mythos. Cette contradiction illustre la difficulté pour les institutions américaines de concilier impératifs de souveraineté numérique, besoins opérationnels croissants en IA, et dépendance inévitable envers quelques entreprises privées qui contrôlent les modèles les plus performants.

UELe retard des agences de renseignement américaines illustre les risques de dépendance envers quelques fournisseurs privés d'IA, un avertissement indirect pour les institutions européennes engagées dans des démarches de souveraineté numérique.

💬 9 milliards pour rattraper un retard que tout le monde voyait venir. Ce qui me frappe, c'est la contradiction : le Pentagone liste officiellement Anthropic comme un "risque sécurité" pour la chaîne d'approvisionnement, et pendant ce temps la NSA continue d'utiliser Mythos via un contrat classifié. Ça dit tout sur ce que vaut la "souveraineté numérique" quand les seuls modèles utilisables sont dans les mains de trois boîtes privées.

InfrastructureOpinion
1 source
Together AI publie OSCAR en open source : un système de quantification KV cache 2 bits adaptatif pour les LLM à long contexte
157MarkTechPost 

Together AI publie OSCAR en open source : un système de quantification KV cache 2 bits adaptatif pour les LLM à long contexte

Together AI vient de publier en open source OSCAR (Offline Spectral Covariance-Aware Rotation), un système de quantification du cache KV à 2 bits conçu pour réduire drastiquement la mémoire GPU nécessaire à l'inférence de grands modèles de langage sur de longs contextes. Le problème visé est concret : lors de l'inférence en mode autorégressif, le cache KV croît avec la longueur du contexte, la taille des lots et la profondeur du modèle. À 100 000 tokens traités par dizaines de requêtes simultanées, ce cache peut accaparer la majorité de la mémoire GPU disponible. La quantification à INT2, qui ne représente les valeurs qu'avec 4 niveaux distincts, était jusqu'ici largement inutilisable : soit elle dégradait trop la précision, soit elle était incompatible avec les architectures de cache paginé utilisées en production. OSCAR surmonte ces deux obstacles grâce à une rotation des activations fondée non pas sur leur distribution brute, mais sur les statistiques d'attention elles-mêmes. L'innovation centrale d'OSCAR réside dans le choix de la base de rotation. Pour les clés (keys), ce qui compte n'est pas l'erreur de reconstruction euclidienne, mais l'erreur sur les logits d'attention, pondérée par la covariance des requêtes. Pour les valeurs (values), c'est la covariance pondérée par les scores d'attention qui détermine quelles directions d'erreur se propagent réellement dans la sortie du modèle. OSCAR estime ces covariances sur un jeu de calibration, les décompose en vecteurs propres, et les utilise comme base de rotation optimale. La rotation finale se compose de trois éléments : l'alignement sur les directions importantes pour l'attention, une transformation de Hadamard qui uniformise les canaux, et un réordonnancement par inversion de bits qui garantit que chaque groupe de quantification reçoit un représentant de chaque niveau hiérarchique. Le système s'intègre dans la pile de serving production de SGLang comme mode INT2 natif du cache KV. Ce travail s'inscrit dans une course intense à l'efficacité mémoire pour les LLM en production. La quantification du cache KV est un levier direct sur la taille des lots traitables et donc sur le coût par requête. Les approches INT4 existantes, comme QuIP# ou QuaRot, fonctionnaient déjà correctement, mais INT2 représentait une frontière difficile à franchir sans perte de qualité rédhibitoire. En publiant OSCAR en open source avec une intégration SGLang, Together AI met cet outil à disposition de l'ensemble de la communauté de déploiement de modèles. L'enjeu est considérable : multiplier par deux la compression du cache KV peut doubler la capacité de traitement parallèle d'un serveur sans changer le matériel. Les prochaines étapes naturelles concernent la validation sur des modèles de très grande taille et l'extension à d'autres architectures d'attention.

UELes laboratoires et startups IA européens déployant des LLM peuvent adopter cette technique open source pour réduire leurs coûts d'inférence GPU et doubler leur capacité de traitement parallèle sans changer de matériel.

InfrastructureOpinion
1 source
Test du Nvidia DGX Spark : le mini PC IA 128 Go
158Frandroid 

Test du Nvidia DGX Spark : le mini PC IA 128 Go

Nvidia a lancé le DGX Spark, un mini PC dédié à l'intelligence artificielle locale, testé ici dans sa version assemblée par Dell sous le label Pro Max. Au cœur de la machine se trouve la puce maison GB10 Grace Blackwell Superchip, couplée à 128 Go de mémoire unifiée partagée entre le CPU et le GPU. Le tout tient dans un boîtier compact comparable à un Mac Mini, pour un tarif qui démarre autour de 3 000 dollars selon les configurations. Ce facteur de forme cache une puissance de calcul jusqu'ici réservée aux serveurs de datacenter : le DGX Spark est capable de faire tourner des modèles de langage de 70 milliards de paramètres et plus directement en local, sans dépendre du cloud. Pour les chercheurs, développeurs et entreprises soucieuses de confidentialité ou de latence, c'est un changement de paradigme concret. La mémoire unifiée de 128 Go élimine le goulot d'étranglement qui rendait ces modèles inaccessibles sur du matériel grand public. Le DGX Spark s'inscrit dans une offensive plus large de Nvidia pour étendre son emprise au-delà des grands clusters GPU, face à la montée en puissance des puces Apple Silicon M4 Ultra qui misent sur la même architecture de mémoire unifiée. Annoncé au CES 2025, le Spark cible une clientèle professionnelle et académique qui veut l'autonomie du local sans sacrifier la performance. Nvidia le positionne également comme point d'entrée vers son écosystème DGX, dont les versions rack coûtent des centaines de milliers de dollars.

UELes professionnels et chercheurs français et européens peuvent désormais faire tourner des modèles de 70 milliards de paramètres en local pour environ 3 000 dollars, réduisant la dépendance au cloud pour les cas d'usage sensibles en matière de confidentialité.

💬 128 Go de mémoire unifiée pour faire tourner un 70B en local, c'est le verrou qui saute. Nvidia a regardé ce qu'Apple faisait avec le M-Series et a poussé le même concept bien plus loin, sur une puce qui cible les workloads sérieux. 3 000 dollars c'est pas donné, mais pour une boîte qui veut garder ses données chez elle sans louer du GPU à la journée, le calcul se fait vite.

InfrastructureOpinion
1 source
D&B a reconstruit sa base de 642 millions d'entreprises pour les agents IA
159VentureBeat AI 

D&B a reconstruit sa base de 642 millions d'entreprises pour les agents IA

Dun & Bradstreet, entreprise vieille de 180 ans spécialisée dans les données commerciales, vient d'annoncer une refonte complète de son infrastructure de données pour la rendre compatible avec les agents d'intelligence artificielle. Son "Commercial Graph" couvre 642 millions d'entreprises, soit presque le double des 300 millions de dossiers qu'il contenait il y a cinq ans, avec 11 000 champs par enregistrement et 100 milliards de vérifications qualité effectuées chaque mois. Cette base de données, utilisée par près de 200 000 clients dans le monde, analystes crédit, gestionnaires de risques, commerciaux, était conçue pour des humains capables d'attendre quelques secondes et d'interpréter des résultats ambigus. Quand les clients de D&B ont commencé à intégrer des agents IA dans leurs workflows de crédit, d'achats et de chaîne d'approvisionnement, l'architecture existante s'est révélée incompatible. Gary Kotovets, directeur des données et de l'analytique chez D&B, a expliqué à VentureBeat que l'entreprise devait désormais considérer les agents comme une nouvelle catégorie de consommateurs à part entière. Le problème fondamental est que les agents IA ne peuvent pas fonctionner avec des systèmes fragmentés, des latences élevées ou des relations statiques entre entités. Là où un analyste humain naviguait à travers plusieurs bases de données hétérogènes via des requêtes SQL, un agent a besoin d'une réponse en moins d'une seconde, d'une résolution d'entité vérifiée, et de relations dynamiques : si un PDG quitte une entreprise pour une autre, le dossier de risque doit suivre en temps réel ; si une filiale change de propriétaire, la hiérarchie complète doit se mettre à jour automatiquement. D&B a donc migré ses bases vers le cloud, redessiné son schéma de données, construit une couche de "data fabric" unifiant les enregistrements à l'échelle mondiale tout en respectant les contraintes réglementaires régionales, puis exposé l'ensemble via des outils MCP (Model Context Protocol) qui permettent aux agents d'interroger des données structurées avec leur contexte. Un moteur de résolution d'entités valide chaque requête pour garantir qu'une demande portant sur une entreprise renvoie bien vers un enregistrement unique et vérifié. L'entreprise a également créé un nouveau modèle d'authentification spécifique aux agents, distincts des utilisateurs humains. Ce chantier illustre une réalité que Kotovets dit avoir entendue de la bouche de centaines de directeurs des données et directeurs informatiques au cours des six derniers mois : les ambitions en matière d'IA se heurtent systématiquement à des fondations de données non standardisées et inexploitables par des machines. D&B, pourtant l'une des entreprises les mieux dotées en données commerciales structurées au monde, a quand même dû tout reconstruire. La montée en puissance des agents autonomes dans les processus métier critiques, évaluation du risque fournisseur, scoring crédit, due diligence, crée une pression inédite sur les fournisseurs de données pour qu'ils passent d'une logique de consultation humaine à une logique d'alimentation machine en temps réel. D&B se positionne ainsi en infrastructure de référence pour les agents d'entreprise, à un moment où MCP s'impose progressivement comme standard d'interopérabilité entre agents et sources de données.

UELes entreprises européennes clientes de D&B pour le risque crédit ou fournisseur peuvent désormais connecter leurs agents IA à cette base via MCP, dans le respect des contraintes réglementaires régionales incluant le RGPD.

💬 Si D&B, avec 180 ans de données commerciales structurées, a quand même dû tout reconstruire pour les agents IA, ton stack de données a peu de chances de s'en tirer sans casse. C'est le vrai enseignement de cet article, pas les 642 millions d'entreprises ou les 11 000 champs par dossier. Les agents ne tolèrent pas l'ambiguïté, pas la latence, pas les silos, et ça va forcer une vague de refonte data que beaucoup n'ont pas encore budgétisée.

InfrastructureActu
1 source
L'IA chinoise cartographie l'intégralité de son réseau d'énergies renouvelables : pourquoi le reste du monde devrait s'en inspirer
160AI News 

L'IA chinoise cartographie l'intégralité de son réseau d'énergies renouvelables : pourquoi le reste du monde devrait s'en inspirer

Des chercheurs de l'Université de Pékin et du DAMO Academy d'Alibaba ont publié cette semaine dans la revue Nature une étude qui marque une première mondiale : une cartographie complète et haute résolution de toute l'infrastructure d'énergie renouvelable d'un pays entier, produite par intelligence artificielle. Le modèle de deep learning, entraîné sur des images satellites à résolution inférieure au mètre, a identifié 319 972 installations solaires photovoltaïques et 91 609 éoliennes à travers la Chine, en traitant 7,56 téraoctets d'imagerie. C'est la première fois qu'une nation dispose d'un inventaire exhaustif et automatisé de son parc renouvelable, accompagné d'un cadre analytique pour le coordonner comme un système unifié. L'enjeu dépasse la prouesse technique. L'étude montre que la complémentarité entre solaire et éolien réduit significativement la variabilité de la production, et que cette complémentarité est d'autant plus efficace que les installations coordonnées sont géographiquement éloignées : un nuage qui couvre les fermes solaires du Gansu n'obscurcit pas les corridors éoliens de Mongolie-Intérieure. Or, la Chine gère aujourd'hui son réseau à l'échelle provinciale, ce qui empêche d'exploiter ces complémentarités naturelles. Passer à une coordination nationale permettrait de stabiliser le réseau, de mieux apparier les sources d'énergie et de réduire le "curtailment", c'est-à-dire le gaspillage d'électricité renouvelable déjà produite, un problème coûteux de longue date. Liu Yu, professeur à l'École des sciences de la Terre et de l'Espace de Pékin, décrit cet inventaire comme une "vue divine" sur le paysage énergétique chinois : on ne peut pas optimiser ce qu'on ne voit pas. Cette percée intervient dans un contexte de pression extrême sur les réseaux électriques mondiaux. En Chine, la consommation électrique des centres de données a bondi de 44 % en glissement annuel au premier trimestre 2026, atteignant 22,9 milliards de kilowattheures selon le China Electricity Council, sous l'effet de la prolifération rapide des infrastructures d'IA. Ce phénomène n'est pas propre à la Chine : aux États-Unis, les prix sur le marché de capacité du PJM, le plus grand opérateur de réseau du pays, ont été multipliés par dix en deux ans, principalement à cause des centres de données. L'Agence internationale de l'énergie projette que la consommation mondiale de ces infrastructures pourrait approcher 1 000 TWh d'ici 2030. La méthode développée par l'équipe sino-chinoise offre un modèle reproductible pour d'autres pays confrontés au même défi : voir leur propre réseau renouvelable en entier, pour la première fois, et commencer à le piloter à la bonne échelle.

UECette méthode reproductible pourrait inspirer l'UE à cartographier son parc renouvelable fragmenté entre États membres, facilitant la coordination transfrontalière du réseau et la réduction du curtailment dans le cadre de la transition énergétique européenne.

💬 Un demi-million d'installations solaires et éoliennes cartographiées par satellite, d'un coup, sur tout un pays. Ce qu'ils mettent en évidence ensuite c'est presque plus important : la Chine gaspille de l'électricité renouvelable déjà produite parce qu'elle pilote son réseau province par province au lieu de le voir à l'échelle nationale. L'Europe avec ses 27 réseaux qui se regardent en chien de faïence, ce serait bien de prendre note.

InfrastructurePaper
1 source
De nouvelles licornes dans l'infrastructure IA : Exa, Modal, TurboPuffer
161Latent Space 

De nouvelles licornes dans l'infrastructure IA : Exa, Modal, TurboPuffer

Trois entreprises spécialisées dans l'infrastructure pour l'intelligence artificielle ont atteint simultanément des jalons majeurs cette semaine, signalant une consolidation rapide du secteur. TurboPuffer, moteur de recherche vectorielle, annonce 100 millions de dollars de revenus récurrents annuels tout en étant rentable. Exa, moteur de recherche sémantique pour les agents IA, lève 250 millions de dollars dans un tour de Série C qui valorise l'entreprise à 2,2 milliards de dollars. Modal, plateforme cloud de calcul GPU à la demande, annonce quant à elle 355 millions de dollars levés à une valorisation de 4,7 milliards de dollars en Série C. Ces trois annonces tombent dans la même fenêtre de 48 heures, les 20 et 21 mai 2026. Ces chiffres illustrent une dynamique structurelle : l'explosion de la demande en infrastructure IA n'est plus portée uniquement par les grands hyperscalers comme AWS ou Google Cloud, mais de plus en plus par des acteurs spécialisés capables de répondre précisément aux besoins des développeurs d'agents et de pipelines LLM. Modal permet d'exécuter du code Python avec des GPU en quelques secondes sans gérer de serveurs ; Exa fournit une API de recherche conçue pour les LLM plutôt que pour les humains ; TurboPuffer offre une base de données vectorielle haute performance. Que les trois atteignent ces valorisations en même temps indique que le marché des outils pour construire des applications IA génère désormais des revenus réels et prévisibles, pas seulement des promesses. Ces succès s'inscrivent dans un contexte où l'ingénierie IA est devenue une discipline à part entière, distincte de la recherche fondamentale en machine learning. L'émergence d'une couche d'infrastructure spécialisée, entre les modèles de fondation des grands labs et les applications finales, crée un espace économique autonome. Latent Space, le podcast et newsletter qui suit ces entreprises depuis leurs débuts, note avoir interviewé les fondateurs des trois sociétés bien avant ces valorisations, soulignant à quel point la communauté des praticiens IA identifie tôt les acteurs structurants. La question désormais est de savoir si ces entreprises resteront indépendantes ou deviendront des cibles d'acquisition pour les grandes plateformes cloud, qui cherchent à intégrer verticalement la chaîne de valeur du développement IA.

UELes développeurs français et européens d'applications IA disposent désormais d'une couche d'infrastructure spécialisée (compute GPU à la demande, recherche vectorielle, recherche sémantique pour LLMs) comme alternative aux grands hyperscalers pour leurs pipelines d'agents.

💬 TurboPuffer rentable à 100M ARR, Modal à 4,7 milliards, Exa à 2,2, tout ça en 48h, c'est pas du hasard. J'attendais ce signal pour confirmer que la couche infra entre les grands modèles et les applis génère vraiment de l'argent, pas juste du cashburn déguisé en croissance. Si tu construis des trucs avec des LLMs, ces outils sont soit déjà dans ta stack, soit tu vas y venir.

InfrastructureOpinion
1 source
CopilotKit redéfinit l'architecture IA à base d'agents en 2026
162MarkTechPost 

CopilotKit redéfinit l'architecture IA à base d'agents en 2026

CopilotKit, startup basée à Seattle et co-fondée par Atai Barkai et Uli Barkai, s'est imposée en 2026 comme l'un des acteurs centraux de l'infrastructure pour agents IA. La société a lancé en avril 2026 AIMock, un outil de test pour systèmes agentiques, et AG-UI, un protocole d'interaction entre agents et utilisateurs au sein des applications. AG-UI est aujourd'hui soutenu par Google, Microsoft, Amazon et Oracle, ainsi que par des frameworks majeurs comme LangChain, Mastra, PydanticAI et Agno. AWS l'a intégré dans son template FAST (Fullstack AgentCore Solution Template) et dans Bedrock AgentCore. Des SDKs communautaires couvrent déjà Kotlin, Go, Dart, Java, Rust, Ruby et C++, tandis que .NET, Nim, Flowise et Langflow sont en cours de développement. Atai Barkai enseigne par ailleurs un cours complet sur AG-UI chez DeepLearning.AI, couvrant un backend LangChain, un frontend React et AG-UI comme runtime. Ce que CopilotKit résout est concret : jusqu'ici, intégrer une IA dans une application signifiait coller un widget de chat dans un coin d'interface. L'utilisateur tapait, le modèle répondait en texte, et personne ne prenait en charge la traduction de cette réponse en action réelle. AG-UI comble le troisième maillon manquant de la pile agentique : MCP standardise l'accès aux outils externes, A2A coordonne les agents entre eux, AG-UI gère la couche d'interaction entre l'agent, l'application et l'utilisateur. Il permet le streaming en temps réel, la génération dynamique de composants d'interface, la synchronisation d'état bidirectionnelle, et les pauses "human-in-the-loop" où l'agent attend une confirmation avant d'agir. AIMock, lui, s'attaque à un problème que peu d'équipes osent admettre : les suites de tests pour agents sont, pour la plupart, de la fiction. Une requête agentique typique en 2026 traverse six ou sept services (LLM, serveur MCP, base vectorielle, reranker, API de recherche web, couche de modération, sous-agent A2A) et la plupart des équipes n'en simulent qu'un seul, laissant les autres non-déterministes et incontrôlés. L'analogie avancée par CopilotKit est parlante : AG-UI serait à la pile agentique ce que HTML est au web, la couche de présentation et d'interaction que TCP et HTTP rendent possible sans pouvoir la fournir eux-mêmes. Pendant des années, l'IA dans les logiciels est restée un outil passif, fonctionnel comme une calculatrice mais incapable d'agir de façon autonome. CopilotKit parie que l'avenir appartient aux agents qui vivent à l'intérieur des applications, comprennent le contexte de l'utilisateur, prennent des actions et génèrent des interfaces adaptées plutôt que de longs blocs de texte. Avec l'adoption par les grands fournisseurs cloud et l'entrée dans les cursus pédagogiques, la startup semble avoir franchi le cap qui sépare le protocole expérimental de l'infrastructure de production. La prochaine étape annoncée porte sur la persistance runtime, troisième chantier d'une feuille de route 2026 qui vise délibérément les angles morts de l'architecture agentique.

💬 L'idée du maillon manquant est bonne : MCP pour les outils, A2A pour la coordination, AG-UI pour l'utilisateur, la stack agentique commence à avoir une vraie colonne vertébrale. Ce qui me parle autant, c'est AIMock, parce que les suites de tests pour agents c'est de la fiction dans la plupart des équipes, et c'est enfin assumé. AWS dans Bedrock, Google et Microsoft embarqués, bon, sur le papier c'est le seuil qui sépare le protocole expérimental du vrai standard de prod.

InfrastructureOpinion
1 source
Doter les agents d'ordinateurs : Ivan Burazin, Daytona
163Latent Space 

Doter les agents d'ordinateurs : Ivan Burazin, Daytona

Ivan Burazin, PDG de Daytona, est au coeur d'une transformation silencieuse mais radicale de l'infrastructure cloud. Son entreprise, fondée sur une obsession vieille de plus d'une décennie, a opéré un pivot décisif : quitter les environnements de développement pour humains afin de fournir des sandboxes informatiques aux agents IA. Daytona peut aujourd'hui démarrer un sandbox en environ 60 millisecondes, en lancer 50 000 en 75 secondes, et son plus gros client exploite quelque 850 000 sandboxes par jour. La plateforme tourne sur du bare metal avec son propre scheduler, plutôt que sur Kubernetes, et les charges de travail liées au reinforcement learning et aux évaluations de modèles sont passées de zéro à environ 50 % de l'utilisation totale en quelques mois seulement. Ce changement illustre une bascule profonde dans les besoins de l'industrie IA. Les agents logiciels ne travaillent pas sur un laptop : ils ont besoin d'une machine accessible par API, capable de conserver un état entre les tâches, de s'adapter instantanément à des pics de charge massifs, et d'être suffisamment isolée pour rester sûre. Quand un client passe de zéro à 100 000 CPUs en quelques minutes pour une tâche d'entraînement, les architectures classiques comme EKS ou GKE montrent leurs limites. Plusieurs clients de Daytona affirment ne pas vouloir revenir à ces solutions. Au-delà du code, Burazin défend l'idée que les agents auront besoin de machines Windows et macOS, pas seulement Linux, ce qui pose des contraintes de licencing importantes, notamment du côté d'Apple. Ivan Burazin n'en est pas à son coup d'essai. Il avait fondé CodeAnywhere, l'un des premiers IDE entièrement dans le navigateur, avec l'idée déjà en tête de mettre fin au développement sur machine locale. La thèse était bonne, mais le marché n'était pas prêt. L'essor des agents IA en 2025 a changé la donne : là où les développeurs humains s'attachent à leur éditeur favori, les agents sont indifférents à l'environnement, pourvu qu'il soit rapide, fiable et pilotable par code. Daytona s'est imposé dans ce créneau en lançant un MVP la veille du Nouvel An, dont les API keys se sont arrachées en quelques heures. La vision de Burazin pour la prochaine étape du cloud IA ressemble davantage à Stripe, une infrastructure invisible et composable consommée à l'usage, qu'au modèle AWS traditionnel. Un pari sur la façon dont les agents, et non plus les humains, deviendront les principaux consommateurs de ressources informatiques.

InfrastructureOpinion
1 source
NVIDIA GTC Taipei au COMPUTEX : les dernières annonces IA en direct
164NVIDIA AI Blog 

NVIDIA GTC Taipei au COMPUTEX : les dernières annonces IA en direct

NVIDIA a remporté plusieurs prix aux COMPUTEX Best Choice Awards 2026, lors du salon GTC Taipei at COMPUTEX qui se tient à Taïwan. Trois produits ont été distingués : le Vera Rubin NVL72, superordinateur IA à l'échelle du rack, a décroché un Golden Award ainsi que le Sustainable Tech Special Award ; la plateforme Jetson Thor pour l'IA embarquée et la robotique a également obtenu un Golden Award ; et l'Alpamayo, plateforme ouverte pour le développement de véhicules autonomes, a remporté le prix de la catégorie Vehicle Technology and Smart Cockpit. Les candidatures ont été évaluées sur leur fonctionnalité, leur innovation et leur potentiel de marché. Jensen Huang, fondateur et PDG de NVIDIA, prononcera un discours inaugural le 1er juin à 11h (heure de Taïwan) au Taipei Music Center. Le Vera Rubin NVL72 concentre l'essentiel des innovations primées. Ce système connecte 36 CPU NVIDIA Vera et 72 GPU NVIDIA Rubin, unifiés via le commutateur NVLink de sixième génération, des SuperNICs ConnectX-9 et des commutateurs optiques Spectrum-X pour la mise à l'échelle. Il affiche jusqu'à 10 fois de meilleures performances d'inférence par watt et un coût par token réduit d'un facteur 10. Associé au NVIDIA Groq 3 LPX, il atteint 35 fois plus de débit par watt pour les modèles à un billion de paramètres. Conçu pour l'IA agentique, le raisonnement et les charges à long contexte, il est entièrement refroidi par liquide à 45 degrés Celsius, sans câbles ni tuyaux ni ventilateurs, réduisant le temps d'assemblage de deux heures à cinq minutes par plateau de calcul. La plateforme Jetson Thor affiche quant à elle 2 070 téraflops FP4, soit 7,5 fois la puissance de calcul et 3,5 fois l'efficacité énergétique de la génération précédente Jetson Orin, dans un module configurable entre 40 et 130 watts. Ces distinctions surviennent alors que COMPUTEX, salon de référence pour la technologie et l'informatique en Asie, accueille cette année le GTC Taipei, la conférence annuelle de NVIDIA dédiée à l'accélération de l'IA. L'événement rassemble développeurs, chercheurs et dirigeants industriels autour des thèmes des usines d'IA, de l'infrastructure à grande échelle, de l'IA physique et des systèmes autonomes. NVIDIA y consolide sa position de fournisseur incontournable pour les centres de données de nouvelle génération, à l'heure où la demande en puissance de calcul pour l'entraînement et l'inférence de grands modèles s'emballe. Les annonces du keynote de Jensen Huang du 1er juin seront scrutées de près par l'ensemble de l'industrie, qui attend des précisions sur la feuille de route de l'entreprise pour les prochains mois.

UELes futurs déploiements des hyperscalers et centres de données européens seront concernés par ces nouvelles architectures, mais aucun impact direct ou immédiat sur la France ou l'UE n'est mentionné.

InfrastructureActu
1 source
Anthropic en négociations pour utiliser les puces IA de Microsoft
165The Information AI 

Anthropic en négociations pour utiliser les puces IA de Microsoft

Anthropic serait en discussions avec Microsoft pour louer des serveurs équipés de puces d'intelligence artificielle conçues en interne par le géant de Redmond. Selon deux personnes ayant eu des échanges directs avec des dirigeants impliqués dans les négociations, la startup fondatrice de Claude cherche à augmenter sa capacité de calcul pour répondre à une demande croissante pour ses modèles d'IA. Aucun accord n'a encore été officialisé, mais les tractations sont en cours. Pour Microsoft, convaincre Anthropic d'adopter ses propres puces constituerait une victoire symbolique et commerciale majeure. L'effort de design de puces maison de l'entreprise a accusé des retards en 2024, compliquant sa stratégie d'indépendance vis-à-vis des fournisseurs externes. Séduire un acteur aussi visible qu'Anthropic permettrait à Microsoft de valider publiquement ses capacités matérielles et de diversifier les revenus issus de son infrastructure cloud Azure. La démarche s'inscrit dans une tendance de fond : les grands fournisseurs de cloud cherchent à réduire leur dépendance aux puces Nvidia, qui dominent aujourd'hui presque l'intégralité du marché des accélérateurs IA et dont la disponibilité reste contrainte. Google dispose déjà de ses TPU, Amazon de ses puces Trainium et Inferentia. Microsoft, en retard sur ce front, tente de combler l'écart. Anthropic, de son côté, bénéficie déjà d'investissements massifs d'Amazon et de Google, ce qui rend un partenariat avec Microsoft d'autant plus significatif sur le plan stratégique.

InfrastructureActu
1 source
Anthropic pourrait dépenser 1,25 milliard $ par mois sur l’infrastructure xAI
166Le Big Data 

Anthropic pourrait dépenser 1,25 milliard $ par mois sur l’infrastructure xAI

Anthropic s'apprête à verser jusqu'à 1,25 milliard de dollars par mois à xAI, la société d'intelligence artificielle d'Elon Musk, pour accéder à sa puissance de calcul. L'accord, révélé dans un dépôt S-1 de SpaceX auprès de la SEC, porte sur l'achat de la totalité de la production du centre de données Colossus 1, situé près de Memphis, dans le Tennessee. Le contrat court jusqu'en mai 2029 et pourrait représenter jusqu'à 45 milliards de dollars de revenus cumulés pour xAI, les deux parties conservant toutefois une option de résiliation avec un préavis de 90 jours. L'accord fait suite à une première annonce, quelques semaines plus tôt, selon laquelle Anthropic avait sécurisé 300 mégawatts de capacité de calcul auprès de xAI, une décision déjà jugée surprenante par le marché. Pour Anthropic, l'accès garanti à des milliers de GPU sur plusieurs années répond à une contrainte structurelle : les modèles génératifs de nouvelle génération exigent des volumes de calcul massifs, aussi bien pour l'entraînement que pour l'inférence et les usages professionnels en temps réel. Alors que la demande des entreprises s'emballe plus vite que l'offre mondiale en puces avancées, verrouiller plusieurs années de capacité permet au créateur de Claude de réduire sa dépendance aux grands fournisseurs cloud traditionnels, Amazon Web Services, Microsoft Azure et Google Cloud. L'accord réduit également le risque de goulots d'étranglement à mesure qu'Anthropic étend ses déploiements dans les produits et workflows d'entreprises. Pour xAI, en revanche, ce contrat s'inscrit dans une stratégie de monétisation agressive de sa capacité excédentaire. Selon les documents de SpaceX, l'accord permet de rentabiliser des serveurs sous-utilisés, une situation qui coïncide avec un ralentissement rapporté de l'usage de Grok, l'assistant IA de xAI, ces derniers mois. Ce modèle positionne xAI dans la catégorie des "néoclouds" : des acteurs qui construisent d'abord une infrastructure pour leurs propres modèles, puis revendent la capacité disponible à d'autres entreprises du secteur, accélérant ainsi l'amortissement des coûts colossaux liés aux GPU Nvidia et aux centres de données énergivores. Paradoxalement, la transaction illustre aussi une évolution du marché : deux concurrents directs sur le segment des modèles génératifs coopèrent désormais sur l'infrastructure, signe que les investissements nécessaires à la course à l'IA dépassent ce que même les leaders du secteur peuvent absorber seuls.

InfrastructureOpinion
1 source
Free, Orange et EDF s’allient pour créer une AI Gigafactory en France
167Le Big Data 

Free, Orange et EDF s’allient pour créer une AI Gigafactory en France

Le 20 mai 2026, huit grands groupes français ont annoncé la création du consortium AION pour porter la candidature de la France au programme européen des AI Gigafactories. Parmi eux : Iliad (la maison mère de Free), Orange, EDF, Capgemini, Scaleway, Ardian, Artefact et Bull. L'objectif est de construire une infrastructure capable d'héberger, d'entraîner et de déployer des modèles d'intelligence artificielle à très grande échelle, entièrement sur sol européen. Chaque membre apporte une brique stratégique : Bull fournit les supercalculateurs haute performance, EDF sécurise l'approvisionnement en électricité bas carbone, Orange et Scaleway assurent le cloud et l'hébergement des données, tandis que Capgemini et Artefact se concentrent sur l'intégration de l'IA en entreprise. Iliad et Ardian apportent le capital et l'expertise numérique pour soutenir un projet de très long terme. Le consortium peut également s'appuyer sur un écosystème plus large incluant Hugging Face, INRIA, Nokia, LightOn et Schneider Electric. L'enjeu est direct : aujourd'hui, l'essentiel de la puissance de calcul utilisée pour entraîner les grands modèles d'IA repose sur des infrastructures américaines, Microsoft, Google, Amazon. Pour les entreprises françaises et européennes des secteurs sensibles comme la santé, l'industrie ou les services publics, cette dépendance pose des problèmes concrets de souveraineté des données et de conformité réglementaire. Une gigafactory IA en France offrirait une alternative crédible, d'autant que le mix énergétique français, nucléaire et hydraulique, produit une électricité moins carbonée et plus stable que dans beaucoup de pays européens. Or les infrastructures IA consomment des volumes d'énergie colossaux, ce qui fait de l'accès à une énergie abondante et décarbonée un avantage compétitif aussi déterminant que les semi-conducteurs. Le consortium indique par ailleurs vouloir privilégier les technologies open source pour éviter de recréer des dépendances aux solutions propriétaires. Ce projet s'inscrit dans une dynamique européenne plus large : la Commission européenne a lancé son programme AI Gigafactories pour doter le continent d'infrastructures capables de rivaliser avec celles des États-Unis et de la Chine, dans un contexte où la course aux modèles génératifs et aux agents IA s'accélère. La France, qui abrite déjà des acteurs de premier plan comme Mistral AI et Hugging Face, tente de transformer cet avantage écosystémique en infrastructure physique souveraine. AION devra encore préciser le calendrier de déploiement et les montants d'investissement engagés, mais la mobilisation de groupes aussi diversifiés, télécoms, énergie, cloud, conseil, finance, signal que la France mise sur une approche de filière plutôt que sur un champion unique pour peser dans la prochaine phase de l'IA industrielle.

UELe consortium AION, porté par EDF, Orange, Iliad et Capgemini, vise à offrir aux entreprises françaises et européennes des secteurs sensibles (santé, industrie, services publics) une alternative souveraine aux infrastructures cloud américaines, en réponse directe au programme européen des AI Gigafactories.

💬 Bon, sur le papier, c'est exactement ce qu'il manquait. Avoir EDF dans la boucle pour sécuriser de l'énergie nucléaire bas carbone, c'est l'argument que personne d'autre en Europe ne peut vraiment sortir, et ça change tout quand tes GPU tournent 24h/24. La question maintenant : calendrier, montants, et si ce consortium reste soudé quand il faudra écrire les vrais chèques.

La puce Vera de Nvidia, le pari à 200 milliards de dollars que Jensen Huang veut mettre en avant
168AI News 

La puce Vera de Nvidia, le pari à 200 milliards de dollars que Jensen Huang veut mettre en avant

Nvidia a publié mercredi ses résultats du premier trimestre fiscal avec un chiffre d'affaires de 81,62 milliards de dollars, dépassant les 78,86 milliards attendus par les analystes. La guidance pour le deuxième trimestre est fixée à 91 milliards, là encore au-dessus des 86,84 milliards anticipés par Wall Street. Mais lors de la conférence avec les analystes, le PDG Jensen Huang a mis en avant un élément stratégique souvent éclipsé par les chiffres trimestriels : le processeur Vera. Huang estime que cette puce CPU ouvre un marché adressable de 200 milliards de dollars, entièrement distinct du marché d'un billion de dollars déjà projeté pour les GPU Blackwell et Rubin entre 2025 et 2027. Il prévoit que les revenus issus de Vera atteindront 20 milliards de dollars d'ici la fin de l'exercice fiscal en cours, ce qui en ferait le deuxième poste de revenus de l'entreprise. La plateforme complète Vera Rubin, combinant le CPU Vera avec les GPU Rubin, doit être lancée plus tard cette année. La mise sur Vera répond à une menace structurelle sur le segment de l'inférence. Google, Amazon et Microsoft devraient investir collectivement plus de 700 milliards de dollars dans l'infrastructure IA cette année, contre environ 400 milliards en 2025, mais développent simultanément leurs propres puces maison pour faire tourner les modèles d'IA à grande échelle. Les TPU de Google, Trainium d'Amazon, ainsi que les offres d'Intel et AMD positionnent désormais sérieusement leurs processeurs sur l'inférence, le maillon où la domination GPU de Nvidia est la plus exposée. Entraîner de grands modèles reste le terrain de chasse exclusif de Nvidia, mais générer des réponses en temps réel et à l'échelle, c'est là que la concurrence fait son chemin. La puce Vera a été développée en partie grâce à une technologie issue de Groq, une startup spécialisée dans l'inférence, dans le cadre d'un accord de licence estimé à environ 17 milliards de dollars. L'enjeu immédiat reste l'approvisionnement. Huang a reconnu sans détour que Nvidia sera probablement en tension sur les stocks durant toute la durée de vie de la plateforme Vera Rubin. Pour anticiper, les engagements d'approvisionnement de l'entreprise ont bondi à 119 milliards de dollars au premier trimestre, contre 95,2 milliards le trimestre précédent. Nvidia a également annoncé un programme de rachat d'actions de 80 milliards de dollars et relevé son dividende trimestriel de 1 centime à 25 cents par action. Malgré ces signaux de confiance, le titre a reculé de 1,6 % en after-hours : les analystes estiment que les performances record sont désormais intégrées dans le cours. La vraie question est de savoir si Nvidia peut convaincre que la dynamique de dépenses en IA restera solide jusqu'en 2027 et 2028, dans un contexte où les géants du cloud bâtissent activement des alternatives à ses GPU.

UELes entreprises européennes et data centers qui dépendent des GPU Nvidia pour leurs infrastructures IA pourraient être confrontés à des tensions d'approvisionnement prolongées sur la plateforme Vera Rubin, avec un impact potentiel sur les coûts et délais de déploiement.

💬 Le chiffre qui compte vraiment, c'est pas les 81 milliards de revenus. C'est que Google, Amazon et Microsoft vont dépenser 700 milliards en infra IA cette année, en bonne partie pour construire leurs propres puces et sortir de la dépendance Nvidia sur l'inférence. Vera, c'est Jensen qui joue défensif avant que les dégâts arrivent, et c'est ça que les résultats record font oublier.

IA et performance : le verdict de l’indice mondial Fivetran
169Le Big Data 

IA et performance : le verdict de l’indice mondial Fivetran

Fivetran a publié en 2026 son indice mondial de maturité des pipelines de données, et les résultats sont sans appel : si 60 % des organisations à l'échelle mondiale investissent massivement dans l'IA agentique, avec des budgets estimés à plusieurs dizaines de millions d'euros, seules 15 % d'entre elles disposent réellement d'une infrastructure de données suffisamment solide pour faire fonctionner ces systèmes en production. En France, ce chiffre tombe à 12 %, soit parmi les plus faibles des pays étudiés. George Fraser, PDG de Fivetran, pointe une erreur de diagnostic commune : les entreprises investissent dans les modèles et les interfaces, mais négligent la plomberie informatique qui les alimente. Résultat : des agents autonomes déployés sur des pipelines instables, incapables de fournir des données fiables en temps réel. L'enjeu dépasse largement la performance technique. Contrairement à l'IA générative classique qui produit du texte à la demande, l'IA agentique prend des décisions et exécute des tâches en autonomie, ce qui exige une traçabilité complète et des données de qualité à chaque instant. Or, près de 40 % des professionnels interrogés dans l'étude identifient deux blocages majeurs : l'absence de traçabilité, qui empêche de comprendre l'origine des erreurs quand un agent dérape, et les contraintes réglementaires de souveraineté des données, qui freinent les déploiements à grande échelle. Ces failles de gouvernance transforment les projets pilotes en impasses opérationnelles, avec des risques économiques et réputationnels concrets pour les organisations concernées. Gartner va plus loin en avertissant que plus de la moitié des initiatives d'IA agentique pourraient être abandonnées faute de préparation adéquate des systèmes sous-jacents. Ce rapport intervient dans un contexte d'accélération généralisée des budgets IA, où la pression sur les directions informatiques pour livrer des résultats visibles est maximale. Les entreprises les plus avancées dans leur déploiement partagent une caractéristique commune : elles ont misé sur des architectures interopérables, capables de communiquer entre différents systèmes sans dépendre d'un fournisseur unique, ce que l'industrie appelle l'évitement du "vendor lock-in". Pour les responsables data, cette capacité d'intégration est désormais un critère éliminatoire dans le choix des solutions. La leçon que tire Fivetran de cet indice est claire : la priorité de 2026 n'est plus l'acquisition de nouveaux outils d'IA, mais la consolidation et la fiabilisation des flux de données qui les alimentent. Sans cette fondation, les ambitions agentiques resteront, pour la plupart des organisations, des promesses sur slides.

UELa France affiche le taux de maturité infrastructure le plus bas de l'étude (12%), exposant les entreprises françaises à un risque élevé d'échec de leurs initiatives d'IA agentique faute de pipelines de données fiables.

InfrastructureActu
1 source
Cerebras affirme que ses puces exécutent un modèle IA d'un billion de paramètres près de 7 fois plus vite que les clouds GPU
170VentureBeat AI 

Cerebras affirme que ses puces exécutent un modèle IA d'un billion de paramètres près de 7 fois plus vite que les clouds GPU

Moins d'une semaine après avoir bouclé la plus grande introduction en bourse du secteur tech en 2026, Cerebras Systems a annoncé lundi qu'il fait tourner Kimi K2.6, un modèle open-weight de mille milliards de paramètres développé par la société pékinoise Moonshot AI, à près de 1 000 tokens par seconde pour ses clients entreprises. Le chiffre exact, vérifié de manière indépendante par la firme de benchmarking Artificial Analysis, s'établit à 981 tokens par seconde en sortie, soit 6,7 fois plus rapide que le meilleur fournisseur cloud sur GPU et 23 fois plus rapide que la médiane. Sur une requête d'assistance au code impliquant 10 000 tokens en entrée, Cerebras a livré la réponse complète en 5,6 secondes, contre 163,7 secondes sur l'endpoint officiel de Kimi, soit une amélioration d'un facteur 29. La société, basée à Sunnyvale et désormais valorisée 95 milliards de dollars après avoir levé 5,55 milliards lors de son IPO, signe ici son entrée en production sur les modèles de taille maximale, un palier qu'elle n'avait jamais encore franchi. L'enjeu dépasse la performance brute. Kimi K2.6 est l'un des premiers modèles open-weight que les entreprises peuvent crédiblement utiliser comme alternative aux API fermées d'Anthropic ou d'OpenAI, notamment pour les tâches de codage et d'agents autonomes qui représentent aujourd'hui les cas d'usage les plus rentables des grands modèles de langage. James Wang, directeur marketing produit de Cerebras, est direct : les clients sont motivés avant tout par le besoin d'une alternative à Anthropic, dont les modèles sont excellents mais coûteux et régulièrement saturés. Il cite l'exemple d'une application tombée en panne un week-end faute de capacité disponible sur l'API d'Anthropic, une mésaventure qui résonne fortement auprès des acheteurs en entreprise. La rapidité de Cerebras n'est donc pas qu'un argument marketing : dans les workflows agentiques, où chaque seconde d'attente se multiplie par des dizaines d'appels successifs, la vitesse d'inférence devient un avantage compétitif structurel. Kimi K2.6 a été publié le 20 avril par Moonshot AI, une startup fondée en 2023 par des anciens de l'université Tsinghua et considérée comme l'une des entreprises "AI Tiger" de Chine. Le modèle utilise une architecture Mixture-of-Experts avec 32 milliards de paramètres activés par token sur un total de 1 000 milliards, 384 experts dont 8 sélectionnés par passe, et une fenêtre de contexte de 256 000 tokens. Il occupe la première place sur SWE-Bench Pro avec un score de 58,6, dépassant Claude Opus 4.6 et égalant GPT-5.4. Le choix de ce modèle chinois comme vitrine d'un fabricant de puces américain soulève néanmoins une dimension géopolitique que l'article laisse en suspens : Cerebras joue ici à la fois la carte de la performance et celle de l'ouverture, dans un contexte de tensions croissantes autour des technologies d'IA entre les deux pays.

UELes entreprises européennes dépendantes de solutions cloud d'inférence LLM disposent d'une nouvelle alternative matérielle avec des vitesses vérifiées jusqu'à 6,7 fois supérieures aux meilleurs fournisseurs GPU, ce qui peut réduire les risques de saturation de capacité pour les workflows agentiques.

💬 981 tokens par seconde, vérifié par un tiers indépendant, sur un modèle à 1000 milliards de paramètres. Dans les workflows agentiques où chaque appel LLM en déclenche dix autres, c'est pas un argument marketing, c'est du cash économisé et des pannes évitées. Et le truc le plus savoureux, c'est qu'un fabricant de puces américain fraîchement introduit en bourse choisit un modèle chinois comme vitrine, et que l'article passe presque dessus comme si c'était un détail.

InfrastructureOpinion
1 source
La passerelle IA : centraliser l'inférence à l'échelle d'équipes décentralisées
171InfoQ AI 

La passerelle IA : centraliser l'inférence à l'échelle d'équipes décentralisées

Face à la multiplication des modèles d'IA dans les entreprises, les équipes d'ingénierie se retrouvent confrontées à ce que Meryem Arik appelle le "chaos d'inférence" : chaque équipe choisit ses propres modèles, ses propres fournisseurs, sans coordination ni visibilité globale. Pour y remédier, une nouvelle catégorie d'infrastructure émerge : les passerelles de modèles d'IA (AI model gateways), une couche de contrôle centralisée qui s'intercale entre les équipes et les fournisseurs de LLM comme OpenAI, Anthropic ou Mistral. L'enjeu est concret : sans ce type de couche intermédiaire, les DSI et responsables techniques perdent le contrôle des coûts, de la sécurité et de la conformité. Une passerelle bien configurée permet de gérer les droits d'accès par équipe (RBAC), de suivre la consommation par projet, d'imposer des règles de routage selon les besoins, et d'éviter que des données sensibles partent vers des API externes sans supervision. Pour les grandes organisations qui déploient l'IA à l'échelle, c'est une brique devenue aussi critique qu'un API gateway classique. Deux solutions open source se distinguent dans ce segment : LiteLLM, qui offre une interface unifiée vers des dizaines de fournisseurs LLM, et Doubleword, plus récent, positionné sur le contrôle d'entreprise. Ce marché reste jeune mais s'accélère à mesure que les équipes tech passent du prototype à la production à grande échelle. Les éditeurs de plateformes MLOps comme Weights & Biases ou Databricks surveillent ce segment de près, et des acquisitions ou intégrations sont probables dans les prochains mois.

UELes entreprises européennes déployant des LLMs à grande échelle ont un intérêt direct à adopter ce type de passerelle pour satisfaire aux exigences du RGPD et de l'AI Act, en garantissant que les données sensibles restent sous contrôle avant d'être transmises à des API externes.

InfrastructureOpinion
1 source
AION : la gigafactory IA d'Orange, EDF et Capgemini
172FrenchWeb 

AION : la gigafactory IA d'Orange, EDF et Capgemini

Ardian, Orange, EDF, Capgemini, Artefact, Bull, le Groupe iliad et Scaleway ont annoncé leur regroupement au sein du consortium AION pour déposer une candidature française au programme européen des AI Gigafactories. Cette initiative, portée par la Commission européenne dans le cadre de son agenda pour la souveraineté numérique, vise à financer la construction de centres de calcul massifs dédiés à l'intelligence artificielle sur le sol européen. L'alliance réunit ainsi des acteurs complémentaires : un fonds d'investissement de premier plan, deux géants de l'énergie et des télécoms, un intégrateur IT mondial et plusieurs spécialistes du cloud français. L'enjeu est considérable pour l'écosystème européen de l'IA. L'Europe accuse un retard structurel face aux États-Unis et à la Chine en matière de puissance de calcul disponible pour entraîner et faire tourner des grands modèles de langage. Une gigafactory labellisée par Bruxelles permettrait de concentrer des milliers de GPU sur un même site, d'en garantir l'accès à des startups et laboratoires de recherche européens à des conditions compétitives, et de réduire la dépendance aux infrastructures américaines comme AWS ou Azure. Le programme AI Gigafactories s'inscrit dans le plan InvestAI annoncé par la Commission européenne début 2025, qui ambitionne de mobiliser 200 milliards d'euros pour rattraper le retard du continent. Plusieurs États membres ont déjà soumis des candidatures, et la France entend peser dans cette compétition en fédérant ses acteurs industriels et technologiques les plus solides. Le choix des lauréats par Bruxelles déterminera quels pays accueilleront les prochains piliers de l'infrastructure IA continentale.

UELe consortium AION réunit Orange, EDF, Capgemini, iliad et Scaleway pour candidater au programme européen des AI Gigafactories, ce qui pourrait permettre à la France d'accueillir un centre de calcul souverain offrant aux startups et laboratoires européens un accès compétitif à la puissance GPU nécessaire à l'entraînement de grands modèles.

💬 Du lourd dans ce consortium : Orange, EDF, Scaleway, iliad, c'est pas une candidature symbolique. Ce qui m'intéresse vraiment là-dedans, c'est pas la gigafactory en elle-même, c'est l'accès GPU garanti pour les startups et labos européens qui galèrent à se payer du compute H100. Bruxelles retient 2-3 sites max sur tout le continent, et là, faut pas se louper.

InfrastructureActu
1 source
Alibaba conçoit des puces IA pour les agents autonomes, ce qui redéfinit les enjeux de la course aux semi-conducteurs
173AI News 

Alibaba conçoit des puces IA pour les agents autonomes, ce qui redéfinit les enjeux de la course aux semi-conducteurs

Alibaba a présenté le Zhenwu M890, un processeur développé par sa filiale semi-conducteur T-Head, conçu spécifiquement pour les agents IA. Selon l'entreprise, la puce offre des performances trois fois supérieures à son prédécesseur, le Zhenwu 810E. Mais la véritable nouveauté n'est pas le bond de puissance brute : le M890 est architecturalement pensé pour les agents IA, ces systèmes logiciels qui doivent maintenir de longs contextes en mémoire, coordonner plusieurs modèles en temps réel et exécuter des tâches complexes à plusieurs étapes avec une intervention humaine minimale. Ces exigences, notamment en bande passante mémoire et en communication inter-modèles, sont fondamentalement différentes de celles des puces d'inférence classiques. En parallèle, Alibaba a annoncé Qwen 3.7-Max, la dernière version de son grand modèle de langage phare, capable de fonctionner en continu jusqu'à 35 heures sans dégradation des performances, une spec qui n'a de sens que si l'on conçoit pour une opération autonome prolongée. Ce qui change vraiment avec cette annonce, c'est la nature de la compétition. Alibaba ne comble pas un vide laissé par les contrôles à l'exportation américains : l'entreprise construit une pile IA intégrée et fermée, avec sa propre puce chez T-Head, son propre modèle chez Qwen, et sa propre plateforme de livraison cloud via Bailian. Le M890 sera disponible aux entreprises chinoises empaqueté dans le Panjiu AL128, un serveur rack intégrant 128 accélérateurs M890. T-Head annonce par ailleurs avoir déjà livré plus de 560 000 unités Zhenwu à plus de 400 clients dans 20 secteurs, dont l'automobile et la finance. Ce n'est pas du matériel de laboratoire : Alibaba dispose déjà de données de déploiement à l'échelle réelle avant même le lancement commercial du M890. La feuille de route publiée simultanément est tout aussi significative. Le M890 sera suivi du V900 au troisième trimestre 2027, promettant un nouveau gain de performances triple, puis du J900 au troisième trimestre 2028. Cette cadence délibérée rappelle les cycles tick-tock de Nvidia, et fait écho à la roadmap similaire dévoilée par Huawei pour sa ligne Ascend l'an dernier. Les deux annonces révèlent la même conclusion stratégique : les grandes entreprises technologiques chinoises ont décidé que dépendre de puces étrangères, même dans un scénario d'allègement des restrictions, représente un risque structurel inacceptable. Cette conviction se traduit en capital : Alibaba a engagé plus de 380 milliards de yuans (environ 53 milliards de dollars) dans l'infrastructure cloud et IA sur trois ans, son plus grand investissement sectoriel à ce jour. Le M890 et ses successeurs sont le résultat direct de cette mise.

UEL'autonomisation accélérée de la Chine en matière de puces IA renforce les tensions géopolitiques sur les semi-conducteurs et accentue la pression sur l'Europe pour consolider sa propre souveraineté technologique dans le cadre de l'EU Chips Act.

InfrastructureOpinion
1 source
Les puces IA d'Amazon commencent à séduire les développeurs face à Nvidia
174The Information AI 

Les puces IA d'Amazon commencent à séduire les développeurs face à Nvidia

Les puces Trainium d'Amazon commencent à séduire les développeurs d'intelligence artificielle, marquant une étape importante dans la stratégie du géant du cloud pour concurrencer Nvidia. Anthropic et OpenAI, qui ont conclu des accords d'investissement et d'infrastructure de plusieurs milliards de dollars avec Amazon, se sont déjà engagés à louer de grandes quantités de capacité Trainium, aussi bien les générations actuelles que futures. Des améliorations logicielles récentes ont en outre convaincu une demi-douzaine de développeurs plus modestes, selon des personnes qui utilisent ou travaillent avec ces puces, d'envisager de transférer davantage de leurs charges de travail vers cette architecture propriétaire d'AWS. Ce changement de perception est significatif pour l'industrie. Nvidia contrôle aujourd'hui plus de 80 % du marché des puces d'entraînement d'IA, ce qui lui confère un pouvoir de fixation des prix considérable. Si Amazon parvient à convaincre même une fraction des développeurs de basculer vers Trainium, cela pourrait réduire la dépendance structurelle de l'écosystème IA envers un seul fournisseur et faire pression sur les marges exceptionnelles de Nvidia. Amazon développe ses propres siliciums depuis plusieurs années, après le rachat d'Annapurna Labs en 2015. La stratégie repose sur l'intégration verticale : proposer des puces optimisées pour les services AWS, avec des prix potentiellement inférieurs à ceux des GPU H100 et H200 de Nvidia. L'adhésion d'acteurs aussi stratégiques qu'Anthropic, dans lequel Amazon a investi plus de 4 milliards de dollars, constitue à la fois une validation technique et un levier commercial pour attirer d'autres clients vers l'écosystème Trainium.

UELes développeurs et entreprises européennes hébergés sur AWS pourraient bénéficier d'une alternative moins coûteuse aux GPU Nvidia si l'adoption de Trainium se généralise, réduisant la dépendance structurelle de l'écosystème IA à un unique fournisseur de silicium.

💬 Quand Anthropic et OpenAI "adoptent" Trainium, faut garder en tête qu'Amazon leur a mis des milliards sur la table, donc c'est une validation arrangée autant que technique. Ce qui compte vraiment, c'est la demi-douzaine de développeurs indépendants qui commencent à y basculer des workloads pour des raisons de coût, sans deal en arrière-plan. C'est ce signal-là qui a du poids.

InfrastructureOpinion
1 source
L'infrastructure GenAI pour préparer l'avenir
175InfoQ AI 

L'infrastructure GenAI pour préparer l'avenir

Merrin Kurian, ingénieure chez Intuit, a présenté l'architecture et les processus organisationnels qui sous-tendent la transformation IA de l'entreprise, connue pour ses logiciels fiscaux et financiers comme TurboTax et QuickBooks. Au cœur de cette transformation se trouve GenOS, la plateforme d'IA générative interne d'Intuit, déployée auprès de 8 000 développeurs et ayant permis la mise en production de plus de 3 500 expérimentations. Pour piloter ce déploiement à grande échelle, Intuit a adopté un cadre en trois niveaux baptisé "fixed, flexible, free", distinguant ce qui est imposé à tous, ce qui est configurable selon les équipes, et ce qui est laissé à la libre initiative des développeurs. Cette approche structurée répond à un défi concret pour toute grande entreprise qui industrialise l'IA : comment donner de l'autonomie aux équipes sans perdre le contrôle de la qualité, de la sécurité et de la cohérence des systèmes. Kurian a notamment détaillé les modes de défaillance propres aux agents IA, ces systèmes autonomes qui enchaînent des actions, et présenté une stratégie d'évaluation dite "LLM-as-a-judge", où un modèle de langage est utilisé pour noter automatiquement les sorties d'un autre modèle. Intuit travaille également à rendre ses API "tool-ready", c'est-à-dire nativement compatibles avec des agents IA capables de les appeler sans intervention humaine. Cette présentation s'inscrit dans un mouvement plus large de structuration des infrastructures GenAI dans les grandes entreprises technologiques. Après une phase d'expérimentation, les acteurs comme Intuit cherchent désormais à industrialiser leurs pratiques, en construisant des plateformes internes capables de supporter des milliers de cas d'usage simultanément. Le passage à l'échelle exige des choix d'architecture rigoureux, une gouvernance claire et des outils d'évaluation automatisés pour maintenir la fiabilité dans des environnements de production complexes.

InfrastructureActu
1 source
L'accord Nvidia H200 avec la Chine a survécu au sommet Trump-Xi, mais pas comme prévu
176AI News 

L'accord Nvidia H200 avec la Chine a survécu au sommet Trump-Xi, mais pas comme prévu

Donald Trump s'est rendu à Pékin en mai 2026, accompagné à la dernière minute de Jensen Huang, PDG de Nvidia, et en est reparti en déclarant que "quelque chose pourrait se passer" sur les exportations de puces. Rien ne s'est passé. Pas un seul H200 de Nvidia n'a été livré en Chine depuis que Trump a autorisé ces ventes en décembre 2025. Le représentant américain au commerce, Jamieson Greer, a confirmé à Bloomberg que les contrôles sur les semi-conducteurs n'étaient même pas à l'ordre du jour bilatéral. En réalité, les licences d'exportation existent déjà : une dizaine d'entreprises chinoises, dont Alibaba, Tencent, ByteDance et JD.com, disposent chacune d'autorisations américaines pour jusqu'à 75 000 unités, avec Lenovo et Foxconn comme distributeurs agréés. Les puces ne bougent pas parce que c'est Pékin qui bloque ses propres entreprises. Le blocage repose sur une contradiction réglementaire structurelle. Les règles américaines exigent que les H200 exportés vers des clients chinois soient déployés uniquement sur le territoire chinois. Pékin, de son côté, a ordonné à ses grandes entreprises tech de réserver leurs achats de puces Nvidia à leurs opérations à l'étranger, tout en soutenant les fournisseurs domestiques. Les deux exigences s'excluent mutuellement : les puces autorisées à l'export ne peuvent légalement être déployées là où Pékin veut les déployer. Ce n'est pas une impasse accidentelle. Le secrétaire au Commerce Howard Lutnick a déclaré devant le Sénat que les firmes chinoises cherchent délibérément à concentrer leurs investissements sur les fournisseurs locaux, au premier rang desquels Huawei. Le Conseil d'État chinois a par ailleurs lancé une revue de la sécurité des chaînes d'approvisionnement visant à réduire la dépendance aux semi-conducteurs américains. Pendant que les diplomates négociaient, les données les plus significatives venaient d'ailleurs. DeepSeek a confirmé que son dernier modèle avait été optimisé pour tourner sur les processeurs Huawei. Le directeur stratégique de Tencent a annoncé que l'offre chinoise en GPU augmenterait progressivement tout au long de 2026, et Alibaba a confirmé que ses GPU propriétaires T-Head étaient désormais en production de masse. En avril, DeepSeek V4 était devenu le premier grand modèle frontier chinois adapté aux puces Ascend de Huawei dès la phase d'entraînement, et non plus seulement pour l'inférence. Le signal est clair : la substitution n'est plus expérimentale, elle est devenue une politique industrielle. Les revenus de Nvidia en Chine sont tombés à environ 5 % ces derniers trimestres, contre plus de 20 % avant le durcissement des contrôles à l'export, et la société anticipe désormais zéro revenu chinois pour le trimestre en cours. La présence de Huang à Pékin illustrait l'urgence ressentie par Nvidia ; son résultat illustre les limites de la diplomatie de PDG face à un blocage structurel.

UEL'impasse sino-américaine sur les GPU Nvidia accélère la montée en puissance d'alternatives chinoises (Huawei Ascend) et rappelle à l'Europe sa propre dépendance aux chaînes d'approvisionnement américaines, renforçant l'urgence de l'European Chips Act.

💬 Jensen Huang à Pékin avec Trump, et au final zéro H200 livré : la mise en scène était parfaite, le résultat nul. Ce qui est frappant, c'est que le blocage ne vient pas de Washington cette fois, ce sont les Chinois eux-mêmes qui freinent leurs propres entreprises pour les forcer vers Huawei. Pendant ce temps, DeepSeek optimisait sur Ascend et Alibaba lançait ses GPU en masse : la substitution n'est plus un plan B, c'est le plan A.

InfrastructureOpinion
1 source
Blackstone et Google investissent dans un nouveau cloud TPU pour accélérer l’IA
177Le Big Data 

Blackstone et Google investissent dans un nouveau cloud TPU pour accélérer l’IA

Blackstone et Google ont annoncé le 19 mai 2026 la création d'une coentreprise américaine dédiée aux services de calcul accéléré basés sur les TPU (Tensor Processing Units) de Google. L'accord prévoit un investissement initial de 5 milliards de dollars apportés par Blackstone en fonds propres, avec pour objectif de déployer une première capacité de 500 mégawatts d'ici 2027. Google fournit ses puces TPU, ses logiciels et ses services, tandis que Blackstone apporte son expertise dans la construction et le financement d'infrastructures à grande échelle, le fonds gère plus de 1 300 milliards de dollars d'actifs et possède une présence majeure dans les centres de données. La nouvelle entité sera dirigée par Benjamin Treynor Sloss, ancien cadre de Google avec plus de vingt ans d'expérience dans la conception d'infrastructures critiques. La capacité prévue pourrait être significativement étendue au-delà de 500 MW pour accompagner la montée en puissance des usages IA. Ce partenariat marque un tournant dans la manière dont Google monétise ses TPU, jusqu'ici cantonnées à un usage interne ou distribuées exclusivement via Google Cloud. En créant une structure commerciale indépendante, Google ouvre un nouveau canal de distribution de sa puissance de calcul, plus flexible et accessible à des entreprises qui ne souhaitent pas s'engager exclusivement avec Google Cloud. Pour les acteurs de l'IA, laboratoires de recherche, institutions financières, grandes entreprises, cela représente une alternative crédible aux GPU Nvidia, qui dominent le marché mais restent confrontés à des problèmes de disponibilité et à des coûts élevés. Cette initiative répond aussi à un besoin structurel : les grandes organisations cherchent à sécuriser des capacités de calcul stables sur le long terme, capables de soutenir des modèles d'IA toujours plus gourmands en ressources. Les TPU de Google sont développées depuis plus d'une décennie et alimentent déjà les infrastructures de Gemini ainsi que celles de nombreux partenaires technologiques. Leur ouverture à un marché plus large s'inscrit dans une logique d'industrialisation rapide de l'infrastructure IA : après la course aux modèles génératifs, la bataille se déplace vers l'accès à la puissance de calcul elle-même. Nvidia règne pour l'instant sans partage sur ce segment, mais la pression concurrentielle s'intensifie, avec des acteurs comme AMD, Intel et désormais Google qui cherchent à capter une part croissante de ce marché estimé à plusieurs centaines de milliards de dollars. L'alliance entre l'un des plus grands gestionnaires d'actifs mondiaux et le détenteur d'une technologie de calcul propriétaire de premier plan illustre comment capital financier et puissance technologique convergent pour structurer l'infrastructure de l'IA de demain.

UELes organisations et laboratoires européens de recherche en IA pourraient à terme accéder à une offre de calcul accéléré supplémentaire, mais la coentreprise est domiciliée aux États-Unis et ne cible pas spécifiquement le marché européen.

💬 5 milliards dans une JV dédiée aux TPU, ça dit clairement que la bataille pour l'infrastructure IA est lancée. Google avait ces puces depuis dix ans, les gardait pour son cloud, et il ouvre maintenant le robinet en partageant le risque avec Blackstone. Reste à voir si les TPU sont vraiment compétitifs en dehors des cas d'usage où Google a tout optimisé pour lui-même.

L'IA est une question de puissance, d'infrastructure et de sécurité, selon TechEx North America
178AI News 

L'IA est une question de puissance, d'infrastructure et de sécurité, selon TechEx North America

La conférence TechEx North America a réuni cette année des représentants de l'industrie autour d'une question centrale : que faut-il construire autour de l'IA avant qu'elle puisse réellement s'intégrer dans le monde physique et les environnements d'entreprise ? Organisée en quatre grandes pistes thématiques, Edge Computing, IoT, Data Centre Congress et Cybersécurité, l'événement a mis en avant des intervenants de Schneider Electric, Akamai, Spectro Cloud, Siemens, LG CNS, Boston Dynamics, Rockwell Automation ou encore Ford. Ed Doran, de l'Edge AI Foundation, a présidé la piste edge computing, dont le programme couvrait le déploiement multi-sites, l'inférence distribuée (on-premise, cloud ou hybride), les opérations réseau agentiques et l'application des principes zero-trust aux systèmes de contrôle industriel. La piste IoT industriel a, elle, abordé les usines intelligentes, la gestion d'actifs, l'IA au-delà de l'Industrie 4.0 et les jumeaux numériques. Le constat qui a dominé les échanges tient en deux mots devenus un leitmotiv du salon : "pilot purgatory". Ce phénomène désigne le gouffre entre une démonstration convaincante en salle de conférence et un déploiement réel qui tient la route face aux machines vieillissantes, aux logiciels patrimoniaux et aux organisations peu préparées. La session commune de Rockwell Automation et Ford sur l'IA physique et l'intelligence des actifs connectés a particulièrement insisté sur ce point : comment fait-on entrer l'intelligence dans les opérations quotidiennes sans qu'elle devienne un tableau de bord de plus que personne ne consulte ? Les jumeaux numériques ont subi le même examen critique, plusieurs intervenants ont plaidé pour des modèles opérationnels capables d'améliorer concrètement la maintenance et d'anticiper les décisions, plutôt que de simples répliques visuelles d'installations. Ces débats s'inscrivent dans un moment charnière pour l'industrie : l'IA générative a démontré sa valeur dans les environnements de bureau, mais son transfert vers les environnements industriels se heurte à des contraintes radicalement différentes, latence, fiabilité, sécurité des systèmes de contrôle et consommation énergétique. La piste Data Centre Congress a illustré cette dernière tension avec acuité, en mettant sur la table les crises de construction, les problèmes d'approvisionnement en électricité, le refroidissement et les besoins en réseau des futurs datacenters dédiés à l'IA. Le message transversal de TechEx North America est que les systèmes intelligents, qu'ils soient enfouis dans un site industriel ou déployés dans un back-office, doivent être conçus en cohérence avec les personnes et les machines qu'ils sont censés servir, sous peine de rester des promesses sans lendemain.

UELa présence de Schneider Electric et Siemens parmi les intervenants principaux illustre le rôle des entreprises européennes dans la définition des standards de déploiement de l'IA industrielle à l'échelle mondiale.

InfrastructureActu
1 source
L'architecture de contexte remplace le RAG à mesure que les agents IA poussent la récupération d'information en entreprise à ses limites
179VentureBeat AI 

L'architecture de contexte remplace le RAG à mesure que les agents IA poussent la récupération d'information en entreprise à ses limites

Redis a lancé lundi Redis Iris, une plateforme de contexte et de mémoire conçue pour les agents d'intelligence artificielle en production. L'annonce vient du CEO Rowan Trollope et marque une évolution majeure dans la stratégie de l'entreprise, historiquement connue comme couche de cache pour les applications web. Redis Iris se positionne entre l'agent et les données dont il a besoin pour agir, en combinant cinq composants : Redis Data Integration (désormais en disponibilité générale), qui synchronise en continu les bases relationnelles, entrepôts et documents via des connecteurs pour Oracle, Snowflake, Databricks et Postgres ; un Context Retriever (en préversion) qui génère automatiquement des outils MCP à partir de modèles de données métier définis en Pydantic, avec contrôles d'accès appliqués côté serveur ; un serveur de mémoire agent pour conserver le contexte à court et long terme entre les sessions ; et Redis Flex, un moteur de stockage réécrit faisant tourner 99 % des données sur SSD et 1 % en RAM, réduisant le coût à un dixième du stockage purement en mémoire. La raison d'être de cette architecture tient à un déséquilibre structurel entre agents et humains. Trollope le formule clairement : les entreprises auront un nombre d'agents plusieurs ordres de grandeur supérieur à celui de leurs employés humains, ce qui génère une charge équivalente sur les systèmes backend. Les pipelines RAG classiques, construits pour des requêtes humaines ponctuelles, ne tiennent pas face au volume que produisent des agents opérant en continu. Redis inverse la logique : plutôt que de présupposer quelles données injecter dans le pipeline, il laisse l'agent tirer lui-même l'information via des interfaces construites pour lui. Le marché confirme l'urgence : selon le VB Pulse RAG Infrastructure Market Tracker du premier trimestre 2026, l'intention d'adoption du retrieval hybride a triplé de 10,3 % à 33,3 % entre janvier et mars, l'optimisation du retrieval est devenue la première priorité d'investissement enterprise devant l'évaluation, et les stacks de retrieval maison sont passées de 24,1 % à 35,6 % du marché. Redis n'est pas le seul acteur à repositionner son offre autour des couches de contexte agent, plusieurs fournisseurs de plateformes de données ayant fait des annonces similaires ces dernières semaines. Trollope tire le parallèle avec l'ère mobile : quand les systèmes bancaires conçus pour les guichets ont dû absorber des millions d'utilisateurs smartphone, Redis est devenu la couche de cache qui a évité une refonte totale des backends. La différence aujourd'hui, c'est que les agents ne peuvent pas écrire leur propre middleware : ils ont besoin, au moment de l'exécution, d'interfaces préparées en amont, ou ils s'arrêtent. La transition de l'infrastructure RAG vers des architectures de contexte dédiées aux agents semble donc moins être une tendance émergente qu'un basculement déjà en cours dans les grandes entreprises.

InfrastructureOpinion
1 source
Jensen Huang (NVIDIA) chez Dell Technologies World : la demande explose de façon exponentielle
180NVIDIA AI Blog 

Jensen Huang (NVIDIA) chez Dell Technologies World : la demande explose de façon exponentielle

Lors du Dell Technologies World, Jensen Huang, PDG de NVIDIA, a rejoint sur scène Michael Dell pour présenter une nouvelle génération d'infrastructures dédiées à l'IA agentique. Les deux dirigeants ont annoncé plusieurs serveurs inédits, dont le Dell PowerEdge XE9812, construit autour de la puce NVIDIA Vera Rubin NVL72, qui affiche un coût par token jusqu'à dix fois inférieur à celui de l'architecture Blackwell pour les déploiements d'inférence à grande échelle. À ses côtés, les serveurs PowerEdge XE9880L, XE9885L et XE9882L s'appuient sur les modules NVIDIA HGX Rubin NVL8, premiers systèmes Dell à adopter cette architecture, supportant jusqu'à 144 GPU par rack, avec des noeuds de calcul entièrement refroidis par liquide et des performances jusqu'à 5,5 fois supérieures au HGX B200. Du côté des processeurs, les PowerEdge M9822 et R9822 intègrent le CPU NVIDIA Vera, doté d'une bande passante mémoire de 1,2 To/s, capable d'exécuter des charges agentiques 50 % plus rapidement que les processeurs x86. Dell a également dévoilé le PowerRack, un système entièrement intégré, ainsi qu'une mise à jour de son AI Data Platform incluant le moteur Starburst, qui offre un débit SQL jusqu'à trois fois supérieur sur CPU Vera. Cinq mille entreprises, dont Lilly, Samsung et Honeywell, exploitent déjà des charges de travail IA sur des Dell AI Factories avec NVIDIA. Ces annonces s'inscrivent dans un contexte de demande explosive. Michael Dell a rappelé que les dépenses mondiales en infrastructure IA pourraient atteindre entre 3 000 et 4 000 milliards de dollars d'ici 2030, avec une consommation de tokens projetée en hausse de 3 400 % sur la même période. Jensen Huang a résumé la situation sans détour : "Nous sommes entrés dans l'ère de l'IA utile, c'est pourquoi la demande est parabolique, absolument parabolique." Pour les entreprises, l'enjeu est direct : réduire le coût de l'inférence pour rendre les agents autonomes économiquement viables en production, et non plus seulement dans des environnements pilotes. La vitesse sur les bases de données est particulièrement stratégique, car les agents IA interrogent en continu ces systèmes pour accomplir leurs tâches, rendant la performance CPU aussi critique que celle des GPU. Cette conférence marque une accélération nette dans la course aux infrastructures IA d'entreprise. NVIDIA et Dell s'inscrivent dans une compétition directe avec les géants du cloud -- Amazon, Google, Microsoft -- qui proposent leurs propres puces et services managés. L'argument central de Dell est de permettre aux entreprises de faire tourner leurs modèles frontières et leurs agents autonomes dans leur propre périmètre sécurisé, sans dépendre d'un fournisseur cloud. La génération Rubin succède à Blackwell, lancée en 2024, et la cadence s'accélère : NVIDIA a maintenu un rythme d'une nouvelle architecture tous les un à deux ans. Pour des groupes comme Honeywell ou Lilly, dont les données sont sensibles et les contraintes réglementaires fortes, la promesse d'une IA souveraine et haute performance constitue un argument de poids face aux offres cloud publiques.

UELes entreprises européennes soumises aux contraintes RGPD pourraient tirer parti de l'offre d'IA souveraine on-premise Dell/NVIDIA pour réduire leur dépendance aux clouds publics américains.

InfrastructureActu
1 source
SiMa.ai lève des fonds à une valorisation de 1,4 milliard de dollars
181The Information AI 

SiMa.ai lève des fonds à une valorisation de 1,4 milliard de dollars

La startup californienne SiMa.ai, basée à San Jose, est en négociations avancées pour lever plus de 100 millions de dollars auprès d'investisseurs, à une valorisation d'environ 1,4 milliard de dollars. Cette opération représenterait une hausse de plus de 45 % par rapport à sa valorisation de 960 millions de dollars enregistrée en août 2025, selon les données de PitchBook. L'information a été confirmée par deux sources proches du dossier. SiMa.ai conçoit des puces d'inférence destinées à fonctionner directement sur des appareils embarqués comme des drones, des robots ou des caméras de surveillance, sans avoir recours à la puissance de calcul des centres de données. Cette levée de fonds illustre une conviction croissante chez certains investisseurs : l'avenir de l'IA ne se jouera pas uniquement dans les datacenters. Les puces de SiMa.ai sont optimisées pour la sobriété énergétique et l'exécution locale des modèles, ce que l'on appelle l'inférence en périphérie de réseau ("edge inference"). Pour les industriels du secteur manufacturier, de la logistique ou de la sécurité, cette approche ouvre la possibilité de déployer de l'intelligence artificielle sur le terrain, en temps réel, sans dépendre d'une connexion permanente au cloud ni des coûts associés. Si ce modèle se généralise, il pourrait remettre en question les projections actuelles sur les besoins en infrastructure numérique mondiale. SiMa.ai s'inscrit dans une vague de startups spécialisées qui cherchent à conquérir des segments du marché des puces IA laissés en dehors du champ de Nvidia, dont la domination porte essentiellement sur les GPU de datacenter. Ces challengers misent sur des cas d'usage précis et des contraintes physiques réelles, comme la consommation électrique ou la taille des appareils. Le marché de l'IA embarquée, porté par l'essor des véhicules autonomes, de la robotique industrielle et des systèmes de vision par ordinateur, devrait croître fortement dans les prochaines années, attirant capitaux et compétition dans ce segment encore dominé par aucun acteur incontournable.

UEL'essor de l'inférence embarquée pourrait à terme bénéficier aux industriels européens (manufacturier, logistique, robotique) en réduisant leur dépendance au cloud américain.

InfrastructureOpinion
1 source
Derrière la rencontre entre Trump et Xi, l’ombre de l’IA
182Next INpact 

Derrière la rencontre entre Trump et Xi, l’ombre de l’IA

Du 13 au 15 mai 2026, Donald Trump s'est rendu en Chine pour un sommet de deux jours avec Xi Jinping, emmenant avec lui une délégation d'une quinzaine de dirigeants de la tech et de la finance, parmi lesquels Jensen Huang (Nvidia), Elon Musk (Tesla) et Tim Cook (Apple). Le patron de Nvidia a même rejoint le groupe en dernière minute, lors d'une escale en Alaska, signe de l'importance stratégique de ce marché pour son entreprise malgré les restrictions américaines à l'export. Au menu des échanges : les terres rares, les puces électroniques, l'usage militaire de l'intelligence artificielle et les lignes rouges à ne pas franchir dans les conflits armés, où l'IA s'est déjà déployée sur le terrain, notamment au Venezuela et en Palestine. Trump a annoncé au retour que dix entreprises chinoises avaient obtenu l'autorisation d'acheter des puces Nvidia H200, mais que c'est désormais Pékin lui-même qui freine ces achats, au nom de l'indépendance technologique nationale. Peu d'accords concrets ont été noués à l'issue de ces deux jours. Ce sommet révèle, plus qu'il ne les résout, les fractures profondes entre deux modèles d'IA. Aux États-Unis, le développement est porté par le secteur privé, fondé sur une captation massive de données et de ressources, au point de susciter des résistances croissantes. En Chine, l'État impulse une stratégie open source, plus sobre en entraînement, aux performances comparables, et potentiellement structurante pour les standards mondiaux à venir. Le cas des puces H200 illustre cette divergence : là où Washington cherche à verrouiller l'accès aux technologies de pointe, Pékin préfère développer ses propres champions plutôt que de rester dépendant des infrastructures américaines. Derrière ces négociations se joue une bataille pour le contrôle des ressources critiques qui sous-tendent toute l'économie de l'IA. La Chine extrait plus de 60 % des terres rares mondiales et raffine près de 85 % des stocks globaux ; elle produit plus de 90 % de douze éléments critiques, dont le terbium et le dysprosium, indispensables aux composants des F-35 américains, aux moteurs de véhicules électriques et au hardware informatique. Cette mainmise constitue l'un des leviers de pression les plus puissants de Pékin dans la négociation. Les États-Unis, eux, dominent la conception des puces les plus avancées et contrôlent les chaînes logicielles qui font tourner les grands modèles. Le sommet de mai illustre ainsi une réalité durable : les deux puissances sont condamnées à s'affronter et à s'articuler simultanément, dans une interdépendance technologique dont aucune n'a encore trouvé la sortie.

UELa dépendance européenne aux terres rares chinoises (85 % du raffinage mondial) et aux puces de conception américaine expose l'UE à des vulnérabilités d'approvisionnement critiques, tandis que la rivalité sino-américaine sur les standards de l'IA risque de s'imposer sans que l'Europe ait son mot à dire.

💬 Jensen Huang qui saute dans un avion en Alaska pour rejoindre la délégation en dernière minute, ça dit tout sur ce que représente ce sommet pour Nvidia. Ce qui se joue là, c'est pas une négociation commerciale, c'est la cartographie des dépendances mutuelles : les terres rares d'un côté, les architectures de puces de l'autre. Et l'Europe regarde ça depuis les gradins, dépendante des deux.

InfrastructureOpinion
1 source
NVIDIA introduit une méthode de pré-entraînement en 4 bits avec NVFP4, validée sur un modèle hybride Mamba-Transformer de 12 milliards de paramètres
183MarkTechPost 

NVIDIA introduit une méthode de pré-entraînement en 4 bits avec NVFP4, validée sur un modèle hybride Mamba-Transformer de 12 milliards de paramètres

Des chercheurs de NVIDIA ont publié une méthodologie complète pour préentraîner des grands modèles de langage en précision 4 bits, en s'appuyant sur un format maison baptisé NVFP4, conçu pour les cœurs tensoriels Blackwell des GPU GB200 et GB300. Pour valider l'approche, l'équipe a préentraîné un modèle hybride Mamba-Transformer de 12 milliards de paramètres sur 10 000 milliards de tokens, ce que NVIDIA décrit comme la durée d'entraînement la plus longue jamais documentée publiquement en précision 4 bits. Les résultats sont frappants par leur proximité avec la référence FP8 : le modèle NVFP4 atteint 62,58 % sur le benchmark MMLU-Pro en configuration 5-shot, contre 62,62 % pour son équivalent FP8, soit un écart de seulement 0,04 point de pourcentage. Sur le plan matériel, les calculs matriciels en FP4 atteignent un débit 4 fois supérieur au BF16 sur le GB200 et 6 fois sur le GB300, ce qui se traduit par des gains de vitesse réels d'environ 2x et 3x par rapport au FP8, avec une empreinte mémoire réduite de moitié. Ce résultat ouvre une perspective concrète pour l'industrie : entraîner des modèles de la taille de 12 milliards de paramètres, et potentiellement bien plus grands, à un coût de calcul significativement inférieur, sans sacrifier la qualité mesurable. Pour les laboratoires et les entreprises qui dépensent des dizaines ou des centaines de millions de dollars en clusters GPU, réduire la consommation mémoire de moitié et doubler voire tripler le débit effectif représente des économies substantielles sur l'ensemble du cycle d'entraînement. La prise en charge est intégrée directement dans le Transformer Engine de NVIDIA, ce qui signifie que l'adoption ne nécessite pas de réingénierie complète des pipelines existants. Le passage de FP8 à FP4 pour l'entraînement, et non seulement pour l'inférence, est un problème ouvert depuis plusieurs années. Les formats 4 bits compriment la plage dynamique de représentation et amplifient les erreurs de quantification sur de longues séquences de tokens, rendant les entraînements instables. NVFP4 répond à ces problèmes par trois innovations structurelles par rapport au standard MXFP4 : une taille de bloc réduite de 32 à 16 éléments, des facteurs d'échelle par bloc stockés en E4M3 plutôt qu'en UE8M0 (gagnant en précision de mantisse), et un second niveau d'échelle par tenseur en FP32. La méthodologie d'entraînement repose ensuite sur quatre composantes complémentaires : le maintien en BF16 des couches linéaires dans les deux premiers et les huit derniers blocs du réseau (soit environ 16 % des couches au total), l'application de transformées de Hadamard aléatoires sur les gradients de poids pour lisser les valeurs aberrantes, un ajustement adaptatif des facteurs d'échelle, et une technique de delayed scaling similaire à celle déjà utilisée en FP8. Les expériences d'ablation montrent que chacun de ces éléments est indispensable à la convergence stable sur 10 000 milliards de tokens.

UELes laboratoires et entreprises européens investissant dans l'entraînement de grands modèles pourraient réduire significativement leurs coûts de calcul si cette méthode est adoptée sur du matériel Blackwell, mais sans impact réglementaire direct sur la France ou l'UE.

💬 Ça fait des années qu'on cherche à entraîner en FP4 sans que ça parte en vrille au bout de quelques milliards de tokens, et là NVIDIA montre que c'est faisable avec 0,04 point d'écart sur MMLU-Pro. Réduire la mémoire de moitié et doubler le débit réel, c'est pas du flan, c'est des économies qui changent l'équation pour ceux qui entraînent à grande échelle. Bon, faut du GB200 ou GB300, donc si tu n'as pas Blackwell, c'est pas pour toi tout de suite.

InfrastructurePaper
1 source
71 % des Américains sont opposés aux datacenters IA, 53 % aux centrales nucléaires
184Next INpact 

71 % des Américains sont opposés aux datacenters IA, 53 % aux centrales nucléaires

Sept Américains sur dix s'opposent à la construction d'un centre de données dédié à l'intelligence artificielle dans leur région, selon un sondage Gallup publié en 2025. Plus précisément, 71 % des personnes interrogées se déclarent défavorables à ces projets, dont 48 % qui s'y disent « fermement opposés ». À peine un quart des répondants y sont favorables, et seulement 7 % se montrent « très favorables ». Pour mesurer ce rejet, Gallup a utilisé la même formulation que celle employée depuis des décennies pour interroger les Américains sur le nucléaire : « Seriez-vous favorable ou opposé à la construction d'un centre de données dans votre région pour soutenir la technologie de l'intelligence artificielle ? » C'est la première fois que l'institut posait cette question sur les datacenters. En parallèle, 46 % des sondés se déclarent très inquiets de l'impact environnemental de ces infrastructures, et 24 % assez inquiets, des chiffres qui recoupent étroitement le niveau d'opposition générale. Ce résultat est d'autant plus frappant qu'il dépasse largement le rejet historique du nucléaire. En 2001, 63 % des Américains s'opposaient à la construction d'une centrale nucléaire près de chez eux ; aujourd'hui, ce chiffre est tombé à 53 %, soit 18 points de moins que le rejet des datacenters IA. Le nucléaire, longtemps perçu comme l'infrastructure la plus indésirable dans un voisinage résidentiel, est donc aujourd'hui mieux accepté que les centres de données consacrés à l'IA. Pour les entreprises technologiques qui planifient des déploiements massifs d'infrastructures aux États-Unis, Microsoft, Google, Amazon, Meta notamment, ce rejet populaire représente un obstacle politique et réglementaire concret, susceptible de ralentir ou de bloquer des projets d'expansion locale. Ce sondage s'inscrit dans un contexte de croissance explosive de la demande en datacenters, portée par le développement des grands modèles de langage et des services d'IA générative. Cette expansion a des conséquences directes sur la consommation d'eau, d'électricité et d'espace foncier, alimentant les inquiétudes des riverains et des élus locaux. La moitié des opposants citent la consommation excessive de ressources comme principal motif de rejet. Aux États-Unis, plusieurs projets ont déjà suscité des résistances locales, notamment dans des États comme la Virginie ou l'Iowa, où la concentration de ces infrastructures est déjà forte. À mesure que les besoins en calcul de l'IA continuent d'augmenter, la question de l'acceptabilité sociale des datacenters devrait s'imposer comme un enjeu politique majeur, au même titre que celui des grandes infrastructures énergétiques des décennies précédentes.

UECette tendance de rejet populaire des datacenters IA pourrait se reproduire en Europe, où les enjeux de consommation d'eau et d'énergie alimentent déjà des débats citoyens similaires autour des projets d'infrastructure numérique.

💬 Plus rejeté que le nucléaire, c'est le score des datacenters IA aux États-Unis. Et c'est pas une surprise : tu construis un truc qui boit des millions de litres d'eau et fait grimper la facture électrique de tout le quartier, forcément les gens apprécient moyen. Le vrai problème pour Microsoft, Google et les autres, c'est que ça va se transformer en levier politique local, et ça c'est beaucoup plus dur à gérer qu'un communiqué de presse sur la durabilité.

InfrastructureActu
1 source
Cerebras : une IPO à 60 milliards de dollars, lente puis soudaine
185Latent Space 

Cerebras : une IPO à 60 milliards de dollars, lente puis soudaine

Cerebras Systems a fait son entrée en bourse cette semaine avec une valorisation spectaculaire de 60 milliards de dollars, clôturant à 280 dollars par action. L'introduction s'est concrétisée après un premier dossier S-1 retiré, puis un partenariat à 750 mégawatts et un accord estimé entre 10 et 20 milliards de dollars avec OpenAI. Lors des communications accompagnant l'IPO, le directeur financier Bob Komin a tenu à corriger la perception d'un positionnement limité aux petits modèles : Cerebras sert aujourd'hui des architectures de toutes tailles, y compris des modèles à un billion de paramètres, et traite en production des modèles internes d'OpenAI, notamment les versions 5.4 et 5.5. L'investisseur Ishan N. Taneja, qui avouait avoir douté des premières annonces de l'entreprise, a publiquement concédé que ses sceptiques avaient eu raison dès le départ, saluant la persévérance de l'équipe et la qualité du silicium développé. Cette introduction en bourse constitue une validation majeure pour le marché des puces d'inférence spécialisées, longtemps perçu comme trop risqué face à la domination de Nvidia. Le fait que Cerebras traite des charges de calcul aussi critiques que les modèles internes d'OpenAI confirme que son architecture, fondée sur une puce unique de la taille d'une tranche entière de wafer, est désormais compétitive sur les workloads les plus exigeants. Le chercheur Apoorv Vyas relie explicitement l'IPO à une discussion de Stanford sur la rareté du calcul, la demande d'inférence en hausse et le routage de modèles, soulignant que l'événement est interprété dans les cercles techniques comme un signal structurant pour l'ensemble du cycle d'infrastructure IA, et non comme un simple fait de marché. Ce succès survient dans un contexte de recomposition rapide du secteur du matériel pour l'IA. Six mois plus tôt, Nvidia avait racheté Groq pour 20 milliards de dollars, un autre spécialiste de l'inférence rapide, consolidant sa position tout en signalant que ce segment attire désormais des capitaux massifs. Cerebras avait opté pour une architecture radicalement différente des GPU de Nvidia ou AMD : une puce monolithique de très grande taille, conçue spécifiquement pour les modèles de langage, plutôt que des GPU généralistes adaptés a posteriori. Ce pari industriel, considéré pendant des années comme excentrique, trouve aujourd'hui une validation boursière qui devrait encourager de nouveaux investissements dans des architectures alternatives. La suite probable est une intensification de la concurrence sur l'inférence à grande échelle et une pression croissante sur Nvidia pour défendre ses marges dans ce segment en pleine expansion.

UEL'essor des architectures de puces spécialisées pour l'inférence IA pourrait, à terme, diversifier les options d'approvisionnement matériel pour les acteurs et institutions européens du secteur.

💬 Quand Cerebras a sorti sa puce wafer-scale, beaucoup ont dit que c'était une blague industrielle. Maintenant ils font tourner les modèles internes d'OpenAI en prod, 5.4 et 5.5, et ils entrent en bourse à 60 milliards. Le marché vient de décider que l'architecture alternative à Nvidia, c'est pas un luxe, c'est une nécessité.

InfrastructureOpinion
1 source
L'action Cerebras double presque le premier jour, valorisant le fabricant de puces IA à 100 milliards de dollars
186VentureBeat AI 

L'action Cerebras double presque le premier jour, valorisant le fabricant de puces IA à 100 milliards de dollars

Cerebras Systems, le fabricant de puces basé dans la Silicon Valley, a fait une entrée fracassante au Nasdaq le 14 mai 2026 : l'action a ouvert à 350 dollars, soit presque le double du prix d'introduction fixé à 185 dollars, propulsant la capitalisation boursière de la société au-delà des 100 milliards de dollars dès les premières heures de cotation. L'entreprise a levé 5,55 milliards de dollars en vendant 30 millions d'actions, ce qui en fait la plus grande introduction en bourse technologique américaine depuis Uber en 2019. La demande des investisseurs a littéralement submergé les attentes initiales : Cerebras avait d'abord fixé une fourchette cible de 115 à 125 dollars, l'avait relevée à 150-160 dollars face à l'engouement, avant de fixer le prix final encore au-dessus de cette bande révisée. La société, dont le chiffre d'affaires a progressé de 76 % pour atteindre 510 millions de dollars en 2025, a annoncé son intention d'investir ces nouveaux capitaux dans l'expansion de son infrastructure cloud d'inférence. Ce succès boursier repose sur une architecture radicalement différente de celle de Nvidia. Le Wafer-Scale Engine WSE-3 de Cerebras est un processeur unique qui occupe un wafer de silicium entier, le disque de la taille d'une assiette à partir duquel sont normalement découpées des dizaines de puces classiques. Avec 4 000 milliards de transistors, 900 000 cœurs de calcul et 44 gigaoctets de mémoire embarquée, il est 58 fois plus grand que le B200 de Nvidia et offre 2 625 fois plus de bande passante mémoire. Cet avantage est décisif pour l'inférence d'IA, le processus qui consiste à faire tourner un modèle entraîné pour générer des réponses : chaque token produit nécessite de déplacer l'intégralité des poids du modèle entre mémoire et calcul, une opération strictement séquentielle où la bande passante est le facteur limitant. Cerebras revendique des vitesses d'inférence jusqu'à 15 fois supérieures aux solutions GPU concurrentes sur modèles open source, un chiffre confirmé par le cabinet d'analyse indépendant Artificial Analysis. Le parcours de Cerebras jusqu'à cette cotation a été tout sauf linéaire. Fondée en 2015 sur le pari que les charges de travail de l'IA seraient fondamentalement contraintes par les communications entre mémoire et calcul, la société a passé des années à résoudre un problème que l'industrie des semi-conducteurs avait tenté et abandonné à plusieurs reprises sur 75 ans d'histoire. Cerebras avait une première fois déposé son dossier d'introduction en bourse en septembre 2024, avant de se retirer face aux questions des régulateurs sur sa dépendance quasi totale à un seul client aux Émirats arabes unis. Le redépôt d'avril 2026 présentait un profil radicalement différent : des partenariats avec OpenAI et Amazon Web Services, un service d'inférence cloud en forte croissance, et une base de revenus diversifiée. La capitalisation atteinte dès le premier jour place désormais Cerebras parmi les fabricants de semi-conducteurs les plus valorisés au monde, dans un secteur où Nvidia règne encore en maître incontesté.

💬 100 milliards le premier jour, le marché n'attendait visiblement que ça. Ce qui m'intéresse plus que le chiffre boursier, c'est que leur pari de 2015 (l'inférence est bornée par la bande passante mémoire, pas par le compute) était juste, là où l'industrie avait abandonné ce problème depuis 75 ans. Les 15x sur l'inférence sont validés par des labos indépendants, c'est pas du marketing.

InfrastructureActu
1 source
Dix entreprises chinoises dont ByteDance auraient obtenu un accord américain pour des puces IA qui leur sont interdites
187The Decoder 

Dix entreprises chinoises dont ByteDance auraient obtenu un accord américain pour des puces IA qui leur sont interdites

Une dizaine d'entreprises chinoises, dont Alibaba, Tencent et ByteDance, ont reçu l'autorisation du gouvernement américain d'acquérir jusqu'à 75 000 puces Nvidia H200 chacune. Ces autorisations, révélées par le secrétaire au Commerce Howard Lutnick, représentent un assouplissement notable des restrictions américaines sur les exportations de semi-conducteurs avancés vers la Chine. Pourtant, pas une seule puce n'a encore été livrée. La raison de ce blocage ne vient pas de Washington, mais de Pékin. Selon Lutnick, c'est le gouvernement chinois lui-même qui empêche ces achats, dans le but de protéger son industrie nationale de semi-conducteurs. Cette situation crée un paradoxe inédit : des entreprises chinoises de premier plan se voient refuser par leur propre gouvernement l'accès à des composants que les États-Unis ont accepté de leur vendre. Pour ces géants technologiques, l'impossibilité d'acquérir du matériel de pointe freine directement le développement de leurs modèles d'IA. Cet épisode s'inscrit dans une guerre technologique plus large entre les deux premières puissances mondiales. Depuis 2022, Washington a progressivement renforcé ses contrôles à l'exportation de puces avancées vers la Chine, poussant Pékin à accélérer ses investissements dans des acteurs comme Huawei et SMIC pour atteindre l'autonomie technologique. En bloquant ces achats, la Chine envoie un signal fort : elle préfère consolider sa filière domestique plutôt que de rester dépendante de fournisseurs américains, même lorsque la porte est temporairement ouverte.

UECe bras de fer sino-américain renforce la prise de conscience européenne sur la nécessité d'une souveraineté dans les semi-conducteurs avancés, thème central de l'European Chips Act, sans impact opérationnel direct immédiat sur les entreprises ou institutions françaises.

InfrastructureOpinion
1 source
Les services financiers face aux exigences de données pour l'IA à base d'agents
188MIT Technology Review 

Les services financiers face aux exigences de données pour l'IA à base d'agents

Plus de la moitié des équipes de services financiers ont déjà déployé ou prévoient de déployer une IA agentique, selon Gartner. Ces systèmes, capables de planifier et d'exécuter des tâches de manière autonome plutôt que de simplement générer des réponses, suscitent un intérêt croissant dans le secteur bancaire et assurantiel. Mais selon Steve Mayzak, directeur général mondial du Search AI chez Elastic, leur succès dépend moins de la sophistication des algorithmes que de la qualité des données sous-jacentes. "Tout commence par les données", résume-t-il. Une étude Forrester révèle pourtant que 57 % des organisations financières sont encore en train de développer les capacités internes nécessaires pour exploiter pleinement ces technologies agentiques. L'enjeu est considérable : une IA agentique amplifie autant les forces que les failles de son infrastructure data. Dans un secteur aussi réglementé, les exigences vont bien au-delà de la simple performance. Les entreprises doivent pouvoir tracer et justifier chaque décision prise par le modèle, données d'entrée comprises. "Il ne suffit pas d'expliquer d'où viennent les données et ce qu'elles sont devenues. Il faut une manière auditable et gouvernable d'expliquer quelle information le modèle a retenue et pourquoi elle était pertinente pour l'étape suivante", insiste Mayzak. Les hallucinations, les réponses incohérentes et les décisions difficiles à retracer minent la confiance des régulateurs, des clients et des équipes internes. Pour les transactions, les signaux de risque, les politiques internes ou l'historique client, la donnée doit être indexée, centralisée et accessible, pas enfouie dans des silos séparés. Le défi est structurel autant que technique. Les données financières existent sous des formats hétérogènes, accumulés sur des décennies d'histoire bancaire, mélangeant données structurées (tableurs, bases transactionnelles) et non structurées (notes de conseillers, échanges clients, documents contractuels). Or le langage naturel est, par nature, bien plus ambigu que les données tabulaires, ce qui rend leur nettoyage et leur organisation particulièrement complexes. Mayzak illustre la difficulté : "Il existe de nombreuses façons de décrire comment exécuter un ordre de bourse dans une banque. Dans un monde piloté par des agents IA, ces descriptions doivent être déterministes, donner le même résultat à chaque fois. Pourtant, on construit sur des modèles puissants mais non déterministes. C'est incroyablement délicat, mais pas impossible." Les prochaines années verront les acteurs financiers investir massivement dans la gouvernance des données, condition sine qua non pour transformer l'IA agentique d'outil prometteur en avantage compétitif réel.

UELes banques et assureurs européens, soumis à l'AI Act et à DORA, doivent impérativement résoudre les défis de gouvernance et d'auditabilité des données pour déployer une IA agentique conforme aux exigences réglementaires.

💬 57% des organisations financières encore en train de "construire les capacités" pour l'IA agentique, c'est beaucoup de retard pour un secteur qui prétend se transformer. L'enjeu soulevé par Mayzak est le bon : tu peux avoir le meilleur modèle du monde, si tes données transactionnelles sont éparpillées en silos depuis 30 ans, l'agent va amplifier le chaos, pas le résoudre. Et la vraie tension, celle qu'on évite de nommer, c'est qu'on veut des résultats déterministes avec des modèles qui ne le sont pas.

InfrastructureOpinion
1 source
FRACTILE lève 187 millions d’euros pour développer les puces destinées aux futurs agents IA
189FrenchWeb 

FRACTILE lève 187 millions d’euros pour développer les puces destinées aux futurs agents IA

Fractile, startup britannique spécialisée dans les semi-conducteurs pour l'intelligence artificielle, a annoncé une levée de fonds de 220 millions de dollars, soit environ 187 millions d'euros. L'entreprise se distingue de la majorité des acteurs du secteur en ne ciblant pas l'entraînement des modèles, mais leur inférence, c'est-à-dire l'exécution concrète des modèles une fois entraînés, notamment dans le cadre des agents IA autonomes qui doivent raisonner et agir en temps réel. Ce financement souligne une tension croissante dans l'écosystème IA : si les GPU de Nvidia dominent la phase d'entraînement, l'inférence à grande échelle représente un goulot d'étranglement distinct, à la fois en termes de coût, de latence et de consommation énergétique. Avec la montée en puissance des agents IA capables d'enchaîner des raisonnements complexes, la demande en puces optimisées pour cette couche d'exécution devient critique pour les entreprises qui déploient ces systèmes à grande échelle. Fractile s'inscrit dans une vague de startups cherchant à concurrencer Nvidia sur des segments spécifiques du marché des puces IA, comme Groq, Etched ou Cerebras. Le pari de se concentrer sur les agents plutôt que sur l'entraînement général reflète une conviction que l'ère des modèles fondamentaux cède progressivement la place à celle du déploiement applicatif. Ce tour de table permettra à l'entreprise d'accélérer le développement de son architecture propriétaire et de recruter dans un marché des talents semi-conducteurs très compétitif.

UEUne startup britannique spécialisée en puces d'inférence IA pourrait offrir aux entreprises européennes une alternative crédible à Nvidia pour le déploiement d'agents IA à grande échelle, réduisant partiellement leur dépendance aux fournisseurs américains.

💬 L'inférence, c'est le vrai goulot d'étranglement qu'on sous-estime depuis des années, et là Fractile met presque 200M€ sur la table pour s'y attaquer en ciblant spécifiquement les agents. C'est le bon timing, parce qu'un agent qui enchaîne dix appels LLM pour accomplir une tâche, ça coûte une fortune en latence et en énergie avec des GPU pensés pour l'entraînement. Bon, sur le papier c'est solide, mais le cimetière des startups chips anti-Nvidia est bien fourni, alors reste à voir si l'architecture tient quand les clients arrivent en prod.

InfrastructureOpinion
1 source
Nvidia franchit les 5 500 milliards en Bourse, du jamais-vu dans l’histoire
190Frandroid 

Nvidia franchit les 5 500 milliards en Bourse, du jamais-vu dans l’histoire

Nvidia a franchi ce mercredi 13 mai 2026 le seuil des 5 500 milliards de dollars de capitalisation boursière, un record absolu dans l'histoire des marchés financiers. Jamais aucune entreprise n'avait atteint une telle valorisation. Pour mettre ce chiffre en perspective, Nvidia pèse désormais plus d'une fois et demie le PIB annuel de la France, qui s'établit autour de 3 200 milliards de dollars. Le groupe californien, fondé par Jensen Huang, s'est imposé comme le fournisseur incontournable de puces GPU utilisées pour entraîner et faire tourner les modèles d'intelligence artificielle. Cette valorisation record illustre l'appétit insatiable des marchés pour tout ce qui touche à l'IA générative. Nvidia capte une part écrasante des dépenses d'infrastructure des géants technologiques, Microsoft, Google, Amazon, Meta, qui investissent des centaines de milliards de dollars dans leurs datacenters. Ses puces H100, H200 et Blackwell sont en rupture chronique depuis deux ans, ce qui confère à l'entreprise un pouvoir de fixation des prix exceptionnel et des marges brutes dépassant 70 %. Nvidia a profité d'une longueur d'avance stratégique grâce à CUDA, son écosystème logiciel développé depuis 2006, qui a rendu ses GPU quasi indétrônables dans la recherche et l'industrie IA. Ses concurrents, AMD et Intel côté puces, ou les solutions maison de Google (TPU) et Amazon (Trainium), peinent encore à rogner sa domination. La question qui se pose désormais est de savoir si cette croissance est soutenable, ou si un ralentissement des investissements en IA pourrait provoquer une correction aussi spectaculaire que l'ascension.

UELes startups et entreprises européennes développant des solutions IA restent structurellement dépendantes des puces Nvidia, dont les prix élevés et la pénurie chronique renchérissent le coût d'accès à l'infrastructure IA sur le marché européen.

InfrastructureOpinion
1 source
GridSFM : un petit modele de fondation pour les reseaux electriques
191Microsoft Research 

GridSFM : un petit modele de fondation pour les reseaux electriques

Microsoft a lancé GridSFM, un petit modèle de fondation neuronal conçu pour résoudre en quelques millisecondes l'un des problèmes les plus complexes de la gestion des réseaux électriques : le flux de puissance optimal en courant alternatif, ou AC-OPF. Jusqu'ici, ce calcul pouvait prendre plusieurs heures sur les grands réseaux de transport d'électricité, forçant les opérateurs à choisir entre analyser peu de scénarios ou recourir à des approximations qui négligent des contraintes physiques critiques. GridSFM change la donne : un seul réseau de neurones couvre des grilles de 500 à 80 000 nœuds de connexion, avec deux niveaux disponibles, GridSFM-Open pour les grilles de recherche jusqu'à 4 000 nœuds, et GridSFM-Premier pour les systèmes de production jusqu'à 80 000 nœuds. Le modèle prend en entrée la topologie du réseau, les spécifications des générateurs et des charges, et les contraintes des lignes de transmission, puis produit un point d'opération optimal ainsi qu'un verdict de faisabilité physique. L'enjeu économique est considérable. Les décisions d'optimisation des réseaux électriques influencent directement jusqu'à 20 milliards de dollars par an en coûts de congestion, ainsi que 3,4 térawattheures d'énergies renouvelables perdues chaque année faute de pouvoir les acheminer. En permettant d'évaluer des ordres de grandeur supplémentaires de scénarios en temps réel, GridSFM ouvre la voie à une gestion proactive plutôt que réactive des réseaux. Concrètement, les opérateurs obtiennent une visibilité directe sur la congestion, la stabilité et l'état général du système, sans avoir à attendre des heures de calcul. Pour les marchés de l'électricité, la distribution en temps réel et l'analyse de contingence, cette rapidité représente une transformation opérationnelle majeure. Ce lancement s'inscrit dans un contexte de tension croissante sur les réseaux électriques, soumis simultanément à l'explosion de la demande, à l'intégration des énergies renouvelables, à l'électrification des transports et à la multiplication des événements météorologiques extrêmes. Microsoft avait déjà posé les bases avec la publication d'un jeu de données ouvert sur la topologie du réseau de transmission américain, qui alimente directement GridSFM. Le modèle est construit comme un opérateur neuronal discret à structure par blocs, représentant chaque réseau sous forme de graphe orienté, et entraîné via une supervision par solveur (IPOPT dans PowerModels.jl) ainsi que par des contraintes physiques. En le mettant à disposition de la communauté, Microsoft vise à permettre la construction de simulateurs avancés et d'outils de planification sans repartir de zéro, accélérant potentiellement la transition énergétique à l'échelle industrielle.

UELes gestionnaires de réseaux européens, dont RTE en France, pourraient déployer GridSFM pour optimiser l'intégration des renouvelables et réduire les coûts de congestion, un enjeu central dans les objectifs de transition énergétique de l'UE.

💬 Un modèle spécialisé qui résout en millisecondes ce que les solveurs classiques calculent en plusieurs heures, c'est le bon usage de l'IA, pas du marketing. 20 milliards par an de coûts de congestion réseaux, c'est du concret. Sur le papier, ça change vraiment quelque chose pour RTE et les opérateurs européens, et le fait que Microsoft publie ça en open accélère le truc.

InfrastructureOpinion
1 source
Google et SpaceX explorent des data centers spatiaux en orbite pour l’IA
192Le Big Data 

Google et SpaceX explorent des data centers spatiaux en orbite pour l’IA

Google et SpaceX seraient en pourparlers avancés sur le déploiement de centres de données en orbite basse, destinés à héberger des charges de calcul dédiées à l'intelligence artificielle. Selon le Wall Street Journal, les deux groupes étudient un accord qui permettrait à Google d'utiliser les capacités de lancement de SpaceX pour placer progressivement des infrastructures informatiques dans l'espace. Cette initiative reste encore au stade exploratoire, sans confirmation officielle d'Elon Musk, mais elle s'inscrit dans un contexte où SpaceX prépare une introduction en bourse valorisée à près de 1 750 milliards de dollars, pariant sur la viabilité économique future de ces infrastructures orbitales. Google ne limiterait pas non plus ses discussions à SpaceX, en parallèle de discussions avec d'autres acteurs du secteur spatial, tout en avançant sur son projet Suncatcher, annoncé en 2018, dont les premiers prototypes de satellites sont attendus à partir de 2027. L'enjeu est considérable pour l'industrie tech. Les modèles d'IA générative réclament des volumes de calcul en croissance exponentielle, tandis que les data centers terrestres se heurtent à des limites de plus en plus contraignantes : consommation électrique massive, occupation foncière importante, et opposition croissante de riverains et d'élus dans plusieurs États américains. Des projets entiers ralentissent en raison d'inquiétudes autour de l'utilisation de l'eau, de l'empreinte carbone et de la pression sur les réseaux électriques locaux. Des infrastructures en orbite permettraient, en théorie, de contourner ces contraintes géographiques et réglementaires tout en ouvrant une nouvelle réserve de capacité de calcul décorrélée des tensions foncières terrestres. Elon Musk avance même que le coût d'exploitation de tels centres pourrait s'avérer inférieur à celui des data centers classiques, à mesure que les coûts de lancement continuent de baisser. Ce mouvement vers l'espace s'inscrit dans une recomposition plus large des alliances autour de l'IA et des infrastructures. Anthropic et SpaceX ont récemment signé un accord portant sur l'accès aux ressources de calcul du centre de données de xAI à Memphis, avec des perspectives de collaboration sur des projets spatiaux à plus long terme. SpaceX a par ailleurs renforcé son positionnement dans l'écosystème IA après le rachat de xAI en février 2026, transformant l'entreprise de lancement en acteur intégré de la chaîne de valeur de l'intelligence artificielle. Si les data centers orbitaux restent une vision à horizon de plusieurs années, la convergence entre les géants du cloud, les fournisseurs de fusées et les laboratoires d'IA dessine d'ores et déjà les contours d'une bataille pour le contrôle des infrastructures du calcul de demain.

UELa domination américaine sur les futures infrastructures orbitales accentue les enjeux de souveraineté numérique pour l'Europe, sans impact opérationnel direct à court terme.

💬 La contrainte des data centers terrestres, c'est réelle, et si tu suis l'actu US tu vois des projets ralentir partout, faute d'élec ou à cause des riverains. Du calcul en orbite basse, ça a du sens sur le fond, j'y crois. Mais le timing colle un peu trop bien avec l'IPO de SpaceX à 1 750 milliards pour pas se poser de questions.

L'accord lucratif de Cerebras avec OpenAI : une arme à double tranchant
193The Information AI 

L'accord lucratif de Cerebras avec OpenAI : une arme à double tranchant

Le 24 décembre 2025, deux décisions majeures ont simultanément reconfiguré le paysage des puces pour l'intelligence artificielle. Ce soir de réveillon, Nvidia annonçait le rachat de Groq, une startup spécialisée dans l'inférence IA fondée par l'inventeur des TPU (tensor processing units) de Google, pour plusieurs milliards de dollars. Le même jour, OpenAI s'engageait contractuellement à acheter pour des milliards de dollars de puces auprès de Cerebras, le concurrent direct de Groq, révèlent des documents déposés auprès des autorités boursières américaines. Cerebras est connu pour ses wafer-scale chips, des processeurs de la taille d'une assiette capables d'exécuter des modèles d'IA à très grande vitesse. Ces deux transactions signalent un tournant dans la relation historiquement ambiguë entre Nvidia et OpenAI, et ouvrent une brèche commerciale considérable pour les startups spécialisées dans l'inférence. Alors que la demande en capacité de traitement explose, les géants du secteur cherchent à diversifier leurs fournisseurs et à réduire leur dépendance à Nvidia. Pour Cerebras, ce contrat avec OpenAI représente une validation industrielle de premier ordre, susceptible d'accélérer sa trajectoire vers une introduction en bourse. Ces événements s'inscrivent dans une compétition acharnée pour contrôler l'infrastructure d'inférence, le maillon qui permet aux modèles d'IA de répondre aux requêtes en temps réel. Nvidia domine le marché de l'entraînement, mais l'inférence reste plus contestée. En rachetant Groq, Nvidia cherche à verrouiller ce segment. OpenAI, en choisissant Cerebras, joue la carte de l'indépendance stratégique tout en obtenant des performances compétitives.

💬 Nvidia rachète Groq, OpenAI signe chez Cerebras le même soir de Noël : c'est pas un hasard, c'est une déclaration. Le marché de l'inférence est en train de se jouer maintenant, et tout le monde cherche à ne pas se retrouver pieds et poings liés à une seule source d'approvisionnement. Pour Cerebras, ce contrat c'est mieux que toutes les levées de fonds du monde, ça valide la technologie là où ça compte vraiment.

InfrastructureOpinion
1 source
La nouvelle idée portée par l'essor de l'IA : héberger un mini data center chez soi
194Ars Technica AI 

La nouvelle idée portée par l'essor de l'IA : héberger un mini data center chez soi

La startup californienne SPAN, basée à San Francisco, a annoncé un projet inédit : installer de mini-centres de données directement chez des particuliers, sous forme de boîtiers compacts baptisés XFRA nodes. Ces appareils embarquent des GPU Nvidia RTX Pro 6000 Blackwell Server Edition refroidis par liquide, conçus pour fonctionner en silence. En échange de l'espace et de l'électricité, les propriétaires recevraient en contrepartie un accès Internet subventionné, une réduction sur leur facture d'électricité et des batteries de secours. SPAN a déjà commencé des tests pilotes et prévoit un déploiement auprès de 100 foyers d'ici la fin de l'année 2026. L'enjeu est de taille pour l'industrie de l'IA : la demande en puissance de calcul explose, mais construire de nouveaux datacenters classiques prend des années et se heurte à des obstacles réglementaires, fonciers et énergétiques considérables. En distribuant cette infrastructure dans les foyers américains, SPAN espère mobiliser rapidement des capacités de calcul dormantes sans les coûts et délais habituels. Pour les ménages, le modèle ressemble à celui des contrats d'effacement électrique ou des panneaux solaires avec revente de surplus : on cède une ressource inutilisée contre un avantage financier tangible. Chris Lander, vice-président de la division XFRA chez SPAN, résume la promesse ainsi : là où les datacenters traditionnels sont bruyants, disgracieux et font monter les prix de l'électricité dans les quartiers, l'XFRA node serait discret et rendrait l'énergie moins chère pour le foyer et la communauté. Ce type d'approche décentralisée n'est pas sans précédent, des projets comme Filecoin ou Helium ont tenté de monétiser la bande passante ou le stockage résidentiel avec des résultats mitigés. La différence ici réside dans la puissance matérielle déployée et dans l'appétit sans précédent des acteurs de l'IA pour du calcul supplémentaire. Reste à voir si les contraintes pratiques, consommation électrique résiduelle, gestion thermique, responsabilité légale des hôtes, seront surmontées à grande échelle, et si les régulateurs américains valideront ce modèle hybride entre infrastructure industrielle et usage résidentiel.

InfrastructureOpinion
1 source
Le capital, et non la puissance de calcul, est le vrai goulet d'étranglement de l'IA
195The Information AI 

Le capital, et non la puissance de calcul, est le vrai goulet d'étranglement de l'IA

L'explosion de la demande en infrastructure IA a déclenché l'un des cycles d'investissement les plus colossaux de l'histoire moderne. Jensen Huang, PDG de Nvidia, estime qu'un gigawatt de capacité de calcul peut coûter jusqu'à 50 milliards de dollars. McKinsey projette que la demande mondiale en centres de données pourrait atteindre 156 gigawatts d'ici 2030, ce qui porterait l'investissement total nécessaire à près de 7 000 milliards de dollars. Lors d'un récent panel organisé par The Information, trois dirigeants du secteur ont dressé un constat convergent : ce n'est pas le manque de GPU qui freine le déploiement de l'IA, mais bien le capital. Charles Fisher, directeur financier de Lambda, Marc Boroditsky, directeur commercial de Nebius, et Nick Robbins, vice-président développement chez CoreWeave, ont tous pointé la même tension : les GPU sont disponibles aujourd'hui, mais les infrastructures nécessaires pour les déployer à grande échelle prennent des années à financer et à construire. Ce goulot d'étranglement financier tient en partie à des idées reçues persistantes dans le monde bancaire. Les prêteurs rechignent à financer des actifs dont la durée de vie estimée est de six ans seulement, contre plusieurs décennies pour les réseaux câblés. Ils supposent également que la demande se concentre sur une poignée de géants du cloud, ignorant la réalité du marché. Lambda compte plus de 10 000 clients sur son cloud public, représentant environ un tiers de ses revenus, avec des comportements d'abonnement très fidèles. Chez CoreWeave, Robbins souligne que les anciens GPU Nvidia V100 et A100 continuent de générer des rendements solides bien au-delà de leur durée de vie théorique. Les contrats fermes avec des clients solvables restent le principal levier pour débloquer des financements : Nebius a ainsi conclu un accord plurimilliardaire avec Meta Platforms qui garantit l'absorption des GPU non vendus, permettant à Nebius d'utiliser la solidité financière de Meta comme caution implicite. Le vrai défi n'est donc pas tant financier que logistique. Fisher parle d'un problème de "chorégraphie" : la demande des clients se matérialise bien plus vite que la construction des centres de données ne peut suivre. Nebius répond à cette contrainte en menant tous les chantiers simultanément, sécurisant les terrains, générant la demande et levant le capital en parallèle. Au-delà des hyperscalers comme Microsoft, Google ou Amazon, qui captent l'essentiel de l'attention médiatique, la prochaine vague de croissance proviendrait de startups IA en forte croissance et de l'adoption enterprise. Des entreprises comme Cursor ou Harvey sont citées comme signaux avant-coureurs d'un marché qui dépasse largement les seuls géants technologiques, et dont le financement structuré reste encore à inventer.

InfrastructureOpinion
1 source
☕️ SoftBank investirait jusqu’à 100 milliards de dollars dans des infrastructures IA en France
196Next INpact 

☕️ SoftBank investirait jusqu’à 100 milliards de dollars dans des infrastructures IA en France

SoftBank serait sur le point d'annoncer un investissement pouvant atteindre 100 milliards de dollars pour déployer des centres de données dédiés à l'intelligence artificielle en France. Selon Bloomberg, le projet a germé lors d'une rencontre entre Masayoshi Son, PDG du conglomérat japonais, et Emmanuel Macron, qui s'était rendu au Japon fin mars 2026 pour une tournée de séduction auprès des grandes puissances économiques de l'archipel. Le président français aurait directement proposé à Son d'installer des infrastructures IA en France, une démarche inhabituelle pour l'investisseur, plus souvent approché par des dirigeants d'entreprise que par des chefs d'État. L'annonce officielle pourrait intervenir lors du sommet Choose France, prévu le 19 mai. Le montant réel reste incertain et pourrait s'avérer bien inférieur aux 100 milliards évoqués en interne. Si l'investissement se concrétise même partiellement, il constituerait un signal fort pour le positionnement de la France comme hub européen de l'IA. Paris mise sur un argument concurrentiel clé : l'énergie nucléaire, qui permet d'alimenter les centres de données avec "l'électricité la plus décarbonée d'Europe", selon les termes de Macron lui-même. Dans un contexte où les besoins énergétiques des datacenters explosent, cet avantage structurel pourrait peser lourd face à des alternatives moins stables ou plus carbonées. Pour les acteurs tech cherchant à construire des infrastructures à grande échelle en Europe, la France deviendrait une option sérieuse. Cet éventuel engagement s'inscrit dans une dynamique d'investissements massifs dans l'IA mondiale. SoftBank est déjà engagé à hauteur de plus de 60 milliards de dollars dans OpenAI, dont il détient 13 % du capital, et co-finance l'initiative Stargate aux États-Unis aux côtés d'OpenAI, Oracle et du fonds émirati MGX, pour un total annoncé de 500 milliards. En parallèle, Microsoft, Meta, Amazon et Alphabet ont promis plus de 700 milliards de dépenses combinées pour la seule année 2026. Masayoshi Son est réputé pour ses annonces spectaculaires dont la concrétisation s'étale sur des années, voire n'aboutit jamais. Du côté français, Macron avait déjà annoncé en février 2025, lors du Sommet pour l'action sur l'IA à Paris, 109 milliards d'euros d'investissements sur plusieurs années, présentés comme l'équivalent français de Stargate. L'éventuelle entrée de SoftBank viendrait compléter cet édifice, mais les détails du projet restent flous et la portée de l'annonce finale pourrait encore évoluer significativement d'ici le 19 mai.

UESi l'investissement se concrétise même partiellement, la France se positionnerait comme le principal hub européen de l'IA, attirant des dizaines de milliards de dollars en centres de données et consolidant son avantage compétitif grâce à son électricité nucléaire décarbonée.

💬 100 milliards, c'est le chiffre qu'on sort pour les journalistes, mais avec Masa Son, t'as appris à diviser par 3 avant de célébrer. Ce qui tient vraiment debout dans ce dossier, c'est l'argument nucléaire : la France a une carte différenciante face à ses voisins européens, et là c'est pas du flan. Reste à voir ce que donnera le 19 mai.

InfrastructureOpinion
1 source
L'eau : pas un problème de centres de données, mais un problème d'IA
197The Information AI 

L'eau : pas un problème de centres de données, mais un problème d'IA

La consommation d'eau liée à l'intelligence artificielle est bien plus importante qu'on ne le pense, mais elle ne se concentre pas là où le débat public se focalise. Selon un rapport publié en janvier 2026 par la société de technologie de l'eau Xylem et le cabinet Global Water Intelligence, les usines de fabrication de semi-conducteurs et les centrales électriques qui les alimentent consomment beaucoup plus d'eau que les centres de données eux-mêmes. En 2025, le secteur IA retire 6 260 milliards de litres d'eau par an, un chiffre qui devrait plus que doubler d'ici 2050. Par comparaison, le premier site de Microsoft dans son complexe Fairwater au Wisconsin, l'un des plus grands campus de data centers au monde, ne consomme que l'équivalent de quatre piscines olympiques par an, soit la moitié de la consommation annuelle d'un lave-auto, et 0,1 % de ce que le fabricant Foxconn aurait été autorisé à prélever sur le même terrain, selon Brad Smith, président de Microsoft. Cette efficacité s'explique par l'adoption de systèmes de refroidissement en circuit fermé qui réduisent la consommation d'eau douce de 50 à 70 % par rapport aux anciens équipements. Ce déplacement du problème vers l'amont de la chaîne d'approvisionnement a des conséquences concrètes pour les territoires et les écosystèmes. Aujourd'hui, 40 % des centres de données mondiaux et 29 % des usines de puces électroniques sont implantés dans des zones souffrant d'un stress hydrique élevé ou extrême. Le refroidissement à l'électricité, qui remplace l'évaporation dans les nouveaux data centers, transfère en réalité la pression vers le réseau électrique : les centrales utilisent elles-mêmes de grandes quantités d'eau, et la consommation électrique des infrastructures IA par mètre carré atteint déjà dix fois celle du cloud traditionnel. Avec les futurs racks Nvidia à un mégawatt, cet écart pourrait grimper à cent fois la norme d'avant l'IA. Le numérique représente certes seulement 3,7 % des 168 800 milliards de litres consommés chaque année par l'industrie mondiale, mais c'est le secteur où la croissance est la plus rapide. Le tableau n'est pas uniformément alarmant. Les centrales électriques restituent plus de 90 % de l'eau utilisée pour leur refroidissement, même si elle nécessite parfois un traitement. La transition vers les énergies renouvelables, moins gourmandes en eau que le charbon ou le gaz, pourrait réduire significativement l'intensité hydrique de la production électrique dans les prochaines décennies. Les industriels investissent aussi dans la réutilisation des eaux usées : la société Ecolab a aidé une usine américaine de semi-conducteurs à économiser près de 42 millions de litres grâce à des processus optimisés. Le vrai enjeu n'est donc pas de condamner les data centers, mais d'imposer une transparence et des normes sur l'ensemble de la chaîne IA, des fonderies de puces en Asie aux centrales à gaz d'Amérique du Nord.

UELes centres de données et usines de puces européens sont exposés aux mêmes tensions hydriques, et l'UE pourrait être amenée à étendre ses obligations de transparence environnementale à l'ensemble de la chaîne d'approvisionnement IA, des fonderies aux centrales électriques.

InfrastructureOpinion
1 source
Le startup qui aide OpenAI à optimiser son IA pour les puces Cerebras
198The Information AI 

Le startup qui aide OpenAI à optimiser son IA pour les puces Cerebras

OpenAI a fait appel à la startup Gimlet Labs pour optimiser ses modèles d'intelligence artificielle sur les puces de Cerebras Systems. Selon Zain Asgar, PDG de Gimlet Labs, cette collaboration permet à OpenAI de faire tourner Codex-Spark, une version accélérée de son outil de programmation destiné aux développeurs, sur l'infrastructure Cerebras. L'annonce intervient alors que Cerebras se prépare à une introduction en bourse imminente cette semaine. Ce recours à une startup spécialisée illustre un défi technique souvent sous-estimé : chaque type de puce exige une adaptation spécifique du code qui entraîne et exécute les modèles. Ce travail d'optimisation bas niveau, peu visible mais indispensable, conditionne directement les performances et les coûts d'exploitation des grands modèles de langage. Pour les utilisateurs de Codex-Spark, cela se traduit concrètement par des temps de réponse plus rapides dans les tâches d'assistance au code. Cette dynamique s'inscrit dans un mouvement plus large de diversification des sources de calcul au sein de l'industrie de l'IA. Alors que les puces Nvidia restent difficiles à obtenir en quantité suffisante, des acteurs comme OpenAI et Meta cherchent activement des alternatives : Cerebras, mais aussi d'autres fabricants de puces spécialisées. Cette stratégie multi-fournisseurs crée un besoin croissant d'intermédiaires techniques capables d'adapter les modèles à des architectures matérielles variées, ouvrant un nouveau segment de marché pour des startups comme Gimlet Labs.

InfrastructureOpinion
1 source
Intel pourrait fabriquer les futures puces IA d’Apple
199Le Big Data 

Intel pourrait fabriquer les futures puces IA d’Apple

Apple et Intel auraient conclu un accord préliminaire permettant au géant des semi-conducteurs américain de fabriquer une partie des futures puces IA d'Apple, selon le Wall Street Journal. Les deux groupes auraient négocié pendant plus d'un an avant d'aboutir à ce rapprochement, révélé début mai 2026. La réaction des marchés a été immédiate : l'action Intel a bondi de près de 14 % à l'annonce, tandis qu'Apple gagnait environ 2 %. Le partenariat débuterait par les futures puces de la série M destinées aux Mac et aux iPad, les puces iPhone pouvant suivre dans un second temps. Côté production, l'usine d'Intel à Chandler, en Arizona, fabrique déjà des puces basées sur son procédé 18A, la technologie la plus avancée du groupe. Apple pourrait toutefois attendre la génération suivante, baptisée 18A-P, dont la mise en production de masse est attendue dès l'année prochaine selon l'analyste Ben Bajarin de Creative Strategies. Cet accord représenterait bien plus qu'un simple contrat de sous-traitance. Pour Apple, il s'agit de réduire une dépendance quasi totale à TSMC, le fondeur taïwanais qui produit aujourd'hui l'essentiel de ses puces les plus avancées. La montée en puissance de l'IA générative a fait exploser la demande mondiale de capacités de fabrication : Nvidia, Microsoft, Amazon, Google et Meta mobilisent déjà une part croissante des lignes de production les plus avancées, rendant la diversification stratégique urgente pour Apple. Bajarin qualifie Intel de "seule alternative crédible" capable de devenir une seconde source industrielle à grande échelle pour Cupertino. Cette diversification permettrait également de limiter l'exposition aux risques géopolitiques liés aux tensions autour de Taïwan, qui font peser une menace structurelle sur l'approvisionnement en puces. Pour Intel, la portée symbolique d'un tel contrat serait considérable. L'entreprise a longtemps peiné à convaincre des clients externes de lui confier des puces critiques, après des années de retards technologiques et de problèmes de rendement dans son activité de fonderie. Accrocher Apple à son carnet de commandes équivaudrait à valider publiquement que cette division est désormais compétitive face aux leaders asiatiques. Intel accélère ses investissements industriels aux États-Unis dans ce but. Cette alliance potentielle s'inscrit dans une bataille plus large : aujourd'hui, seules trois entreprises disposent des technologies nécessaires pour produire les semi-conducteurs les plus avancés, TSMC, Intel et Samsung. Apple aurait d'ailleurs également visité l'usine texane de Samsung pour évaluer ses capacités, signe que la guerre mondiale des usines IA s'intensifie et que les géants de la tech cherchent activement à multiplier leurs options industrielles.

UECe rapprochement Apple-Intel accélère la consolidation des capacités de fabrication de semi-conducteurs avancés aux États-Unis, rendant plus urgente la question de la souveraineté industrielle européenne face à une dépendance structurelle aux fondeurs extra-européens que l'European Chips Act cherche précisément à réduire.

💬 Apple qui diversifie ses fondeurs, c'est pas une surprise, mais que ce soit Intel qui décroche le contrat, là par contre je l'aurais pas parié il y a deux ans. Les retards, les problèmes de rendement, le fiasco de leur division fonderie... et pourtant le 18A semble enfin tenir la route, assez pour qu'Apple prenne le risque. Reste à voir si les lignes de production suivent quand il faudra livrer des dizaines de millions de puces.

NVIDIA a déjà investi 40 milliards de dollars dans des accords IA en 2026
200Le Big Data 

NVIDIA a déjà investi 40 milliards de dollars dans des accords IA en 2026

En à peine cinq mois depuis le début de l'année 2026, NVIDIA a engagé plus de 40 milliards de dollars dans des accords liés à l'intelligence artificielle. L'investissement le plus massif reste une mise de 30 milliards de dollars dans OpenAI, le créateur de ChatGPT. Le groupe a également conclu un accord pouvant atteindre 2,1 milliards de dollars avec IREN, opérateur de centres de données, pour déployer 5 gigawatts d'infrastructures NVIDIA DSX. Quelques jours plus tôt, c'est Corning qui annonçait un partenariat à hauteur de 3,2 milliards de dollars pour construire trois usines dédiées aux technologies optiques. En mars, NVIDIA avait aussi investi 2 milliards dans Marvell Technology, ainsi que dans les spécialistes de la photonique Lumentum et Coherent. Dans le cloud IA, le groupe soutient les néoclouds CoreWeave et Nebius Group avec 2 milliards chacun. Au total, Jensen Huang dirige une entreprise valorisée à environ 5 200 milliards de dollars, dont l'action a été multipliée par plus de 11 en quatre ans. Cette stratégie va bien au-delà de la simple diversification financière : NVIDIA cherche à contrôler l'ensemble de la chaîne de valeur de l'IA, des puces jusqu'aux infrastructures qui les font tourner. En finançant les fournisseurs cloud, les opérateurs de data centers, les fabricants de composants optiques et les grandes startups IA, le groupe s'assure que chaque maillon de l'écosystème dépend de ses technologies. Jensen Huang l'a lui-même résumé en déclarant vouloir "soutenir tout le monde" plutôt que "désigner un seul gagnant", une posture qui lui permet de couvrir plusieurs scénarios concurrentiels à la fois. Le groupe a généré 97 milliards de dollars de free cash flow en 2025, ce qui rend ce rythme d'investissement soutenable à court terme. Cette mécanique suscite néanmoins des inquiétudes croissantes à Wall Street. Plusieurs analystes pointent une logique circulaire potentiellement fragile : NVIDIA investit dans des entreprises qui achètent ses GPU pour construire leurs infrastructures, et leur fournit parfois directement des ressources de calcul. Certains observateurs comparent cette boucle à une bulle auto-entretenue. La domination de NVIDIA sur le marché des puces IA est le fruit de l'explosion de l'IA générative depuis 2022, mais la concurrence monte, avec AMD, Intel et les puces propriétaires développées par Google, Amazon et Microsoft. La capacité du groupe à maintenir sa position dominante tout en tissant ce réseau d'alliances financières déterminera si cette stratégie est un masterstroke industriel ou un risque systémique pour l'ensemble de l'écosystème IA mondial.

UELa stratégie d'intégration verticale de NVIDIA renforce sa domination sur l'ensemble de la chaîne IA mondiale, accentuant la dépendance des acteurs européens vis-à-vis des infrastructures et puces américaines.

InfrastructureOpinion
1 source