Aller au contenu principal

Infrastructure

50 sur 527 articles

Infrastructure IA : data centers, puces GPU/TPU, cloud computing, énergie et hardware.

Réduire la latence des LLM grâce au routage sensible aux préfixes sur Amazon SageMaker Inference
Illustration générée par IA
1AWS ML Blog InfrastructureActu

Réduire la latence des LLM grâce au routage sensible aux préfixes sur Amazon SageMaker Inference

Amazon SageMaker Inference a lancé le 11 septembre 2026 un nouveau mécanisme baptisé prefix-aware routing, conçu pour réduire la latence des grands modèles de langage (LLM) déployés sur plusieurs instances. Le problème visé est concret : dans une application type chatbot de service client, chaque requête commence par un bloc de contexte fixe (instructions, politiques de l'entreprise), pouvant atteindre 3 000 tokens, suivi d'une question de l'utilisateur d'à peine 50 tokens. Des moteurs comme vLLM ou TensorRT-LLM savent déjà mettre en cache les calculs de ce préfixe répété (technique dite de prefix caching), mais ce cache perd son intérêt dès qu'un pool de plusieurs machines répartit aléatoirement les requêtes, empêchant une même instance de voir suffisamment souvent le même préfixe. La nouvelle fonctionnalité de SageMaker route désormais systématiquement les requêtes partageant un même début de prompt vers la même instance, sans configuration manuelle. Sur des tests avec le modèle Llama 3.1 70B Instruct déployé sur 7 instances ml.p5.48xlarge, Amazon rapporte une réduction du temps avant premier token (TTFT) médian (P50) allant jusqu'à 77 %, une hausse du débit jusqu'à 16 %, et un taux de succès du cache KV passant d'environ 25 % à plus de 80 %. Cette avancée compte pour toute entreprise exploitant des LLM à grande échelle en production, notamment celles gérant des volumes élevés de requêtes avec des contextes longs et répétitifs, comme les assistants virtuels d'entreprise, les outils de support client ou les applications juridiques et médicales s'appuyant sur des documents de référence volumineux. Une latence divisée par trois ou quatre sur le temps de première réponse se traduit directement par une expérience utilisateur plus fluide et par des coûts d'inférence réduits, puisque moins de calcul redondant est effectué sur les mêmes tokens. Pour les équipes d'ingénierie, l'intérêt est aussi la simplicité : la fonctionnalité s'active sans avoir à gérer soi-même une logique d'affinité ou de tagging des requêtes, un travail auparavant complexe à implémenter correctement à grande échelle. Ce lancement s'inscrit dans la compétition plus large que se livrent les fournisseurs de cloud (Amazon Web Services, Microsoft Azure, Google Cloud) pour optimiser l'infrastructure d'inférence des LLM, un poste de coût devenu critique à mesure que les modèles et leurs contextes s'allongent. Amazon a intégré deux garde-fous pour éviter les effets pervers d'un tel routage ciblé : une protection contre la surcharge, qui redirige une requête vers une instance moins occupée si la machine cible a atteint sa limite de concurrence configurée, et une stabilité du comportement lors du scaling, qui limite le nombre de requêtes redistribuées quand des instances sont ajoutées ou retirées, évitant d'invalider les caches à chaque ajustement de capacité. Les tests ont couvert 16 configurations différentes, incluant les endpoints à modèle unique, les composants d'inférence, l'API native Invoke et l'API compatible OpenAI, avec un taux de réussite de 100 %, aussi bien sur des charges à contexte long (préfixes de 8 000 tokens sur une heure) que sur des conversations de longueur variable de type ShareGPT.

UELes entreprises européennes déployant des LLM en production sur AWS pourraient bénéficier de cette réduction de latence et de couts d'inférence, sans impact réglementaire direct pour la France ou l'UE.

1 source
NVIDIA détaille BioIR : débit de repliement Boltz-2 multiplié par 2,9 et 58 500 résidus par heure-GPU sur 8 H100
Illustration générée par IA
2MarkTechPost 

NVIDIA détaille BioIR : débit de repliement Boltz-2 multiplié par 2,9 et 58 500 résidus par heure-GPU sur 8 H100

NVIDIA a détaillé le fonctionnement de son BioNeMo Inference Runtime (BioIR), une bibliothèque Python qui accélère les modèles de prédiction de structures biomoléculaires sur GPU tout en conservant un flux de travail PyTorch standard. Cet outil a déjà tourné à échelle de production : il a permis l'expansion récente de l'AlphaFold Database, générant des structures de complexes protéiques sur 4 777 protéomes, soit environ 31 millions de complexes candidats, dont 1,81 million publiés comme prédictions à haute confiance. Dans un benchmark portant sur 1 000 cibles dimériques humaines (longueurs de séquence combinées inférieures à 2 800 résidus) exécuté sur 8 GPU H100 de 80 Go, BioIR associé au modèle Boltz-2 a traité l'ensemble des cibles en délivrant 58,5 milliers de résidus repliés avec succès par heure-GPU allouée, contre une implémentation open source de Boltz-2 compilée avec torch.compile utilisant les mêmes cibles, les mêmes MSA préparés et la même configuration matérielle. Au niveau du calcul du modèle seul, NVIDIA rapporte des accélérations moyennes géométriques par rapport à une base torch.compile de 1,55x pour OpenFold3, 1,78x pour Boltz-2 et 2,56x pour OpenFold2 monomère sur H100, avec des résultats similaires sur H200. BioIR est disponible dès maintenant sur GitHub sous forme de wheel avec des CUBIN précompilés, nécessitant Python 3.12 ou supérieur, un GPU NVIDIA compatible, un checkpoint de modèle et des MSA A3M par chaîne, sans besoin de nvcc, CUDA source, CMake ni du CUDA toolkit complet. Cette accélération répond à un changement de nature dans la prédiction de structures biomoléculaires : l'enjeu n'est plus de savoir si un modèle peut replier une protéine, mais de faire circuler des files entières de cibles indépendantes à travers l'analyse, la featurisation, l'inférence GPU et l'écriture des résultats, à l'échelle du protéome entier. Pour les laboratoires de recherche pharmaceutique et les équipes de biologie computationnelle, un gain de débit de ce type signifie pouvoir cribler des dizaines de millions de complexes candidats en un temps et un coût de calcul nettement réduits, ce qui accélère la découverte de cibles thérapeutiques et la caractérisation d'interactions protéine-protéine à grande échelle. Le fait que BioIR reste compatible avec les objets torch.nn.Module habituels, sans étape de compilation d'un moteur séparé ni export d'artefact, abaisse aussi la barrière d'adoption pour les équipes déjà investies dans des pipelines PyTorch existants comme Boltz-2 ou OpenFold. Techniquement, BioIR agit sur trois couches distinctes : la sélection de noyaux de calcul optimisés (implémentations maison, cuEquivariance ou repli PyTorch selon le GPU, le type de données et la forme des tenseurs), l'optimisation de modules via la capture de CUDA Graph pour réduire la surcharge de lancement, et la mise à l'échelle du pipeline grâce à un exécuteur Ray qui place une réplique complète du modèle sur chaque GPU visible d'un nœud pour répartir des entrées indépendantes, tout en recouvrant les étapes CPU avec le calcul GPU. Le repliement en parallèle de contexte, qui permettrait de répartir une seule cible sur plusieurs GPU, est annoncé comme prévu mais pas encore disponible. Ce travail s'inscrit dans une compétition plus large entre grands fournisseurs de calcul et laboratoires de biologie structurale, dans la lignée d'AlphaFold de DeepMind et de modèles comme Boltz-2, où l'infrastructure logicielle devient un facteur de différenciation aussi important que les modèles eux-mêmes pour faire tourner la biologie computationnelle à l'échelle industrielle.

UELes laboratoires pharmaceutiques et de biologie computationnelle européens pourraient adopter cet outil pour accélérer leurs recherches, mais aucun acteur ou réglementation français ou européen n'est directement implique.

InfrastructureActu
1 source
Réduire les temps de démarrage à froid sur Amazon SageMaker HyperPod grâce à la mise en cache des modèles
Illustration générée par IA
3AWS ML Blog 

Réduire les temps de démarrage à froid sur Amazon SageMaker HyperPod grâce à la mise en cache des modèles

AWS a lancé une nouvelle fonctionnalité de mise en cache de modèles pour Amazon SageMaker Inference sur HyperPod, destinée à réduire drastiquement les temps de démarrage à froid lors du déploiement de grands modèles de langage. Jusqu'à présent, chaque nouveau pod d'inférence devait suivre deux téléchargements séquentiels avant de pouvoir traiter la moindre requête : l'image du conteneur du serveur d'inférence depuis Amazon ECR, puis les poids du modèle depuis une source de stockage comme Amazon S3, Amazon FSx for Lustre ou HuggingFace Hub. Pour les images de serveurs comme vLLM ou LMI, qui embarquent pilotes GPU, bibliothèques CUDA et framework de service, ce seul téléchargement prend entre 5 et 7 minutes. Pour les poids d'un modèle de 145 Go stocké sur S3, il faut compter plus de 20 minutes supplémentaires, et pour un modèle massif comme DeepSeek-R1, qui dépasse 600 Go, l'attente grimpe à plus de 30 minutes avant qu'une seule requête puisse être servie. Avec le nouveau système de cache, les poids et les images sont préchargés sur les nœuds du cluster avant même que les pods en aient besoin, ce qui permet une lecture depuis un stockage NVMe local à environ 7 Go/s au lieu d'un téléchargement réseau, ramenant le temps de démarrage à quelques secondes. Cette avancée change concrètement la donne pour l'autoscaling en production. Lorsqu'un pic de trafic déclenche le HorizontalPodAutoscaler et que celui-ci demande, par exemple, cinq nouveaux pods, chacun devait auparavant répéter indépendamment tout le cycle de téléchargement : même si la politique d'autoscaling réagissait en quelques secondes, le temps réel avant de pouvoir absorber le trafic supplémentaire atteignait 25 à 30 minutes, voire plus. Pour les équipes qui opèrent des modèles volumineux en production, ce délai représentait un goulot d'étranglement critique, capable de provoquer des dégradations de service lors de montées en charge soudaines. En réduisant ce temps à quelques secondes, AWS permet aux entreprises de dimensionner leurs déploiements d'inférence de façon beaucoup plus réactive, sans sacrifier la disponibilité du service ni sur-provisionner en permanence des ressources coûteuses en GPU pour anticiper les pics. Techniquement, la fonctionnalité repose sur deux composants indépendants et activables séparément : un cache de poids et un cache d'images. Il suffit d'ajouter la configuration modelCacheConfig avec l'option weightsCache activée dans la ressource InferenceEndpointConfig ou JumpStartModel. L'opérateur d'inférence HyperPod crée alors automatiquement une ressource ModelDataCacheConfig, télécharge les poids sur le stockage NVMe local de tous les nœuds ciblés, puis étiquette chaque nœud comme prêt dès que le cache est disponible, avant de lancer le déploiement d'inférence. Le cache reste disponible lors des redémarrages de pods sur un même nœud, et les nouveaux pods qui atterrissent sur des nœuds déjà en cache démarrent immédiatement, ce qui s'inscrit dans la stratégie plus large d'AWS visant à rendre l'infrastructure GPU pour l'IA générative plus efficace et plus rentable à exploiter.

UELes entreprises européennes déployant des LLM sur AWS SageMaker pourraient bénéficier de cette réduction des temps de démarrage, mais aucune régulation ou acteur européen n'est concerne directement.

💬 Le vrai problème, c'était jamais le calcul, c'était l'attente : 30 minutes pour qu'un pod DeepSeek-R1 daigne répondre à la première requête, pendant qu'un pic de trafic passe. Le cache NVMe local, ça ramène ça à quelques secondes, et c'est exactement le genre de plomberie invisible qui rend l'autoscaling GPU crédible en prod plutôt que théorique. Ce qu'AWS montre surtout, c'est que le vrai goulot d'étranglement de l'inférence à grande échelle n'est plus le silicium, c'est le réseau de stockage qu'on a construit autour.

InfrastructureActu
1 source
d-Matrix adopte NVIDIA NVLink Fusion pour ses déploiements XPU à l'échelle du rack
Illustration générée par IA
4NVIDIA AI Blog 

d-Matrix adopte NVIDIA NVLink Fusion pour ses déploiements XPU à l'échelle du rack

Le fabricant de puces d'inférence IA d-Matrix a annoncé qu'il utilisera la technologie NVLink Fusion de NVIDIA pour connecter ses futures puces Raptor XPU à la plateforme d'infrastructure IA de NVIDIA, rejoignant une liste croissante de partenaires qui compte déjà AWS, Arm, Intel, Fujitsu, SiFive, Alchip, Astera Labs, GUC, Marvell, MediaTek, Samsung, Cadence, Synopsys, Ayar Labs et Lightmatter. Sid Sheth, cofondateur et PDG de d-Matrix, a présenté l'accord lors d'un point presse, expliquant que "la demande d'inférence explose, mais le capital, le temps et l'énergie restent limités" et que NVLink Fusion combiné à l'architecture de racks MGX de NVIDIA offre à ses clients "une voie plus rapide et moins risquée pour déployer et faire évoluer une inférence à ultra-faible latence". Concrètement, les puces Raptor seront reliées via le réseau d'interconnexion NVLink en mode scale-up et le réseau Spectrum-X en mode scale-out, avec à la clé des performances annoncées de trois fois moins de latence puce à puce que l'Ethernet standard, dix fois plus de paquets traités par seconde, et une bande passante de 3 To/s par puce grâce à la sixième génération de NVLink. Cette intégration change la donne pour les fabricants de silicium spécialisé, qui doivent habituellement construire eux-mêmes toute l'infrastructure de déploiement à grande échelle, des interfaces haut débit jusqu'au refroidissement liquide des racks, un processus long, coûteux et risqué. En s'appuyant sur l'écosystème MGX déjà validé de NVIDIA, d-Matrix évite de devoir concevoir sa propre architecture de racks et bénéficie d'une chaîne d'approvisionnement, d'une alimentation électrique et d'un refroidissement éprouvés. L'entreprise prévoit aussi d'intégrer les futurs processeurs NVIDIA Vera, les cartes réseau ConnectX-9 SuperNIC, les DPU BlueField-4 et le réseau Ethernet Spectrum-X, permettant à ses racks de fonctionner aux côtés des systèmes GPU NVIDIA comme le Vera Rubin NVL72 pour des architectures d'inférence désagrégée. Pour les opérateurs de data centers, l'intérêt est de pouvoir standardiser sur un seul type de rack capable d'accueillir GPU, CPU et XPU, sans multiplier les architectures dédiées par type de processeur. Ce partenariat illustre la stratégie de NVIDIA consistant à rester verticalement intégré tout en s'ouvrant horizontalement à des puces tierces, un modèle que l'entreprise qualifie d'"usine IA semi-personnalisée": le partenaire se concentre sur l'innovation de son silicium tandis que NVIDIA fournit l'interconnexion, les racks, le logiciel et la chaîne logistique. NVLink Fusion supporte désormais toutes les grandes architectures de processeurs, Arm, x86 et RISC-V, aux côtés des GPU NVIDIA. Dans un contexte où de nombreux hyperscalers et fabricants développent leurs propres puces d'inférence pour réduire leur dépendance aux GPU génériques, cette ouverture permet à NVIDIA de conserver un rôle central dans l'infrastructure IA, même chez ses concurrents potentiels sur le marché des puces spécialisées.

UEImpact indirect seulement: les opérateurs de data centers européens pourraient a terme bénéficier de racks standardises compatibles GPU/CPU/XPU, mais aucune entreprise ni régulation française ou européenne n'est concernée directement.

💬 Encore un fabricant qui préfère louer l'autoroute NVIDIA plutôt que de construire sa propre route. Ça se comprend, monter un rack scale-up avec refroidissement liquide from scratch, c'est des mois de risque pour une boîte comme d-Matrix. Mais ça confirme surtout un truc: NVIDIA n'a plus besoin de vendre le meilleur GPU, il lui suffit de posséder l'interconnexion pour rester au centre du jeu, même chez ceux qui essaient de s'en passer.

InfrastructureActu
1 source
Simplifiez et soutenez vos charges TorchServe avec les conteneurs Deep Learning de Ray Serve
Illustration générée par IA
5AWS ML Blog 

Simplifiez et soutenez vos charges TorchServe avec les conteneurs Deep Learning de Ray Serve

Le projet TorchServe, largement utilisé pour déployer des modèles de machine learning en production, n'est plus activement maintenu : son avis officiel indique qu'aucune mise à jour, correction de bug, nouvelle fonctionnalité ou patch de sécurité n'est prévu, et que les vulnérabilités futures pourraient rester sans réponse. Face à ce constat, Amazon Web Services (AWS) a lancé un nouveau conteneur, le Ray Serve Deep Learning Container (DLC), destiné à prendre le relais pour l'inférence. Ce conteneur GPU s'appuie sur l'image officielle NVIDIA Amazon Linux 2023, intègre PyTorch, la couche de service Ray Serve avec FastAPI et Uvicorn, ainsi que des utilitaires pour la vidéo, l'audio et le multimodal, dont FFmpeg compilé avec accélération matérielle NVIDIA. AWS illustre son fonctionnement en déployant le modèle vision-langage Qwen3-VL-2B sur Amazon Elastic Kubernetes Service (EKS), à l'aide d'instances g5.xlarge et des outils AWS CLI, eksctl et kubectl. L'application de service est injectée via une ConfigMap Kubernetes, ce qui permet de modifier le code sans reconstruire l'image du conteneur. L'enjeu dépasse la simple compatibilité logicielle : sans maintenance, les équipes qui exploitent TorchServe doivent elles-mêmes garantir la cohérence de toute la chaîne de dépendances GPU, corriger les failles de sécurité couche par couche et déboguer des pannes dues à des versions désalignées entre CUDA, PyTorch et le serveur d'inférence. Ce travail technique, qualifié de non différenciant par AWS, ralentit la mise en production des modèles sans apporter de valeur ajoutée. En proposant un conteneur préconstruit, testé et patché à chaque publication, AWS transfère cette charge de maintenance vers son propre cycle de release, un service déjà éprouvé pour l'entraînement de modèles via ses Deep Learning Containers historiques, et désormais étendu à l'inférence. Pour les développeurs venant de TorchServe, Ray Serve simplifie aussi l'écriture du code : un point de terminaison devient une simple classe Python décorée avec @serve.deployment, sans archiveur de modèle ni hiérarchie de classes de handlers ni fichier de configuration séparé. Cette bascule s'inscrit dans une tendance plus large de consolidation des outils de serving de modèles autour d'infrastructures cloud gérées, alors que plusieurs projets open source d'inférence peinent à trouver des financements pérennes pour leur maintenance. Le Ray Serve DLC est disponible en versions distinctes pour Amazon EKS, Amazon EC2 et Amazon SageMaker, chacune dotée d'un point d'entrée adapté à son environnement, mais partageant la même pile logicielle sous-jacente. AWS précise que de nombreux modèles peuvent tourner directement sur ce conteneur sans image personnalisée, les équipes ne devant ajouter des bibliothèques supplémentaires que pour des besoins spécifiques, ce qui laisse présager une adoption progressive de cette approche par d'autres fournisseurs cloud confrontés au même problème d'obsolescence des outils d'inférence.

💬 TorchServe qui meurt sans alerte rouge nulle part, c'est le vrai sujet de cet article, pas Ray Serve. Amazon récupère juste les équipes orphelines et leur vend l'entretien qu'elles faisaient elles-mêmes gratuitement. Bon, sur le papier ça simplifie vraiment le code (une classe Python décorée, fini les handlers à rallonge), mais faut voir ce que ça coûte une fois qu'on dépend d'un cycle de release AWS plutôt que d'un projet open source, même mal maintenu.

InfrastructureActu
1 source
Comparatif d'inférence de petits LLM sur SageMaker AI : G7 face à G5 et G6
Illustration générée par IA
6AWS ML Blog 

Comparatif d'inférence de petits LLM sur SageMaker AI : G7 face à G5 et G6

Amazon Web Services a publié début septembre 2026 une étude comparative détaillée sur les performances d'inférence de modèles de langage sur SageMaker AI, opposant ses nouvelles instances G7 (dotées de GPU NVIDIA Blackwell RTX PRO 4500) aux générations précédentes G5 (A10G) et G6 (L4 et L40S). Deux cas d'usage ont été testés. Le premier déploie Qwen3-Coder-30B, un modèle Mixture-of-Experts de 30 milliards de paramètres destiné aux assistants de codage d'entreprise, sur des instances ml.g5.12xlarge, ml.g6.12xlarge et ml.g7.12xlarge via le conteneur DJL Large Model Inference d'AWS. Fait notable, les configurations G5 et G6 mobilisent chacune quatre GPU pour 96 Go de mémoire cumulée, tandis que G7 se contente de deux GPU pour seulement 64 Go. Le second cas d'usage porte sur NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4, un modèle destiné au raisonnement, à la synthèse et aux tâches agentiques, testé sur G6, G6e (L40S, 192 Go) et G7 via le serveur d'inférence vLLM, en s'appuyant sur la fonctionnalité Generative AI Inference Recommendations de SageMaker qui automatise le choix de configuration selon le débit, le coût et la latence. Ces résultats ont une portée directe pour les entreprises qui déploient des grands modèles de langage en production à grande échelle, où chaque génération de GPU peut réduire la latence, augmenter le débit et diminuer le coût par token traité. L'enseignement central de cette étude est que les instances G7 parviennent à égaler, voire dépasser, les performances de prix et de latence des générations antérieures tout en utilisant deux fois moins d'accélérateurs et une mémoire GPU totale inférieure. Pour les équipes techniques qui opèrent des copilotes de développement, des assistants conversationnels d'entreprise ou des systèmes agentiques, cela signifie la possibilité de réduire l'empreinte matérielle et donc la facture cloud sans sacrifier la qualité de service, un arbitrage particulièrement sensible à mesure que les modèles de type Mixture-of-Experts, plus économes en calcul actif malgré leur taille nominale élevée, se généralisent dans les déploiements commerciaux. Cette publication s'inscrit dans la course permanente entre fournisseurs cloud et fabricants de puces pour optimiser le rapport performance-coût de l'inférence, alors que les architectures Blackwell de NVIDIA commencent à irriguer les catalogues d'instances des grands fournisseurs comme AWS après leur déploiement initial sur les charges d'entraînement. La fonctionnalité SageMaker AI Generative AI Inference Recommendations illustre aussi une tendance plus large: automatiser le choix d'infrastructure pour des équipes qui ne veulent plus arbitrer manuellement entre dizaines de combinaisons de GPU, de formats de quantification et de piles logicielles comme vLLM. À mesure que des modèles comme Qwen3-Coder ou la gamme Nemotron de NVIDIA se diversifient, ces benchmarks comparatifs devraient devenir un outil récurrent pour guider les décisions de déploiement, avec la question de la disponibilité et du coût réel des instances G7 à grande échelle comme prochain point d'attention pour les entreprises clientes d'AWS.

💬 Deux fois moins de GPU, deux fois moins de mémoire, et des perfs qui tiennent la route : c'est exactement le genre de gain qu'on attend d'une nouvelle génération et qu'on obtient rarement aussi proprement. Le vrai test, c'est la dispo des G7 à grande échelle, pas le benchmark AWS fait sur mesure pour briller. Si ça se confirme en prod, la facture d'inférence des copilotes de code type Qwen3-Coder va baisser plus vite que prévu, et ça, ça change le calcul de rentabilité de pas mal de boîtes.

InfrastructureActu
1 source
Cisco Secure AI Factory : l’architecture qui veut simplifier l’IA en entreprise ?
Illustration générée par IA
7Le Big Data 

Cisco Secure AI Factory : l’architecture qui veut simplifier l’IA en entreprise ?

Cisco a dévoilé une architecture de référence baptisée Secure AI Factory, conçue pour industrialiser le déploiement de l'intelligence artificielle en entreprise. Elle repose sur l'intégration de plusieurs briques technologiques au sein d'un même environnement : les serveurs UCS de Cisco, la technologie réseau Silicon One, des GPU NVIDIA Blackwell, des solutions de stockage, des logiciels d'orchestration et des outils de sécurité. Le calcul s'appuie notamment sur des GPU Blackwell capables de faire tourner des modèles comportant plusieurs milliards de paramètres, tandis que le réseau utilise des commutateurs Ethernet atteignant 800 Gbit/s pour assurer la circulation rapide des données entre les nœuds de calcul. Selon les éléments communiqués, le centre d'innovation de TD Synnex à Paris exploite désormais cette plateforme, ce qui en fait l'une des premières implémentations concrètes de l'architecture en France. L'enjeu principal de Secure AI Factory est de faciliter le passage de la phase d'expérimentation à un déploiement de l'IA à grande échelle, une étape qui pose souvent problème aux entreprises. Tester un modèle sur une infrastructure limitée est relativement simple, mais la complexité augmente fortement dès lors que ce modèle doit être partagé entre plusieurs équipes, connecté à des données sensibles et intégré aux systèmes de production. En assemblant elles-mêmes des composants provenant de fournisseurs différents, les entreprises s'exposent à des difficultés d'intégration, d'administration et de sécurisation qui peuvent ralentir ou faire échouer leurs projets d'IA. En proposant une architecture préintégrée, Cisco cherche à réduire ces frictions, à sécuriser les données manipulées par les modèles et à offrir une infrastructure capable d'accompagner la montée en charge des besoins en IA sans nécessiter une reconstruction complète à chaque étape. Cette initiative s'inscrit dans un mouvement plus large où les grands équipementiers et fournisseurs de cloud cherchent à proposer des architectures de référence clés en main pour l'IA générative, à mesure que les infrastructures nécessaires (calcul, réseau, stockage, sécurité) gagnent en complexité. Cisco mise sur son partenariat avec NVIDIA et sur son savoir-faire réseau pour se positionner face à d'autres offres intégrées du marché, dans un contexte où la vitesse des échanges de données devient un facteur aussi critique que la puissance brute des GPU. L'adoption par un acteur comme TD Synnex, actif dans la distribution technologique, pourrait favoriser une diffusion plus large de cette architecture auprès d'entreprises cherchant à sécuriser et industrialiser leurs projets d'intelligence artificielle dans les mois à venir.

UELe centre d'innovation de TD Synnex à Paris déploie concrètement cette architecture, ce qui en fait l'une des premières implémentations en France.

InfrastructureActu
1 source
Anthropic aurait signé 517 milliards de dollars de contrats de calcul après la mise en garde de Dario Amodei contre les risques inconsidérés
Illustration générée par IA
8The Decoder 

Anthropic aurait signé 517 milliards de dollars de contrats de calcul après la mise en garde de Dario Amodei contre les risques inconsidérés

Anthropic, l'entreprise à l'origine des modèles Claude, a signé en l'espace de onze mois des contrats d'approvisionnement en puissance de calcul atteignant jusqu'à 517 milliards de dollars, selon des informations rapportées début septembre 2026. Ce montant reste toutefois inférieur au plan annoncé par OpenAI, qui prévoit d'engager 750 milliards de dollars de dépenses en infrastructure de calcul d'ici 2030. Ce virage est d'autant plus notable que le PDG d'Anthropic, Dario Amodei, avait lui-même mis en garde début 2026 contre une course à l'investissement jugée trop rapide et risquée chez ses concurrents. Malgré cet avertissement, son entreprise se retrouve désormais à accélérer ses propres engagements financiers pour ne pas prendre trop de retard face à OpenAI. Cette accélération illustre l'ampleur des sommes désormais nécessaires pour rester compétitif dans le développement de modèles d'intelligence artificielle de pointe. Les besoins en centres de données, en puces et en électricité explosent, poussant même les acteurs les plus prudents à revoir leurs plans à la hausse. Pour les investisseurs, les fournisseurs de cloud et les clients entreprises, cela signifie une intensification de la concurrence sur les capacités de calcul disponibles, avec un risque accru de surinvestissement si la demande ne suit pas. Le contexte est marqué par les propos de Sam Altman, patron d'OpenAI, qui a lui-même dénoncé une "bêtise insoutenable" dans la ruée vers les infrastructures de calcul, visant en particulier les fournisseurs de "néo-cloud" apparus pour répondre à cette demande. Ces mises en garde croisées entre dirigeants concurrents alimentent les craintes d'une bulle spéculative autour des investissements en IA, tout en n'empêchant aucun des deux acteurs de continuer à multiplier les engagements financiers.

💬 517 milliards engagés après avoir soi-même dénoncé la course folle chez les autres, ça montre qu'aucun labo n'a de plan B face à OpenAI. C'est ça la vraie histoire : la prudence affichée dure jusqu'au moment où le concurrent signe un chèque plus gros, et là tout le monde suit. Reste à voir qui absorbe la facture si la demande ne suit pas au bout des dix ans de contrats.

InfrastructureActu
1 source
NSCALE : la bataille du cloud IA se joue aussi sur l’accès au capital
Illustration générée par IA
9FrenchWeb 

NSCALE : la bataille du cloud IA se joue aussi sur l’accès au capital

Nscale, fournisseur de cloud spécialisé dans le calcul pour l'intelligence artificielle, a présenté à ses investisseurs environ 103 milliards de dollars de contrats déjà signés ou engagés. Avant une possible introduction en Bourse, l'entreprise doit désormais lever les capitaux nécessaires pour construire et faire fonctionner l'infrastructure, essentiellement des centres de données équipés de puces Nvidia, capable d'honorer ces engagements auprès de ses clients. Cette démarche de financement illustre une réalité devenue centrale dans le secteur : signer des contrats ne suffit pas, encore faut-il disposer des fonds propres ou de la dette nécessaires pour acheter, installer et alimenter le matériel correspondant. Cette situation éclaire un enjeu structurel de toute l'industrie du cloud dédié à l'IA. Un carnet de commandes de plusieurs dizaines de milliards de dollars ne représente une valeur réelle que si l'entreprise peut effectivement livrer le calcul promis dans les délais prévus, sous peine de pénalités ou de perte de clients au profit de concurrents mieux capitalisés. Pour les investisseurs, cela déplace l'évaluation du risque : au-delà de la demande commerciale, la capacité d'exécution et l'accès au capital deviennent des critères déterminants pour juger de la solidité d'un acteur du cloud IA. Ce dossier s'inscrit dans la montée en puissance des "neoclouds", ces fournisseurs spécialisés qui concurrencent les géants historiques comme Microsoft, Google ou Amazon en misant sur des flottes massives de processeurs graphiques financées par dette et capital-risque. Face à l'ampleur des investissements requis pour suivre la demande en IA générative, plusieurs de ces acteurs cherchent à ouvrir leur capital aux marchés publics, tout en affrontant des interrogations croissantes sur la soutenabilité financière de ce modèle de croissance à crédit.

UENscale, fournisseur cloud européen, illustre les tensions de financement des neoclouds qui cherchent a concurrencer les hyperscalers américains sur le marche européen de l'IA.

💬 Ce qui est intéressant ici, c'est que 103 milliards de dollars de contrats signés ne valent rien si tu n'as pas le cash pour acheter les puces et allumer les data centers derrière. Nscale, c'est le symptôme d'un truc plus large : chez les neoclouds, l'accès au capital est devenu un critère de survie aussi important que la demande client, et ceux qui lèvent moins vite se feront bouffer par des concurrents mieux financés. Sur le papier ça sent la bulle, mais le vrai risque n'est pas la demande en IA, c'est la capacité d'exécution.

InfrastructureOpinion
1 source
Perplexity dévoile son infrastructure GPU d'embeddings : Ivy, Tulip et ROSE au service de pplx-embed
Illustration générée par IA
10MarkTechPost 

Perplexity dévoile son infrastructure GPU d'embeddings : Ivy, Tulip et ROSE au service de pplx-embed

Perplexity a publié cette semaine, via son équipe d'ingénierie, un billet technique intitulé « Fast Embeddings on GPUs », détaillant l'infrastructure qui fait tourner pplx-embed ainsi que les modèles de ranking utilisés dans Perplexity Search, Computer et l'API Platform. L'équipe constate que l'inférence d'embeddings sur GPU a largement convergé entre moteurs concurrents sur du matériel Hopper et Blackwell mature, les gains résiduels se logeant désormais dans le runtime : gestion des CUDA graphs, suivi asynchrone des résultats et un chemin de requêtes écrit en Rust. Le système repose sur trois services : Ivy, une passerelle HTTP en Rust qui gère le tokenizing et répartit la charge entre répliques ; Tulip, un serveur d'inférence gRPC construit avec Rust, tokio et tonic, chargé de l'ordonnancement ; et ROSE (Runtime-Optimized Serving Engine), principalement en Python, qui exécute les kernels et gère les CUDA graphs. Perplexity a choisi de ne pas construire de moteur d'embeddings dédié, réutilisant à la place les kernels de prefill et décodé de sa pile LLM existante, car les modèles d'embeddings sont de petits Transformers dont le comportement ressemble à ces deux régimes de calcul. Cette architecture importe parce qu'elle conditionne directement le coût et la latence d'un moteur de recherche IA à grande échelle : la qualité de la recherche dépend autant de la pertinence du modèle d'embedding que du prix de son exécution sur l'ensemble d'un index. En optimisant l'infrastructure plutôt que le modèle lui-même, Perplexity peut réduire ses coûts d'indexation par lots tout en gardant des requêtes utilisateur rapides en temps réel, deux contraintes habituellement contradictoires. La démonstration que l'attention devient négligeable face au coût des couches denses pour ces petits modèles permet à l'entreprise de garder un ordonnanceur volontairement simple, premier arrivé premier servi, sans perte d'efficacité une fois le GPU saturé autour de 512 tokens. C'est un signal pour l'industrie que l'optimisation du serving, et non seulement l'entraînement de meilleurs modèles, devient un axe de différenciation concurrentielle pour les entreprises d'IA appliquée. Le contexte plus large est celui d'une course à l'efficacité d'inférence à mesure que les produits de recherche et d'assistance IA passent à l'échelle, chaque requête embeddée ou rerankée ayant un coût GPU direct. Perplexity a dû résoudre des problèmes concrets comme la lenteur du lancement de kernels sur petits batches, en capturant des graphes CUDA complets par modèle, une opération coûteuse en temps qu'elle a rendue paresseuse pour étaler la charge de capture sur plusieurs heures plutôt que plusieurs minutes au démarrage. L'entreprise a aussi contribué en amont à la bibliothèque FlashInfer pour permettre cette capture de graphes complets, illustrant une dynamique où les acteurs de la recherche IA améliorent des outils open source partagés par toute l'industrie. Cette publication technique s'inscrit dans une tendance des laboratoires à documenter publiquement leur pile d'inférence, à la fois pour attirer des talents en ingénierie et pour asseoir leur crédibilité technique face à des concurrents comme Google ou OpenAI sur le terrain de la recherche augmentée par IA.

💬 Perplexity vient de démontrer un truc que peu de boîtes IA osent dire tout haut : sur les petits modèles d'embeddings, l'attention ne compte quasiment plus, c'est le coût des couches denses qui domine, et ça change toute la logique d'optimisation. Résultat, ils gardent un ordonnanceur simplissime (premier arrivé, premier servi) et ça tient la charge jusqu'à 512 tokens sans perte d'efficacité. Le vrai signal, c'est que la bataille se déplace de l'entraînement vers le serving : demain, ce qui différencie un moteur de recherche IA, c'est autant l'ingénierie d'inférence que le modèle lui-même.

InfrastructureActu
1 source
Architecture de la mémoire et du stockage à l'ère de l'IA
Illustration générée par IA
11MIT Technology Review 

Architecture de la mémoire et du stockage à l'ère de l'IA

L'ère de l'inférence en intelligence artificielle a désormais succédé à celle de l'entraînement des modèles, selon un article consacré à l'architecture des infrastructures mémoire et stockage. Jim McGregor, fondateur et analyste principal du cabinet Tirias Research, y explique que l'IA ne constitue pas une charge de travail unique mais des millions, voire des milliards de charges distinctes, chacune avec ses propres exigences en matière de latence, de bande passante mémoire et de débit de stockage. Concrètement, des systèmes comme un dispositif hospitalier analysant des millions de points de données en temps réel pour accélérer la recherche médicale, ou un assistant intelligent traitant simultanément des milliers de requêtes clients complexes, illustrent ce basculement vers une intelligence continue et distribuée, du centre de données jusqu'à la périphérie des objets connectés. Ce changement impose de repenser l'infrastructure dans son ensemble : performance, latence, mémoire, stockage et réseau ne peuvent plus être optimisés séparément, car les charges d'inférence sont continues, géographiquement dispersées et très sensibles au temps de réponse. Cette évolution a des conséquences directes sur les coûts d'exploitation et l'empreinte environnementale des entreprises. Chaque ralentissement, goulot d'étranglement ou watt gaspillé se traduit par un impact concret, à la fois financier et humain, notamment dans des usages critiques comme la santé. Pour les décideurs, l'enjeu consiste désormais à arbitrer entre coût, flexibilité et pérennité des choix technologiques, plutôt qu'à simplement rechercher la puissance de calcul brute. Les organisations qui parviendront à améliorer leur performance par watt, réduire leur empreinte énergétique et éliminer les goulots d'étranglement liés à la mémoire et au stockage avant qu'ils ne freinent leur croissance prendront l'avantage. Le déplacement des données devient lui-même le principal facteur limitant : des techniques comme la génération augmentée par récupération, ou RAG, exigent que les systèmes interrogent en permanence des bases de données massives, ce qui multiplie la pression sur les infrastructures bien au-delà de ce qu'exigeaient les applications traditionnelles. Cette transformation s'explique par l'inadéquation croissante entre les infrastructures informatiques héritées, conçues pour des charges stables et prévisibles, et les besoins des systèmes d'IA agentique et d'inférence en temps réel, marqués par une forte volatilité de la demande. Selon McGregor, une stratégie d'infrastructure IA doit désormais partir d'une compréhension fine des charges de travail réellement prévues, afin d'éviter à la fois le sous-dimensionnement et le surinvestissement destiné à absorber des pics ponctuels. Les fournisseurs de mémoire, de stockage et de composants réseau se retrouvent ainsi au centre des arbitrages stratégiques des entreprises, alors que la course à l'IA générative et agentique s'oriente désormais vers l'efficacité opérationnelle autant que vers la puissance brute des modèles, ouvrant la voie à une nouvelle génération d'architectures conçues dès l'origine pour l'échelle, la résilience et l'efficacité énergétique.

💬 L'infra qui a servi à entraîner les modèles n'est pas celle qui va faire tourner l'inférence, et c'est là que ça va coincer. Un hôpital qui interroge sa base en continu pour du RAG, ce n'est plus une charge de calcul ponctuelle, c'est un flux permanent qui bouffe de la bande passante mémoire 24/7. Le vrai avantage compétitif ne sera plus dans les FLOPS mais dans la performance par watt, et les boîtes qui continuent à dimensionner pour le pic vont cramer leur budget énergie avant même de scaler.

InfrastructureOpinion
1 source
Créer une usine de modèles d'IA physique avec NVIDIA Cosmos 3 sur SageMaker HyperPod
Illustration générée par IA
12AWS ML Blog 

Créer une usine de modèles d'IA physique avec NVIDIA Cosmos 3 sur SageMaker HyperPod

NVIDIA et Amazon Web Services ont détaillé, dans un billet technique publié sur le blog AWS, comment construire une "usine à modèles" d'IA physique en combinant le nouveau modèle Cosmos 3 de NVIDIA avec Amazon SageMaker HyperPod, un service de calcul dédié à l'entraînement de modèles à grande échelle sur Amazon EKS. Cosmos 3 est décrit comme un modèle de fondation "omnimodal" ouvert, qui traite vidéo, images, actions et son comme un seul flux de tokens grâce à une architecture Mixture-of-Transformers avec attention conjointe à chaque couche. Un même tronc transformeur fonctionne dans trois modes distincts : générateur de vidéos synthétiques par dynamique directe, étiqueteur d'actions par dynamique inverse, et politique d'action déployable pour piloter un robot ou un véhicule autonome. Le modèle repose sur un transformeur de vision (ViT) pour comprendre les images, un encodeur vidéo Wan2.2 figé pour générer les pixels, et un vecteur compact représentant les deltas de pose et l'état de préhension, permettant à un même système de commander aussi bien un bras robotique qu'un véhicule autonome. NVIDIA a publié Cosmos 3 sous licence OpenMDW-1.1 de la Linux Foundation, avec un rapport technique détaillant l'architecture, et AWS met à disposition le code, les modèles d'infrastructure et les manifestes de tâches dans le dépôt GitHub awsome-distributed-ai, incluant une démonstration complète sur le jeu de données public DROID pour l'étape de politique robotique. L'enjeu principal est économique et opérationnel : entraîner un système d'IA physique n'est pas une tâche unique mais une boucle continue de génération de données, post-entraînement et évaluation en simulation, qui nécessite traditionnellement des grappes de GPU séparées pour chaque étape, chacune avec son propre cycle de déploiement. En unifiant génération, post-entraînement et évaluation dans un seul modèle partagé, Cosmos 3 permet de faire tourner ces trois charges de travail sur un unique pool de GPU persistant, géré par un seul plan de contrôle de cluster, plutôt que de multiplier les réservations dédiées. Cela change directement la métrique de référence pour les équipes qui construisent des robots ou des véhicules autonomes : ce n'est plus le débit maximal d'une tâche isolée qui compte, mais le "GPU goodput", soit la progression utile de l'ensemble de la boucle par heure de GPU réservée. Cette approche s'inscrit dans un contexte où l'accès aux GPU reste une contrainte majeure : la disponibilité et les délais varient fortement, et la capacité obtenue peut se retrouver dans une zone de disponibilité ou une région AWS éloignée des données d'entraînement. AWS recommande donc d'engager la capacité sur l'ensemble de la boucle plutôt que par étape, via un plan de formation flexible pour une campagne limitée dans le temps ou une réservation de capacité pour un usage continu. Cette architecture ouvre la voie à une industrialisation plus fluide du développement de robots et de véhicules autonomes, où les équipes pourraient itérer plus rapidement sur des modèles de perception et de décision sans multiplier les infrastructures dédiées.

💬 Une "usine de modèles" qui unifie génération, entraînement et évaluation sur le même pool de GPU, ça change vraiment la donne pour qui bosse sur robotique ou véhicules autonomes. Fini le débit maximal d'une tâche isolée, place au GPU goodput, la progression utile par heure de calcul réservée : c'est ce genre de métrique qui décide qui tient dans les coûts et qui explose son budget cloud. Reste à voir si Cosmos 3 encaisse vraiment la charge en prod, pas juste sur le papier AWS.

InfrastructureActu
1 source
Gestion des opérations Amazon SageMaker HyperPod par agents autonomes avec InstantStart
Illustration générée par IA
13AWS ML Blog 

Gestion des opérations Amazon SageMaker HyperPod par agents autonomes avec InstantStart

Amazon Web Services a présenté HyperPod InstantStart, un nouveau contrôle plane open source destiné à piloter Amazon SageMaker HyperPod, son service de calcul managé pour l'entraînement et le déploiement de modèles de fondation. L'outil s'exécute sous forme d'un unique conteneur de gestion « out-of-band » dans le compte AWS du client, qui appelle les API AWS et l'API Kubernetes sans jamais se trouver dans le chemin critique d'un job d'entraînement ou d'une requête d'inférence. Il propose deux façons d'utiliser le même moteur : une interface web classique, avec formulaires et barres de progression, et une interface en ligne de commande pilotée par un agent IA, où une simple phrase comme « Help me create a new HyperPod cluster » suffit à déclencher un provisionnement complet. L'agent planifie alors le flux multi-étapes, lance chaque phase, interroge les opérations asynchrones AWS jusqu'à leur achèvement, et ne s'interrompt que pour les choix qui reviennent réellement à l'utilisateur, comme la zone de disponibilité, le type d'instance ou le type de capacité, avant de restituer un cluster opérationnel avec le stockage déjà monté. Web UI, API REST et outils MCP utilisés par l'agent constituent trois façades du même conteneur, appelant les mêmes validations et lisant le même état d'opération persisté. Cette approche s'attaque à un problème très concret pour les équipes d'infrastructure ML : le déploiement d'un cluster HyperPod implique une chaîne de tâches dépendantes, allant de la création du réseau et du plan de contrôle à l'installation des dépendances, en passant par la préparation du stockage et de l'identité, le maintien des jobs distribués malgré les pannes matérielles, et le déploiement des serveurs de modèles. Chaque étape possède sa propre API, ses propres modes d'échec et ses propres délais d'attente, et l'essentiel de la charge opérationnelle se situe justement dans les transitions entre ces étapes. En encodant les règles opérationnelles directement dans une API de contrôle plutôt qu'en laissant un agent manipuler un CLI brut, AWS cherche à rendre l'automatisation par agent réellement fiable plutôt que sujette aux erreurs de séquencement. Sur le plan technique, Amazon EKS reste la surface d'orchestration Kubernetes gérée par l'utilisateur, tandis que SageMaker HyperPod apporte des capacités entièrement managées par AWS réparties en quatre familles : l'infrastructure (surveillance de santé, vérifications approfondies, récupération automatique des nœuds), la capacité (provisionnement continu et autoscaling managé via Karpenter), l'entraînement (récupération au niveau des processus et checkpointing en couches), et l'inférence (routage intelligent et mise en cache clé-valeur hiérarchisée). InstantStart vient donc compléter cet écosystème en orchestrant la composition de ces briques AWS et Kubernetes, un chantier jusqu'ici laissé à la charge des équipes infrastructure elles-mêmes.

UELes équipes européennes utilisant Amazon SageMaker HyperPod pourraient simplifier leur gestion de clusters ML, sans impact réglementaire spécifique pour la France ou l'UE.

💬 L'astuce ici c'est pas le chatbot qui te sort un cluster en une phrase, c'est qu'AWS a mis les règles d'enchaînement des étapes dans l'API elle-même plutôt que de laisser l'agent bricoler un CLI brut. Ça change la fiabilité du truc : un agent qui appelle une API qui refuse les séquences invalides plante moins qu'un agent qui improvise des commandes à l'aveugle. Reste à voir si ça tient quand le cluster passe à l'échelle et que la panne matérielle arrive au pire moment.

InfrastructureOutil
1 source
Quatre grands modèles d'IA touchés par une panne simultanée rare
Illustration générée par IA
14Ars Technica AI 

Quatre grands modèles d'IA touchés par une panne simultanée rare

Jeudi matin, les modèles cloud d'OpenAI, Anthropic, xAI et Google ont connu des pannes significatives et chevauchantes sur une période de plusieurs heures, un événement rare touchant simultanément quatre grands fournisseurs d'IA. Anthropic a signalé en premier une "panne partielle" à 9h23 (heure de l'Est), avec des "erreurs élevées" affectant Claude Mythos 5.1, Claude Fable 5.1 et Claude Opus 5. L'entreprise a annoncé avoir identifié la cause environ quinze minutes plus tard, puis déployé un correctif, l'incident étant marqué résolu à 12h16. Un second rapport a fait état d'erreurs élevées sur Claude Sonnet 5 pendant une brève période juste après midi. De son côté, OpenAI a signalé dès 10h43 des "erreurs élevées" sur ChatGPT et Codex entraînant des performances dégradées ; une mesure corrective mise en place un peu plus de trente minutes plus tard a permis de résoudre l'incident à 12h55. Cette convergence de pannes chez plusieurs fournisseurs majeurs le même matin illustre à quel point l'économie numérique repose désormais sur un nombre restreint d'infrastructures d'IA cloud. Des millions d'utilisateurs professionnels et particuliers, ainsi que d'innombrables applications tierces construites sur ces API, ont subi des interruptions ou des dégradations de service en quelques heures seulement. Pour les entreprises qui ont intégré ChatGPT, Claude ou d'autres modèles dans leurs flux de travail critiques, l'incident rappelle les risques de dépendance à un fournisseur unique et l'absence de redondance dans de nombreuses architectures actuelles. Ces interruptions surviennent alors que la demande en calcul pour l'IA générative continue d'exploser, mettant sous tension les infrastructures cloud des grands acteurs du secteur. Bien que les causes précises invoquées par chaque entreprise restent techniques et propres à leurs systèmes respectifs, la simultanéité de ces incidents chez des concurrents directs a interpellé les observateurs du secteur, sans qu'un lien de cause commune n'ait été établi publiquement. Ce type d'épisode alimente régulièrement les discussions sur la résilience des services d'IA à grande échelle et sur la nécessité, pour les entreprises clientes, de prévoir des solutions de repli en cas de panne d'un fournisseur.

UELes entreprises européennes qui intègrent ChatGPT, Claude ou d'autres API dans leurs outils critiques subissent le même risque de panne, sans solution de repli locale garantie.

InfrastructureActu
1 source
Fin du cloud centralisé ? Le pari fou d’Equinix pour faire tourner 200 modèles open source
Illustration générée par IA
15Le Big Data 

Fin du cloud centralisé ? Le pari fou d’Equinix pour faire tourner 200 modèles open source

Equinix a annoncé la semaine du 1er septembre 2026 un partenariat majeur avec Nvidia et Together AI pour lancer une plateforme baptisée Inference Exchange, destinée à héberger plus de 200 modèles d'intelligence artificielle open source. Le dispositif s'appuiera sur les architectures de référence de Nvidia, notamment les puces Blackwell Ultra B300 et un système de refroidissement liquide conçu pour les futures puces Vera Rubin, tandis que Together AI gérera la couche logicielle donnant accès aux modèles. L'infrastructure sera déployée sur les 281 centres de données urbains d'Equinix à travers le monde, avec une disponibilité générale annoncée pour le premier trimestre 2027. Jensen Huang, le patron de Nvidia, a publiquement salué cette architecture maillée la semaine dernière, saluant sa capacité à traiter les données au plus près des utilisateurs et des capteurs plutôt que dans de gigantesques fermes de serveurs centralisées. Cette annonce marque un tournant stratégique dans l'industrie du cloud pour l'IA. Alors que l'entraînement des grands modèles reste l'apanage de méga data centers centralisés, la phase d'inférence, c'est à dire l'utilisation quotidienne des modèles par les applications, exige au contraire une faible latence et une proximité géographique avec les utilisateurs. En misant sur son maillage urbain existant plutôt que sur la course aux méga sites de plusieurs gigawatts menée par des acteurs comme CoreWeave, Equinix propose une alternative économique et rapide aux entreprises qui déploient des services d'IA générative. Pour les décideurs informatiques, cela signifie potentiellement des coûts d'inférence réduits et des temps de réponse plus courts pour leurs applications, sans avoir à dépendre exclusivement des géants du cloud comme Amazon ou Google. Ce choix s'inscrit dans un contexte financier contrasté au sein du secteur. L'action Equinix a bondi de 33 % depuis le début de l'année 2026, portant sa capitalisation boursière au delà de 100 milliards de dollars et dépassant celle de son concurrent Digital Realty. Son dernier trimestre affiche 477 millions de dollars de bénéfice net pour un chiffre d'affaires de 2,63 milliards de dollars, une rentabilité que certains analystes, comme Vlad Galabov, jugent pourtant trop prudente face à des rivaux comme CoreWeave, qui a accusé 626 millions de dollars de pertes sur la même période mais investit massivement dans des usines à IA de plusieurs gigawatts. Le vendeur à découvert Jim Chanos reste sceptique sur la rentabilité réelle des capitaux engagés dans ce secteur. En évitant l'affrontement direct avec les hyperscalers et en misant sur l'inférence de proximité, Equinix cherche à sécuriser une position de niche rentable dans un marché encore volatile.

UELe réseau de centres de données urbains d'Equinix inclut des sites en Europe, ce qui pourrait offrir aux entreprises européennes un accès à faible latence à l'inférence IA sans dépendre exclusivement des hyperscalers américains.

InfrastructureActu
1 source
Configurer OpenAI ChatGPT Codex avec LiteLLM sur Amazon ECS et Amazon Bedrock
Illustration générée par IA
16AWS ML Blog 

Configurer OpenAI ChatGPT Codex avec LiteLLM sur Amazon ECS et Amazon Bedrock

Amazon Web Services a publié un guide technique détaillant comment déployer une passerelle LiteLLM pour connecter l'agent de codage OpenAI ChatGPT Codex à Amazon Bedrock, en s'appuyant sur Amazon Elastic Container Service (ECS) et AWS Fargate. L'architecture proposée place LiteLLM, une passerelle IA open source, entre le poste de travail du développeur et Bedrock, tout en laissant Codex exécuter localement sa boucle de tâches, la lecture de fichiers et les outils approuvés sous son propre bac à sable. Le flux de requêtes suit cinq étapes: Codex envoie le contexte de la tâche à l'endpoint /v1/responses de la passerelle, un Application Load Balancer couplé à AWS WAF applique des contrôles réseau, LiteLLM authentifie l'appelant et vérifie les politiques de consommation avant d'invoquer le modèle sur Bedrock via son rôle IAM ECS, puis Bedrock renvoie du texte ou un appel de fonction que Codex exécute localement avant de renvoyer le résultat dans la requête suivante. L'infrastructure de référence s'appuie sur Amazon RDS pour PostgreSQL pour stocker l'état, l'usage et les budgets, sur AWS Secrets Manager et AWS KMS pour la gestion des clés, sur Amazon CloudWatch pour les journaux et alertes, et sur Amazon ECR pour héberger une image immuable de la passerelle. Le code complet est disponible dans le dépôt guidance-codex d'AWS. Cette architecture répond à un besoin concret des entreprises qui passent de l'expérimentation individuelle d'agents de codage IA à une adoption managée à grande échelle. En centralisant l'accès aux modèles derrière une passerelle unique, les équipes techniques peuvent appliquer des budgets, des limites de débit et une attribution précise de la consommation par développeur ou par équipe, tout en conservant une visibilité complète sur le chemin d'accès aux modèles via la télémétrie de la passerelle. Ce contrôle centralisé devient particulièrement utile lorsque plusieurs équipes ou plusieurs fournisseurs de modèles doivent coexister avec des règles de gouvernance cohérentes, sans pour autant donner à la passerelle un accès shell généralisé au compte AWS ni remplacer les approbations locales de Codex. Ce type de déploiement s'inscrit dans une tendance plus large où les grands fournisseurs cloud cherchent à encadrer l'usage d'agents IA autonomes en entreprise, entre autonomie du développeur et gouvernance centralisée. AWS précise que l'accès direct à Bedrock via AWS IAM Identity Center reste l'option la plus simple lorsque l'identité native AWS et les journaux CloudTrail suffisent aux besoins de conformité, et qu'une passerelle gérée comme Portkey peut constituer une alternative pour les organisations qui préfèrent ne pas opérer elles-mêmes l'infrastructure LiteLLM. Le choix entre ces trois approches, accès direct, passerelle auto-hébergée ou service géré tiers, dépendra du niveau de contrôle et de la charge opérationnelle que chaque organisation est prête à assumer à mesure que les agents de codage IA s'intègrent aux flux de développement en production.

InfrastructureTuto
1 source
NVIDIA accélère l'IA locale avec ses nouveautés dévoilées à l'IFA 2026
Illustration générée par IA
17NVIDIA AI Blog 

NVIDIA accélère l'IA locale avec ses nouveautés dévoilées à l'IFA 2026

À l'occasion du salon IFA 2026 à Berlin, NVIDIA a dévoilé, avec Microsoft et plusieurs partenaires, une série d'annonces destinées à accélérer l'intelligence artificielle exécutée localement sur ses puces. De nouveaux PC compacts NVIDIA RTX Spark, fabriqués par Lenovo et Acer, arriveront dès octobre. Les optimisations apportées à llama.cpp et vLLM, disponibles immédiatement ainsi que via LM Studio et Ollama, promettent une inférence locale jusqu'à 1,9 fois plus rapide. NVIDIA lance aussi PAIR (Personal AI Router), un outil qui répartit intelligemment les calculs d'inférence entre les PC d'un même réseau local, tandis que des applications d'agents comme Hermes Agent, OpenClaw et Perplexity Portable Computer bénéficient désormais d'une configuration simplifiée sous Windows. Le mois d'août a par ailleurs vu le lancement de plusieurs modèles taillés pour le matériel local : Nemotron 3.5 Lightning (30 milliards de paramètres), GLM-5.3-Flash de Z.ai, Qwen3.8-Flash-Next et Qwen3.8-27B, le générateur vidéo LTX 2.5, MiniMax-H3 et sa version distillée FastH3 (sept fois plus rapide), Muse Glimmer de Meta (30 milliards de paramètres) et DeepSeek v4 Flash, un modèle à mélange d'experts de 284 milliards de paramètres dont 13 milliards actifs, capable de tourner sur un cluster de deux DGX Spark. Electronic Arts, Embark et Ubisoft rejoignent également le catalogue de jeux optimisés pour RTX Spark. Ces annonces marquent une étape dans la démocratisation des agents d'IA exécutés sans passer par le cloud. Jusqu'ici, faire tourner un modèle local exigeait de choisir soi-même un modèle, un serveur d'inférence compatible, de régler la quantification et de maintenir l'ensemble à jour, autant d'obstacles qui freinaient les développeurs et créateurs non spécialistes. En simplifiant cette chaîne, NVIDIA et ses partenaires abaissent la barrière d'entrée pour des utilisateurs qui veulent conserver leurs données sur leur propre machine, éviter de consommer des crédits d'API et gagner en confidentialité. Perplexity Portable Computer illustre cette logique : l'outil exécute des tâches entières en local sur des GPU RTX disposant d'au moins 24 Go de VRAM, tout en demandant l'autorisation de l'utilisateur avant d'envoyer des contenus vers le cloud pour les tâches nécessitant plus de puissance. Cette poussée s'inscrit dans une compétition plus large entre fournisseurs de matériel et laboratoires d'IA pour s'imposer sur le segment de l'inférence locale, à mesure que les modèles open source gagnent en capacité tout en restant exécutables sur des postes de travail. Des acteurs aussi variés que Meta, Z.ai, Alibaba avec Qwen ou DeepSeek publient désormais des modèles ouverts spécifiquement optimisés pour l'écosystème NVIDIA, des RTX grand public aux stations DGX en passant par les modules Jetson. Le support Windows de Perplexity Portable Computer est annoncé comme prochain, signe que la course à la simplification de l'IA locale devrait se poursuivre dans les mois à venir.

UEL'exécution locale de l'IA peut faciliter indirectement la conformité RGPD des utilisateurs européens en limitant les transferts de données vers le cloud, mais aucune entreprise ou réglementation française ou européenne n'est directement concernée.

💬 Le vrai obstacle à l'IA locale n'a jamais été la puissance des cartes, c'est la galère de config: choisir son modèle, un serveur d'inférence compatible, régler la quantification à la main. Là NVIDIA planque tout ça derrière un clic avec llama.cpp et vLLM optimisés, et ça change qui peut s'en servir, plus seulement les devs qui aiment bricoler leur stack. Reste à voir si PAIR tient la route sur un réseau local un peu bordélique, mais pour une fois l'annonce répond à un vrai point de friction, pas à une démo qui brille en fond noir.

InfrastructureActu
1 source
Sam Altman (OpenAI) alerte sur une "folie insoutenable" dans les investissements en calcul
Illustration générée par IA
18The Decoder 

Sam Altman (OpenAI) alerte sur une "folie insoutenable" dans les investissements en calcul

Sam Altman, PDG d'OpenAI, a mis en garde contre ce qu'il qualifie de "folie insoutenable" dans la construction mondiale de data centers dédiés à l'intelligence artificielle. Selon lui, de trop nombreux fournisseurs de type Neocloud, ces entreprises spécialisées dans la location de capacité de calcul GPU, annoncent des investissements massifs en infrastructure sans disposer des clients réels pour absorber cette capacité. Altman reconnaît également un risque structurel plus large : la baisse continue des coûts de calcul pourrait transformer les projets d'infrastructure valorisés en milliards de dollars aujourd'hui en investissements ratés demain, un risque qui, selon lui, concerne aussi OpenAI elle-même malgré sa position dominante sur le marché. Cet avertissement, venant du dirigeant de l'une des entreprises les plus engagées dans la course aux capacités de calcul, prend une dimension particulière. OpenAI a signé ces derniers mois plusieurs accords d'infrastructure représentant des centaines de milliards de dollars d'engagements avec des partenaires comme Oracle, Nvidia ou encore des acteurs du cloud spécialisé. Si le fondateur reconnaît lui-même la fragilité économique de ce modèle, cela alimente les craintes d'une bulle spéculative autour des infrastructures d'IA, où la valorisation de nombreux projets repose sur des hypothèses de demande future incertaines plutôt que sur des contrats fermes déjà signés. Ces déclarations interviennent alors que l'industrie de l'IA traverse une phase de dépenses d'infrastructure sans précédent, portée par la conviction que la demande en puissance de calcul continuera de croître de manière exponentielle. Les Neoclouds, souvent financés par de la dette adossée aux futurs contrats de location GPU, misent sur cette croissance pour rentabiliser des investissements colossaux en centres de données. Mais la chute rapide du coût du calcul, portée par de nouvelles générations de puces et l'amélioration de l'efficacité des modèles, pourrait déprécier ces actifs plus vite que prévu, posant la question de qui absorbera les pertes si la demande ne suit pas le rythme des annonces.

UEUn éclatement de la bulle des data centers IA affecterait indirectement les investisseurs et fournisseurs cloud européens exposes au secteur des Neoclouds.

InfrastructureOpinion
1 source
Le contrat Anthropic-Nscale signe l’avènement de l’alt-cloud IA
Illustration générée par IA
19Le Big Data 

Le contrat Anthropic-Nscale signe l’avènement de l’alt-cloud IA

Anthropic a signé avec la société britannique Nscale un contrat d'infrastructure d'environ 45 milliards de dollars sur six ans, portant sur la réservation de 460 mégawatts de capacité de calcul dans un centre de données situé en Virginie-Occidentale. Ce site sera équipé des puces Nvidia Vera Rubin à partir de fin 2027. Cet accord fait grimper le carnet de commandes de Nscale au-delà des 100 milliards de dollars, alors même que la startup britannique est déjà financée à hauteur de plusieurs milliards de dollars par Amazon et Google, ses futurs concurrents indirects dans cette transaction. Il s'inscrit dans une série de partenariats similaires noués récemment par Anthropic : 10 milliards de dollars avec Volta, 5 milliards avec AMD, et environ 1,25 milliard de dollars par mois pour les capacités de calcul de SpaceX. L'éditeur de Claude, actuellement valorisé à 965 milliards de dollars dans la perspective d'une introduction en bourse, diversifie ainsi délibérément ses fournisseurs d'infrastructure plutôt que de dépendre d'AWS ou de Google Cloud. Cette stratégie illustre un basculement de rapport de force dans l'industrie du cloud. L'entraînement des grands modèles de langage exige des grappes de processeurs graphiques interconnectées à très haute vitesse, sans goulot d'étranglement réseau, une contrainte que les hyperscalers généralistes peinent parfois à satisfaire aux volumes et délais requis par les laboratoires d'IA. En contournant ses propres investisseurs, Anthropic valide le modèle de l'"alt-cloud IA", ces infrastructures de niche taillées sur mesure pour l'entraînement, le réglage fin et l'inférence de modèles complexes. Pour les directions informatiques, ce signal a une portée concrète : le calcul devient le premier poste budgétaire des projets d'IA, et la diversification des fournisseurs apparaît comme une protection contre la hausse des tarifs et les risques de dépendance. Les clouds traditionnels restent pertinents pour l'hébergement applicatif ou les bases de données, mais les charges de travail d'IA intensive se déplacent vers ces plateformes spécialisées, plus efficaces sur le plan énergétique et moins coûteuses à l'exécution. Ce mouvement s'inscrit dans une course généralisée à la capacité de calcul, où les laboratoires d'IA multiplient les contrats hors norme pour sécuriser de l'énergie et du matériel avant leurs concurrents. La saturation récurrente des services d'Anthropic lors des pics d'usage a accéléré cette recherche de fournisseurs alternatifs, malgré les investissements consentis par Amazon pour imposer AWS comme partenaire privilégié. Nscale, encore relativement jeune sur ce marché, se retrouve propulsée au rang d'acteur clé de l'infrastructure IA grâce à ce type d'accord. La question qui se pose désormais pour l'ensemble du secteur est celle de la pérennité de ce modèle multi-fournisseurs face aux besoins énergétiques croissants, et de la capacité des hyperscalers historiques à réagir pour ne pas voir leur position s'éroder davantage.

InfrastructureOpinion
1 source
Les entreprises placent les puces non-Nvidia 14 points devant les futurs GPU de Nvidia dans leurs listes d'évaluation
Illustration générée par IA
20VentureBeat AI 

Les entreprises placent les puces non-Nvidia 14 points devant les futurs GPU de Nvidia dans leurs listes d'évaluation

Selon l'enquête VB Pulse de VentureBeat menée en juillet auprès de 170 responsables d'infrastructure IA, 39,4% des entreprises interrogées prévoient d'évaluer des accélérateurs autres que Nvidia au cours des douze prochains mois, notamment les puces Trainium d'AWS, les TPU de Google, les Instinct d'AMD, les Gaudi d'Intel ou des ASIC maison, contre seulement 25,3% pour la prochaine génération de GPU Nvidia, la Blackwell GB300, soit un écart de 14 points. Nvidia reste le choix par défaut dans la plupart des environnements de production, mais les entreprises diversifient désormais leurs options d'évaluation. L'enquête montre aussi une adoption croissante des plateformes cloud en production: Microsoft Azure passe de 29% à 47,1% entre juin et juillet, Google Gemini de 41,1% à 47,6%, OpenAI de 40,2% à 49,4%, et Anthropic bondit de 12,1% à 24,7%. Parmi les entreprises exploitant leurs propres GPU, la part de celles fonctionnant à moitié de leur capacité ou moins recule de 83% (sur 100 répondants en juin) à 69% (sur 155 répondants en juillet), tandis que celles dépassant 50% d'utilisation passent de 13% à 23%. Ce basculement traduit un changement de priorité pour les directions informatiques: plutôt que de chercher à remplacer leur plateforme d'IA, les entreprises cherchent désormais à optimiser et à mieux exploiter l'infrastructure déjà en place. La part des répondants prévoyant un changement de plateforme dans les trois mois tombe de 38,3% à 28,8% d'un mois sur l'autre, alors même que l'adoption en production, le taux d'utilisation des accélérateurs et l'exploration des neoclouds et de l'open source progressent tous simultanément. Les critères de succès deviennent aussi plus opérationnels: la fiabilité et la disponibilité sont citées comme critères importants par 51,2% des répondants contre 42,1% en juin, le débit par 24,7% contre 21,5%, et la facilité de mise en œuvre progresse de 3,84 à 4,04 sur cinq. La satisfaction globale, elle, ne bouge presque pas, de 4,07 à 4,14, tout comme la valeur perçue, stable autour de 3,9, signe que les entreprises deviennent plus exigeantes à mesure qu'elles montent en compétence. Ce ralentissement de l'urgence à changer de fournisseur s'accompagne d'un déplacement des horizons de décision: la part des entreprises prévoyant un changement immédiat, sous trois mois, chute de 9,5 points, tandis que les fenêtres de trois à six mois et de six à douze mois progressent respectivement de 4,1 et 5,3 points. Le débat autour des modèles à poids ouverts et des harnais open source influence désormais quels composants de la pile technologique sont conservés, améliorés ou remplacés entièrement, l'intégration avec le cloud et la pile de données existants restant un critère de sélection déterminant pour les entreprises face à un marché des accélérateurs de plus en plus concurrentiel entre Nvidia, AWS, Google, AMD et Intel.

UELes entreprises européennes font face aux mêmes arbitrages entre Nvidia et alternatives cloud, mais l'enquête ne porte pas spécifiquement sur le marche français ou européen.

💬 Ce chiffre ne dit pas que Nvidia perd du terrain, il dit que les entreprises arrêtent de signer les yeux fermés. Évaluer Trainium ou les TPU, c'est surtout un levier de négociation, pas une bascule en prod, d'ailleurs le nombre de boîtes qui prévoient de changer de plateforme dans les trois mois recule dans la même enquête. Selon Le Fil IA, cet été marque moins l'arrivée de vrais concurrents à Nvidia que la fin de la panique d'achat: les DSI préfèrent enfin optimiser ce qu'ils ont plutôt que courir après le prochain GPU.

InfrastructureActu
1 source
Anthropic et son deal à 35 milliards : une hausse inévitable du TCO de l’IA générative ?
Illustration générée par IA
21Le Big Data 

Anthropic et son deal à 35 milliards : une hausse inévitable du TCO de l’IA générative ?

Anthropic a signé un contrat de cloud computing d'un montant de 35 milliards de dollars avec Lambda, opérateur d'infrastructures soutenu par Nvidia, révélé fin août 2026 par le Wall Street Journal. L'accord porte sur l'exploitation d'un centre de données de 350 mégawatts développé par la société Hut 8 dans le comté de Nueces, au Texas. Selon des détails rapportés par le Financial Express, Nvidia détient directement le bail du site auprès de Hut 8 avant de mettre les capacités à disposition de Lambda, qui fournit ensuite la puissance de calcul à Anthropic. Le fabricant de puces joue ainsi simultanément le rôle d'équipementier, d'investisseur et de garant financier dans ce montage circulaire. Quelques jours plus tôt, Anthropic avait déjà dévoilé un engagement de 45 milliards de dollars auprès de l'opérateur Nscale, en Virginie-Occidentale. Au total, les grands laboratoires de recherche en intelligence artificielle cumulent désormais plus de 100 milliards de dollars d'engagements locatifs fermes pour sécuriser leurs capacités de calcul. Cette course aux infrastructures a des conséquences directes sur le coût total de possession de l'IA générative pour les entreprises clientes. Les fournisseurs de cloud devront amortir ces investissements colossaux à travers leurs grilles tarifaires, ce qui se traduit déjà par une hausse progressive des tarifs appliqués aux requêtes API, une revalorisation des abonnements SaaS métier et un durcissement des engagements contractuels imposés par les hébergeurs. Pour les directeurs informatiques et financiers, cette inflation structurelle des coûts d'infrastructure impose de dépasser l'enthousiasme des premiers prototypes pour instaurer une gouvernance financière stricte sur chaque cas d'usage déployé. Les départements informatiques généralisent ainsi les pratiques de FinOps appliquées aux grands modèles de langage, en privilégiant des modèles spécialisés de petite taille pour les tâches automatisées récurrentes plutôt qu'un recours systématique aux modèles les plus puissants et les plus coûteux. Cette flambée des dépenses s'explique par la conjonction de plusieurs pénuries structurelles: rareté de l'énergie électrique disponible, manque de foncier technique adapté à l'implantation de centres de données, et quasi-monopole de Nvidia sur les processeurs graphiques nécessaires à l'entraînement et à l'inférence des modèles. Anthropic multiplie ces engagements pharaoniques pour répondre à l'explosion de la demande des entreprises autour de son assistant Claude Code. Cette captation massive des capacités de calcul par une poignée d'acteurs réduit mécaniquement les ressources disponibles pour le reste du marché, accentuant la pression concurrentielle entre laboratoires de recherche et fournisseurs de cloud. La dépendance croisée entre Nvidia, des opérateurs d'infrastructures comme Lambda ou Nscale, et des propriétaires de centres de données comme Hut 8, illustre à quel point la réservation prioritaire de matériel conditionne désormais la survie commerciale et la croissance des éditeurs de logiciels d'intelligence artificielle.

UELes entreprises européennes clientes des API Claude et autres LLM subiront une hausse indirecte des couts via la répercussion tarifaire de ces investissements massifs en infrastructure.

💬 Nvidia loueur, investisseur et garant du même contrat : ce montage circulaire sent plus l'ingénierie financière que la stratégie industrielle. Anthropic sécurise sa puissance de calcul face à l'explosion de Claude Code, d'accord, mais ces 100 milliards d'engagements cumulés ne tombent pas du ciel, ils finissent dans le prix du token que payent les entreprises clientes. Le vrai tournant à surveiller, c'est les DSI qui basculent vers des petits modèles spécialisés pour les tâches répétitives, parce que balancer le modèle le plus cher sur tout devient un luxe qu'on ne peut plus se permettre.

InfrastructureOpinion
1 source
Acheter le Mac mini M6 pour l’IA locale : pourquoi c’est souvent une mauvaise idée
Illustration générée par IA
22Frandroid 

Acheter le Mac mini M6 pour l’IA locale : pourquoi c’est souvent une mauvaise idée

Le site spécialisé Frandroid a testé le Mac mini M6 d'Apple, présenté par la marque comme une machine adaptée à l'intelligence artificielle locale, pour vérifier ce qu'il peut réellement exécuter en pratique. Apple met en avant des chiffres favorables autour des capacités du puce M6 pour faire tourner des modèles d'IA directement sur l'appareil, sans passer par le cloud. Or, selon l'analyse menée, ces performances affichées ne reflètent pas l'expérience concrète que rencontrerait la majorité des acheteurs cherchant à exploiter l'IA en local sur cette machine. Le constat du test est clair : pour la plupart des usages visés, le Mac mini M6 ne constitue pas le bon choix. Ce type de vérification compte parce que l'IA locale devient un argument de vente central pour les fabricants, qui promettent confidentialité des données et rapidité sans dépendre d'un serveur distant. Un acheteur convaincu par cette promesse marketing risque de se retrouver avec un appareil sous-dimensionné pour les modèles qu'il souhaite réellement faire tourner, notamment les grands modèles de langage gourmands en mémoire et en puissance de calcul. Cette situation illustre un écart croissant entre les chiffres bruts communiqués par les constructeurs et les besoins réels des utilisateurs, qu'il s'agisse de développeurs, de professionnels ou de simples curieux voulant expérimenter l'IA générative sans dépendance au cloud. Ce débat s'inscrit dans une tendance plus large où Apple, comme ses concurrents, cherche à positionner son matériel comme une plateforme privilégiée pour l'IA embarquée, misant sur l'architecture unifiée de ses puces Silicon. Mais la mémoire disponible et la bande passante restent des facteurs déterminants souvent minimisés dans la communication commerciale. Ce type d'article invite les acheteurs à comparer les configurations réelles, notamment la quantité de RAM, avant d'investir dans une machine vendue comme adaptée à l'IA locale.

UELes consommateurs français tentes par l'IA locale doivent vérifier la RAM réelle disponible avant d'acheter un Mac mini M6, au-delà des chiffres marketing d'Apple.

InfrastructureOpinion
1 source
NVIDIA et MediaTek propulsent l’IA locale : un tournant stratégique pour les données d’entreprise
Illustration générée par IA
23Le Big Data 

NVIDIA et MediaTek propulsent l’IA locale : un tournant stratégique pour les données d’entreprise

Nvidia et MediaTek ont officialisé le 31 août 2026 un partenariat stratégique majeur, confirmé par Nvidia sur son compte X et détaillé dans un communiqué officiel. Nvidia investit 3,5 milliards de dollars sous forme d'obligations convertibles dans le concepteur taïwanais de semi-conducteurs, afin de développer conjointement de nouvelles plateformes de calcul allant du cloud jusqu'à la périphérie du réseau, ou edge computing. L'accord prévoit que MediaTek adopte la technologie d'interconnexion NVLink Fusion de Nvidia. Concrètement, l'alliance donne déjà naissance à des puces personnalisées, les DGX Spark et RTX Spark, qui associent la microarchitecture graphique Blackwell de Nvidia à des cœurs de processeur SoC à très haute efficacité énergétique conçus par MediaTek. Ces composants reposent sur une interconnexion à haut débit NVLink-C2C et sur de la mémoire à large bande passante NVHBM, combinant ainsi la puissance de calcul de la firme de Santa Clara au savoir-faire de MediaTek en matière de puces économes. Cette évolution marque un changement d'architecture pour les entreprises qui utilisent l'intelligence artificielle générative. Jusqu'ici, la majorité des requêtes envoyées aux modèles d'IA transitaient par des serveurs cloud distants, facturés à l'usage via des API, ce qui génère des coûts opérationnels croissants et difficiles à maîtriser pour les directions informatiques. En déployant du matériel capable d'exécuter localement des modèles comptant plusieurs dizaines de milliards de paramètres, les entreprises transforment une dépense variable et exponentielle en investissement matériel prévisible, une logique proche des principes du FinOff. Cette IA locale répond aussi à des enjeux de confidentialité : garder le traitement des données sensibles au sein du réseau interne réduit les risques de fuite et facilite la conformité au RGPD. Enfin, pour des usages industriels critiques comme la vision par ordinateur, la maintenance prédictive ou la robotique, l'exécution sur site supprime la latence liée aux échanges avec le cloud et permet de continuer à fonctionner même en cas de coupure internet. Ce rapprochement s'inscrit dans une tendance plus large de bascule du cloud centralisé vers l'edge computing, portée par l'explosion des coûts d'infrastructure IA et les exigences réglementaires croissantes sur la souveraineté des données. En misant sur MediaTek, réputé pour ses systèmes sur puce à basse consommation utilisés notamment dans le mobile, Nvidia cherche à équiper directement postes de travail et stations professionnelles pour en faire de véritables supercalculateurs de bureau. Les développeurs et équipes data pourraient ainsi ajuster et exécuter des modèles volumineux sans solliciter d'infrastructure d'inférence distante, une orientation qui pourrait redéfinir la manière dont les entreprises consomment l'IA dans les mois à venir.

UEAucune entreprise française ou européenne n'est impliquée dans cet accord, mais la possibilité de traiter l'IA localement pourrait faciliter la conformité au RGPD pour les entreprises européennes qui adopteraient ce matériel.

InfrastructureActu
1 source
Comment Jamf a mis en place le contrôle des dépenses en temps réel pour Amazon Bedrock
Illustration générée par IA
24AWS ML Blog 

Comment Jamf a mis en place le contrôle des dépenses en temps réel pour Amazon Bedrock

Jamf, société qui gère et sécurise les appareils Apple pour plus de 76 000 organisations dans le monde, a mis au point un système de contrôle des dépenses en temps quasi réel pour l'usage d'Amazon Bedrock par ses équipes d'ingénierie. Après avoir ouvert largement l'accès à cette plateforme d'IA générative pour accélérer le développement assisté par IA, l'entreprise a constaté une hausse de la productivité mais aussi un besoin urgent de visibilité sur les coûts par utilisateur. Le système repose sur une architecture entièrement serverless combinant plusieurs services AWS : les journaux d'invocation d'Amazon Bedrock (modèle utilisé, nombre de tokens en entrée et sortie, identité de l'utilisateur) sont stockés dans Amazon S3, puis une vue Amazon Athena baptisée bedrockcosttoday calcule la dépense quotidienne de chaque ingénieur en croisant les volumes de tokens avec les tarifs publiés des modèles. Toutes les quinze minutes, une fonction AWS Lambda déclenchée par Amazon EventBridge évalue ces dépenses et applique des restrictions graduées : l'accès à Claude Opus d'Anthropic est coupé dès 80 % du budget journalier atteint, celui à Claude Sonnet à 100 %, tandis que Claude Haiku reste toujours disponible pour ne pas bloquer le travail. Les restrictions, appliquées via des politiques IAM (Customer Managed Policies) ciblant les utilisateurs par identifiant SAML, prennent effet en quelques minutes sans nécessiter de reconnexion, et sont réinitialisées automatiquement chaque jour. Ce cas illustre un problème de plus en plus pressant pour les entreprises qui déploient l'IA générative à grande échelle : contrairement au calcul traditionnel, dont le coût suit la capacité provisionnée, la dépense en IA suit le comportement des utilisateurs. Un seul ingénieur lançant une boucle de codage agentique sur un modèle premium peut consommer en quelques heures plus de tokens qu'une équipe entière en une semaine, rendant les coûts invisibles jusqu'à la facture. Ce système répond directement aux trois questions que se posent les directions avant d'élargir l'accès à l'IA : combien coûte chaque utilisateur, peut-on plafonner sans ralentir les équipes, et les gains de productivité justifient-ils la dépense. En automatisant la gouvernance financière de l'IA (AI FinOps) au niveau individuel, sans interrompre les sessions actives ni exiger de réauthentification, Jamf propose un modèle reproductible pour d'autres organisations confrontées au même dilemme entre innovation et maîtrise budgétaire. Le dispositif s'inscrit dans la montée en puissance de l'IA générative comme outil de développement logiciel au sein des grandes organisations, où l'accès à des modèles comme ceux d'Anthropic devient un poste de dépense significatif et volatile. Jamf a prévu une soupape : les ingénieurs ayant un besoin légitime de dépasser leur quota peuvent obtenir, via un processus documenté, des limites temporaires plus élevées, et sont prévenus par un message Slack avant que les restrictions ne s'appliquent. Amazon présente cette architecture, bâtie sur DynamoDB, Athena, Lambda et IAM, comme un modèle de référence pour le contrôle des coûts d'IA en entreprise, à mesure que le sujet du FinOps appliqué à l'IA générative devient central pour les responsables techniques.

InfrastructureActu
1 source
Comment ZS a démocratisé l'analyse ad hoc sécurisée avec Amazon SageMaker
Illustration générée par IA
25AWS ML Blog 

Comment ZS a démocratisé l'analyse ad hoc sécurisée avec Amazon SageMaker

ZS Associates, cabinet de conseil actif notamment auprès d'organisations du secteur de la santé, a construit une plateforme d'analyse de données ad hoc sécurisée sur Amazon SageMaker Studio d'AWS. Décrit dans un billet co-signé par Kiran Dhamane, Abhishek I S et Mayur Ghodekar, le système sert désormais plus de 1 000 utilisateurs actifs quotidiens répartis sur plus de 200 domaines SageMaker distincts. La plateforme fonctionne sans accès direct à internet par défaut, les échanges avec les services AWS passant par des points de terminaison Amazon VPC, tandis que JFrog Artifactory scanne les paquets logiciels en temps réel pour bloquer tout code non autorisé ou altéré. Chaque domaine SageMaker, isolé par équipe interne, dispose de son propre volume Amazon EFS, de rôles IAM dédiés et de paramètres réseau spécifiques, avec une hiérarchie à trois niveaux de rôles IAM (domaine, utilisateur, espace partagé) appliquant le principe du moindre privilège. Le chiffrement AWS KMS est activé par défaut sur EFS, S3, Amazon ECR et AWS CodeCommit, la détection des menaces passe par CrowdStrike, les journaux sont centralisés via Splunk, et AWS CloudTrail trace l'ensemble des appels API. Cette architecture répond à une tension classique des industries réglementées: offrir aux data scientists l'agilité nécessaire pour explorer des données rapidement, sans compromettre la conformité exigée dans la santé. En démocratisant l'accès au machine learning tout en conservant un contrôle granulaire des coûts et des accès, ZS a fait de SageMaker l'outil d'analyse ad hoc principal pour la quasi-totalité de ses équipes applicatives. Des configurations de cycle de vie automatisées sauvegardent en continu les données et scripts des utilisateurs vers Amazon S3, palliant l'absence de sauvegarde native dans SageMaker sans faire peser cette charge sur chaque utilisateur. Côté coûts, des politiques IAM limitent par défaut les utilisateurs à des instances préapprouvées de taille réduite, l'accès à des instances plus puissantes nécessitant une demande spécifique auprès de l'équipe analytics, et l'arrêt automatique des ressources inactives élimine les coûts de surprovisionnement. Cette démarche illustre un mouvement plus large chez les grands cabinets de conseil et les entreprises du secteur de la santé, où l'adoption du machine learning se heurte souvent à des contraintes réglementaires strictes en matière de protection des données. En intégrant ses standards de sécurité directement dans l'expérience développeur plutôt qu'en les imposant comme une couche de restrictions supplémentaire, ZS montre qu'agilité et gouvernance ne sont pas nécessairement contradictoires. Le maintien d'AWS CodeCommit, service fermé aux nouveaux clients depuis juillet 2024 mais toujours utilisé par ZS car déployé avant cette date, souligne aussi la difficulté pour les organisations réglementées de faire évoluer leur pile technique sans rouvrir des chantiers de conformité déjà validés. Ce type d'architecture pourrait inspirer d'autres acteurs de la santé, de la finance ou de l'assurance cherchant à généraliser l'usage du machine learning en interne sans multiplier les risques réglementaires.

InfrastructureActu
1 source
Cartes graphiques : 10 ans de GPU, comment l’IA a jeté un froid
Illustration générée par IA
26Next INpact 

Cartes graphiques : 10 ans de GPU, comment l’IA a jeté un froid

NVIDIA lance en général une nouvelle génération de cartes graphiques chaque année, une régularité tenue depuis près d'une décennie, mais 2026 s'annonce comme une rupture avec cette habitude. La dernière carte grand public sortie par l'entreprise est la RTX 5050, lancée en juillet 2025. La génération complète des RTX 5000 avait, elle, été dévoilée en janvier 2025. Depuis, aucune nouvelle référence n'est apparue, pas même une déclinaison « Super » de milieu de génération comme NVIDIA en propose habituellement. Selon les informations rapportées en février par le média The Information, l'entreprise ne prévoit aucune nouvelle puce graphique destinée aux joueurs pour l'année 2026, en raison d'une pénurie mondiale croissante de puces mémoire provoquée par l'essor de l'intelligence artificielle. Le calendrier observé depuis confirme cette prévision. Quant à la génération suivante, connue sous le nom de code Rubin, elle ne devrait pas arriver avant 2027, voire 2028, si ce nom de projet est conservé pour le marché grand public. Cette pause a des conséquences concrètes bien au-delà des joueurs sur PC. Les trois principaux fabricants mondiaux de puces mémoire ont réorienté leur production vers les besoins massifs de l'IA générative, au détriment des composants destinés au grand public. Résultat, les prix de la mémoire et du stockage ont grimpé jusqu'à cinq fois en dix-huit mois, une hausse qui touche directement le coût des ordinateurs, des consoles et des cartes graphiques. Pour NVIDIA comme pour AMD, la priorité stratégique n'est plus le joueur mais le datacenter, où la demande en GPU dédiés à l'entraînement et à l'inférence des modèles d'IA reste extrêmement lucrative. Ce basculement illustre à quel point l'IA générative redessine les priorités industrielles d'un secteur entier, quitte à ralentir l'innovation sur un marché historique et à peser sur le budget des consommateurs. Ce virage trouve son origine dans le lancement de ChatGPT fin 2022, qui a bouleversé en quelques mois les besoins matériels de l'industrie. Les grands modèles de langage sont passés en quelques années de dizaines de milliards de paramètres à plusieurs milliers de milliards, exigeant des quantités de mémoire toujours plus importantes pour être chargés et exploités. Face à cette demande, les fabricants de mémoire ont dû se réorganiser en profondeur, créant une tension durable sur l'ensemble de la chaîne d'approvisionnement. Alors que le monde des cartes graphiques pour joueurs marque une pause inédite, celui des datacenters continue sa course effrénée, NVIDIA et AMD y concentrant l'essentiel de leurs investissements. Reste à savoir si ce déséquilibre se résorbera avec l'arrivée de nouvelles capacités de production mémoire, ou si les joueurs devront s'habituer à un rythme de renouvellement bien plus lent qu'auparavant.

UELa pénurie mondiale de puces mémoire liée à l'IA fait grimper les prix des ordinateurs, consoles et cartes graphiques, ce qui touche aussi les consommateurs français et européens sans qu'aucune régulation ou acteur européen ne soit directement impliqué.

InfrastructureOpinion
1 source
Comment Sony et TSMC intègrent l’Edge AI dans leurs capteurs pour traiter la donnée à la source
Illustration générée par IA
27Le Big Data 

Comment Sony et TSMC intègrent l’Edge AI dans leurs capteurs pour traiter la donnée à la source

Sony Group et TSMC ont annoncé la constitution d'une coentreprise industrielle dotée d'un investissement de 1 000 milliards de yens, soit environ 6,3 milliards de dollars, pour développer des capteurs d'image intégrant des capacités d'Edge AI. Implantée dans la préfecture de Kumamoto au Japon, la nouvelle entité sera détenue à 60 % par Sony et 40 % par TSMC, et vise le début de la fabrication en série de ces composants dès 2029. Au delà des débouchés classiques dans les smartphones, notamment ceux d'Apple, les deux groupes ciblent explicitement les marchés de l'IA physique et de la robotique. Le procédé repose sur une architecture d'empilement tridimensionnelle où une puce de calcul logique, gravée selon les procédés de TSMC, est placée directement sous la matrice de pixels conçue par Sony, permettant au capteur d'exécuter des modèles d'IA et de trier l'information visuelle sans faire appel à un serveur distant. Un séisme survenu fin juillet 2026 à Kumamoto a temporairement suspendu l'activité des usines locales, sans remettre en cause le calendrier du projet selon les deux partenaires. Cette intégration directe du calcul dans le capteur répond à un problème concret pour les directions informatiques : l'acheminement continu de flux vidéo haute définition vers le cloud génère des coûts de bande passante et de stockage croissants, à mesure que les réseaux industriels saturent. En ne transmettant que des métadonnées utiles, comme une alerte de panne ou un comptage d'objets, plutôt que le flux brut, les entreprises réduisent significativement leurs coûts d'infrastructure. Le traitement local limite aussi l'exposition des données sensibles, puisque l'image brute reste dans le boîtier optique, ce qui facilite la conformité avec le RGPD. Pour l'automatisation industrielle et les véhicules autonomes, où l'analyse de l'environnement doit s'effectuer en quelques millisecondes pour éviter une collision ou corriger une trajectoire, l'élimination des allers-retours réseau devient un enjeu de sécurité autant que de performance. Ce rapprochement rassemble le premier fabricant mondial de capteurs optiques et le leader mondial de la fonderie de semi-conducteurs, chacun protégeant son cœur de métier : Sony conserve la propriété exclusive de ses procédés d'imagerie tout en s'appuyant sur la puissance de gravure de TSMC, ce qui lui permet de défendre ses parts de marché face à Samsung et OmniVision. TSMC, de son côté, acquiert une expertise nouvelle sur le segment en forte croissance de la vision par ordinateur embarquée. L'ampleur de l'investissement, équivalent à environ quatre années de dépenses d'investissement de la filiale semi-conducteurs de Sony, illustre l'importance stratégique accordée à ce pari industriel de long terme. La suite dépendra de la capacité des deux groupes à tenir leur calendrier de 2029 malgré les aléas locaux, comme le séisme de juillet, et de la vitesse à laquelle les industriels de la robotique et des véhicules autonomes adopteront ces capteurs intelligents comme brique de base de leurs systèmes de perception.

InfrastructureOpinion
1 source
OpenAI aurait acheté des milliers de Mac d’Apple… mais pourquoi ?
Illustration générée par IA
28Le Big Data 

OpenAI aurait acheté des milliers de Mac d’Apple… mais pourquoi ?

OpenAI aurait acquis des dizaines de milliers de Mac mini et de Mac Studio auprès d'Apple, selon des informations rapportées fin août 2026 par The Information. L'information a été relayée le 30 août 2026 sur X par l'analyste Shay Boloor, qui précise que ces machines serviraient à l'apprentissage par renforcement ainsi qu'au fonctionnement d'agents IA capables d'utiliser un ordinateur. Toujours selon cette source, Anthropic suivrait une logique comparable en louant des Mac mini via l'infrastructure cloud d'Amazon Web Services, plutôt qu'en les achetant directement. Ces révélations interviennent alors que le marché des composants électroniques traverse une période de tension extrême, avec une flambée des prix de la mémoire qui pousse les laboratoires d'intelligence artificielle à sécuriser des stocks de matériel par tous les moyens, un peu comme Amazon avait récemment fait parler d'elle en rachetant massivement des livres pour nourrir ses modèles en données textuelles. Cette stratégie surprend car les Mac ne sont pas les machines auxquelles on pense spontanément pour entraîner des modèles d'IA de pointe, un rôle habituellement dévolu aux immenses fermes de serveurs équipées de puces NVIDIA. Mais le choix n'est pas anodin: OpenAI ne chercherait pas à remplacer ses GPU, insuffisants pour le pré-entraînement gourmand en données, mais à équiper une étape différente et tout aussi cruciale du développement de ses modèles, celle où les systèmes sont testés, évalués et corrigés pour affiner leurs réponses. Pour ce type de tâche, l'architecture des puces Apple Silicon présente un avantage réel: leur mémoire unifiée permet au processeur et au GPU de partager plus facilement les ressources, et des connexions rapides comme le Thunderbolt 5 permettent de faire coopérer plusieurs machines compactes avec une faible latence, un atout pour coordonner des systèmes multi-agents. Le signal envoyé à l'industrie est clair: le matériel grand public d'Apple devient un maillon pertinent des infrastructures d'IA, une place qu'on ne lui prêtait pas en début d'année. Cette course aux composants illustre une dépendance de plus en plus intenable envers les puces spécialisées, sur un marché où la moindre nouveauté suscite déjà des ruptures de stock. C'est le cas des futurs PC équipés de puces NVIDIA RTX Spark, qui seraient déjà épuisés avant même leur commercialisation. Un autre exemple cité est la puce Grace-plus-Blackwell, coconçue par NVIDIA et MediaTek, gravée en 3 nanomètres chez TSMC, attendue à l'automne 2026 sous Windows sur architecture Arm, avec des systèmes haut de gamme N1x annoncés à partir d'environ 110 000 dollars taïwanais, soit près de 3 400 dollars. Dans ce contexte de pénurie généralisée, le recours massif d'OpenAI et d'Anthropic au matériel Apple apparaît moins comme une excentricité que comme une solution pragmatique pour continuer à faire progresser leurs modèles malgré la rareté des composants traditionnellement dédiés à l'IA.

UELa flambée mondiale des prix des composants mémoire pourrait indirectement renchérir le matériel IA pour les acteurs européens, mais aucune entreprise ou institution française n'est impliquée.

💬 Ce qui surprend, c'est justement le bon signal : OpenAI n'achète pas des Mac pour remplacer ses GPU, mais pour l'étape de fine-tuning et d'évaluation des agents, là où la mémoire unifiée d'Apple Silicon fait mouche. Ça dit surtout un truc simple : la pénurie de composants est en train de pousser les labos à réinventer leur stack matérielle avec ce qui traîne sur le marché, pas juste avec ce qui est prévu pour l'IA. Reste que si même du matos grand public devient stratégique, c'est que la tension sur les puces spécialisées est plus grave qu'on ne le dit.

InfrastructureActu
1 source
AWS reconnu leader dans le rapport Forrester Wave sur l'infrastructure IA (T4 2025)
Illustration générée par IA
29AWS ML Blog 

AWS reconnu leader dans le rapport Forrester Wave sur l'infrastructure IA (T4 2025)

AWS a été désigné Leader dans le rapport The Forrester Wave: AI Infrastructure Solutions, Q4 2025, publié par Forrester Research le 16 décembre 2025. Sur les 13 fournisseurs évalués, AWS a obtenu le score le plus élevé possible, 5,00 sur 5, dans 16 critères répartis entre deux catégories : l'offre actuelle (architecture, écosystème, gestion des données, entraînement, développement, gestion et opérations, tolérance aux pannes, efficacité, sécurité et scalabilité) et la stratégie (vision, innovation, feuille de route, écosystème de partenaires, flexibilité et transparence tarifaire). AWS a également obtenu le score le plus élevé de l'ensemble des candidats dans la catégorie Stratégie. L'infrastructure d'AWS repose sur deux familles de puces maison, Inferentia et Trainium, proposées en complément des instances GPU NVIDIA, permettant aux clients d'adapter le type de calcul à chaque charge de travail sans dépendre d'un seul fournisseur de matériel. Cette reconnaissance intervient alors que l'adoption de l'IA générative s'accélère et que les entreprises cherchent des infrastructures capables de couvrir tout le cycle de vie des modèles, de l'entraînement et du fine-tuning jusqu'à l'inférence à grande échelle. Pour les clients d'AWS, cela confirme la viabilité d'une stratégie hybride mêlant silicium propriétaire et GPU tiers, censée réduire les coûts tout en évitant le verrouillage fournisseur, un enjeu central pour les directions techniques qui redoutent de dépendre exclusivement de NVIDIA. Forrester souligne qu'AWS est particulièrement adapté aux entreprises ayant des charges d'inférence à fort volume ou élastiques, qui privilégient l'efficacité des coûts tout en gardant un accès aux GPU pour les pics de performance. Ce positionnement pèse directement sur les arbitrages budgétaires des équipes IA, entre coût, performance et flexibilité contractuelle. Le rapport Forrester s'inscrit dans un contexte de concurrence intense entre fournisseurs de cloud et d'infrastructure IA, où Microsoft Azure, Google Cloud, Oracle et des acteurs spécialisés comme CoreWeave rivalisent pour capter la demande en puissance de calcul liée aux grands modèles de langage. AWS met en avant ses partenariats avec les principaux développeurs de modèles de fondation, donnant à ses clients un accès direct à une diversité de modèles via des services comme Amazon Bedrock et Amazon SageMaker. Forrester précise agir en toute indépendance, sans recommander explicitement un fournisseur plutôt qu'un autre, les évaluations reflétant un jugement à un instant donné susceptible d'évoluer. La feuille de route d'AWS, jugée prometteuse par Forrester, laisse présager de nouveaux investissements dans le développement de silicium propriétaire et une intégration plus étroite avec ses services managés, dans une course où la maîtrise du matériel devient un facteur de différenciation stratégique aussi important que les modèles eux-mêmes.

InfrastructureActu
1 source
Pourquoi le data center traditionnel cède sa place aux AI Factories : l’exemple ChronoScale et Microsoft
Illustration générée par IA
30Le Big Data 

Pourquoi le data center traditionnel cède sa place aux AI Factories : l’exemple ChronoScale et Microsoft

Microsoft et la société d'infrastructure ChronoScale ont annoncé, le 27 août 2026, un partenariat portant sur le déploiement d'une capacité de 50 mégawatts dédiée au calcul accéléré en Amérique du Nord. Ce site doit accueillir des puces NVIDIA GB300 NVL72, la nouvelle génération d'architecture conçue pour l'entraînement et l'inférence des grands modèles de langage. L'annonce, relayée sur le compte X de ChronoScale (@ChronoScaleCorp), présente le projet comme une infrastructure "full stack" pensée pour la densité et la montée en charge. Contrairement à un centre de données classique où le stockage, le réseau et les serveurs sont gérés séparément, cette AI Factory intègre l'ensemble de la chaîne technique dans un même environnement optimisé. Le choix du refroidissement liquide s'impose de fait : les baies de serveurs dépassent désormais régulièrement 40 kilowatts, un seuil au-delà duquel le refroidissement à air ne suffit plus à évacuer la chaleur dégagée par les GPU. Un rapport de Gartner cité dans la couverture de l'accord confirme que cette bascule vers le liquide devient la norme pour les nouvelles installations d'IA générative, tandis qu'une analyse de Forbes pointe les limites physiques des salles climatisées à air face aux puces les plus récentes. Cet accord illustre un changement de modèle pour l'ensemble de l'industrie du cloud : même un acteur aussi intégré que Microsoft, qui opère ses propres centres Azure, choisit de s'associer à un spécialiste tiers de l'infrastructure haute densité plutôt que de tout construire en interne. Pour les directeurs des systèmes d'information, cela signifie que les data centers construits avant l'ère des modèles génératifs risquent de devenir rapidement inadaptés, faute de pouvoir accueillir les nouvelles générations de GPU sans révision complète du refroidissement, de l'alimentation électrique et du génie civil. La rationalisation des dépenses en capital devient un enjeu central : Microsoft met en avant, sur son blog Azure, la nécessité d'optimiser le coût par unité de calcul pour rentabiliser des projets d'IA toujours plus gourmands en énergie et en matériel. Pour les entreprises clientes du cloud, cette évolution devrait se traduire par une meilleure disponibilité de capacité de calcul dense, mais aussi par une dépendance accrue envers un nombre restreint de fournisseurs capables de construire ces usines à calcul spécialisées. Cette mutation s'inscrit dans une course plus large où les fournisseurs de cloud, confrontés à une demande explosive pour l'entraînement et le déploiement de modèles toujours plus volumineux, doivent revoir leurs choix d'infrastructure au même rythme que les fabricants de puces publient de nouvelles architectures. NVIDIA, avec ses générations successives de GPU comme le GB300 NVL72, impose de facto ses propres exigences techniques aux opérateurs de data centers, qui doivent s'y adapter sous peine de ne plus pouvoir héberger les charges de travail les plus avancées. ChronoScale se positionne ainsi comme l'un des acteurs spécialisés capables d'absorber cette complexité pour le compte des géants du cloud, un rôle que d'autres sociétés d'infrastructure chercheront probablement à occuper dans les mois à venir. Le pari, pour Microsoft comme pour ses concurrents, consiste à sécuriser suffisamment de capacité de calcul dense pour ne pas freiner le développement de leurs services d'IA, tout en évitant que les coûts de construction et d'exploitation de ces nouvelles usines ne finissent par peser sur la rentabilité des offres proposées aux entreprises.

💬 Le refroidissement liquide n'est plus une option premium, c'est devenu le prérequis d'entrée pour héberger du GB300. Ce qui me frappe surtout, c'est ce que ça dit en creux : même Microsoft, qui a les moyens et l'expertise pour tout construire seul, préfère sous-traiter la complexité à un spécialiste comme ChronoScale. Ça veut dire une chose simple pour les DSI, un data center pensé avant 2023 ne pourra pas accueillir cette génération de puces sans tout casser, et la capacité de calcul dense va se concentrer entre les mains de quelques acteurs qui savent la construire.

InfrastructureActu
1 source
Anthropic et MatX : des puces IA sur-mesure pour réduire la facture de Claude
Illustration générée par IA
31Le Big Data 

Anthropic et MatX : des puces IA sur-mesure pour réduire la facture de Claude

Anthropic a mené des discussions pour racheter MatX, une jeune pousse spécialisée dans les semi-conducteurs, pour un montant d'environ 7 milliards de dollars, avant de réorienter ces échanges vers un simple partenariat, selon des informations relayées par Reuters le 27 août 2026. Fondée par d'anciens ingénieurs de l'unité TPU de Google, MatX cherche actuellement à lever des fonds sur la base d'une valorisation de 4 milliards de dollars. L'objectif de ce rapprochement est d'accélérer la conception de puces IA sur-mesure, optimisées spécifiquement pour la famille de modèles Claude, en s'appuyant sur une approche de co-design matériel-logiciel plutôt que sur des processeurs graphiques génériques. En parallèle, Anthropic a recruté des figures clés du secteur pour bâtir une équipe interne dédiée au silicium, notamment Amir Salek, ancien cadre de Google, et Clive Chan, ex-ingénieur silicium chez OpenAI. L'entreprise prévoit par ailleurs d'engager 36 milliards de dollars auprès des géants du cloud pour sécuriser sa puissance de calcul. Cette stratégie répond à un problème économique très concret : l'entraînement et l'inférence des grands modèles de langage génèrent des coûts informatiques considérables, et les puces génériques souffrent souvent de blocages mémoire et d'une surconsommation électrique inutile. En concevant des circuits ASIC taillés pour ses propres algorithmes, Anthropic vise une réduction significative du coût par million de tokens traités, ce qui pourrait se traduire par des tarifs API plus stables et plus compétitifs pour ses clients entreprises. Pour les décideurs technologiques qui suivent de près les budgets FinOps liés à l'IA, la maîtrise de la couche matérielle devient un levier direct de marge et de prévisibilité tarifaire. C'est aussi un signal envoyé au marché : la firme prépare une introduction en bourse avec un objectif de chiffre d'affaires de 200 milliards de dollars d'ici 2028, et le contrôle de son infrastructure de calcul est présenté comme un pilier central de cette rentabilité future. Le renoncement à un rachat direct au profit d'un partenariat plus flexible illustre une gestion prudente des risques financiers, sachant que la conception de matériel dédié coûte des centaines de millions de dollars par génération et nécessite plusieurs années de développement. Cette démarche s'inscrit dans une tendance plus large de l'industrie, où les grands laboratoires d'IA cherchent à réduire leur dépendance aux fournisseurs de GPU génériques comme Nvidia en développant leurs propres puces, à l'image de ce que Google a fait avec ses TPU. Anthropic adopte toutefois une approche hybride, combinant recrutement interne, partenariats ciblés avec des startups comme MatX, et maintien d'engagements massifs auprès des géants du cloud, plutôt qu'un pari isolé sur une seule filière technologique. Les suites possibles incluent la concrétisation ou non de ce partenariat avec MatX, ainsi que d'éventuelles annonces supplémentaires liées à la préparation de l'introduction en bourse d'Anthropic.

UEAucun impact direct, mais une éventuelle baisse des couts API pourrait a terme profiter aux entreprises européennes clientes de Claude.

💬 Sur le papier, renoncer au rachat pour un simple partenariat, ça ressemble à un lot de consolation. En vrai c'est plus malin : concevoir de l'ASIC sur-mesure coûte des centaines de millions par génération, alors Anthropic garde ses options ouvertes plutôt que de miser tout sur un seul pari matériel. Ce qui compte vraiment ici, c'est que la maîtrise du silicium devient le vrai levier de marge des labos IA, pas les modèles eux-mêmes, et ça va redessiner qui peut se permettre de vendre du Claude pas cher dans deux ans.

InfrastructureActu
1 source
OpenAI et ses rivaux achètent des dizaines de milliers de Mac mini pour entraîner des agents autonomes
Illustration générée par IA
32The Decoder 

OpenAI et ses rivaux achètent des dizaines de milliers de Mac mini pour entraîner des agents autonomes

OpenAI a acheté des dizaines de milliers de Mac mini et de Mac Studio afin d'entraîner ses agents capables d'utiliser un ordinateur, selon des informations rapportées par The Information. Anthropic s'appuie également sur du matériel Apple pour des besoins similaires. La demande pour ces machines est telle que les modèles les plus puissants sont en rupture de stock depuis plusieurs mois. Cette ruée profite directement à Apple : les revenus tirés des Mac ont bondi de près de 29 % au cours du trimestre clos en juin, atteignant 10,4 milliards de dollars. Cet engouement révèle un changement de fond dans la manière dont les laboratoires d'intelligence artificielle entraînent leurs modèles. Les agents dits "computer-use", conçus pour naviguer et manipuler directement une interface graphique comme le ferait un humain, nécessitent un entraînement sur du matériel qui reproduit fidèlement l'environnement réel dans lequel ils opéreront, à savoir des ordinateurs de bureau classiques. Le fait que des acteurs aussi puissants qu'OpenAI et Anthropic se tournent vers du matériel grand public plutôt que vers des infrastructures serveurs spécialisées illustre à quel point cette catégorie d'agents devient stratégique, et laisse entrevoir une compétition accrue pour s'approprier de tels environnements de test à grande échelle. Cette tendance s'inscrit dans la course plus large que se livrent les grands laboratoires d'IA pour développer des agents autonomes capables d'accomplir des tâches complexes sur un ordinateur, un domaine où OpenAI et Anthropic rivalisent déjà avec leurs propres offres d'agents. Apple, longtemps perçue comme en retrait dans la course à l'IA générative, se retrouve ainsi bénéficiaire indirect de cette compétition, ses machines devenant un outil d'infrastructure recherché par ses concurrents technologiques. Reste à savoir si cette dépendance au matériel Apple perdurera à mesure que les besoins d'entraînement des agents s'intensifieront, ou si des solutions alternatives, voire des partenariats matériels dédiés, émergeront pour répondre à cette demande croissante.

InfrastructureActu
1 source
Infrastructure IA : a16z lève 1,1 milliard de dollars pour franchir le mur physique des datacenters
Illustration générée par IA
33Le Big Data 

Infrastructure IA : a16z lève 1,1 milliard de dollars pour franchir le mur physique des datacenters

La société de capital-risque Andreessen Horowitz a annoncé le 28 août 2026 la création du Machine Age Fund, un véhicule d'investissement doté de 1,1 milliard de dollars et entièrement consacré aux contraintes matérielles de l'intelligence artificielle. Ce fonds cible en priorité les goulots d'étranglement physiques des centres de données : puces personnalisées de type ASIC, équipements réseau optiques et systèmes de conversion d'énergie, notamment la transition vers du courant continu 800 volts. Sa gouvernance s'appuie sur d'anciens dirigeants d'Intel et de VMware, un choix qui souligne la volonté d'a16z de peser directement sur la pile matérielle plutôt que sur les seules applications logicielles. Le fonds soutient déjà plusieurs sociétés spécialisées, dont Unconventional AI, Nexthop et Volta. Selon les données citées par a16z, la part des investissements du fonds consacrée au matériel dépasse désormais 20 %, contre une proportion marginale il y a trois ans à peine, un basculement qui illustre l'ampleur du virage stratégique opéré par la firme. Ce mouvement traduit une réalité opérationnelle de plus en plus pressante pour les directeurs des systèmes d'information : la puissance de calcul brute ne suffit plus si elle ne peut être alimentée ni refroidie. Le passage des serveurs Nvidia H100 à l'architecture Rubin multiplie par 28 la densité énergétique par baie, faisant passer la consommation d'un rack classique de 5 à 10 kilowatts à environ 250 kilowatts aujourd'hui, avec des projections atteignant 1 mégawatt par rack d'ici trois ans. Une étude d'Enterprise DNA évalue déjà l'écart entre une demande projetée de 44 gigawatts et une capacité réseau limitée à 25 gigawatts d'ici 2028, un déficit qui menace directement la croissance du secteur. Pour les entreprises qui déploient des projets d'IA, cela signifie que la sécurisation de capacités électriques et de refroidissement fermes devient un enjeu financier aussi central que le choix des modèles eux-mêmes. Ce virage s'inscrit dans un contexte où la course à l'infrastructure IA a déplacé la compétition technologique du code vers le béton, le cuivre et l'électricité. Les analyses de Value Add VC pointent une pénurie de mémoire à haute bande passante (HBM) et des limites du refroidissement liquide qui freinent une demande en croissance à trois chiffres, tandis que le câblage en cuivre atteint ses limites physiques pour les interconnexions internes. En misant sur des start-up spécialisées dans l'énergie et le réseau plutôt que sur de nouveaux modèles d'IA, Andreessen Horowitz parie que la prochaine bataille concurrentielle se jouera sur la capacité des acteurs à construire et alimenter des infrastructures physiques suffisamment denses et fiables pour soutenir la demande de calcul des années à venir.

UELes tensions sur la capacité électrique et le refroidissement des datacenters IA que le fonds cible concernent aussi les opérateurs européens, confrontés aux mêmes contraintes de densité énergétique.

InfrastructureOpinion
1 source
Comment Apple est arrivé au succès du Mac dans le matériel IA, presque par hasard
Illustration générée par IA
34The Information AI 

Comment Apple est arrivé au succès du Mac dans le matériel IA, presque par hasard

Les Mac mini et Mac Studio d'Apple, deux ordinateurs sans écran ni clavier destinés aux professionnels, connaissent une demande qui a dépassé les prévisions internes d'Apple, au point que leur lancement a été avancé, juste avant celui des nouveaux iPhone. Ces machines se révèlent particulièrement adaptées à l'exécution d'agents IA, des logiciels capables de gérer des tâches en plusieurs étapes comme l'édition et le test de code, l'automatisation du tri des e-mails ou la synthèse de documents. Elles séduisent aussi les développeurs d'IA qui cherchent à réduire leurs factures de cloud en entraînant et en exécutant leurs modèles directement en local. Résultat concret sur les chiffres : au dernier trimestre clos en juin, les ventes de Mac ont bondi de près de 29% sur un an, pour atteindre 10,4 milliards de dollars, la progression la plus rapide de tous les segments de produits d'Apple. Cette poussée de popularité illustre un phénomène plus large: l'essor de l'IA locale redessine la demande matérielle, au bénéfice d'ordinateurs conçus à l'origine pour d'autres usages. Pour les entreprises et les développeurs, faire tourner des modèles directement sur des machines personnelles plutôt que sur des serveurs distants permet de réduire les coûts, de gagner en confidentialité des données et de limiter la dépendance aux fournisseurs de cloud. Pour Apple, c'est une aubaine inattendue: sans avoir conçu ces machines spécifiquement pour l'IA générative, l'entreprise se retrouve avec des produits plébiscités par une nouvelle catégorie d'acheteurs techniques, ce qui vient diversifier ses sources de croissance à un moment où l'iPhone reste son produit dominant mais peu porté par l'actualité de l'IA. Ce succès s'inscrit dans un contexte où la puissance de calcul locale devient un enjeu stratégique face à la montée en puissance des agents autonomes et des grands modèles de langage, que les développeurs veulent pouvoir exécuter sans dépendre systématiquement d'infrastructures cloud coûteuses. Apple profite ainsi indirectement d'une tendance de fond portée par des acteurs comme les fournisseurs de modèles open source et les plateformes cloud concurrentes, sans avoir eu besoin de repositionner sa gamme Mac. Reste à savoir si l'entreprise capitalisera davantage sur cette dynamique avec du matériel ou des puces spécifiquement pensés pour l'inférence IA locale, alors que la demande pour ce type d'usage semble appelée à se renforcer.

💬 Apple n'a rien vu venir, et c'est justement ça le plus révélateur : le Mac mini et le Mac Studio deviennent des best-sellers parce qu'ils sont bons pour tourner des modèles en local, pas parce qu'Apple les a conçus pour ça. Résultat, +29% sur les ventes Mac en un trimestre, portées par des devs qui veulent juste arrêter de payer des factures cloud à faire tourner leurs agents. Le vrai signal, c'est que la demande pour du calcul IA local existe déjà et cherche du matériel, peu importe qui le fabrique, reste à voir si Apple va enfin sortir une puce pensée pour l'inférence plutôt que de profiter du hasard.

InfrastructureOpinion
1 source
Répartir la charge : comment Salesforce assure la haute disponibilité multi-AZ avec les composants d'inférence SageMaker
Illustration générée par IA
35AWS ML Blog 

Répartir la charge : comment Salesforce assure la haute disponibilité multi-AZ avec les composants d'inférence SageMaker

Salesforce a déployé Amazon SageMaker AI Inference Components (IC) pour faire tourner Agentforce, sa plateforme d'agents IA, avec une disponibilité multi-zone (Multi-AZ). Cette technologie permet d'héberger plusieurs modèles sur des GPU partagés et a permis à Salesforce de réduire ses coûts d'infrastructure d'un facteur 8. Mais l'algorithme de placement par défaut des IC optimise chaque déploiement indépendamment, sans tenir compte de l'équilibrage entre zones de disponibilité (AZ), ce qui pouvait laisser des copies d'un même modèle concentrées sur une seule instance ou une seule AZ. Or Salesforce impose en interne un support obligatoire sur au moins deux AZ pour tout modèle en production. Pour résoudre ce problème, l'équipe a utilisé le nouveau paramètre SchedulingConfig de l'API CreateInferenceComponent d'AWS, avec ses sous-paramètres AvailabilityZoneBalance et PlacementStrategy. Dans un exemple concret cité dans l'article, un modèle nommé "salesforce-einstein-llm-v2" est déployé avec 4 copies réparties sur un endpoint de 4 instances, 2 par AZ, grâce à la stratégie SPREAD et un paramètre MaxImbalance limité à 1 copie d'écart maximum entre zones. Cette avancée technique répond à un enjeu de résilience critique pour les entreprises qui déploient des modèles d'IA à grande échelle en production. Sans répartition équilibrée entre zones, une panne d'instance ou d'une AZ entière peut rendre un modèle totalement indisponible, un risque inacceptable pour des systèmes d'agents IA utilisés en contexte commercial comme Agentforce. En donnant aux utilisateurs un contrôle fin sur le placement des copies de modèles, AWS permet aux entreprises de concilier deux objectifs jusque-là difficiles à combiner : l'efficacité économique du partage de GPU entre plusieurs modèles, et les exigences de conformité et de continuité de service propres aux environnements de production critiques. Ce type de garantie devient un critère de choix pour les grands comptes qui évaluent les plateformes cloud pour héberger leurs charges de travail d'inférence IA. Ce développement s'inscrit dans la montée en puissance des architectures d'inférence mutualisées, où plusieurs modèles partagent les mêmes ressources GPU pour réduire les coûts, une tendance née de la pression économique croissante liée au déploiement de grands modèles de langage. Les Inference Components de SageMaker avaient déjà permis à des entreprises comme Salesforce de réaliser des économies substantielles, mais la gestion fine de la haute disponibilité restait un point faible face aux exigences de conformité des grandes organisations. En ouvrant le paramétrage du placement des copies aussi bien à l'échelle des instances qu'à celle des zones de disponibilité, AWS renforce sa position face à d'autres fournisseurs cloud sur le segment de l'infrastructure IA d'entreprise. La capacité à gérer dynamiquement le scaling tout en préservant l'équilibre entre zones laisse présager d'autres affinements à venir, à mesure que les entreprises industrialisent leurs déploiements d'agents IA et exigent des garanties de service toujours plus strictes.

UELes entreprises européennes déployant des modèles IA sur AWS SageMaker pourraient utiliser cette nouvelle fonctionnalité pour améliorer la résilience de leurs infrastructures, sans impact réglementaire direct sur la France ou l'UE.

💬 La vraie info c'est pas les 8x d'économies, c'est le SchedulingConfig qui force le SPREAD entre AZ. Sans ça, tu partages tes GPU pour payer moins cher et tu recrées exactement le point de panne unique que le multi-AZ était censé éliminer. C'est le genre de détail d'API qui décide si Agentforce tient debout un vendredi soir ou pas, et ça va devenir un critère de sélection cloud pour les grands comptes bien avant les benchmarks de perf.

InfrastructureTuto
1 source
AWS et NVIDIA dopent le Big Data : une nouvelle ère de performance pour vos pipelines IA
Illustration générée par IA
36Le Big Data 

AWS et NVIDIA dopent le Big Data : une nouvelle ère de performance pour vos pipelines IA

Amazon Web Services et NVIDIA ont annoncé le 26 août 2026 une extension majeure de leur collaboration stratégique, avec le déploiement de deux millions de GPU NVIDIA supplémentaires sur l'infrastructure mondiale d'AWS d'ici 2028, dans la continuité de seize années de coopération entre les deux groupes. Au delà de la puissance brute destinée à l'entraînement des modèles, l'annonce porte surtout sur l'intégration native des bibliothèques logicielles NVIDIA cuDF et cuVS au sein d'Amazon EMR et d'Amazon OpenSearch. Sur les nouvelles instances EC2 G7, les traitements ETL sous Apache Spark s'exécutent jusqu'à 3,7 fois plus vite qu'avec des configurations CPU classiques, pour un coût de calcul réduit de 30 %, sans qu'il soit nécessaire de modifier une seule ligne de code Spark existant. Côté bases de données vectorielles, la suite cuVS permet de délester la construction des index sur des GPU dédiés au sein d'Amazon OpenSearch, portant la vitesse d'indexation jusqu'à neuf fois supérieure pour un quart du coût initial. Ces capacités sont accessibles via OpenSearch Serverless ainsi que via les clusters Amazon EMR et EKS. Cette évolution cible un maillon souvent négligé des projets d'intelligence artificielle : la préparation et l'indexation des données en amont, plutôt que le seul entraînement des grands modèles de langage. Pour les entreprises qui déploient des architectures RAG ou des applications agentiques, la gestion de milliards de vecteurs et les cycles de rafraîchissement des données constituent un goulot d'étranglement opérationnel et financier majeur. En réduisant drastiquement les temps de traitement, AWS et NVIDIA permettent de remplacer des cycles d'indexation nocturnes, qui pouvaient durer plusieurs jours, par des flux de données mis à jour en continu. Pour les directions informatiques, cela change la logique de calcul du coût total de possession : même si le tarif horaire d'une instance GPU dépasse celui d'un serveur CPU classique, la baisse du temps d'exécution rend la facture par traitement plus faible et plus prévisible. Cette annonce s'inscrit dans une course plus large à l'infrastructure IA, où AWS, Microsoft Azure et Google Cloud investissent massivement dans les capacités GPU pour répondre à l'explosion des volumes de données générés par l'IA générative et les agents autonomes. En misant sur une accélération matérielle transparente, qui ne requiert aucune refonte applicative, AWS et NVIDIA cherchent à lever un frein concret à l'adoption de pipelines IA à grande échelle. La montée en puissance annoncée jusqu'en 2028 laisse présager de nouvelles intégrations logicielles similaires sur d'autres services AWS dans les mois à venir.

💬 Deux millions de GPU d'ici 2028, on retient le chiffre, mais le vrai move est ailleurs : cuDF et cuVS intégrés nativement dans EMR et OpenSearch, sans toucher au code Spark existant. C'est ça le signal à suivre, pas l'entraînement des LLM : l'indexation vectorielle passe de la nuit entière à du continu, et ça déplace le vrai goulot d'étranglement des architectures RAG, qui n'a jamais été le modèle mais la donnée en amont. Reste à voir si le 3,7x annoncé tient sur des pipelines Spark bien crades en prod, parce que les benchmarks constructeur adorent les cas propres.

InfrastructureActu
1 source
L'inférence multi-régions Inde pour les modèles OpenAI GPT-5.6 arrive sur Amazon Bedrock
Illustration générée par IA
37AWS ML Blog 

L'inférence multi-régions Inde pour les modèles OpenAI GPT-5.6 arrive sur Amazon Bedrock

Amazon Web Services a annoncé la disponibilité des modèles OpenAI GPT-5.6, baptisés Terra et Luna, sur Amazon Bedrock en Inde, via un mécanisme d'inférence inter-régions limité au territoire indien. Le trafic est désormais réparti entre les régions AWS de Mumbai (ap-south-1) et de Hyderabad (ap-south-2), sans jamais quitter le pays. Les deux modèles disposent d'une fenêtre de contexte d'un million de tokens, acceptent du texte et des images en entrée et produisent du texte en sortie, ce qui permet de traiter en une seule requête de longs documents, des bases de code volumineuses ou des contenus mixtes texte-image. AWS met à disposition deux profils d'inférence dédiés, in.openai.gpt-5.6-terra et in.openai.gpt-5.6-luna, accessibles via l'API Responses d'OpenAI, l'API Chat Completions d'OpenAI et l'API Converse native d'Amazon Bedrock, avec le point de terminaison bedrock-runtime recommandé pour les nouvelles applications. La facturation et les quotas restent rattachés à la région source de l'appel, tandis que les journaux Amazon CloudWatch et AWS CloudTrail sont conservés uniquement dans cette même région. Cette annonce répond directement aux exigences de résidence des données qui pèsent sur des secteurs fortement réglementés comme les services financiers, la santé et le secteur public en Inde, où le traitement des informations sensibles doit rester sur le territoire national. En permettant de répartir la charge entre deux régions indiennes plutôt que de dépendre de la seule capacité de Mumbai, AWS offre aux entreprises locales un moyen de maintenir des performances stables lors des pics de trafic tout en respectant la conformité réglementaire, un point souvent bloquant pour l'adoption de grands modèles de langage américains dans ces industries. C'est aussi un signal de la montée en puissance de l'Inde comme marché stratégique pour l'intelligence artificielle générative, avec une infrastructure cloud pensée pour répondre aux contraintes souverraines locales plutôt qu'à une architecture mondiale unique. Ce lancement s'inscrit dans la stratégie plus large de cross-Region inférence d'Amazon Bedrock, un mécanisme purement capacitaire qui mutualise la puissance de calcul entre plusieurs régions AWS pour absorber la demande, indépendamment de la localisation choisie par les clients. Bedrock propose également une version mondiale de ce mécanisme, avec des profils préfixés global., qui route les requêtes vers l'ensemble des régions commerciales AWS pour maximiser la capacité disponible, contrairement à l'option indienne strictement cantonnée au pays. Sur le plan de la sécurité, Amazon Bedrock applique par défaut un modèle de rétention zéro des données, à l'exception des contenus signalés par les systèmes automatisés de détection d'abus, conservés à des fins d'analyse. Cette architecture régionale pourrait préfigurer des déploiements similaires dans d'autres marchés soumis à des contraintes de souveraineté numérique comparables.

InfrastructureActu
1 source
OpenAI arrive sur Amazon Bedrock pour l'inférence locale en Inde
Illustration générée par IA
38AWS ML Blog 

OpenAI arrive sur Amazon Bedrock pour l'inférence locale en Inde

Amazon a annoncé l'arrivée des modèles OpenAI GPT-5.6, nommés Terra et Luna, sur Amazon Bedrock en Inde, avec une inférence cross-régionale limitée au territoire indien. Ce dispositif s'appuie sur deux régions AWS, Mumbai (ap-south-1) et Hyderabad (ap-south-2), entre lesquelles les requêtes sont automatiquement réparties pour absorber les pics de charge sans que le client ait à gérer lui-même la capacité région par région. Les deux modèles disposent d'une fenêtre de contexte d'un million de tokens, acceptent des entrées texte et image, et produisent du texte en sortie, ce qui permet de traiter en une seule requête de longs documents, des bases de code volumineuses ou des contenus mixtes. L'accès se fait via deux profils d'inférence dédiés, in.openai.gpt-5.6-terra et in.openai.gpt-5.6-luna, appelables depuis la console Amazon Bedrock ou par code, en utilisant l'API OpenAI Responses, l'API OpenAI Chat Completions ou l'API Amazon Bedrock Converse. Cette offre cible en priorité les secteurs soumis à des contraintes strictes de résidence des données, comme la finance, la santé et le secteur public en Inde, qui doivent garantir que leurs données ne quittent jamais le territoire national. En gardant le traitement des requêtes confiné entre Mumbai et Hyderabad, Amazon permet à ces organisations d'exploiter des modèles OpenAI de pointe à grande échelle tout en respectant leurs obligations réglementaires locales, sans sacrifier le débit ni la disponibilité en période de forte demande. La facturation et le suivi des quotas restent rattachés à la région source du compte, et les journaux Amazon CloudWatch et AWS CloudTrail sont conservés dans cette même région, ce qui simplifie la supervision pour les équipes de conformité. Amazon Bedrock applique par ailleurs un modèle de rétention nulle des données par défaut, à l'exception des contenus signalés par ses classificateurs automatiques de détection d'abus. Cette annonce s'inscrit dans la stratégie plus large d'Amazon Web Services visant à répondre aux exigences croissantes de souveraineté numérique dans les marchés émergents, où l'Inde constitue un enjeu majeur du fait de sa réglementation sur la localisation des données sensibles. Elle illustre aussi l'approfondissement du partenariat entre Amazon et OpenAI, dont les modèles rejoignent ceux d'Anthropic déjà disponibles sur la plateforme Bedrock via des API compatibles. Pour les nouvelles applications, Amazon recommande désormais le point de terminaison bedrock-runtime, qui centralise les API natives Bedrock, les API compatibles OpenAI et l'API Anthropic Messages, ainsi que des fonctionnalités comme les garde-fous et le routage intelligent des prompts. Amazon Bedrock propose également une inférence cross-régionale mondiale pour les charges nécessitant une capacité maximale au-delà des frontières indiennes, laissant aux entreprises le choix entre performance globale et confinement strict des données selon leurs besoins réglementaires.

InfrastructureActu
1 source
Réduire de 75% les coûts d'inférence ASR sur Amazon EC2 grâce à NVIDIA MPS
Illustration générée par IA
39AWS ML Blog 

Réduire de 75% les coûts d'inférence ASR sur Amazon EC2 grâce à NVIDIA MPS

Heidi Health, une plateforme d'IA dédiée aux soins cliniques active dans 190 pays et traitant plus de 2,4 millions de consultations médicales par semaine, a collaboré avec AWS et NVIDIA pour résoudre un problème coûteux d'inférence en reconnaissance vocale automatique (ASR). L'entreprise utilise le modèle Parakeet TDT 0.6B V2 de NVIDIA, affiné pour la transcription clinique, mais chaque requête d'inférence n'exploitait que 15 à 20 % de la puissance de calcul d'un GPU NVIDIA L40S, doté de 142 processeurs de flux (SM). Le mécanisme par défaut de time-slicing de CUDA imposait un accès séquentiel aux GPU, laissant jusqu'à 80 % du matériel inactif et limitant chaque carte à environ 62 requêtes par seconde tout en respectant une latence stricte, inférieure à 650 millisecondes en moyenne et à 1 seconde au 99e percentile. Pour absorber les pics de trafic sans dépasser ce seuil, Heidi devait exploiter 16 instances GPU en production. En combinant le service NVIDIA CUDA Multi-Process Service (MPS) avec le serveur d'inférence NVIDIA Triton sur des instances GPU Amazon EC2, les équipes ont réduit ce besoin à seulement 4 GPU, une baisse de 75 %, tout en maintenant la latence sous la seconde à 92,1 requêtes par seconde par carte. Cette optimisation illustre un enjeu central pour l'industrie de l'IA appliquée à la santé : la capacité à réduire drastiquement les coûts d'infrastructure sans dégrader la qualité de service en temps réel. Pour un acteur comme Heidi Health, qui doit garantir une transcription quasi instantanée des consultations médicales à l'échelle mondiale, diviser par quatre le nombre de GPU nécessaires représente une économie substantielle sur les dépenses cloud, tout en libérant des ressources matérielles pour absorber la croissance du volume de consultations. Plus largement, cette approche montre que de nombreuses charges de travail d'inférence légères, comme l'ASR, sous-exploitent structurellement le matériel GPU haut de gamme, un constat qui pourrait s'appliquer à d'autres entreprises confrontées à des coûts d'inférence élevés pour des modèles de taille modeste. Techniquement, la solution s'appuie sur trois mécanismes de partage GPU disponibles chez NVIDIA : le time-slicing par défaut, le MIG (Multi-Instance GPU) qui crée des partitions physiques rigides, et le MPS, qui fait transiter tous les processus par un contexte GPU unique géré par un démon, permettant une exécution concurrente de noyaux CUDA sans modification de code. Heidi et NVIDIA avaient déjà documenté, dans un article précédent, l'affinage du modèle Parakeet pour la reconnaissance vocale clinique ; ce nouveau travail se concentre sur l'étape suivante, le service du modèle en production, combinée à des optimisations au niveau du modèle via ONNX et TensorRT ainsi qu'à un ordonnancement des requêtes géré par Triton.

UELes entreprises européennes déployant de l'IA sur des instances GPU AWS pourraient appliquer la même technique NVIDIA MPS pour réduire leurs couts d'inférence, mais aucune entité française ou européenne n'est directement impliquée ici.

💬 Diviser par quatre le nombre de GPU pour la même charge, ça change vraiment le calcul économique de l'ASR médical. Le vrai enseignement, c'est que la plupart des charges d'inférence légères tournent à 15-20% d'un GPU haut de gamme sans que personne s'en occupe, MPS n'a rien de nouveau mais quasiment personne ne le configure en prod. Reste à voir si Heidi tient cette latence sous la seconde quand le volume de consultations doublera encore.

InfrastructureActu
1 source
« Deux ans et demi pour autoriser un data center IA en France » : le patron d’Iliad (Free) veut aller plus vite
Illustration générée par IA
40Numerama 

« Deux ans et demi pour autoriser un data center IA en France » : le patron d’Iliad (Free) veut aller plus vite

Iliad, le groupe fondé par Xavier Niel et maison mère de Free, a présenté ses résultats semestriels le 27 août 2026 et en a profité pour dresser un bilan de ses activités liées à l'intelligence artificielle. Le groupe n'a pas souhaité communiquer de chiffres précis concernant ses filiales Scaleway, spécialisée dans le cloud, et Kyutai, son laboratoire de recherche en IA. Il revendique toutefois une croissance de 50 % sur son activité cloud. À cette occasion, le patron d'Iliad a surtout voulu alerter sur un frein majeur à son développement dans l'IA : selon lui, l'entreprise dispose déjà des terrains nécessaires pour construire de nouveaux data centers dédiés à l'intelligence artificielle, mais l'administration française met environ deux ans et demi à délivrer les autorisations requises. Ce délai administratif pose un problème concret de compétitivité pour l'industrie française du cloud et de l'IA. Alors que la course mondiale aux infrastructures de calcul s'intensifie, avec des investissements massifs aux États-Unis et en Chine, un temps d'attente aussi long pour ouvrir un data center peut faire perdre à la France des opportunités d'investissement et de positionnement stratégique. Pour des acteurs comme Scaleway, qui cherchent à répondre rapidement à la demande croissante de puissance de calcul pour l'entraînement de modèles d'IA, cette lenteur administrative représente un désavantage direct face à des pays capables d'accorder ces autorisations plus rapidement. Cette sortie s'inscrit dans un débat plus large sur la capacité de la France et de l'Europe à retenir les investissements dans les infrastructures numériques stratégiques, dans un contexte où la souveraineté technologique est devenue un enjeu politique majeur. Iliad, via Scaleway et Kyutai, cherche à se positionner comme une alternative européenne face aux géants américains du cloud et de l'IA. La prise de parole du dirigeant pourrait s'interpréter comme une pression exercée sur les pouvoirs publics pour accélérer les procédures administratives, dans un secteur où la rapidité de déploiement des capacités de calcul conditionne directement la compétitivité des entreprises.

UELe délai administratif de deux ans et demi pour autoriser un data center IA freine directement la compétitivité de l'industrie française du cloud face aux Etats-Unis et à la Chine.

InfrastructureActu
1 source
L'IA transforme la conception des puces, star de la conférence Hot Chips cette année
Illustration générée par IA
41The Information AI 

L'IA transforme la conception des puces, star de la conférence Hot Chips cette année

Lors de la conférence Hot Chips, qui s'est tenue cette semaine à Palo Alto, en Californie, ingénieurs, chercheurs et startups ont mis en avant un thème central : l'intelligence artificielle accélère désormais la conception des puces électroniques. OpenAI a expliqué que son nouveau processeur Jalapeño, qu'elle présente comme plus performant que les puces Blackwell de Nvidia pour l'inférence, doit une partie de ses qualités à ses modèles internes Sol et Astra, utilisés pour assister le processus de conception matérielle et logicielle. De son côté, l'équipe chargée des processeurs tensoriels (TPU) de Google a attribué aux chercheurs de DeepMind l'utilisation de l'IA pour rendre la dernière génération, le TPU v8, à la fois 6% plus économe en énergie et 6% plus puissante. Nvidia mise également depuis longtemps sur l'IA pour la conception de puces, via une série de bibliothèques logicielles appliquées à des tâches allant du calcul des motifs de gravure des circuits jusqu'à l'optimisation des flux de données entre les millions de composants microscopiques d'une puce. La startup Agentrys a par ailleurs annoncé mercredi une levée de fonds de 25 millions de dollars pour développer des agents IA capables d'automatiser la conception de puces. Cette évolution marque un tournant potentiel pour toute l'industrie des semi-conducteurs, où la conception de puces reste un processus long, coûteux et complexe, mobilisant des équipes d'ingénieurs pendant des mois. Si l'IA parvient à raccourcir ces cycles tout en améliorant les performances énergétiques, comme le montrent les gains de 6% annoncés par Google, cela pourrait accélérer le rythme d'innovation matérielle nécessaire pour répondre à la demande croissante en puissance de calcul liée à l'IA elle-même, créant une boucle où les modèles d'IA conçoivent les puces qui font tourner la génération suivante de modèles. Cette dynamique s'inscrit dans une course plus large entre grands acteurs technologiques pour internaliser la conception de semi-conducteurs et réduire leur dépendance aux cycles de développement traditionnels. Mark Ren, PDG d'Agentrys et ancien responsable de l'automatisation de la conception chez Nvidia pendant dix ans, estime que l'avenir du secteur reposera sur des systèmes agentiques suffisamment puissants pour concevoir des puces de manière quasi autonome, du début à la fin du processus, laissant entrevoir une transformation profonde des méthodes de travail des ingénieurs en semi-conducteurs dans les années à venir.

InfrastructureActu
1 source
Mac Studio M5 Max-Ultra ou Mac mini M6 : peut-on vraiment remplacer son abonnement Claude ou Codex ?
Illustration générée par IA
42Frandroid 

Mac Studio M5 Max-Ultra ou Mac mini M6 : peut-on vraiment remplacer son abonnement Claude ou Codex ?

Apple présente désormais sa gamme Mac comme une alternative matérielle aux abonnements d'intelligence artificielle en ligne, avec des configurations allant du Mac mini M6 à 1 049 euros jusqu'au Mac Studio M5 Max-Ultra pouvant dépasser 60 000 euros. Le point commun de ces machines est leur mémoire unifiée, qui peut atteindre 512 Go sur les configurations les plus poussées, permettant théoriquement de charger localement des modèles de langage ouverts de grande taille, comme ceux des familles Llama ou DeepSeek, sans passer par les serveurs d'OpenAI ou d'Anthropic. Une vérification concrète de ce que chaque machine peut réellement faire tourner, en tenant compte de la bande passante mémoire et de la vitesse de génération, montre cependant de fortes disparités selon le budget engagé. Cette question dépasse le simple exercice technique : elle touche à l'avenir de la souveraineté numérique et de la confidentialité des données pour les professionnels et les entreprises qui hésitent entre le cloud et le calcul local. Faire tourner un modèle chez soi élimine les coûts récurrents d'abonnement et les risques liés à l'envoi de données sensibles vers des serveurs tiers, mais implique un investissement matériel lourd et des performances souvent inférieures aux modèles propriétaires les plus avancés comme Claude ou GPT. Ce mouvement s'inscrit dans la stratégie plus large d'Apple autour du calcul embarqué et de la puce Apple Silicon, conçue pour rivaliser avec les infrastructures cloud dominées par Nvidia, Microsoft et Google. Alors que les abonnements Claude ou Codex continuent d'offrir des modèles plus puissants et mis à jour en continu, la comparaison révèle que le remplacement total reste, pour l'instant, réservé à des cas d'usage spécifiques et à des budgets conséquents.

InfrastructureOpinion
1 source
Hot Chips : le Jalapeño d'OpenAI, le CS-5 de Cerebras, le LPX de Groq 3 et l'Apple M6
Illustration générée par IA
43Latent Space 

Hot Chips : le Jalapeño d'OpenAI, le CS-5 de Cerebras, le LPX de Groq 3 et l'Apple M6

Lors de la 37e édition de la conférence Hot Chips, OpenAI a dévoilé les premiers résultats de benchmarks de sa propre puce d'inférence, baptisée Jalapeño, moins d'un an après avoir annoncé son partenariat avec Broadcom pour concevoir des semi-conducteurs maison. Selon les chiffres publiés par l'entreprise, la puce affiche un rendement de 1,5 à 1,9 fois supérieur par watt, une latence de bout en bout réduite de 1,7 à 3,6 fois, et des performances jusqu'à 4,1 fois plus élevées sur les charges de travail interactives, comparée aux systèmes Nvidia GB200 et GB300. Classée pour une puissance de 700 watts, Jalapeño serait restée à 550 watts ou moins lors des tests réels. OpenAI prévoit de déployer la puce dans sa propre infrastructure d'ici la fin de l'année, avec une deuxième génération déjà bien avancée et une troisième en préparation, selon Sam Altman et les communications officielles de l'entreprise. Autre détail marquant, les modèles GPT-Astra et Codex ont directement participé à l'écriture et à l'optimisation des noyaux de calcul bas niveau de la puce, permettant de porter trois modèles à poids ouverts à haute performance en seulement deux mois, avec certains blocs d'attention et de mélange d'experts jusqu'à 1,8 fois plus rapides que le code écrit par des ingénieurs humains. La même conférence a aussi vu passer des annonces de Cerebras avec son CS-5, de Groq avec la puce 3 LPX, et d'Apple avec le M6. L'enjeu dépasse la simple performance brute. En réduisant l'habituel compromis entre débit et latence, OpenAI signale que les grands laboratoires d'intelligence artificielle ne sont plus forcément dépendants de Nvidia pour l'économie de leurs coûts d'inférence, un poste de dépense devenu central à mesure que les modèles sont déployés à grande échelle auprès de millions d'utilisateurs. Cela pourrait rebattre les cartes d'un marché des puces d'IA aujourd'hui largement dominé par Nvidia, en particulier si d'autres laboratoires suivent cette voie de la conception interne. Le fait que des modèles comme GPT-Astra et Codex participent eux-mêmes à l'optimisation du code bas niveau illustre aussi une tendance plus large, celle de l'automatisation croissante du travail d'ingénierie logicielle et matérielle par l'IA elle-même. Cette annonce s'inscrit dans la continuité du partenariat OpenAI-Broadcom révélé il y a moins d'un an, et des analystes comme ceux de SemiAnalysis ont jugé les résultats inhabituellement solides pour un circuit spécialisé de première génération, le comparant aux GB200 et GB300 de Nvidia, le rapprochement avec la future gamme Rubin reposant sur des chiffres publiés séparément. Un bémol de taille subsiste toutefois, la capacité de packaging avancé et de fabrication chez des fondeurs comme TSMC reste un goulot d'étranglement pour toute l'industrie. La conférence a par ailleurs mis en lumière une autre tendance de fond, celle de l'importance croissante des architectures logicielles entourant les modèles d'IA: une étude menée par Microsoft sur un système nommé AutoSaddler a montré que corriger automatiquement les invites, la configuration des outils et la logique de contrôle d'un agent pouvait apporter des gains de 9 à 10 points sur des tests comme GAIA2, SWE-Bench Pro et Terminal-Bench 2.0, parfois davantage que ne le ferait un changement de modèle sous-jacent.

UELa bataille des puces IA entre OpenAI, Nvidia, Cerebras et Groq pourrait a terme influencer les couts d'infrastructure IA disponibles aux entreprises européennes, mais sans impact direct sur la France ou l'UE.

💬 Le chiffre qui compte, c'est pas le 1,9x par watt, c'est que GPT-Astra et Codex ont écrit eux-mêmes une partie du code bas niveau de la puce. Selon Le Fil IA, OpenAI vient de montrer que sa dépendance à Nvidia n'est plus une fatalité technique, juste un calcul économique, à condition que TSMC suive côté fonderie. Sur le papier c'est du lourd pour un premier jet de puce maison, reste à voir si ça tient une fois Jalapeño déployée en vrai sur ChatGPT.

InfrastructureActu
1 source
L'avertissement de Bill Gates sur l'IA et le trimestre record de Nvidia
Illustration générée par IA
44The Information AI 

L'avertissement de Bill Gates sur l'IA et le trimestre record de Nvidia

Bill Gates a publié mercredi un long essai mettant en garde contre les dangers de l'intelligence artificielle, se disant prêt à soutenir un ralentissement mondial du développement de cette technologie si quelqu'un proposait un plan crédible pour l'organiser. Le même jour, Nvidia, principal fournisseur de puces pour l'IA, a annoncé des résultats trimestriels impressionnants pour la période close en juillet: son chiffre d'affaires a plus que doublé pour atteindre 96 milliards de dollars. Le PDG Jensen Huang a résumé cette performance d'une phrase: "l'IA est devenue utile". Il n'a pas commenté directement l'essai de Gates, mais son intervention lors de la conférence sur les résultats a, comme d'habitude, mis l'accent sur les bénéfices de l'IA pour les entreprises. Ce contraste illustre la fracture actuelle du débat sur l'intelligence artificielle: d'un côté, des figures historiques de la tech alertent sur les risques existentiels ou sociétaux de la technologie; de l'autre, les résultats financiers démontrent une adoption massive et rentable, en tout cas pour les fournisseurs d'infrastructure comme Nvidia. Une grande partie de ces bénéfices reste concentrée entre les mains de Nvidia elle-même, ce qui pose la question de la répartition réelle de la valeur créée par l'IA dans l'économie. Pour les investisseurs et les entreprises clientes, le signal envoyé est que la demande pour les puces IA reste extrêmement soutenue, malgré les interrogations persistantes sur la rentabilité à long terme des projets d'IA générative. Le rapport trimestriel de Nvidia a aussi révélé l'ampleur des efforts déployés par l'entreprise pour soutenir ses clients et sécuriser sa position dominante: investissements dans plusieurs sociétés qui achètent ses puces ou développent des projets d'IA, soutien financier à la construction de centres de données, et extension des délais de paiement accordés à certains acheteurs de puces durant le trimestre. Ces pratiques soulèvent des questions sur la solidité du modèle économique de l'écosystème IA, largement financé par Nvidia elle-même, dans un contexte où les avertissements de figures comme Bill Gates rappellent que l'enthousiasme financier ne dissipe pas les inquiétudes sur les conséquences à long terme de cette technologie.

InfrastructureOpinion
1 source
NVIDIA étend NVLink Fusion avec la mémoire haute bande passante personnalisée NVHBM
Illustration générée par IA
45NVIDIA AI Blog 

NVIDIA étend NVLink Fusion avec la mémoire haute bande passante personnalisée NVHBM

NVIDIA a annoncé l'extension de sa technologie NVLink Fusion avec NVHBM, une nouvelle génération de mémoire à haute bande passante conçue sur mesure pour les puces XPU. Contrairement aux architectures HBM traditionnelles, qui placent le contrôleur mémoire directement sur la puce XPU en consommant une surface de silicium précieuse, NVHBM intègre ce contrôleur mémoire directement dans la puce de base de l'empilement HBM. Cette technologie repose sur la même base que celle que NVIDIA utilisera pour ses futurs GPU. Résultat concret : jusqu'à 30% de bande passante mémoire supplémentaire, une consommation électrique de la HBM réduite de 15%, et jusqu'à 25% d'espace en plus libéré sur la puce de calcul XPU, comparé à une HBM4E standard. NVIDIA établit une implémentation NVHBM standardisée, disponible auprès de plusieurs fournisseurs de mémoire. Annapurna Labs, la filiale semi-conducteurs d'Amazon, sera le premier partenaire à travailler sur cette technologie dans le cadre de sa collaboration élargie avec NVIDIA autour de NVLink Fusion. Cette avancée compte parce qu'elle s'attaque à un goulot d'étranglement central de l'infrastructure IA actuelle : à mesure que les agents IA et les modèles à plusieurs milliers de milliards de paramètres se généralisent, la performance ne dépend plus seulement de la puissance de calcul brute, mais de la façon dont calcul, mémoire, stockage, réseau et logiciel sont conçus ensemble comme un système unifié. En libérant de l'espace sur la puce XPU tout en augmentant la bande passante mémoire, NVHBM permet aux fabricants de puces personnalisées de consacrer davantage de silicium au calcul pur, un avantage direct pour les géants du cloud qui développent leurs propres accélérateurs IA. En standardisant l'implémentation auprès de plusieurs fournisseurs de mémoire, NVIDIA réduit aussi l'effort d'ingénierie nécessaire pour intégrer et qualifier la mémoire, ce qui accélère la mise sur le marché de puces IA sur mesure pour les clients de NVLink Fusion. Cette annonce s'inscrit dans la stratégie plus large de NVIDIA visant à rester incontournable même face à la montée des puces IA personnalisées développées par les hyperscalers. Amazon, via Annapurna Labs, prévoit d'intégrer NVLink Fusion à ses futures puces Trainium à partir de Trainium4, permettant à ses propres accélérateurs de fonctionner aux côtés des GPU NVIDIA au sein d'une architecture de rack commune. Nafea Bshara, vice-président d'Annapurna Labs chez Amazon, a qualifié NVHBM de "nouvelle approche architecturale" pour améliorer la performance et l'efficacité de la mémoire à haute bande passante, ajoutant que cette collaboration bénéficiera aux futures conceptions d'infrastructure d'AWS. Plus largement, NVLink Fusion donne accès aux partenaires aux chiplets NVLink, à NVLink-C2C, aux commutateurs NVLink et aux systèmes et racks NVIDIA MGX, ainsi qu'à tout un écosystème de partenaires CPU, concepteurs d'ASIC et fabricants de systèmes, leur permettant de concentrer leurs efforts d'ingénierie sur l'innovation des puces XPU tout en s'appuyant sur une pile technologique éprouvée pour le déploiement d'infrastructures IA semi-personnalisées.

InfrastructureActu
1 source
Le Jetson Orin Nano 2 de NVIDIA apporte l'IA physique aux drones et aux robots
Illustration générée par IA
46AI News 

Le Jetson Orin Nano 2 de NVIDIA apporte l'IA physique aux drones et aux robots

NVIDIA a présenté le Jetson Orin Nano 2, un ordinateur embarqué pour l'intelligence artificielle physique, destiné aux drones, robots et systèmes de vision. La carte fournit 78 000 milliards d'opérations par seconde de calcul IA, 8 Go de mémoire et un processeur Arm huit cœurs, soit le double des performances d'inférence de son prédécesseur, le Jetson Orin Nano Super, dans le même format compact, grâce à des Tensor Cores améliorés et davantage de bande passante mémoire. En mode 15 watts, elle consomme 40% d'énergie en moins que ce dernier pour une performance équivalente. Deepu Talla, vice-président Robotique et IA embarquée chez NVIDIA, présente cette carte comme un moyen de mettre le raisonnement en temps réel à la portée de millions de développeurs. Elle fait tourner des modèles comme Cosmos et Nemotron, développés en interne, ainsi que Gemma 4 et Qwen 3, via l'écosystème logiciel Jetson. Cognex, Doosan Bobcat et Matic Robots figurent parmi les premiers partenaires cités, sur une base de plus de trois millions de développeurs déjà actifs sur la pile robotique de NVIDIA. Wing, la filiale de livraison par drone d'Alphabet, qui utilise déjà le Jetson Orin Nano Super, va évaluer la nouvelle carte, selon Dinuka Abeywardena, responsable de la perception chez Wing. L'intérêt de l'annonce tient à un basculement technique: des modèles de taille petite ou moyenne atteignent désormais la précision qui, un an plus tôt, n'était accessible qu'aux plus grands modèles de pointe. Du matériel compact et peu énergivore peut donc interpréter langage et images et agir en temps réel sans passer par un centre de données distant. Pour des drones de livraison ou d'inspection, des robots domestiques ou des systèmes de vision industrielle, cela réduit la latence et la consommation tout en prolongeant l'autonomie sur batterie. Wing espère ainsi rendre ses livraisons de commerces locaux plus rapides et plus sûres. Chez Matic Robots, dont le cofondateur et directeur général Navneet Dalal insiste sur la nécessité pour les robots domestiques de comprendre les personnes et de cartographier précisément les espaces, la carte doit ajouter IA conversationnelle, détection de gestes et compréhension sémantique du logement à des robots de nettoyage déjà autonomes. Ce lancement prolonge la stratégie de NVIDIA autour de sa gamme Jetson, pilier de son expansion dans la robotique et le calcul en périphérie de réseau, alors que l'entreprise pousse son concept d'IA physique au-delà de ses GPU de centres de données. En s'appuyant sur une base de plus de trois millions de développeurs déjà formés à sa pile logicielle, NVIDIA vise à faire du Jetson Orin Nano 2 une référence pour les fabricants de cartes mères, de systèmes matériels et de designs de robots et de drones. Aucune date n'a été communiquée pour un passage de Wing de la phase d'évaluation à un usage en production sur ses vols de livraison. La démarche s'inscrit dans la montée en puissance des robots domestiques et des drones autonomes, un marché où NVIDIA mise sur l'intégration étroite entre son matériel et ses propres modèles pour asseoir sa position face aux autres fabricants de puces dédiées à l'IA embarquée.

UELes développeurs européens de drones et de robots pourront évaluer cette carte via l'écosystème logiciel Jetson, mais aucune entreprise ou réglementation française ou européenne n'est directement impliquée.

InfrastructureActu
1 source
Cisco et Supermicro industrialisent le rack-scale pour sécuriser le passage à l’échelle
Illustration générée par IA
47Le Big Data 

Cisco et Supermicro industrialisent le rack-scale pour sécuriser le passage à l’échelle

Cisco a annoncé le 25 août 2026 un partenariat stratégique avec Supermicro visant à étendre sa plateforme Secure AI Factory, conçue en collaboration avec NVIDIA. L'accord prévoit l'intégration des serveurs haute densité de Supermicro, refroidis par air ou par liquide, au catalogue de l'équipementier américain, avec des premières livraisons annoncées pour octobre 2026. L'architecture combine les puces réseau Cisco Silicon One, les commutateurs NVIDIA Spectrum-X et le système d'orchestration Cisco Nexus One, le tout dimensionné pour des baies consommant plus de 200 kilowatts grâce au refroidissement liquide. Cette offre clé en main cible les néoclouds, les clouds souverains et les grandes entreprises, et doit permettre d'entraîner des modèles atteignant mille milliards de paramètres ainsi que de faire tourner l'inférence à haut débit sur la plateforme NVIDIA Vera Rubin NVL72. Le PDG de Supermicro, Charles Liang, a confirmé l'accord le jour même sur le réseau social X, évoquant une solution complète allant du rack jusqu'au réseau. Un service dédié, Cisco Validated Infrastructure Services, certifiera la conformité des installations avec les exigences du programme NVIDIA Cloud Partner. Pour les responsables d'infrastructures IT, cet accord change la donne en supprimant le risque d'intégration qui freinait jusqu'ici le passage des projets d'IA du stade expérimental à la production industrielle. Jusqu'à présent, construire un cluster à l'échelle du rack obligeait les équipes à assembler elles-mêmes des composants venus de fournisseurs différents, un processeur graphique ici, un commutateur réseau là, un système de refroidissement liquide sur mesure, une tâche compliquée par la rareté des compétences spécialisées. Chaque défaut d'optimisation thermique ou réseau se traduisait par une hausse de la consommation électrique et du coût par token généré, ainsi que par des retards d'exécution coûteux. En proposant un système pré-validé et certifié, Cisco et Supermicro promettent de réduire nettement le délai de mise en production, un enjeu crucial alors que la demande de calcul pour l'entraînement et l'inférence de grands modèles continue de croître fortement en 2026. Les équipes conservent par ailleurs leurs outils habituels, via la suite NVIDIA AI Enterprise et la plateforme AgenticOps de Cisco Cloud Control. Cette alliance s'inscrit dans une tendance plus large de standardisation industrielle des infrastructures d'intelligence artificielle, où les grands équipementiers cherchent à proposer des architectures de référence plutôt que des briques isolées à assembler. NVIDIA joue un rôle central dans cette dynamique, en imposant ses standards réseau et ses plateformes de calcul comme dénominateur commun entre des partenaires par ailleurs concurrents, tels que Cisco et Supermicro. Ce rapprochement traduit aussi la pression économique pesant sur les fournisseurs de cloud, y compris les acteurs souverains ou émergents, sommés de rentabiliser rapidement leurs investissements massifs dans le calcul IA. D'autres annonces de ce type pourraient suivre dans les prochains mois, à mesure que fabricants de serveurs et équipementiers réseau consolident leurs offres autour des futures générations de puces NVIDIA.

UELes fournisseurs de cloud souverain européens pourraient adopter cette architecture standardisée pour accélérer leurs déploiements IA, mais aucune entreprise ou institution française n'est directement impliquée dans cet accord.

InfrastructureActu
1 source
Pourquoi le Jalapeño d'OpenAI pourrait poser problème à Nvidia
Illustration générée par IA
48The Information AI 

Pourquoi le Jalapeño d'OpenAI pourrait poser problème à Nvidia

OpenAI a dévoilé mardi les premiers résultats de tests de Jalapeño, son tout premier processeur conçu en interne pour faire tourner ses modèles d'intelligence artificielle. L'entreprise affirme que la puce représente une avancée de performance significative, capable de traiter davantage de charges de travail par unité d'énergie tout en renvoyant des réponses plus rapidement. Le PDG Sam Altman a résumé la nouvelle en une phrase sur X : nous avons fabriqué une puce et elle est rapide. Le cabinet d'analyse SemiAnalysis, spécialisé dans les semi-conducteurs, a publié une évaluation indépendante concluant que Jalapeño surpasse le Blackwell de Nvidia, la puce phare actuellement utilisée par la quasi-totalité des grands laboratoires d'IA. Le nom du processeur, inspiré du piment, tombe toutefois mal : la Food and Drug Administration américaine met au même moment en garde contre la consommation de produits à base de jalapeños, en raison d'une épidémie de salmonelle liée à ce légume. Cette annonce marque une étape stratégique pour OpenAI, qui cherche à réduire sa dépendance vis-à-vis de Nvidia, dont les puces représentent l'essentiel des coûts d'infrastructure des géants de l'IA. Si les résultats se confirment à grande échelle, Jalapeño pourrait permettre à l'entreprise de réduire ses coûts de calcul, un enjeu crucial alors qu'elle dépense des dizaines de milliards de dollars pour entraîner et faire fonctionner des modèles comme GPT. Pour Nvidia, dont la valorisation boursière dépend largement de la demande de ses plus gros clients, l'émergence d'un concurrent interne chez l'un de ses plus importants acheteurs constitue un signal d'alerte, même s'il reste limité pour l'instant. Plus largement, cela confirme une tendance de fond : à l'image de Google avec ses puces TPU ou d'Amazon avec Trainium, les grands acteurs de l'IA cherchent tous à concevoir leur propre silicium pour ne plus dépendre entièrement d'un fournisseur unique. Ce mouvement s'inscrit dans une course engagée depuis plusieurs années par les géants technologiques pour internaliser la conception de leurs puces d'intelligence artificielle, face à la position dominante et aux marges élevées de Nvidia sur ce marché. OpenAI a multiplié ces derniers mois les investissements dans les infrastructures de calcul, notamment via des partenariats avec des fondeurs et des fournisseurs de mémoire, afin de sécuriser sa chaîne d'approvisionnement. Reste à savoir si les performances vantées par OpenAI et SemiAnalysis se confirmeront en conditions de production à grande échelle, et si Jalapeño restera un outil strictement interne ou sera un jour proposé plus largement, comme le fait déjà Google avec ses TPU.

💬 Le vrai signal, c'est pas la puce elle-même, c'est le fait qu'OpenAI ait besoin de la sortir alors qu'elle brûle déjà des dizaines de milliards chez Nvidia. Selon Le Fil IA, quand ton plus gros client se met à concevoir son propre silicium, c'est le premier vrai indicateur que la rente Nvidia a une date de péremption, même si elle reste confortable pour l'instant. Reste que SemiAnalysis évalue sur des specs annoncées, pas sur du déployé à grande échelle, donc l'histoire du "Jalapeño plus rapide que Blackwell" à vérifier en prod, pas sur un post X de Sam Altman.

InfrastructureActu
1 source
Atlassian mise sur l'essor des graphes de connaissances
Illustration générée par IA
49The Information AI 

Atlassian mise sur l'essor des graphes de connaissances

Atlassian fait partie des éditeurs de logiciels qui misent sur les graphes de connaissances, aussi appelés bases de données en graphe, pour accompagner l'essor des agents d'intelligence artificielle capables d'automatiser du code et d'autres tâches de bureau. Ces outils permettent à l'IA d'analyser les relations entre différents types de données au sein d'une organisation, contrairement aux plateformes plus classiques comme celles de Databricks ou Snowflake, qui organisent les données en colonnes et en lignes. Les deux approches visent à nettoyer et structurer de vastes volumes d'informations pour que l'IA puisse en dégager des tendances, par exemple analyser les dépenses des clients sur un trimestre donné. Plus tôt cette année, un article a également révélé que Microsoft avait mis en place des restrictions empêchant des éditeurs concurrents d'accéder aux données de ses propres clients. Cette bascule vers les graphes de connaissances illustre un enjeu économique central pour l'industrie du logiciel : à mesure que les agents IA deviennent des outils de travail courants, les entreprises technologiques cherchent à capter la valeur générée par le stockage et la structuration des données nécessaires à leur fonctionnement. Les défenseurs des bases de données en graphe affirment qu'elles demandent moins de traitement de la part des modèles d'IA que les formats tabulaires traditionnels, ce qui peut réduire les coûts de calcul pour les entreprises clientes. Pour les organisations qui déploient des agents IA à grande échelle, le choix de l'infrastructure de données devient ainsi un facteur direct de rentabilité, et pas seulement une question technique. Cette évolution s'inscrit dans une compétition plus large entre géants du logiciel pour contrôler l'accès aux données d'entreprise à l'ère de l'IA générative. En verrouillant certains accès, comme l'a fait Microsoft, ou en proposant de nouveaux formats de stockage jugés plus efficaces, des acteurs comme Atlassian, Databricks et Snowflake cherchent à s'imposer comme intermédiaires incontournables entre les entreprises et les agents IA qu'elles adoptent. La bataille porte désormais autant sur l'architecture des données que sur les modèles d'IA eux-mêmes, et pourrait redessiner les rapports de force entre fournisseurs de cloud, éditeurs de bases de données et développeurs d'agents autonomes dans les mois à venir.

💬 Les graphes de connaissances, c'est ce qui manquait pour que l'IA d'entreprise arrête de bosser en aveugle sur des tableaux de chiffres sans contexte. Reste que derrière l'argument technique il y a surtout une bataille de rente : Atlassian, Databricks, Snowflake veulent tous devenir le tuyau obligatoire entre tes données et tes agents, et vu ce que Microsoft a fait en verrouillant l'accès à ses clients, la vraie question dans deux ans ce sera moins "quel modèle d'IA" que "qui possède le graphe de tes données".

InfrastructureOpinion
1 source
OpenAI dévoile Jalapeño, sa première puce maison, plus rapide que les Blackwell de Nvidia en inférence
Illustration générée par IA
50The Decoder 

OpenAI dévoile Jalapeño, sa première puce maison, plus rapide que les Blackwell de Nvidia en inférence

OpenAI a dévoilé lors de la conférence Hot Chips son premier processeur d'inférence conçu en interne, baptisé "Jalapeño". Des essais publiés par OpenAI sur InferenceX, le banc d'essai de la société d'analyse SemiAnalysis, placent cette puce devant les GB200 et GB300 de Nvidia en débit de calcul et en efficacité énergétique. SemiAnalysis, qui indique avoir relu ces exécutions avec les ingénieurs d'OpenAI sans conduire elle-même la suite complète, juge la comparaison incomplète : Jalapeño embarque de la mémoire HBM4 quand les GB200 et GB300 sont en HBM3E. Dylan Patel, patron de SemiAnalysis, a résumé la performance en soulignant que les puces de première génération sont habituellement peu compétitives, alors que celle d'OpenAI devance déjà les Blackwell de Nvidia. Le dépassement de la génération suivante, Vera Rubin, ne repose pas sur un face-à-face mais sur un recoupement avec des chiffres publiés séparément. Ces résultats ont été présentés publiquement lors de la conférence, un rendez-vous suivi de près par l'industrie des semi-conducteurs. Cette annonce marque un tournant potentiel dans la dépendance d'OpenAI envers Nvidia, qui fournit aujourd'hui l'essentiel de la puissance de calcul utilisée pour faire tourner ses modèles comme ChatGPT. Si Jalapeño tient ses promesses à grande échelle, OpenAI pourrait réduire ses coûts d'inférence, qui représentent une part croissante de ses dépenses à mesure que l'usage de ses produits explose, tout en gagnant en indépendance stratégique face à un fournisseur unique dont les prix et les délais de livraison pèsent sur l'ensemble du secteur. Cette démarche s'inscrit dans une tendance plus large où les grands acteurs de l'intelligence artificielle développent leurs propres puces pour limiter leur dépendance à Nvidia, à l'image de Google avec ses TPU, Amazon avec Trainium ou Microsoft avec Maia. OpenAI travaillerait notamment avec Broadcom sur la conception de ces circuits. Reste à voir si Jalapeño passera du stade des bancs d'essai à un déploiement massif dans les centres de données d'OpenAI.

💬 Jalapeño change la donne : pour la première fois, une puce maison bat Blackwell dès sa première génération, alors que d'habitude un round 1 se fait laminer. Ça veut dire qu'OpenAI peut viser une inférence moins chère sans dépendre entièrement de Nvidia, et vu que l'inférence bouffe une part croissante de leurs coûts, c'est stratégique, pas cosmétique. Reste à voir si ça tient la charge en datacenter réel, les bancs d'essai chez SemiAnalysis c'est une chose, un déploiement massif chez OpenAI c'en est une autre.