InfrastructureThe Information AI · 28 mai 2026, 16:00· 2 min de lecture

Apple relance son offensive pour une IA locale, sans passer par le cloud

Résumé IASource uniqueImpact UE Take éditorial

Lors de sa conférence annuelle des développeurs (WWDC), prévue le mois prochain, Apple devrait mettre en avant une série de mises à jour d'intelligence artificielle très attendues pour l'iPhone, tout en insistant sur une capacité souvent sous-estimée : celle de faire tourner des modèles d'IA directement sur ses appareils, sans passer par le cloud. Selon des personnes proches des plans de l'entreprise, Apple entend démontrer comment ses 15 ans d'expérience dans la conception de puces personnalisées pour l'iPhone, l'Apple Watch et les Mac lui confèrent un avantage concret pour exécuter des modèles d'IA localement. Cette approche contraste avec la norme du secteur, où la plupart des traitements IA s'effectuent dans des datacenters remplis de puces coûteuses. Certaines requêtes resteront néanmoins traitées dans le cloud, notamment celles qui nécessitent une complexité élevée ou un accès à de vastes bases de données en ligne : dans le cadre d'un accord avec Google, une nouvelle version de Siri fera tourner certaines requêtes sur Google Cloud, via une version sous licence du modèle Gemini. Apple a par ailleurs récemment approuvé une technologie de confidentialité développée par Nvidia pour cet environnement, ce qui suggère que l'entreprise utilisera également des puces Nvidia pour une partie de ses besoins de calcul dans Google Cloud.

L'enjeu de l'IA embarquée est considérable : exécuter des modèles localement réduit la latence, améliore la confidentialité des données et diminue la dépendance à des infrastructures cloud onéreuses. Avec des milliards d'appareils Apple en circulation, la capacité à distribuer des traitements IA à cette échelle représente un levier différenciant face à des concurrents comme Google, Microsoft ou OpenAI, dont les offres reposent quasi exclusivement sur des serveurs distants.

Apple accuse un retard significatif sur ses rivaux dans la course à l'IA générative. La WWDC du mois prochain sera donc un moment clé pour démontrer que la maîtrise du matériel, via ses puces Apple Silicon, peut constituer une réponse crédible à ce retard. La coexistence d'une stratégie on-device et d'un recours au cloud via des partenaires comme Google et Nvidia illustre la complexité de la position d'Apple : rattraper rapidement les leaders du secteur tout en préservant les promesses de confidentialité qui sont au coeur de son identité de marque.

Impact France/UE

L'approche on-device d'Apple réduit les transferts de données vers des serveurs distants, ce qui s'aligne naturellement avec les exigences du RGPD et pourrait renforcer la conformité des milliards d'appareils Apple utilisés en Europe.

💬 L'analyse de Mathieu

L'argument confidentialité tient moins bien avec Siri qui sous-traite à Google Cloud, mais c'est à côté du sujet. Ce qui compte, c'est que quinze ans de puces custom donnent à Apple une base que Google ou Microsoft ne peuvent pas copier en six mois : faire tourner de l'IA sur des milliards d'appareils sans passer par un datacenter, c'est une infrastructure inversée que personne d'autre n'a. Reste à voir si les modèles sont à la hauteur.

Dans nos dossiers

NVIDIA Google Cloud Microsoft OpenAI

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1VentureBeat AI

Microsoft lance le Surface RTX Spark Dev Box pour faire tourner de grands modèles IA sans recourir au cloud

Microsoft a dévoilé lundi le Surface RTX Spark Dev Box lors de la conférence Build 2026, un ordinateur de bureau compact destiné aux développeurs de logiciels qui souhaitent faire tourner de grands modèles d'intelligence artificielle en local, sans passer par le cloud. La machine embarque le nouveau processeur RTX Spark d'Nvidia, basé sur l'architecture Blackwell, et dispose de 128 gigaoctets de mémoire unifiée partagée dynamiquement entre le CPU et le GPU. Cette configuration permet d'atteindre un pétaflop de puissance de calcul IA, ce qui autorise l'exécution de modèles dépassant 120 milliards de paramètres sans envoyer la moindre requête vers un serveur distant. Pavan Davuluri, vice-président exécutif de Windows et Devices chez Microsoft, a précisé que la mémoire joue un rôle critique : à 100 000 tokens de contexte, le cache clé-valeur d'un grand modèle peut à lui seul consommer entre 40 et 50 gigaoctets, ce qui explique le choix de ce pool mémoire de 128 Go. L'appareil sera commercialisé exclusivement sur Microsoft.com aux États-Unis d'ici la fin de l'année, sans prix annoncé à ce stade. L'enjeu est directement économique. Les entreprises de toutes tailles font face à des factures cloud GPU qui s'accumulent de façon imprévisible : chaque appel d'inférence, chaque cycle de fine-tuning, chaque workflow agentique qui itère sur un modèle frontier génère des coûts qui s'emballent pour un développeur testant son prototype des dizaines de fois par jour. Andrew Hill, vice-président de Surface, a résumé la promesse dans le billet d'annonce : le Dev Box "change l'équation" en permettant aux équipes de "réserver les appels aux modèles frontier aux vrais problèmes frontier, et de traiter le reste sur leur propre matériel." La proposition n'est pas que le cloud soit dépassé, mais qu'une large partie des tâches actuellement envoyées à des datacenters distants ne justifie pas des modèles de pointe et serait mieux servie par du matériel local à coût fixe et prévisible. Ce lancement marque un tournant stratégique notable pour Microsoft, dont Azure génère plusieurs dizaines de milliards de dollars de revenus annuels. En commercialisant explicitement un appareil qui réduit la dépendance au cloud de ses propres clients, l'entreprise reconnaît une tension structurelle qui monte dans l'industrie depuis l'explosion des coûts d'inférence. Le pari de Redmond est que les développeurs qui prototypent en local déploieront ensuite sur Azure lorsqu'ils auront besoin de passer à l'échelle, et que contrôler les deux extrémités de ce cycle de développement est plus rentable que de n'en posséder qu'une. L'architecture RTX Spark, qui fusionne CPU ARM et GPU Blackwell en un seul chip avec mémoire unifiée, remplace quatre composants distincts d'un PC classique et ouvre la voie à une nouvelle génération de postes de travail IA autonomes.

InfrastructureOpinion

1 source

2NVIDIA AI Blog

NVIDIA intègre le calcul confidentiel pour renforcer le Private Cloud Compute d'Apple

Apple vient d'annoncer lors de sa conférence annuelle WWDC 2026 l'extension de son infrastructure Private Cloud Compute (PCC) au-delà de ses propres centres de données, vers Google Cloud. Pour sécuriser cette expansion, Apple s'appuie désormais sur les GPU NVIDIA avec Confidential Computing, notamment les puces Blackwell de dernière génération. Ces GPU servent à l'inférence confidentielle côté serveur pour les Apple Foundation Models, des modèles d'IA propriétaires développés conjointement par Apple et Google à partir des technologies qui sous-tendent la famille Gemini. C'est la première fois qu'Apple intègre explicitement du matériel NVIDIA dans l'architecture de sécurité matérielle de PCC, un système conçu pour traiter des requêtes d'intelligence artificielle sensibles sans exposer les données des utilisateurs. Cette collaboration soulève un enjeu fondamental pour l'IA à grande échelle : comment traiter des données personnelles dans le cloud sans sacrifier ni la performance ni la confidentialité. Le Confidential Computing de NVIDIA répond à cette contrainte en isolant les charges de travail dans des environnements d'exécution sécurisés, en chiffrant les flux de communication entre composants, et en permettant une attestation à distance, un mécanisme cryptographique qui permet au logiciel de vérifier que l'infrastructure n'a pas été compromise avant d'y envoyer des données sensibles. Concrètement, cela signifie que personne, y compris les ingénieurs d'Apple, de Google ou de NVIDIA, ne peut accéder aux conversations ou données des utilisateurs pendant le traitement. Pour des centaines de millions d'utilisateurs Apple qui activent des fonctions Apple Intelligence impliquant du traitement cloud, cette garantie est directement opérationnelle. Cette annonce s'inscrit dans une tendance de fond : à mesure que les expériences d'IA hybrides combinent traitement sur l'appareil et inférence serveur, la pression sur la chaîne de confiance s'intensifie. Apple avait fait de la confidentialité de PCC une promesse centrale depuis l'introduction d'Apple Intelligence, mais ses centres de données propriétaires limitaient sa capacité à monter en puissance. Le recours à Google Cloud, avec des GPU Blackwell sécurisés, lui permet de scaler sans renoncer à cette promesse. Pour NVIDIA, c'est une validation de son positionnement sur la sécurité de l'IA, un segment encore peu exploité mais stratégique face à des régulations croissantes sur les données personnelles. L'intégration de ces trois acteurs majeurs, Apple, Google et NVIDIA, autour d'un standard commun de confidentialité computationnelle pourrait accélérer l'adoption de ce type d'architecture dans l'ensemble de l'industrie.

UEL'architecture de confidentialité computationnelle décrite pourrait devenir un standard pour les entreprises européennes soumises au RGPD cherchant à déployer l'IA dans le cloud sans compromettre la protection des données personnelles.

💬 Apple qui sous-traite sa confidentialité à Google Cloud, c'est un paradoxe savoureux. Mais le Confidential Computing de NVIDIA change la lecture : l'attestation à distance garantit que même les ingénieurs des trois boîtes ne touchent pas aux données pendant l'inférence, c'est pas du branding, c'est de la cryptographie. Reste à voir si ça tient à l'échelle, mais sur le papier c'est le template qu'on attendait pour que l'IA cloud passe enfin le test RGPD.

InfrastructureOpinion

1 source

3Le Big Data

Blackstone et Google investissent dans un nouveau cloud TPU pour accélérer l’IA

Blackstone et Google ont annoncé le 19 mai 2026 la création d'une coentreprise américaine dédiée aux services de calcul accéléré basés sur les TPU (Tensor Processing Units) de Google. L'accord prévoit un investissement initial de 5 milliards de dollars apportés par Blackstone en fonds propres, avec pour objectif de déployer une première capacité de 500 mégawatts d'ici 2027. Google fournit ses puces TPU, ses logiciels et ses services, tandis que Blackstone apporte son expertise dans la construction et le financement d'infrastructures à grande échelle, le fonds gère plus de 1 300 milliards de dollars d'actifs et possède une présence majeure dans les centres de données. La nouvelle entité sera dirigée par Benjamin Treynor Sloss, ancien cadre de Google avec plus de vingt ans d'expérience dans la conception d'infrastructures critiques. La capacité prévue pourrait être significativement étendue au-delà de 500 MW pour accompagner la montée en puissance des usages IA. Ce partenariat marque un tournant dans la manière dont Google monétise ses TPU, jusqu'ici cantonnées à un usage interne ou distribuées exclusivement via Google Cloud. En créant une structure commerciale indépendante, Google ouvre un nouveau canal de distribution de sa puissance de calcul, plus flexible et accessible à des entreprises qui ne souhaitent pas s'engager exclusivement avec Google Cloud. Pour les acteurs de l'IA, laboratoires de recherche, institutions financières, grandes entreprises, cela représente une alternative crédible aux GPU Nvidia, qui dominent le marché mais restent confrontés à des problèmes de disponibilité et à des coûts élevés. Cette initiative répond aussi à un besoin structurel : les grandes organisations cherchent à sécuriser des capacités de calcul stables sur le long terme, capables de soutenir des modèles d'IA toujours plus gourmands en ressources. Les TPU de Google sont développées depuis plus d'une décennie et alimentent déjà les infrastructures de Gemini ainsi que celles de nombreux partenaires technologiques. Leur ouverture à un marché plus large s'inscrit dans une logique d'industrialisation rapide de l'infrastructure IA : après la course aux modèles génératifs, la bataille se déplace vers l'accès à la puissance de calcul elle-même. Nvidia règne pour l'instant sans partage sur ce segment, mais la pression concurrentielle s'intensifie, avec des acteurs comme AMD, Intel et désormais Google qui cherchent à capter une part croissante de ce marché estimé à plusieurs centaines de milliards de dollars. L'alliance entre l'un des plus grands gestionnaires d'actifs mondiaux et le détenteur d'une technologie de calcul propriétaire de premier plan illustre comment capital financier et puissance technologique convergent pour structurer l'infrastructure de l'IA de demain.

UELes organisations et laboratoires européens de recherche en IA pourraient à terme accéder à une offre de calcul accéléré supplémentaire, mais la coentreprise est domiciliée aux États-Unis et ne cible pas spécifiquement le marché européen.

💬 5 milliards dans une JV dédiée aux TPU, ça dit clairement que la bataille pour l'infrastructure IA est lancée. Google avait ces puces depuis dix ans, les gardait pour son cloud, et il ouvre maintenant le robinet en partageant le risque avec Blackstone. Reste à voir si les TPU sont vraiment compétitifs en dehors des cas d'usage où Google a tout optimisé pour lui-même.

InfrastructureOpinion

1 source

4Numerama

Une tour à 15 274 €, deux GPU AMD et aucun abonnement cloud : on a testé l’IA locale à son maximum [Sponso]

Une configuration à 15 274 euros, assemblée sous un bureau et équipée de deux cartes graphiques AMD, a été testée pour évaluer ce qu'une machine dédiée à l'intelligence artificielle peut réellement accomplir en local, sans recourir au moindre service cloud. L'objectif de ce test, mené en collaboration avec AMD, était de faire fonctionner une chaîne complète de production logicielle d'IA, de l'entraînement à l'inférence, entièrement sur du matériel physique installé chez l'utilisateur. Le contenu a été produit par les rédacteurs indépendants de l'entité Humanoid xp, sans intervention de la rédaction de Numerama, dans le cadre d'un partenariat commercial clairement identifié. Cette démarche illustre un intérêt croissant pour les infrastructures d'IA locales, à contre-courant du modèle dominant fondé sur les abonnements aux plateformes cloud comme AWS, Azure ou Google Cloud. Pour les professionnels et les entreprises soucieux de maîtriser leurs coûts récurrents, leurs données sensibles ou leur dépendance à des fournisseurs tiers, une tour équipée de GPU AMD représente une alternative tangible, même si l'investissement initial reste conséquent. Cela change la donne pour les studios, les chercheurs ou les PME qui veulent expérimenter avec des modèles d'IA sans exposer leurs données à des serveurs externes ni subir la facturation à l'usage. Le marché du matériel dédié à l'IA locale s'est intensifié ces dernières années, porté par la demande de puissance de calcul pour l'entraînement et l'inférence de modèles toujours plus lourds. AMD y voit une opportunité de concurrencer Nvidia, acteur dominant du secteur, en misant sur des configurations multi-GPU accessibles aux particuliers avertis et aux petites structures. Ce type de démonstration commerciale s'inscrit dans une bataille plus large pour convaincre les utilisateurs que l'IA locale peut rivaliser, en performance comme en autonomie, avec les offres cloud des géants du secteur.

💬 Une tour à 15 000 balles pour causer IA sans dépendre du cloud, c'est le genre de démo commerciale qu'on regarde avec un sourcil levé, financée par AMD pour vendre du multi-GPU. Mais le vrai signal derrière, c'est que le prix d'entrée pour sortir du modèle abonnement-cloud devient un calcul économique sérieux, pas juste un fantasme de geek paranoïaque des données. Reste à voir si une PME normale a vraiment besoin de ça, parce que pour la plupart, un bon abonnement API reste largement moins cher que d'amortir une tour à cinq chiffres.

InfrastructureActu

1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic