Aller au contenu principal
InfrastructureMarkTechPost · 2 min de lecture

CPUs, GPUs, TPUs, NPUs et LPUs : cinq architectures de calcul IA que tout ingénieur doit connaître

Source originale ↗·

L'intelligence artificielle moderne ne repose plus sur un seul type de processeur, mais sur un écosystème de puces spécialisées aux compromis bien distincts. Les CPU (processeurs centraux), architecture historique de l'informatique, restent indispensables pour l'orchestration des systèmes, la gestion des flux de données et la coordination des autres accélérateurs, mais leurs cœurs peu nombreux et leur traitement séquentiel les rendent inadaptés aux calculs massivement parallèles que nécessite l'IA à grande échelle. Les GPU (processeurs graphiques), conçus à l'origine pour le rendu vidéo, sont devenus la colonne vertébrale de l'entraînement des modèles de deep learning grâce à leurs milliers de cœurs capables d'exécuter simultanément les multiplications matricielles et opérations tensorielles au cœur des réseaux de neurones, une révolution rendue possible par l'introduction de CUDA par Nvidia. À ces deux architectures s'ajoutent les TPU (Tensor Processing Units) de Google, conçus spécifiquement pour l'exécution de réseaux de neurones avec un flux de données optimisé, les NPU (Neural Processing Units) intégrés dans les appareils grand public pour une inférence locale économe en énergie, et les LPU (Language Processing Units) de Groq, une innovation récente promettant une inférence nettement plus rapide et plus efficiente pour les grands modèles de langage.

Ces distinctions architecturales ont des conséquences directes pour les entreprises et les ingénieurs qui déploient des systèmes d'IA en production. Choisir la mauvaise puce signifie payer trop cher pour de l'entraînement, subir une latence excessive en inférence, ou gaspiller de l'énergie sur des appareils embarqués. Les GPU restent le choix dominant pour l'entraînement intensif, mais leur coût élevé et leur disponibilité limitée poussent les acteurs à explorer des alternatives. Les NPU, désormais intégrés dans les puces Apple Silicon, Qualcomm Snapdragon ou Intel Core Ultra, permettent d'exécuter des modèles directement sur les terminaux sans cloud, réduisant latence et risques liés à la confidentialité. Les LPU de Groq, eux, ciblent précisément le goulot d'étranglement de l'inférence en production pour les LLM, avec des débits annoncés plusieurs fois supérieurs aux GPU traditionnels.

Cette diversification des architectures de calcul reflète une transition plus profonde de l'industrie : le passage du calcul généraliste à l'optimisation par charge de travail. Pendant des décennies, la loi de Moore et les CPU universels ont suffi. Aujourd'hui, la demande explosive en puissance de calcul pour l'IA, portée par des modèles de plus en plus massifs comme GPT-4, Gemini ou Llama 3, dépasse ce que les architectures généralistes peuvent absorber efficacement. Google a investi massivement dans ses TPU v4 et v5 pour sécuriser son indépendance vis-à-vis de Nvidia, tandis que des startups comme Groq, Cerebras ou Tenstorrent parient sur des designs radicalement différents. Pour tout ingénieur IA, comprendre ces architectures n'est plus une curiosité académique : c'est une compétence opérationnelle pour concevoir des systèmes performants, économiques et adaptés aux contraintes réelles du déploiement.

Impact France/UE

L'intégration des NPU dans les appareils grand public (Apple Silicon, Qualcomm Snapdragon, Intel Core Ultra) permet aux entreprises et utilisateurs européens d'exécuter des modèles en local, réduisant la dépendance au cloud et les risques liés au RGPD.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

L'IA révèle les limites de l'architecture réseau traditionnelle
1VentureBeat AI 

L'IA révèle les limites de l'architecture réseau traditionnelle

L'intelligence artificielle met à nu les limites des architectures réseau traditionnelles, selon une étude de Tata Communications relayée début août 2026. Une enquête de Cisco révèle que 80% des dirigeants estiment que la survie concurrentielle de leur entreprise dépendra de l'IA agentique, alors que l'usage grand public de l'IA continue de s'accélérer. Une étude Bloomberg intitulée "The Future-Ready Enterprise", commandée par Tata Communications, montre que si trois dirigeants sur quatre considèrent l'IA comme une priorité au niveau du conseil d'administration, près des deux tiers des entreprises (65%) fonctionnent encore avec une infrastructure réseau transitoire ou obsolète. Le fossé est aussi une question de performance pure: les applications métier traditionnelles toléraient une latence de 100 à 500 millisecondes, tandis que les charges de travail IA critiques exigent désormais moins de 10 millisecondes. Kapil, vice-président des services réseau mondiaux chez Tata Communications, qualifie ce basculement de "paradigme de performance totalement différent", qui remet en cause les hypothèses de conception réseau ayant prévalu pendant des décennies. Cet écart entre les capacités des infrastructures existantes et les exigences de l'IA transforme directement la performance réseau en facteur de fiabilité et de coût. Traiter le réseau comme une simple couche de transport "au mieux" fait courir un risque que beaucoup d'entreprises ne découvrent qu'une fois leur déploiement défaillant en production: un modèle conçu pour la détection de fraude en temps réel ou l'optimisation de chaîne logistique perd toute utilité dès qu'une congestion retarde les données dont il dépend, chaque milliseconde de délai pouvant représenter un coût financier ou opérationnel direct. Kapil souligne que s'appuyer sur un réseau "au mieux" transforme des investissements de plusieurs millions de dollars dans une pile IA en pari à haut risque. La complexité s'accroît encore lorsque les données franchissent les frontières ou se connectent à des plateformes cloud internationales, où le manque de contrôle de bout en bout devient un frein opérationnel majeur. Cette complexité s'amplifie à mesure que les composants d'IA se répartissent entre cloud, périphérie (edge) et environnements d'entreprise. Les organisations se concentrent souvent sur la puissance de calcul et l'infrastructure de données, en négligeant le tissu réseau qui les relie, un angle mort qui se traduit par des goulots d'étranglement liés au trafic est-ouest à haute fréquence entre GPU. Cette distribution élargit aussi la surface à défendre: applications, utilisateurs et écosystèmes partenaires sont désormais dispersés entre cloud, SaaS, edge et terminaux, et les bots malveillants pilotés par IA représenteraient environ 37% du trafic en ligne, rendant plus difficile la distinction entre utilisateurs légitimes et menaces automatisées. Face à cela, de nombreuses entreprises ont empilé des outils cloisonnés, générant fragmentation et incohérence en matière de sécurité plutôt qu'une défense unifiée, ce qui pousse certaines à se tourner vers des approches de type SASE pour reprendre le contrôle.

InfrastructureActu
1 source
« Une architecture évolutive pour gérer le rythme des changements en IA »
2InfoQ AI 

« Une architecture évolutive pour gérer le rythme des changements en IA »

Quatre experts en architecture d'entreprise, Joe Price, Branimir Đurek, Pavlos Migkiros et Trevor Dearham, publient une analyse sur l'émergence des AI Gateways comme nouvelle brique d'infrastructure pour les systèmes d'intelligence artificielle agentique. Leur constat de départ est simple : les passerelles API traditionnelles ont été conçues pour des services déterministes aux schémas d'échange simples et prévisibles, des hypothèses que l'IA agentique, capable d'enchaîner des décisions autonomes et des appels d'outils variables, rend caduques. Face à ce décalage, un nombre croissant de responsables techniques dans les grandes entreprises se tournent vers une architecture dite évolutive, où l'AI Gateway agit comme un point de passage unique entre les agents IA et le reste du système d'information. Concrètement, ce plan de contrôle centralise plusieurs fonctions critiques jusqu'ici dispersées : les garde-fous de sécurité, le routage entre modèles, la gestion de l'identité des agents, les politiques encadrant leurs actions, ainsi que l'audit sémantique des échanges. L'enjeu est d'éviter les incidents coûteux, qu'il s'agisse de dérives de comportement, de failles de sécurité ou d'actions non maîtrisées prises par un agent autonome, tout en préservant la stabilité des plateformes existantes sans devoir les refondre entièrement. Cette approche s'inscrit dans une tendance plus large de l'industrie, où l'adoption rapide d'agents IA capables d'agir de façon autonome dans les systèmes d'entreprise oblige les équipes d'architecture à repenser leurs fondations. Plutôt que de multiplier des correctifs ponctuels à chaque nouvel usage de l'IA, les auteurs plaident pour un point d'ancrage unique et évolutif, capable d'absorber les changements rapides propres à ce domaine tout en gardant le contrôle sur la gouvernance, la traçabilité et la sécurité des déploiements.

InfrastructureOpinion
1 source
L'architecture de contexte remplace le RAG à mesure que les agents IA poussent la récupération d'information en entreprise à ses limites
3VentureBeat AI 

L'architecture de contexte remplace le RAG à mesure que les agents IA poussent la récupération d'information en entreprise à ses limites

Redis a lancé lundi Redis Iris, une plateforme de contexte et de mémoire conçue pour les agents d'intelligence artificielle en production. L'annonce vient du CEO Rowan Trollope et marque une évolution majeure dans la stratégie de l'entreprise, historiquement connue comme couche de cache pour les applications web. Redis Iris se positionne entre l'agent et les données dont il a besoin pour agir, en combinant cinq composants : Redis Data Integration (désormais en disponibilité générale), qui synchronise en continu les bases relationnelles, entrepôts et documents via des connecteurs pour Oracle, Snowflake, Databricks et Postgres ; un Context Retriever (en préversion) qui génère automatiquement des outils MCP à partir de modèles de données métier définis en Pydantic, avec contrôles d'accès appliqués côté serveur ; un serveur de mémoire agent pour conserver le contexte à court et long terme entre les sessions ; et Redis Flex, un moteur de stockage réécrit faisant tourner 99 % des données sur SSD et 1 % en RAM, réduisant le coût à un dixième du stockage purement en mémoire. La raison d'être de cette architecture tient à un déséquilibre structurel entre agents et humains. Trollope le formule clairement : les entreprises auront un nombre d'agents plusieurs ordres de grandeur supérieur à celui de leurs employés humains, ce qui génère une charge équivalente sur les systèmes backend. Les pipelines RAG classiques, construits pour des requêtes humaines ponctuelles, ne tiennent pas face au volume que produisent des agents opérant en continu. Redis inverse la logique : plutôt que de présupposer quelles données injecter dans le pipeline, il laisse l'agent tirer lui-même l'information via des interfaces construites pour lui. Le marché confirme l'urgence : selon le VB Pulse RAG Infrastructure Market Tracker du premier trimestre 2026, l'intention d'adoption du retrieval hybride a triplé de 10,3 % à 33,3 % entre janvier et mars, l'optimisation du retrieval est devenue la première priorité d'investissement enterprise devant l'évaluation, et les stacks de retrieval maison sont passées de 24,1 % à 35,6 % du marché. Redis n'est pas le seul acteur à repositionner son offre autour des couches de contexte agent, plusieurs fournisseurs de plateformes de données ayant fait des annonces similaires ces dernières semaines. Trollope tire le parallèle avec l'ère mobile : quand les systèmes bancaires conçus pour les guichets ont dû absorber des millions d'utilisateurs smartphone, Redis est devenu la couche de cache qui a évité une refonte totale des backends. La différence aujourd'hui, c'est que les agents ne peuvent pas écrire leur propre middleware : ils ont besoin, au moment de l'exécution, d'interfaces préparées en amont, ou ils s'arrêtent. La transition de l'infrastructure RAG vers des architectures de contexte dédiées aux agents semble donc moins être une tendance émergente qu'un basculement déjà en cours dans les grandes entreprises.

InfrastructureOpinion
1 source
Que cache le grand partenariat entre Meta et Amazon autour des puces CPU ?
4Le Big Data 

Que cache le grand partenariat entre Meta et Amazon autour des puces CPU ?

Le 24 avril 2026, Meta Platforms a officialisé un accord de plusieurs milliards de dollars avec Amazon Web Services portant sur l'accès à des dizaines de millions de cœurs de puces Graviton sur une durée estimée entre trois et cinq ans. Les puces concernées sont les Graviton5, gravées en 3 nanomètres, conçues en interne par Amazon via Annapurna Labs sur architecture Arm. Meta devient ainsi l'un des cinq plus grands clients de cette gamme de processeurs. Selon Nafea Bshara, vice-présidente d'AWS, le critère décisif pour Meta a été le rapport performance/prix, dans un contexte où les coûts d'infrastructure liés à l'IA atteignent des niveaux inédits. L'accord marque une rupture avec la logique purement GPU qui dominait les décisions d'infrastructure depuis deux ans et confirme un rééquilibrage profond des architectures de calcul à grande échelle. Ce retour des CPU au premier plan n'est pas un hasard. L'essor des agents IA, ces systèmes capables d'exécuter des tâches complexes de manière autonome, génère des besoins de calcul différents de ceux de l'entraînement des grands modèles. Les CPU jouent un rôle central dans les phases dites de post-entraînement, où les modèles sont ajustés pour des usages spécifiques, ainsi que dans la gestion de l'orchestration en amont et en aval des GPU. Loin de les remplacer, ils les complètent en optimisant l'ensemble de la chaîne de traitement. Pour Meta, qui déploie Meta AI à des centaines de millions d'utilisateurs et développe activement des expériences agentiques, la capacité à absorber des volumes massifs d'inférences à coût maîtrisé est devenue un avantage compétitif direct. Cet accord s'inscrit dans une stratégie d'infrastructure délibérément diversifiée. Meta multiplie les partenariats avec Nvidia, AMD et Arm Holdings, refusant toute dépendance à une architecture unique. La collaboration avec Amazon remonte à 2016, mais bascule ici vers un engagement sur une technologie CPU spécifique, ce qui est inédit dans leur relation. Sur le plan géographique, la majorité des déploiements sera réalisée aux États-Unis, dans un contexte de souveraineté technologique et de sécurisation des chaînes d'approvisionnement devenues des enjeux stratégiques. Du côté d'Amazon, valider Meta comme client de référence renforce la crédibilité des Graviton face aux solutions concurrentes et soutient une intégration verticale plus large : AWS vient d'annoncer 5 milliards de dollars supplémentaires investis dans Anthropic, qui utilisera elle aussi ces mêmes puces maison.

InfrastructureOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic