Aller au contenu principal
InfrastructureLe Big Data · 2 min de lecture

Infinity : comment d’anciens chercheurs d’OpenAI et d’Anthropic veulent transformer l’inférence IA ?

Source originale ↗·

Infinity, une startup fondée il y a moins d'un an par Jeremy Nixon, ancien chercheur chez Google Brain et cofondateur de la communauté AGI House, vient de boucler une levée de fonds de 15 millions de dollars qui porte sa valorisation à 100 millions de dollars. Le tour de table réunit Touring Capital, Principal VC, plusieurs dirigeants de l'industrie des semi-conducteurs ainsi que des chercheurs issus d'OpenAI et d'Anthropic. Plutôt que de développer un nouveau modèle de langage, l'entreprise se concentre sur les logiciels d'inférence, la couche technique qui permet aux puces d'IA d'exploiter pleinement leurs performances. Son produit phare, Ignition, est un agent d'IA capable d'écrire, tester et optimiser automatiquement les noyaux logiciels nécessaires au fonctionnement des modèles sur une nouvelle architecture matérielle. Premier partenariat industriel de la jeune pousse, la collaboration avec le fabricant de puces d-Matrix a permis d'atteindre jusqu'à 92 % des performances théoriques maximales de sa puce Corsair, et ce en seulement dix heures de tests, avant un déploiement de plusieurs modèles récents en une dizaine de jours.

Cette avancée s'attaque à un problème central du secteur des semi-conducteurs pour l'IA : de nombreux fabricants conçoivent aujourd'hui des accélérateurs performants, mais peinent à rivaliser avec NVIDIA, dont l'avantage repose autant sur ses GPU que sur son écosystème logiciel CUDA, mûri depuis près de vingt ans. En automatisant un travail d'optimisation qui mobilisait auparavant des équipes d'ingénieurs pendant plusieurs mois voire plusieurs années, Ignition promet de réduire ce délai à quelques jours, les experts conservant la supervision de l'architecture globale pendant que l'agent traite les tâches répétitives. Pour les fabricants de puces alternatives, cela change la donne économique de l'adoption : un environnement logiciel mature devient accessible sans qu'il faille reconstituer, puce par puce, l'écosystème que NVIDIA a mis des années à bâtir. Le modèle économique d'Infinity accompagne cette ambition puisque l'entreprise partage les gains de performance et les économies générées avec ses partenaires, plutôt que de vendre une licence logicielle classique.

Cette trajectoire illustre un déplacement plus large dans l'écosystème de l'IA. Après plusieurs années où l'essentiel de l'attention et des capitaux allait au développement des modèles de fondation chez OpenAI, Anthropic ou Google, une nouvelle génération d'entrepreneurs issus de ces mêmes laboratoires se tourne vers les infrastructures qui feront tourner l'IA de demain, plus rapides, moins coûteuses et compatibles avec un plus grand nombre de matériels. Infinity ambitionne ainsi de bâtir une bibliothèque d'inférence universelle, capable de fonctionner sur GPU, puces spécialisées ou autres accélérateurs, avec l'objectif de fragiliser la position dominante de NVIDIA sur le marché des semi-conducteurs pour l'IA.

Dans nos dossiers

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Anthropic et Micron veulent co-concevoir l'architecture mémoire pour l'IA
1The Decoder 

Anthropic et Micron veulent co-concevoir l'architecture mémoire pour l'IA

Micron Technology rejoint le tour de table Series H d'Anthropic en tant qu'investisseur stratégique, et signe dans la foulée un accord pluriannuel pour fournir des composants mémoire destinés à l'infrastructure qui fait tourner Claude. L'opération témoigne d'une intégration croissante entre fabricants de puces et laboratoires d'IA : plutôt qu'une simple relation client-fournisseur, les deux entreprises entendent co-concevoir l'architecture mémoire adaptée aux exigences spécifiques de l'entraînement et de l'inférence des grands modèles de langage. Tom Brown, co-fondateur d'Anthropic, souligne que la mémoire constitue un élément critique aussi bien pour entraîner Claude que pour le faire fonctionner à l'échelle. Ce partenariat garantit à Anthropic un approvisionnement prioritaire et une feuille de route matérielle alignée sur ses besoins, au moment où la compétition pour les ressources de calcul s'intensifie entre OpenAI, Google DeepMind et Meta. Pour Micron, c'est l'occasion de s'imposer comme fournisseur incontournable dans la chaîne d'approvisionnement de l'IA générative, un marché en croissance rapide dominé jusqu'ici par SK Hynix et Samsung. Ce type d'accord croisé, où un fournisseur investit dans son propre client, suscite des critiques de la part d'analystes qui voient dans ces montages financiers un mécanisme d'inflation artificielle des valorisations dans le secteur. L'action Micron a bondi de plus de dix fois en l'espace d'un an, portée par l'engouement pour l'IA. La question de savoir si ces partenariats traduisent une création de valeur réelle ou alimentent une bulle spéculative reste ouverte, alors que les investissements dans l'infrastructure IA continuent d'atteindre des sommets historiques.

InfrastructureOpinion
1 source
Micron et Anthropic s’allient pour renforcer l’infrastructure IA de nouvelle génération
2Le Big Data 

Micron et Anthropic s’allient pour renforcer l’infrastructure IA de nouvelle génération

Micron Technology et Anthropic ont annoncé le 22 juin 2026 un accord stratégique multidimensionnel qui couvre quatre axes : la co-conception d'architectures de mémoire et de stockage optimisées pour l'IA, un contrat d'approvisionnement à long terme portant sur l'ensemble du portefeuille de solutions pour centres de données de Micron, le déploiement interne de Claude dans les équipes de Micron, et une participation financière du fabricant de semi-conducteurs au tour de financement Série H d'Anthropic. Les deux entreprises travailleront conjointement sur les technologies de mémoire HBM (High Bandwidth Memory), les modules DRAM haute performance et les SSD destinés aux data centers, ces composants étant au cœur des infrastructures utilisées pour entraîner et faire tourner les modèles Claude. Tom Brown, cofondateur d'Anthropic et responsable des ressources de calcul, a souligné que la mémoire et le stockage jouent désormais un rôle central dans l'efficacité des systèmes d'entraînement et d'inférence de l'entreprise. L'accord illustre un changement de paradigme dans l'industrie de l'IA : les performances d'un modèle dépendent autant de l'infrastructure matérielle sous-jacente que des avancées algorithmiques. Si les GPU concentrent souvent l'attention, la capacité à les alimenter en données à très haute vitesse est devenue un facteur déterminant pour les coûts, les performances et la consommation énergétique des infrastructures à grande échelle. En optimisant directement les sous-systèmes mémoire utilisés par Anthropic, les deux partenaires cherchent à réduire le coût unitaire de chaque requête traitée par Claude, un levier concurrentiel décisif à mesure que le marché de l'IA générative se masse-marketise. L'accord d'approvisionnement sécurise par ailleurs la croissance d'Anthropic sur plusieurs années, limitant les risques de pénurie de composants critiques dans un marché en tension. Ce partenariat s'inscrit dans une stratégie plus large d'Anthropic visant à consolider ses fondations matérielles face à l'accélération de la demande autour de Claude. Reuters relevait récemment qu'Anthropic a multiplié les accords destinés à renforcer ses capacités de calcul, au moment même où le laboratoire enchaîne les levées de fonds record pour rivaliser avec OpenAI et Google DeepMind. Pour Micron, l'opération représente une opportunité de positionner ses technologies HBM comme composants de référence dans les futures générations d'infrastructure IA, un marché en croissance explosive. La collaboration technique directe avec un laboratoire de premier plan lui permet d'anticiper les besoins des prochains modèles et d'adapter son offre bien en amont, transformant un client potentiel en co-développeur.

InfrastructureOpinion
1 source
Anthropic débauche le deuxième ingénieur en puces d'OpenAI alors que les deux sociétés visent la bourse
3The Decoder 

Anthropic débauche le deuxième ingénieur en puces d'OpenAI alors que les deux sociétés visent la bourse

Anthropic a recruté Clive Chan, qu'il décrit lui-même comme le deuxième ingénieur hardware à avoir rejoint le programme de puces personnalisées d'OpenAI. Chan apporte avec lui une expérience rare : il a travaillé sur l'ASIC Autopilot de Tesla avant de contribuer au partenariat stratégique entre OpenAI et Broadcom, le géant des semi-conducteurs, pour développer des puces d'inférence sur mesure. Le recrutement intervient alors que les deux entreprises se préparent activement à entrer en bourse. Ce débauchage ciblé signale qu'Anthropic envisage sérieusement de concevoir ses propres puces d'intelligence artificielle, une étape que la société n'a pas encore franchie publiquement. Pour une startup valorisée à plusieurs dizaines de milliards de dollars, disposer d'une infrastructure silicium propriétaire représente un levier majeur de réduction des coûts et d'indépendance vis-à-vis de Nvidia, dont les GPU H100 et H200 dominent encore massivement le marché de l'entraînement et de l'inférence. Attirer un ingénieur ayant déjà traversé ce processus chez un concurrent direct accélère considérablement la courbe d'apprentissage. La course aux puces maison s'est intensifiée dans tout le secteur : Google dispose de ses TPU, Amazon de ses Trainium et Inferentia, Meta de ses MTIA. OpenAI avait annoncé début 2024 son intention de développer ses propres accélérateurs en collaboration avec Broadcom, avant de signer un accord massif avec SoftBank pour sécuriser des capacités de calcul. Le départ de l'un de ses pionniers hardware vers Anthropic, à quelques mois d'une potentielle introduction en bourse pour les deux acteurs, illustre la bataille de talents qui se joue en coulisses autant que la compétition technologique.

UELa course aux puces IA propriétaires entre géants américains renforce la dépendance technologique européenne vis-à-vis des fournisseurs US, sans impact direct immédiat sur la France ou l'UE.

💬 Le recrutement du deuxième ingénieur puces d'OpenAI, c'est pas anodin. Quand tu cibles quelqu'un qui a déjà fait le chemin chez un concurrent direct, tu brûles les étapes, et Anthropic le sait. Reste à voir si l'IPO va accélérer les investissements silicium ou si c'est encore du positionnement pour les roadshows.

InfrastructureOpinion
1 source
NVIDIA et Google réduisent les coûts d'inférence en IA
4AI News 

NVIDIA et Google réduisent les coûts d'inférence en IA

Lors de la conférence Google Cloud Next, Google et NVIDIA ont dévoilé une nouvelle génération d'infrastructure destinée à réduire drastiquement le coût de l'inférence IA à grande échelle. Les deux entreprises ont présenté les instances A5X bare-metal, reposant sur les systèmes rack NVIDIA Vera Rubin NVL72. Cette architecture promet une réduction jusqu'à dix fois du coût d'inférence par token par rapport aux générations précédentes, tout en multipliant par dix le débit de tokens par mégawatt. Pour atteindre ces performances, les instances A5X combinent les SuperNICs NVIDIA ConnectX-9 avec la technologie réseau Google Virgo, permettant de connecter jusqu'à 80 000 GPU NVIDIA Rubin au sein d'un même site, et jusqu'à 960 000 GPU dans un déploiement multi-sites. Mark Lohmeyer, VP et directeur général de l'infrastructure IA chez Google Cloud, a résumé l'enjeu : "La prochaine décennie de l'IA sera façonnée par la capacité des entreprises à faire tourner leurs charges de travail les plus exigeantes sur une infrastructure vraiment intégrée et optimisée pour l'IA." Ces annonces ont un impact direct sur les secteurs fortement réglementés, comme la finance et la santé, qui butent régulièrement sur des contraintes de souveraineté des données. Google et NVIDIA y répondent avec plusieurs initiatives concrètes : les modèles Gemini fonctionnant sur GPU NVIDIA Blackwell et Blackwell Ultra sont désormais disponibles en préversion sur Google Distributed Cloud, ce qui permet aux organisations de garder les modèles frontier entièrement dans leur environnement contrôlé, au plus près de leurs données sensibles. La sécurité est assurée par NVIDIA Confidential Computing, un protocole de chiffrement matériel qui protège les données d'entraînement et les prompts y compris vis-à-vis des opérateurs cloud eux-mêmes. Pour les environnements cloud public multi-tenant, des VM Confidential G4 équipées de GPU NVIDIA RTX PRO 6000 Blackwell sont également introduites en préversion, marquant la première offre de confidential computing cloud pour des GPU Blackwell. Cette collaboration s'inscrit dans une course plus large à l'optimisation de l'inférence, alors que les coûts opérationnels de l'IA générative restent un frein majeur à son adoption industrielle. Au-delà du matériel, le partenariat couvre aussi la couche logicielle : NVIDIA Nemotron 3 Super est désormais disponible sur la Gemini Enterprise Agent Platform, permettant aux développeurs de construire des systèmes agentiques complexes capables de raisonner, planifier et agir en chaîne. L'ensemble de la plateforme NVIDIA sur Google Cloud est optimisé pour les familles de modèles Gemini et Gemma. Avec des clusters dépassant le million de GPU et une ambition affichée de simplifier le déploiement d'IA souveraine, Google et NVIDIA repositionnent l'infrastructure cloud non plus comme un simple fournisseur de puissance de calcul, mais comme un levier stratégique pour les entreprises qui veulent industrialiser l'IA sans sacrifier performance, coût ou conformité réglementaire.

UELes entreprises européennes des secteurs réglementés (finance, santé) disposent désormais d'options d'infrastructure IA souveraine compatibles avec les exigences RGPD, réduisant un frein concret à l'industrialisation de l'IA en Europe.

InfrastructureActu
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic