Aller au contenu principal
Comment Shopify a construit un stack IA indifférent à la survie des modèles
InfrastructureVentureBeat AI · 2 min de lecture

Comment Shopify a construit un stack IA indifférent à la survie des modèles

Source originale ↗·
Comment Shopify a construit un stack IA indifférent à la survie des modèles
▶ Voir sur YouTube

Shopify a développé un proxy LLM maison qui connecte l'ensemble de ses ingénieurs à plusieurs fournisseurs d'IA en parallèle, avec basculement automatique en cas de panne ou de disparition d'un modèle. Quand Claude Fable 5 a été retiré du marché, aucun ingénieur de l'entreprise n'a été interrompu dans son travail : le système les a redirigés automatiquement vers Claude Opus ou GPT 5.5. Farhan Thawar, directeur de l'ingénierie chez Shopify, a détaillé cette architecture dans le podcast VentureBeat Beyond the Pilot. L'entreprise achète des tokens en volume auprès de plusieurs fournisseurs, et tous les utilisateurs passent par ce proxy unique qui centralise les rapports d'utilisation et gère la redondance. En cas d'indisponibilité d'un fournisseur, le transfert vers un autre est décrit comme "automatique et transparent". La plateforme interne Tangle permet à chacun de visualiser les pipelines d'IA en temps réel, et un tableau de bord de consommation suit les dépenses token par utilisateur, par discipline et par type de modèle.

Ce choix architectural donne à Shopify une indépendance réelle vis-à-vis des fournisseurs, là où la plupart des entreprises restent exposées aux mises à jour non concertées ou aux arrêts de modèles. La stratégie de distillation pousse l'avantage plus loin encore : un modèle "enseignant" (par exemple Opus 4.8) transfère ses capacités vers un modèle "élève" plus petit et spécialisé (par exemple Qwen 3.5) en une journée de pipeline. Le résultat est évalué automatiquement sur la vitesse, le coût et la précision pour une tâche précise. Dans certains cas, les gains atteignent un facteur 2 en coût et en latence ; dans des cas extrêmes, jusqu'à 30 fois moins cher et plus rapide. Ces modèles distillés alimentent notamment Sidekick, l'assistant IA phare de Shopify destiné aux marchands, conçu pour automatiser les tâches répétitives du quotidien. Les ingénieurs peuvent déployer directement sans processus d'approbation, ce qui accélère considérablement les cycles d'itération.

La démarche s'inscrit dans un contexte où le marché des modèles évolue à une vitesse difficile à anticiper : des modèles apparaissent, sont mis à jour silencieusement ou disparaissent en quelques mois. Shopify tire les conséquences pratiques de cette instabilité en construisant une infrastructure qui ne parie pas sur un seul acteur. Thawar évoque aussi une vision plus ambitieuse : à terme, le pipeline de distillation choisirait lui-même le meilleur modèle cible en fonction des données et des évaluations fournies, sans que l'ingénieur ait à le spécifier. "Peut-être que ça donnera un modèle si petit qu'il pourrait tourner sur un téléphone", dit-il. Des garde-fous existent également côté consommation : si un modèle tourne depuis plus de dix heures en accumulant des tokens, l'utilisateur reçoit une alerte lui demandant si la dépense est intentionnelle, une manière de concilier autonomie des équipes et maîtrise des coûts.

Impact France/UE

Les équipes d'ingénierie européennes déployant des LLMs en production peuvent s'inspirer directement de cette architecture multi-fournisseurs pour réduire leur exposition aux changements non concertés de modèles et optimiser leurs coûts par distillation.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

La construction de l'environnement d'entreprise pour l'IA à base d'agents
1MIT Technology Review 

La construction de l'environnement d'entreprise pour l'IA à base d'agents

Intel a mené plusieurs milliers d'expériences sur des charges de travail d'IA agentique afin d'identifier ce dont une entreprise a réellement besoin pour faire fonctionner des agents logiciels à grande échelle. Pour cela, le groupe a étendu Terminal-Bench, un outil open source de benchmark pour agents IA, en y ajoutant des capacités de profilage, de télémétrie et de rejeu. La méthode retenue repose sur un enregistrement déterministe des réponses des modèles de langage, rejouées ensuite à l'identique à chaque test : cela permet de mesurer la performance des agents indépendamment de la variabilité propre au LLM. Le panel de tâches utilisé était volontairement large : compilation, tests logiciels, opérations de bases de données, logique booléenne, interprétation, ray tracing, compression de données, algèbre linéaire, transcodage vidéo et entraînement de modèles de machine learning. Cette diversité visait à rapprocher les résultats des conditions réelles rencontrées en entreprise. De ces travaux, Intel tire cinq enseignements pratiques, dont l'idée centrale que l'IA agentique constitue un problème de système complet et non un simple enjeu d'inférence. Cette distinction a des conséquences concrètes pour les équipes qui déploient des agents en production. Plutôt que de se limiter aux métriques classiques d'évaluation des modèles, Intel recommande de suivre six indicateurs : le taux de réussite des tâches, le coût par tâche, le temps par tâche, le débit de traitement, la densité d'agents par vCPU et la latence. Le point le plus contre-intuitif concerne le dimensionnement des infrastructures : la bonne unité de mesure n'est pas le nombre brut d'agents déployés, mais la densité d'agents par processeur virtuel disponible. Ainsi, dix agents tournant sur un système à 8 vCPU et vingt agents sur un système à 16 vCPU se comportent de façon comparable, dès lors que la densité reste identique. Cela donne aux architectes un moyen fiable de comparer des capacités entre différentes tailles d'instances et générations de processeurs, et de calibrer leurs infrastructures selon les objectifs métier : les assistants interactifs orientés utilisateur exigent une densité plus faible pour préserver le temps de réponse, tandis que les traitements par lots, comme les flux de travail IT internes, peuvent tourner à densité plus élevée. Ces travaux s'inscrivent dans un contexte où l'IA agentique dépasse largement le cadre du chatbot conversationnel pour devenir un outil d'automatisation de bout en bout des processus métier, capable de planifier des tâches multi-étapes, d'appeler des outils, de lire des résultats et de relancer une action en cas d'échec. Intel préconise notamment de surveiller la latence réelle des tâches plutôt que la seule utilisation moyenne du CPU, et de privilégier une architecture en scale-out plutôt qu'en scale-up, cette dernière n'étant réservée qu'aux charges nécessitant davantage de calcul par agent ou soumises à des contraintes architecturales spécifiques. Ces recommandations visent à outiller les équipes techniques face à la montée en charge attendue des déploiements agentiques dans les prochains mois.

💬 Ce qui me marque le plus dans ce papier, c'est le changement d'unité de mesure. Intel affirme que compter les agents déployés ne veut rien dire : seule la densité d'agents par vCPU permet de comparer deux infras entre elles, dix agents sur 8 vCPU se comportant comme vingt sur 16. Reste qu'Intel a du silicium à vendre derrière cette grille de lecture, donc je la garde en tête sans la prendre pour argent comptant.

InfrastructureActu
1 source
Bristol Myers Squibb construit l'usine d'IA la plus avancée du secteur des sciences de la vie sur NVIDIA Vera Rubin
2NVIDIA AI Blog 

Bristol Myers Squibb construit l'usine d'IA la plus avancée du secteur des sciences de la vie sur NVIDIA Vera Rubin

Erin Davis appelle ça la "SuperDuperPOD". Bristol Myers Squibb (BMS), qui exploite déjà l'un des plus grands clusters d'IA du secteur pharmaceutique, a annoncé le déploiement de son second NVIDIA DGX SuperPOD, cette fois construit autour de huit systèmes DGX Vera Rubin NVL72. Combinant processeurs NVIDIA Vera et GPU Rubin, cette infrastructure est présentée comme le cluster d'IA le plus puissant et le plus économe en énergie du secteur des sciences de la vie, avec des performances jusqu'à 10 fois supérieures par mégawatt par rapport à l'infrastructure qu'elle remplace. Erin Davis, vice-présidente en charge de la recherche business et de la technologie chez BMS, explique que l'accès ne sera plus réservé à un petit groupe de chercheurs mais ouvert à l'ensemble des scientifiques de l'entreprise. La plateforme unifiée intégrera notamment le NVIDIA BioNeMo Agent Toolkit pour l'IA biologique, permettant prédictions, entraînement de modèles et flux de travail agentiques sur l'ensemble du pipeline de découverte de médicaments. Cette montée en puissance vise à transformer concrètement la recherche pharmaceutique. Selon Payal Sheth, nommée en janvier vice-présidente senior des sciences de découverte thérapeutique chez BMS après une carrière entière en laboratoire, l'objectif est de passer d'un discours abstrait sur les capacités de l'IA à un impact mesurable. BMS exploite déjà un DGX SuperPOD depuis environ trois ans, avec des résultats concrets : l'identification de cibles thérapeutiques assistée par IA fait gagner des semaines de travail manuel aux chercheurs, qui peuvent se concentrer sur les décisions scientifiques à plus forte valeur ajoutée. L'entreprise a notamment utilisé l'IA pour étoffer sa bibliothèque de composés CELMoD, des molécules conçues pour dégrader sélectivement les protéines responsables de cancers, avec des applications contre les cancers du sang et au-delà, ouvrant la voie à de nouvelles cibles thérapeutiques. Sheth évoque aussi une méthodologie baptisée "Predict First", qui utilise des prédictions computationnelles pour prioriser la synthèse des molécules les plus prometteuses et écarter en amont celles qui ne répondraient pas aux critères recherchés, économisant ainsi des expériences de laboratoire coûteuses. Cette dépendance croissante à l'IA a fait exploser les besoins en calcul de l'organisation de recherche. "Nous sommes saturés", résume Davis, évoquant des prédictions à grande échelle sur de grosses molécules et l'entraînement de modèles fondationnels maison, très gourmands en GPU. D'où l'arrivée de ce nouveau système, présenté en interne comme la promesse d'un "calcul sans limites" pour les chercheurs. Davis, chimiste computationnelle de formation, a passé une quinzaine d'années côté éditeurs technologiques, chez ChemAxon, Schrödinger puis X-Chem, avant de rejoindre BMS convaincue que le vrai goulot d'étranglement de l'industrie pharmaceutique n'était pas la technologie elle-même, mais sa mise à disposition effective des scientifiques et la capacité à en tirer des enseignements. Cette conviction, dit-elle, est aussi nourrie par une expérience personnelle : son père est mort il y a cinq ans d'une maladie que la recherche pharmaceutique n'est pas encore parvenue à vaincre.

InfrastructureActu
1 source
D&B a reconstruit sa base de 642 millions d'entreprises pour les agents IA
3VentureBeat AI 

D&B a reconstruit sa base de 642 millions d'entreprises pour les agents IA

Dun & Bradstreet, entreprise vieille de 180 ans spécialisée dans les données commerciales, vient d'annoncer une refonte complète de son infrastructure de données pour la rendre compatible avec les agents d'intelligence artificielle. Son "Commercial Graph" couvre 642 millions d'entreprises, soit presque le double des 300 millions de dossiers qu'il contenait il y a cinq ans, avec 11 000 champs par enregistrement et 100 milliards de vérifications qualité effectuées chaque mois. Cette base de données, utilisée par près de 200 000 clients dans le monde, analystes crédit, gestionnaires de risques, commerciaux, était conçue pour des humains capables d'attendre quelques secondes et d'interpréter des résultats ambigus. Quand les clients de D&B ont commencé à intégrer des agents IA dans leurs workflows de crédit, d'achats et de chaîne d'approvisionnement, l'architecture existante s'est révélée incompatible. Gary Kotovets, directeur des données et de l'analytique chez D&B, a expliqué à VentureBeat que l'entreprise devait désormais considérer les agents comme une nouvelle catégorie de consommateurs à part entière. Le problème fondamental est que les agents IA ne peuvent pas fonctionner avec des systèmes fragmentés, des latences élevées ou des relations statiques entre entités. Là où un analyste humain naviguait à travers plusieurs bases de données hétérogènes via des requêtes SQL, un agent a besoin d'une réponse en moins d'une seconde, d'une résolution d'entité vérifiée, et de relations dynamiques : si un PDG quitte une entreprise pour une autre, le dossier de risque doit suivre en temps réel ; si une filiale change de propriétaire, la hiérarchie complète doit se mettre à jour automatiquement. D&B a donc migré ses bases vers le cloud, redessiné son schéma de données, construit une couche de "data fabric" unifiant les enregistrements à l'échelle mondiale tout en respectant les contraintes réglementaires régionales, puis exposé l'ensemble via des outils MCP (Model Context Protocol) qui permettent aux agents d'interroger des données structurées avec leur contexte. Un moteur de résolution d'entités valide chaque requête pour garantir qu'une demande portant sur une entreprise renvoie bien vers un enregistrement unique et vérifié. L'entreprise a également créé un nouveau modèle d'authentification spécifique aux agents, distincts des utilisateurs humains. Ce chantier illustre une réalité que Kotovets dit avoir entendue de la bouche de centaines de directeurs des données et directeurs informatiques au cours des six derniers mois : les ambitions en matière d'IA se heurtent systématiquement à des fondations de données non standardisées et inexploitables par des machines. D&B, pourtant l'une des entreprises les mieux dotées en données commerciales structurées au monde, a quand même dû tout reconstruire. La montée en puissance des agents autonomes dans les processus métier critiques, évaluation du risque fournisseur, scoring crédit, due diligence, crée une pression inédite sur les fournisseurs de données pour qu'ils passent d'une logique de consultation humaine à une logique d'alimentation machine en temps réel. D&B se positionne ainsi en infrastructure de référence pour les agents d'entreprise, à un moment où MCP s'impose progressivement comme standard d'interopérabilité entre agents et sources de données.

UELes entreprises européennes clientes de D&B pour le risque crédit ou fournisseur peuvent désormais connecter leurs agents IA à cette base via MCP, dans le respect des contraintes réglementaires régionales incluant le RGPD.

💬 Si D&B, avec 180 ans de données commerciales structurées, a quand même dû tout reconstruire pour les agents IA, ton stack de données a peu de chances de s'en tirer sans casse. C'est le vrai enseignement de cet article, pas les 642 millions d'entreprises ou les 11 000 champs par dossier. Les agents ne tolèrent pas l'ambiguïté, pas la latence, pas les silos, et ça va forcer une vague de refonte data que beaucoup n'ont pas encore budgétisée.

InfrastructureActu
1 source
Comment xAI Colossus redéfinit les règles de la course à l’IA
4Le Big Data 

Comment xAI Colossus redéfinit les règles de la course à l’IA

En mars 2023, Elon Musk fonde xAI pour affronter directement OpenAI, Google et Meta dans la course aux grands modèles de langage. Le premier modèle, Grok, sort fin 2023 avec des résultats prometteurs, mais l'entreprise se heurte rapidement à un obstacle structurel majeur : elle ne possède aucune infrastructure propre et loue sa puissance de calcul auprès de fournisseurs cloud comme Oracle. Pour briser cette dépendance, Musk lance dès le printemps 2024 un chantier d'une rapidité inédite. xAI rachète une ancienne usine Electrolux de 73 000 mètres carrés à Memphis, Tennessee, et y déploie le supercalculateur Colossus. Début 2026, le site concentre environ 555 000 processeurs NVIDIA interconnectés, principalement des H100 et H200 dans le premier bloc (Colossus 1), et la nouvelle architecture Blackwell GB200/GB300 dans le second (Colossus 2), auxquels s'ajoute une extension satellitaire en cours à Southaven. À près de 35 000 dollars l'unité, le seul achat des composants dépasse les 18 milliards de dollars. Cette infrastructure redéfinit les rapports de force dans l'industrie de l'IA. En contrôlant son propre parc de calcul, xAI s'affranchit des délais et des contraintes imposés par les fournisseurs tiers, ce qui lui permet d'accélérer l'entraînement de ses modèles au rythme qu'elle impose. La densité thermique extrême générée par 555 000 puces a nécessité l'abandon du refroidissement par air au profit d'un système à eau intégral en circuit fermé, fourni par Dell et Supermicro, qui capte la chaleur directement sur le silicium et réduit significativement les coûts d'électricité liés à la climatisation. Sur le plan réseau, xAI a fait le choix de rejeter l'InfiniBand, standard dominant mais coûteux et en rupture mondiale, pour déployer la plateforme NVIDIA Spectrum-X Ethernet, avec routage adaptatif et protocole RoCE, afin d'éliminer la latence de queue qui paralyse les clusters lors des échanges massifs de paramètres entre processeurs. Ce projet s'inscrit dans une rivalité technologique et géopolitique qui dépasse largement xAI. La puissance de calcul est devenue la ressource stratégique centrale de l'IA : qui contrôle les clusters contrôle le rythme d'innovation. Microsoft, Google et Amazon ont chacun engagé des dizaines de milliards dans leurs propres datacenters, tandis que la pénurie mondiale de puces NVIDIA maintient une pression constante sur les acteurs moins capitalisés. En construisant Colossus en moins d'un an, là où l'industrie estimait le délai à deux ans minimum, xAI a envoyé un signal clair sur sa capacité d'exécution. La prochaine étape sera de transformer cette puissance brute en avance technologique durable face à des concurrents qui ne restent pas immobiles.

UELa concentration de capacité de calcul chez les acteurs américains creuse l'écart avec les laboratoires et startups européens, renforçant leur dépendance aux infrastructures cloud extérieures à l'UE.

InfrastructureOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic