Aller au contenu principal
Infrastructure · Actu ·

AI Agenda Live : passer de la course aux tokens à la valeur, tirer le meilleur de chaque unité de calcul

Lors d'un récent panel animé par Phoebe Liu, de The Information, trois responsables du secteur ont expliqué comment ils tirent davantage de jetons de chaque unité de calcul : Marc Boroditsky, directeur commercial de Nebius, Mattie Toia, vice-présidente Infrastructure chez Uber, et Dion Harris, directeur senior des solutions d'infrastructure HPC et IA hyperscale chez NVIDIA. Nebius vient d'obtenir la note Platinum, le niveau le plus élevé du classement ClusterMAX de SemiAnalysis, qui soumet les fournisseurs de cloud GPU à des tests pratiques. Sa plateforme d'inférence, Nebius Token Factory, adapte ses optimisations à l'objectif de chaque client (vitesse, fiabilité, qualité ou prix), par exemple via le décodage spéculatif, où un petit modèle prédit les jetons suivants que le grand modèle valide en bloc, à partir du trafic propre au client. NVIDIA, de son côté, propose dans sa plateforme Dynamo une fonction qui retrouve les données déjà calculées dans le cache KV d'un cluster pour éviter de les recalculer. Uber affirme que ses coûts en jetons se sont stabilisés ces derniers mois malgré la montée des workflows agentiques, grâce à un cache appliqué à chaque sous-agent et à une meilleure visibilité donnée aux ingénieurs sur leur consommation. L'entreprise a aussi construit un « graphe de contexte » d'environ 24 millions de nœuds, issus de tickets Jira, de documents de conception et de revues de code, qui a fait passer certaines requêtes de 20 minutes à 30 secondes tout en consommant moins de jetons.

2 min de lecturePertinence 55

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de The Information AI. Lire l'article original →

Ces témoignages montrent que le débat sur la pénurie de calcul se déplace de l'accès aux GPU vers leur utilisation efficace. Marc Boroditsky résume ce virage comme le passage du « token maxing » au « value maxing » : mesurer le nombre de tours d'agent, de jetons et de dollars nécessaires pour atteindre un résultat concret, comme un document rédigé ou un formulaire rempli, plutôt que de maximiser le volume consommé. Pour les entreprises, cela signifie que la maîtrise des coûts de l'IA dépendra moins de la puissance brute achetée que de la discipline d'ingénierie : mesure de l'usage par utilisateur, mise en cache, réutilisation des calculs et qualité des données. Le message vaut aussi pour les fournisseurs, qui se différencient désormais par l'efficacité délivrée autant que par la capacité installée.

Les intervenants insistent sur le fait que ces gains relèvent de tout un écosystème. Selon Dion Harris, il faut bien plus qu'une puce pour déployer l'IA à grande échelle : l'association du matériel à des logiciels améliorés (réglage des noyaux, frameworks plus malins, outils de l'écosystème NVIDIA) peut multiplier les performances par 3 à 5 entre le premier jour et la cinquième année de vie d'une puce. Marc Boroditsky ajoute qu'aucun modèle ne l'emporte sur tous les usages et que la valeur vient de la solution de bout en bout. Mattie Toia recommande de mettre de l'ordre dans ses propres données, précieuses pour ancrer les modèles, et Boroditsky observe que les entreprises qui centralisent ces ressources obtiennent de meilleurs résultats. Sa prévision à cinq ans est que les sociétés leaders auront pris le contrôle de leur propre intelligence.

Impact France / UEChamp produit par Le Fil IA

Pas d\'impact direct sur la France/UE

À lire ensuite

01☕️ Les agences de renseignement américaines à court de puissance de calcul pour leurs IA43Next INpactInfrastructure 02Configurez des limites de débit pour le trafic IA sur la passerelle AgentCore35AWS ML BlogInfrastructure 03Repenser le coût total de l'IA : pourquoi le coût par token est la seule métrique qui compte30NVIDIA AI BlogInfrastructure 
Dossier · NVIDIASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.