AI Agenda Live : passer de la course aux tokens à la valeur, tirer le meilleur de chaque unité de calcul
Lors d'un récent panel animé par Phoebe Liu, de The Information, trois responsables du secteur ont expliqué comment ils tirent davantage de jetons de chaque unité de calcul : Marc Boroditsky, directeur commercial de Nebius, Mattie Toia, vice-présidente Infrastructure chez Uber, et Dion Harris, directeur senior des solutions d'infrastructure HPC et IA hyperscale chez NVIDIA. Nebius vient d'obtenir la note Platinum, le niveau le plus élevé du classement ClusterMAX de SemiAnalysis, qui soumet les fournisseurs de cloud GPU à des tests pratiques. Sa plateforme d'inférence, Nebius Token Factory, adapte ses optimisations à l'objectif de chaque client (vitesse, fiabilité, qualité ou prix), par exemple via le décodage spéculatif, où un petit modèle prédit les jetons suivants que le grand modèle valide en bloc, à partir du trafic propre au client. NVIDIA, de son côté, propose dans sa plateforme Dynamo une fonction qui retrouve les données déjà calculées dans le cache KV d'un cluster pour éviter de les recalculer. Uber affirme que ses coûts en jetons se sont stabilisés ces derniers mois malgré la montée des workflows agentiques, grâce à un cache appliqué à chaque sous-agent et à une meilleure visibilité donnée aux ingénieurs sur leur consommation. L'entreprise a aussi construit un « graphe de contexte » d'environ 24 millions de nœuds, issus de tickets Jira, de documents de conception et de revues de code, qui a fait passer certaines requêtes de 20 minutes à 30 secondes tout en consommant moins de jetons.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Information AI. Lire l'article original →
Ces témoignages montrent que le débat sur la pénurie de calcul se déplace de l'accès aux GPU vers leur utilisation efficace. Marc Boroditsky résume ce virage comme le passage du « token maxing » au « value maxing » : mesurer le nombre de tours d'agent, de jetons et de dollars nécessaires pour atteindre un résultat concret, comme un document rédigé ou un formulaire rempli, plutôt que de maximiser le volume consommé. Pour les entreprises, cela signifie que la maîtrise des coûts de l'IA dépendra moins de la puissance brute achetée que de la discipline d'ingénierie : mesure de l'usage par utilisateur, mise en cache, réutilisation des calculs et qualité des données. Le message vaut aussi pour les fournisseurs, qui se différencient désormais par l'efficacité délivrée autant que par la capacité installée.
Les intervenants insistent sur le fait que ces gains relèvent de tout un écosystème. Selon Dion Harris, il faut bien plus qu'une puce pour déployer l'IA à grande échelle : l'association du matériel à des logiciels améliorés (réglage des noyaux, frameworks plus malins, outils de l'écosystème NVIDIA) peut multiplier les performances par 3 à 5 entre le premier jour et la cinquième année de vie d'une puce. Marc Boroditsky ajoute qu'aucun modèle ne l'emporte sur tous les usages et que la valeur vient de la solution de bout en bout. Mattie Toia recommande de mettre de l'ordre dans ses propres données, précieuses pour ancrer les modèles, et Boroditsky observe que les entreprises qui centralisent ces ressources obtiennent de meilleurs résultats. Sa prévision à cinq ans est que les sociétés leaders auront pris le contrôle de leur propre intelligence.
Pas d\'impact direct sur la France/UE