L'IA devient le premier client de l'IA : l'usage de tokens par des agents autonomes est multiplié par 14 sur OpenRouter
Depuis le 6 février 2025, les agents d'intelligence artificielle consomment désormais davantage de tokens que les humains sur OpenRouter, la plateforme qui agrège l'accès à de multiples modèles de langage. L'usage dit "agentique", c'est-à-dire généré par des IA opérant de façon autonome plutôt que par des requêtes humaines directes, a été multiplié par 14 depuis cette date, tandis que la consommation humaine n'a progressé que de 2,8 fois sur la même période. Fait notable, près de 70 % de la consommation de tokens par les agents provient de prompts mis en cache, une technique qui réduit fortement les coûts de calcul par rapport à un traitement classique. Résultat, la facture réelle augmente beaucoup plus lentement que ne le suggèrent les volumes bruts de tokens traités.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette bascule marque un tournant pour l'industrie de l'IA, où les modèles ne servent plus seulement des utilisateurs humains mais deviennent eux-mêmes les principaux clients d'autres systèmes d'IA, dans des chaînes d'agents qui s'appellent, se coordonnent et négocient entre eux. Pour les fournisseurs de modèles et les plateformes comme OpenRouter, cela change la nature de la demande à anticiper, moins pilotée par des pics d'usage humain que par des boucles automatisées tournant en continu. Le rôle central du cache montre aussi que la rentabilité de ces déploiements dépend directement de l'optimisation technique de l'inférence plutôt que du seul volume de requêtes.
Ce basculement s'inscrit dans la montée en puissance des architectures agentiques, où des assistants autonomes exécutent des tâches complexes en enchaînant plusieurs appels à des modèles, souvent avec des contextes répétitifs propices à la mise en cache. OpenRouter, en position d'observateur privilégié du marché grâce à son rôle d'intermédiaire entre développeurs et fournisseurs de modèles, offre ainsi l'un des premiers indicateurs chiffrés de cette transition. La question qui se pose désormais pour les acteurs du secteur, d'OpenAI à Anthropic en passant par les fournisseurs d'infrastructure, est celle du dimensionnement de leurs capacités face à une demande de plus en plus générée par des machines elles-mêmes.
Pas d'impact direct sur la France/UE
L'IA qui devient cliente de l'IA, c'est le vrai signal derrière ce chiffre : on n'est plus dans une croissance tirée par des humains qui posent plus de questions, mais par des agents qui tournent en boucle et s'appellent entre eux, 24h/24. Le détail qui compte, c'est les 70% de cache : ça veut dire que la facture n'explose pas aussi vite que le volume brut, et que la vraie bataille de rentabilité se joue maintenant sur l'optimisation de l'inférence, pas sur le nombre de requêtes. Reste que dimensionner une infra pour des boucles automatisées qui ne dorment jamais, c'est un problème complètement différent que d'absorber des pics d'usage humain, et personne n'a encore la réponse.