L'assistant IA de Writer réduit la consommation de tokens de près de 40 %, sans perte de précision
Writer, l'entreprise d'IA générative dirigée par le CTO et cofondateur Waseem AlShikh, a publié une étude qui s'attaque à un problème central de l'IA en entreprise : l'explosion des coûts liés à la consommation de tokens dans les systèmes agentiques. Les chercheurs se sont penchés sur le « harness », la couche d'orchestration qui entoure le modèle de langage et gère le routage, le formatage et l'exécution des tâches, plutôt que sur le modèle lui-même. En optimisant cette couche via la mise en cache des prompts systèmes, la compaction de l'historique des interactions, une meilleure gestion des outils, des stratégies de récupération d'information plus précises et une gestion des erreurs plus rigoureuse, l'équipe a obtenu une réduction du coût par tâche réussie allant jusqu'à 61%, avec une baisse de près de 40% du nombre de tokens consommés par tâche, sans dégrader la qualité des résultats et sans modifier ni réentraîner le modèle de fondation sous-jacent.
Cette avancée répond directement à ce que Writer qualifie de « tokenmaxxing », une pratique répandue chez les développeurs qui consiste à s'appuyer sur des fenêtres de contexte massives et une consommation de tokens à outrance plutôt que de concevoir des workflows intelligents. Selon AlShikh, cette habitude s'est imposée parce qu'elle constitue la solution la plus rapide dans l'instant, calquée sur les réflexes du développement logiciel traditionnel: générer, exécuter, échouer, puis renvoyer l'erreur et davantage de contexte dans la fenêtre avant de réessayer. Le problème est que la baisse du prix par token masque une inefficacité croissante: dans les workflows agentiques, le nombre de tokens par tâche augmente à chaque boucle, car le contexte grandissant est retransmis intégralement à chaque itération, et cette croissance dépasse largement la vitesse à laquelle les prix chutent. Résultat, des équipes envoient par défaut des tâches simples vers des modèles premium coûteux, utilisent le LLM comme un moteur de recherche paresseux en saturant le contexte de documents bruts, ou laissent des boucles agentiques non maîtrisées s'emballer dès qu'une erreur survient, ce qui pèse lourdement sur les factures compte tenu du coût plus élevé des tokens de sortie par rapport aux tokens d'entrée chez tous les grands fournisseurs.
L'étude souligne que les techniques d'efficacité existantes, comme la compression de prompts, le raisonnement budgétisé, la génération de code minimal ou le décodage spéculatif, échouent car elles optimisent le modèle isolément sans jamais s'attaquer à la couche d'orchestration elle-même. En démontrant que des gains substantiels sont possibles simplement en repensant le harness, sans toucher au modèle de fondation ni engager de coûts de fine-tuning, les chercheurs de Writer offrent aux équipes d'ingénierie un levier directement actionnable et sous leur contrôle total. Dans un contexte où l'adoption de l'IA agentique en entreprise se heurte de plus en plus à un paradoxe de rentabilité, où les expériences produit fonctionnent bien mais les coûts de déploiement en production deviennent insoutenables, cette approche pourrait inciter davantage d'acteurs du secteur à concentrer leurs efforts d'optimisation sur l'architecture des systèmes plutôt que sur la seule course aux modèles les plus puissants ou aux prix de tokens les plus bas.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




