Aller au contenu principal
OutilsMarkTechPost · 2 min de lecture

Token Saver : une extension MCP open source avec RAG hybride local pour réduire de 90 à 99 % le coût en tokens des PDF sur Claude

Source originale ↗·

Marktechpost AI Media Inc vient de publier Token Saver, une extension open source sous licence MIT pour le protocole MCP (Model Context Protocol) de Claude Desktop, actuellement en version 1.0. L'outil a été développé par Arnav Rai, étudiant en informatique au Rochester Institute of Technology, durant son stage chez Marktechpost, sous la supervision de Jean-Marc Mommessin et Asif Razzaq. Token Saver repose sur un système de RAG hybride local qui s'exécute directement sur la machine de l'utilisateur : le fichier PDF n'est jamais envoyé au modèle. Concrètement, l'extension combine deux méthodes de recherche, une correspondance par mots-clés via le moteur FTS5 de SQLite (pondérée à 0,4) et une recherche sémantique par similarité cosinus reposant sur le modèle d'embeddings local all-MiniLM-L6-v2 (pondérée à 0,6). Le traitement suit huit étapes : extraction du texte via pypdfium2 (avec pypdf en secours), découpage en passages de 180 mots avec un chevauchement de 40 mots, notation hybride, filtrage qualité (seuil de similarité sémantique de 0,25 pour les passages sans mot-clé commun), déduplication, réduction aux phrases pertinentes, plafonnement du volume transmis à 8 000 caractères, puis mise en forme avec citation précise de la page source. Résultat annoncé : une réduction de la consommation de tokens de 92 à 99 %, sans configuration Python ni ligne de commande.

Le problème visé est bien connu des utilisateurs intensifs de Claude : lorsqu'un PDF volumineux est ajouté à une conversation, il n'est pas facturé une seule fois. Comme l'historique complet est renvoyé au modèle à chaque nouveau message, le document entier est repayé à chaque question de suivi. Or Claude convertit par défaut chaque page en image tout en extrayant le texte séparément, ce qui représente déjà 1 500 à 3 000 tokens par page rien que pour le texte. Le Prompt Caching et les Projects de Claude atténuent la facture mais ne changent rien au fait que le document complet transite par les serveurs du fournisseur. Pire, faire chercher deux paragraphes utiles dans un document de mille pages par le modèle lui-même est coûteux et propice aux hallucinations.

Cette initiative s'inscrit dans une tendance plus large de RAG local et de traitement de documents "on-device", portée par la multiplication des outils MCP autour de Claude Desktop depuis l'ouverture du protocole par Anthropic. En gardant le fichier sur le disque de l'utilisateur, Token Saver répond aussi à des préoccupations de confidentialité pour les professionnels manipulant des documents sensibles, tout en illustrant comment de simples étudiants ou petites équipes peuvent désormais construire des extensions MCP viables sans infrastructure lourde.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

L'outil open-source pxpipe cache du texte dans des PNG pour réduire jusqu'à 70% les coûts en tokens de Claude Code et Fable 5
1The Decoder 

L'outil open-source pxpipe cache du texte dans des PNG pour réduire jusqu'à 70% les coûts en tokens de Claude Code et Fable 5

Steven Chong, développeur indépendant, a mis en ligne un outil open source baptisé pxpipe qui convertit de longs prompts textuels destinés à Claude Code en fichiers PNG compacts. L'astuce repose sur un détail de la tarification d'Anthropic : les images sont facturées selon leur taille en pixels, et non selon le contenu textuel qu'elles encodent. Résultat, Chong annonce des économies de 59 à 70 pour cent sur les coûts de tokens, au prix toutefois d'une perte de précision et de vitesse dans les réponses générées. Cette découverte illustre à quel point les modèles de tarification des API d'intelligence artificielle peuvent être détournés dès qu'une faille de calcul apparaît entre différents types d'entrées, texte ou image. Pour les développeurs qui utilisent massivement des outils comme Claude Code au quotidien, la facture peut vite grimper, et une réduction de 70 pour cent des coûts représente un argument concret, surtout pour des usages intensifs ou automatisés. Mais le compromis sur la fiabilité des réponses limite l'intérêt de la méthode aux tâches où l'exactitude n'est pas critique. Cet épisode s'inscrit dans une tendance plus large de contournement des grilles tarifaires des fournisseurs de modèles de langage, où chaque nouvelle méthode de facturation, par token, par pixel ou par requête, finit par générer ses propres optimisations créatives côté utilisateurs. Anthropic, comme ses concurrents, devra probablement ajuster sa politique de prix pour combler cette faille, un exercice d'équilibriste récurrent entre simplicité de facturation et résistance aux détournements techniques.

💬 Cacher du texte dans une image pour payer moins cher, c'est malin, mais ça révèle surtout qu'Anthropic facture au pixel sans vraiment regarder ce qu'il y a dedans. Bon, sur le papier, 70% d'économie ça fait rêver, sauf que tu perds en précision, donc cette astuce, oublie-la dès que la réponse doit être fiable. Ce genre de bidouille dit une chose simple : dès qu'une API facture différemment texte et image, quelqu'un trouve la faille avant l'entreprise elle-même.

OutilsOutil
1 source
Onyx : une alternative à Claude, plus puissante, open-source et locale ?
2Le Big Data 

Onyx : une alternative à Claude, plus puissante, open-source et locale ?

Onyx est une plateforme d'intelligence artificielle open source qui a franchi le cap des 20 000 étoiles sur GitHub début avril 2026, attirant l'attention des équipes techniques à la recherche d'alternatives aux solutions propriétaires comme Claude d'Anthropic. Conçue pour s'installer en self-hosting via Docker, elle fonctionne comme une couche d'orchestration complète : elle se connecte à plus de 40 sources de données d'entreprise (stockage, messagerie, gestion de projet), indexe les contenus en continu et dialogue avec n'importe quel LLM, qu'il s'agisse de modèles cloud, d'API externes ou de modèles tournant entièrement en local. Sur les benchmarks de recherche approfondie, Onyx affiche des scores supérieurs à plusieurs solutions propriétaires, en combinant recherche sémantique, indexation permanente et exploration web intégrée pour produire des réponses contextualisées et traçables. L'enjeu concret est la souveraineté technologique des organisations. En permettant de choisir librement le modèle sous-jacent selon chaque usage et d'optimiser les coûts sans dépendre d'un fournisseur unique, Onyx élimine le risque de verrouillage propriétaire qui préoccupe de nombreux DSI et responsables de la sécurité informatique. Les réponses ne reposent plus sur des données d'entraînement génériques, mais sur les documents internes réels de l'entreprise, synchronisés en temps réel. Dans des environnements professionnels où chaque réponse doit être justifiable et auditable, cette traçabilité représente un avantage opérationnel direct. L'outil "Craft" intégré pousse la logique plus loin : il permet de générer non seulement des documents, mais aussi des tableaux de bord, des applications web et des visualisations à partir des données internes, dans des environnements isolés garantissant la confidentialité. Le lancement d'Onyx s'inscrit dans une dynamique plus large de professionnalisation de l'IA open source, portée par des projets comme LangChain, Ollama ou LlamaIndex, qui ont progressivement rendu accessibles des capacités jusqu'alors réservées aux grandes plateformes cloud. Face à la montée en puissance de Claude, GPT-4o et Gemini, une partie de l'écosystème technique cherche à construire des infrastructures IA qui restent sous contrôle de l'organisation. Onyx mise sur la dimension collaborative pour se différencier davantage : la plateforme gère des rôles, des accès granulaires et des agents automatisés configurables avec des règles précises, la rapprochant d'un système applicatif complet plutôt que d'un simple assistant conversationnel. La prochaine étape pour le projet sera de démontrer sa robustesse à l'échelle dans des environnements de production critiques, un terrain où les solutions propriétaires conservent encore une avance significative en matière de support et de garanties contractuelles.

UELes organisations européennes soucieuses de souveraineté numérique et de conformité RGPD peuvent déployer Onyx en self-hosting pour garder leurs données internes hors des clouds américains.

OutilsOutil
1 source
3MarkTechPost 

Créer une couche de mémoire à long terme universelle pour les agents IA avec Mem0 et OpenAI

Des chercheurs et développeurs s'appuient désormais sur Mem0, une bibliothèque open source compatible avec les modèles OpenAI et la base de données vectorielle ChromaDB, pour construire une couche de mémoire persistante destinée aux agents d'intelligence artificielle. Le principe repose sur une architecture en plusieurs modules : extraction automatique de souvenirs structurés à partir de conversations naturelles, stockage sémantique dans ChromaDB via les embeddings text-embedding-3-small, récupération contextuelle par recherche vectorielle, et intégration directe dans les réponses générées par GPT-4.1-nano. Concrètement, le système segmente les échanges conversationnels en faits durables associés à un identifiant utilisateur, comme les préférences techniques, les projets en cours ou les informations personnelles, puis les rend disponibles lors des interactions futures via une API CRUD complète permettant d'ajouter, modifier, supprimer ou interroger ces souvenirs. Cette approche résout un problème fondamental des agents IA actuels : leur amnésie entre les sessions. Sans mémoire persistante, chaque conversation repart de zéro, obligeant l'utilisateur à reformuler son contexte à chaque échange. Avec ce type d'architecture, un agent peut se souvenir qu'un utilisateur est ingénieur logiciel, qu'il travaille sur un pipeline RAG pour une fintech, et qu'il préfère VS Code en mode sombre, sans que ces informations aient été répétées. Pour les entreprises qui déploient des assistants IA internes, des copilotes de code ou des outils de support client, cela représente un gain de personnalisation et d'efficacité considérable. L'isolation multi-utilisateurs intégrée dans Mem0 garantit par ailleurs que les souvenirs d'un profil ne contaminent pas ceux d'un autre. La mémoire à long terme est l'un des chantiers prioritaires de l'IA générative en 2025-2026, aux côtés du raisonnement et de l'utilisation d'outils. Des acteurs comme OpenAI avec la mémoire de ChatGPT, ou des startups spécialisées telles que Mem0 (anciennement EmbedChain), se positionnent sur ce marché en pleine expansion. L'approche présentée ici est dite "production-ready" : elle exploite ChromaDB en local pour réduire les coûts et la latence, mais reste compatible avec des backends cloud. La tendance de fond est de faire évoluer les agents d'un mode sans état vers une continuité contextuelle, condition nécessaire pour des assistants véritablement utiles sur la durée. Les prochaines étapes probables incluent la gestion de la decay mémorielle (oublier les informations obsolètes) et l'intégration dans des frameworks multi-agents comme LangGraph ou AutoGen.

💬 Le problème de l'amnésie entre sessions, c'est le truc qui rend les agents inutilisables en vrai. Mem0 propose une architecture propre pour ça, avec ChromaDB en local et une isolation multi-utilisateurs qui tient la route, ce qui évite les bricolages maison qu'on voit partout. Bon, "production-ready" ça se vérifie, mais l'approche est solide.

OutilsOutil
1 source
EverOS : runtime de mémoire open source pour agents, récupération hybride BM25/vectorielle et compétences auto-évolutives
4MarkTechPost 

EverOS : runtime de mémoire open source pour agents, récupération hybride BM25/vectorielle et compétences auto-évolutives

EverMind a publié EverOS, un moteur de mémoire open source pour agents IA, sous licence Apache 2.0. Le projet s'attaque à un problème fondamental des grands modèles de langage : leur absence d'état persistant. Dès qu'une conversation se termine, le contexte disparaît. EverOS propose une approche différente : plutôt que d'enfermer la mémoire dans une base de données vectorielle opaque, il stocke chaque souvenir sous forme de fichiers Markdown ordinaires. Ces fichiers deviennent la source de vérité que les agents lisent, modifient et interrogent entre les sessions. La bibliothèque Python s'appuie sur une pile de stockage en trois couches : Markdown comme source canonique, SQLite pour la gestion des états et des files d'attente, et LanceDB pour les vecteurs et les index. La récupération est hybride : une seule requête LanceDB combine la recherche par mots-clés BM25, la recherche vectorielle dense et un filtrage scalaire, ce que l'équipe nomme mRAG. Les performances annoncées par EverMind sont de 93,05 % sur le benchmark LoCoMo, 83,00 % sur LongMemEval, et une latence p95 inférieure à 500 ms. Ce que change EverOS pour les développeurs d'agents, c'est avant tout l'inspectabilité et la portabilité. Les fichiers .md peuvent être ouverts dans n'importe quel éditeur, versionnés avec Git, ou consultés dans Obsidian. Il n'y a pas besoin de MongoDB, Elasticsearch, Milvus, Redis ou Kafka, ce qui réduit considérablement le coût opérationnel pour les développeurs indépendants et les petites équipes. L'architecture distingue deux pistes mémoire : côté utilisateur, des Profils, Épisodes, Faits et Prévisions ; côté agent, des Cas et des Compétences. Cette séparation est rare dans les bibliothèques concurrentes qui se concentrent généralement sur l'historique de chat. La mémoire procédurale est la fonctionnalité la plus distinctive : EverOS enregistre chaque tâche complétée comme un Cas, puis distille offline les patterns réussis en Compétences réutilisables partagées entre agents, sans curation manuelle. Le runtime est compatible avec le protocole OpenAI et se connecte à OpenRouter, vLLM, Ollama ou DeepInfra via un simple changement d'URL. EverOS s'inscrit dans une tendance plus large de recherche d'alternatives aux architectures mémoire complexes et coûteuses pour les systèmes agentiques. La version 1.1.0 a introduit des APIs de Knowledge pour des pages Markdown adossées à des sources taxonomiques, ainsi qu'un processus de Réflexion offline qui fusionne des clusters d'épisodes et affine les profils entre sessions. EverMind propose également EverOS Cloud pour les équipes qui préfèrent ne pas gérer l'infrastructure, avec parité complète du SDK et du format mémoire avec la version auto-hébergée. Les scores de benchmark sont prometteurs mais proviennent d'EverMind eux-mêmes, ce qui appelle une vérification sur des charges de travail réelles avant adoption en production.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic