Aller au contenu principal
Outils · Outil ·

FreeToken : un moteur MoE natif edge qui fait tourner GLM-5.2 (753 milliards de paramètres) sur un seul GPU de station de travail

Une équipe de chercheurs de UC Berkeley et de l'université du Texas à Austin a présenté FreeToken, un moteur de serving pour modèles Mixture-of-Experts (MoE) conçu pour tourner sur du matériel grand public plutôt que sur des clusters de datacenter. Le système permet de faire tourner un modèle de 35 milliards de paramètres à vitesse interactive sur un GPU de laptop de 8 Go, un modèle de 284 milliards sur un desktop gaming, et surtout le GLM-5.2 de 753 milliards de paramètres sur une seule carte GPU de station de travail. FreeToken est publié sous licence Apache-2.0 sur GitHub, disponible sur PyPI en version 0.1.2 (installation via uv pip install "freetoken[accel]"), et proposé sous forme d'application desktop en un clic pour Windows et Linux via flashml.ai. La ligne de commande cible Linux x86_64 avec un GPU NVIDIA sous pilote r580 ou supérieur (CUDA 13). La commande ft serve expose des points d'accès compatibles OpenAI et Anthropic sur le port 1919, tandis que ft launch claude permet de connecter directement Claude Code, Codex, OpenCode ou OpenClaw à sa propre machine.

2 min de lecturePertinence 56
Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette avancée cible d'abord les développeurs indépendants, les startups et les petites équipes d'ingénierie dont les factures de tokens pour agents dépassent déjà le coût d'un GPU qu'ils pourraient posséder. Pour les entreprises, l'outil se positionne comme une solution pour les charges de travail isolées ou réglementées plutôt que comme un remplacement de datacenter, avec une pertinence particulière dans la santé, le juridique, la défense, la finance et la recherche à forte propriété intellectuelle, où les données ne doivent jamais quitter la machine. Les usages typiques incluent les agents de code locaux, la revue de code privée, l'analyse de contrats hors ligne, la génération de données synthétiques et les évaluations par lots. Plus de cent millions de machines grand public disposent déjà d'un GPU dédié, ce qui change la donne économique pour l'inférence de modèles ouverts de pointe.

Des modèles comme Kimi-K3, GLM-5.2 ou DeepSeek-V4-Flash réduisent l'écart avec les systèmes propriétaires, mais leur exécution supposait jusqu'ici des clusters GPU de datacenter. Les chercheurs pointent trois limites des moteurs existants, comme llama.cpp, KTransformers, Ollama ou MoE-Infinity : le préremplissage (prefill) détruit la sparsité et force le transfert de tout le pool d'experts via PCIe, jusqu'à dix secondes sur les liaisons x8 de laptop ; le placement statique des tenseurs ignore les changements de routage à chaque token, laissant le GPU inactif ; et la bande passante mémoire d'un CPU grand public, autour de 80 à 90 Go/s en DDR5 double canal, reste très inférieure au 1 à 1,8 To/s d'un GPU comme la RTX 4090 ou 5090. FreeToken répond à cela par une exécution adaptative à la bande passante mesurée sur la machine (commande ft bench bw) et un système de cache sémantique avec double buffering par couche pendant le préremplissage.

Impact France / UEChamp produit par Le Fil IA

Les startups et PME europeennes de secteurs regules (sante, juridique, defense, finance) pourraient reduire leurs couts d'inference et garder leurs donnees sur site grace a cet outil open source.

À lire ensuite

01Chroma lance Context-1 : un modèle de recherche à base d'agents de 20 milliards de paramètres pour la récupération multi-saut et la gestion du contexte43MarkTechPostOutils 02« Datalab Lift face à la concurrence : comment un extracteur à 9 milliards de paramètres, guidé par schéma, se compare à NuExtract3, LlamaExtract, Marker et Docling »39MarkTechPostOutils 03Mistral AI lance Workflows, un moteur d'orchestration propulsé par Temporal qui traite déjà des millions d'exécutions par jour54VentureBeat AIOutils 
Dossier · CUDASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.