BottleCap AI lance ThinkingCap-Qwen3.8-27B : 37,2 % de tokens de raisonnement en moins pour 0,86 point de précision en moins
BottleCap AI a publié ThinkingCap-Qwen3.8-27B, second modèle de sa série ThinkingCap, un fine-tune du Qwen3.8-27B développé par l'équipe Qwen dont l'unique objectif est de raccourcir les traces de raisonnement. Sur douze benchmarks, le modèle consomme en moyenne 37,2 % de tokens de réflexion en moins, le nombre moyen cumulé passant de 15 735 à 12 144 tokens, pour une baisse de précision macro-moyenne limitée à 0,86 point (de 86,65 % à 85,79 %). Les gains varient fortement selon les tâches : MMMLU voit ses tokens chuter de 65,5 % (de 1 656 à 571), MMLU-Pro de 57,3 %, et GPQA-Diamond de 43,1 % (de 12 772 à 7 267 tokens). IFBench réduit sa réflexion de 46,4 % avec une précision quasi stable (79,75 % contre 79,71 %), tandis qu'AA-LCR progresse même de 2,25 points (81,75 % à 84,00 %) avec 38,6 % de tokens en moins. Le compromis le plus coûteux concerne AIME 2026, où la précision recule de 3,85 points (98,13 % à 94,27 %) pour 30,2 % de réflexion en moins. Le modèle, un checkpoint bf16 de 28 milliards de paramètres acceptant image et texte, est disponible en cinq versions quantifiées (FP8 31 Go, NVFP4 21 Go, NVFP4 W4A4 23 Go, GGUF de 16 à 55 Go, MLX 4 bits 21 Go pour Mac Apple Silicon) et s'installe en remplacement direct de Qwen3.8-27B sur vLLM ou SGLang.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette approche répond à un problème concret des modèles de raisonnement récents : ils produisent souvent bien plus de tokens de réflexion que nécessaire sans que cela améliore la réponse finale, ce qui gonfle les coûts d'inférence et la latence en production. Pour les entreprises qui déploient ces modèles à grande échelle, notamment sur des tâches longues ou agentiques, la réduction de 37 % du volume de calcul représente une économie directe. L'effet est particulièrement net sous contrainte : avec un plafond de 16 000 tokens par réponse, ThinkingCap dépasse le modèle de base, avec des traces tronquées ramenées de 0,51 % à 0,34 % et des boucles de raisonnement réduites de 0,06 % à 0,05 %, un point sensible pour toute application soumise à un budget de tokens strict. Le recul sur les tâches mathématiques de compétition invite toutefois à la prudence pour les usages où la précision maximale prime sur le coût.
Ce second modèle fait suite à une première version appliquée à Qwen3.6-27B, confirmant que BottleCap AI se positionne comme un acteur spécialisé dans l'optimisation post-entraînement de modèles ouverts plutôt que dans la création de nouvelles capacités. L'entreprise recommande le mode de raisonnement xhigh pour le meilleur équilibre précision-coût et annonce vouloir affiner spécifiquement les autres niveaux d'effort dans une prochaine itération. L'accès au dépôt reste soumis à autorisation, et tout usage commercial dépassant le cadre de la petite entreprise nécessite un accord spécifique avec BottleCap, illustrant le modèle économique naissant autour de ces services de compression de raisonnement.
Pas d'impact direct sur la France/UE