Aller au contenu principal
LLMs · Actu ·

BottleCap AI lance ThinkingCap-Qwen3.8-27B : 37,2 % de tokens de raisonnement en moins pour 0,86 point de précision en moins

BottleCap AI a publié ThinkingCap-Qwen3.8-27B, second modèle de sa série ThinkingCap, un fine-tune du Qwen3.8-27B développé par l'équipe Qwen dont l'unique objectif est de raccourcir les traces de raisonnement. Sur douze benchmarks, le modèle consomme en moyenne 37,2 % de tokens de réflexion en moins, le nombre moyen cumulé passant de 15 735 à 12 144 tokens, pour une baisse de précision macro-moyenne limitée à 0,86 point (de 86,65 % à 85,79 %). Les gains varient fortement selon les tâches : MMMLU voit ses tokens chuter de 65,5 % (de 1 656 à 571), MMLU-Pro de 57,3 %, et GPQA-Diamond de 43,1 % (de 12 772 à 7 267 tokens). IFBench réduit sa réflexion de 46,4 % avec une précision quasi stable (79,75 % contre 79,71 %), tandis qu'AA-LCR progresse même de 2,25 points (81,75 % à 84,00 %) avec 38,6 % de tokens en moins. Le compromis le plus coûteux concerne AIME 2026, où la précision recule de 3,85 points (98,13 % à 94,27 %) pour 30,2 % de réflexion en moins. Le modèle, un checkpoint bf16 de 28 milliards de paramètres acceptant image et texte, est disponible en cinq versions quantifiées (FP8 31 Go, NVFP4 21 Go, NVFP4 W4A4 23 Go, GGUF de 16 à 55 Go, MLX 4 bits 21 Go pour Mac Apple Silicon) et s'installe en remplacement direct de Qwen3.8-27B sur vLLM ou SGLang.

2 min de lecturePertinence 54

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette approche répond à un problème concret des modèles de raisonnement récents : ils produisent souvent bien plus de tokens de réflexion que nécessaire sans que cela améliore la réponse finale, ce qui gonfle les coûts d'inférence et la latence en production. Pour les entreprises qui déploient ces modèles à grande échelle, notamment sur des tâches longues ou agentiques, la réduction de 37 % du volume de calcul représente une économie directe. L'effet est particulièrement net sous contrainte : avec un plafond de 16 000 tokens par réponse, ThinkingCap dépasse le modèle de base, avec des traces tronquées ramenées de 0,51 % à 0,34 % et des boucles de raisonnement réduites de 0,06 % à 0,05 %, un point sensible pour toute application soumise à un budget de tokens strict. Le recul sur les tâches mathématiques de compétition invite toutefois à la prudence pour les usages où la précision maximale prime sur le coût.

Ce second modèle fait suite à une première version appliquée à Qwen3.6-27B, confirmant que BottleCap AI se positionne comme un acteur spécialisé dans l'optimisation post-entraînement de modèles ouverts plutôt que dans la création de nouvelles capacités. L'entreprise recommande le mode de raisonnement xhigh pour le meilleur équilibre précision-coût et annonce vouloir affiner spécifiquement les autres niveaux d'effort dans une prochaine itération. L'accès au dépôt reste soumis à autorisation, et tout usage commercial dépassant le cadre de la petite entreprise nécessite un accord spécifique avec BottleCap, illustrant le modèle économique naissant autour de ces services de compression de raisonnement.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Qwen lance Qwen3.7-Max : un modèle agent de raisonnement avec une fenêtre de contexte d'un million de tokens42MarkTechPostLLMs 02Qwen3.8-27B fait tourner localement des agents de codage et du raisonnement de pointe, sans API cloud53VentureBeat AILLMs 03Z.ai lance GLM-5.2 : contexte de 1 million de tokens, deux niveaux d'effort de raisonnement, sans benchmarks au lancement43MarkTechPostLLMs 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.