Aller au contenu principal
LLMs · Actu ·

PrismML publie Ternary Bonsai 2 27B, un modèle Apache 2.0 de 5,9 Go conservant 98,2 % des performances de Qwen3.8 27B

PrismML a publié Ternary Bonsai 2 27B, une version à poids ternaires de Qwen3.8 27B sous licence Apache 2.0, ne pesant que 5,93 Go contre 53,80 Go en FP16. Ce modèle de 27,36 milliards de paramètres traite texte et images avec un contexte de 262 000 tokens, et conserve selon PrismML 98,2% des performances moyennes du modèle d'origine sur 20 benchmarks, contre environ 95% pour le premier Bonsai 27B sorti deux mois plus tôt. Chaque poids prend l'une des trois valeurs -1, 0 ou +1, avec un facteur d'échelle FP16 partagé toutes les 128 valeurs, pour une taille moyenne d'environ 1,72 bit par paramètre. Le modèle fonctionne dès aujourd'hui sur un ordinateur portable de 16 Go de mémoire ou un seul GPU de 24 Go, via le fork llama.cpp ou le runtime MLX de PrismML.

2 min de lecturePertinence 51

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette compression rend accessible sur du matériel grand public, portable ou carte graphique unique, un modèle jusque là réservé aux GPU de centre de données. Face aux méthodes de quantification classiques, l'écart est net: une version IQ2_XXS de Qwen3.8 27B, quantifiée de façon conventionnelle et légèrement plus légère à 7,3 Go, ne retient que 75,2% de performance moyenne, avec un score de 78,6 sur AIME26 contre 95,83 pour Bonsai 2. Sur une RTX 5090, le modèle atteint 142,5 tokens par seconde, avec une efficacité énergétique que PrismML dit supérieure de 40% à un modèle en pleine précision. Ces gains restent inégaux: sur les tâches d'agents longs, Bonsai 2 ne retient qu'environ 75% des performances, avec 52,8 contre 69,7 sur Terminal-Bench 2.1 et 60,8 contre 80,6 sur SWE-bench Verified, un signal d'alerte pour les usages d'agents de codage complexes.

Cette sortie s'inscrit dans la course à la quantification extrême des modèles de langage, une technique qui s'appuie ici sur une rotation Hadamard par blocs inspirée de la méthode SpinQuant. PrismML ne détaille pas sa méthode d'attribution des valeurs ternaires, laissant une partie du procédé propriétaire malgré l'ouverture des poids finaux. Tous les résultats de performance proviennent des propres mesures de l'entreprise, réalisées avec EvalScope et vLLM sur des GPU H100, et n'ont pas été reproduits de façon indépendante. Le passage d'une rétention de 95% à 98,2% en seulement deux mois entre les deux générations de Bonsai suggère que PrismML continue d'affiner rapidement sa méthode de compression, même si la fiabilité de ces modèles sur des tâches d'agents autonomes complexes reste un point de vigilance pour les développeurs qui envisageraient de les déployer en production.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01PrismML lance Bonsai 27B : versions 1-bit et ternaire de Qwen3.6-27B pour ordinateurs portables et smartphones43MarkTechPostLLMs 02Alibaba dévoile Qwen3.8-Max, un modèle MoE de 2,4 billions de paramètres, le plus performant de la famille Qwen à ce jour45MarkTechPostLLMs 03Mistral AI publie Leanstral 1.5 : un modèle agent de code Lean 4 sous licence Apache 2.0, qui résout 587 des 672 problèmes du PutnamBench48MarkTechPostLLMs 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.