PrismML publie Ternary Bonsai 2 27B, un modèle Apache 2.0 de 5,9 Go conservant 98,2 % des performances de Qwen3.8 27B
PrismML a publié Ternary Bonsai 2 27B, une version à poids ternaires de Qwen3.8 27B sous licence Apache 2.0, ne pesant que 5,93 Go contre 53,80 Go en FP16. Ce modèle de 27,36 milliards de paramètres traite texte et images avec un contexte de 262 000 tokens, et conserve selon PrismML 98,2% des performances moyennes du modèle d'origine sur 20 benchmarks, contre environ 95% pour le premier Bonsai 27B sorti deux mois plus tôt. Chaque poids prend l'une des trois valeurs -1, 0 ou +1, avec un facteur d'échelle FP16 partagé toutes les 128 valeurs, pour une taille moyenne d'environ 1,72 bit par paramètre. Le modèle fonctionne dès aujourd'hui sur un ordinateur portable de 16 Go de mémoire ou un seul GPU de 24 Go, via le fork llama.cpp ou le runtime MLX de PrismML.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette compression rend accessible sur du matériel grand public, portable ou carte graphique unique, un modèle jusque là réservé aux GPU de centre de données. Face aux méthodes de quantification classiques, l'écart est net: une version IQ2_XXS de Qwen3.8 27B, quantifiée de façon conventionnelle et légèrement plus légère à 7,3 Go, ne retient que 75,2% de performance moyenne, avec un score de 78,6 sur AIME26 contre 95,83 pour Bonsai 2. Sur une RTX 5090, le modèle atteint 142,5 tokens par seconde, avec une efficacité énergétique que PrismML dit supérieure de 40% à un modèle en pleine précision. Ces gains restent inégaux: sur les tâches d'agents longs, Bonsai 2 ne retient qu'environ 75% des performances, avec 52,8 contre 69,7 sur Terminal-Bench 2.1 et 60,8 contre 80,6 sur SWE-bench Verified, un signal d'alerte pour les usages d'agents de codage complexes.
Cette sortie s'inscrit dans la course à la quantification extrême des modèles de langage, une technique qui s'appuie ici sur une rotation Hadamard par blocs inspirée de la méthode SpinQuant. PrismML ne détaille pas sa méthode d'attribution des valeurs ternaires, laissant une partie du procédé propriétaire malgré l'ouverture des poids finaux. Tous les résultats de performance proviennent des propres mesures de l'entreprise, réalisées avec EvalScope et vLLM sur des GPU H100, et n'ont pas été reproduits de façon indépendante. Le passage d'une rétention de 95% à 98,2% en seulement deux mois entre les deux générations de Bonsai suggère que PrismML continue d'affiner rapidement sa méthode de compression, même si la fiabilité de ces modèles sur des tâches d'agents autonomes complexes reste un point de vigilance pour les développeurs qui envisageraient de les déployer en production.
Pas d'impact direct sur la France/UE