Aller au contenu principal
LLMs · Actu ·

Saluki 27B : un Qwen3.8-27B en 2 bits qui surpasse l'original en appel d'outils

Underdog, l'assistant embarqué de Conway Research, a publié Saluki 27B sous licence Apache 2.0. Il s'agit d'une version GGUF en 2 bits de Qwen3.8-27B, un modèle dense de 27 milliards de paramètres développé par l'équipe Qwen. Le fichier ne pèse que 7,89 Go, contre 54 Go pour le modèle complet en BF16. Il s'appuie sur le travail d'ISTA-DASLab (Qwen3.8-27B-GSQ-RCO-GGUF), dont le plus petit fichier, IQ2_XS, atteint 8,4 Go à 2,50 bits par poids. Underdog a ajouté sa propre passe de compression, baptisée IQ2-mix, ciblée sur l'appel d'outils, sans publier la recette complète. Sur un banc de 120 tâches tirées de BFCL v4, Saluki obtient 88 contre 84 pour le modèle complet et 70 pour Bonsai 2 de PrismML. Sur 100 tâches d'appels d'outils parallèles, il marque 42 contre 35. Sur SWE-bench Verified (50 problèmes), il en résout 30 contre 33. Comparé aux scores publics du modèle complet, il fait mieux sur IFEval (93,5 contre 91,5) et IFBench (72,7 contre 71,0), mais recule sur MBPP+ (78,0 contre 83,9), MuSR (67,5 contre 79,6), AIME 2025 (79,2 contre 96,7) et AIME 2026 (80,0 contre 94,6). La rétention moyenne atteint 96 % sur neuf benchmarks.

2 min de lecturePertinence 53

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Pour les développeurs, l'intérêt est concret : un modèle de classe 27 milliards de paramètres, capable de piloter des agents, tient désormais dans moins de 8 Go et tourne dans un llama.cpp standard, avec déchargement complet sur GPU. Un module de vision optionnel de 629 Mo ou 928 Mo est proposé. L'appel d'outils est la compétence qui transforme un modèle de conversation en agent, et c'est précisément celle que la compression a préservée, voire améliorée. Le revers est net : les mathématiques de compétition et le raisonnement en plusieurs étapes perdent entre 12 et 18 points, soit environ 82 à 85 % de rétention. Saluki convient donc mieux à des agents locaux qu'à des tâches de raisonnement exigeantes. Ces chiffres viennent d'Underdog, et l'écart sur l'appel d'outils parallèles repose sur un échantillon de 100 tâches.

Ce lancement s'inscrit dans la course à la quantification extrême pour exécuter de gros modèles sur du matériel grand public. Qwen3.8-27B combine des couches d'attention linéaire Gated DeltaNet et d'attention à porte, sur 64 couches, et gère nativement 262 144 tokens de contexte. Le concurrent Bonsai 2 de PrismML est plus petit (5,95 Go, 1,75 bit par poids) et revendique 98,2 % de rétention sur 14 benchmarks en mode raisonnement, avec un meilleur score à AIME25 (95,00). Mais il exige un fork de llama.cpp, le llama.cpp standard rejetant ses formats d'empaquetage. Chaque éditeur utilisant son propre protocole d'évaluation, les comparaisons croisées restent indicatives. Le contexte et le nombre exact de bits par poids de Saluki ne sont pas précisés.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Qwen3.8-Max affirme surpasser GPT-5.6 Sol Max et Fable 5 sur l'usage d'ordinateur à base d'agents48VentureBeat AILLMs 02Alibaba publie Qwen3.6-27B, un modèle dense qui surpasse le MoE 397B sur les benchmarks de codage par agents49MarkTechPostLLMs 03Needle 2 : un modèle open source de 45M de paramètres pour l'appel d'outils, en binaire de 14 Mo et 28 Mo de RAM34MarkTechPostLLMs 
Dossier · Qwen3Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.