Needle 2 : un modèle open source de 45M de paramètres pour l'appel d'outils, en binaire de 14 Mo et 28 Mo de RAM
Cactus Compute a annoncé Needle 2, un modèle ouvert de 45 millions de paramètres spécialisé dans l'appel d'outils (tool calling), le contrôle d'appareils et l'extraction de données structurées. L'ensemble du modèle tient dans un binaire unique de 14 Mo et ne consomme qu'environ 28 Mo de RAM pour une session complète, les poids étant entraînés et déployés en 2 bits via la technique maison Cactus Quants, directement intégrés au moteur C++ de l'entreprise, sans runtime à installer ni téléchargement au moment de l'inférence. Les débits annoncés atteignent 500 tokens par seconde sur un Raspberry Pi 5, entre 400 et 1 500 tokens par seconde sur les casques Meta Quest 3S et Apple Vision Pro, et entre 300 et 700 tokens par seconde sur des smartphones à moins de 200 dollars. L'architecture, baptisée Simple Attention Network, compte 27 couches sur 512 dimensions, combine attention GQA, un bloc Hadamard MLP à la place du FFN classique, une mémoire clé-valeur par n-grammes hachés et des connexions multi-voies. Le modèle a été préentraîné sur un corpus propriétaire de 115 milliards de tokens, complété par 38 milliards de tokens de post-entraînement, et ne consomme que 70 MFLOPs par token contre 460 pour LFM2.5-230M, 540 pour FunctionGemma-270M et près de 6 000 pour Apple FM. Il est disponible sous forme de binaires précompilés pour macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS/watchOS/tvOS et WebAssembly, et tourne déjà en local dans l'application Index 01 du fabricant de wearables Pebble pour des commandes vocales hors ligne.
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Ce format ultra-compact ouvre la voie à des appels de fonctions fiables sur du matériel dépourvu de GPU ou de NPU, ce qui change la donne pour les objets connectés, les montres et lunettes intelligentes, la robotique, les commandes embarquées en voiture, les bornes de vente ou les caméras IP. Les entreprises les plus concernées sont les startups de matériel connecté en phase d'amorçage, les fabricants d'électronique grand public, les équipes de robotique et les grands constructeurs cherchant un mode de secours hors ligne, notamment dans des contextes réglementés où l'audio ne doit jamais quitter l'appareil. Les acteurs du cloud pur en tirent en revanche moins de bénéfices. Un système de grammaire contraignant chaque token émis selon un schéma JSON permet d'ignorer jusqu'à 98% des projections de vocabulaire inutiles, tandis qu'un score de confiance calibré décide d'agir, de reformuler ou d'escalader vers un modèle plus puissant.
Le pari de Cactus repose sur une observation simple : traduire une phrase en un appel de fonction typé ne demande ni culture générale ni prose ouverte, contrairement aux grands modèles de langage généralistes, ce qui justifie qu'un modèle de seulement 45 millions de paramètres suffise là où des modèles comme LFM2.5, entraîné sur 19 000 milliards de tokens, visent des usages bien plus larges. Les travaux sous-jacents ont été publiés sur arXiv sous le titre "A Controlled Study of Attention-Only Transformers". Techniquement, les poids en 2 bits ne sont jamais décompressés en mémoire : ils s'étendent directement dans les registres vectoriels et alimentent des produits scalaires en entiers, le binaire détectant automatiquement le processeur au démarrage pour choisir le meilleur jeu d'instructions disponible, qu'il s'agisse de SDOT, NEON, AVX2, des vecteurs RISC-V ou de SIMD WebAssembly. Cactus a évalué Needle 2 sur cinq benchmarks publics d'appel de fonctions avec correspondance stricte de bout en bout, via son moteur déployé en 2 bits, une méthodologie qui doit encore faire ses preuves face à des modèles de référence tournant en pleine précision.
Pas d'impact direct sur la France/UE