Aller au contenu principal
LLMs · Actu ·

Needle 2 : un modèle open source de 45M de paramètres pour l'appel d'outils, en binaire de 14 Mo et 28 Mo de RAM

Cactus Compute a annoncé Needle 2, un modèle ouvert de 45 millions de paramètres spécialisé dans l'appel d'outils (tool calling), le contrôle d'appareils et l'extraction de données structurées. L'ensemble du modèle tient dans un binaire unique de 14 Mo et ne consomme qu'environ 28 Mo de RAM pour une session complète, les poids étant entraînés et déployés en 2 bits via la technique maison Cactus Quants, directement intégrés au moteur C++ de l'entreprise, sans runtime à installer ni téléchargement au moment de l'inférence. Les débits annoncés atteignent 500 tokens par seconde sur un Raspberry Pi 5, entre 400 et 1 500 tokens par seconde sur les casques Meta Quest 3S et Apple Vision Pro, et entre 300 et 700 tokens par seconde sur des smartphones à moins de 200 dollars. L'architecture, baptisée Simple Attention Network, compte 27 couches sur 512 dimensions, combine attention GQA, un bloc Hadamard MLP à la place du FFN classique, une mémoire clé-valeur par n-grammes hachés et des connexions multi-voies. Le modèle a été préentraîné sur un corpus propriétaire de 115 milliards de tokens, complété par 38 milliards de tokens de post-entraînement, et ne consomme que 70 MFLOPs par token contre 460 pour LFM2.5-230M, 540 pour FunctionGemma-270M et près de 6 000 pour Apple FM. Il est disponible sous forme de binaires précompilés pour macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS/watchOS/tvOS et WebAssembly, et tourne déjà en local dans l'application Index 01 du fabricant de wearables Pebble pour des commandes vocales hors ligne.

3 min de lecturePertinence 48
Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Ce format ultra-compact ouvre la voie à des appels de fonctions fiables sur du matériel dépourvu de GPU ou de NPU, ce qui change la donne pour les objets connectés, les montres et lunettes intelligentes, la robotique, les commandes embarquées en voiture, les bornes de vente ou les caméras IP. Les entreprises les plus concernées sont les startups de matériel connecté en phase d'amorçage, les fabricants d'électronique grand public, les équipes de robotique et les grands constructeurs cherchant un mode de secours hors ligne, notamment dans des contextes réglementés où l'audio ne doit jamais quitter l'appareil. Les acteurs du cloud pur en tirent en revanche moins de bénéfices. Un système de grammaire contraignant chaque token émis selon un schéma JSON permet d'ignorer jusqu'à 98% des projections de vocabulaire inutiles, tandis qu'un score de confiance calibré décide d'agir, de reformuler ou d'escalader vers un modèle plus puissant.

Le pari de Cactus repose sur une observation simple : traduire une phrase en un appel de fonction typé ne demande ni culture générale ni prose ouverte, contrairement aux grands modèles de langage généralistes, ce qui justifie qu'un modèle de seulement 45 millions de paramètres suffise là où des modèles comme LFM2.5, entraîné sur 19 000 milliards de tokens, visent des usages bien plus larges. Les travaux sous-jacents ont été publiés sur arXiv sous le titre "A Controlled Study of Attention-Only Transformers". Techniquement, les poids en 2 bits ne sont jamais décompressés en mémoire : ils s'étendent directement dans les registres vectoriels et alimentent des produits scalaires en entiers, le binaire détectant automatiquement le processeur au démarrage pour choisir le meilleur jeu d'instructions disponible, qu'il s'agisse de SDOT, NEON, AVX2, des vecteurs RISC-V ou de SIMD WebAssembly. Cactus a évalué Needle 2 sur cinq benchmarks publics d'appel de fonctions avec correspondance stricte de bout en bout, via son moteur déployé en 2 bits, une méthodologie qui doit encore faire ses preuves face à des modèles de référence tournant en pleine précision.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Meta ouvre en open source Muse Glimmer, un modèle à base d'agents de 30 milliards de paramètres optimisé pour l'exécution locale61InfoQ AILLMs 02NVIDIA lance Nemotron 3 Ultra, un modèle open source de 550 milliards de paramètres50Latent SpaceLLMs 03Arcee AI publie Trinity Large Thinking : un modèle de raisonnement open source Apache 2.0 pour les agents autonomes et l'utilisation d'outils45MarkTechPostLLMs 
Dossier · Meta IASuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.