
Thinking Machines Lab publie Inkling-Small, un modèle multimodal MoE en open weights (276 milliards de paramètres, 12 milliards actifs)
Thinking Machines Lab a publié Inkling-Small, un modèle à poids ouverts de type Mixture-of-Experts comptant 276 milliards de paramètres au total, dont 12 milliards actifs, soit environ un quart de la taille de son grand frère Inkling (975 milliards au total, 41 milliards actifs). Entraîné sur des systèmes NVIDIA GB300 NVL72, il raisonne nativement sur du texte, des images et de l'audio, avec une fenêtre de contexte atteignant 1 million de tokens et un effort de réflexion ajustable. Les poids sont diffusés sous licence Apache 2.0 sur Hugging Face. Le point clé est sa déployabilité grâce à la version quantifiée : la version BF16 nécessite au moins 600 Go de VRAM cumulée, soit 4 GPU NVIDIA B300 ou 8 H200, tandis que la version NVFP4 abaisse ce seuil à 180 Go, permettant un fonctionnement W4A4 sur un seul B300 (nécessitant une architecture SM100 ou supérieure) ou W4A16 sur deux H200. Les runtimes compatibles incluent SGLang, vLLM, TokenSpeed, Unsloth et Hugging Face. Sur le plan architectural, il s'agit d'un transformeur décodeur de 42 couches avec un réseau MoE clairsemé : chaque token active 6 des 256 experts disponibles, plus 2 experts partagés systématiquement sollicités, combinés à une attention hybride locale et globale.
Ce passage à une exécution sur un seul GPU fait sortir un modèle de 276 milliards de paramètres du cercle réservé aux laboratoires de pointe. Des startups peuvent l'héberger sur une seule instance B300 louée, tandis que des entreprises de taille moyenne disposant déjà de H200 peuvent le servir sans nouvel investissement matériel. Cela ouvre une option de poids privés pour les secteurs réglementés comme la finance, la santé, l'assurance, les télécoms et le secteur public, avec des usages allant des agents de codage et de l'automatisation en terminal à la compréhension de documents et de graphiques, jusqu'à l'analyse de centres d'appels et la synthèse de réunions.
Inkling-Small a commencé son entraînement après le modèle plus grand, ce qui a permis à l'équipe de revoir le mélange de données de pré-entraînement. Il a ensuite été post-entraîné à partir d'une version préliminaire, en partie via une distillation avec Inkling comme professeur, suivie de deux semaines supplémentaires d'apprentissage par renforcement orienté codage agentique. Résultat, il dépasse son propre professeur sur plusieurs benchmarks de raisonnement : 31,6% contre 29,7% sur Humanity's Last Exam, 80,2% contre 77,6% sur SWE-bench Verified, ou encore 40,1% contre 36,5% sur ARC-AGI-2. Il recule en revanche nettement sur la précision factuelle, avec un score SimpleQA Verified de 20,6% contre 43,9% pour Inkling. Sur la sécurité, il atteint 98,4% sur StrongREJECT, et Thinking Machines Lab estime que le modèle ne présente pas de risque supplémentaire par rapport à l'écosystème existant, tout en recommandant l'ajout de garde-fous comme Llama Guard côté déploiement.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.



