Thinking Machines lance Inkling Small, un modèle open source proche des performances de son prédécesseur pour environ un quart de sa taille
La startup Thinking Machines, dirigée par l'ancienne directrice technique d'OpenAI Mira Murati, a dévoilé Inkling-Small, un nouveau modèle d'intelligence artificielle open source, seulement deux semaines après le lancement de son premier modèle, Inkling. Inkling-Small compte 276 milliards de paramètres, contre 975 milliards pour son prédécesseur, mais n'utilise que 12 milliards de paramètres actifs par token, contre 41 milliards pour Inkling. Distribué sous licence permissive Apache 2.0, ce modèle multimodal accepte du texte, des images et de l'audio en entrée, produit du texte en sortie, et gère une fenêtre de contexte allant jusqu'à un million de tokens. Sur l'index d'intelligence de référence publié par Artificial Analysis, il obtient un score de 40, contre 41 pour Inkling, un écart minime qui en fait, selon l'organisme, le modèle open source le plus performant à cette taille ou en dessous. Les poids complets sont disponibles sur Hugging Face, avec un support pour le fine-tuning via l'API Tinker de l'entreprise, et un tarif de lancement réduit de 50%, soit 0,58 dollar par million de tokens en entrée, 1,44 dollar par million de tokens générés et 1,73 dollar par million de tokens d'entraînement pour la version standard à 64000 tokens de contexte.
Pour les entreprises, l'intérêt ne réside pas seulement dans la taille réduite du modèle, mais dans le fait qu'il conserve l'essentiel des capacités de son grand frère tout en réduisant nettement les besoins en calcul, les coûts d'inférence et l'empreinte de déploiement. Inkling-Small dépasse même Inkling sur plusieurs benchmarks techniques, avec 80,2% contre 77,6% sur SWE-bench Verified et 64,7% contre 63,8% sur Terminal Bench 2.1, ce qui en fait un candidat solide pour les assistants de codage, les systèmes d'outils automatisés ou l'analyse documentaire. Cette avancée reste toutefois inégale: sur les tâches nécessitant des connaissances factuelles ou certains usages agentiques, comme le benchmark bancaire τ³-Banking où il chute à 15,5% contre 23,7% pour Inkling, le modèle marque un net recul, ce qui impose aux entreprises de maintenir des mécanismes de vérification et de relecture humaine pour les usages à fort enjeu.
Sur le plan technique, Inkling-Small repose sur une architecture de type mélange d'experts, avec un décodeur à 42 couches qui redirige chaque token vers six experts spécialisés parmi un ensemble de 256, complétés par deux experts partagés qui restent actifs en permanence. Cette conception explique l'écart entre ses 276 milliards de paramètres totaux et ses 12 milliards de paramètres réellement mobilisés à chaque calcul. Elle illustre une tendance plus large du secteur de l'IA générative, où les laboratoires cherchent désormais à comprimer les performances des grands modèles dans des architectures plus légères et moins coûteuses à exploiter, sans sacrifier la compétitivité face aux modèles propriétaires fermés.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




