JetBrains publie Mellum2.1, un modèle ouvert de 12 milliards de paramètres (MoE) pour les agents de code
JetBrains a publié Mellum2.1, un modèle ouvert conçu pour les agents de programmation et les sous-agents rapides. Le checkpoint, baptisé Mellum2.1-12B-A2.5B-Thinking, est un modèle de raisonnement de type mixture-of-experts (MoE) de 12 milliards de paramètres au total, dont 2,5 milliards sont activés par token. Il est distribué sous licence Apache 2.0 sur Hugging Face. L'architecture est identique à celle de Mellum2, ouvert en juin 2026 : 28 couches, 64 experts dont 8 activés par token, attention à requêtes groupées (32 têtes de requête, 4 têtes KV), fenêtre glissante de 1 024 tokens sur trois couches sur quatre, contexte de 131 072 tokens et vocabulaire de 98 304 tokens. Le gain vient presque entièrement du post-entraînement : l'apprentissage par renforcement (RL), auparavant une courte étape finale, est devenu le cœur de l'entraînement, avec des tâches de mathématiques, de programmation compétitive, de sciences, d'appel d'outils et de génie logiciel. Pour ce dernier volet, le modèle travaille dans de vrais dépôts avec un shell et des outils d'édition, récompensé quand les tests passent, à travers des millions de bacs à sable répartis sur des milliers d'environnements. Sur SWE-bench Verified, le score passe de 2,0 à 47,0, sur SWE-bench Pro de 0,0 à 28,0 et sur Terminal-Bench 2.1 de 0,6 à 17,4. Mellum2.1 devance Mellum2 sur 15 des 17 benchmarks listés.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Face à Qwen3.5-9B et Gemma 4 E4B, évalués par JetBrains avec un même protocole en mode raisonnement, Mellum2.1 domine sur LiveCodeBench v6 (82,0 contre 75,4 et 69,4), HumanEval+ (91,5), MBPP+ (79,4) et BFCL v4 (62,3). Qwen3.5-9B garde l'avantage sur SWE-bench Verified (50,0), SWE-bench Pro (38,0), Terminal-Bench 2.1 (21,7), AIME 25/26 (86,7) et GPQA Diamond (77,8) : Mellum2.1 ne gagne que 5 des 17 comparaisons. Côté sécurité, le score HarmBench, où un chiffre bas est préférable, tombe de 21,5 à 8,5. Tous ces résultats sont publiés par JetBrains lui-même, avec le harnais open source Pi v0.73.1 et un contexte de 114 000 tokens pour les tâches d'agent. La vitesse est le second argument : sur un GPU NVIDIA H200 sous forte charge, le modèle sert près de deux fois plus de tokens que Qwen3.5-9B, et la prédiction multi-token le rend environ 1,6 fois plus rapide sur une requête isolée, la tête MTP pour vLLM étant annoncée comme prochainement disponible.
L'intérêt est concret pour les équipes qui veulent un agent de code hébergé en interne : avec seulement 2,5 milliards de paramètres actifs, le modèle tourne sur ses propres GPU via vLLM ou SGLang, et des versions GGUF (à partir de 7,0 Go, 24,3 Go pour le BF16) permettent de l'utiliser avec llama.cpp, Ollama ou LM Studio. JetBrains recommande une température de 0,6, topp 0,95 et topk 20, avec l'analyseur de raisonnement qwen3 et l'analyseur d'outils hermès sous vLLM. Les limites restent nettes : le modèle reste derrière Qwen3.5-9B sur les tâches logicielles agentiques difficiles et sur les connaissances. Les écarts de méthode comptent aussi : la fiche de Qwen annonce 65,6 sur LiveCodeBench v6 et 81,7 sur GPQA Diamond, contre 75,4 et 77,8 mesurés par JetBrains pour le même modèle, ce qui invite à comparer les chiffres avec prudence.
Ce lancement s'inscrit dans la course aux petits modèles ouverts spécialisés dans le code, où l'efficacité d'inférence devient aussi décisive que la qualité brute, face à Qwen de la famille Alibaba et à Gemma de Google. JetBrains, éditeur d'environnements de développement, mise sur une stratégie différente de la simple montée en taille : conserver l'architecture de Mellum2 et déplacer l'effort vers l'entraînement par renforcement dans des environnements réalistes, avec un filtrage des jeux de données RL ouverts pour écarter les tests défaillants, les réponses invérifiables et les tâches trop faciles ou impossibles. La suite dépendra de la publication de la tête MTP et des builds GGUF finalisés, ainsi que des évaluations indépendantes qui diront si les gains agentiques annoncés se confirment hors du protocole maison.
Pas d'impact direct sur la France/UE