Aller au contenu principal
LLMs · Actu ·

Cognition lance SWE-2, un modèle de code basé sur Kimi K3 qui égale Fable 5.1 sur FrontierCode pour 64% moins cher

Cognition, l'entreprise derrière l'agent de codage Devin, a lancé SWE-2, son modèle de codage le plus performant à ce jour. SWE-2 est post-entraîné par renforcement (RL) à partir de Kimi K3, le modèle ouvert de 2,8 trillions de paramètres de Moonshot AI. Cognition annonce un score de 50,0% sur FrontierCode 1.1 Main, à moins d'un point de Fable 5.1, pour un coût inférieur de 64%. C'est aussi le premier modèle de Cognition à proposer des niveaux d'effort de raisonnement sélectionnables, les trois entraînés en une seule session RL. Sur DeepSWE 1.1, SWE-2 atteint 73,0% et sur Terminal-Bench 2.1 il prend la tête avec 92,8%, devançant Kimi K3 (88,3%), Grok 4.6 (88,4%) et Fable 5.1 (91,4%). Son point faible reste Terminal-Bench 4, où il plafonne à 27,3%, loin derrière Fable 5.1 (55,8%) et GPT-6 Astra (57,9%). SWE-2 n'est pas disponible en poids ouverts ni via API autonome : il ne fonctionne qu'à l'intérieur de Devin, sur les versions Desktop et CLI, avec un déploiement à venir sur Devin Web et Fusion.

2 min de lecturePertinence 43

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette annonce illustre une tendance de fond dans l'industrie du codage assisté par IA : obtenir des performances proches des meilleurs modèles propriétaires à une fraction du coût, en s'appuyant sur du post-entraînement RL plutôt que sur des modèles toujours plus massifs entraînés from scratch. Pour les équipes de développement utilisant Devin, cela signifie des agents capables de résoudre des tâches complexes plus rapidement et moins cher : Cognition indique que SWE-2 en mode medium résout des tâches avec 58% de tours en moins et un coût réduit de 81% par rapport à son prédécesseur SWE-1.7, tout en obtenant de meilleurs scores. Le nombre moyen d'étapes par tâche chute de 127 à 53 (medium), 80 (high) ou 98 (max), et le modèle effectue sa première modification réelle après une médiane de 18 étapes contre 48 auparavant. Pour l'industrie, cela confirme que l'efficacité d'exécution des agents de codage devient un axe de compétition aussi important que le score brut sur les benchmarks.

SWE-2 s'inscrit dans la continuité de SWE-1.7, qui avait été post-entraîné à partir de Kimi K2.7 ; cette fois, Cognition a appliqué le même type de RL à un modèle presque trois fois plus grand. L'entreprise revendique un gain de 5 à 6 points sur de nombreux benchmarks grâce à sa méthode RL par rapport au modèle de base K3. Techniquement, Cognition a introduit une fonction de récompense pénalisant le coût de façon linéaire pour chaque niveau d'effort, une pondération de la récompense par la longueur des séquences pour stabiliser l'entraînement, ainsi que des optimisations de service d'inférence (regroupement de requêtes, décodage spéculatif via DSpark, calcul en précision réduite NVFP4/FP8) pour accélérer les cycles d'entraînement. Cognition a aussi triplé ses environnements RL et ajouté des données de suivi d'instructions. Les comparaisons publiées restent toutefois basées sur l'évaluation interne de Cognition, à l'exception de FrontierCode qui est son propre benchmark, ce qui invite à une lecture prudente face aux résultats annoncés pour les modèles concurrents comme Fable 5.1 ou GPT-6 Astra.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Le vrai move ici, c'est pas le score sur FrontierCode, c'est le choix de partir d'un modèle ouvert : plutôt que d'entraîner un mastodonte from scratch, Cognition prend Kimi K3 et le muscle au RL pour 64% moins cher que Fable 5.1. Sur le papier c'est malin, mais SWE-2 ne tourne que dans Devin, pas de poids ouverts, pas d'API : t'as le coût de l'open source sans jamais pouvoir en sortir. Le signal pour l'industrie est clair, le post-entraînement par renforcement sur des bases ouvertes devient l'arme de choix face aux géants propriétaires, la course au paramètre brut c'est terminé.

À lire ensuite

01Fireworks AI lance Ember-1, une version post-entraînée de Kimi K3 qui utilise environ 40% de tokens en moins50MarkTechPostLLMs 02Anthropic lance Claude Opus 5, un modèle IA moins cher pour le code, les agents et les entreprises48VentureBeat AILLMs 03Meta AI lance Muse Spark 1.3, un modèle de code à base d'agents plus économe en appels d'outils et en tokens que 1.242MarkTechPostLLMs 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.