Aller au contenu principal
LLMs · Actu ·

Cognition lance SWE-2, un modèle de code basé sur Kimi K3 qui égale Fable 5.1 sur FrontierCode pour 64% moins cher

Cognition, l'entreprise derrière l'agent de codage Devin, a lancé SWE-2, son modèle de codage le plus performant à ce jour. SWE-2 est post-entraîné par renforcement (RL) à partir de Kimi K3, le modèle ouvert de 2,8 trillions de paramètres de Moonshot AI. Cognition annonce un score de 50,0% sur FrontierCode 1.1 Main, à moins d'un point de Fable 5.1, pour un coût inférieur de 64%. C'est aussi le premier modèle de Cognition à proposer des niveaux d'effort de raisonnement sélectionnables, les trois entraînés en une seule session RL. Sur DeepSWE 1.1, SWE-2 atteint 73,0% et sur Terminal-Bench 2.1 il prend la tête avec 92,8%, devançant Kimi K3 (88,3%), Grok 4.6 (88,4%) et Fable 5.1 (91,4%). Son point faible reste Terminal-Bench 4, où il plafonne à 27,3%, loin derrière Fable 5.1 (55,8%) et GPT-6 Astra (57,9%). SWE-2 n'est pas disponible en poids ouverts ni via API autonome : il ne fonctionne qu'à l'intérieur de Devin, sur les versions Desktop et CLI, avec un déploiement à venir sur Devin Web et Fusion.

2 min de lecturePertinence 56

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette annonce illustre une tendance de fond dans l'industrie du codage assisté par IA : obtenir des performances proches des meilleurs modèles propriétaires à une fraction du coût, en s'appuyant sur du post-entraînement RL plutôt que sur des modèles toujours plus massifs entraînés from scratch. Pour les équipes de développement utilisant Devin, cela signifie des agents capables de résoudre des tâches complexes plus rapidement et moins cher : Cognition indique que SWE-2 en mode medium résout des tâches avec 58% de tours en moins et un coût réduit de 81% par rapport à son prédécesseur SWE-1.7, tout en obtenant de meilleurs scores. Le nombre moyen d'étapes par tâche chute de 127 à 53 (medium), 80 (high) ou 98 (max), et le modèle effectue sa première modification réelle après une médiane de 18 étapes contre 48 auparavant. Pour l'industrie, cela confirme que l'efficacité d'exécution des agents de codage devient un axe de compétition aussi important que le score brut sur les benchmarks.

SWE-2 s'inscrit dans la continuité de SWE-1.7, qui avait été post-entraîné à partir de Kimi K2.7 ; cette fois, Cognition a appliqué le même type de RL à un modèle presque trois fois plus grand. L'entreprise revendique un gain de 5 à 6 points sur de nombreux benchmarks grâce à sa méthode RL par rapport au modèle de base K3. Techniquement, Cognition a introduit une fonction de récompense pénalisant le coût de façon linéaire pour chaque niveau d'effort, une pondération de la récompense par la longueur des séquences pour stabiliser l'entraînement, ainsi que des optimisations de service d'inférence (regroupement de requêtes, décodage spéculatif via DSpark, calcul en précision réduite NVFP4/FP8) pour accélérer les cycles d'entraînement. Cognition a aussi triplé ses environnements RL et ajouté des données de suivi d'instructions. Les comparaisons publiées restent toutefois basées sur l'évaluation interne de Cognition, à l'exception de FrontierCode qui est son propre benchmark, ce qui invite à une lecture prudente face aux résultats annoncés pour les modèles concurrents comme Fable 5.1 ou GPT-6 Astra.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Anthropic lance Claude Opus 5, un modèle IA moins cher pour le code, les agents et les entreprises48VentureBeat AILLMs 02Meta AI lance Muse Spark 1.3, un modèle de code à base d'agents plus économe en appels d'outils et en tokens que 1.242MarkTechPostLLMs 03Kimi K3 de Moonshot devance Fable 5 sur le code frontend, mais accuse un net retard en mathématiques complexes42The DecoderLLMs 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.