Aller au contenu principal
LLMs · Opinion ·

Cohere lance North Small Translate, un modèle de traduction MoE de 218 milliards de paramètres, score de 83,6 sur WMT26 en 50 langues

Cohere a lancé North Small Translate, un nouveau modèle de traduction en poids ouverts développé avec Cohere Labs et l'entreprise RWS, dont les linguistes de Language Weaver ont contribué à affiner la qualité de sortie. Il s'agit d'un modèle Mixture-of-Experts épars comptant 218 milliards de paramètres au total, dont seulement 25 milliards actifs par requête, couvrant 50 langues, de l'albanais au vietnamien. Sur l'évaluation interne WMT26 de Cohere, il obtient un score moyen de 83,6 sur l'ensemble des langues, un score que l'entreprise revendique supérieur à DeepL, Google Translate, ainsi qu'à des modèles ouverts concurrents comme GLM 5.2 et Mistral Large 3. Une variante dite "Agentic", qui effectue plusieurs passes pour détecter et corriger ses propres erreurs, atteint même 84,36. Le modèle repose sur une architecture décodeur uniquement avec 128 experts dont 8 activés par token, une fenêtre de contexte de 16 000 tokens en entrée et en sortie, et un entraînement post-hoc spécifiquement orienté vers la qualité de traduction. Il est accessible gratuitement via l'API de Cohere jusqu'à certaines limites de débit, auto-hébergeable pour un usage non commercial, ou disponible sous licence commerciale.

2 min de lecturePertinence 59

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cet événement compte pour l'industrie car il ramène l'attention sur la traduction automatique, un cas d'usage historique du deep learning, à un moment où la plupart des laboratoires concentrent leurs efforts sur des modèles généralistes multitâches. Pour les entreprises internationales, la promesse est double: une meilleure qualité, en particulier sur les documents longs où North Small Translate obtient un score de 48,9 contre 21,3 pour Google Translate et 19,4 pour Gemma 4 31B sur la traduction de chapitres de livres entiers, et un coût nettement réduit, avec 0,000676 dollar par tâche contre 0,038928 dollar pour Gemini 3.1 Pro Preview, soit environ 58 fois moins cher. Cohere présente aussi cette sortie sous l'angle de la souveraineté numérique, arguant que les organisations incapables de communiquer efficacement à l'échelle mondiale ne peuvent pas rester autonomes, un argument qui vise particulièrement les gouvernements et grandes entreprises soucieux de ne pas dépendre d'outils américains ou chinois génériques.

Ce lancement s'inscrit dans une filiation historique directe: c'est en 2017 que des chercheurs de Google avaient introduit l'architecture Transformer dans leur article fondateur "Attention Is All You Need", justement à partir d'expériences de traduction anglais-allemand et anglais-français sur les jeux de données WMT 2014. Neuf ans plus tard, Cohere revient donc au problème d'origine avec un modèle dédié. North Small Translate s'inscrit dans la famille "North" de Cohere et fait suite à Tiny Aya et Command A Translate dans sa lignée multilingue. Il convient toutefois de noter que les chiffres de performance annoncés proviennent des propres tests de Cohere, évalués par le modèle GPT-5.6-Sol comme juge, et devront être confirmés par des résultats WMT26 indépendants avant d'être considérés comme définitifs. Les prochains mois diront si des laboratoires concurrents comme DeepL, Google ou les acteurs open source chinois comme Qwen et GLM répliquent ces performances sur des bancs d'essai neutres.

Impact France / UEChamp produit par Le Fil IA

Les entreprises et administrations européennes pourraient s'intéresser a l'argument de souveraineté numérique de Cohere pour réduire leur dépendance aux outils américains ou chinois de traduction.

À lire ensuite

01Cohere lance Command A+, un modèle MoE sparse de 218 milliards de paramètres pour agents autonomes, utilisable sur seulement deux GPU H10046MarkTechPostLLMs 02Tencent lance Hy3, un modèle MoE ouvert de 295 milliards de paramètres (21 milliards actifs) et 256K de contexte47MarkTechPostLLMs 03NVIDIA lance Nemotron 3 Ultra, un modèle open source de 550 milliards de paramètres50Latent SpaceLLMs 
Dossier · Open weight & Open sourceSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.