Aller au contenu principal
Outils · Outil ·

Meilleurs modèles de reconnaissance vocale (ASR) open source en 2026 : comparatif WER, langues, latence et licences

Cohere a publié en mars 2026 son modèle de reconnaissance vocale Transcribe, doté de 2 milliards de paramètres et sous licence Apache 2.0, qui a pris la tête du Open ASR Leaderboard d'Hugging Face avec un taux d'erreur mot (WER) moyen de 5,42%. Cinq semaines plus tard, IBM a riposté avec Granite Speech 4.1 2B, à 5,33%. Depuis, ARK-ASR-3B et MOSS-Transcribe-preview-2B ont affiché des scores encore plus bas, si bien que le sommet du classement se joue désormais à moins d'un point de WER. Mais ce chiffre de 5,42% mérite d'être décortiqué: il correspond à une moyenne sur huit jeux de test anglophones incluant TED-LIUM (AMI 8,13, Earnings-22 10,86, GigaSpeech 9,34, LibriSpeech clean 1,25, LibriSpeech other 2,37, SPGISpeech 3,08, TED-LIUM 2,49, VoxPopuli 5,87). Or ARK-ASR-3B affiche son 5,04% sur seulement sept jeux, sans TED-LIUM, l'un des plus faciles du lot. En recalculant Cohere et Granite sur ces mêmes sept jeux, leurs scores remontent respectivement à 5,84 et 5,65: l'avance réelle d'ARK est donc plus grande que ne le laissent penser les chiffres bruts, pas plus petite.

2 min de lecturePertinence 38

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette affaire de méthodologie a des conséquences très concrètes pour quiconque doit choisir un modèle de transcription en production. Le rang au classement n'est plus le critère décisif: la licence, la couverture linguistique, le support du streaming et le coût par heure audio pèsent désormais davantage. Deux biais supplémentaires fragilisent le classement public: MOSS-Transcribe-preview-2B a été explicitement affiné par apprentissage par renforcement sur les données d'entraînement du leaderboard lui-même, ce qui mesure sa capacité à optimiser le benchmark plutôt que sa performance réelle. Par ailleurs, des jeux d'évaluation privés fournis par Appen, couvrant les accents australien, canadien, indien et américain en parole scriptée et spontanée, rebattent les cartes: activés, ils font passer zoom/scribe_v1 de la quatrième à la première place, reléguant le leader public. Les modèles calibrés sur de la parole lue propre s'effondrent proportionnellement plus sur de la conversation spontanée.

Sur le terrain de la précision pure, Cohere Transcribe reste le modèle réellement adopté en production, avec plus de 620 000 téléchargements en un mois et un support d'exécution large (transformers, vLLM, mlx-audio pour Apple Silicon, port Rust, version WebGPU). Construit autour d'un encodeur Conformer et d'un décodeur Transformer léger entraîné depuis zéro, il couvre 14 langues et affiche un taux de préférence humaine de 61% en moyenne, 78% face à IBM Granite 4.0 1B Speech et 64% face à Whisper large-v3. Sa fiche technique reconnaît toutefois l'absence de détection automatique de langue, d'horodatage et de diarisation, ainsi qu'une tendance à halluciner du texte sur du silence. Granite Speech 4.1 2B, entraîné sur 174 000 heures audio, mise lui sur la polyvalence plutôt que sur le score brut: six langues, traduction vocale bidirectionnelle, biais par liste de mots-clés pour les noms propres, et gestion fine de la ponctuation.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Cohere lance Cohere Transcribe, un modèle de reconnaissance vocale automatique de pointe pour les entreprises46MarkTechPostOutils 02Cohere publie un modèle open source qui domine les benchmarks de reconnaissance vocale48The DecoderOutils 03Cohere lance un modèle ASR open-weight avec 5,4 % d'erreur, suffisant pour remplacer les API vocales en production52VentureBeat AIOutils 
Dossier · Hugging FaceSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.