Aller au contenu principal
Cohere publie un modèle open source qui domine les benchmarks de reconnaissance vocale
OutilsThe Decoder · 1 min de lecture

Cohere publie un modèle open source qui domine les benchmarks de reconnaissance vocale

Source originale ↗·

Cohere a publié un nouveau modèle de reconnaissance vocale open source qui surpasse l'ensemble de ses concurrents sur les benchmarks de référence du secteur, y compris Whisper d'OpenAI, le standard de facto depuis plusieurs années. Le modèle est disponible librement, ce qui permet à n'importe quelle équipe de le déployer, le modifier et l'intégrer sans restrictions de licence.

Cette sortie représente un défi direct à la domination d'OpenAI dans le domaine de la transcription automatique. Whisper, lancé en 2022, s'est imposé comme la solution de référence pour des milliers d'applications professionnelles et open source. Qu'un acteur comme Cohere propose désormais une alternative plus performante et librement accessible change concrètement la donne pour les développeurs, les entreprises et les chercheurs qui cherchent à traiter de l'audio à grande échelle sans dépendance à un fournisseur propriétaire.

Cohere, spécialisé dans les modèles de langage à destination des entreprises, élargit ainsi son périmètre au-delà du texte vers la modalité vocale, un segment en forte croissance. Cette publication s'inscrit dans une tendance plus large où les acteurs de l'IA rivalisent d'open source stratégique pour gagner en adoption et en crédibilité face aux géants comme OpenAI et Google. La qualité des benchmarks annoncés reste à confirmer par la communauté, mais le signal envoyé à l'industrie est clair.

Impact France/UE

Les développeurs et entreprises européens peuvent adopter une alternative open source performante à Whisper pour la transcription vocale, réduisant leur dépendance aux solutions propriétaires américaines.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Cohere lance Cohere Transcribe, un modèle de reconnaissance vocale automatique de pointe pour les entreprises
1MarkTechPost 

Cohere lance Cohere Transcribe, un modèle de reconnaissance vocale automatique de pointe pour les entreprises

Cohere, l'entreprise canadienne spécialisée dans les grands modèles de langage pour les entreprises, a lancé le 26 mars 2026 son premier modèle de reconnaissance automatique de la parole, baptisé Cohere Transcribe. Dès sa sortie, le modèle s'est classé premier sur le classement Open ASR Leaderboard de Hugging Face, avec un taux d'erreur moyen de 5,42 % (WER) sur sept ensembles de benchmark, AMI, Earnings22, GigaSpeech, LibriSpeech, SPGISpeech, TED-LIUM et VoxPopuli. Il surpasse ainsi les références du marché : Whisper Large v3 d'OpenAI (7,44 % WER), ElevenLabs Scribe v2 (5,83 %) et Qwen3-ASR-1.7B (5,76 %). Dans des évaluations humaines en anglais, les annotateurs ont préféré Transcribe dans 78 % des cas face à IBM Granite 4.0, 67 % face à NVIDIA Canary, et 64 % face à Whisper Large v3. Le modèle prend en charge 14 langues, dont le français, l'anglais, l'arabe, le chinois et le japonais, en misant sur la qualité plutôt que sur l'exhaustivité. Ce lancement marque une entrée stratégique de Cohere sur un segment jusqu'ici dominé par OpenAI, Google et Meta. Pour les entreprises, la transcription automatique fiable est un prérequis pour exploiter des données audio massives : appels de centres de contact, réunions, audiences juridiques, transcriptions médicales. Un WER inférieur à 6 % représente un seuil de qualité utilisable en production sans correction humaine systématique, ce qui change concrètement l'économie du traitement audio à grande échelle. La capacité du modèle à traiter des fichiers longs, jusqu'à des enregistrements de plus d'une heure, via un système de découpage automatique en segments de 35 secondes avec réassemblage intelligent répond directement aux usages entreprise les plus exigeants, comme les earnings calls ou les procédures légales. Sur le plan technique, Cohere a opté pour une architecture hybride Conformer-Transformer : un encodeur Conformer de grande taille, qui combine réseaux convolutifs (efficaces pour les détails acoustiques locaux) et mécanismes d'attention (pour les dépendances linguistiques longue portée), couplé à un décodeur Transformer allégé. Ce choix architectural, entraîné par supervision classique (cross-entropy), contraste avec les approches purement Transformer comme Whisper. Cohere, qui avait jusqu'ici concentré son offre sur les modèles de texte et d'embedding, se positionne désormais sur une stack multimodale complète à destination des entreprises. Dans un contexte où les grandes plateformes, Microsoft, Zoom, Google, intègrent déjà de la transcription native dans leurs outils, Cohere parie sur une offre souveraine et personnalisable pour les équipes qui ne veulent pas dépendre des APIs propriétaires des géants américains.

UECohere Transcribe supporte le français parmi ses 14 langues et se positionne comme alternative souveraine aux APIs américaines pour les entreprises européennes souhaitant traiter des données audio sensibles en interne.

OutilsOpinion
1 source
Meilleurs modèles de reconnaissance vocale (ASR) open source en 2026 : comparatif WER, langues, latence et licences
2MarkTechPost 

Meilleurs modèles de reconnaissance vocale (ASR) open source en 2026 : comparatif WER, langues, latence et licences

Cohere a publié en mars 2026 son modèle de reconnaissance vocale Transcribe, doté de 2 milliards de paramètres et sous licence Apache 2.0, qui a pris la tête du Open ASR Leaderboard d'Hugging Face avec un taux d'erreur mot (WER) moyen de 5,42%. Cinq semaines plus tard, IBM a riposté avec Granite Speech 4.1 2B, à 5,33%. Depuis, ARK-ASR-3B et MOSS-Transcribe-preview-2B ont affiché des scores encore plus bas, si bien que le sommet du classement se joue désormais à moins d'un point de WER. Mais ce chiffre de 5,42% mérite d'être décortiqué: il correspond à une moyenne sur huit jeux de test anglophones incluant TED-LIUM (AMI 8,13, Earnings-22 10,86, GigaSpeech 9,34, LibriSpeech clean 1,25, LibriSpeech other 2,37, SPGISpeech 3,08, TED-LIUM 2,49, VoxPopuli 5,87). Or ARK-ASR-3B affiche son 5,04% sur seulement sept jeux, sans TED-LIUM, l'un des plus faciles du lot. En recalculant Cohere et Granite sur ces mêmes sept jeux, leurs scores remontent respectivement à 5,84 et 5,65: l'avance réelle d'ARK est donc plus grande que ne le laissent penser les chiffres bruts, pas plus petite. Cette affaire de méthodologie a des conséquences très concrètes pour quiconque doit choisir un modèle de transcription en production. Le rang au classement n'est plus le critère décisif: la licence, la couverture linguistique, le support du streaming et le coût par heure audio pèsent désormais davantage. Deux biais supplémentaires fragilisent le classement public: MOSS-Transcribe-preview-2B a été explicitement affiné par apprentissage par renforcement sur les données d'entraînement du leaderboard lui-même, ce qui mesure sa capacité à optimiser le benchmark plutôt que sa performance réelle. Par ailleurs, des jeux d'évaluation privés fournis par Appen, couvrant les accents australien, canadien, indien et américain en parole scriptée et spontanée, rebattent les cartes: activés, ils font passer zoom/scribe_v1 de la quatrième à la première place, reléguant le leader public. Les modèles calibrés sur de la parole lue propre s'effondrent proportionnellement plus sur de la conversation spontanée. Sur le terrain de la précision pure, Cohere Transcribe reste le modèle réellement adopté en production, avec plus de 620 000 téléchargements en un mois et un support d'exécution large (transformers, vLLM, mlx-audio pour Apple Silicon, port Rust, version WebGPU). Construit autour d'un encodeur Conformer et d'un décodeur Transformer léger entraîné depuis zéro, il couvre 14 langues et affiche un taux de préférence humaine de 61% en moyenne, 78% face à IBM Granite 4.0 1B Speech et 64% face à Whisper large-v3. Sa fiche technique reconnaît toutefois l'absence de détection automatique de langue, d'horodatage et de diarisation, ainsi qu'une tendance à halluciner du texte sur du silence. Granite Speech 4.1 2B, entraîné sur 174 000 heures audio, mise lui sur la polyvalence plutôt que sur le score brut: six langues, traduction vocale bidirectionnelle, biais par liste de mots-clés pour les noms propres, et gestion fine de la ponctuation.

OutilsOutil
1 source
Cohere lance Transcribe Arabic, un modèle open source pour les défis complexes de transcription en arabe
3The Decoder 

Cohere lance Transcribe Arabic, un modèle open source pour les défis complexes de transcription en arabe

Cohere a dévoilé Transcribe Arabic, un nouveau modèle de reconnaissance vocale open source spécialement conçu pour l'arabe. Disponible sur Hugging Face sous licence Apache 2.0, ce modèle compte 2 milliards de paramètres et se positionne comme une alternative plus performante que Whisper d'OpenAI et OmniASR sur les cas d'usage les plus délicats de la langue arabe : la diversité des dialectes régionaux, le code-switching (le passage fluide d'une langue à l'autre au sein d'une même phrase) et la transcription de discours bilingues mêlant arabe et anglais, une pratique courante dans de nombreux pays du Golfe et du Maghreb. Cette sortie répond à un problème concret et longtemps négligé par les grands modèles vocaux généralistes : l'arabe parlé varie énormément d'une région à l'autre, au point que des dialectes comme l'égyptien, le levantin ou le golfique peuvent être quasiment incompréhensibles entre eux, tout en s'écartant fortement de l'arabe standard moderne utilisé à l'écrit. Les outils de transcription entraînés principalement sur des données anglophones ou sur de l'arabe standard échouent souvent face à cette réalité linguistique, ce qui limite leur utilité pour les entreprises, médias ou services publics de la région. En choisissant l'open source et la licence Apache 2.0, Cohere permet à des développeurs et chercheurs du monde entier d'adapter librement le modèle à leurs propres besoins, sans contrainte commerciale. Cette démarche s'inscrit dans une compétition plus large entre acteurs de l'IA pour combler les lacunes linguistiques des modèles vocaux, un terrain où l'arabe, parlé par plus de 400 millions de personnes, reste historiquement sous-représenté malgré son poids démographique et économique.

UEImpact indirect : ce modèle pourrait intéresser les entreprises, médias et services publics français en lien avec les importantes communautés arabophones du Maghreb, mais aucune entreprise ou institution européenne n'est directement impliquée.

💬 Enfin un modèle qui prend le dialecte au sérieux plutôt que de plaquer de l'arabe standard sur tout le monde. Ça paraît anecdotique, mais c'est justement là que les gros modèles généralistes se plantent depuis des années : ils testent bien sur les benchmarks propres et s'écroulent dès qu'un Marocain switche à l'anglais au milieu d'une phrase. Sur 400 millions de locuteurs, il aura fallu un acteur de niche pour combler ce que les mastodontes du secteur ont ignoré.

OutilsActu
1 source
Cohere lance un modèle ASR open-weight avec 5,4 % d'erreur, suffisant pour remplacer les API vocales en production
4VentureBeat AI 

Cohere lance un modèle ASR open-weight avec 5,4 % d'erreur, suffisant pour remplacer les API vocales en production

Cohere a lancé Transcribe, un modèle de reconnaissance vocale automatique (ASR) en open-weight, disponible depuis mars 2026 via API ou dans son Model Vault sous l'identifiant cohere-transcribe-03-2026. Avec 2 milliards de paramètres et une licence Apache-2.0 autorisant un usage commercial immédiat, le modèle affiche un taux d'erreur moyen sur les mots (WER) de 5,42 %, le meilleur score actuellement sur le classement ASR de Hugging Face. Il devance Whisper Large v3 d'OpenAI (7,44 %), ElevenLabs Scribe v2 (5,83 %) et Qwen3-ASR-1.7B (5,76 %). Transcribe prend en charge 14 langues : anglais, français, allemand, italien, espagnol, grec, néerlandais, polonais, portugais, chinois, japonais, coréen, vietnamien et arabe. Sur des benchmarks spécialisés, il obtient 8,15 % sur AMI (compréhension de réunions) et 5,87 % sur VoxPopuli (diversité d'accents). Ce lancement change concrètement la donne pour les entreprises qui construisent des workflows voix, des pipelines de transcription ou des systèmes de recherche audio. Jusqu'ici, elles devaient choisir entre des API fermées, précises mais problématiques pour la souveraineté des données, ou des modèles open source moins performants. Transcribe rompt ce compromis : il tourne sur l'infrastructure GPU locale d'une organisation, éliminant les risques de résidence des données et les pénalités de latence liées aux API externes. Pour les équipes qui construisent des pipelines RAG ou des agents IA intégrant de l'audio, c'est une voie directe vers la transcription de qualité production sans dépendance à un fournisseur cloud. Cohere se positionne depuis plusieurs années comme l'alternative "enterprise-first" aux grands modèles grand public, en misant sur le déploiement privé et la conformité réglementaire. Transcribe s'inscrit dans cette stratégie : là où Whisper avait été publié comme modèle de recherche sous licence MIT sans priorité commerciale immédiate, Cohere livre d'emblée un modèle prêt pour la production. La société précise avoir optimisé simultanément la précision (WER bas) et le débit (RTFx élevé), ce qui est techniquement difficile dans la catégorie des modèles de plus d'un milliard de paramètres. Les premiers utilisateurs ont salué notamment la capacité à rapatrier en interne des flux audio qui transitaient jusqu'alors par des API tierces, un enjeu croissant dans les secteurs soumis au RGPD ou aux réglementations sectorielles strictes comme la finance et la santé.

UELe modèle supporte le français et permet un déploiement on-premise éliminant les risques de résidence des données, un avantage direct pour les entreprises européennes soumises au RGPD dans les secteurs finance et santé.

OutilsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic