Aller au contenu principal
Recherche · Paper ·

Kyutai lance Voice of Reason, un modèle vocal natif qui résout des calculs énoncés à l'oral grâce à l'apprentissage par renforcement

Le laboratoire français Kyutai a publié Voice of Reason, deux modèles vocaux en poids ouverts qui résolvent des problèmes de mathématiques énoncés à voix haute, sans transcription ni modèle de langage textuel intermédiaire. Basés sur GLM-4-Voice-9B, ils combinent un affinage supervisé et un apprentissage par renforcement. Sur GSM8K adapté à l'oral, la précision passe de 27,3% pour le modèle de base à 77,1% pour la meilleure version publiée. L'entraînement supervisé s'appuie sur 150 616 problèmes d'Orca-Math, reformulés pour l'oral par Qwen3-235B et vocalisés par le système DSM de Kyutai. Pour le renforcement, mené sur 16 GPU H100 pendant 1500 mises à jour, un juge automatique, Qwen3-235B-A22B-2507, évalue les réponses sans voir la solution de référence, avec 88% d'accord avec des évaluateurs humains. Les deux versions, dont une variante « stitch » qui insère de courts blocs de raisonnement silencieux entre les segments parlés, tournent sur un seul GPU H100 et sont publiées sous la licence de GLM-4-Voice.

2 min de lecturePertinence 65

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette avancée compte parce que les modèles vocaux natifs accusaient un net retard en raisonnement face aux pipelines classiques qui enchaînent reconnaissance vocale, LLM textuel et synthèse, une architecture plus lente et qui perd les nuances de ton. Voice of Reason montre que ces gains tiennent en conditions réelles : transcrites automatiquement, les réponses du modèle stitch conservent 72% de précision, et la qualité de la voix, mesurée par UTMOSv2, reste quasiment inchangée après l'entraînement. Les progrès ne viennent pas de réponses plus longues, le modèle direct répondant même plus vite après renforcement, passant de 41,9 à 36,4 secondes en moyenne. Revers de la médaille, les connaissances générales du modèle reculent nettement sur le benchmark oral TriviaQA, signe que la spécialisation en mathématiques a un coût.

Ces travaux s'inscrivent dans une course pour rapprocher les modèles vocaux natifs des pipelines en cascade et des grands modèles omnimodaux, qui restent en tête avec 84,7% pour Qwen2.5-Omni, 94,6% pour Qwen3-Omni et 95,7% pour une cascade appuyée sur un LLM de 31 milliards de paramètres. Kyutai revendique la première application du renforcement au raisonnement mathématique dans un modèle vocal natif, après la méthode STITCH qui avait porté le score à 58,7%. Deux choix techniques se sont révélés déterminants : une correction de température dans la fonction de perte, sans laquelle le score s'effondre à 12,3%, et la fusion des tokens audio en un seul token abstrait pour réduire la variance de l'apprentissage. Le renforcement se montre en outre très efficace avec peu de données, un entraînement prolongé sur seulement 10% du jeu supervisé atteignant 58,5% de précision, contre 43,9% pour l'affinage seul.

Impact France / UEChamp produit par Le Fil IA

Kyutai, laboratoire de recherche français, publie en open source une avancée technique sur les modèles vocaux natifs, renforçant la position de la France dans la recherche en IA vocale.

À lire ensuite

01Skyfall AI lance MORPHEUS, un benchmark de simulation d'entreprise persistante qui rend l'apprentissage par renforcement continu nécessaire38MarkTechPostRecherche 02Attribution du crédit par modélisation des récompenses en apprentissage par renforcement hors ligne orienté objectifs44arXiv cs.RORecherche 03Affordance-R1 : apprentissage par renforcement pour le raisonnement sur les affordances dans les LLM multimodaux39arXiv cs.RORecherche 
Dossier · Open weight & Open sourceSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.