Kyutai lance Voice of Reason, un modèle vocal natif qui résout des calculs énoncés à l'oral grâce à l'apprentissage par renforcement
Le laboratoire français Kyutai a publié Voice of Reason, deux modèles vocaux en poids ouverts qui résolvent des problèmes de mathématiques énoncés à voix haute, sans transcription ni modèle de langage textuel intermédiaire. Basés sur GLM-4-Voice-9B, ils combinent un affinage supervisé et un apprentissage par renforcement. Sur GSM8K adapté à l'oral, la précision passe de 27,3% pour le modèle de base à 77,1% pour la meilleure version publiée. L'entraînement supervisé s'appuie sur 150 616 problèmes d'Orca-Math, reformulés pour l'oral par Qwen3-235B et vocalisés par le système DSM de Kyutai. Pour le renforcement, mené sur 16 GPU H100 pendant 1500 mises à jour, un juge automatique, Qwen3-235B-A22B-2507, évalue les réponses sans voir la solution de référence, avec 88% d'accord avec des évaluateurs humains. Les deux versions, dont une variante « stitch » qui insère de courts blocs de raisonnement silencieux entre les segments parlés, tournent sur un seul GPU H100 et sont publiées sous la licence de GLM-4-Voice.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette avancée compte parce que les modèles vocaux natifs accusaient un net retard en raisonnement face aux pipelines classiques qui enchaînent reconnaissance vocale, LLM textuel et synthèse, une architecture plus lente et qui perd les nuances de ton. Voice of Reason montre que ces gains tiennent en conditions réelles : transcrites automatiquement, les réponses du modèle stitch conservent 72% de précision, et la qualité de la voix, mesurée par UTMOSv2, reste quasiment inchangée après l'entraînement. Les progrès ne viennent pas de réponses plus longues, le modèle direct répondant même plus vite après renforcement, passant de 41,9 à 36,4 secondes en moyenne. Revers de la médaille, les connaissances générales du modèle reculent nettement sur le benchmark oral TriviaQA, signe que la spécialisation en mathématiques a un coût.
Ces travaux s'inscrivent dans une course pour rapprocher les modèles vocaux natifs des pipelines en cascade et des grands modèles omnimodaux, qui restent en tête avec 84,7% pour Qwen2.5-Omni, 94,6% pour Qwen3-Omni et 95,7% pour une cascade appuyée sur un LLM de 31 milliards de paramètres. Kyutai revendique la première application du renforcement au raisonnement mathématique dans un modèle vocal natif, après la méthode STITCH qui avait porté le score à 58,7%. Deux choix techniques se sont révélés déterminants : une correction de température dans la fonction de perte, sans laquelle le score s'effondre à 12,3%, et la fusion des tokens audio en un seul token abstrait pour réduire la variance de l'apprentissage. Le renforcement se montre en outre très efficace avec peu de données, un entraînement prolongé sur seulement 10% du jeu supervisé atteignant 58,5% de précision, contre 43,9% pour l'affinage seul.
Kyutai, laboratoire de recherche français, publie en open source une avancée technique sur les modèles vocaux natifs, renforçant la position de la France dans la recherche en IA vocale.