Qwen publie Qwen3.8-LiveTranslate, un modèle d'interprétation en temps réel avec un décalage moyen de 2,3 secondes sur 60 langues
L'équipe Qwen d'Alibaba a lancé Qwen3.8-LiveTranslate, un nouveau modèle d'interprétation simultanée en temps réel qui traduit la parole en direct, avec prise en charge optionnelle de flux vidéo, tout en restituant texte et voix pendant que l'interlocuteur parle encore. Sa nouveauté technique centrale est une architecture baptisée Interleave, qui améliore la fidélité, la fluidité et la concision des traductions tout en réduisant le délai moyen mesuré par l'indicateur LAAL (Length-Adaptive Average Lagging), passé de 2,8 à 2,3 secondes, soit une baisse d'environ 18 %. Le modèle intègre aussi la diarisation des locuteurs en temps réel, un affichage bilingue synchronisé du texte source et de sa traduction, ainsi qu'une désambiguïsation contextuelle sur de longs échanges, capable par exemple de garder un nom propre cohérent tout au long d'une réunion. Il comprend 60 langues et peut en restituer 29 à l'oral avec audio et texte, dont le chinois, l'anglais, l'arabe, l'allemand, le français, l'espagnol, le japonais, le coréen et l'hindi, les 31 autres n'étant disponibles qu'en texte. Le service est accessible via une API WebSocket sous l'identifiant qwen3.8-livetranslate-flash-realtime, disponible sur Alibaba Cloud Model Studio et QwenCloud, avec une fenêtre de contexte de 53 248 tokens et des tarifs à Singapour de 7,50 dollars par million de tokens en entrée audio, 20 dollars en sortie texte et 30 dollars en sortie audio, des prix inférieurs à Pékin.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette avancée s'adresse directement aux usages professionnels de visioconférence, de sommets internationaux ou de diffusion en direct, où chaque seconde de décalage dégrade l'expérience d'écoute et la fluidité des échanges. En abaissant le retard sous les 2,5 secondes tout en conservant la reconnaissance des locuteurs multiples et la cohérence terminologique, Alibaba propose une alternative crédible et nettement moins coûteuse que l'interprétation humaine pour des réunions multilingues, avec un coût estimé à environ 1,54 dollar par heure de parole en entrée et sortie audio à Singapour. Cela pourrait accélérer l'adoption de l'interprétation automatique dans les entreprises, les institutions et les plateformes de streaming, en particulier pour les langues moins bien couvertes par les services existants.
Ce lancement s'inscrit dans la stratégie plus large d'Alibaba de renforcer sa gamme Qwen face à la concurrence croissante sur les modèles multimodaux temps réel, notamment ceux développés par les grands acteurs américains du secteur. Qwen3.8-LiveTranslate s'appuie sur la pile Qwen-Omni, entraînée sur des données multimodales à grande échelle avec alignement croisé entre langues et modalités, et coexiste avec une version Flash capable de traduire hors ligne de l'audio et de la vidéo déjà enregistrés. L'enjeu central de ce type de système reste l'arbitrage entre rapidité et précision : attendre plus de contexte améliore la qualité de traduction mais allonge le délai perçu par l'auditeur. Les prochaines évolutions attendues porteront probablement sur l'extension du nombre de langues parlées, l'amélioration du clonage vocal multi-locuteurs et la réduction supplémentaire de la latence.
Les entreprises et institutions européennes pourraient utiliser ce service pour des réunions ou diffusions multilingues, mais aucune entreprise française ou européenne n'est impliquée dans son développement.