Aller au contenu principal
ByteDance dévoile SeedRealtime, un LLM audio-visuel en duplex intégral qui voit, écoute et parle
LLMsMarkTechPost · 2 min de lecture

ByteDance dévoile SeedRealtime, un LLM audio-visuel en duplex intégral qui voit, écoute et parle

Source originale ↗·

L'équipe Seed de ByteDance a dévoilé SeedRealtime, un grand modèle de langage nativement audio-visuel fonctionnant en duplex intégral, capable de fusionner son, vidéo et texte dans une architecture unique et de dialoguer en continu plutôt que tour par tour. Le modèle est déjà déployé dans l'application grand public Doubao, l'assistant conversationnel de ByteDance, mais aucun rapport technique, aucun nombre de paramètres, aucun poids ouvert ni aucun point d'accès via Volcano Engine ou BytePlus n'ont été publiés, ce qui rend le modèle inaccessible aux développeurs tiers pour l'instant. Seed a présenté sept scénarios de démonstration, dont quatre jugés significatifs : lors d'un dîner bruyant, le modèle associe les noms aux visages au fil des présentations puis attribue correctement à chaque interlocuteur ses préférences de voyage contradictoires ; au musée du Hebei, il surveille un flux vidéo en continu et prend la parole spontanément dès qu'un support en bronze recherché apparaît à l'écran, un comportement similaire lui permettant aussi de repérer une section précise dans un article sur ResNet et d'en lire les hyperparamètres à voix haute ; en observant la préparation d'un espresso, il interrompt l'utilisateur dès qu'il détecte une erreur dans le dosage des grains et suggère un ajustement du temps d'extraction de deux à trois secondes ; enfin, à l'aéroport de Beijing Daxing, il ignore les conversations non pertinentes sur un vol tout en répondant, une fois sollicité, à partir d'informations d'horaires déjà disparues de l'écran, et en recherchant en ligne l'emplacement d'un tapis à bagages.

Cette annonce marque une rupture avec l'architecture en cascade encore dominante dans les systèmes vocaux temps réel, où des modules de reconnaissance vocale, de compréhension visuelle et de synthèse vocale distincts se succèdent, ajoutant de la latence et perdant de l'information à chaque étape. En intégrant perception, compréhension, décision et expression dans un seul modèle de bout en bout, et en supprimant le détecteur d'activité vocale externe habituellement nécessaire pour gérer les tours de parole, ByteDance affirme, sur la base de ses propres évaluations humaines, avoir divisé par deux les problèmes de timing conversationnel par rapport aux systèmes en cascade, sans toutefois fournir de benchmark chiffré ni de mesures de latence.

Cette initiative s'inscrit dans une course plus large vers l'interaction dite omnimodale, où les grands laboratoires cherchent à dépasser le modèle du chatbot tour par tour pour aller vers des assistants capables de voir, d'entendre et de parler en continu comme un interlocuteur humain. En choisissant de déployer SeedRealtime directement dans Doubao sans publier de documentation technique complète ni ouvrir l'accès à des tiers, ByteDance valide surtout une architecture de référence et déplace les attentes du secteur, tout en gardant pour l'instant le contrôle exclusif de sa mise en œuvre, la publication éventuelle d'un rapport technique ou d'une API restant à confirmer.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

StepFun lance StepAudio 2.5 Realtime : un modèle vocal bout-en-bout avec RLHF dédié au jeu de rôle et compréhension paraverbale
1MarkTechPost 

StepFun lance StepAudio 2.5 Realtime : un modèle vocal bout-en-bout avec RLHF dédié au jeu de rôle et compréhension paraverbale

Le laboratoire d'intelligence artificielle shanghaïen StepFun a lancé StepAudio 2.5 Realtime, un modèle vocal en temps réel de bout en bout capable de maintenir des personnages stables lors de conversations prolongées. Contrairement aux systèmes classiques qui enchaînent reconnaissance vocale, raisonnement et synthèse en étapes séparées, StepAudio 2.5 Realtime traite l'audio en entrée et produit de l'audio en sortie au sein d'un unique système unifié, sans pipeline intermédiaire. Le modèle supporte le chinois et l'anglais, et s'intègre via une API WebSocket à l'adresse wss://api.stepfun.com/v1/realtime. Sur les cinq dimensions évaluées lors de benchmarks conduits en avril 2026, le modèle s'est classé premier : 80,41 en évaluation humaine subjective, 86,36 en dialogue général, 84,80 en scénario automobile, 79,80 en questions-réponses orales sur 11 tâches de compréhension audio, et 82,18 en compréhension paralinguistique. Ce que distingue fondamentalement ce modèle, c'est sa capacité à percevoir et interpréter les signaux paralinguistiques, c'est-à-dire les informations acoustiques non verbales comme le ton, le débit de parole, les pauses, les soupirs ou les rires. En analysant ces éléments directement sur les caractéristiques audio plutôt que sur la transcription textuelle, le modèle peut détecter la fatigue dans un ton bas ou la frustration dans un débit rapide, adaptant ainsi ses réponses à l'état émotionnel de l'interlocuteur. Par ailleurs, StepFun a appliqué un entraînement par renforcement à partir de retours humains (RLHF) spécifiquement dédié à la cohérence de personnage dans les scénarios de roleplay, ciblant directement le problème bien connu de dérive hors-personnage qui affecte la plupart des agents conversationnels actuels. Combinée à une fusion profonde entre compréhension et génération vocale, cette approche permet au modèle de calibrer un registre émotionnel global sur une réponse tout en ajustant les détails acoustiques fins au niveau de chaque phrase. StepFun s'est appuyé sur plus de 10 000 personas rédigés nativement, amplifiés algorithmiquement pour constituer une matrice de données à l'échelle du million, couplée à des millions d'échantillons conversationnels réels. Cette stratégie d'augmentation évite l'étiquetage manuel massif tout en garantissant la robustesse sur des sujets conversationnels rares ou complexes. Le lancement de StepAudio 2.5 Realtime s'inscrit dans une compétition croissante autour des interfaces vocales en temps réel, où OpenAI, Google et plusieurs acteurs asiatiques investissent massivement. La capacité à maintenir un personnage cohérent sur la durée, combinée à une compréhension émotionnelle fine, positionne ce type de modèle comme une brique centrale pour les assistants embarqués, la téléphonie automatisée et les applications de compagnonnage interactif.

💬 La vraie différence ici c'est la compréhension paralinguistique : lire la fatigue ou la frustration directement sur l'audio, sans passer par la transcription texte. J'attends ça depuis longtemps sur les agents vocaux. Le RLHF ciblé sur la cohérence de personnage en roleplay c'est une vraie bonne idée, reste à voir si les benchmarks tiennent une fois en prod avec de vrais utilisateurs.

LLMsActu
1 source
L'équipe Qwen d'Alibaba publie Qwen3.5 Omni : un modèle multimodal natif pour le texte, l'audio, la vidéo et l'interaction en temps réel
2MarkTechPost 

L'équipe Qwen d'Alibaba publie Qwen3.5 Omni : un modèle multimodal natif pour le texte, l'audio, la vidéo et l'interaction en temps réel

L'équipe Qwen d'Alibaba a publié Qwen3.5-Omni, un modèle multimodal natif capable de traiter simultanément du texte, des images, de l'audio et de la vidéo au sein d'un seul pipeline computationnel. Disponible en trois variantes, Plus (raisonnement complexe), Flash (faible latence) et Light (efficacité), le modèle phare Qwen3.5-Omni-Plus revendique des résultats de pointe sur 215 sous-tâches de compréhension et de raisonnement audio et audiovisuel, dépassant selon Alibaba le Gemini 3.1 Pro de Google sur la compréhension audio générale, la reconnaissance vocale et la traduction. Son encodeur audio natif (Audio Transformer) a été pré-entraîné sur plus de 100 millions d'heures de données audio-visuelles, et l'architecture supporte des fenêtres contextuelles de 256 000 tokens, soit plus de 10 heures d'audio continu ou 400 secondes de contenu vidéo 720p. Ce lancement marque un tournant dans la conception des modèles multimodaux : on passe des architectures « en patchwork », où des encodeurs spécialisés (comme Whisper pour l'audio) sont greffés sur un socle textuel, à des systèmes entièrement natifs et unifiés. Pour l'industrie, cela signifie des agents vocaux et visuels capables d'interaction en temps réel sans les pénalités de latence propres aux pipelines en cascade. L'architecture Thinker-Talker, couplée à un mécanisme Hybrid-Attention Mixture of Experts (MoE), permet au modèle d'allouer dynamiquement ses ressources selon la modalité dominante, favorisant les tokens visuels lors d'une analyse vidéo, par exemple, tout en conservant un débit compatible avec les services de streaming. Concrètement, les développeurs d'applications vocales, de systèmes de sous-titrage automatique ou d'assistants multimodaux disposent d'un socle technique plus robuste et moins coûteux à exploiter. La course aux modèles omnimodaux s'est accélérée depuis que Google a démontré avec Gemini la viabilité des architectures nativement multimodales, forçant les acteurs comme OpenAI, Meta et Alibaba à répondre. Qwen3.5-Omni s'inscrit dans la stratégie offensive d'Alibaba pour s'imposer comme alternative crédible aux modèles occidentaux, notamment sur les marchés asiatiques et auprès des entreprises sensibles à la souveraineté des données. Deux problèmes d'ingénierie spécifiques à l'interaction temps réel ont été adressés : la stabilité du flux de parole (via un mécanisme baptisé ARIA, Adaptive Rate Interleave Alignment, qui synchronise les tokens texte et audio de nature asymétrique) et la fluidité conversationnelle. Les benchmarks avancés par Alibaba, 8 tests de reconnaissance automatique de la parole, 156 tâches de traduction parole-texte dans des langues spécifiques, 43 tâches d'ASR ciblées, restent à valider par des évaluations indépendantes, mais positionnent déjà Qwen3.5-Omni comme un concurrent direct aux modèles les plus avancés du moment.

UELes entreprises européennes sensibles à la souveraineté des données disposent d'une alternative crédible aux modèles américains pour leurs déploiements d'agents vocaux et visuels multimodaux en temps réel.

💬 L'architecture native, c'est vraiment ce qui change la donne ici. Pas un Whisper greffé sur un LLM avec du scotch, mais un seul pipeline qui ingère tout en même temps, avec 100 millions d'heures d'entraînement audio-vidéo derrière. Les benchmarks Alibaba, bon, à vérifier en conditions réelles, mais le socle technique, lui, a l'air solide.

LLMsOpinion
1 source
NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un LLM audio-texte unifié qui préserve l'intelligence textuelle de son modèle de base
3MarkTechPost 

NVIDIA lance Audex (Nemotron-Labs-Audex-30B-A3B) : un LLM audio-texte unifié qui préserve l'intelligence textuelle de son modèle de base

NVIDIA a publié Audex, officiellement Nemotron-Labs-Audex-30B-A3B, un grand modèle de langage unifié qui comprend et génère à la fois texte, parole et sons généraux. L'architecture est une Mixture-of-Experts de 30 milliards de paramètres, dont seulement 3 milliards activés par token, bâtie sur le socle textuel Nemotron-Cascade-2-30B-A3B, un hybride Mamba-Transformer de 52 couches avec 128 experts routables et 6 activés. Une version plus légère, Audex-2B, est publiée en parallèle, les deux sous licence non commerciale. L'audio entrant passe par l'encodeur AF-Whisper, issu d'Audio Flamingo 3 et basé sur Whisper Large-v3, projeté dans l'espace d'embedding textuel via des adaptateurs MLP. En sortie, le vocabulaire grimpe de 131 072 à 205 312 tokens pour loger deux codecs : X-Codec2 pour la parole, à 50 tokens par seconde, et X-Codec pour les sons complexes, à 200 tokens par seconde. Le modèle gère jusqu'à un million de tokens de contexte et tourne sur Megatron-LM et vLLM, avec mode instruction et mode raisonnement. L'objectif est d'éviter la "taxe du texte", cette perte de performance linguistique que subissent la plupart des modèles multimodaux quand ils apprennent l'audio. NVIDIA affirme que ce phénomène touche même des modèles qui se contentent de générer de la parole. Sur MMLU-Redux, Audex obtient 86,4 points contre 86,3 pour son socle texte seul, et le dépasse même sur IMO AnswerBench avec 81,1 contre 79,3, avec de légères baisses seulement sur MMLU-Pro et GPQA-Diamond. À titre de comparaison, Qwen3-Omni-30B-A3B-Thinking, de taille similaire, chute nettement face à son propre socle : sur HMMT Feb25, Audex atteint 92,2 points contre 89,0 pour Qwen3.5-35B-A3B et seulement 60,4 pour Qwen3-Omni-Thinking. Pour les entreprises voulant déployer des assistants vocaux sans sacrifier la qualité des réponses écrites, l'enjeu est direct, d'autant qu'Audex compte parmi les rares modèles ouverts à générer des sons au-delà de la simple parole. Cette robustesse vient d'un entraînement progressif plutôt que d'un pré-entraînement audio classique. Audex part d'un point de contrôle texte déjà ajusté, puis enchaîne réchauffement audio, génération audio et compréhension audio, dans cet ordre. Pendant le réchauffement, les embeddings textuels restent gelés, car les dégeler dégradait la qualité du texte. Une recette mélangeant toutes les données en une seule étape a aussi été testée, mais elle cassait la récupération d'information sur les longs contextes. Après l'ajustement supervisé, NVIDIA applique un apprentissage par renforcement limité au texte et une distillation multi-domaine, ce qui améliore encore les scores textuels. L'entraînement mobilise 157,4 milliards de tokens audio et 320,5 milliards de tokens texte, couvrant reconnaissance vocale, traduction, synthèse et compréhension audio, dans une course plus large entre laboratoires pour des modèles multimodaux sans compromis.

💬 Le vrai sujet, c'est pas l'audio, tu t'en doutes, c'est que NVIDIA démonte l'excuse classique du multimodal : ajouter du son dégraderait forcément le texte. Audex fait mieux que son propre socle texte sur MMLU-Redux, quand Qwen3-Omni s'écroule sur les mêmes benchmarks, la preuve que la "taxe du texte" est un problème d'entraînement, pas une fatalité d'architecture. Bonne nouvelle si tu veux déployer un assistant vocal sans sacrifier la qualité des réponses écrites, mais la licence non commerciale ferme la porte à un vrai déploiement en boîte pour l'instant.

LLMsActu
1 source
GPT-Realtime-2 : l’IA vocale d’OpenAI pense pendant qu’elle vous parle
4Le Big Data 

GPT-Realtime-2 : l’IA vocale d’OpenAI pense pendant qu’elle vous parle

OpenAI a annoncé le 7 mai 2026 le lancement de GPT-Realtime-2, son nouveau modèle vocal disponible via l'API Realtime. Ce modèle intègre directement les capacités de raisonnement de GPT-5, ce qui le distingue fondamentalement de ses prédécesseurs. Concrètement, il peut écouter, analyser des requêtes complexes, appeler des outils externes et gérer les interruptions sans perdre le fil d'une conversation. Sa fenêtre de contexte passe de 32 000 à 128 000 tokens, lui permettant de suivre des échanges prolongés sans oublier ce qui a été dit plusieurs minutes auparavant. OpenAI lance simultanément deux modèles complémentaires : GPT-Realtime-Translate, capable de traduire en temps réel des conversations dans plus de 70 langues d'entrée vers 13 langues de sortie, et GPT-Realtime-Whisper, dédié à la transcription ultra-rapide avec génération automatique de sous-titres et de notes de réunion. Deutsche Telekom a déjà intégré GPT-Realtime-Translate dans ses solutions de support vocal multilingue. Ce que change GPT-Realtime-2, c'est la nature même de l'interaction vocale avec une IA. Jusqu'ici, les assistants vocaux répondaient vite mais sans véritable compréhension du contexte. Ce nouveau modèle introduit un comportement plus humain : lorsqu'il traite une requête complexe, il verbalise son activité avec des phrases comme "Laissez-moi vérifier cela" ou "Je regarde votre calendrier", rendant les temps de traitement naturels plutôt qu'anxiogènes. Il est également capable de reconnaître ses propres difficultés au lieu de rester silencieux. Pour les entreprises qui déploient des agents vocaux en support client, en assistance médicale ou en gestion de réunions, ce niveau de robustesse change radicalement ce que l'on peut exiger de ces systèmes. Cette annonce s'inscrit dans une course accélérée à la voix comme interface centrale entre humains et logiciels. OpenAI positionne explicitement GPT-Realtime-2 comme un concurrent direct aux assistants vocaux établis de Google, Apple et Amazon, dont les limites en matière de raisonnement sont bien connues. La stratégie d'OpenAI est claire : en ouvrant ces capacités via API, la société mise sur les développeurs tiers pour construire la prochaine génération d'agents conversationnels. L'enjeu dépasse le simple gadget vocal : si parler devient plus efficace que cliquer, c'est toute la manière dont les professionnels interagissent avec leurs outils qui se trouve redéfinie. Les prochains mois diront si les usages en entreprise confirment cette promesse à grande échelle.

UEDeutsche Telekom a déjà intégré GPT-Realtime-Translate dans ses solutions de support vocal multilingue, ouvrant la voie à des agents vocaux multilingues pour les entreprises et opérateurs télécoms européens.

💬 Ce qui change vraiment ici, c'est pas la vitesse (on était déjà pas mal) mais le raisonnement en temps réel, embarqué directement dans le vocal. Le "Laissez-moi vérifier ça" plutôt que le silence mort pendant le traitement, c'est un détail UX qui va tout changer pour les équipes qui déploient des agents vocaux en support ou en médical. Sur le papier c'est exactement ce qui manquait, bon, reste à voir si ça tient à 10 000 appels simultanés.

LLMsOpinion
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic