Aller au contenu principal
LLMs · Actu ·

ByteDance dévoile SeedRealtime, un LLM audio-visuel en duplex intégral qui voit, écoute et parle

L'équipe Seed de ByteDance a dévoilé SeedRealtime, un grand modèle de langage nativement audio-visuel fonctionnant en duplex intégral, capable de fusionner son, vidéo et texte dans une architecture unique et de dialoguer en continu plutôt que tour par tour. Le modèle est déjà déployé dans l'application grand public Doubao, l'assistant conversationnel de ByteDance, mais aucun rapport technique, aucun nombre de paramètres, aucun poids ouvert ni aucun point d'accès via Volcano Engine ou BytePlus n'ont été publiés, ce qui rend le modèle inaccessible aux développeurs tiers pour l'instant. Seed a présenté sept scénarios de démonstration, dont quatre jugés significatifs : lors d'un dîner bruyant, le modèle associe les noms aux visages au fil des présentations puis attribue correctement à chaque interlocuteur ses préférences de voyage contradictoires ; au musée du Hebei, il surveille un flux vidéo en continu et prend la parole spontanément dès qu'un support en bronze recherché apparaît à l'écran, un comportement similaire lui permettant aussi de repérer une section précise dans un article sur ResNet et d'en lire les hyperparamètres à voix haute ; en observant la préparation d'un espresso, il interrompt l'utilisateur dès qu'il détecte une erreur dans le dosage des grains et suggère un ajustement du temps d'extraction de deux à trois secondes ; enfin, à l'aéroport de Beijing Daxing, il ignore les conversations non pertinentes sur un vol tout en répondant, une fois sollicité, à partir d'informations d'horaires déjà disparues de l'écran, et en recherchant en ligne l'emplacement d'un tapis à bagages.

2 min de lecturePertinence 38

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette annonce marque une rupture avec l'architecture en cascade encore dominante dans les systèmes vocaux temps réel, où des modules de reconnaissance vocale, de compréhension visuelle et de synthèse vocale distincts se succèdent, ajoutant de la latence et perdant de l'information à chaque étape. En intégrant perception, compréhension, décision et expression dans un seul modèle de bout en bout, et en supprimant le détecteur d'activité vocale externe habituellement nécessaire pour gérer les tours de parole, ByteDance affirme, sur la base de ses propres évaluations humaines, avoir divisé par deux les problèmes de timing conversationnel par rapport aux systèmes en cascade, sans toutefois fournir de benchmark chiffré ni de mesures de latence.

Cette initiative s'inscrit dans une course plus large vers l'interaction dite omnimodale, où les grands laboratoires cherchent à dépasser le modèle du chatbot tour par tour pour aller vers des assistants capables de voir, d'entendre et de parler en continu comme un interlocuteur humain. En choisissant de déployer SeedRealtime directement dans Doubao sans publier de documentation technique complète ni ouvrir l'accès à des tiers, ByteDance valide surtout une architecture de référence et déplace les attentes du secteur, tout en gardant pour l'instant le contrôle exclusif de sa mise en œuvre, la publication éventuelle d'un rapport technique ou d'une API restant à confirmer.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Bon, là on quitte enfin le terrain de la démo marketing pour du concret : associer un nom à un visage pendant un dîner bruyant, repérer l'erreur de dosage sur un espresso en temps réel, c'est un modèle qui perçoit en continu plutôt qu'un chatbot qui attend son tour. Ce qui compte vraiment ici, ce n'est pas la prouesse technique isolée, c'est que ByteDance déploie direct dans Doubao sans rapport technique ni API : il valide une architecture de référence pour tout le secteur tout en gardant la main dessus. Reste à voir si "deux fois moins de problèmes de timing" tient face à un vrai benchmark, parce que pour l'instant on n'a que leur mot.

À lire ensuite

01StepFun lance StepAudio 2.5 Realtime : un modèle vocal bout-en-bout avec RLHF dédié au jeu de rôle et compréhension paraverbale44MarkTechPostLLMs 02GPT-Live-1 arrive dans l’API : l’IA vous écoute et vous parle en même temps47Le Big DataLLMs 03L'équipe Qwen d'Alibaba publie Qwen3.5 Omni : un modèle multimodal natif pour le texte, l'audio, la vidéo et l'interaction en temps réel49MarkTechPostLLMs 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.