
ByteDance dévoile SeedRealtime, un LLM audio-visuel en duplex intégral qui voit, écoute et parle
L'équipe Seed de ByteDance a dévoilé SeedRealtime, un grand modèle de langage nativement audio-visuel fonctionnant en duplex intégral, capable de fusionner son, vidéo et texte dans une architecture unique et de dialoguer en continu plutôt que tour par tour. Le modèle est déjà déployé dans l'application grand public Doubao, l'assistant conversationnel de ByteDance, mais aucun rapport technique, aucun nombre de paramètres, aucun poids ouvert ni aucun point d'accès via Volcano Engine ou BytePlus n'ont été publiés, ce qui rend le modèle inaccessible aux développeurs tiers pour l'instant. Seed a présenté sept scénarios de démonstration, dont quatre jugés significatifs : lors d'un dîner bruyant, le modèle associe les noms aux visages au fil des présentations puis attribue correctement à chaque interlocuteur ses préférences de voyage contradictoires ; au musée du Hebei, il surveille un flux vidéo en continu et prend la parole spontanément dès qu'un support en bronze recherché apparaît à l'écran, un comportement similaire lui permettant aussi de repérer une section précise dans un article sur ResNet et d'en lire les hyperparamètres à voix haute ; en observant la préparation d'un espresso, il interrompt l'utilisateur dès qu'il détecte une erreur dans le dosage des grains et suggère un ajustement du temps d'extraction de deux à trois secondes ; enfin, à l'aéroport de Beijing Daxing, il ignore les conversations non pertinentes sur un vol tout en répondant, une fois sollicité, à partir d'informations d'horaires déjà disparues de l'écran, et en recherchant en ligne l'emplacement d'un tapis à bagages.
Cette annonce marque une rupture avec l'architecture en cascade encore dominante dans les systèmes vocaux temps réel, où des modules de reconnaissance vocale, de compréhension visuelle et de synthèse vocale distincts se succèdent, ajoutant de la latence et perdant de l'information à chaque étape. En intégrant perception, compréhension, décision et expression dans un seul modèle de bout en bout, et en supprimant le détecteur d'activité vocale externe habituellement nécessaire pour gérer les tours de parole, ByteDance affirme, sur la base de ses propres évaluations humaines, avoir divisé par deux les problèmes de timing conversationnel par rapport aux systèmes en cascade, sans toutefois fournir de benchmark chiffré ni de mesures de latence.
Cette initiative s'inscrit dans une course plus large vers l'interaction dite omnimodale, où les grands laboratoires cherchent à dépasser le modèle du chatbot tour par tour pour aller vers des assistants capables de voir, d'entendre et de parler en continu comme un interlocuteur humain. En choisissant de déployer SeedRealtime directement dans Doubao sans publier de documentation technique complète ni ouvrir l'accès à des tiers, ByteDance valide surtout une architecture de référence et déplace les attentes du secteur, tout en gardant pour l'instant le contrôle exclusif de sa mise en œuvre, la publication éventuelle d'un rapport technique ou d'une API restant à confirmer.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




