Black Forest Labs lance FLUX 3, un modèle multimodal pour l'image, la vidéo, l'audio et la prédiction d'actions robotiques
Black Forest Labs (BFL) a dévoilé FLUX 3, un modèle de fondation multimodal capable d'apprendre simultanément à partir d'images, de vidéos et de fichiers audio au sein d'une seule architecture. Il s'agit du premier modèle de la famille FLUX à générer vidéo, audio et prédiction d'actions robotiques à partir d'un unique jeu de poids. La déclinaison FLUX 3 Video produit des clips allant jusqu'à 20 secondes en une seule génération, avec audio natif, et couvre plusieurs modes : texte-vers-vidéo, image-vers-vidéo, vidéo-vers-vidéo à partir d'un clip de référence, transitions contrôlées entre images-clés, et prolongement génératif d'une vidéo et d'un audio existants. BFL revendique aussi des fonctions de dialogue multilingue, un enchaînement agentique de plusieurs plans en séquences à plusieurs prises de vue, ainsi qu'une génération typographique animée particulièrement soignée. L'entreprise met en avant des résultats solides sur les expressions faciales humaines et sur l'association entre sons et événements physiques. Selon des tests de préférence humaine publiés par BFL sur des clips de 10 secondes en 720p avec audio, FLUX 3 a été préféré à Luma Ray 3.2 dans 93% des comparaisons, à Runway Gen-4.5 dans 77% des cas, jusqu'à 69% face à Grok Imagine Video, 60% face à Kling v3 Pro, 59% et 57% face aux deux versions de Happy Horse, et un score proche du 50/50 (52%) face à Seedance 2.0 et Gemini Omni Flash.
Cette avancée est importante parce qu'elle rapproche les modèles génératifs d'une compréhension unifiée du monde physique plutôt que d'une simple juxtaposition de compétences séparées par modalité. Pour BFL, aucune modalité prise isolément ne décrit complètement la réalité : l'image capture une structure spatiale figée, la vidéo restitue le temps et la dynamique physique, l'audio révèle les liens de causalité entre un événement mécanique et le son qu'il produit. En entraînant un seul modèle sur ces trois dimensions à la fois, chacune vient contraindre les autres, le son doit correspondre à l'impact visuel et le mouvement doit respecter la masse des objets. Cette cohérence intermodale intéresse directement les studios de production vidéo, les développeurs d'outils créatifs et, via le partenariat évoqué avec mimic robotics, les concepteurs de robots qui ont besoin de modèles capables de prédire des actions physiques plausibles.
Sur le plan technique, FLUX 3 s'appuie sur Self-Flow, une méthode de BFL introduite en mars 2026 qui combine un objectif d'appariement de flux avec un objectif de reconstruction de caractéristiques auto-supervisé. L'implémentation de référence publiée sur GitHub sous licence Apache-2.0 utilise une architecture SiT-XL/2 avec conditionnement par pas de temps au niveau du token, un taux de masquage de 25% et une auto-distillation entre un enseignant EMA à la couche 20 et un élève à la couche 8, mais ce point de contrôle reste un modèle de recherche limité à des images ImageNet en 256x256, distinct de FLUX 3 lui-même. BFL affirme avoir considérablement augmenté les ressources de calcul et de données pour appliquer cette même approche à l'échelle de la vidéo, de l'image et de l'audio combinés, ce qui constitue selon l'entreprise sa première réalisation entièrement fondée sur ce principe unificateur.
Black Forest Labs étant basée en Allemagne, ce lancement renforce la position d'un acteur européen dans la course mondiale aux modèles multimodaux génératifs face aux laboratoires américains et chinois.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




