Black Forest Labs lance FLUX 3 Action, un modèle d'action pour le monde réel en poids ouverts de 7 milliards de paramètres, en tête de RoboLab-120
Black Forest Labs (BFL), le laboratoire derrière les modèles d'images FLUX, a lancé FLUX 3 Action, un modèle de contrôle robotique en poids ouverts de 7 milliards de paramètres. Ce « World Action Model » lit les images de caméra, l'état du robot et une instruction textuelle, puis prédit conjointement les futures images vidéo et la prochaine séquence d'actions. Sur le classement RoboLab-120 (120 tâches simulées sous Isaac Sim, dix essais chacune sur un bras Franka de type DROID), il obtient 42,92% de réussite, devançant Cosmos 3 Nano de NVIDIA (36,8%, 16 milliards de paramètres) et π0.5 (28%, 3,3 milliards), avec 56% de paramètres en moins que Cosmos 3 Nano. Sur un bras robotique réel, une évaluation à l'aveugle de Positronic Robotics confirme l'écart: 28 succès sur 30 essais (93,3%), contre 27 pour Cosmos 3 Nano et 13 pour π0.5. Le modèle demande 32 Go de mémoire GPU en BF16 sur H200, ou 24 Go en FP8, sous licence FLUX Kommunity non commerciale.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
L'enjeu est un compromis classique en robotique open source: les modèles qui prédisent la vidéo, comme Cosmos 3 Nano, sont précis mais lents (BFL mesure un temps de calcul environ 4,7 fois supérieur à π0.5 par seconde de mouvement), tandis que les modèles vision langage action légers comme π0.5 sont rapides mais moins fiables. En conservant la prédiction conjointe vidéo/action mais avec un squelette plus compact et de la distillation, BFL réduit cet écart de vitesse. Trois versions sont proposées: la base, une variante distillée par guidage (1,8 à 2 fois plus rapide, pour un score légèrement supérieur) et une version distillée à une seule étape (jusqu'à 4 fois plus rapide, pour 3,5 à 4,3 points de réussite en moins). De quoi rendre des politiques robotiques ouvertes exploitables sur du matériel plus modeste, un atout pour les équipes qui veulent affiner ces modèles, comme celles de LeRobot ou Jetson AI.
FLUX 3 Action dérive du socle multimodal FLUX 3, préentraîné sur de l'image, de la vidéo et de l'audio (plus de 95% des tokens issus de vidéo), puis affiné sur un mélange de données de préentraînement et de vidéo alignée sur l'action, tirée de jeux vidéo, de vidéos de mains humaines, de pinces portables et de téléopération couvrant quatorze morphologies de robots, la plupart partageant un espace d'action commun à 50 dimensions appelé EE50. Ce préentraînement est décisif: sans lui, un entraînement limité aux seules données DROID plafonne sous 1% de réussite sur RoboLab, contre 11,6% avec. BFL a aussi testé un pilotage hybride avec le modèle de raisonnement GPT 6 Astra: à effort faible, la combinaison résout 90% des épisodes pour 8,77 dollars et 8 minutes par succès, contre 100% mais 13,47 dollars et plus de 16 minutes pour Astra seul à effort maximal, signe de la recherche d'un équilibre entre coût, vitesse et fiabilité face à des rivaux comme NVIDIA.
Black Forest Labs, laboratoire allemand base a Fribourg, renforce la position européenne dans l'IA robotique open source face a NVIDIA.