Reka lance Rho-1 : un modèle de raisonnement omni de 19 milliards de paramètres qui comprend et génère de la vidéo et produit des actions de robot
Reka a publié une préversion de recherche de Rho-1, un modèle de 19 milliards de paramètres entraîné à partir de zéro, qui comprend et génère du texte, des images et de la vidéo, raisonne sur ces contenus et produit des actions de robot au sein d'un seul réseau de neurones. L'entreprise le présente comme un remplaçant direct des architectures agentiques, où un modèle central planifie puis confie les tâches à des spécialistes de l'image, de la vidéo ou de la détection. Ici, texte, vision et actions robotiques deviennent des jetons dans une même fenêtre de contexte. Deux formats coexistent : des jetons discrets pour le texte, le raisonnement symbolique et les commandes de haut niveau, et des jetons continus pour les latents d'image, les images vidéo, les actions et la proprioception. Chaque bloc transformeur comporte deux flux d'experts, l'un pour la compréhension, l'autre pour la génération, qui partagent l'attention et le même cache clé-valeur. L'entraînement combine prédiction du jeton suivant et « flow matching ». Dans une session de démonstration, le modèle dessine un phare, l'encadre, l'anime, transforme la vidéo en tempête de neige et explique la différence en cinq tours, sans appel d'outil ni second modèle.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Côté performances, le modèle de base génère de la vidéo à 0,79 fois le temps réel en médiane, avec un flux visionnable au bout de six secondes environ. Reka mesure 7,0 secondes jusqu'au premier clip, contre 13,8 secondes, à titre illustratif, pour un pipeline multi-agents. Une variante distillée réduit le débruitage de 99 à 8 étapes, avec une perte de qualité minime selon l'entreprise, et produit un clip de 5,3 secondes en environ une seconde. Lors de tests internes, elle égale les modèles d'image dédiés les plus rapides et affiche le plus court délai avant le premier jeton de texte. Ces mesures sont réalisées par le fabricant et ne constituent pas des benchmarks indépendants. Pour la robotique, actions et images futures sont décodées depuis le même état latent : un épisode de simulation LIBERO montre sept canaux d'action émis. Reka associe aussi Rho-1 à son modèle de dynamique inverse, qui déduit des signaux de contrôle à partir de vidéos brutes, afin de dépasser la rareté des données de téléopération.
L'intérêt tient à la suppression des transferts entre modèles, chacun ajoutant de la latence et ne voyant qu'une requête étroite du contexte global. Un modèle unique conserve l'état complet de la conversation, ce qui permet par exemple d'obtenir des boîtes englobantes directement sous forme de jetons de coordonnées, sans détecteur séparé. Rho-1 fonctionne aussi comme modèle du monde en flux continu : de nouvelles instructions mises à jour en cours de génération permettent de bifurquer une même scène vers un virage à gauche ou à droite. Pour la robotique, la même représentation sert à prévoir et à agir.
Le paysage concurrent reste contrasté. BAGEL de ByteDance (14 milliards de paramètres au total, 7 milliards actifs) et Emu3.5 de BAAI (34 milliards) sont sous licence Apache 2.0 mais ne génèrent pas de vidéo native ni d'actions de robot. Genie 3 de Google DeepMind produit des mondes interactifs en 720p à 24 images par seconde, mais accepte des actions de navigation sans en émettre. Rho-1, limité à 672×384 en vidéo native, n'a pas de poids ouverts et n'est accessible que sur demande à contact@reka.ai.
Pas d'impact direct sur la France/UE