Reka AI présente Rho-1, un modèle unique qui gère texte, images, vidéo et contrôle de robots
Reka AI a présenté Rho-1, un modèle « omni » de 19 milliards de paramètres capable de traiter et de générer du texte, des images, de la vidéo et des commandes de contrôle de robots au sein d'un seul réseau de neurones. Son entraînement a mobilisé 320 GPU H100 pendant environ trois mois, soit une fraction des ressources de calcul que requièrent aujourd'hui les modèles les plus avancés. Plutôt que d'aiguiller chaque demande vers des systèmes spécialisés, Rho-1 traite toutes les modalités sous forme de tokens placés dans une même fenêtre de contexte partagée.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette approche unifiée suggère qu'un modèle de taille relativement modeste peut couvrir des usages habituellement répartis entre plusieurs systèmes distincts, de la compréhension d'une vidéo à la génération d'une image ou à l'envoi d'instructions à un bras robotisé. Pour les équipes qui développent des applications, cela peut simplifier l'architecture : un seul modèle à déployer et à maintenir, au lieu d'un assemblage de composants. Le budget d'entraînement, limité à 320 GPU, montre aussi que des acteurs sans les moyens des plus grands laboratoires peuvent prétendre à des modèles polyvalents.
Le mouvement s'inscrit dans la course aux modèles multimodaux natifs, où l'on cherche à dépasser les chaînes d'outils spécialisés mises bout à bout. L'intégration du contrôle robotique y ajoute une dimension particulière, en rapprochant les modèles de langage et de vision de l'action physique. Reste à savoir comment Rho-1 se comportera face aux références du secteur sur chaque modalité, et si l'efficacité annoncée résistera à des évaluations indépendantes.
Pas d'impact direct sur la France/UE