GEN-1.5 de Generalist AI : un modele de fondation pour robots qui apprend une nouvelle tache a partir d'une seule demonstration de 3 a 12 secondes
Generalist AI a dévoilé GEN-1.5, un modèle fondation pour robots capable d'apprendre une nouvelle tâche physique à partir d'une seule démonstration de 3 à 12 secondes de données sensorimotrices, insérée dans une fenêtre de contexte de 30 secondes. Sans mise à jour de gradient ni fine-tuning, le robot exécute alors la tâche directement. Sur dix tâches de manipulation variées, cet apprentissage en un coup, dit "physical prompting", atteint en moyenne 59% de réussite (écart-type de 10 points) avec le seul modèle pré-entraîné. Dix pas de gradient sur cinq minutes de données par tâche, soit environ 50 démonstrations, font grimper ce taux à 83% (écart-type de 9 points). Dans un cas extrême, un seul pas de gradient sur une minute de données a permis d'atteindre 66,5% de réussite sur une tâche inédite, sans réglage spécifique des hyperparamètres. GEN-1.5 est un modèle multimodal traitant vidéo, capteurs, langage et proprioception, produisant des trajectoires d'action à 100 Hz, entraîné en continu depuis plus de huit mois sur des données d'interaction physique collectées dans des foyers, entrepôts et usines. Il s'agit pour l'instant d'une publication de recherche: aucun poids public, aucune API, aucune tarification, l'accès passant uniquement par un partenariat direct avec Generalist AI.
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette avancée est significative car l'adaptation des politiques robotiques nécessitait jusqu'ici des dizaines de milliers de pas de gradient. Ici, dix pas suffisent à faire évoluer les poids du modèle de moins de 0,15% sur des tâches inédites, ce qui suggère que le fine-tuning reconfigure des connaissances déjà acquises plutôt qu'il n'en construit de nouvelles. Generalist AI y voit un équivalent, pour la robotique, du moment GPT-3, où l'apprentissage en contexte était apparu sans avoir été conçu comme objectif d'entraînement. Pour l'industrie, cela laisse entrevoir des robots capables d'apprendre nombre de tâches sur site, à partir de démonstrations filmées, sans passer par des cycles longs et coûteux de collecte de données puis de réentraînement, ce qui pourrait accélérer le déploiement de robots polyvalents en entrepôt ou à domicile.
Le contexte est celui d'une course entre laboratoires de robotique à produire des modèles fondation généralistes, capables de transférer des compétences d'une tâche à l'autre comme les grands modèles de langage transfèrent des connaissances entre domaines. Generalist AI met en avant plusieurs capacités de transfert obtenues avec GEN-1.5: la généralisation compositionnelle, qui permet d'enchaîner deux démonstrations indépendantes en un seul comportement continu avec des mouvements de transition inédits; le transfert simulation vers réel, où une démonstration entièrement simulée sert de guide au robot réel alors que le pré-entraînement ne contenait aucune donnée simulée; et l'imitation humain vers robot, où une personne démontre le geste de ses propres mains devant les caméras du robot, qui le reproduit ensuite avec ses propres pinces. Ces résultats, bien que limités à des tâches courtes et simples selon l'entreprise elle-même, ouvrent la voie à des suites: extension à des tâches plus longues, ouverture progressive de l'accès au-delà des partenariats directs, et concurrence accrue avec d'autres acteurs de la robotique fondation qui cherchent eux aussi à réduire la dépendance aux données d'entraînement massives.
Pas d'impact direct sur la France/UE