Aller au contenu principal
Recherche · Paper ·

Des chercheurs de UC Berkeley lancent CUA-Lite, une plateforme ouverte unifiant sandbox, données, évaluation et RL pour agents utilisant l'ordinateur

Des chercheurs de UC Berkeley ont publié CUA-Lite, une plateforme open source destinée à unifier l'entraînement et l'évaluation des agents capables de manipuler un ordinateur (computer-use agents, CUA). Leur constat de départ est que construire un tel agent exige quatre briques, à savoir des agents, des environnements, des traces de données et un cadre d'évaluation et d'entraînement, mais que ces briques sont aujourd'hui dispersées dans des dépôts séparés aux interfaces incompatibles. CUA-Lite les réunit derrière un espace d'action unique, un schéma de données commun appelé LiteSample, et une seule ligne de commande, sur ordinateur de bureau, navigateur et mobile. La contribution la plus concrète est Lite.OSWorld, qui reproduit les tâches et les évaluateurs du benchmark OSWorld sur un bureau GNOME dans un simple conteneur Docker, alors qu'OSWorld nécessite normalement une machine virtuelle QEMU/KVM complète par tâche. Résultat mesuré : 0,9 Go de mémoire contre 4,1 Go, un démarrage à froid de 23,8 secondes contre 29,9, et environ 4,6 fois plus d'instances exécutables en parallèle, avec des scores identiques sur 13 modèles testés. La plateforme revendique plus de 30 000 tâches vérifiables, via une famille de sandboxes incluant Lite.ScaleCUA, Lite.CUAGym et Lite.CUAWorld, ce dernier couvrant une quarantaine d'applications comme Blender, QGIS ou VS Code.

2 min de lecturePertinence 52

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette unification lève un obstacle pratique majeur pour la recherche sur les agents autonomes : l'accès à la virtualisation imbriquée (/dev/kvm), généralement indisponible sur les infrastructures cloud managées, les runners de CI ou les conteneurs imbriqués. En supprimant cette dépendance tout en préservant la fidélité des scores, CUA-Lite permet à un plus grand nombre de laboratoires et d'équipes, sans accès à du matériel spécialisé, d'entraîner et de comparer des agents à grande échelle. Le schéma LiteSample facilite aussi la réutilisation de données existantes : plus de dix jeux de données publiés (Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey, Multimodal-Mind2Web) ont été reformatés et rendus disponibles gratuitement sur Hugging Face, réduisant le travail d'ingénierie nécessaire avant de pouvoir entraîner un modèle. Pour l'industrie, cela abaisse la barrière d'entrée pour construire des assistants capables d'utiliser un ordinateur comme un humain, un axe de recherche jugé stratégique par des entreprises comme Anthropic ou OpenAI.

Le projet s'inscrit dans la compétition croissante autour des agents capables d'agir directement dans une interface graphique plutôt que via des API dédiées. CUA-Lite fournit une brique lite.gym reliant plus de dix agents (basés sur GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI) à plus de quinze benchmarks couvrant le bureau, le navigateur (WebArena, WebVoyager) et le mobile (AndroidWorld, AndroidLab). L'équipe documente aussi des cas d'usage concrets : un fine-tuning supervisé de Qwen3-VL-2B-Instruct a fait passer le score moyen de 0,138 à 0,237 sur 332 tâches, et un entraînement par renforcement via GRPO a été testé sur 416 tâches mobiles réparties dans 28 applications. Ces résultats restent des configurations uniques rapportées par l'équipe, non reproduites indépendamment, mais ils illustrent la direction que prend la recherche : standardiser l'infrastructure pour accélérer l'itération sur les modèles eux-mêmes, plutôt que de continuer à dupliquer les efforts d'ingénierie propres à chaque benchmark.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Echoverse : des environnements riches et évolutifs pour les agents utilisant un ordinateur41Microsoft ResearchRecherche 02Recherche sur les environnements proactifs d'agents : simuler des utilisateurs actifs pour évaluer les assistants proactifs37Apple Machine LearningRecherche 03Des chercheurs automatisent la conception de stratégies de raisonnement pour LLM et réduisent l'utilisation de tokens de 69,5 %46VentureBeat AIRecherche 
Dossier · Hugging FaceSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.