Pourquoi Dwarkesh a tort sur le « computer use » + Comment OpenAI a lancé son concurrent de Jev en une semaine
Lors de l'OpenAI DevDay, deux responsables de l'entreprise ont détaillé la nouvelle pile pour développeurs, dans un entretien du podcast Latent Space. Ari Weinstein, cofondateur de Sky et aujourd'hui à la tête des produits et de l'ingénierie de l'utilisation d'ordinateur (Computer Use) chez OpenAI, affirme que le domaine est « à 180 degrés » de ce qu'il était il y a quelques mois. Selon lui, les agents savent désormais déboguer leurs erreurs et se rétablir après un échec. Ils combinent captures d'écran, arbres d'accessibilité, DOM, Playwright et code JavaScript généré, ce qui accélère l'exécution : certaines tâches sont déjà accomplies plus vite que par un humain moyen. OpenAI présente aussi Dots, où chaque agent dispose de son propre ordinateur Linux, et les App Shots, qui donnent aux modèles un contexte plus riche qu'une simple capture. Nikunj Handa, responsable produit de l'API, décrit l'appel de fonctions asynchrone, le pilotage en cours de tour, les WebSockets, l'inférence UltraFast, le cache de prompts plus long avec préchauffage, la compaction côté serveur, l'Agents API et la Decisions API. Cette dernière a été construite en une semaine environ. Pour l'instant, elle n'est qu'une surcouche autour du modèle Luna.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de Latent Space. Lire l'article original →
L'enjeu est double. Pour les utilisateurs, un agent capable de manipuler des logiciels plus vite qu'une personne, puis de dépasser le niveau humain, change la nature de l'automatisation. Il peut aussi boucler l'écriture de code et son test, ce qui touche directement le développement et l'assurance qualité. Cela soulève des questions de confiance, de permissions et de sécurité, notamment quand des agents peuvent effectuer des paiements ou opérer des sites web. Pour les développeurs, l'appel d'outils asynchrone permet au modèle de continuer à raisonner pendant que les outils tournent, et la Decisions API vise plus que des sorties structurées à faible latence. OpenAI l'utilise déjà en interne pour classer les demandes de support et automatiser des flux de travail. L'entreprise cherche aussi à se positionner comme un « cloud d'IA », avec des primitives de plus haut niveau que les simples API de modèles.
Cette évolution s'inscrit dans un débat plus large sur l'apprentissage par renforcement. Il y a trois mois, Dwarkesh Patel, dont les essais sur le sujet font référence, a posé une question de cadrage sur l'apprentissage par renforcement à récompense vérifiable (RLVR) qui a irrité nombre de spécialistes de l'utilisation d'ordinateur. Les animateurs du podcast, présents au lancement de Computer Use chez Anthropic et de Claude Cowork, ayant organisé la première session consacrée au sujet à l'AI Engineer, y répondent en donnant la parole à OpenAI. Ils étaient aussi proches du rachat de Sky Software par OpenAI, dont la technologie alimente la domination actuelle de Codex en la matière. L'épisode relève enfin que la Decisions API reprend un modèle initié par Jev, que les animateurs avaient été les premiers à présenter, et que l'équipe d'OpenAI assume de cloner les bonnes idées. Reste à voir si cette surcouche évoluera vers un modèle dédié.
Pas d'impact direct sur la France/UE