Aller au contenu principal
Hark dévoile son premier produit : un agent d'utilisation d'ordinateur rapide et abordable, Hark Handoff
OutilsVentureBeat AI · 2 min de lecture

Hark dévoile son premier produit : un agent d'utilisation d'ordinateur rapide et abordable, Hark Handoff

Source originale ↗·
Hark dévoile son premier produit : un agent d'utilisation d'ordinateur rapide et abordable, Hark Handoff
▶ Voir sur YouTube

La startup américaine Hark, fondée cette année par l'entrepreneur en série et roboticien Brett Adcock, a dévoilé son premier produit, Handoff, un agent capable de naviguer seul sur le web pour accomplir des tâches complètes : commander un repas sur DoorDash, réserver un vol chez United ou Delta, ou contacter des candidats sur LinkedIn. Les inscriptions sont ouvertes depuis aujourd'hui sur hark.com, avec un déploiement prévu plus tard ce mois-ci. Hark affirme que Handoff a obtenu le meilleur score jamais enregistré sur Online-Mind2Web, un benchmark tiers évalué par des humains, avec 97,7 points contre 92,8 pour GPT 5.4 d'OpenAI, 84,1 pour Claude Opus 4.8 d'Anthropic et 69 pour Gemini 2.5 Pro de Google. L'entreprise revendique un coût dix fois inférieur à celui de ses concurrents, 0,18 dollar par million de tokens en entrée et 2,37 dollars en sortie contre 5 et 30 dollars pour GPT 5.5, avec une latence de 0,8 seconde par échange. Chaque requête déploie un ordinateur virtuel dédié, avec navigateur, système de fichiers et terminal propres, et les utilisateurs peuvent y connecter leurs comptes existants pour que l'agent utilise leurs adresses et moyens de paiement enregistrés. Selon Hark, les internautes passent 75% de leur temps d'écran dans un navigateur, alors que moins d'un site sur 1000 dispose d'une API publique.

Ce lancement illustre la course des startups d'IA pour automatiser les tâches numériques du quotidien sans intégration technique complexe. Dans une vidéo de présentation d'environ quatre minutes, Adcock, installé dans un entrepôt vide, demande oralement à Hark de fleurir les lieux avec des roses et des fleurs de cerisier, et l'agent passe alors commande chez un fleuriste en ligne de façon autonome ; il dit désormais utiliser Handoff pour l'intégralité de ses processus de recrutement. Pour les entreprises, la promesse est celle d'un assistant capable de gérer des tâches web répétitives sans supervision constante et à moindre coût, ce qui pourrait réduire la dépendance aux interfaces traditionnelles et aux API propriétaires si les performances annoncées se confirment dans des conditions réelles.

Plusieurs zones d'ombre subsistent cependant. Les comparaisons fournies par Hark portent sur la génération précédente de modèles, GPT 5.5, GPT 5.4, Opus 4.8 et Gemini 2.5 Pro, et non sur les leaders actuels GPT-5.6 d'OpenAI et Opus 5 d'Anthropic, ni sur des concurrents open source comme DeepSeek V4, Kimi K3 ou Qwen3.8-Max, dont les résultats sur ce benchmark n'ont pas encore été publiés. Or les modèles récents ont justement le plus progressé sur l'utilisation d'ordinateur : sur OSWorld 2.0, Opus 5 atteint environ 70,6%, contre 55,7% pour Opus 4.8, le modèle retenu par Hark. Les chiffres de latence avancés, 6,8 secondes pour GPT 5.5 et 6 secondes pour Opus 4.8, ont été mesurés par Hark elle-même, avec les modèles concurrents réglés sur leur niveau de raisonnement le plus lent, sans validation indépendante ; interrogée par VentureBeat, l'entreprise n'a pas précisé si elle comptait publier des comparaisons face aux modèles les plus récents. Même dans les benchmarks choisis par Hark, la suprématie n'est pas totale : sur WebTailBench v2, GPT 5.5 devance Handoff avec 72,3 points contre 68,6, et deux des trois benchmarks cités ont été exécutés dans l'environnement propriétaire de Hark.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

Le responsable produit de Claude Code évoque les limites d'utilisation, la transparence et le « lean harness »
1Ars Technica AI 

Le responsable produit de Claude Code évoque les limites d'utilisation, la transparence et le « lean harness »

Anthropic a organisé le 8 mai dernier sa deuxième conférence annuelle "Code with Claude" à San Francisco, dans un parking à étages reconverti en espace événementiel. L'événement a permis à l'entreprise de présenter de nouvelles fonctionnalités pour ses Managed Agents et d'annoncer un accord de calcul avec SpaceX. Dans la foulée, Anthropic a doublé les limites d'utilisation de Claude Code pour les abonnés aux plans Pro et Max, une décision directement motivée par les frustrations croissantes des utilisateurs face à des contraintes de ressources particulièrement sévères ces dernières semaines. Cat Wu, responsable produit de Claude Code chez Anthropic, a accordé une interview de trente minutes à Ars Technica en marge de l'événement. Ce doublement des limites représente une réponse concrète à une tension de fond : Claude Code consomme une quantité de tokens et de calcul nettement supérieure à celle d'un usage conversationnel classique, ce qui met sous pression l'infrastructure d'Anthropic et génère des blocages pour les développeurs qui en font un usage intensif. Pour les professionnels qui intègrent Claude Code dans leur flux de travail quotidien, cette contrainte pouvait se traduire par des interruptions de service en milieu de journée, rendant l'outil peu fiable en production. Anthropic assume publiquement l'absence d'une feuille de route à long terme pour Claude Code, pari assumé sur le fait que les progrès rapides des modèles rendront tout plan figé rapidement obsolète. La philosophie de l'équipe repose sur ce qu'elle appelle un "lean harness" : un cadre d'exécution minimaliste qui laisse le maximum de latitude au modèle plutôt que de l'enfermer dans une architecture rigide. L'accord avec SpaceX pour de la capacité de calcul illustre la stratégie d'Anthropic pour absorber une demande en forte hausse, dans un marché où la concurrence entre outils de développement assistés par IA s'intensifie rapidement.

UELes développeurs français et européens abonnés aux plans Pro ou Max bénéficient directement du doublement des limites d'utilisation, réduisant les interruptions de service en production.

💬 Le "lean harness", c'est une vraie prise de position : plutôt que d'enfermer le modèle dans des règles figées, on lui laisse de la marge pour s'adapter quand les modèles changent tous les trois mois. Bon, sur le papier ça ressemble à de l'humilité affichée, mais c'est probablement la seule stratégie sensée vu la vitesse à laquelle le terrain bouge. Le doublement des limites, lui, c'est du concret : plus d'interruptions à 14h en plein sprint.

OutilsOutil
1 source
L'agent de ChatGPT Work décrypté : le pari d'un milliard d'utilisateurs
2Latent Space 

L'agent de ChatGPT Work décrypté : le pari d'un milliard d'utilisateurs

Le 9 juillet dernier, OpenAI a lancé ChatGPT Work, son agent dédié au travail de connaissance, accompagné de trois nouveaux modèles déclinés en quatorze configurations et d'une fusion des applications de bureau ChatGPT et Codex. Trois semaines après son lancement, Work, associé à Codex, aurait dépassé les 10 millions d'utilisateurs. Ce chiffre s'inscrit dans une progression plus large de ChatGPT, qui aurait franchi le milliard d'utilisateurs mensuels actifs en juin et le milliard d'utilisateurs hebdomadaires ce mois-ci. Pour l'instant, Chat et Work coexistent comme deux modes distincts au sein de ChatGPT, mais le président d'OpenAI, Greg Brockman, a confirmé que les deux seraient fusionnés d'ici la fin de l'année. Work fonctionne sur le même moteur que Codex, avec les mêmes modèles, sous-agents et capacités de navigation web, mais son interface a été volontairement dépouillée des éléments techniques, comme les contrôles git ou les traces de différences de code, qui trahiraient son origine de programmation. Concrètement, Work se connecte aux outils que les professionnels utilisent déjà au quotidien, Slack, la messagerie, Drive, les calendriers, les CRM et des centaines d'autres plugins, pour rassembler du contexte et produire un travail fini. Chaque session s'exécute dans un ordinateur virtuel isolé et puissant : les comptes Pro disposent de 8 processeurs, 20 Go de RAM et 64 Go de stockage, contre 14 Go de RAM pour les comptes Plus, avec un service Chrome géré que l'agent pilote via des appels d'outils. L'agent peut produire des feuilles de calcul, des documents et des présentations dans des visionneuses interactives, ainsi que des sites web hébergés et partageables par simple lien. Cette architecture représente un changement d'échelle important : elle ouvre potentiellement à un milliard d'utilisateurs hebdomadaires un accès à un agent capable de travailler seul pendant des heures sur des tâches complexes, bien au-delà du simple échange conversationnel. Cette évolution s'inscrit dans une trajectoire entamée par OpenAI dès 2023 avec les Plugins, poursuivie lors de la Devday 2024 puis avec le lancement de Codex en 2025. Sur ordinateur, Work propose deux modes : un mode cloud, où les tâches tournent sur le même serveur distant que les versions web et mobile et se synchronisent entre elles, et un mode local, où l'agent agit directement sur la machine de l'utilisateur avec un contrôle complet de l'ordinateur, sans possibilité pour l'instant de transférer une tâche locale vers le cloud. Ce mode local s'apparente en réalité à Codex, débarrassé de ses indices visuels de développeur. La superposition de ces briques, héritées de Codex, de ChatGPT agent, d'Atlas et d'autres projets internes, rend l'offre actuelle complexe à saisir, mais elle préfigure la manière dont OpenAI entend faire travailler l'ensemble de sa base d'utilisateurs dans les mois à venir.

💬 Dix millions d'utilisateurs pour Work en trois semaines, c'est le genre de chiffre qui tranche le débat sur l'utilité des agents au boulot. Ce qui est malin dans le coup, c'est le camouflage : Work tourne exactement sur le moteur de Codex, mêmes modèles, mêmes sous-agents, mais on a viré les traces de code et les contrôles git pour que ça ressemble à un collègue et pas à un terminal. OpenAI a pigé un truc simple, l'agent qui gagne au boulot est celui qui ne ressemble pas à un outil de développeur.

OutilsOutil
1 source
3Ars Technica AI 

Codex s'enrichit de nouvelles fonctionnalités, dont l'utilisation de votre ordinateur en arrière-plan

OpenAI a déployé aujourd'hui une nouvelle version de son application desktop Codex, apportant un ensemble de fonctionnalités inédites qui étendent son champ d'action bien au-delà du code. Parmi les ajouts les plus notables figure la capacité d'effectuer des tâches sur l'ordinateur de l'utilisateur en arrière-plan, sans interrompre le travail en cours sur le bureau. L'entreprise a détaillé cette mise à jour dans un billet de blog officiel, présentant également des améliorations pour les développeurs et une ouverture vers des usages non techniques. Cette fonctionnalité d'exécution en arrière-plan représente un changement de paradigme significatif : l'agent ne se contente plus de répondre à des requêtes ponctuelles, il agit de manière autonome sur la machine pendant que l'utilisateur continue son activité normale. Pour les développeurs comme pour les professionnels du secteur, cela ouvre la voie à une automatisation plus profonde des tâches répétitives, qu'il s'agisse de refactorisation de code, de recherche ou de traitement de fichiers, sans mobiliser l'attention de l'utilisateur. Cette mise à jour s'inscrit dans la stratégie plus large d'OpenAI de transformer Codex en une "super app" polyvalente, capable de couvrir à la fois les besoins techniques et les tâches de travail du savoir en général. La compétition dans ce segment s'intensifie, avec des concurrents comme Anthropic (Claude) et Google (Gemini) qui proposent également des agents de bureau. OpenAI mise sur l'intégration native et la discrétion d'exécution pour se différencier dans une course qui redéfinit la relation entre l'humain et l'ordinateur.

OutilsOutil
1 source
NotebookLM de Google intègre désormais un ordinateur cloud avec exécution de code et recherche à base d'agents
4The Decoder 

NotebookLM de Google intègre désormais un ordinateur cloud avec exécution de code et recherche à base d'agents

Google a annoncé une mise à jour majeure de NotebookLM, son outil de recherche et de synthèse documentaire. La nouvelle version tourne désormais sur Gemini 2.5 Flash et dispose d'un ordinateur cloud dédié capable d'exécuter du code directement depuis l'interface. Plus significatif encore, NotebookLM peut désormais trouver ses propres sources de manière autonome via Google Search, sans que l'utilisateur ait à importer manuellement des documents. Lors des tests internes, le nouveau système a surpassé l'ancienne version dans 78,2 % des cas. Ces évolutions transforment NotebookLM d'un simple outil d'analyse documentaire en un véritable agent de recherche autonome. La capacité d'exécution de code ouvre la voie à des analyses de données directement dans l'outil, sans passer par un environnement externe. L'intégration native à Google Search signifie que les utilisateurs n'ont plus besoin de sélectionner manuellement leurs sources : l'outil explore le web et construit lui-même sa base documentaire. Pour les chercheurs, journalistes, consultants ou étudiants, cela réduit considérablement le temps de préparation avant d'obtenir une synthèse exploitable. NotebookLM avait été lancé par Google en 2023 comme outil expérimental de prise de notes augmentée par l'IA, avant de connaître un succès inattendu, notamment grâce à sa fonctionnalité de podcast audio généré automatiquement. Cette montée en puissance vers l'agentique s'inscrit dans la tendance générale des grands acteurs de l'IA à doter leurs outils de capacités d'action autonome. Google positionne ainsi NotebookLM comme un concurrent direct des assistants de recherche comme Perplexity ou les modes "deep research" de ChatGPT et Gemini Advanced.

UELes professionnels et chercheurs en France et en Europe gagnent accès à un agent de recherche autonome capable d'explorer le web et d'exécuter du code, réduisant significativement le temps de préparation documentaire.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic