Aller au contenu principal
Outils · Outil ·

Hark dévoile son premier produit : un agent d'utilisation d'ordinateur rapide et abordable, Hark Handoff

La startup américaine Hark, fondée cette année par l'entrepreneur en série et roboticien Brett Adcock, a dévoilé son premier produit, Handoff, un agent capable de naviguer seul sur le web pour accomplir des tâches complètes : commander un repas sur DoorDash, réserver un vol chez United ou Delta, ou contacter des candidats sur LinkedIn. Les inscriptions sont ouvertes depuis aujourd'hui sur hark.com, avec un déploiement prévu plus tard ce mois-ci. Hark affirme que Handoff a obtenu le meilleur score jamais enregistré sur Online-Mind2Web, un benchmark tiers évalué par des humains, avec 97,7 points contre 92,8 pour GPT 5.4 d'OpenAI, 84,1 pour Claude Opus 4.8 d'Anthropic et 69 pour Gemini 2.5 Pro de Google. L'entreprise revendique un coût dix fois inférieur à celui de ses concurrents, 0,18 dollar par million de tokens en entrée et 2,37 dollars en sortie contre 5 et 30 dollars pour GPT 5.5, avec une latence de 0,8 seconde par échange. Chaque requête déploie un ordinateur virtuel dédié, avec navigateur, système de fichiers et terminal propres, et les utilisateurs peuvent y connecter leurs comptes existants pour que l'agent utilise leurs adresses et moyens de paiement enregistrés. Selon Hark, les internautes passent 75% de leur temps d'écran dans un navigateur, alors que moins d'un site sur 1000 dispose d'une API publique.

2 min de lecturePertinence 49
Source

Résumé et traduction réalisés par Le Fil IA à partir de VentureBeat AI. Lire l'article original →

Ce lancement illustre la course des startups d'IA pour automatiser les tâches numériques du quotidien sans intégration technique complexe. Dans une vidéo de présentation d'environ quatre minutes, Adcock, installé dans un entrepôt vide, demande oralement à Hark de fleurir les lieux avec des roses et des fleurs de cerisier, et l'agent passe alors commande chez un fleuriste en ligne de façon autonome ; il dit désormais utiliser Handoff pour l'intégralité de ses processus de recrutement. Pour les entreprises, la promesse est celle d'un assistant capable de gérer des tâches web répétitives sans supervision constante et à moindre coût, ce qui pourrait réduire la dépendance aux interfaces traditionnelles et aux API propriétaires si les performances annoncées se confirment dans des conditions réelles.

Plusieurs zones d'ombre subsistent cependant. Les comparaisons fournies par Hark portent sur la génération précédente de modèles, GPT 5.5, GPT 5.4, Opus 4.8 et Gemini 2.5 Pro, et non sur les leaders actuels GPT-5.6 d'OpenAI et Opus 5 d'Anthropic, ni sur des concurrents open source comme DeepSeek V4, Kimi K3 ou Qwen3.8-Max, dont les résultats sur ce benchmark n'ont pas encore été publiés. Or les modèles récents ont justement le plus progressé sur l'utilisation d'ordinateur : sur OSWorld 2.0, Opus 5 atteint environ 70,6%, contre 55,7% pour Opus 4.8, le modèle retenu par Hark. Les chiffres de latence avancés, 6,8 secondes pour GPT 5.5 et 6 secondes pour Opus 4.8, ont été mesurés par Hark elle-même, avec les modèles concurrents réglés sur leur niveau de raisonnement le plus lent, sans validation indépendante ; interrogée par VentureBeat, l'entreprise n'a pas précisé si elle comptait publier des comparaisons face aux modèles les plus récents. Même dans les benchmarks choisis par Hark, la suprématie n'est pas totale : sur WebTailBench v2, GPT 5.5 devance Handoff avec 72,3 points contre 68,6, et deux des trois benchmarks cités ont été exécutés dans l'environnement propriétaire de Hark.

VidéoVoir la vidéo de cet article sur YouTube →
Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

Notre lecture

Le pari a du sens : moins d'un site sur mille a une API, alors autant apprendre à l'agent à cliquer comme toi et moi. Mais Hark compare ses scores à Opus 4.8 et GPT 5.5, pas aux modèles actuels, alors qu'Opus 5 progresse justement le plus sur l'utilisation d'ordinateur, et l'entreprise n'a pas voulu dire si elle republierait face à eux. Classique : benchmarker contre la génération d'avant pour sortir en tête, c'est le tour de passe-passe préféré des startups qui savent que le match retour sera perdu.

À lire ensuite

01Le responsable produit de Claude Code évoque les limites d'utilisation, la transparence et le « lean harness »44Ars Technica AIOutils 02L'agent de ChatGPT Work décrypté : le pari d'un milliard d'utilisateurs49Latent SpaceOutils 03Codex s'enrichit de nouvelles fonctionnalités, dont l'utilisation de votre ordinateur en arrière-plan45Ars Technica AIOutils 
Dossier · GPT-5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.