Aller au contenu principal
OutilsMarkTechPost · 2 min de lecture

Le coworker IA open source et local d'Andrew Ng, OpenWorker, livre des tâches finies plutôt que du chat

Source originale ↗·

Andrew Ng vient de publier OpenWorker, un agent de bureau open source sous licence MIT conçu pour livrer un travail terminé plutôt qu'une conversation. L'utilisateur ne formule pas un prompt mais décrit un résultat attendu, un document finalisé, une réponse Slack contenant les vrais chiffres, un agenda mis à jour ou une boîte mail triée, et l'outil découpe cet objectif en étapes concrètes. Le dépôt compte 119 fichiers Python, soit environ 32 400 lignes, dans le dossier coworker, 149 fichiers TypeScript et TSX pour l'interface graphique, et 78 modules de tests côté serveur. L'architecture repose sur quatre couches qui tournent entièrement en local: une coquille de bureau Tauri 2 avec une interface React 18, un serveur d'agent Python 3.10 sous FastAPI et uvicorn écoutant par défaut sur 127.0.0.1:8765, une couche d'outils et de connecteurs regroupant fichiers, git, recherche via ripgrep, terminal et intégrations MCP, et enfin un routeur de modèles bâti sur aisuite, la bibliothèque multi-fournisseurs déjà développée par Andrew Ng. Il n'existe aucun service d'inférence propre à OpenWorker: l'utilisateur fournit sa propre clé API ou pointe vers un modèle local. La liste homologuée compte exactement trente modèles, dont les gammes GPT d'OpenAI, Claude d'Anthropic, Gemini de Google, ainsi que GLM, DeepSeek, Kimi, MiniMax, Qwen3 Max, Grok, Mistral Large, des modèles ouverts via Together AI et Fireworks, et des modèles totalement locaux via Ollama, sans clé requise.

La vraie innovation technique du projet tient dans son moteur de permissions. Chaque appel d'outil est classé selon quatre niveaux de risque, lecture seule, écriture locale limitée au dossier de travail, exécution de commandes, ou action externe affectant d'autres systèmes. Cinq modes déterminent ensuite ce qui est autorisé, allant d'un mode purement consultatif à un mode automatique complet, en passant par un mode interactif par défaut qui demande confirmation avant toute écriture ou commande. Fait notable, le mode sans supervision ne relâche pas le niveau d'autonomie: il redirige simplement les demandes de validation vers une boîte de réception où la session reste suspendue jusqu'à réponse humaine. Les commandes shell, elles, demandent systématiquement confirmation, sans exception possible. Le profil intégré instruit aussi le modèle à traiter tout contenu issu d'outils, du web ou de fichiers comme une donnée non fiable plutôt que comme une instruction, une protection explicite contre les injections de prompt.

Sur le plan de la confidentialité, les appels aux modèles partent directement de la machine de l'utilisateur vers le fournisseur choisi, sans passer par un serveur intermédiaire, et les clés ne transitent jamais dans le contexte du modèle. Seul un service cloud optionnel gère l'authentification OAuth des connecteurs via Auth0, sans jamais stocker les jetons. L'application fonctionne intégralement hors connexion à ce service, avec des identifiants saisis manuellement, ce qui illustre une approche local-first assumée dans un secteur où la plupart des agents d'IA restent dépendants d'infrastructures propriétaires.

Cet article vous a été utile ?

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

WebBrain : un agent de navigation IA open-source et local qui lit les pages et automatise des tâches sur Chrome et Firefox
1MarkTechPost 

WebBrain : un agent de navigation IA open-source et local qui lit les pages et automatise des tâches sur Chrome et Firefox

WebBrain est un agent de navigation open source, gratuit et disponible pour Chrome et Firefox, développé par Emre Sokullu sous licence MIT, avec son code source publié sur GitHub. L'extension s'installe dans le panneau latéral du navigateur, en Manifest V3 avec l'API sidePanel sur Chrome et en Manifest V2 avec sidebar_action sur Firefox, et chaque onglet conserve son propre historique de conversation. Elle propose deux modes : le mode Ask, en lecture seule, qui analyse les pages via des scripts de contenu classiques, et le mode Act, capable de cliquer, taper, faire défiler et naviguer, en pilotant la page via le protocole Chrome DevTools et l'API chrome.debugger, ce qui permet de générer des événements reconnus comme fiables par les sites modernes et d'atteindre les iframes cross-origin et le shadow DOM. Les températures sont fixées pour plus de prévisibilité : 0,15 en mode Act, 0,3 en mode Ask et 0 pour les descriptions de captures d'écran. L'outil est disponible en anglais, espagnol, français, turc et chinois, détecte automatiquement la langue du navigateur, ne collecte aucune donnée externe et n'intègre ni télémétrie ni compte utilisateur. Point clé : en connectant WebBrain à un modèle local, aucune donnée de page ne quitte la machine de l'utilisateur, une option rare parmi les agents de navigation IA. Cette approche locale-first change la donne pour la confidentialité des données dans un secteur où la plupart des agents IA de navigateur transitent systématiquement par des API cloud. Les utilisateurs professionnels manipulant des informations sensibles, comptes bancaires, dossiers clients ou données internes d'entreprise, peuvent ainsi automatiser des tâches répétitives comme l'extraction de données depuis des catalogues, le remplissage de formulaires ou le résumé d'articles, sans exposer ces informations à un tiers. WebBrain a aussi été pensé pour limiter les coûts en tokens sur les sessions longues : les captures d'écran sont redimensionnées et compressées en JPEG avant traitement, et l'historique de conversation est tronqué en commençant par les éléments les plus anciens lorsque la fenêtre de contexte se remplit. Il est également possible d'associer un modèle texte économique pour la planification à un modèle de vision distinct pour l'analyse des captures d'écran, une flexibilité qui réduit encore la facture pour les utilisateurs de modèles cloud. Le développement de WebBrain répond à un problème de sécurité identifié dans les agents de navigation : les pages web peuvent dissimuler des injections de prompt destinées à détourner le comportement de l'agent. Face à ce risque, l'outil démarre toujours en mode Ask en lecture seule, demande une confirmation avant toute action jugée conséquente (ces alertes pouvant être désactivées dans les paramètres) et impose une règle stricte pour toute mutation de données : créer, envoyer, soumettre ou acheter passe obligatoirement par l'interface visible du site plutôt que par des appels directs aux API REST ou GraphQL, sauf dérogation ponctuelle via la commande /allow-api en cas d'échec de l'interface. La lecture de contenu, elle, bénéficie de règles plus souples via les outils fetchurl et researchurl puisqu'elle ne modifie rien à distance. WebBrain se positionne ainsi entre les simples extensions IA de navigateur et les frameworks d'agents complets, dans un marché où la question de la confiance et du contrôle utilisateur devient centrale à mesure que ces outils gagnent en autonomie sur des tâches concrètes comme la recherche, le remplissage de formulaires ou l'automatisation multi-étapes.

💬 Reste à voir si ça tient en prod, mais l'idée de base est bonne : un agent qui pilote ton navigateur sans faire transiter tes pages par un cloud tiers, c'est ce que devrait être le standard depuis le début. Là où la plupart des agents web envoient tes onglets bancaires ou tes CRM à une API distante, celui-là tourne en local si tu le branches sur ton propre modèle, ce qui change complètement le calcul risque/bénéfice pour les pros. Le vrai signal du marché, c'est que le contrôle utilisateur (mode lecture par défaut, confirmation avant chaque action, interface visible obligatoire plutôt qu'appels API directs) devient un argument de vente à part entière, pas une case à cocher pour les juristes.

OutilsOutil
1 source
OpenAI lance ChatGPT Work, un agent IA cloud qui gère les tâches sur email, Slack et calendriers
2VentureBeat AI 

OpenAI lance ChatGPT Work, un agent IA cloud qui gère les tâches sur email, Slack et calendriers

OpenAI a lancé jeudi ChatGPT Work, un nouvel agent intégré à son chatbot phare, alimenté par son dernier modèle, GPT-5.6. L'outil vise à transformer ChatGPT d'un simple outil de questions-réponses en une plateforme de travail autonome capable d'exécuter des tâches complexes et multi-étapes directement dans les e-mails, calendriers, dépôts de code et messageries des utilisateurs. Ty Geri, chef de produit chez OpenAI ayant contribué au développement de ChatGPT Work, a expliqué que l'agent puise le contexte dans les applications, fichiers et flux de travail connectés pour produire des documents, tableurs, présentations, rapports et sites web finalisés. À partir d'un objectif donné, il découpe la tâche en étapes et peut travailler seul pendant des heures sur des projets complexes. Le déploiement commence avec les abonnés Pro, Enterprise et Edu, avant de s'étendre dans les prochains jours aux utilisateurs Plus et Business. Le cœur technique du produit repose sur une machine virtuelle persistante hébergée dans le cloud d'OpenAI, accessible en permanence depuis n'importe quel appareil, y compris sur mobile. Cette annonce marque la tentative la plus nette d'OpenAI de repositionner ChatGPT comme plateforme professionnelle plutôt que comme simple agent conversationnel. Selon Geri, l'objectif est de démocratiser les capacités agentiques déjà démontrées en interne par Codex, l'outil d'ingénierie d'OpenAI, dont l'adoption suit une courbe exponentielle dans toutes les fonctions de l'entreprise. Fait notable, cette technologie n'est pas réservée aux abonnements les plus chers : elle est disponible dès l'offre Plus, ce que Geri présente comme une prouesse conforme à la mission d'OpenAI de rendre cette puissance accessible au plus grand nombre. L'approche mobile constitue aussi une nouveauté sur le marché, avec la possibilité de créer un site web depuis son téléphone et de le partager instantanément avec des collaborateurs. Sur le plan technique, ChatGPT Work s'appuie sur des plugins basés sur le protocole MCP (Model Context Protocol) pour se connecter à Gmail, Google Calendar, Slack et GitHub, et la prise en charge de plusieurs comptes Gmail simultanés figure déjà sur la feuille de route. Ce lancement intervient à un moment charnière pour OpenAI, qui a déposé le mois dernier un dossier confidentiel d'introduction en bourse auprès de la SEC, avec une valorisation estimée entre 730 et 852 milliards de dollars et un chiffre d'affaires annualisé dépassant désormais les 25 milliards de dollars. Face à des concurrents dont les agents dépendent d'une machine locale allumée et connectée, OpenAI mise sur une infrastructure cloud toujours disponible pour asseoir son avance dans la course à l'IA agentique en entreprise.

💬 OpenAI ne lance pas juste une feature, il déplace ChatGPT du chat vers l'agent qui bosse tout seul pendant des heures dans ta boîte mail et ton Slack. Ce qui change vraiment, c'est le prix : cette capacité arrive dès l'abonnement Plus, pas réservée aux comptes Enterprise, et ça c'est une vraie rupture de stratégie face à Google ou Microsoft qui verrouillent ce genre d'outil derrière des licences pro. Reste à voir si une VM cloud "toujours allumée" tient ses promesses sur des tâches multi-étapes réelles, parce que sur le papier c'est bluffant, mais l'agentique a déjà déçu plus d'une fois en prod.

OutilsOutil
1 source
Onyx : une alternative à Claude, plus puissante, open-source et locale ?
3Le Big Data 

Onyx : une alternative à Claude, plus puissante, open-source et locale ?

Onyx est une plateforme d'intelligence artificielle open source qui a franchi le cap des 20 000 étoiles sur GitHub début avril 2026, attirant l'attention des équipes techniques à la recherche d'alternatives aux solutions propriétaires comme Claude d'Anthropic. Conçue pour s'installer en self-hosting via Docker, elle fonctionne comme une couche d'orchestration complète : elle se connecte à plus de 40 sources de données d'entreprise (stockage, messagerie, gestion de projet), indexe les contenus en continu et dialogue avec n'importe quel LLM, qu'il s'agisse de modèles cloud, d'API externes ou de modèles tournant entièrement en local. Sur les benchmarks de recherche approfondie, Onyx affiche des scores supérieurs à plusieurs solutions propriétaires, en combinant recherche sémantique, indexation permanente et exploration web intégrée pour produire des réponses contextualisées et traçables. L'enjeu concret est la souveraineté technologique des organisations. En permettant de choisir librement le modèle sous-jacent selon chaque usage et d'optimiser les coûts sans dépendre d'un fournisseur unique, Onyx élimine le risque de verrouillage propriétaire qui préoccupe de nombreux DSI et responsables de la sécurité informatique. Les réponses ne reposent plus sur des données d'entraînement génériques, mais sur les documents internes réels de l'entreprise, synchronisés en temps réel. Dans des environnements professionnels où chaque réponse doit être justifiable et auditable, cette traçabilité représente un avantage opérationnel direct. L'outil "Craft" intégré pousse la logique plus loin : il permet de générer non seulement des documents, mais aussi des tableaux de bord, des applications web et des visualisations à partir des données internes, dans des environnements isolés garantissant la confidentialité. Le lancement d'Onyx s'inscrit dans une dynamique plus large de professionnalisation de l'IA open source, portée par des projets comme LangChain, Ollama ou LlamaIndex, qui ont progressivement rendu accessibles des capacités jusqu'alors réservées aux grandes plateformes cloud. Face à la montée en puissance de Claude, GPT-4o et Gemini, une partie de l'écosystème technique cherche à construire des infrastructures IA qui restent sous contrôle de l'organisation. Onyx mise sur la dimension collaborative pour se différencier davantage : la plateforme gère des rôles, des accès granulaires et des agents automatisés configurables avec des règles précises, la rapprochant d'un système applicatif complet plutôt que d'un simple assistant conversationnel. La prochaine étape pour le projet sera de démontrer sa robustesse à l'échelle dans des environnements de production critiques, un terrain où les solutions propriétaires conservent encore une avance significative en matière de support et de garanties contractuelles.

UELes organisations européennes soucieuses de souveraineté numérique et de conformité RGPD peuvent déployer Onyx en self-hosting pour garder leurs données internes hors des clouds américains.

OutilsOutil
1 source
OpenClaw vs ChatGPT : quel agent IA local bat le roi du cloud ?
4Le Big Data 

OpenClaw vs ChatGPT : quel agent IA local bat le roi du cloud ?

En 2026, le débat entre agents IA locaux et solutions cloud a pris une nouvelle dimension avec l'émergence d'OpenClaw, un agent dit "skills-based" qui s'exécute directement sur la machine de l'utilisateur. Contrairement à ChatGPT Agent, le mode Operator d'OpenAI lancé dans le courant de l'année, OpenClaw accède au terminal, manipule les fichiers locaux, gère les dépôts Git et peut tourner en arrière-plan même session fermée, envoyant des notifications sur Discord à la fin d'une tâche. ChatGPT Agent fonctionne lui exclusivement dans le navigateur : l'IA clique, défile et remplit des formulaires à la place de l'utilisateur, mais s'arrête dès que l'onglet est fermé. Sur le plan tarifaire, OpenClaw revient à environ 10 à 30 dollars par mois selon la consommation d'API, contre 20 dollars fixes pour l'abonnement ChatGPT Plus incluant l'accès au mode Operator. La différence fondamentale entre les deux approches tient à la souveraineté des données et à la flexibilité technique. Avec OpenClaw, l'utilisateur choisit lui-même ses modèles, Claude 3.5 pour les raisonnements complexes, Llama 3 ou Kimi pour les tâches répétitives, afin d'optimiser ses coûts, tandis que ChatGPT impose l'écosystème OpenAI sans possibilité de substitution. La mémoire d'OpenClaw est persistante via des fichiers stockés sur disque ; celle de ChatGPT Agent est éphémère, réinitialisée à chaque session. Pour les professionnels qui valorisent l'intégration profonde dans leur environnement de travail, scripts actifs, assets locaux, automatisations conditionnelles, l'agent local représente un levier que le cloud ne peut pas reproduire. Nvidia a par ailleurs introduit NemoClaw, une couche de sécurité greffable sur OpenClaw pour encadrer les actions de l'agent et prévenir les comportements non désirés, comblant l'un des reproches traditionnels faits aux solutions locales. Ce duel s'inscrit dans un basculement plus large du marché de l'IA : on ne parle plus de simples chatbots, mais d'agents capables d'agir de manière autonome sur des systèmes réels. OpenAI a misé sur l'accessibilité maximale avec une interface sans friction, au prix d'un contrôle réduit pour l'utilisateur. OpenClaw, porté par une communauté technique exigeante, répond à un besoin croissant de confidentialité et d'autonomie, notamment dans les secteurs sensibles, finance, santé, défense, où héberger des données sur des serveurs tiers reste rédhibitoire. La vraie question pour 2026 n'est donc pas laquelle des deux IA est "plus intelligente", mais laquelle correspond au niveau de contrôle et de confiance que chaque utilisateur est prêt à exercer sur ses outils numériques.

UELa souveraineté des données mise en avant par OpenClaw répond aux exigences du RGPD et aux contraintes des secteurs réglementés en France et en UE (finance, santé, défense), où l'hébergement tiers reste problématique.

OutilsOutil
1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic