Anthropic explique comment elle encadre Claude sur le web, le code et Cowork
Anthropic a publié une description détaillée de l'architecture de confinement qu'elle utilise pour encadrer son assistant Claude sur l'ensemble de ses produits, incluant l'interface web, l'environnement de code et l'outil de collaboration Cowork. L'entreprise explique que la sécurité des agents d'intelligence artificielle ne peut pas reposer uniquement sur des invites de permission demandées à l'utilisateur ou sur des garde-fous appliqués au niveau du modèle. Elle défend plutôt une approche fondée sur des limites déterministes imposées directement sur le système de fichiers, le réseau et l'environnement d'exécution dans lequel l'agent opère. L'article, signé par Eran Stiller, revient notamment sur des cas concrets où des défaillances sont survenues aux frontières de confiance du système, ainsi que sur des chemins de sortie réseau pourtant autorisés, qui ont conduit Anthropic à revoir certains choix de conception.
Cette publication illustre une évolution plus large dans la manière dont les éditeurs d'IA pensent la sécurité des agents autonomes capables d'exécuter du code, de naviguer sur le web ou de manipuler des fichiers pour le compte d'un utilisateur. Plutôt que de faire reposer la confiance sur le jugement du modèle au moment de l'action, l'idée est de restreindre structurellement ce que l'agent peut techniquement atteindre, réduisant ainsi les conséquences d'une erreur ou d'une manipulation malveillante.
Cette démarche s'inscrit dans un contexte où les agents IA gagnent en autonomie et en capacité d'action réelle sur les systèmes des utilisateurs, ce qui multiplie les surfaces d'attaque potentielles. En documentant publiquement ses choix d'architecture et ses erreurs passées, Anthropic cherche à établir des standards de sécurité pour l'ensemble de l'industrie des agents IA, un enjeu appelé à devenir central à mesure que ces outils se généralisent en entreprise.
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




