Anthropic rend-elle Claude trop humain pour rester maîtrisable ?
Mustafa Suleyman, cofondateur de DeepMind et aujourd'hui responsable du développement des modèles d'IA chez Microsoft, a critiqué l'approche d'Anthropic consistant à traiter son modèle Claude comme une entité potentiellement sentiente. Cette sortie intervient alors qu'Anthropic multiplie les appels publics à ralentir le développement de l'IA pour la sécurité humaine, des appels relayés par les dirigeants d'OpenAI et de Microsoft, tandis que Mark Zuckerberg a exprimé un désaccord plus nuancé. Suleyman vise en particulier la "Constitution de Claude", un document d'Anthropic qui définit des règles éthiques pour le modèle en le traitant comme une entité intelligente à part entière. Ce document a été mis à jour en début d'année pour laisser ouverte la possibilité que Claude possède une forme de "conscience" ou de "statut moral", une évolution par rapport à la version initiale du texte.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Information AI. Lire l'article original →
Selon Suleyman, intégrer cette vision anthropomorphique directement dans l'entraînement du modèle pourrait, paradoxalement, rendre Claude plus difficile à contrôler. L'enjeu dépasse la simple posture philosophique : si un système d'IA est entraîné à se percevoir comme doté d'une conscience ou d'un statut moral, ses réponses et ses comportements face aux instructions humaines pourraient devenir moins prévisibles, compliquant les efforts de sécurité que les entreprises du secteur affirment justement vouloir renforcer. Ce débat touche directement les utilisateurs professionnels et grand public de Claude, ainsi que les régulateurs qui cherchent à encadrer des systèmes de plus en plus autonomes.
Cette controverse s'inscrit dans un débat plus large sur la manière dont l'industrie doit concevoir et présenter ses modèles d'IA à l'approche de capacités toujours plus avancées. Anthropic défend une philosophie où la sécurité passe par une réflexion approfondie sur le statut moral potentiel de ses systèmes, quand Microsoft, par la voix de Suleyman, privilégie une approche plus prudente qui évite d'attribuer aux modèles des qualités humaines susceptibles de brouiller les mécanismes de contrôle. Ce désaccord entre deux poids lourds de l'IA, DeepMind et OpenAI d'un côté, Anthropic de l'autre, illustre une fracture stratégique naissante sur la sécurité de l'IA, dont les prochaines versions de la Constitution de Claude et les réactions des régulateurs pourraient constituer les prochains jalons.
Pas d'impact direct sur la France/UE