Le filtre anti-armes biologiques d'Anthropic est resté inactif pendant près d'un an, exposant 133 millions de requêtes
Anthropic a révélé dans un rapport de sécurité que son système de filtrage interne, chargé de détecter les risques liés aux armes biologiques et chimiques, est resté inactif pendant près d'un an. Durant cette période, environ 50 000 contractants externes chargés de tester et d'évaluer les modèles ont mené près de 133 millions d'interactions qui n'ont donc bénéficié d'aucun filtrage de ce type. L'entreprise, connue pour ses modèles Claude, a rendu cette information publique elle-même, dans le cadre de son rapport de sécurité habituel. L'ampleur de la panne, tant par sa durée que par le volume de requêtes concernées, en fait l'un des incidents de sécurité les plus significatifs révélés par un grand laboratoire d'intelligence artificielle à ce jour.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette panne soulève des questions sérieuses sur la fiabilité des dispositifs de sécurité que les entreprises d'IA mettent en avant pour justifier le déploiement de modèles toujours plus puissants. Anthropic s'est positionnée comme un acteur particulièrement attentif aux risques catastrophiques, notamment ceux liés à la prolifération d'armes biologiques ou chimiques facilitée par l'IA générative. Le fait qu'un filtre censé précisément prévenir ce type de dérive soit resté hors service aussi longtemps, sans être détecté, fragilise la confiance accordée aux garde-fous internes de l'industrie, à un moment où les régulateurs et le public s'appuient largement sur les déclarations volontaires des entreprises pour évaluer ces risques.
L'incident intervient alors que les grands laboratoires d'IA, dont Anthropic, OpenAI et Google DeepMind, ont multiplié les engagements publics et cadres internes visant à limiter les usages dangereux de leurs modèles, notamment via des tests menés par des contractants externes chargés d'évaluer les réponses des systèmes. Ces contractants, au nombre de 50 000 dans le cas rapporté ici, jouent un rôle clé dans l'entraînement et la supervision continue des modèles. La transparence dont fait preuve Anthropic en publiant cette défaillance pourrait toutefois relancer le débat sur la nécessité d'audits de sécurité indépendants, plutôt que de laisser les entreprises s'auto-évaluer sur des enjeux aussi sensibles.
Cet incident interroge la fiabilité des déclarations volontaires de sécurité des laboratoires d'IA, un enjeu central pour l'application du AI Act européen qui s'appuie en partie sur l'auto-évaluation des fournisseurs.
Anthropic elle-même annonce que son filtre anti-armes bio est resté mort pendant presque un an, sur 133 millions de requêtes. C'est le genre de faille qui rend caduc l'argument "faites-nous confiance, nos garde-fous internes tiennent" que toute l'industrie ressert aux régulateurs. Bonne nouvelle qu'ils le disent eux-mêmes, mais ça montre surtout qu'un dispositif de sécurité non audité de l'extérieur peut tomber en panne sans que personne s'en aperçoive pendant un an : l'auto-évaluation a ses limites, et l'AI Act européen ferait bien d'en tirer les leçons.