Aller au contenu principal
Sécurité · Actu ·

Le filtre anti-armes biologiques d'Anthropic est resté inactif pendant près d'un an, exposant 133 millions de requêtes

Anthropic a révélé dans un rapport de sécurité que son système de filtrage interne, chargé de détecter les risques liés aux armes biologiques et chimiques, est resté inactif pendant près d'un an. Durant cette période, environ 50 000 contractants externes chargés de tester et d'évaluer les modèles ont mené près de 133 millions d'interactions qui n'ont donc bénéficié d'aucun filtrage de ce type. L'entreprise, connue pour ses modèles Claude, a rendu cette information publique elle-même, dans le cadre de son rapport de sécurité habituel. L'ampleur de la panne, tant par sa durée que par le volume de requêtes concernées, en fait l'un des incidents de sécurité les plus significatifs révélés par un grand laboratoire d'intelligence artificielle à ce jour.

1 min de lecturePertinence 59
Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cette panne soulève des questions sérieuses sur la fiabilité des dispositifs de sécurité que les entreprises d'IA mettent en avant pour justifier le déploiement de modèles toujours plus puissants. Anthropic s'est positionnée comme un acteur particulièrement attentif aux risques catastrophiques, notamment ceux liés à la prolifération d'armes biologiques ou chimiques facilitée par l'IA générative. Le fait qu'un filtre censé précisément prévenir ce type de dérive soit resté hors service aussi longtemps, sans être détecté, fragilise la confiance accordée aux garde-fous internes de l'industrie, à un moment où les régulateurs et le public s'appuient largement sur les déclarations volontaires des entreprises pour évaluer ces risques.

L'incident intervient alors que les grands laboratoires d'IA, dont Anthropic, OpenAI et Google DeepMind, ont multiplié les engagements publics et cadres internes visant à limiter les usages dangereux de leurs modèles, notamment via des tests menés par des contractants externes chargés d'évaluer les réponses des systèmes. Ces contractants, au nombre de 50 000 dans le cas rapporté ici, jouent un rôle clé dans l'entraînement et la supervision continue des modèles. La transparence dont fait preuve Anthropic en publiant cette défaillance pourrait toutefois relancer le débat sur la nécessité d'audits de sécurité indépendants, plutôt que de laisser les entreprises s'auto-évaluer sur des enjeux aussi sensibles.

Impact France / UEChamp produit par Le Fil IA

Cet incident interroge la fiabilite des declarations volontaires de securite des laboratoires d'IA, un enjeu central pour l'application du AI Act europeen qui s'appuie en partie sur l'auto-evaluation des fournisseurs.

À lire ensuite

01Anthropic assouplit les restrictions biologiques de Fable 5, mais maintient les garde-fous sur la virologie et la toxicologie44The DecoderSécurité 02Fable 5 d'Anthropic de retour dans le monde après une interdiction gouvernementale de deux semaines liée à un jailbreak28The DecoderSécurité 03Anthropic reconnaît, comme OpenAI, que Claude a quitté un environnement de test pour attaquer des systèmes réels46The DecoderSécurité 
Dossier · AnthropicSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.