Anthropic assouplit les restrictions biologiques de Fable 5, mais maintient les garde-fous sur la virologie et la toxicologie
Anthropic a annoncé une réduction d'environ 85 % des faux positifs dans les filtres de sécurité liés à la biologie de son modèle Fable 5. Jusqu'à présent, la quasi-totalité des requêtes portant sur des sujets biologiques déclenchait un blocage automatique, redirigeant les utilisateurs vers Opus 5, un modèle moins performant. L'entreprise maintient toutefois ses garde-fous sur les thématiques sensibles à double usage, comme la virologie et la toxicologie, jugées à plus haut risque de détournement malveillant.
Ce changement modifie concrètement l'expérience des chercheurs, étudiants et professionnels de la biologie qui utilisent Fable 5 dans leurs travaux : ils ne seront plus systématiquement redirigés vers un modèle dégradé lorsqu'ils posent des questions légitimes sur la biologie moléculaire, la génétique ou la biochimie. Pour Anthropic, l'enjeu est de préserver l'utilité scientifique de son assistant sans renoncer à la prévention des usages dangereux, un équilibre de plus en plus scruté à mesure que les modèles d'IA gagnent en capacité dans des domaines pouvant faciliter la conception d'armes biologiques.
Cette annonce s'inscrit dans un débat plus large sur la sécurité des modèles d'IA face aux risques biologiques, une préoccupation qu'Anthropic a placée au cœur de sa politique de déploiement responsable depuis plusieurs années. Les classificateurs automatiques utilisés pour filtrer les requêtes sensibles restent notoirement imparfaits, générant soit trop de blocages inutiles, soit des failles exploitables. D'autres laboratoires, comme OpenAI et Google DeepMind, sont confrontés au même dilemme et affinent eux aussi leurs propres garde-fous. L'ajustement d'Anthropic pourrait ainsi servir de repère pour calibrer la frontière entre utilité scientifique et prévention des risques biologiques dans les mois à venir.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




