La biosécurité, un terrain de course aux armements pour l'IA
Eric Nguyen, cofondateur et directeur général de Radical Numerics, a expliqué dans un entretien comment la biosécurité est devenue une course aux armements portée par l'intelligence artificielle. Pendant ses études à Stanford, il a contribué au développement des modèles de langage génomique (GLM) Evo puis Evo 2 à l'Arc Institute, entraînés directement sur des séquences d'ADN. Une équipe distincte de l'Arc Institute et de Stanford a ensuite utilisé ces modèles pour générer des génomes entiers de bactériophages, synthétisés en virus fonctionnels. L'ADN repose sur un alphabet réduit à quatre lettres (A, C, T, G) mais s'étend sur des séquences très longues, un gène humain moyen comptant environ 60 000 bases et le génome humain complet près de 3 milliards. C'est l'architecture à contexte long Striped Hyena, développée il y a environ trois ans, bien avant les modèles à un million de tokens des grands laboratoires, qui a rendu cela possible. Eric Nguyen a depuis cofondé Radical Numerics pour étendre ces GLM à un éventail plus large de problèmes biologiques.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de Latent Space. Lire l'article original →
Cette conversation survient après une attaque récente touchant la chaîne OpenAI-Hugging Face, qui a relancé les inquiétudes sur les risques liés à l'IA, Anthropic identifiant justement la cybersécurité et la biologie comme domaines à surveiller de près. Clem Delangue, cofondateur de Hugging Face, défend une cybersécurité défensive ouverte capable de suivre le rythme des modèles offensifs de pointe, un raisonnement qu'Eric Nguyen étend à la biologie : les mêmes GLM qui augmentent les capacités biologiques dangereuses peuvent aussi empêcher la défense de prendre du retard. Radical Numerics a montré que ses modèles généralisent déjà à l'ARN et aux protéines grâce aux marqueurs présents dans les séquences d'ADN. Dans une expérience, en montrant au modèle des aptamères d'ARN classés du score le plus faible au plus élevé, l'équipe l'a vu extrapoler de lui-même vers des scores supérieurs jamais observés, une forme de raisonnement en chaîne appliqué au langage de l'ADN. Pour Eric Nguyen, la défense accuse aujourd'hui un retard, ce qui justifie selon lui d'accélérer plutôt que de freiner.
Ce schéma rappelle ce qui s'est produit avec les grands modèles de langage classiques, où contexte long, raisonnement en chaîne et perception multimodale ont débloqué des capacités sophistiquées : les mêmes leviers s'appliquent désormais aux GLM, avec un potentiel de danger comparable. Le parcours d'Eric Nguyen illustre la résistance initiale à cette idée : pendant longtemps à Stanford, les biologistes doutaient que ces modèles fonctionnent, que leurs résultats soient vérifiables, ou qu'ils apportent des applications réellement nouvelles. Radical Numerics veut désormais dépasser la seule séquence d'ADN pour intégrer la structure tridimensionnelle des protéines, l'épigénétique et le langage naturel, avec l'idée qu'un modèle pensant en ADN puisse aussi comprendre l'empreinte laissée par l'environnement sur les génomes. Le débat oppose ainsi deux logiques : restreindre la diffusion de ces capacités pour limiter les abus, ou accélérer leur développement pour garder une longueur d'avance défensive. Radical Numerics, comme Hugging Face sur la cybersécurité, penche pour la seconde option, plaçant les laboratoires de biologie synthétique au centre des arbitrages à venir sur la régulation de l'IA appliquée au vivant.
Pas d'impact direct sur la France/UE