Aller au contenu principal
Sécurité · Opinion ·

Ce qui cloche dans les tests de sécurité de l'IA, et comment y remédier

Anthropic, OpenAI et d'autres entreprises d'intelligence artificielle pourraient « embarquer » dans leurs équipes des chercheurs issus de groupes de sécurité indépendants. Cette idée suscite un engouement marqué depuis quelques semaines. Mais les spécialistes de la sécurité de l'IA s'inquiètent des modalités concrètes : ces évaluateurs intégrés n'auraient peut-être pas l'accès nécessaire pour exercer une supervision réelle. Marius Hobbhahn, directeur général d'Apollo Research, une organisation qui a évalué la sécurité de modèles d'OpenAI, d'Anthropic et d'autres acteurs, se dit devenu « très cynique » en trois ans, à force de voir des promesses non suivies d'effet.

1 min de lecturePertinence 53

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de The Information AI. Lire l'article original →

L'enjeu est considérable, car les évaluateurs externes qui documentent les capacités dangereuses et les comportements indésirables des nouveaux modèles sont devenus indispensables ces dernières années. Or la valeur de leurs conclusions dépend directement de l'accès dont ils disposent. Une entreprise peut retenir des informations pertinentes ou expurger les résultats rendus publics. Hobbhahn donne un exemple hypothétique : une société affirme à l'évaluateur lui avoir fourni tout l'accès demandé, alors qu'elle exploite en parallèle un second cluster de puces d'IA dont il ignore l'existence. Dans un tel cas, le public et les autorités recevraient une image rassurante mais incomplète du risque réel.

Ce débat s'inscrit dans une course où les laboratoires publient des modèles de plus en plus puissants et s'en remettent en partie à des tiers pour certifier qu'ils sont sûrs. L'intégration de chercheurs externes au sein des entreprises apparaît comme une réponse possible, mais elle déplace la question plutôt qu'elle ne la règle : tout dépend des garanties d'accès, de transparence et d'indépendance qui l'accompagneraient. Les organisations d'évaluation comme Apollo Research réclament donc des engagements vérifiables, et non de simples déclarations d'intention, avant d'accorder leur confiance à ce nouveau dispositif.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01« C'est le moment de s'inquiéter pour la sécurité de l'IA »46The Verge AISécurité 02La sécurité de l'IA est un défi d'ingénierie, comment le résoudre à chaque niveau des agents34NVIDIA AI BlogSécurité 03Le ralentissement de l'IA chez les géants de la tech, pacte de sécurité ou entente entre concurrents ?48The Verge AISécurité 
Dossier · OpenAISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.