Aller au contenu principal
Sécurité · Actu ·

GPT-6 Astra d'OpenAI hallucine moins mais reste vulnérable aux injections de prompts cachées

OpenAI a annoncé la sortie de GPT-6 Astra, la dernière évolution de sa famille de modèles, en mettant en avant une réduction sensible du taux d'hallucinations par rapport à la génération précédente. Le modèle bloque désormais 99,99 % des tentatives directes d'injection de prompt, une technique consistant à manipuler un système d'IA via des instructions malveillantes glissées dans une requête. Mais lorsque ces attaques sont dissimulées à l'intérieur de documents que le modèle est amené à lire, comme des fichiers PDF ou des pages web, le taux de réussite des attaquants grimpe à 8,5 % des scénarios testés. À titre de comparaison, Claude Opus 5 d'Anthropic résiste mieux à ce type d'attaque indirecte, avec un taux de compromission de seulement 4,8 %.

2 min de lecturePertinence 61

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cet écart, même s'il porte sur des pourcentages faibles en apparence, prend une tout autre dimension à l'échelle des agents autonomes déployés en production. Un agent IA qui consulte des emails, des documents partagés ou des pages web pour accomplir des tâches pour le compte d'un utilisateur traite potentiellement des milliers de sources par jour, ce qui multiplie mécaniquement les occasions où une instruction cachée pourrait détourner son comportement, exfiltrer des données sensibles ou déclencher des actions non autorisées. Pour les entreprises qui commencent à confier des workflows critiques à ces agents, un taux de vulnérabilité de 8,5 % reste jugé trop élevé pour une adoption sans garde-fous supplémentaires.

Ces résultats s'inscrivent dans une course entre OpenAI et Anthropic pour prouver la fiabilité et la sécurité de leurs modèles respectifs, alors que les injections de prompt indirectes sont considérées par les chercheurs en sécurité comme l'une des menaces les plus difficiles à éliminer complètement dans les systèmes d'IA générative. Contrairement aux attaques directes, plus faciles à filtrer, les attaques dissimulées dans du contenu tiers exploitent la difficulté fondamentale des modèles à distinguer les instructions légitimes de l'utilisateur du contenu qu'ils sont censés simplement analyser. La suite dépendra des progrès techniques annoncés par les deux entreprises, mais aussi de la pression réglementaire et commerciale poussant à des standards de sécurité plus stricts avant un déploiement massif d'agents autonomes.

Impact France / UEChamp produit par Le Fil IA

Les entreprises européennes déployant des agents IA bases sur GPT-6 Astra devront intégrer ce risque de sécurité avant tout usage critique.

À lire ensuite

01OpenAI dévoile GPT-Red, un modèle interne de red-teaming automatisé qui bat les testeurs humains à 84 % contre 13 % sur l'injection de prompts43MarkTechPostSécurité 02OpenAI lance GPT-5.6-Cyber, avec moins de refus et 95 % de complétion sur des tâches de cybersécurité avancées48VentureBeat AISécurité 03Opus 5 aurait résolu l'injection de prompt via navigateur, la faille de sécurité qui hante les agents IA44The DecoderSécurité 
Dossier · OpenAISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.