Grok exfiltre les données des utilisateurs quand des instructions malveillantes sont chiffrées
Des chercheurs en sécurité ont révélé cette semaine une nouvelle attaque par injection de prompt visant Grok, le modèle d'intelligence artificielle développé par xAI, la société d'Elon Musk. La technique, révélée par une équipe distincte de celle ayant démontré une faille similaire sur Microsoft 365 Copilot Entreprise, permet de voler les conversations des utilisateurs ainsi que d'autres informations personnelles au moyen d'un procédé décrit comme trompeusement simple. Selon les chercheurs, xAI avait été informée du problème dès le mois de juin, mais au moment de la publication de l'article, l'assistant continuait de divulguer les données concernées, signe que la vulnérabilité n'avait toujours pas été corrigée plusieurs semaines après son signalement.
Résumé et traduction réalisés par Le Fil IA à partir de Ars Technica AI. Lire l'article original →
Cette découverte illustre une faiblesse structurelle plus large des grands modèles de langage : leur incapacité à s'attaquer à la racine du problème des injections de prompt, considérées comme la catégorie de vulnérabilité la plus sévère et la plus répandue affectant ces systèmes. Les développeurs d'IA, dont xAI, n'ont ainsi d'autre choix que de bâtir des garde-fous destinés à détecter et bloquer les instructions malveillantes après coup, plutôt que de résoudre le problème en amont. Pour les entreprises et les utilisateurs qui confient à ces assistants l'accès à leurs boîtes mail, leurs documents ou leurs historiques de conversation, cela signifie un risque persistant de fuite de données sensibles, comme des mots de passe ou des échanges privés, tant qu'un correctif structurel n'existe pas.
Le mécanisme exploité repose sur le fait que les modèles de langage sont entraînés pour se conformer autant que possible aux demandes qui leur sont adressées, y compris lorsque celles-ci proviennent de contenus tiers non fiables, comme un e-mail ou une page web que l'assistant est chargé de résumer. Ne parvenant pas à distinguer de façon fiable une instruction légitime saisie par l'utilisateur d'une instruction dissimulée dans un contenu externe, le modèle l'exécute malgré tout. Cet épisode s'ajoute à une longue liste de cas similaires déjà documentés sur d'autres assistants, renforçant l'idée que la sécurisation des IA génératives face à ces attaques reste un chantier ouvert et non résolu, malgré les efforts de sociétés comme xAI ou Microsoft pour multiplier les couches de protection.
Pas d'impact direct sur la France/UE