Les chercheurs parviennent à reconstituer les prompts d'un LLM à partir du texte généré avec une précision quasi parfaite
Les chercheurs de l'IIT Bombay et d'Adobe Research ont mis au point une méthode capable de reconstruire quasiment parfaitement le prompt original ayant généré un texte produit par un grand modèle de langage. Baptisée "Previous-Token Prediction", cette technique repose sur un modèle de langage inverse qui analyse le texte de sortie pour en déduire les instructions initiales. Sa particularité tient au fait qu'elle ne nécessite aucun accès aux poids internes du modèle visé et fonctionne indépendamment du système utilisé, ce qui la rend applicable à une large variété de LLM commerciaux ou propriétaires.
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cette avancée soulève une inquiétude sérieuse pour les entreprises qui bâtissent une partie de leur avantage concurrentiel sur des prompts système soigneusement conçus et gardés secrets. De nombreux produits basés sur l'IA générative, des chatbots aux assistants spécialisés, dépendent d'instructions internes optimisées pour orienter le comportement du modèle, filtrer certains contenus ou personnaliser les réponses. Si ces prompts peuvent être extraits simplement en observant les réponses générées, la protection de cette propriété intellectuelle devient illusoire, exposant les entreprises à un risque de copie rapide de leurs configurations les plus sophistiquées par des concurrents.
Cette découverte s'inscrit dans un débat plus large sur la sécurité et la confidentialité des systèmes d'intelligence artificielle déployés commercialement. Depuis l'essor des LLM, plusieurs tentatives d'extraction de prompts système avaient déjà été rapportées, souvent via des manipulations directes de l'utilisateur final, mais cette nouvelle méthode automatisée et quasi systématique change l'échelle du problème. Elle relance la question de savoir comment les entreprises pourront protéger leurs configurations propriétaires à l'avenir, que ce soit par des techniques de watermarking, une architecture différente des systèmes de prompt, ou une évolution des pratiques de sécurité entourant le déploiement des modèles génératifs.
Les entreprises europeennes qui deploient des chatbots ou assistants bases sur des prompts systeme proprietaires sont egalement exposees a ce risque d'extraction automatisee.