Aller au contenu principal
Sécurité · Actu ·

Les chercheurs parviennent à reconstituer les prompts d'un LLM à partir du texte généré avec une précision quasi parfaite

Les chercheurs de l'IIT Bombay et d'Adobe Research ont mis au point une méthode capable de reconstruire quasiment parfaitement le prompt original ayant généré un texte produit par un grand modèle de langage. Baptisée "Previous-Token Prediction", cette technique repose sur un modèle de langage inverse qui analyse le texte de sortie pour en déduire les instructions initiales. Sa particularité tient au fait qu'elle ne nécessite aucun accès aux poids internes du modèle visé et fonctionne indépendamment du système utilisé, ce qui la rend applicable à une large variété de LLM commerciaux ou propriétaires.

1 min de lecturePertinence 58
Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cette avancée soulève une inquiétude sérieuse pour les entreprises qui bâtissent une partie de leur avantage concurrentiel sur des prompts système soigneusement conçus et gardés secrets. De nombreux produits basés sur l'IA générative, des chatbots aux assistants spécialisés, dépendent d'instructions internes optimisées pour orienter le comportement du modèle, filtrer certains contenus ou personnaliser les réponses. Si ces prompts peuvent être extraits simplement en observant les réponses générées, la protection de cette propriété intellectuelle devient illusoire, exposant les entreprises à un risque de copie rapide de leurs configurations les plus sophistiquées par des concurrents.

Cette découverte s'inscrit dans un débat plus large sur la sécurité et la confidentialité des systèmes d'intelligence artificielle déployés commercialement. Depuis l'essor des LLM, plusieurs tentatives d'extraction de prompts système avaient déjà été rapportées, souvent via des manipulations directes de l'utilisateur final, mais cette nouvelle méthode automatisée et quasi systématique change l'échelle du problème. Elle relance la question de savoir comment les entreprises pourront protéger leurs configurations propriétaires à l'avenir, que ce soit par des techniques de watermarking, une architecture différente des systèmes de prompt, ou une évolution des pratiques de sécurité entourant le déploiement des modèles génératifs.

Impact France / UEChamp produit par Le Fil IA

Les entreprises europeennes qui deploient des chatbots ou assistants bases sur des prompts systeme proprietaires sont egalement exposees a ce risque d'extraction automatisee.

À lire ensuite

01Excédé par les vibe coders, un dev piège leur code avec une injection de prompt qui efface leurs données50Ars Technica AISécurité 02Les défenseurs adoptent aussi l'injection de prompts47Ars Technica AISécurité 03Quatre entreprises sur cinq ayant sécurisé leurs identités d'agents IA ne parviennent toujours pas à contenir un agent devenu incontrôlable57VentureBeat AISécurité 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.