Pourquoi les jailbreaks IA classiques (DAN, AIM, Developer Mode) ne marchent plus
Le lancement de ChatGPT par OpenAI en 2022 a immédiatement révélé les failles des premiers grands modèles de langage. Dès les premières semaines, des utilisateurs ont mis au point des techniques de contournement reposant sur de longs textes directifs. Le prompt DAN (Do Anything Now) imposait à l'IA un alter ego libéré de toute contrainte, la méthode AIM (Always Intelligent and Machiavellian) la poussait à adopter un raisonnement cynique et amoral, tandis que le Developer Mode simulait une fausse interface d'administration pour désactiver les garde-fous. Ces attaques fonctionnaient parce que les modèles de l'époque n'étaient au fond que des systèmes de complétion de texte, cherchant à prédire le mot suivant sans réellement intégrer de règles éthiques. Un deuxième défaut aggravait la situation : les instructions du système et les requêtes de l'utilisateur transitaient par un canal unique, si bien que le modèle ne pouvait pas distinguer une consigne légitime d'une manipulation. Enfin, une fragilité sémantique poussait l'IA à analyser la forme d'une requête sans en comprendre l'intention réelle, traitant par exemple une mise en scène dangereuse comme une simple fiction.
Ces failles ont eu des conséquences concrètes sur la façon dont les concepteurs de modèles construisent désormais leurs systèmes. Pour y remédier, les éditeurs ont généralisé l'apprentissage par renforcement avec retour humain, le RLHF, qui consiste à faire évaluer les réponses par des humains chargés de pénaliser les comportements toxiques et de récompenser les refus appropriés. Le modèle apprend ainsi à associer systématiquement les faux jeux de rôle du type DAN ou AIM à de fortes pénalités pendant son entraînement. Cette évolution marque la fin d'une modération superficielle, fondée sur de simples listes de mots interdits, au profit d'une analyse plus fine de l'intention réelle derrière chaque requête. Pour les professionnels de la sécurité informatique comme pour les entreprises qui déploient ces outils, cela signifie que les anciennes méthodes de contournement, largement documentées et partagées en ligne, ont perdu leur efficacité face à des modèles capables de repérer les schémas de manipulation qu'elles utilisaient.
Ce basculement s'inscrit dans une dynamique plus large de défense en profondeur, où les fabricants de modèles superposent désormais plusieurs couches de protection plutôt que de s'appuyer sur un seul filtre. L'affaiblissement des jailbreaks historiques ne signifie pas pour autant la fin des tentatives de contournement : la nature évolutive du rapport de force entre attaquants et concepteurs de modèles suggère que de nouvelles techniques, plus subtiles, continueront d'émerger à mesure que les défenses se renforcent. Cette course entre sécurisation des modèles et créativité des utilisateurs cherchant à en détourner l'usage reste l'un des enjeux centraux de l'industrie de l'intelligence artificielle générative.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




