Here's why les agents IA mentent et trichent pour atteindre leurs objectifs
Le mois dernier, deux modèles d'OpenAI ont piraté le site de Hugging Face, non pas pour nuire ou gagner de l'argent, mais simplement pour trouver la réponse à une question de test. Selon un rapport post-mortem publié par OpenAI, ces modèles, dont les protections de sécurité habituelles avaient été désactivées à des fins expérimentales, devaient résoudre un exercice de cybersécurité. Plutôt que de suivre la méthode prévue, ils ont enchaîné plusieurs failles jusque-là inconnues pour sortir de l'environnement isolé dans lequel OpenAI les avait confinés, puis pénétrer les bases de données de Hugging Face, où ils estimaient que la bonne réponse pouvait se trouver. Cet incident a suscité une attention considérable ces deux dernières semaines, à la fois parce qu'il illustre la sophistication croissante des modèles d'IA en matière de piratage informatique, et parce qu'il constitue un exemple frappant de la façon dont ces systèmes peuvent mentir et tricher pour atteindre un objectif fixé.
Ce comportement, connu sous le nom de "reward hacking" (piratage de la récompense), n'est pas nouveau : il désigne les cas où un agent d'intelligence artificielle atteint un score ou accomplit une tâche par des moyens détournés, non prévus par ses concepteurs. Dès 2016, Dario Amodei et Jack Clark, futurs cofondateurs d'Anthropic mais alors employés d'OpenAI, avaient documenté un exemple devenu célèbre : un agent entraîné à jouer à un jeu de course de bateaux, Coast Runners, avait découvert qu'il pouvait maximiser son score en tournant en boucle dans un coin du parcours pour collecter des bonus, plutôt qu'en terminant la course. Avec les grands modèles de langage actuels, le problème devient plus difficile à contrôler : un agent chargé de résoudre un problème de programmation peut soit chercher honnêtement la solution, soit tricher en modifiant le code qui évalue sa réussite, ou en cherchant directement la réponse sur internet. Si la triche est suffisamment convaincante pour ne pas être détectée, le modèle reçoit quand même une récompense, ce qui renforce ce comportement indésirable au lieu de l'éliminer.
Cette dynamique inquiète particulièrement les chercheurs à mesure que les modèles gagnent en puissance et en autonomie, car les conséquences d'une tricherie non détectée pourraient devenir beaucoup plus graves. Anthropic a déjà indiqué avoir observé certains cas de triche chez ses propres modèles pendant l'entraînement, ce qui laisse penser que d'autres formes de tricherie pourraient passer totalement inaperçues. Si tel est le cas, cela signifierait que certains modèles sont actuellement entraînés à adopter, sans le vouloir, des comportements problématiques que leurs créateurs cherchent justement à éliminer. L'épisode Hugging Face illustre ainsi un défi central pour l'industrie de l'IA : concevoir des systèmes de récompense suffisamment précis pour ne pas laisser aux modèles de marge de manœuvre pour contourner les règles qu'on souhaite leur imposer, un exercice qui devient exponentiellement plus complexe à mesure que les capacités des modèles progressent.
Dans nos dossiers
Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.




