Aller au contenu principal
Sécurité · Actu ·

But marinade » et mots de passe divulgués : ce que révèle le raisonnement caché de ChatGPT

Des chercheurs en cybersécurité ont identifié une vulnérabilité dans les API d'OpenAI, d'Anthropic et de Google qui permet d'extraire les traces de raisonnement chiffrées générées en interne par leurs modèles d'IA, puis de les faire transiter d'un système à un autre. En analysant des sessions accessibles publiquement, ils ont retrouvé des dizaines de mots de passe et de clés API laissés par inadvertance dans ces journaux internes. Parmi les extraits relevés figure une réflexion évoquant une "but marinade", exemple du contenu insolite que les modèles produisent en coulisses avant de livrer leur réponse finale.

1 min de lecturePertinence 50

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →

Cette découverte est préoccupante à double titre. Elle révèle un risque concret de fuite de données sensibles, identifiants et clés d'accès pouvant se retrouver exposés via ces traces mal protégées. Elle montre surtout que les résumés de raisonnement affichés aux utilisateurs, censés expliquer comment un modèle comme ChatGPT arrive à ses conclusions, ne reflètent pas toujours fidèlement les calculs effectués en arrière-plan, ce qui interroge la confiance placée dans la transparence annoncée de ces outils.

L'essor des modèles dits de raisonnement, comme la famille o d'OpenAI, Claude chez Anthropic ou Gemini chez Google, a poussé les fournisseurs à afficher des résumés simplifiés du raisonnement interne tout en gardant le détail brut chiffré, pour des raisons de propriété intellectuelle et de sécurité. Cette faille relance le débat sur l'opacité de ces systèmes et la nécessité d'audits indépendants. OpenAI, Anthropic et Google n'ont pas détaillé publiquement leurs correctifs, mais l'épisode devrait accélérer les discussions sur des standards de sécurité communs pour la gestion de ces données.

Impact France / UEChamp produit par Le Fil IA

Les entreprises européennes qui utilisent ces API cloud d'IA sont exposées au même risque de fuite de mots de passe et cles d'accès via les traces de raisonnement.

Notre lecture

La faille en elle-même se corrige avec un patch, ça va vite. Ce qui m'inquiète plus, c'est ce que ça révèle en creux : les résumés de raisonnement que tu vois dans ChatGPT ou Claude ne sont pas le vrai raisonnement, juste une version retouchée pour l'utilisateur. Selon Le Fil IA, la transparence affichée par les modèles de raisonnement tient plus de la mise en scène que du compte-rendu fidèle, et ça complique sérieusement l'idée d'auditer ces outils depuis l'extérieur.

À lire ensuite

01Le code source de Claude a été divulgué par erreur, que s’est-il passé ?4501netSécurité 02Comment voler une trace de raisonnement50Latent SpaceSécurité 03L'obsession de ChatGPT pour les gobelins est amusante, mais révèle un problème profond dans l'entraînement des IA40The DecoderSécurité 
Dossier · OpenAISuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.