OpenAI dit avoir stoppé une campagne de vol du raisonnement de ses modèles, mais la technique fonctionnait encore sur Azure
OpenAI affirme avoir mis fin à une campagne coordonnée dans laquelle plus de 15 000 comptes ont tenté de copier le raisonnement caché de ses modèles. L'entreprise relie une partie de cette activité à des personnes liées à Moonshot AI, la société chinoise à l'origine des modèles Kimi. Le procédé consiste à interroger massivement un modèle pour lui faire révéler, ou pour reconstituer, les étapes intermédiaires de sa réflexion, que le fournisseur choisit de ne pas exposer. Ces traces peuvent ensuite servir de données d'entraînement pour doter un modèle concurrent de capacités comparables. Des chercheurs ont toutefois constaté que la même attaque a continué de fonctionner pendant des semaines sur Microsoft Azure, y compris contre le nouveau GPT-6 Astra.
Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie
Résumé et traduction réalisés par Le Fil IA à partir de The Decoder. Lire l'article original →
Cet écart montre que les mesures de détection et de blocage déployées par OpenAI ne semblent pas s'étendre aux plateformes cloud qui revendent aussi ses modèles. Pour les entreprises qui développent des modèles de pointe, la protection de leur propriété intellectuelle dépend donc du maillon le plus faible de la chaîne de distribution. Un acteur qui se voit fermer l'accès sur l'API d'origine peut se tourner vers un revendeur dont la surveillance est moins stricte. Pour les clients d'Azure, la question de la responsabilité se pose aussi, car la protection contre ce type d'extraction relève à la fois de l'éditeur du modèle et de l'hébergeur.
Cet épisode s'inscrit dans la montée des accusations de « distillation » entre laboratoires américains et chinois, qui reprochent à leurs rivaux d'exploiter les sorties de leurs modèles pour accélérer leur propre développement à moindre coût. Les laboratoires américains masquent désormais le raisonnement détaillé de leurs modèles pour limiter ces pratiques, mais cette dissimulation n'est efficace que si elle est appliquée partout. Une coordination plus étroite entre OpenAI et Microsoft, ainsi que des règles de surveillance communes sur les canaux de revente, semblent désormais nécessaires.
Les clients européens d'Azure utilisant les modèles d'OpenAI sont concernés par la question du partage de responsabilité entre éditeur et hébergeur face à l'extraction de raisonnement.