Aller au contenu principal
Sécurité · Opinion ·

Lecture des résultats de GLM-5.3 de Zhipu au-delà du chiffre affiché en titre

Le laboratoire chinois Zhipu, également connu sous le nom de Z.ai, a publié le 14 août 2026 son nouveau modèle GLM-5.3, spécialisé dans la programmation, accompagné d'une note technique détaillant ses performances face aux modèles américains concurrents. Le chiffre qui a retenu l'attention concerne la cybersécurité : GLM-5.3 obtient 84,5% sur le benchmark CyberGym, dédié à la détection de vulnérabilités logicielles, contre 83,8% pour Mythos 5 d'Anthropic et 83,6% pour GPT-5.6 Sol d'OpenAI. Mais la note de Zhipu elle-même relativise cette avance en publiant deux autres résultats bien moins favorables. Sur ExploitBench, qui teste le raisonnement sur l'exploitation réelle d'une faille, GLM-5.3 atteint 54,4% (contre 24,4% pour son prédécesseur), loin derrière Mythos 5 (78,0%) et GPT-5.6 Sol (76,5%). Sur ExploitGym, qui mesure le nombre de tâches d'exploitation accomplies en temps limité, GLM-5.3 en réalise 105 en deux heures et 130 en six heures, contre 181 et 247 pour Mythos 5.

2 min de lecturePertinence 54
Source

Résumé et traduction réalisés par Le Fil IA à partir de AI News. Lire l'article original →

Cet écart entre le chiffre qui a circulé et le tableau complet a une portée concrète. Un modèle capable de repérer des failles dans un code est autant utile à une équipe qui audite son propre logiciel qu'à un attaquant cherchant à en exploiter un autre. Anthropic garde d'ailleurs ses résultats équivalents derrière un accès restreint, tandis que Zhipu prévoit de publier les poids de GLM-5.3 en accès libre, ce qui change la nature du risque associé à la diffusion de ces capacités. Zhipu reconnaît elle-même, dans sa propre note, que ses performances se dégradent à mesure que la tâche se rapproche de l'exploitation effective d'une vulnérabilité plutôt que de sa simple détection, une nuance largement absente de la couverture médiatique initiale.

Le contexte éclaire aussi une confusion supplémentaire dans les comparaisons publiées par Zhipu, qui mesure GLM-5.3 face à trois modèles Anthropic différents selon les tableaux : Opus 4.8 pour le tableau principal, Fable 5 pour les graphiques de performance, et Mythos 5 pour la section cybersécurité. Sur le codage en général, Zhipu admet que son modèle reste derrière Claude Fable 5 sur son propre benchmark interne. Autre détail méthodologique notable : les tests de GLM-5.3, un modèle chinois à poids ouverts, ont été réalisés via Claude Code 2.1.207, l'agent de codage d'Anthropic, choisi comme environnement commun pour garantir une comparaison équitable entre les modèles. Cet épisode illustre la manière dont un chiffre isolé peut prendre le pas sur une analyse plus nuancée dans la course entre laboratoires chinois et américains sur l'intelligence artificielle appliquée à la cybersécurité.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Avec le modèle GLM-5.2, la Chine pourrait rebattre les cartes de la cybersécurité53Next INpactSécurité 02Microsoft affirme battre tout le monde en détection de failles avec MAI-Cyber-1-Flash38Next INpactSécurité 03GPT-5.5 aussi redoutable que Mythos en matière de hacking ? Les tests inquiètent55Le Big DataSécurité 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.