Aller au contenu principal
LLMs · Actu ·

GLM-5.3 arrive avec des capacités cyber avancées, et aurait déjà découvert une "vulnérabilité sérieuse" dans Cursor

La startup chinoise Z.ai, connue pour sa série de modèles de langage ouverts GLM, a dévoilé GLM-5.3, une nouvelle version marquée par des progrès notables en programmation sur des tâches longues et par un bond important de ses capacités en cybersécurité. Selon Lou, développeur chez Z.ai, cité sur X, GLM-5.3 aurait déjà identifié une "vulnérabilité potentiellement sérieuse" dans Cursor, l'éditeur de code assisté par IA récemment racheté par SpaceX. VentureBeat a sollicité Cursor pour confirmation et attendait toujours une réponse au moment de la publication. Le modèle repose sur la même base que GLM-5.2, d'environ 743 milliards de paramètres, les gains provenant uniquement d'un renforcement massif du post-entraînement, via davantage d'environnements, de tâches variées et de calcul consacré à l'apprentissage par renforcement. Sur Terminal-Bench 3.0, le score grimpe de 4,6 à 28,3 ; sur DeepSWE v1.1, de 46,2 à 66,9 ; sur AutomationBench, de 26,2 à 48,2 ; et sur Agents' Last Exam CLI, de 23,8 à 28,5. GLM-5.3 reste toutefois en retrait face à certains rivaux, avec GPT-5.6 Sol à 34,6 et Claude Fable 5 à 33,7 sur Terminal-Bench 3.0. Le modèle n'est pour l'instant accessible que via le GLM Coding Plan et l'environnement ZCode de Z.ai ; l'accès par API et la publication des poids sont prévus environ deux semaines après le lancement, une fois les évaluations de sécurité achevées.

3 min de lecturePertinence 56
Source

Résumé et traduction réalisés par Le Fil IA à partir de VentureBeat AI. Lire l'article original →

Cette progression rapide des capacités offensives soulève une question inédite pour un éditeur de modèles ouverts. D'après Z.ai, les compétences en cybersécurité de GLM-5.3 ont augmenté plus vite que prévu à mesure que l'entraînement montait en puissance, notamment pour construire des chaînes d'exploitation complètes de vulnérabilités, et pas seulement les identifier. Reuters a rapporté vendredi 14 août que Z.ai met en place des garde-fous, dont un mécanisme d'"accès de confiance" pour restreindre les fonctionnalités les plus sensibles. Pour les entreprises qui déploient des agents de codage, l'enjeu dépasse le simple classement dans les benchmarks : sur le Z.ai Code Bench, une évaluation interne, GLM-5.3 atteint 34,5% de réussite en mode Max tout en consommant environ 75 000 jetons de sortie par tâche, contre 23,4% pour GLM-5.2 avec près de 96 000 jetons. En mode High, GLM-5.3 obtient 31,4% pour environ 50 000 jetons, un résultat que Z.ai compare aux 29,5% revendiqués pour Claude Opus 4.8, qui consommerait 120 000 jetons pour une tâche équivalente. Une meilleure efficacité en jetons réduit directement les coûts d'inférence pour les entreprises qui font tourner ces agents à grande échelle, mais ces chiffres proviennent d'une évaluation propriétaire de Z.ai et doivent être traités comme des résultats communiqués par l'entreprise plutôt que comme des mesures indépendantes.

GLM-5.3 illustre une tendance plus large : plutôt que de relancer un cycle de pré-entraînement coûteux, Z.ai a choisi d'intensifier le post-entraînement autour d'environnements qui reproduisent des missions d'ingénierie complètes, avec accès à des bases de code, de la documentation, des clusters de calcul et des systèmes de stockage, certaines tâches étant conçues pour approcher plusieurs jours de travail d'un ingénieur expérimenté. Ce pari, sans changer de modèle de base, teste les limites de ce qu'une architecture existante peut encore livrer par le seul entraînement post-hoc. La montée en puissance simultanée des capacités offensives relance le débat sur les risques liés à la diffusion de modèles ouverts puissants : Z.ai doit concilier sa stratégie d'ouverture, qui a forgé sa réputation face à des acteurs comme OpenAI ou Anthropic, avec la nécessité d'encadrer l'accès à des fonctions capables de repérer et d'exploiter des failles logicielles réelles. La réaction de Cursor, encore attendue, et l'attitude des régulateurs face à la publication prochaine des poids du modèle figurent parmi les éléments à suivre dans les prochaines semaines.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01Z.ai lance GLM-5.3 : le nouveau choc IA qui bouscule le codage… et la cybersécurité55Le Big DataLLMs 02SpaceX progresse dans l'IA, avec un coup de main de Cursor48The Information AILLMs 03Grok 4.5 de SpaceXAI, entraîné par Cursor pour le code et les tâches à base d'agents, arrive à 2$/M tokens22MarkTechPostLLMs 
Dossier · CursorSuivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.