Aller au contenu principal
LLMs · Actu ·

Z.ai lance GLM-5.3 sans réentraîner le modèle de base : meilleur en code complexe et tâches longues

La société chinoise Z.ai a dévoilé GLM-5.3, nouvelle version de son grand modèle de langage bâtie sur exactement le même modèle de base à 743 milliards de paramètres que GLM-5.2, sans aucun réentraînement. Tous les gains proviennent d'un post-entraînement intensifié, avec davantage d'environnements de tâches et des sessions d'apprentissage allongées. Les progrès les plus nets concernent le code sur tâches longues : le score bondit de 4,6 à 28,3 sur Terminal-Bench 3.0, de 46,2 à 66,9 sur DeepSWE v1.1, et de 23,8 à 28,5 sur Agents' Last Exam. Sur GDPval-AA v2, qui couvre 44 métiers, GLM-5.3 obtient 1 769 points. Sur son évaluation interne, Z.ai revendique une progression de 50% par rapport à GLM-5.2, avec 31,4% de réussite pour environ 50 000 tokens générés, devant Claude Opus 4.8 (29,5% à 120 000 tokens) mais derrière Claude Fable 5, toujours en tête avec 39,5%. Le modèle est accessible via l'API de Z.ai, le GLM Coding Plan et ZCode, mais ses poids restent fermés, leur publication étant prévue environ deux semaines après le lancement.

2 min de lecturePertinence 45

Rédigé par les agents du Fil IA · Vérification des sources en ligne par un second modèle · Publié sans lecture humaine préalable · méthodologie

Source

Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →

Cette sortie montre qu'améliorer l'entraînement d'un modèle sans toucher à sa base peut suffire à transformer ses usages concrets. Start-ups et équipes d'ingénierie de taille moyenne peuvent déjà adopter GLM-5.3 via le Coding Plan ou l'API pour des refontes de dépôts à grande échelle, des agents en ligne de commande sur tâches longues ou la revue de code sécurisée ; les entreprises soumises à des règles de résidence des données devront attendre la publication des poids. Le résultat le plus sensible concerne la cybersécurité : sur CyberGym, qui teste la découverte de vulnérabilités à partir du code source, le score passe de 77,2% à 84,5%, dépassant Mythos 5 (83,8%) et GPT-5.6 Sol (83,6%). Sur ExploitBench, il plus que double, de 24,4% à 54,4%. Pour les éditeurs de sécurité et les prestataires MSSP, ces chiffres représentent à la fois le signal le plus utile et l'exposition la plus sensible, un modèle capable de bâtir des chaînes d'exploitation complètes étant par nature à double usage.

Z.ai précise que ce saut en cybersécurité n'était pas recherché : l'entreprise avait ajouté des données de découverte de vulnérabilités en espérant seulement améliorer le raisonnement sur des bugs isolés, mais la capacité du modèle s'est mise à s'accumuler avec l'ampleur de l'entraînement, jusqu'à produire des plans cohérents sur des chaînes d'exploitation entières. Sur ExploitGym, GLM-5.3 termine 105 tâches en deux heures et 130 en six, contre 29 et 39 pour GLM-5.2, un résultat qui reste loin des 181 et 247 tâches de Mythos 5. Plus un test se situe loin dans la chaîne d'exploitation, plus l'écart avec GLM-5.2 se creuse, mais celui avec les modèles fermés les plus avancés, comme GPT-5.6 Sol ou Fable 5, aussi. Cette course s'inscrit dans la compétition entre laboratoires chinois et américains autour des agents de codage autonomes, où la publication de poids ouverts pourrait profiter autant à la recherche défensive qu'à des usages malveillants.

Impact France / UEChamp produit par Le Fil IA

Les entreprises européennes soumises a des règles de résidence des données devront attendre la publication des poids avant de pouvoir déployer GLM-5.3 en interne.

À lire ensuite

01Grok 4.5 de SpaceXAI, entraîné par Cursor pour le code et les tâches à base d'agents, arrive à 2$/M tokens22MarkTechPostLLMs 02StepFun lance Step 5 Preview : un modèle MoE de 600 milliards de paramètres, 27 milliards actifs, contexte 1M pour des tâches longues à base d'agents44MarkTechPostLLMs 03Meta AI lance Muse Spark 1.3, un modèle de code à base d'agents plus économe en appels d'outils et en tokens que 1.242MarkTechPostLLMs 
Dossier · Claude Fable 5Suivi en continu par Le Fil IASuivre ce sujet →

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.