Z.ai lance GLM-5.3 sans réentraîner le modèle de base : meilleur en code complexe et tâches longues
La société chinoise Z.ai a dévoilé GLM-5.3, nouvelle version de son grand modèle de langage bâtie sur exactement le même modèle de base à 743 milliards de paramètres que GLM-5.2, sans aucun réentraînement. Tous les gains proviennent d'un post-entraînement intensifié, avec davantage d'environnements de tâches et des sessions d'apprentissage allongées. Les progrès les plus nets concernent le code sur tâches longues : le score bondit de 4,6 à 28,3 sur Terminal-Bench 3.0, de 46,2 à 66,9 sur DeepSWE v1.1, et de 23,8 à 28,5 sur Agents' Last Exam. Sur GDPval-AA v2, qui couvre 44 métiers, GLM-5.3 obtient 1 769 points. Sur son évaluation interne, Z.ai revendique une progression de 50% par rapport à GLM-5.2, avec 31,4% de réussite pour environ 50 000 tokens générés, devant Claude Opus 4.8 (29,5% à 120 000 tokens) mais derrière Claude Fable 5, toujours en tête avec 39,5%. Le modèle est accessible via l'API de Z.ai, le GLM Coding Plan et ZCode, mais ses poids restent fermés, leur publication étant prévue environ deux semaines après le lancement.
Résumé et traduction réalisés par Le Fil IA à partir de MarkTechPost. Lire l'article original →
Cette sortie montre qu'améliorer l'entraînement d'un modèle sans toucher à sa base peut suffire à transformer ses usages concrets. Start-ups et équipes d'ingénierie de taille moyenne peuvent déjà adopter GLM-5.3 via le Coding Plan ou l'API pour des refontes de dépôts à grande échelle, des agents en ligne de commande sur tâches longues ou la revue de code sécurisée ; les entreprises soumises à des règles de résidence des données devront attendre la publication des poids. Le résultat le plus sensible concerne la cybersécurité : sur CyberGym, qui teste la découverte de vulnérabilités à partir du code source, le score passe de 77,2% à 84,5%, dépassant Mythos 5 (83,8%) et GPT-5.6 Sol (83,6%). Sur ExploitBench, il plus que double, de 24,4% à 54,4%. Pour les éditeurs de sécurité et les prestataires MSSP, ces chiffres représentent à la fois le signal le plus utile et l'exposition la plus sensible, un modèle capable de bâtir des chaînes d'exploitation complètes étant par nature à double usage.
Z.ai précise que ce saut en cybersécurité n'était pas recherché : l'entreprise avait ajouté des données de découverte de vulnérabilités en espérant seulement améliorer le raisonnement sur des bugs isolés, mais la capacité du modèle s'est mise à s'accumuler avec l'ampleur de l'entraînement, jusqu'à produire des plans cohérents sur des chaînes d'exploitation entières. Sur ExploitGym, GLM-5.3 termine 105 tâches en deux heures et 130 en six, contre 29 et 39 pour GLM-5.2, un résultat qui reste loin des 181 et 247 tâches de Mythos 5. Plus un test se situe loin dans la chaîne d'exploitation, plus l'écart avec GLM-5.2 se creuse, mais celui avec les modèles fermés les plus avancés, comme GPT-5.6 Sol ou Fable 5, aussi. Cette course s'inscrit dans la compétition entre laboratoires chinois et américains autour des agents de codage autonomes, où la publication de poids ouverts pourrait profiter autant à la recherche défensive qu'à des usages malveillants.
Les entreprises europeennes soumises a des regles de residence des donnees devront attendre la publication des poids avant de pouvoir deployer GLM-5.3 en interne.