Français · 8 min de lecture
GLM-5.3 : le même modèle de base, un bien meilleur codeur — et un résultat cyber que personne n'avait prévu
Z.ai a livré GLM-5.3 le 14 août 2026. Tous les gains viennent du post-entraînement, pas d'un modèle plus gros. Terminal-Bench 3.0 passe de 4.6 à 28.3. Voici ce qui est réel, ce que ça coûte, et la migration qui va casser vos appels d'API.
La réponse courte : GLM-5.3, c'est le modèle de base de GLM-5.2 avec un mois de post-entraînement supplémentaire par-dessus — et c'est un bond important en codage agentique. Il est disponible dès maintenant sur le GLM Coding Plan et l'API. Les poids sont promis sous deux semaines. Si votre code envoie thinking.type: "disabled", vos requêtes échoueront sur GLM-5.3 — cette migration est la seule chose urgente de ce lancement.
Vérifié le 14 août 2026 contre le billet de lancement de Z.ai, "GLM-5.3: Frontier Coding with Emergent Cyber Capabilities", y compris son tableau de benchmarks et ses notes de méthodologie. Tous les chiffres ci-dessous sont les mesures auto-déclarées de Z.ai, sauf mention contraire. Il n'existe encore aucune évaluation indépendante de GLM-5.3, il n'est donc pas dans notre instantané LiveBench — le benchmark d'un labo sur lui-même est une affirmation, pas un score tiers.
Ce qui a vraiment été livré
Le même modèle de base. C'est le point que la plupart des articles vont manquer. Z.ai indique clairement que GLM-5.3 « utilise le même modèle de base que GLM-5.2 — tous les gains viennent du post-entraînement ». Pas de modèle plus gros, pas de nouveau pré-entraînement. Les gains viennent du passage à l'échelle de l'apprentissage par renforcement sur des environnements de tâches à long horizon.
C'est un résultat réellement intéressant, et c'est aussi pourquoi les améliorations sont déséquilibrées : elles sont énormes là où le travail agentique à long horizon est mesuré, et modestes ailleurs.
Une API en production, identifiant de modèle glm-5.3, déployée pour tous les abonnés du GLM Coding Plan.
Des poids ouverts sous deux semaines, une fois « l'évaluation de sécurité et le durcissement terminés ». Un engagement borné dans le temps, pas un verrou indéfini.
Les sauts de benchmark qui comptent
Les chiffres auto-déclarés de Z.ai, GLM-5.3 contre GLM-5.2 :
| Benchmark | GLM-5.3 | GLM-5.2 |
|---|---|---|
| Terminal-Bench 3.0 | 28.3 | 4.6 |
| SWE-Marathon v1.1 | 42.5 | 19.4 |
| ExploitBench | 54.4 | 24.4 |
| AutomationBench v1.0.6 | 48.2 | 26.2 |
| DeepSWE v1.1 | 66.9 | 46.2 |
| Toolathlon Verified | 73.0 | 59.9 |
| FrontierSWE | 78.1 | 67.5 |
| CyberGym | 84.5 | 77.2 |
| Terminal-Bench 2.1 | 88.2 | 81.0 |
Terminal-Bench 3.0 qui passe de 4.6 à 28.3 est le signal le plus clair : sur les tâches agentiques à long horizon les plus difficiles, GLM-5.2 échouait pour ainsi dire, et GLM-5.3 non.
Notez la forme de la chose. Terminal-Bench 2.1 est passé de 81.0 à 88.2, un incrément normal. Terminal-Bench 3.0 est passé de 4.6 à 28.3, un facteur 6. Plus la tâche est difficile et longue, plus le gain est important — exactement ce à quoi on s'attend si l'amélioration vient du RL à long horizon plutôt que de la capacité brute.
Là où il perd encore. Sur Terminal-Bench 3.0, le tableau de Z.ai lui-même place GPT-5.6 Sol à 34.6 et Fable 5 à 33.7, tous deux devant les 28.3 de GLM-5.3. Sur son Z.ai Code Bench interne, GLM-5.3 atteint 34.5 % à l'effort Max contre 39.5 % pour Claude Fable 5. Z.ai le dit directement, ce qui mérite d'être porté à son crédit.
Le résultat d'efficacité en tokens est l'histoire business
Enfoui sous le tableau de benchmarks se trouve le chiffre qui affecte réellement une facture.
Sur Z.ai Code Bench à l'effort Max, GLM-5.3 atteint 34.5 % en utilisant environ 75K tokens de sortie par tâche — contre 23.4 % à 96K pour GLM-5.2. De meilleurs résultats, moins de tokens.
Face à un modèle fermé : à l'effort High, GLM-5.3 atteint 31.4 % avec environ 50K tokens de sortie, contre Claude Opus 4.8 à 29.5 % avec 120K. Score légèrement meilleur, environ 2,4 fois moins de tokens de sortie.
Pour quiconque fait tourner des agents de code à volume, les tokens de sortie sont la facture. Un modèle qui obtient le même score pour une fraction des tokens est une histoire de coût, pas une histoire de classement.
Le résultat cyber, et pourquoi il est à double tranchant
Z.ai a ajouté des données de découverte de vulnérabilités à son mélange d'entraînement en s'attendant à des gains modestes, et se dit surpris : GLM-5.3 s'est mis à raisonner sur des chaînes d'exploitation complètes, et pas seulement à repérer des failles isolées. Sur ExploitGym, il complète 105 tâches en deux heures et 130 en six, contre 29 et 39 pour GLM-5.2.
Exécuté contre de vraies bases de code avec des équipes de sécurité chinoises, le modèle a fait apparaître 2 436 vulnérabilités dans 269 projets open source — 107 critiques et 990 élevées. La faille moyenne avait survécu 26,6 ans sans être découverte ; la plus ancienne datait de 1981. Z.ai a publié un Security Disclosure Ledger qui les suit, avec 53 divulguées et 2 383 encore sous embargo.
Deux réserves honnêtes. D'abord, les comparaisons de Z.ai lui-même le montrent nettement derrière la frontière fermée sur ce terrain — la page cite des concurrents à 181 et 247 tâches ExploitGym contre 105 et 130 pour GLM-5.3. Le résumé que Z.ai fait de son propre écart est franc : la capacité progresse le plus vite exactement là où il est le plus en retard.
Ensuite, un modèle open weights capable de découvrir des vulnérabilités est à double usage par construction. Le délai de deux semaines sur les poids, pour « évaluation de sécurité et durcissement », porte vraisemblablement précisément là-dessus.
(Une incohérence d'étiquetage à signaler : le texte de Z.ai parle de « Mythos 5 » pour les comparaisons cyber alors que la colonne de son propre tableau est intitulée « Fable 5 ». Nous avons cité les chiffres propres à GLM-5.3 plutôt que de deviner de quel concurrent il s'agit.)
La migration qui va casser vos appels
GLM-5.3 prend en charge trois niveaux d'effort de réflexion — low, high, max. Désactiver la réflexion n'est plus pris en charge.
Si votre application envoie actuellement thinking.type: "disabled", passez-la à enabled et réglez reasoning_effort sur low avant de basculer l'identifiant de modèle vers glm-5.3. Sinon la requête échoue. Z.ai recommande max pour les tâches de code.
C'est le seul élément du lancement assorti d'une échéance.
Ce que ça coûte
Z.ai n'a pas publié de tarif au token. Le GLM Coding Plan est passé à un système de quota par points, avec des points comptés séparément pour les tokens d'entrée, d'entrée en cache et de sortie.
Le détail tarifaire le plus important : les appels hors heures de pointe consomment 50 % des points standard. La pointe, c'est 14h00–18h00 UTC+8, du lundi au vendredi. Tout le reste — y compris tout le week-end — est à moitié prix.
Si vous faites du traitement par lots, c'est une décision de planification à prendre délibérément. La nuit en Europe ou sur le continent américain, c'est en dehors des heures de pointe en UTC+8.
Via ZCode, Z.ai annonce aussi un taux de succès de cache de 98 %+ sur du contexte répété et un bonus de quota temporaire de 1,5× jusqu'au 31 août.
Quoi faire cette semaine
Si vous êtes sur un GLM Coding Plan. GLM-5.3 vous a déjà été déployé. Vérifiez d'abord votre code pour thinking.type: "disabled", puis essayez-le — le gain d'efficacité en tokens est ce qu'il faut mesurer, pas le chiffre de benchmark.
Si vous auto-hébergez GLM-5.2. Attendez deux semaines pour les poids. Il n'y a encore rien à télécharger.
Si vous utilisez un harnais de code. GLM-5.3 fonctionne dans ZCode, Claude Code, OpenCode et d'autres — vous n'êtes pas enfermé dans le client de Z.ai.
Si vous compariez GLM à Claude ou GPT. GLM-5.3 réduit sensiblement l'écart sur le codage agentique et gagne nettement sur le rapport tokens/résultat. Il ne prend pas la première place dans le propre tableau de Z.ai. Décidez sur le coût par résultat, pas sur le classement.
Les réserves honnêtes
Ce sont les chiffres du labo lui-même. Chaque mesure ici est auto-déclarée. Z.ai documente sa méthodologie de façon inhabituellement complète — versions de harnais, températures, longueurs de contexte, délais, mesures anti-triche — ce qui est plus que ce que publient la plupart des labos, et ça reste une évaluation non indépendante. GLM-5.3 figure dans notre suivi des modèles avec ses chiffres étiquetés comme étant ceux de Z.ai, et il n'entrera pas dans notre page de benchmarks tant qu'un tiers ne l'aura pas évalué.
Plusieurs benchmarks sont internes. Z.ai Code Bench est privé et non auditable par conception. Son argument sur la contamination est raisonnable ; il n'empêche que c'est Z.ai qui note Z.ai.
Les « poids ouverts » n'existent pas encore. Deux semaines, c'est une intention déclarée. GLM-5.2 avait livré ses poids dès le premier jour ; ce n'est pas le cas ici.
Données et juridiction. Inchangé : sachez où vont vos tokens avant de faire passer des données clients par un endpoint hébergé.
Le geste de la semaine
Faites le contrôle de migration. Mesurez les tokens de sortie, pas les scores. Si vous traitez par lots, déplacez le travail hors des heures de pointe et prenez les 50 %.
Si vous voulez que le partage « quel modèle pour quel travail » soit tranché face à votre flux de travail et à votre facture réels, un Business AI Plan (99 $ une fois, 29 $/mois en option pour le maintenir à jour) fait exactement cela. Le chercheur de plan IA gratuit en 2 minutes est le premier passage rapide.
Sources : Z.ai — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, documentation développeur Z.ai, ZCode. Consulté le 14 août 2026.