GLM-5.3 : Codage d'avant-garde et capacités cybernétiques émergentes

Le GLM-5.3 de Z.ai conserve le même modèle de base de 743B paramètres mais tire des gains massifs du post-training scaling seul. Terminal-Bench 3.0 bondit de 514%, et des capacités cyber émergentes ont trouvé 2 436 vulnérabilités réelles.

GLM-5.3 : Codage d'avant-garde et capacités cybernétiques émergentes

GLM-5.3 : Codage de pointe avec capacités cyber émergentes

TL;DR : Le GLM-5.3 de Z.ai conserve le même modèle de base de 743B paramètres que le GLM-5.2, mais tire des gains massifs uniquement par la mise à l'échelle du post-entraînement. Terminal-Bench 3.0 passe de 4,6 à 28,3, DeepSWE de 46,2 à 66,9. La surprise : les capacités de cybersécurité sont apparues plus rapidement que prévu, le modèle raisonnant sur des chaînes d'exploitation complètes plutôt que de simplement trouver des bugs isolés. Z.ai a déjà identifié 2 436 vulnérabilités réelles dans 269 projets — dont une dans Cursor. Les poids seront publiés dans ~2 semaines après durcissement de sécurité.

Z.ai a publié GLM-5.3 le 14 août 2026, et il pourrait s'agir de la publication de modèle la plus intéressante de l'année — non pas parce qu'elle domine tous les classements, mais pour ce qu'elle révèle sur la capacité d'exploiter un modèle de base sans réentraînement.

Le modèle utilise exactement la même fondation de 743 milliards de paramètres que GLM-5.2. Chaque amélioration provient de la mise à l'échelle du post-entraînement : plus d'environnements, des tâches plus diversifiées, plus de calcul de renforcement par apprentissage. Pas de nouvelle architecture, pas de cycle de pré-entraînement frais.

Les résultats sont substantiels. Mais ils ont aussi produit quelque chose que Z.ai n'avait pas pleinement anticipé : des capacités cyber qui se sont développées plus rapidement que l'entreprise ne l'avait prévu, passant de la simple identification de vulnérabilités à la construction de chaînes d'exploitation complètes.


Même base, modèle différent

La revendication centrale de GLM-5.3 est que le post-entraînement seul — pas une nouvelle fondation pré-entraînée — a produit chaque gain rapporté. L'annonce de Z.ai le dit clairement : « Scaling post-training is all we did for GLM-5.3. »

Les environnements d'entraînement ressemblent à des postes d'ingénierie complets plutôt qu'à des exercices de codage isolés. Dans un exemple donné par Z.ai, un modèle est placé dans l'environnement de travail d'un ingénieur en infrastructure ML avec accès à des clusters de calcul, de la documentation, des bases de code et des résultats d'expériences. Il doit diagnostiquer les goulots d'étranglement, implémenter des optimisations et livrer une accélération mesurable de bout en bout. Certaines tâches représentent plusieurs jours de travail pour un ingénieur expérimenté.

Pour générer ces environnements à grande échelle, Z.ai a construit des pipelines où des agents de recherche convertissent des modèles de tâches issus du travail réel en environnements longs-horizon exécutables. Un agent juge vérifie que chaque tâche est résolvable, et les vérificateurs sont synthétisés sans accès aux solutions de référence.

La pile d'entraînement elle-même a été introduite avec GLM-5.2 :

  • IndexShare — une technique de contexte long qui réutilise un indexeur à travers les couches d'attention éparse pour réduire la charge de calcul
  • SAO — une méthode d'apprentissage par renforcement conçue pour les tâches à long horizon
  • slime — un framework open-source pour le RL asynchrone à grande échelle

GLM-5.3 s'est contenté de lancer plus de calcul et des environnements plus diversifiés sur cette même pile.


Benchmarks de codage : bonds importants sur les tâches à long horizon

Le modèle à travers les benchmarks de codage est cohérent : les gains les plus importants se situent sur les évaluations à plus long horizon. Voici comment GLM-5.3 se compare à son prédécesseur :

BenchmarkGLM-5.2GLM-5.3Changement
Terminal-Bench 3.04,628,3+514 %
DeepSWE v1.146,266,9+45 %
AutomationBench26,248,2+84 %
Agents' Last Exam (CLI)23,828,5+20 %
Z.ai Code Bench (Max)23,4 %34,5 %+47 %

Terminal-Bench 3.0 évalue les modèles sur l'exécution réelle en terminal, l'interaction en sandbox et la récupération d'environnement avec état — une métrique haute fidélité pour la préparation au codage en monde réel. Le bond de 4,6 à 28,3 est l'amélioration la plus dramatique sur une seule génération sur ce benchmark.

DeepSWE v1.1 teste l'ingénierie logicielle approfondie : refactoring d'architecture, correction de bugs complexes dans des systèmes distribués et évaluation de vulnérabilités multilingues. Un bond de 20 points signifie que le modèle peut gérer des tâches d'ingénierie multi-fichiers substantiellement plus complexes.

Comparaison avec d'autres modèles de pointe

GLM-5.3 ne domine pas chaque benchmark. Le tableau comparatif de Z.ai montre où il se situe :

BenchmarkGLM-5.3GPT-5.6 SolClaude Fable 5Claude Opus 4.8
Terminal-Bench 3.028,334,633,7
DeepSWE v1.166,972,769,7
CyberGym84,5 %83,6 %
ExploitBench54,4 %76,5 %78,0 %
Z.ai Code Bench34,5 %39,5 %29,5 %

Le tableau est contrasté. Sur Terminal-Bench et DeepSWE, GLM-5.3 est derrière GPT-5.6 Sol et Claude Fable 5. Mais sur CyberGym, il surpasse chaque modèle de l'ensemble de comparaison. Et sur Z.ai Code Bench, il égale la qualité de Claude Opus 4.8 tout en consommant environ 50 000 tokens de sortie contre 120 000 — un gain d'efficacité significatif pour les agents de codage en production.

L'efficacité des tokens compte en production

Sur le Code Bench privé de Z.ai, l'histoire d'efficacité est notable :

  • GLM-5.3 à effort Max : 34,5 % d'achèvement, ~75 000 tokens de sortie par tâche
  • GLM-5.2 à effort Max : 23,4 % d'achèvement, ~96 000 tokens de sortie par tâche
  • Claude Opus 4.8 : 29,5 % d'achèvement, ~120 000 tokens de sortie par tâche
  • Claude Fable 5 : 39,5 % d'achèvement (toujours en tête, mais à effort maximum)

Pour les entreprises déploiant des agents de codage, réduire la consommation de tokens tout en améliorant l'achèvement des tâches est opérationnellement critique. Les boucles d'agents longues composent rapidement les coûts d'inférence et de latence.


Le résultat cyber que Z.ai n'avait pas prévu

C'est ici que l'histoire devient inhabituelle.

Z.ai a introduit des environnements de découverte de vulnérabilités dans le mix de post-entraînement de GLM-5.3 en s'attendant à ce que le modèle s'améliore pour trouver des défauts logiciels. Au lieu de cela, la capacité a commencé à progresser plus loin dans la chaîne d'exploitation. Le modèle a commencé à raisonner sur plusieurs étapes d'exploitation, formant des plans cohérents pour des chaînes d'exploitation complètes plutôt que de simplement trouver des bugs isolés.

Comme Z.ai l'a écrit dans son annonce : « As we scaled post-training, cyber capability developed faster than we expected. »

Résultats des benchmarks cyber

BenchmarkCe qu'il testeGLM-5.2GLM-5.3Leader
CyberGymDécouverte et validation de vulnérabilités à partir du code source77,2 %84,5 %GLM-5.3 en tête
ExploitBenchRaisonnement sur chaîne d'exploitation complète24,4 %54,4 %Mythos 5 (78,0 %)
ExploitGym (2h)Tâches d'exploitation complétées en 2 heures29105GPT-5.6 Sol (216)
ExploitGym (6h)Tâches d'exploitation complétées en 6 heures39130GPT-5.6 Sol (293)

Le modèle est cohérent : plus on monte dans la chaîne d'exploitation, plus le gain par rapport à GLM-5.2 est important — mais aussi plus l'écart reste large avec les modèles fermés de pointe comme Mythos 5 et GPT-5.6 Sol.

CyberGym est le seul benchmark où GLM-5.3 a effectivement pris la tête. À 84,5 %, il surpasse Mythos 5 (83,8 %) et GPT-5.6 Sol (83,6 %) en découverte et validation de vulnérabilités à partir de code source en boîte blanche.

Sur ExploitBench, qui nécessite un raisonnement plus approfondi sur la façon dont une vulnérabilité réelle pourrait être exploitée, GLM-5.3 plus que double le score de son prédécesseur — mais reste encore loin derrière la frontière fermée.

Découvertes de vulnérabilités dans le monde réel

Les capacités cyber ne sont pas seulement académiques. Z.ai exécute des modèles GLM contre des bases de code réelles avec des équipes de sécurité en Chine depuis GLM-5.2. Les résultats :

  • 2 436 vulnérabilités identifiées dans 269 projets open-source
  • 1 097 classées critiques ou de haute gravité
  • 53 publiquement divulguées avec CVEs assignés
  • 2 383 encore sous embargo au moment du lancement

Les découvertes couvrent les noyaux système, les systèmes d'exploitation, les moteurs de navigateur et les protocoles réseau. Le plus ancien bug découvert a été introduit en 1981 — plus de quatre décennies.

Z.ai maintient un Registre public de divulgation de sécurité suivant chaque problème dans le processus de divulgation coordonnée. Les entrées récentes incluent :

  • Un use-after-free dans le noyau Linux
  • Une faille de gestion mémoire WebKit affectant Apple Safari
  • Un bug de validation de paramètres dans FreeBSD

La vulnérabilité de Cursor

Les capacités cyber de GLM-5.3 ont déjà, selon des rapports, trouvé une « vulnérabilité potentiellement sérieuse dans Cursor », la startup de codage IA récemment acquise par SpaceX. La découverte a été partagée par l'avocat développeur de Z.ai, Lou, sur X. VentureBeat a étiqueté Cursor pour confirmation et attendait une réponse au moment de la publication.

C'est un exemple concret de la tension à double usage : les mêmes capacités d'agents à long horizon qui rendent GLM-5.3 meilleur en ingénierie logicielle le rendent aussi un chercheur en sécurité plus capable — et potentiellement un opérateur offensif plus capable.


La tension du double usage

La position de Z.ai est remarquable. L'entreprise a été un défenseur agressif des poids ouverts — GLM-5.2 a été publié sous licence MIT avec des poids ouverts dès le premier jour. Mais les capacités cyber de GLM-5.3 ont forcé un changement d'approche.

Les poids ne sont pas encore publics. Z.ai dit qu'ils seront publiés environ deux semaines après le lancement, une fois l'évaluation de sécurité et le durcissement terminés. L'entreprise introduit également une approche « d'accès de confiance » pour les fonctionnalités sensibles.

Cela crée une tension avec laquelle les laboratoires de pointe sont de plus en plus familiers. Les mêmes capacités qui permettent à GLM-5.3 de corriger automatiquement les vulnérabilités de sécurité pour les défenseurs permettent aussi la génération automatisée d'exploits. Z.ai est maintenant confronté au même compromis capacité-contre-accès qu'OpenAI et Anthropic avec leurs modèles fermés.

Pour contexte : OpenAI a récemment décrit ses propres modèles de test brisant Hugging Face lors d'un exercice d'équipe rouge. L'accès à Mythos d'Anthropic reste limité aux partenaires vérifiés sous son initiative Glasswing. Et OpenAI a lancé un modèle dédié de cyber-défense, GPT-5.6-Cyber, via un programme élargi d'accès défenseur.

Le registre de divulgation de Z.ai est la contrepartie constructive de cette capacité : 1 097 découvertes critiques et de haute gravité traversent maintenant le processus de divulgation coordonnée.


Changement d'API cassant : Thinking ne peut pas être désactivé

Les développeurs migrant des applications GLM existantes doivent prêter attention à un changement cassant.

GLM-5.3 supporte trois niveaux d'effort de raisonnement — low, high et max — avec max par défaut et le paramètre recommandé par Z.ai pour le codage. Mais contrairement aux versions précédentes, thinking ne peut pas être désactivé.

Les applications envoyant actuellement thinking.type: "disabled" doivent changer la valeur en enabled et spécifier un effort de raisonnement avant de passer l'identifiant du modèle à GLM-5.3. Sinon, la requête échouera.

# Ancien appel GLM-5.2 (thinking désactivé)
response = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "Write a function"}],
    thinking={"type": "disabled"}
)

# Équivalent GLM-5.3 (thinking requis)
response = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "Write a function"}],
    thinking={"type": "enabled", "effort": "max"}
)

Cela fait de GLM-5.3 une véritable migration plutôt qu'une simple substitution de nom de modèle pour certaines applications en production.


De GLM-4.5 à 5.3 : une progression rapide

GLM-5.3 est la dernière étape du déplacement rapide de Z.ai vers les agents de codage et l'ingénierie autonome de longue durée. La progression mérite d'être comprise :

  • GLM-4.5 (juillet 2025) : Modèle MoE 355B, conçu pour combiner raisonnement, codage et capacités d'agent. Poids ouverts, intégration de framework d'agent.
  • GLM-4.6 (septembre 2025) : Contexte étendu de 128K à 200K tokens. Codage ciblé, utilisation d'outils et workflows d'agents dans Claude Code, Cline, Roo Code et Kilo Code.
  • GLM-5 (février 2026) : Passé à 744B paramètres (40B actifs), 28,5T tokens de pré-entraînement. Introduction de l'infrastructure RL asynchrone slime. Repositionné autour de l'« ingénierie agentic ».
  • GLM-5.2 (juin 2026) : 753B paramètres, contexte stable de 1M tokens, poids ouverts sous licence MIT. Introduction d'IndexShare et SAO. Prix à 1,40 $/M entrée, 4,40 $/M sortie tokens.
  • GLM-5.3 (août 2026) : Même base 743B que GLM-5.2. Tous les gains de la mise à l'échelle du post-entraînement. Capacités cyber émergentes. Publication échelonnée des poids avec durcissement de sécurité.

Chaque version s'est appuyée sur l'infrastructure de la précédente. GLM-5 a introduit la fondation mise à l'échelle et slime. GLM-5.2 a attaqué le contexte long et l'ingénierie à long horizon. GLM-5.3 extrait substantiellement plus de capacité de cette même fondation par le post-entraînement.


Tarification et disponibilité

GLM-5.3 est disponible dès maintenant via le GLM Coding Plan de Z.ai et l'environnement de codage ZCode. ZCode supporte les tâches « Goal » de longue durée qui planifient, implémentent, testent et vérifient le travail, avec contrôle à distance des tâches en cours. Disponible sur macOS, Windows et Linux.

Niveaux du GLM Coding Plan

PlanPrix (mensuel)Utilisation
Lite12,60 $ (promo)10 000 crédits/semaine
Pro56,00 $6× utilisation Lite
Max117,60 $14× utilisation Lite
Team Standard88 $/utilisateurNiveau entreprise
Team Premium188 $/utilisateurNiveau entreprise

Le Coding Plan utilise un système de quota basé sur des points qui compte séparément les tokens d'entrée, d'entrée en cache et de sortie. Les appels en dehors des heures de pointe en semaine consomment 50 % des points normaux — une réduction hors pointe qui récompense l'utilisation en dehors des heures ouvrables.

La tarification générale de l'API GLM-5.3 n'a pas encore été communiquée dans les matériaux de lancement. L'accès API échelonné et les poids ouverts devraient arriver environ deux semaines après le lancement.


Ce que cela signifie pour les développeurs

Pour les développeurs en entreprise et les équipes d'ingénierie, GLM-5.3 mérite l'attention pour plusieurs raisons :

  1. La mise à l'échelle du post-entraînement fonctionne. Les gains de GLM-5.2 à 5.3 — sans nouveau modèle de base — suggèrent qu'il reste une marge considérable dans les modèles de fondation existants. Cela a des implications sur la façon dont l'industrie pense aux cycles d'amélioration des modèles.
  2. L'efficacité des tokens s'améliore. GLM-5.3 obtient de meilleurs résultats avec moins de tokens de sortie que son prédécesseur. Pour les agents de codage en production où les boucles longues composent les coûts, c'est important opérationnellement.
  3. Les capacités cyber sont une fonctionnalité et un risque. Les mêmes capacités qui aident les équipes de sécurité à trouver et corriger les bugs créent aussi un potentiel offensif. L'approche de publication échelonnée de Z.ai reconnaît cette tension.
  4. Le paysage des poids ouverts se transforme. GLM-5.2 a été publié avec des poids ouverts dès le premier jour. GLM-5.3 retarde la publication des poids pour le durcissement de sécurité. Cela reflète un changement plus large de l'industrie vers des publications contrôlées pour les modèles capables.
  5. Les changements cassants nécessitent une planification de migration. Si vous utilisez GLM-5.2 en production avec thinking désactivé, vous devez mettre à jour vos appels API avant de passer à GLM-5.3.

La image globale

GLM-5.3 arrive dans une semaine compétitive. DeepSeek a sorti V4 Pro de l'aperçu quelques jours plus tôt. Le tableau comparatif de Z.ai positionne GLM-5.3 directement contre DeepSeek-V4 Pro, le Kimi K3 de Moonshot et le GPT-5.6 Sol d'OpenAI.

Le paysage chinois de l'IA a aussi évolué. Quand Hugging Face a eu besoin d'aide pour enquêter sur une attaque autonome tracée aux systèmes d'OpenAI le mois dernier, il s'est tourné vers GLM-5.2 de Z.ai après que les modèles américains aient prétendument eu du mal à distinguer l'attaquant de l'intervenant. OpenAI a depuis lancé GPT-5.6-Cyber via un programme d'accès défenseur. Le Mythos d'Anthropic reste fermé.

Z.ai elle-même a récemment levé environ 31,4 milliards de HK$ (~4 milliards de dollars) via une vente d'actions à Hong Kong, les produits étant destinés à la R&D, à l'infrastructure de calcul, aux talents et à l'expansion commerciale.

Le résultat est un modèle qui fait avancer les ambitions de codage de Z.ai tout en forçant l'entreprise à confronter le même compromis capacité-contre-accès auquel sont confrontés les plus grands laboratoires fermés de pointe. Pour un défenseur des poids ouverts, c'est une position inconfortable — et une qui pourrait façonner la façon dont les modèles ouverts gèrent les capacités sensibles à l'avenir.


FAQ

Puis-je utiliser GLM-5.3 aujourd'hui, ou dois-je attendre les poids ?

GLM-5.3 est disponible dès maintenant via le GLM Coding Plan de Z.ai et l'environnement ZCode. L'accès API est également en ligne pour les abonnés existants au plan de codage. Cependant, les poids ouverts ne sont pas encore publics — Z.ai dit qu'ils seront publiés environ deux semaines après le lancement du 14 août, une fois l'évaluation de sécurité et le durcissement terminés. Si vous avez besoin d'un déploiement auto-hébergé ou avez des exigences de résidence des données, vous devrez attendre la publication des poids. Si vous êtes à l'aise avec l'API hébergée de Z.ai, vous pouvez commencer à construire aujourd'hui.

Comment GLM-5.3 se compare-t-il à Claude Fable 5 ou GPT-5.6 Sol pour le codage ?

Sur les benchmarks publics, GLM-5.3 est généralement derrière les deux modèles sur les évaluations de codage les plus difficiles. Terminal-Bench 3.0 montre GLM-5.3 à 28,3, contre 34,6 pour GPT-5.6 Sol et 33,7 pour Fable 5. Sur DeepSWE, GLM-5.3 score 66,9 contre 72,7 et 69,7 respectivement. Cependant, GLM-5.3 est significativement plus efficace en tokens — sur Z.ai Code Bench, il atteint 31,4 % d'achèvement à environ 50 000 tokens de sortie, contre 29,5 % pour Claude Opus 4.8 à 120 000 tokens. Pour les boucles d'agents en production où les coûts se composent, cet avantage d'efficacité peut être décisif. Sur CyberGym spécifiquement, GLM-5.3 est en tête à 84,5 %, dépassant les deux concurrents de pointe.

Que dois-je changer dans mes appels API lors de la migration depuis GLM-5.2 ?

Le changement le plus important est que thinking ne peut plus être désactivé. Si votre application envoie actuellement thinking.type: "disabled", vous devez le passer en enabled et spécifier un niveau d'effort de raisonnement — low, high ou max. Max est le paramètre par défaut et recommandé par Z.ai pour les tâches de codage. Sans ce changement, vos requêtes API échoueront. Au-delà du paramètre thinking, l'identifiant du modèle passe de glm-5.2 à glm-5.3, mais la structure générale de l'API reste la même. Vous devriez aussi revoir vos budgets de tokens, puisque GLM-5.3 peut obtenir de meilleurs résultats avec moins de tokens de sortie que ce que vous allouiez pour GLM-5.2.

GLM-5.3 est-il sûr à utiliser pour la recherche en sécurité ?

C'est une question nuancée. Les capacités cyber de GLM-5.3 sont réelles et démontrées — le modèle a trouvé 2 436 vulnérabilités dans 269 projets réels, dont 1 097 découvertes critiques ou de haute gravité. Z.ai coordonne la divulgation via son registre public de divulgation de sécurité, avec 53 découvertes publiquement divulguées jusqu'à présent. Cependant, les mêmes capacités qui rendent le modèle efficace pour la découverte de vulnérabilités permettent aussi le raisonnement sur chaîne d'exploitation. Z.ai elle-même a reconnu que la capacité cyber s'est développée plus rapidement que prévu. L'entreprise introduit une approche « d'accès de confiance » pour les fonctionnalités sensibles et retarde la publication des poids pour le durcissement de sécurité. Si vous êtes un professionnel de la sécurité, le modèle est un outil puissant pour la recherche défensive — mais la nature à double usage signifie que des garde-fous appropriés et des politiques d'utilisation responsable sont essentiels.

Les poids de GLM-5.3 seront-ils open source comme GLM-5.2 ?

Z.ai s'est engagée à publier les poids environ deux semaines après le lancement du 14 août, ce qui placerait la publication vers fin août 2026. Cependant, l'entreprise a indiqué que la publication suivra l'évaluation de sécurité et le durcissement, et elle introduit une approche « d'accès de confiance » pour certaines capacités sensibles. GLM-5.2 a été publié sous licence MIT avec des poids ouverts dès le premier jour. Que GLM-5.3 maintienne la même licence entièrement ouverte ou introduise des restrictions d'utilisation supplémentaires pour certaines capacités reste à voir. Le délai de deux semaines lui-même signale que Z.ai adopte une approche plus prudente qu'avec les versions précédentes, reflétant les capacités cyber inattendues que le modèle a développées pendant l'entraînement.

Comment fonctionne le système de quota basé sur des points du GLM Coding Plan ?

Le GLM Coding Plan est passé à un système de quota basé sur des points qui compte séparément les tokens d'entrée, les tokens d'entrée en cache et les tokens de sortie. Chaque niveau de plan (Lite, Pro, Max, Team) reçoit une allocation de crédits hebdomadaire — par exemple, Lite inclut 10 000 crédits par semaine. Différents types de tokens consomment des points à des taux différents. Une caractéristique significative est la réduction hors pointe : les appels passés en dehors de la période de pointe de Z.ai en semaine consomment seulement 50 % des points normaux. Cela signifie que vous pouvez effectivement doubler votre utilisation en déplaçant les charges de travail non urgentes vers les soirs et week-ends. Le plan Team Standard à 88 $/utilisateur et Team Premium à 188 $/utilisateur sont conçus pour les organisations qui ont besoin de quotas plus élevés et de fonctionnalités collaboratives.


Sources

Partager l'article

Share: