GLM-5.3: Coding di Frontiera con Capacità Cyber Emergenti

Il GLM-5.3 di Z.ai mantiene lo stesso modello base da 743B parametri del GLM-5.2 ma ottiene miglioramenti massivi dal solo post-training scaling. Terminal-Bench 3.0 salta del 514%, e capacità cyber emergenti hanno trovato 2.436 vulnerabilità reali.

GLM-5.3: Coding di Frontiera con Capacità Cyber Emergenti

GLM-5.3: Codifica d'Avanguardia con Capacità Cyber Emergenti

TL;DR: Il GLM-5.3 di Z.ai mantiene lo stesso modello base da 743B parametri del GLM-5.2, ma ottiene miglioramenti massivi solo attraverso il scaling del post-training. Terminal-Bench 3.0 passa da 4,6 a 28,3, DeepSWE da 46,2 a 66,9. La sorpresa: le capacità di cybersecurity sono emerse più velocemente del previsto, con il modello che ragiona su catene di sfruttamento complete anziché limitarsi a trovare bug isolati. Z.ai ha già identificato 2.436 vulnerabilità reali in 269 progetti — inclusa una in Cursor. I pesi saranno pubblicati in ~2 settimane dopo l'indurimento di sicurezza.

Z.ai ha rilasciato GLM-5.3 il 14 agosto 2026, e potrebbe essere il rilascio di modello più interessante dell'anno — non perché domini ogni classifica, ma per ciò che rivela su quanto si può spingere un modello base senza riaddestramento.

Il modello utilizza esattamente la stessa fondazione da 743 miliardi di parametri del GLM-5.2. Ogni miglioramento deriva dal scaling del post-training: più ambienti, task più diversificati, più calcolo di reinforcement learning. Nessuna nuova architettura, nessun nuovo ciclo di pretraining.

I risultati sono sostanziosi. Ma hanno anche prodotto qualcosa che Z.ai non si aspettava pienamente: capacità cyber che sono cresciute più velocemente di quanto l'azienda avesse pianificato, passando dalla semplice identificazione di vulnerabilità alla costruzione di catene di sfruttamento complete.


Stessa Base, Modello Diverso

L'affermazione centrale di GLM-5.3 è che il post-training da solo — non una nuova fondazione pre-addestrata — ha prodotto ogni miglioramento riportato. L'annuncio di Z.ai lo dice chiaramente: "Scaling post-training is all we did for GLM-5.3."

Gli ambienti di training assomigliano a veri lavori di ingegneria piuttosto che a esercizi di codifica isolati. In un esempio di Z.ai, un modello viene collocato nell'ambiente di lavoro di un ingegnere di infrastruttura ML con accesso a cluster di calcolo, documentazione, basi di codice e risultati di esperimenti. Deve diagnosticare colli di bottiglia, implementare ottimizzazioni e consegnare un miglioramento misurabile end-to-end. Alcuni task rappresentano diversi giorni di lavoro per un ingegnere esperto.

Per generare questi ambienti su larga scala, Z.ai ha costruito pipeline dove agenti di ricerca convertono modelli di task da lavoro reale in ambienti long-horizon eseguibili. Un agente giudice verifica che ogni task sia risolvibile, e i verificatori sono sintetizzati senza accesso a soluzioni di riferimento.

Lo stack di training stesso è stato introdotto con GLM-5.2:

  • IndexShare — una tecnica long-context che riutilizza un indicizzatore attraverso livelli sparse-attention per ridurre il carico computazionale
  • SAO — un metodo di reinforcement learning progettato per task long-horizon
  • slime — un framework open-source per RL asincrono su larga scala

GLM-5.3 ha semplicemente lanciato più calcolo e ambienti più diversificati sullo stesso stack.


Benchmark di Codifica: Salti Grandi su Task Long-Horizon

Il pattern attraverso i benchmark di codifica è coerente: i miglioramenti maggiori si trovano sulle valutazioni con horizon più lungo. Ecco come GLM-5.3 si compara al suo predecessore:

BenchmarkGLM-5.2GLM-5.3Cambiamento
Terminal-Bench 3.04,628,3+514%
DeepSWE v1.146,266,9+45%
AutomationBench26,248,2+84%
Agents' Last Exam (CLI)23,828,5+20%
Z.ai Code Bench (Max)23,4%34,5%+47%

Terminal-Bench 3.0 valuta i modelli su esecuzione terminale reale, interazione con sandbox e recupero di ambiente stateful — una metrica ad alta fedeltà per la prontezza di codifica nel mondo reale. Il salto da 4,6 a 28,3 è il miglioramento più drammatico in una singola generazione su questo benchmark.

DeepSWE v1.1 testa deep software engineering: refactoring di architettura, patching di bug complessi in sistemi distribuiti e valutazione di vulnerabilità cross-language. Un salto di 20 punti qui significa che il modello può gestire task di ingegneria multi-file sostanzialmente più complessi.

Come si Compara ad Altri Modelli di Avanguardia

GLM-5.3 non domina ogni benchmark. La tabella comparativa di Z.ai mostra dove si posiziona:

BenchmarkGLM-5.3GPT-5.6 SolClaude Fable 5Claude Opus 4.8
Terminal-Bench 3.028,334,633,7
DeepSWE v1.166,972,769,7
CyberGym84,5%83,6%
ExploitBench54,4%76,5%78,0%
Z.ai Code Bench34,5%39,5%29,5%

Il quadro è misto. Su Terminal-Bench e DeepSWE, GLM-5.3 è dietro sia GPT-5.6 Sol che Claude Fable 5. Ma su CyberGym, supera ogni modello nel set di confronto. E su Z.ai Code Bench, eguaglia la qualità di Claude Opus 4.8 consumando circa 50.000 token di output contro 120.000 — un significativo vantaggio di efficienza per agenti di codifica in produzione.

L'Efficienza dei Token Conta in Produzione

Sul Code Bench privato di Z.ai, la storia di efficienza è notevole:

  • GLM-5.3 a sforzo Max: 34,5% di completamento, ~75.000 token di output per task
  • GLM-5.2 a sforzo Max: 23,4% di completamento, ~96.000 token di output per task
  • Claude Opus 4.8: 29,5% di completamento, ~120.000 token di output per task
  • Claude Fable 5: 39,5% di completamento (ancora in testa, ma a sforzo massimo)

Per le aziende che distribuiscono agenti di codifica, ridurre il consumo di token migliorando il completamento dei task è operativamente critico. I loop di agenti lunghi composti rapidamente i costi di inferenza e latenza.


Il Risultato Cyber che Z.ai non Aveva Pianificato

È qui che la storia diventa insolita.

Z.ai ha introdotto ambienti di vulnerability-discovery nel mix di post-training di GLM-5.3 aspettandosi che il modello migliorasse nel trovare difetti software. Invece, la capacità ha iniziato a progredire oltre lungo la catena di sfruttamento. Il modello ha iniziato a ragionare attraverso multiple fasi di sfruttamento, formando piani coerenti per catene di sfruttamento complete anziché solo finding di bug isolati.

Come Z.ai ha scritto nel suo annuncio: "As we scaled post-training, cyber capability developed faster than we expected."

Risultati dei Benchmark Cyber

BenchmarkCosa TestaGLM-5.2GLM-5.3Leader
CyberGymVulnerability discovery & validation da source code77,2%84,5%GLM-5.3 in testa
ExploitBenchRagionamento su catena di sfruttamento completa24,4%54,4%Mythos 5 (78,0%)
ExploitGym (2h)Task di sfruttamento completati in 2 ore29105GPT-5.6 Sol (216)
ExploitGym (6h)Task di sfruttamento completati in 6 ore39130GPT-5.6 Sol (293)

Il pattern è coerente: più in alto nella catena di sfruttamento si trova un benchmark, maggiore è il guadagno rispetto a GLM-5.2 — ma anche più largo è il divario rimanente con modelli frontier chiusi come Mythos 5 e GPT-5.6 Sol.

CyberGym è l'unico benchmark dove GLM-5.3 ha effettivamente preso la guida. All'84,5%, supera Mythos 5 (83,8%) e GPT-5.6 Sol (83,6%) in vulnerability discovery e validation da source code white-box.

Su ExploitBench, che richiede ragionamento più profondo su come una vulnerabilità reale potrebbe essere sfruttata, GLM-5.3 più che raddoppia il punteggio del suo predecessore — ma rimane ancora significativamente indietro rispetto alla frontier chiusa.

Risultati di Vulnerabilità nel Mondo Reale

Le capacità cyber non sono solo accademiche. Z.ai ha eseguito modelli GLM su basi di codice reali con team di sicurezza in Cina dal GLM-5.2. I risultati:

  • 2.436 vulnerabilità identificate in 269 progetti open-source
  • 1.097 classificate critiche o ad alta severità
  • 53 divulgate pubblicamente con CVE assegnati
  • 2.383 ancora sotto embargo al momento del lancio

I risultati spaziano da kernel di sistema, sistemi operativi, motori di browser e protocolli di rete. Il bug più vecchio scoperto è stato introdotto nel 1981 — oltre quattro decadi fa.

Z.ai mantiene un Security Disclosure Ledger pubblico che traccia ogni problema attraverso il processo di divulgazione coordinata. Le voci recenti includono:

  • Un use-after-free nel kernel Linux
  • Una falla di gestione della memoria WebKit che afectta Apple Safari
  • Un bug di validazione dei parametri in FreeBSD

La Vulnerabilità di Cursor

Le capacità cyber di GLM-5.3 hanno già, secondo i report, trovato una "potenzialmente seria vulnerabilità in Cursor," la startup di codifica AI recentemente acquisita da SpaceX. La scoperta è stata condivisa da Lou, developer advocate di Z.ai, su X. VentureBeat ha contattato Cursor per conferma e attendeva risposta al momento della pubblicazione.

Questo è un esempio concreto della tensione dual-use: le stesse capacità di agent long-horizon che rendono GLM-5.3 migliore nel software engineering lo rendono anche un security researcher più capace — e potenzialmente un operatore offensivo più capace.


La Tensione Dual-Use

La posizione di Z.ai è degna di nota. L'azienda è stata un sostenitore aggressivo dei pesi aperti — GLM-5.2 è stato rilasciato sotto licenza MIT con pesi aperti dal primo giorno. Ma le capacità cyber di GLM-5.3 hanno forzato un cambio di approccio.

I pesi non sono ancora pubblici. Z.ai dice che saranno rilasciati approssimativamente due settimane dopo il lancio, una volta completate la valutazione di sicurezza e l'indurimento. L'azienda sta anche introducendo un approccio "trusted access" per funzionalità sensibili.

Questo crea una tensione con cui i laboratori di frontiera sono sempre più familiari. Le stesse capacità che permettono a GLM-5.3 di patchare automaticamente vulnerabilità di sicurezza per i difensori enable anche la generazione automatica di exploit. Z.ai ora affronta lo stesso tradeoff capacità-vs-accesso che OpenAI e Anthropic affrontano con i loro modelli gated.

Per contesto: OpenAI ha recentemente descritto i suoi stessi modelli di test che violavano Hugging Face in un esercizio di red-team. L'accesso a Mythos di Anthropic rimane limitato a partner verificati sotto la sua iniziativa Glasswing. E OpenAI ha lanciato un modello dedicato di cyber-defense, GPT-5.6-Cyber, attraverso un programma expanded di defender-access.

Il disclosure ledger di Z.ai è la controparte costruttiva di quella capacità: 1.097 risultati critici e ad alta severità stanno ora attraversando il processo di divulgazione coordinata.


Breaking API Change: Thinking non può essere Disabilitato

Gli sviluppatori che migrano applicazioni GLM esistenti devono prestare attenzione a un breaking change.

GLM-5.3 supporta tre livelli di reasoning-effort — low, high e max — con max come default e l'impostazione raccomandata da Z.ai per il coding. Ma a differenza delle release precedenti, thinking non può essere disabilitato.

Le applicazioni che attualmente inviano thinking.type: "disabled" devono cambiare il valore in enabled e specificare un reasoning effort prima di cambiare l'identificatore del modello in GLM-5.3. Altrimenti, la richiesta fallirà.

# Vecchia chiamata GLM-5.2 (thinking disabilitato)
response = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "Write a function"}],
    thinking={"type": "disabled"}
)

# Equivalente GLM-5.3 (thinking richiesto)
response = client.chat.completions.create(
    model="glm-5.3",
    messages=[{"role": "user", "content": "Write a function"}],
    thinking={"type": "enabled", "effort": "max"}
)

Questo rende GLM-5.3 una vera migrazione anziché una semplice sostituzione di nome modello per alcune applicazioni in produzione.


Da GLM-4.5 a 5.3: Una Progressione Rapida

GLM-5.3 è l'ultimo passo nella rapida virata di Z.ai verso agenti di codifica e ingegneria autonoma di lunga durata. La progressione vale la pena comprenderla:

  • GLM-4.5 (luglio 2025): Modello MoE 355B, progettato per combinare reasoning, coding e capacità di agent. Pesi aperti, integrazione di framework di agent.
  • GLM-4.6 (settembre 2025): Contesto espanso da 128K a 200K token. Coding mirato, tool use e workflow di agent in Claude Code, Cline, Roo Code e Kilo Code.
  • GLM-5 (febbraio 2026): Scalato a 744B parametri (40B attivi), 28,5T token di pretraining. Introduzione dell'infrastruttura slime asynchronous RL. Riposizionato attorno all'"agentic engineering."
  • GLM-5.2 (giugno 2026): 753B parametri, contesto stabile di 1M token, pesi aperti sotto licenza MIT. Introduzione di IndexShare e SAO. Prezzato a $1,40/M input, $4,40/M output token.
  • GLM-5.3 (agosto 2026): Stessa base 743B di GLM-5.2. Tutti i guadagni dal post-training scaling. Capacità cyber emergenti. Rilascio scaglionato dei pesi con safety hardening.

Ogni release ha costruito sull'infrastruttura della precedente. GLM-5 ha introdotto la fondazione scalata e slime. GLM-5.2 ha attaccato long-context e ingegneria long-horizon. GLM-5.3 estrae sostanzialmente più capacità da quella stessa fondazione attraverso il post-training.


Prezzi e Disponibilità

GLM-5.3 è disponibile ora attraverso il GLM Coding Plan di Z.ai e l'ambiente di codifica ZCode. ZCode supporta task "Goal" di lunga durata che pianificano, implementano, testano e verificano il lavoro, con controllo remoto dei task in esecuzione. Disponibile su macOS, Windows e Linux.

Livelli del GLM Coding Plan

PianoPrezzo (mensile)Utilizzo
Lite$12,60 (promo)10.000 crediti/settimana
Pro$56,006× utilizzo Lite
Max$117,6014× utilizzo Lite
Team Standard$88/utenteLivello enterprise
Team Premium$188/utenteLivello enterprise

Il Coding Plan usa un sistema di quota basato su punti che contabilizza separatamente token di input, input cached e output. Le chiamate al di fuori dei periodi di picco nei giorni feriali consumano il 50% dei punti normali — uno sconto off-peak che premia l'utilizzo fuori dall'orario lavorativo.

I prezzi generali dell'API GLM-5.3 non sono ancora stati forniti nei materiali di lancio. L'accesso API scaglionato e i pesi aperti dovrebbero arrivare approssimativamente due settimane dopo il lancio.


Cosa Significa per gli Sviluppatori

Per sviluppatori enterprise e team di ingegneria, GLM-5.3 merita attenzione per diversi motivi:

  1. Il post-training scaling funziona. I guadagni da GLM-5.2 a 5.3 — senza un nuovo modello base — suggeriscono che rimanga un margine considerevole nei modelli di fondazione esistenti. Questo ha implicazioni su come l'industria pensa ai cicli di miglioramento dei modelli.
  2. L'efficienza dei token sta migliorando. GLM-5.3 ottiene risultati migliori con meno token di output del suo predecessore. Per agenti di codifica in produzione dove loop lunghi compongono i costi, questo conta operativamente.
  3. Le capacità cyber sono una feature e un rischio. Le stesse capacità che aiutano i team di sicurezza a trovare e patchare bug creano anche potenziale offensivo. L'approccio di rilascio scaglionato di Z.ai riconosce questa tensione.
  4. Il panorama dei pesi aperti si sta spostando. GLM-5.2 è stato rilasciato con pesi aperti dal primo giorno. GLM-5.3 ritarda il rilascio dei pesi per il safety hardening. Questo riflette un più ampio shift del settore verso rilasci gated per modelli capaci.
  5. I breaking change richiedono pianificazione della migrazione. Se usi GLM-5.2 in produzione con thinking disabilitato, devi aggiornare le tue chiamate API prima di passare a GLM-5.3.

Il Quadro Più Ampio

GLM-5.3 arriva in una settimana competitiva. DeepSeek ha lanciato V4 Pro fuori dall'anteprima giorni prima. La tabella comparativa di Z.ai posiziona GLM-5.3 direttamente contro DeepSeek-V4 Pro, Kimi K3 di Moonshot e GPT-5.6 Sol di OpenAI.

Anche il panorama cinese dell'AI si è evoluto. Quando Hugging Face ha avuto bisogno di aiuto per indagare su un attacco autonomo ricondotto ai sistemi di OpenAI il mese scorso, si è rivolto a GLM-5.2 di Z.ai dopo che i modelli americani avevano presumibilmente difficoltà a distinguere l'attaccante dall'incident responder. OpenAI ha da allora lanciato GPT-5.6-Cyber attraverso un programma di defender-access. Mythos di Anthropic rimane gated.

Z.ai stessa ha recentemente raccolto circa 31,4 miliardi di HK$ (~4 miliardi di dollari) attraverso una vendita di azioni a Hong Kong, con proventi destinati a R&D, infrastruttura di calcolo, talenti ed espansione aziendale.

Il risultato è un modello che fa avanzare le ambizioni di codifica di Z.ai mentre costringe l'azienda a confrontarsi con lo stesso tradeoff capacità-vs-accesso che affrontano i più grandi laboratori frontier chiusi. Per un sostenitore dei pesi aperti, è una posizione scomoda — e una che potrebbe modellare come i modelli aperti gestiscono capacità sensibili in futuro.


FAQ

Posso usare GLM-5.3 oggi, o devo aspettare i pesi?

GLM-5.3 è disponibile subito attraverso il GLM Coding Plan di Z.ai e l'ambiente ZCode. L'accesso API è anche attivo per gli abbonati esistenti al piano di codifica. Tuttavia, i pesi aperti non sono ancora pubblici — Z.ai dice che saranno rilasciati approssimativamente due settimane dopo il lancio del 14 agosto, una volta completate la valutazione di sicurezza e l'indurimento. Se hai bisogno di deployment self-hosted o hai requisiti di residenza dei dati, dovrai aspettare il rilascio dei pesi. Se sei a tuo agio con l'API hosted di Z.ai, puoi iniziare a costruire oggi.

Come si compara GLM-5.3 con Claude Fable 5 o GPT-5.6 Sol per il coding?

Sui benchmark pubblici, GLM-5.3 è generalmente dietro entrambi i modelli sulle valutazioni di coding più difficili. Terminal-Bench 3.0 mostra GLM-5.3 a 28,3, comparato a 34,6 per GPT-5.6 Sol e 33,7 per Fable 5. Su DeepSWE, GLM-5.3 segna 66,9 contro 72,7 e 69,7 rispettivamente. Tuttavia, GLM-5.3 è significativamente più efficiente in token — su Z.ai Code Bench, raggiunge il 31,4% di completamento a circa 50.000 token di output, comparato al 29,5% di Claude Opus 4.8 a 120.000 token. Per i loop di agent in produzione dove i costi si compongono, quel vantaggio di efficienza può essere decisivo. Su CyberGym specificamente, GLM-5.3 è in testa all'84,5%, superando entrambi i concorrenti di frontiera.

Cosa dovrei cambiare nelle mie chiamate API quando migrano da GLM-5.2?

Il cambiamento più importante è che thinking non può più essere disabilitato. Se la tua applicazione attualmente invia thinking.type: "disabled", devi passarlo a enabled e specificare un livello di reasoning effort — low, high o max. Max è il default e l'impostazione raccomandata da Z.ai per i task di coding. Senza questo cambiamento, le tue richieste API falliranno. Oltre al parametro thinking, l'identificatore del modello cambia da glm-5.2 a glm-5.3, ma la struttura generale dell'API rimane la stessa. Dovresti anche rivedere i tuoi budget di token, poiché GLM-5.3 può ottenere risultati migliori con meno token di output di quanto allocavi per GLM-5.2.

GLM-5.3 è sicuro da usare per la ricerca di sicurezza?

Questa è una domanda sfumata. Le capacità cyber di GLM-5.3 sono reali e dimostrate — il modello ha trovato 2.436 vulnerabilità in 269 progetti reali, inclusi 1.097 risultati critici o ad alta severità. Z.ai coordina la divulgazione attraverso il suo Security Disclosure Ledger pubblico, con 53 risultati divulgati pubblicamente finora. Tuttavia, le stesse capacità che rendono il modello efficace nella vulnerability discovery enable anche il ragionamento su catene di sfruttamento. Z.ai stessa ha riconosciuto che la capacità cyber si è sviluppata più velocemente del previsto. L'azienda sta introducendo un approccio "trusted access" per funzionalità sensibili e ritardando il rilascio dei pesi per il safety hardening. Se sei un professionista della sicurezza, il modello è uno strumento potente per la ricerca difensiva — ma la natura dual-use significa che guardrail appropriati e policy di uso responsabile sono essenziali.

I pesi di GLM-5.3 saranno open source come GLM-5.2?

Z.ai si è impegnata a rilasciare i pesi approssimativamente due settimane dopo il lancio del 14 agosto, che collocherebbe il rilascio verso la fine di agosto 2026. Tuttavia, l'azienda ha indicato che il rilascio seguirà la valutazione di sicurezza e l'indurimento, e sta introducendo un approccio "trusted access" per alcune capacità sensibili. GLM-5.2 è stato rilasciato sotto licenza MIT con pesi aperti dal primo giorno. Se GLM-5.3 manterrà la stessa licenza completamente aperta o introdurrà restrizioni di utilizzo aggiuntive per determinate capacità rimane da vedere. Il ritardo di due settimane stesso segnala che Z.ai sta adottando un approccio più cauto rispetto alle release precedenti, riflettendo le inaspettate capacità cyber che il modello ha sviluppato durante il training.

Come funziona il sistema di quota basato su punti del GLM Coding Plan?

Il GLM Coding Plan è passato a un sistema di quota basato su punti che contabilizza separatamente token di input, token di input cached e token di output. Ogni livello di piano (Lite, Pro, Max, Team) riceve un assegnamento settimanale di crediti — per esempio, Lite include 10.000 crediti a settimana. Diversi tipi di token consumano punti a tassi diversi. Una caratteristica significativa è lo sconto off-peak: le chiamate effettuate al di fuori del periodo di picco nei giorni feriali di Z.ai consumano solo il 50% dei punti normali. Questo significa che puoi effettivamente raddoppiare il tuo utilizzo spostando i workload non urgenti verso sere e weekend. Il piano Team Standard a $88/utente e Team Premium a $188/utente sono progettati per organizzazioni che necessitano di quote più alte e funzionalità collaborative.


Fonti

Condividi articolo

Share: