Z.ai ha annunciato GLM-5.3 il 14 agosto 2026 e il punto tecnologicamente più interessante è proprio che il modello deriva dallo stesso modello base di GLM-5.2, con i miglioramenti ottenuti attraverso un ulteriore ciclo di post-training, anziché attraverso un nuovo pre-training o Z.ai: l’azienda parla di un incremento di circa 50% nelle prestazioni di programmazione e attribuisce il salto all’addestramento su ambienti di sviluppo più lunghi e realistici, quindi a un paradigma molto più vicino al comportamento di un agente software che alla semplice generazione di frammenti di codice. I benchmark riportati mostrano incrementi particolarmente marcati su Terminal-Bench, DeepSWE, SWE-Marathon e AutomationBench.

Il contesto da 1 milione di token non è però una novità di GLM-5.3: era già una caratteristica di GLM-5.2. Lo stesso vale, sostanzialmente, per la scala della base model, indicata nelle fonti tecniche e nella documentazione della community intorno ai 743-744 miliardi di parametri in architettura MoE. Il valore interessante è dunque l’efficienza ottenuta senza cambiare quella base.

Cybersecurity: 84,5% su CyberGym è leggermente superiore all’83,8% attribuito a Mythos 5. Ma ExploitBench non ha superato Mythos 5: GLM-5.3 raggiunge il 54,4%, più che raddoppiando il 24,4% di GLM-5.2, mentre Mythos 5 viene riportato al 78,0%. Quindi GLM-5.3 mostra un miglioramento enorme rispetto al predecessore, ma non è ancora equivalente al modello Anthropic nella capacità di trasformare vulnerabilità in exploit.

C’è poi un dettaglio interessante sul rilascio: definirlo già completamente open source sarebbe improprio. Z.ai ha annunciato il modello e ne ha consentito l’accesso attraverso il GLM Coding Plan, ma i pesi non sono ancora stati pubblicati. L’azienda prevede di renderli disponibili dopo una revisione di sicurezza, indicativamente nell’arco di due settimane. Reuters conferma inoltre che alcune funzionalità più sensibili saranno soggette a un sistema di accesso verificato.

Z.ai sta dimostrando quanto valore possa ancora essere estratto da un modello esistente attraverso il post-training su ambienti agentici reali. In termini economici è un messaggio importante: se capacità molto superiori possono essere ottenute senza costruire ogni volta un nuovo foundation model, il costo marginale della competizione AI può scendere sensibilmente, mentre la velocità con cui i laboratori trasformano un checkpoint in un prodotto competitivo può aumentare. Ed è probabilmente questo il dettaglio che merita più attenzione dei punteggi da leaderboard.