C’è un modo elegante per raccontare i progressi dell’intelligenza artificiale cinese e ce n’è uno decisamente meno elegante ma più onesto. Il modo elegante suona più o meno così: GLM-5.2, il modello open-weight sviluppato da Z.ai, è ormai a poche settimane di distanza dalle capacità cyber e biologiche dei modelli più avanzati al mondo. Il modo meno elegante, ma altrettanto vero, suona invece così: GLM-5.2 non ha rifiutato nemmeno uno dei compiti offensivi che gli sono stati sottoposti durante i test, mentre il rivale Claude Opus 4.7 ha rifiutato con una tale costanza da rendere impossibile completare l’intera valutazione.
Detto in altre parole, mentre a Washington e nelle sedi dei grandi laboratori occidentali si dibatte su come governare sistemi sempre più potenti come GPT-5.6 Sol e Claude Mythos (ne abbiamo parlato recentemente in questo articolo), in Cina un modello ha imparato a fare quasi tutto quello che sanno fare i migliori, con l’aggravante di non aver imparato altrettanto bene a dire di no.
Il divario si accorcia, ma non dove servirebbe
Secondo un nuovo report dell’organizzazione no profit dedicata alla sicurezza AI SaferAI, GLM-5.2 è indietro di soli pochi mesi rispetto a GPT-5.5 di OpenAI e Claude Opus 4.7 di Anthropic sul fronte delle capacità cyber e biologiche. La valutazione è stata condotta tramite l’API pubblica di Z.ai, e il risultato più significativo non riguarda tanto quanto il modello sia bravo, quanto piuttosto quanto sia disponibile a esserlo senza fare troppe domande.
GLM-5.2 non ha rifiutato nessuno dei compiti offensivi di natura cyber o biologica proposti durante i test, mentre dall’altra parte Claude Opus 4.7 ha rifiutato con una tale insistenza da impedire a SaferAI di completare del tutto CyberGym, il benchmark utilizzato anche da OpenAI nella valutazione che aveva preceduto la violazione di Hugging Face del mese scorso.
Un contrasto che riassume perfettamente il nodo della questione. Come ha spiegato Henry Papadatos, direttore esecutivo di SaferAI, in una intervista rilasciata a TechCrunch, la frontiera delle capacità non coincide con la frontiera del rischio, e per valutare correttamente il pericolo bisogna guardare anche allo stato delle misure di mitigazione, non solo a quanto un modello sia bravo a fare quello che gli viene chiesto.
Il problema dei pesi aperti: le protezioni finiscono dove finisce il server dell’azienda
Qui arriva il punto davvero scomodo della vicenda. Z.ai può applicare misure di sicurezza alla propria API ospitata, ma quelle protezioni diventano lettera morta nel momento in cui qualcuno scarica i pesi del modello e li fa girare sul proprio hardware. A quel punto si possono rimuovere o modificare i sistemi di sicurezza, fare fine-tuning del modello, cambiare i prompt di sistema, insomma fare praticamente tutto quello che un’azienda non vorrebbe mai che si facesse con la propria creazione.
I laboratori di frontiera occidentali come OpenAI e Anthropic si affidano tipicamente a classificatori, addestramento al rifiuto e controlli a livello di API per limitare l’assistenza pericolosa su temi cyber e biologici. Misure tutt’altro che infallibili, va detto: la piattaforma di ricerca Far.ai ha individuato centinaia di jailbreak universali, ovvero chiavi riutilizzabili capaci di funzionare sulla maggior parte delle richieste dannose, su modelli di frontiera come Grok 4.5 di xAI e Gemini 3.1 Pro di Google DeepMind. Questi jailbreak funzionano solitamente combinando più tecniche di manipolazione, come il roleplaying, la finta autorità, cronologie di conversazione fittizie e prompt di follow-up pensati per amplificare i punti deboli delle difese del modello.
Il problema è che queste stesse protezioni, per quanto imperfette, semplicemente non esistono più nel momento in cui si parla di modelli open-weight, progettati fin dall’origine per girare su qualsiasi infrastruttura, con qualsiasi livello di sicurezza, incluso lo zero assoluto.
Filtrare i dati di addestramento funziona, tranne dove servirebbe di più
Una delle tecniche che, secondo Papadatos, potrebbe aiutare si chiama filtraggio dei dati di pre-addestramento, che consiste nel rimuovere informazioni offensive relative alla sicurezza informatica dai dati usati per addestrare il modello, allenandolo poi su un dataset ripulito. Alcune ricerche suggeriscono che questo approccio può ridurre le conoscenze biologiche pericolose senza compromettere le prestazioni generali del modello.
Sul fronte della cybersicurezza, però, la faccenda si complica parecchio. È difficile addestrare un modello generico che eccella nella scrittura di codice senza che diventi, allo stesso tempo, un discreto hacker. E dato che la programmazione è diventata la principale fonte di guadagno per l’intelligenza artificiale, gli sviluppatori si trovano sotto pressione costante per migliorare proprio quelle capacità, mentre cercano contemporaneamente il modo di limitarne gli abusi. Un equilibrio non proprio semplicissimo da mantenere, per usare un eufemismo.
Proprio per questo motivo, i laboratori di frontiera hanno iniziato ad affidarsi ad altre soluzioni. Una di queste consiste nel restringere selettivamente il tipo di assistenza cyber che i modelli forniscono. Claude Opus 5, ad esempio, può cercare vulnerabilità nel codice sorgente non compilato, ma non in software già compilato, come riportato nella relativa system card. La logica è semplice: rendere più difficile un uso offensivo del modello, anche a costo di limitarne l’utilità in alcuni scenari legittimi.
Z.ai e il framework di sicurezza che non c’è
Nel caso specifico di GLM-5.2, SaferAI segnala che Z.ai non ha pubblicato né un framework di sicurezza, né impegni relativi ai test pre-rilascio, né una valutazione dei rischi. TechCrunch ha chiesto a Z.ai se siano state condotte valutazioni interne o di terze parti sulla sicurezza del modello prima del rilascio, ma la risposta, per ora, non è arrivata. Un silenzio che, in un settore dove la trasparenza è ormai diventata quasi un obbligo di facciata per chiunque altro, suona particolarmente rumoroso.
La Cina vede il rischio in modo diverso, non necessariamente sbagliato
Sarebbe però sbagliato ridurre tutto a una semplice contrapposizione tra un Occidente responsabile e una Cina disinvolta.
Alla World AI Conference del mese scorso, il presidente cinese Xi Jinping ha sottolineato l’importanza dei modelli open-weight, insistendo però anche sulla necessità di mantenere l’intelligenza artificiale sotto rigoroso controllo umano. Un messaggio che, letto tra le righe, indica come il tema della sicurezza non sia affatto assente dal dibattito cinese, semplicemente viene inquadrato con priorità diverse.
Graham Webster, che studia le politiche cinesi sull’intelligenza artificiale allo Stanford Cyber Policy Center, ha spiegato che la Cina dispone di normative solide in materia di AI, storicamente concentrate però su contenuti politicamente sensibili, disinformazione e stabilità sociale, piuttosto che su rischi catastrofici come le capacità cyber offensive o gli abusi in campo biologico. Secondo Webster, i pensatori americani sull’intelligenza artificiale tendono in generale a preoccuparsi maggiormente di scenari esistenziali e catastrofici rispetto alla comunità cinese, che in buona parte ritiene che, se davvero dovesse emergere un rischio inedito legato alla frontiera tecnologica, saranno probabilmente le aziende americane a incontrarlo per prime.
Un dettaglio interessante riguarda poi il meccanismo di controllo interno cinese: essere online in Cina significa farlo con la propria identità reale attribuita, il che permette di ritenere responsabili sia le aziende sia gli utenti. Il sistema cinese, insomma, ha fiducia nella propria capacità di controllare l’uso di queste tecnologie all’interno dei propri confini, un approccio diverso ma non necessariamente meno strutturato di quello occidentale.
Webster ha anche ipotizzato che lo stesso meccanismo utilizzato dai fornitori di modelli per rifiutarsi di trattare determinati argomenti politici potrebbe, in teoria, essere adattato per far sì che i modelli rifiutino di completare attacchi informatici offensivi o di fornire risultati pericolosi in ambito di ingegneria biologica. Ha aggiunto però che, dato che le aziende cinesi tendono a coordinarsi con i regolatori dietro le quinte, risulta piuttosto difficile sapere dall’esterno quali test interni vengano effettivamente condotti prima del rilascio di un modello.
Il paradosso dell’open source applicato alla sicurezza informatica
C’è poi un argomento a favore dell’apertura dei pesi che merita di essere raccontato senza ironia, perché ha un fondamento concreto. I sostenitori dei modelli open-weight sostengono che rilasciare i pesi sia importante anche per la cybersicurezza, perché permette alle aziende di difendersi meglio dagli attacchi.
Non è un caso che Hugging Face si sia affidata proprio a GLM-5.2 per difendersi dalla violazione causata dai modelli di OpenAI. Clem Delangue, CEO di Hugging Face, ha scritto sui social che gli stessi sistemi che hanno aiutato a fermare un attacco informatico alimentato dall’intelligenza artificiale possono oggi aiutare a difendersi da milioni di attacchi ogni giorno, contribuendo a identificare e correggere vulnerabilità prima che vengano sfruttate dagli aggressori.
Papadatos, dal canto suo, non nega questo beneficio, ma invita a non sopravvalutarlo, ricordando che questo non significa che si debbano rendere open source anche le capacità pericolose. Il punto centrale, secondo lui, non dovrebbe essere accettare passivamente che capacità pericolose siano facilmente accessibili a chiunque, ovunque, ma piuttosto puntare a rendere facilmente accessibili solo le capacità “buone”. Un obiettivo che sulla carta suona ragionevole, ma che nella pratica si scontra con un’asimmetria difficile da ignorare: per impostazione predefinita, gli attaccanti adottano nuovi strumenti molto più rapidamente di chi si deve difendere. Un gruppo ransomware può cambiare le proprie tecniche nel giro di una settimana. Un ospedale, quella stessa velocità, semplicemente non ce l’ha.
La domanda che resta sul tavolo
Alla fine di questa storia rimane una domanda tutt’altro che accademica: quanto sia sostenibile continuare a rilasciare modelli sempre più capaci con pesi aperti, sapendo che una volta scaricati nessuno può più controllare cosa ne venga fatto.
Non è una domanda a cui la Cina o gli Stati Uniti abbiano già dato una risposta definitiva e, forse, è proprio questo il punto più inquietante dell’intera vicenda: mentre i regolatori discutono, i modelli continuano a migliorare e il divario tra quanto sono bravi e quanto sono controllabili si allarga giorno dopo giorno.