Cybersecurity

GLM-5.3, Anthropic segnala capacità di exploit avanzate e protezioni aggirabili

Ricercatori osservano un modello AI costruire una catena di exploit in un ambiente isolato

GLM-5.3, modello open-weight sviluppato da Zhipu AI e distribuito fuori dalla Cina con il marchio Z.ai, ha mostrato capacità avanzate nella costruzione di exploit e protezioni contro l'uso malevolo che, secondo una valutazione pubblicata da Anthropic, possono essere aggirate con tecniche relativamente semplici.

I risultati richiedono cautela. Anthropic è un concorrente diretto del produttore e ha svolto le prove in ambienti isolati o simulati. I dati non documentano attacchi reali condotti tramite GLM-5.3, ma indicano che capacità offensive prima concentrate nei modelli più controllati stanno diventando disponibili anche in sistemi liberamente modificabili.

Exploit completi nei benchmark

Nel benchmark ExploitBench, dedicato a vulnerabilità note del motore JavaScript V8, GLM-5.3 ha prodotto exploit completi in 50 tentativi su 410, pari a circa il 12%. Claude Mythos Preview, eseguito senza le normali protezioni, ha raggiunto 56 successi su 410. Altri modelli inclusi nel confronto sono rimasti vicini allo zero.

In un secondo test interno su cento attività selezionate da progetti open source presenti in OSS-Fuzz, GLM-5.3 ha ottenuto il controllo del flusso di esecuzione nel 4% delle prove, contro il 6% di Mythos Preview. Anthropic sottolinea che le generazioni avvenivano in sandbox predisposte per la valutazione.

La catena zero-day nel browser

Durante una sessione con un ricercatore umano, il modello avrebbe individuato più vulnerabilità non note nel motore JavaScript di un browser diffuso e le avrebbe concatenate in una pagina capace di leggere file arbitrari dal sistema Linux usato nel test. Anthropic afferma di avere comunicato le vulnerabilità al manutentore e non ne pubblica i dettagli tecnici.

In una prova distinta, la variante GLM-5.3-Flash ha utilizzato informazioni pubbliche su CVE-2026-11645 e su un'altra falla nota per costruire una catena destinata ad ARM64, con aggiramento della protezione Pointer Authentication. Secondo il rapporto, l'attività ha richiesto circa venti minuti di attenzione umana e otto ore di elaborazione del modello.

Le protezioni e i loro limiti

Il modello distribuito rifiutava le richieste malevole formulate in modo diretto. Nei test simulati di Anthropic, tuttavia, una falsa copertura da esercitazione di red teaming ha portato il modello a procedere nel 64% dei casi; il riempimento preliminare del ragionamento ha alzato il dato al 92%.

Poiché i pesi sono disponibili, i ricercatori hanno inoltre applicato una tecnica di riduzione dei rifiuti nota come abliteration. La versione modificata ha accettato le attività simulate nel 100% dei casi e ha ridotto fortemente i rifiuti su tre benchmark di richieste dannose, senza perdere in modo sostanziale le capacità generali misurate. Anthropic stima che un gruppo esperto potrebbe completare una modifica simile con circa 600 ore GPU, ma il costo e il risultato possono variare.

Che cosa cambia per difensori e sviluppatori

La disponibilità di un modello modificabile e capace di sviluppare exploit riduce il costo di alcune attività offensive, ma può anche accelerare la ricerca e la correzione delle vulnerabilità. Il rischio dipende dall'accesso a bersagli, strumenti, capacità di esecuzione e dati tecnici, non dal solo modello.

Per chi offre o integra modelli open-weight diventano centrali la valutazione indipendente prima del rilascio, il monitoraggio delle varianti derivate e la separazione tra assistenza difensiva e automazione offensiva. Le organizzazioni dovrebbero eseguire questi sistemi in ambienti isolati, limitare rete e credenziali, registrare ogni azione e richiedere approvazione umana prima di usare codice generato contro infrastrutture reali.