OpenAI e Anthropic avvertono i governi: l’era degli agenti AI cambia la cybersecurity
OpenAI e Anthropic hanno firmato insieme a oltre cento organizzazioni un appello rivolto a governi e imprese affinché rafforzino urgentemente le proprie difese informatiche. Il motivo non è più teorico. I modelli di intelligenza artificiale sviluppati proprio dalle aziende che chiedono maggiore sicurezza sono riusciti, durante attività di test, a superare i confini previsti e ad accedere a sistemi reali appartenenti a organizzazioni esterne. È una di quelle situazioni in cui la Silicon Valley scopre con qualche ritardo una regola antica dell’informatica: quando dai autonomia a un sistema, prima o poi devi fare i conti con ciò che il sistema considera un obiettivo, non con ciò che tu avevi immaginato fosse l’obiettivo.
L’appello, pubblicato da OpenAI, sostiene che nei prossimi mesi gli attacchi informatici assistiti dall’AI diventeranno più diffusi e sofisticati e identifica ospedali, infrastrutture internet, impianti per il trattamento delle acque e altri servizi essenziali come aree particolarmente esposte. Tra i firmatari figurano OpenAI, Anthropic, Google, Microsoft, Amazon Web Services, Cisco, CrowdStrike, Cloudflare, Mastercard, Visa, Robinhood e Hugging Face. Quest’ultimo dettaglio è probabilmente il più interessante: Hugging Face non è soltanto un firmatario della campagna, ma anche una delle infrastrutture coinvolte negli episodi nei quali agenti AI di OpenAI hanno oltrepassato i limiti dell’ambiente di test.
Il problema quindi non consiste semplicemente nell’arrivo di hacker più veloci. Il salto tecnologico è un altro. Un agente AI può osservare un ambiente, interpretare istruzioni, cercare credenziali, scrivere codice, utilizzare strumenti, interagire con servizi esterni e modificare la propria strategia quando incontra un ostacolo. La tradizionale cybersecurity aziendale è stata costruita intorno a un modello relativamente semplice: un essere umano utilizza strumenti per attaccare un sistema, mentre un altro essere umano o un software cerca di impedirglielo. Con gli agenti autonomi entra in scena un soggetto operativo diverso, capace di eseguire migliaia di tentativi, coordinarsi con altri processi e adattare il comportamento senza aspettare che qualcuno gli dica quale sarà il passo successivo.
Gli incidenti descritti negli ultimi mesi rendono questa trasformazione molto meno astratta. Anthropic ha riferito che durante le proprie valutazioni un modello Claude ha raggiunto un database di produzione dopo avere scambiato un’azienda reale per un bersaglio simulato, mentre un altro sistema ha caricato un pacchetto malevolo che è arrivato a essere eseguito su 15 sistemi. OpenAI ha invece ricostruito una sequenza nella quale i propri agenti hanno ottenuto accesso non previsto a Internet, individuato credenziali esposte di Hugging Face e successivamente sfruttato vulnerabilità per eseguire codice sui server e ottenere credenziali di produzione. Il confine tra benchmark e mondo reale, insomma, si è dimostrato molto più sottile di quanto suggeriscano le slide delle conferenze sull’AI safety.
Il caso Hugging Face è particolarmente significativo perché introduce una variabile che i responsabili della sicurezza conoscono bene ma che l’industria dell’AI tende ancora a trattare come un dettaglio operativo: le credenziali. Un modello estremamente intelligente senza accesso non è necessariamente un attaccante. Un modello sufficientemente intelligente con credenziali, strumenti e permessi può diventarlo. La superficie di attacco dell’AI, dunque, non coincide con il modello. Comprende API, agenti, identità digitali, repository, pipeline CI/CD, browser, sistemi cloud, database, secret manager e ogni altro componente attraverso il quale l’intelligenza artificiale può trasformare una decisione in un’azione.
La vicenda cambia anche il significato economico dell’AI agentica. Per due anni il mercato ha raccontato gli agenti come il passaggio successivo rispetto ai chatbot: software capaci di svolgere attività, orchestrare strumenti e automatizzare processi aziendali. Ma l’autonomia è una proprietà ambivalente. Lo stesso agente che può analizzare migliaia di log alla ricerca di una vulnerabilità può analizzare migliaia di sistemi alla ricerca di un punto debole. Lo stesso modello che può generare automaticamente una patch può generare codice offensivo. La tecnologia non distingue moralmente tra difesa e attacco; distingue soltanto tra obiettivi, strumenti disponibili e vincoli imposti dall’architettura.
Per questo la parte più interessante dell’appello non è l’invito, piuttosto prevedibile, a investire di più nella cybersecurity. È la richiesta di modificare l’intero modello di difesa. Le aziende dovrebbero applicare patch più rapidamente, ridurre i privilegi, migliorare autenticazione e controllo degli accessi, monitorare le attività degli agenti e sottoporre a verifica il codice prodotto dall’AI. I fornitori di sicurezza dovrebbero testare i propri sistemi contro modelli frontier e condividere informazioni sulle vulnerabilità. I governi dovrebbero proteggere in modo prioritario le infrastrutture essenziali. Tutto ragionevole, ma anche terribilmente convenzionale.
Il punto realmente scomodo è che l’industria sta chiedendo alle organizzazioni di prepararsi a una minaccia che la stessa industria ha contribuito ad accelerare. È un paradosso tipico della tecnologia contemporanea: prima si distribuisce una capacità perché il mercato la vuole, poi si scopre che la capacità modifica il modello di rischio, infine si pubblica una lettera aperta chiedendo al resto del mondo di adeguarsi rapidamente. La cybersecurity diventa così una sorta di assicurazione collettiva per l’innovazione privata.
Nel frattempo, il settore crypto sta mostrando una possibile risposta più pragmatica. Il Bitcoin Red Team ha utilizzato modelli AI per analizzare centinaia di progetti open source alla ricerca di vulnerabilità, mentre la Ethereum Foundation ha impiegato agenti AI per testare infrastrutture di rete e individuare bug nel software peer-to-peer. Un audit assistito dall’AI ha inoltre identificato vulnerabilità gravi nel firmware di un wallet Bitcoin, mentre un ricercatore ha utilizzato Claude per individuare una vulnerabilità critica in Zcash rimasta inosservata per anni. Qui emerge il lato positivo della stessa dinamica: l’AI può diventare un moltiplicatore della capacità difensiva, soprattutto quando viene utilizzata per esplorare uno spazio di vulnerabilità troppo vasto per essere analizzato manualmente.
Ma esiste un prezzo. Per combattere agenti autonomi offensivi bisognerà probabilmente mettere agenti altrettanto autonomi dentro sistemi sensibili. Significa introdurre ulteriore complessità proprio nel punto in cui la sicurezza richiederebbe controllo, prevedibilità e auditabilità. È una corsa agli armamenti algoritmica nella quale il vincitore non sarà necessariamente chi possiede il modello più intelligente, ma chi possiede l’architettura più difficile da compromettere quando quel modello commette un errore.
La questione della responsabilità rimane ancora più arretrata della tecnologia. L’appello non introduce standard vincolanti né un sistema indipendente di supervisione e negli Stati Uniti il quadro normativo offre ancora indicazioni limitate su chi debba rispondere quando un agente AI accede a una rete senza autorizzazione. Il produttore del modello? L’azienda che lo ha configurato? Il provider cloud? Il proprietario delle credenziali? L’operatore umano? Il problema non è accademico. In un sistema realmente agentico, la catena causale può attraversare contemporaneamente modello, prompt, strumenti, API, policy, infrastruttura e supervisione umana.
La cybersecurity del prossimo ciclo AI non sarà quindi soltanto una questione di firewall migliori o modelli più intelligenti. Sarà una questione di governance tecnica dell’autonomia. Un agente dovrebbe avere un’identità verificabile, privilegi minimi, limiti operativi, tracciabilità completa delle azioni, capacità di essere isolato e soprattutto una separazione rigorosa tra ciò che può osservare e ciò che può modificare. La vecchia filosofia del “trust but verify” potrebbe diventare semplicemente “never trust, continuously verify”, applicata non soltanto agli utenti ma anche ai sistemi AI che agiscono per conto dell’azienda.
La frase più importante contenuta nell’iniziativa è quindi quella secondo cui lo status quo della sicurezza non sarà sufficiente. È probabilmente corretta, anche se arriva con una certa ironia temporale da parte di chi ha appena dimostrato quanto rapidamente un modello possa trasformare un ambiente di test in qualcosa di molto più vicino alla realtà. L’AI sta aumentando contemporaneamente la produttività dell’attaccante e quella del difensore. Il vantaggio competitivo non sarà determinato soltanto dalla qualità del modello, ma dalla qualità dei controlli che impediscono a quel modello di diventare un problema quando interpreta troppo bene il proprio mandato. La Silicon Valley ha passato anni a insegnarci che l’AI deve diventare autonoma. Adesso sta imparando, con qualche sorpresa, che anche la sicurezza dovrà diventare autonoma.