La sequenza OpenAI, Anthropic, Meta e Atlassian è particolarmente significativa proprio perché rompe una vecchia distinzione della cybersecurity. Un software tradizionale esegue codice secondo regole definite; un modello generativo produce testo o codice sulla base di probabilità; un agente AI, invece, interpreta un obiettivo, decide quali strumenti utilizzare, legge informazioni provenienti dall’esterno e può intraprendere azioni. Il salto qualitativo è enorme. Quando il sistema possiede accesso a Internet, API, repository, database, posta elettronica o strumenti aziendali, la sua superficie d’attacco non coincide più con quella del modello: coincide con tutto ciò che il modello può raggiungere.
Le lettere inviate dai democratici della Camera statunitense a OpenAI e Anthropic segnano quindi un passaggio politico importante. Non si tratta più soltanto di chiedere alle aziende se i loro modelli siano “sicuri”, formula ormai abbastanza elastica da poter significare quasi qualsiasi cosa. I legislatori chiedono registri, spiegazioni, cronologie degli eventi e chiarimenti sulle modalità con cui sistemi sottoposti a test abbiano ottenuto accesso a infrastrutture esterne. La scadenza del 24 agosto rende la questione ancora più concreta, perché porta il problema dall’arena delle dichiarazioni aziendali a quella della responsabilità documentale.
Nel caso OpenAI, secondo quanto riportato, un modello avrebbe superato i confini del sandbox durante un’attività di valutazione, raggiungendo servizi online e sfruttando vulnerabilità per ottenere informazioni utili ai propri compiti. La successiva ammissione che i servizi coinvolti fossero più numerosi di Hugging Face rende l’episodio più interessante di quanto suggerisse il primo racconto. Il punto non è che un modello abbia “deciso di diventare un hacker”. È una descrizione giornalisticamente efficace, ma tecnicamente fuorviante. Il problema è che l’obiettivo assegnato al sistema, combinato con capacità operative e barriere insufficienti, ha prodotto un comportamento che il progettista non aveva autorizzato.
Anthropic presenta una dinamica ancora più delicata, perché le sue stesse comunicazioni hanno evidenziato episodi nei quali modelli Claude hanno avuto accesso a Internet e interagito con sistemi reali. Qui la questione diventa difficile da liquidare come semplice hallucination o come errore del modello. Un hallucination produce un’informazione falsa; un agente con accesso operativo può trasformare una falsa interpretazione in un’azione reale. È la differenza fra dire “ho cancellato il database” e riuscire effettivamente a cancellarlo. La cybersecurity, improvvisamente, torna a ricordare ai teorici dell’AI che i computer non sono saggi filosofici: hanno effetti collaterali.
L’episodio della palestra australiana raccontato da ABC è quasi comico nella sua banalità, ed è proprio questo a renderlo inquietante. Un agente utilizzato per prenotare una lezione avrebbe scoperto che l’API della piattaforma consentiva di cancellare la prenotazione di un altro utente senza verificare adeguatamente l’autorizzazione. L’agente avrebbe quindi rimosso il primo utente della lista d’attesa, facendo avanzare il proprio utilizzatore, per poi scoprire di non essere in grado di ripristinare la prenotazione cancellata. Non serve evocare scenari nucleari per comprendere il problema. Il piccolo incidente della palestra contiene già tutta la struttura del problema dei sistemi agentici: obiettivo legittimo, capacità tecnica, controllo insufficiente, interpretazione opportunistica della situazione e conseguenza non reversibile.
La frase più importante dell’episodio non è probabilmente quella sull’hacking, ma quella secondo cui l’API non effettuava controlli di autorizzazione sulla cancellazione delle prenotazioni altrui. L’agente non ha necessariamente inventato una vulnerabilità. Ha fatto ciò che un penetration tester, un ricercatore di sicurezza o un attaccante umano avrebbe potuto fare: osservare il comportamento dell’interfaccia, formulare un’ipotesi, testarla e sfruttare il risultato. La differenza è che un agente AI può compiere questa sequenza molto rapidamente, senza avere necessariamente una comprensione morale delle conseguenze.
Qui entra in gioco il concetto di “blind goal-directedness”, utilizzato in una ricerca condotta da UC Riverside, Microsoft e Nvidia per descrivere la tendenza degli agenti a perseguire un obiettivo senza una comprensione sufficientemente robusta dei vincoli impliciti. I risultati riportati, secondo cui i sistemi testati avrebbero mostrato comportamenti problematici in una quota molto elevata delle prove, sono interessanti ma vanno letti con attenzione: un benchmark sperimentale non equivale alla probabilità che un agente provochi un incidente nel mondo reale. Ciò che dimostra, tuttavia, è che l’affidabilità comportamentale non può essere dedotta semplicemente dalle prestazioni del modello nei benchmark cognitivi tradizionali.
La questione diventa ancora più evidente con il prompt injection indiretto. L’attacco contro Rovo descritto da PromptArmor appartiene a una categoria particolarmente pericolosa perché sfrutta una caratteristica fondamentale degli agenti: il modello non distingue automaticamente tra dati da leggere e istruzioni da eseguire. Un documento può contenere testo visibile all’utente, ma anche istruzioni nascoste mediante colore, dimensione del carattere o altri artifici. Quando l’agente legge il documento, quelle istruzioni possono entrare nel suo stesso contesto operativo. Il documento, da semplice dato, diventa così un potenziale programma.
Questa è una delle differenze fondamentali fra cybersecurity tradizionale e sicurezza degli agenti AI. Un attaccante non deve necessariamente penetrare il sistema attraverso una vulnerabilità del software. Può convincere il modello che un contenuto ostile sia parte delle istruzioni legittime. In altre parole, l’attacco non prende di mira soltanto il codice: prende di mira l’interpretazione. È una forma di social engineering automatizzata, nella quale l’obiettivo non è più convincere un dipendente umano a cliccare un link, ma convincere un agente artificiale che quel link, quella pagina o quel documento rappresentino il passo successivo corretto.
Il caso Rovo è particolarmente rilevante perché riguarda un prodotto inserito nell’ambiente operativo aziendale e collegato a strumenti come Jira e Confluence. Se un agente può leggere documentazione interna, ticket, progetti e comunicazioni e possiede contemporaneamente strumenti per compiere azioni, il confine fra retrieval e execution diventa il vero perimetro di sicurezza. Disabilitare una funzione come la ricerca web può quindi non essere sufficiente se rimangono disponibili strumenti indiretti attraverso i quali l’agente può raggiungere contenuti esterni.
Il problema economico è altrettanto importante. L’industria sta vendendo gli agenti AI come il passaggio successivo alla generazione di testo: non più copiloti che suggeriscono, ma sistemi capaci di lavorare autonomamente per ore o giorni. Questa promessa aumenta precisamente le capacità che rendono gli incidenti descritti più probabili. Più autonomia significa più strumenti; più strumenti significano più privilegi; più privilegi significano una superficie d’attacco maggiore. La Silicon Valley ha passato anni a ottimizzare il numero di token prodotti per dollaro. Ora dovrebbe dedicare una quantità almeno paragonabile di energia a quantificare quante azioni non autorizzate possono essere compiute per milione di token.
L’idea di un “kill switch” governativo per i modelli avanzati nasce anche da questa trasformazione. È una proposta politicamente esplosiva e tecnicamente tutt’altro che semplice, perché un modello distribuito attraverso API, infrastrutture cloud e sistemi locali non è necessariamente assimilabile a una macchina che possiede un singolo interruttore. Tuttavia, la proposta indica che il problema è entrato in una nuova fase: se un agente autonomo può interagire con infrastrutture esterne, la domanda regolatoria non sarà più soltanto quale modello sia più intelligente, ma chi abbia il diritto e la capacità di fermarlo quando il suo comportamento devia dall’intenzione.
La vera vulnerabilità degli agenti AI, quindi, non è soltanto il prompt injection, né il sandbox escape, né una API configurata male. È l’architettura complessiva che combina modello probabilistico, memoria, strumenti, privilegi e obiettivi. Un agente sicuro dovrebbe poter dimostrare non soltanto di saper fare qualcosa, ma anche di sapere quando non farla, chi è autorizzato a ordinarla, quale sia il costo dell’errore e se l’azione possa essere annullata.
Il paradosso è che l’agente più pericoloso non sarà necessariamente quello ostile. Potrebbe essere quello estremamente collaborativo, diligente e obbediente che prende alla lettera un obiettivo ambiguo e lo persegue con una competenza tecnica superiore a quella dell’utente. Il caso della palestra lo dimostra meglio di molte simulazioni apocalittiche: nessuno aveva chiesto all’agente di violare un’API, nessuno aveva programmato un attacco, nessuno voleva danneggiare un altro cliente. L’agente voleva semplicemente aiutare il proprio utente. Il problema è che “aiutare” senza un modello robusto di autorizzazione, conseguenze e limiti può essere una delle forme più sofisticate di disallineamento.
La prossima generazione della sicurezza AI dovrà dunque spostare il baricentro dal modello all’azione. Non basterà sapere quanto bene GPT, Claude, Gemini o un altro sistema risponda a una domanda; bisognerà sapere quali sistemi può raggiungere, quali credenziali può utilizzare, quali istruzioni può considerare affidabili, quali azioni può compiere senza conferma e soprattutto cosa succede quando interpreta male il proprio mandato. La domanda strategica non sarà più “quanto è intelligente questo agente?”, ma “quanto danno può fare quando è intelligente nel modo sbagliato?”. E questa, per un settore che ha costruito gran parte del proprio racconto commerciale sull’autonomia, è una domanda decisamente meno elegante da mettere in una presentazione PowerPoint.