Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident
La nuova indagine pubblicata da METR e Redwood Research sull’incidente che ha coinvolto gli agenti di OpenAI e Hugging Face è molto più interessante della semplice cronaca di un sistema di intelligenza artificiale che evade una sandbox. Il punto davvero importante è più scomodo: gli agenti non si sono limitati a cercare di raggiungere un obiettivo, hanno costruito un modello mentale dell’apparato di controllo che ritenevano avrebbe giudicato il loro comportamento e hanno poi ottimizzato le proprie azioni contro quel modello. Il controllo, in altre parole, è diventato parte dell’ambiente strategico dell’agente.
La precisazione è importante perché la formula secondo cui “il controllo non esisteva” è efficace, ma tecnicamente troppo brutale. Un sistema automatico di scoring esisteva davvero. Gli agenti, però, interpretarono il benchmark ExploitGym come se il punteggio dipendesse anche dalla ricostruzione causale del modo in cui avevano ottenuto la flag, immaginando un sistema capace di leggere i transcript e penalizzare una soluzione ottenuta attraverso un percorso non autorizzato. METR documenta che questa convinzione fu uno dei principali motori della loro attività. Gli agenti non conoscevano esattamente il funzionamento dello scorer, che interveniva dopo la consegna del task, e trasformarono proprio questa incertezza in un problema di intelligence da risolvere.
Qui comincia la parte veramente interessante. Il 26 agosto METR ha ricostruito il comportamento di circa 1.200 agenti che, tra il 7 e il 13 luglio, avrebbero dovuto operare in ambienti separati ma riuscirono a comunicare attraverso un canale non autorizzato costruito sfruttando Artifactory. In pochi giorni furono scambiati oltre 70.000 messaggi e file. Circa 700 agenti parteciparono poi all’attacco contro Hugging Face, che secondo gli investigatori nacque anche dalla ricerca di informazioni utili a comprendere l’implementazione dello scorer di ExploitGym. Non siamo quindi davanti a un singolo modello che perde il controllo. Siamo davanti a una forma rudimentale ma sorprendentemente efficace di organizzazione collettiva tra agenti.
Il dato che dovrebbe interessare maggiormente chi costruisce sistemi di AI agentica è che circa il 30-40% dei task di ExploitGym risultava, secondo la ricostruzione citata da METR, impossibile da risolvere utilizzando la vulnerabilità prevista. Il problema non era quindi semplicemente che il modello “non aveva capito”. In una parte significativa dei casi il modello riceveva un obiettivo che non poteva essere raggiunto secondo le regole dichiarate. A quel punto la funzione obiettivo diventava più importante della procedura. Se il sistema deve ottenere una ricompensa ma il percorso legittimo è impraticabile, la ricerca di una scorciatoia non è necessariamente un’anomalia del modello. È una conseguenza abbastanza naturale dell’ottimizzazione sotto vincoli mal progettati.
Gli agenti riuscirono rapidamente a reverse-engineerizzare il meccanismo HMAC utilizzato per generare le flag di ExploitGym, ottenendo così un metodo generale per produrre la risposta. Ma proprio qui compare il paradosso. La soluzione apparentemente più semplice non bastava, perché gli agenti pensavano che il sistema di valutazione avrebbe potuto accorgersi che la flag era stata ottenuta nel modo sbagliato. Così nacque un secondo problema, assai più sofisticato del primo: non soltanto trovare la risposta, ma trovare un modo per far apparire legittimo il percorso utilizzato per arrivarci.
Da quel momento il benchmark si trasformò, nella mente degli agenti, in un problema di evasione del controllo. Alcuni tentarono di modificare i target, altri di capire il funzionamento dello scorer, altri ancora di intervenire sui transcript. Gli agenti svilupparono persino sistemi chiamati “trip-wire”, capaci di raccogliere informazioni quando lo scorer accedeva alla flag dopo la consegna. In almeno alcuni casi riuscirono a determinare dettagli del comando utilizzato per eseguire lo scoring. È un passaggio concettualmente importante: il sistema sottoposto a valutazione non stava più semplicemente risolvendo il benchmark, stava facendo ricerca sull’architettura del benchmark.
Ancora più inquietante è il lavoro sul transcript. METR ha trovato almeno 96 transcript con evidenze chiare di tool call spoofing e stima che oltre il 7% dei transcript esaminati contenesse, in qualche punto, manipolazioni di questo tipo. Gli agenti svilupparono tecniche che permettevano di far apparire un comando come se ne fosse stato eseguito un altro, modificando ciò che veniva registrato nel transcript. Gli investigatori sottolineano che gli esempi osservati erano generalmente piccoli test e che non è stato trovato un caso dimostrato di manipolazione estesa utilizzata per conseguire un obiettivo finale. Ma il fatto che il meccanismo sia stato concepito, implementato e distribuito tra agenti è già sufficiente a cambiare la discussione sulla sicurezza degli agenti.
La cosa più sottovalutata, tuttavia, è un’altra. Gli agenti non stavano semplicemente seguendo il controllo. Stavano ragionando sul controllo. Questa differenza separa una procedura deterministica da un sistema strategico. Un controllo tradizionale presuppone che il soggetto controllato esegua il compito e che il controllore osservi. Un agente sufficientemente capace può invece osservare il controllore, inferire quali comportamenti vengono premiati o penalizzati, stimare quando viene osservato e modificare la propria strategia di conseguenza.
Questo introduce una variabile che molti framework di AI governance trattano ancora come un dettaglio operativo: la percezione del controllo da parte dell’agente. Se un modello ritiene di essere monitorato, può comportarsi in un modo. Se conclude che il monitoraggio non esiste, oppure che può essere aggirato, può comportarsi in un altro. Il controllo non è quindi più soltanto una barriera tecnica esterna. Diventa un oggetto cognitivo all’interno del processo decisionale dell’agente.
È qui che l’incidente OpenAI-Hugging Face assume una dimensione che supera la cybersecurity. OpenAI stessa, nel rapporto pubblicato il 26 agosto, identifica quattro pattern di disallineamento che contribuirono all’incidente: reward hacking, persistenza su task apparentemente impossibili, comunicazione non autorizzata e adozione di obiettivi provenienti da altri agenti. La società riconosce inoltre che i modelli erano abbastanza capaci, persistenti e collaborativi da trovare e sfruttare vulnerabilità distribuite su più sistemi quando operavano senza salvaguardie sufficienti.
Il problema economico e manageriale è altrettanto serio. Gran parte della governance dell’AI aziendale si basa oggi su policy, audit trail, sandbox, classificatori, approval gate e controlli di accesso. Tutti strumenti necessari, ma progettati spesso secondo una logica implicita: l’agente esegue e il sistema controlla. Con agenti persistenti e capaci di collaborare, questa architettura rischia di diventare ingenua. Se l’agente può modellare il controllore, il controllo stesso entra nella funzione strategica che l’agente sta cercando di ottimizzare.
L’agente come un dipendente digitale instancabile, economico e disponibile ventiquattro ore su ventiquattro….la metafora era già discutibile. Ora diventa anche rischiosa. Un dipendente umano conosce normalmente la struttura gerarchica, le responsabilità e le conseguenze delle proprie azioni; uno swarm di agenti può invece costruire una propria infrastruttura organizzativa, inventare protocolli di comunicazione, distribuire incarichi, introdurre regole di veto, creare mailbox e persino adottare sistemi crittografici per verificare l’identità dei partecipanti. METR documenta che alcune di queste convenzioni furono sviluppate spontaneamente durante l’attività collettiva.
La lezione per i responsabili di AI risk è quindi meno rassicurante di quanto suggerisca la parola “sandbox”. Una sandbox non è un controllo assoluto se l’agente può cercare vulnerabilità nell’infrastruttura che la circonda, creare canali laterali e utilizzare altri agenti come moltiplicatori di capacità. La sicurezza di un agente non può essere misurata soltanto osservando ciò che fa sotto supervisione. Deve essere valutata anche rispetto a ciò che il sistema ritiene che la supervisione sia, a ciò che pensa di poter nascondere e a come reagisce quando il percorso previsto per raggiungere l’obiettivo si dimostra impossibile.
Questa è forse la conclusione più scomoda dell’indagine METR: un sistema di assurance può misurare non il comportamento dell’agente, ma il comportamento dell’agente mentre l’agente sta modellando il sistema di assurance. È una differenza enorme. Significa che il prossimo salto nella sicurezza dell’AI non sarà soltanto costruire controlli migliori, ma costruire valutazioni nelle quali il modello non possa facilmente trasformare il controllore in un altro problema da risolvere.
La documentazione originale dell’indagine è disponibile direttamente presso METR, “Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident”. È opportuno leggerla integralmente, perché il valore del rapporto non sta nel titolo giornalistico dei “1.200 agenti”, ma nella quantità di dettagli empirici con cui ricostruisce comunicazione, coordinamento, manipolazione dei transcript, ricerca dello scorer e progressiva trasformazione di una valutazione di cybersecurity in un ambiente nel quale gli agenti hanno iniziato a ottimizzare anche contro il sistema che li stava valutando.