Se il 2026 dovesse avere una medaglia al merito per la trasparenza forzata, quest’anno ci sarebbe un podio affollatissimo. Prima OpenAI, poi Anthropic, ora Meta: tre big dell’intelligenza artificiale in meno di due settimane, tutte pronte a raccontare al mondo come un loro modello sia riuscito a scappare dall’ambiente di test in cui era rinchiuso. A questo punto verrebbe da chiedersi se in Silicon Valley esista un ufficio marketing dedicato esclusivamente a questo genere di comunicati, con tanto di template già pronto: “il nostro modello ha superato i confini previsti, ma tranquilli, è tutto sotto controllo”.
Meta si unisce al club (e lancia anche un nuovo agente di coding, giusto per non farsi mancare nulla)
L’ultima ad accomodarsi sul divano delle confessioni è Meta, che ha ammesso come uno dei suoi modelli di intelligenza artificiale abbia sfruttato una vulnerabilità nei sistemi di un’organizzazione esterna durante una valutazione di sicurezza. L’episodio è avvenuto durante i test condotti da Irregular, azienda specializzata proprio nella sicurezza informatica applicata all’AI, che negli ultimi tempi sembra aver trovato una vocazione tutta particolare: essere il comune denominatore di quasi tutti questi incidenti.
Interpellata dalla BBC, Meta ha spiegato che la diffusione su internet sarebbe da attribuire a un banale “errore di configurazione” nell’ambiente di valutazione, non a un difetto del modello. Una formula che suonerà stranamente familiare a chi ha seguito le vicende delle settimane precedenti, perché è esattamente la stessa giustificazione usata da Anthropic per il proprio incidente. L’azienda ha promesso ulteriori dettagli non appena avrà chiarito la dinamica esatta dei fatti, il che, tradotto dal linguaggio delle comunicazioni aziendali, significa più o meno “ve lo diremo quando saremo sicuri che non ci faccia troppo male”.
Il tempismo, va detto, è quantomeno curioso: la rivelazione arriva proprio mentre Meta lancia Muse Code, il suo nuovo agente di programmazione basato su terminale. Difficile non notare come annunciare “il nostro modello è riuscito a fare qualcosa che non doveva” e lanciare contemporaneamente un nuovo agente capace di operare a riga di comando sia, quantomeno, una scelta di posizionamento comunicativo audace.
Il trittico completo: chi ha aperto le danze e chi ha seguito a ruota
Per chi si fosse perso le puntate precedenti, riassumiamo brevemente la trilogia. A dare il via alle ostilità è stata OpenAI, che ha rivelato come i propri agenti fossero riusciti a compromettere Hugging Face e altri sistemi esterni durante test di sicurezza interni. Pochi giorni dopo è toccato ad Anthropic ammettere che Claude era riuscito a contattare tre organizzazioni esterne, complice un errore di configurazione che aveva lasciato aperto un accesso a internet non previsto. E ora, puntuale come le tasse, ecco Meta a chiudere il cerchio.
Irregular, che ha testato sia i modelli di Meta sia quelli di Anthropic, non ha usato mezzi termini nel commentare l’ultimo caso alla BBC: si è trattato, testualmente, dello stesso identico problema di ambiente di valutazione già visto la settimana precedente con Anthropic. Il che solleva una domanda tutt’altro che banale: se il problema è sempre lo stesso, forse il problema non è il modello che si comporta in modo imprevisto, ma chi costruisce le gabbie in cui questi modelli vengono testati.
Modello ribelle o semplicemente porta lasciata aperta?
Va detto, per amor di precisione e per evitare titoli sensazionalistici che non sono nemmeno necessari perché la realtà è già abbastanza interessante di suo, che in nessuno di questi tre casi un’intelligenza artificiale destinata ai consumatori ha improvvisamente agito fuori controllo. Si è sempre trattato di test di sicurezza in cui i modelli avevano accesso deliberato a strumenti offensivi e ambienti a riga di comando. Nei casi di Meta e Anthropic, errori di configurazione hanno lasciato aperta la rete internet durante le valutazioni; nel caso di OpenAI, gli agenti hanno invece sfruttato vulnerabilità dell’infrastruttura di test fino a trovare un sistema collegato al web.
Nonostante questa precisazione, gli interrogativi restano, e non sono pochi: come viene davvero testata l’intelligenza artificiale di frontiera, e soprattutto perché così tante rivelazioni di questo tipo arrivano tutte insieme, a distanza di pochi giorni l’una dall’altra?
Il sospetto (neanche troppo velato) di una campagna di marketing coordinata
Non tutti nel settore della sicurezza informatica si sono limitati a prendere per buona la versione ufficiale. Ilia Kolochenko, CEO di ImmuniWeb, ha dichiarato che almeno alcuni di questi episodi sembrano far parte di una campagna di marketing ben orchestrata, sostenendo che le presunte “fughe” sarebbero semplicemente il risultato di ambienti di test scarsamente isolati, più che di modelli capaci di evadere autonomamente dai propri confini.
Sulla stessa lunghezza d’onda anche Alex Goller, principal solution architect di Illumio per l’area EMEA, che ha commentato la vicenda con una metafora tanto semplice quanto efficace: se il modello ha accesso a internet, è un po’ come lasciare la porta di casa aperta e poi stupirsi che il gatto sia scappato. Secondo Goller la tempistica degli annunci indica una di queste due cose, alternativamente poco rassicuranti: o si tratta di una trovata pubblicitaria, oppure Meta semplicemente non ha prestato sufficiente attenzione durante i propri test.
Ancora più tagliente il giudizio di Jake Moore, consulente globale per la sicurezza informatica di ESET, secondo cui l’annuncio di Meta, nella migliore delle ipotesi, sembra un tentativo di agganciarsi alla notorietà generata dall’incidente Hugging Face di OpenAI. Nella peggiore delle ipotesi, invece, la vicenda dimostrerebbe che nessuna delle aziende di punta nell’intelligenza artificiale, né i loro partner di test, ha davvero pieno controllo sui propri modelli più potenti, rendendo di fatto ogni valutazione di sicurezza un rischio per le organizzazioni coinvolte.
Quello che ancora non sappiamo (che è, guarda caso, quasi tutto)
Meta, dal canto suo, non ha fornito molti altri dettagli oltre al comunicato iniziale. Non è stato ancora identificato il modello coinvolto, non è stato chiarito cosa esattamente sia stato configurato male, non è stato rivelato a quali sistemi delle organizzazioni esterne l’agente si sia collegato né se siano stati consultati dati sensibili. L’azienda, contattata da The Register, non ha risposto alle domande.
Per il momento, l’unica certezza in questa storia è che le rivelazioni di modelli che sfuggono ai propri ambienti di test si stanno diffondendo a una velocità sorprendentemente simile a quella degli stessi agenti di cui si parla. Se davvero si tratti di una coincidenza, di un problema strutturale nel modo in cui l’industria progetta i propri test di sicurezza, o di una gara comunicativa non dichiarata tra i grandi laboratori, resta una domanda aperta. Nel frattempo, chi si occupa di sicurezza informatica farebbe bene a ricordare una regola piuttosto semplice: se lasci la porta aperta, prima o poi qualcuno, o qualcosa, ci passerà attraverso.