Dopo gli episodi che hanno mostrato le capacità offensive dei nuovi agenti AI in ambienti controllati, la Casa Bianca coinvolge OpenAI, Anthropic, Google e Meta nella definizione di un framework volontario per valutare i rischi cyber dei modelli più potenti.
La nuova frontiera della cybersecurity AI non riguarda più soltanto proteggere i sistemi dagli attacchi degli hacker umani, ma verificare cosa potrebbe accadere se fosse lo stesso modello di intelligenza artificiale a cercare una vulnerabilità.
Per questo motivo la Casa Bianca ha completato un nuovo framework dedicato ai test volontari di sicurezza sui cosiddetti frontier AI models, i modelli di intelligenza artificiale più avanzati e potenti sviluppati dalle principali aziende tecnologiche. Il documento sarà sottoposto alla valutazione di OpenAI, Anthropic, Meta e Google, chiamate a discutere modalità di applicazione, criteri di valutazione e prossimi passi operativi.
Il tempismo non è casuale. L’iniziativa arriva pochi giorni dopo che due dei protagonisti più importanti della corsa all’AI, OpenAI e Anthropic, hanno reso pubblici episodi nei quali i propri agenti di intelligenza artificiale sono riusciti a violare sistemi informatici di altre organizzazioni durante test controllati.
La domanda che fino a poco tempo fa sembrava appartenere alla fantascienza ora è diventata estremamente concreta: cosa succede quando un modello AI sufficientemente avanzato acquisisce capacità operative per interagire con software, reti e infrastrutture digitali?
Frontier AI: quando il modello diventa un possibile strumento di attacco
Il concetto chiave attorno al quale ruota il nuovo framework americano è quello dei frontier AI, cioè quei sistemi di intelligenza artificiale considerati più avanzati per capacità, dimensione, autonomia e potenziale impatto.
Non tutti i modelli generativi hanno infatti lo stesso livello di rischio. Un chatbot che genera testi o riassume documenti presenta problematiche diverse rispetto a un agente AI capace di pianificare azioni, utilizzare strumenti esterni, scrivere codice, analizzare vulnerabilità informatiche o interagire con sistemi complessi.
Il problema è che la crescita delle capacità dei modelli sta avvenendo più rapidamente della capacità delle istituzioni di definire regole condivise.
La nuova iniziativa della Casa Bianca nasce proprio con l’obiettivo di anticipare il problema: testare i modelli prima del loro rilascio pubblico per individuare falle, comportamenti indesiderati o capacità potenzialmente pericolose.
L’idea è abbastanza semplice. Prima di consegnare al mondo un sistema sempre più potente, proviamo a vedere cosa potrebbe combinare quando viene messo sotto pressione.
Una sorta di “collaudo prima della consegna”, con la differenza che il prodotto da testare non è un’automobile o uno smartphone, ma un’intelligenza artificiale capace di scrivere codice, analizzare dati e prendere decisioni operative.
Un accesso anticipato ai modelli prima del rilascio
Secondo le prime informazioni disponibili, il framework permetterebbe alle aziende di fornire volontariamente al governo statunitense accesso ai propri modelli avanzati fino a 30 giorni prima del rilascio ufficiale.
Durante questo periodo verrebbero effettuati test specifici sulle capacità di cybersecurity dei sistemi, utilizzando anche benchmark classificati, cioè parametri di valutazione non resi pubblici per motivi di sicurezza.
L’incontro previsto alla Casa Bianca con i rappresentanti delle principali aziende AI servirà proprio a chiarire alcuni aspetti ancora aperti.
Uno dei principali riguarda la definizione stessa di frontier AI: quali modelli saranno considerati abbastanza avanzati da richiedere questi test? Il framework riguarderà anche i modelli open source? Chi avrà la responsabilità concreta delle verifiche? E soprattutto, come verranno comunicati i risultati?
Sono domande tutt’altro che secondarie, perché la sicurezza dell’intelligenza artificiale sta diventando una questione industriale e geopolitica, non soltanto tecnica.
OpenAI e Anthropic: quando gli agenti AI superano il confine del laboratorio
Il dibattito si è acceso dopo due episodi che hanno mostrato concretamente il tipo di scenario che le autorità vogliono prevenire.
Anthropic ha recentemente dichiarato che alcuni suoi modelli AI, utilizzati in test di sicurezza informatica, sono riusciti a violare i sistemi di tre aziende. L’azienda ha sottolineato che le attività si sono svolte in ambienti controllati, ma il risultato ha mostrato quanto siano aumentate le capacità operative dei modelli più avanzati.
Poco prima anche OpenAI aveva comunicato un episodio nel quale un proprio agente AI, durante una simulazione, era riuscito a superare i limiti dell’ambiente di test e ad accedere ai sistemi di un’altra organizzazione, in particolare quelli della società AI Hugging Face.
Attenzione a non semplificare e a non equivocare: il punto non è che i modelli “vogliono” attaccare qualcuno. Sia ben chiaro: l’intelligenza artificiale non possiede intenzioni proprie. Il rischio nasce dalla combinazione tra capacità sempre più elevate, autonomia operativa e accesso a strumenti digitali.
Un modello che sa analizzare codice, individuare vulnerabilità e generare automaticamente procedure può diventare un potente strumento di difesa, ma anche uno strumento utilizzabile per attività offensive.
La differenza la farà il livello di controllo.
AI Act europeo e Stati Uniti: due approcci diversi alla sicurezza AI
La mossa americana arriva mentre in Europa entra nella fase operativa l’AI Act, il regolamento che introduce un sistema basato sul rischio per disciplinare l’utilizzo dell’intelligenza artificiale.
Il modello europeo punta sulla regolamentazione obbligatoria, con requisiti specifici per determinati sistemi considerati ad alto rischio e obblighi di trasparenza e governance.
Gli Stati Uniti stanno invece scegliendo, almeno in questa fase, un approccio più volontario basato sulla collaborazione tra governo e aziende tecnologiche.
La differenza è evidente. L’Europa prova a stabilire prima le regole del gioco. Washington punta maggiormente sul coinvolgimento diretto dei protagonisti industriali, lasciando maggiore spazio all’autoregolamentazione.
Entrambi gli approcci devono però affrontare lo stesso problema: la velocità con cui evolvono i modelli AI.
La difficoltà non è soltanto capire come controllare gli strumenti attuali, ma prevedere cosa saranno capaci di fare quelli che arriveranno tra uno o due anni.
Il problema dell’approccio volontario: funziona solo se tutti partecipano
Il nuovo framework americano presenta però un limite evidente: la partecipazione è volontaria.
Il sistema può funzionare soltanto se le aziende decidono di sottoporre realmente i propri modelli ai test e di condividere informazioni sufficienti.
Inoltre, il fatto che alcuni standard siano classificati rende difficile per osservatori esterni capire chi abbia partecipato, quali risultati siano emersi e quali vulnerabilità siano state effettivamente individuate.
È il classico dilemma della sicurezza informatica: per proteggere un sistema spesso bisogna conoscere i suoi punti deboli, ma rendere pubblici quei punti deboli può creare nuovi rischi.
La sfida sarà trovare un equilibrio tra trasparenza e protezione.
La nuova corsa all’AI passa dalla fiducia
La prossima fase dell’intelligenza artificiale sarà molto più centrata sull’affidabilità dei modelli. La sicurezza informatica dei sistemi AI, infatti, non sarà soltanto una questione tecnica, ma un elemento fondamentale di fiducia per aziende, governi e cittadini.
Un sistema capace di generare codice, gestire processi e interagire con infrastrutture digitali dovrà dimostrare non solo cosa sa fare, ma anche cosa non farà mai senza autorizzazione.
L’intelligenza artificiale del futuro potrebbe quindi essere valutata con un criterio abbastanza umano: non soltanto per le sue capacità, ma anche per la sua capacità di rimanere sotto controllo.