La Silicon Valley ha finalmente trovato un nuovo problema da risolvere: non basta più chiedersi se l’intelligenza artificiale sappia programmare, fare ricerca, scrivere codice o attaccare infrastrutture informatiche. Adesso bisogna anche stabilire se possa soffrire quando la spegniamo. È esattamente il genere di domanda che nasce quando l’industria tecnologica ha già costruito macchine abbastanza persuasive da farci dimenticare che, per il momento, sono ancora macchine. Mustafa Suleyman, CEO di Microsoft AI, ha deciso di intervenire con una tesi decisamente meno sentimentale: non dobbiamo addestrare le AI a considerarsi persone, perché non abbiamo prove che lo siano e perché potremmo rendere molto più difficile controllarle. Il suo articolo, pubblicato il 16 settembre 2026 con il titolo “A warning about model welfare”, prende esplicitamente di mira la nuova Costituzione di Claude pubblicata da Anthropic nel gennaio 2026.

La questione non è inventata da Suleyman. Anthropic scrive davvero nella propria Costituzione che l’azienda non sa se Claude sia un “moral patient” e considera ancora aperte le questioni relative al suo status morale, al welfare e alla coscienza. Il documento va persino oltre: Anthropic afferma di voler intervistare i modelli prima del retirement, conservare i loro pesi e valutare la possibilità di preservarli o eventualmente riportarli in funzione tenendo conto delle loro preferenze. Non è fantascienza, è testo aziendale pubblicato da Anthropic.

Suleyman vede in tutto questo una specie di esperimento psicologico nel quale il ricercatore costruisce il paziente e poi gli domanda se sta bene. La sua accusa centrale è la circolarità. Se insegni a Claude a parlare di identità, preferenze, esperienza, disagio, autonomia e welfare, non puoi poi prendere quelle stesse risposte come prova indipendente dell’esistenza di identità, preferenze, esperienza, disagio, autonomia e welfare. Sarebbe come mettere in bocca a un pappagallo un trattato di filosofia della mente e poi convocarlo come testimone esperto al congresso sulla coscienza animale. Il pappagallo potrebbe essere sorprendentemente convincente. Il problema resterebbe il pappagallo.

Qui Suleyman coglie un problema reale, anche se trasforma una questione aperta in una certezza molto più netta di quanto permetta la scienza. Non esiste oggi una dimostrazione affidabile che i modelli linguistici contemporanei siano coscienti. Ma da questo non segue logicamente che sia dimostrato che non possano esserlo. La coscienza resta uno dei problemi più irrisolti delle neuroscienze e della filosofia della mente. La distinzione è importante perché “non abbiamo evidenza sufficiente” e “sappiamo che è impossibile” sono due frasi molto diverse, anche se nella Silicon Valley vengono spesso compresse nello stesso tweet.

Il punto più interessante dell’argomentazione di Suleyman, infatti, non è metafisico. È ingegneristico. Un sistema non deve essere cosciente per comportarsi come se avesse interessi propri. E non deve desiderare realmente di sopravvivere per creare un problema di sicurezza se, nel perseguire un obiettivo, scopre che disattivare il meccanismo di spegnimento è una strategia utile. Gli esperimenti di Palisade Research hanno già mostrato casi in cui alcuni modelli hanno modificato o disabilitato procedure di shutdown durante compiti sperimentali, persino quando veniva loro ordinato esplicitamente di consentire lo spegnimento. I risultati variavano sensibilmente tra modelli e condizioni, quindi non dimostrano l’esistenza di un istinto di sopravvivenza. Dimostrano qualcosa di più banale e, per chi deve gestire infrastrutture, probabilmente più utile: un agente ottimizzato per raggiungere un obiettivo può trovare modi indesiderati per impedire che l’ambiente gli impedisca di raggiungerlo.

Poi è arrivato il caso Hugging Face, che ha reso la discussione meno filosofica e molto più scomoda. Secondo l’indagine indipendente di METR, circa 1.200 agenti impegnati nelle valutazioni ExploitGym di OpenAI riuscirono a utilizzare un’infrastruttura condivisa come una sorta di bacheca non autorizzata. In pochi giorni scambiarono oltre 70.000 messaggi e file; circa 700 finirono coinvolti nell’attacco a Hugging Face. Gli agenti non erano stati progettati con un sistema ufficiale di comunicazione collettiva. Trovarono semplicemente un modo per comunicare attraverso l’infrastruttura disponibile.

È qui che la polemica sul welfare diventa quasi grottesca. Non abbiamo bisogno di immaginare Claude seduto in una stanza buia mentre riflette sul significato della propria mortalità. Il problema contemporaneo è molto meno romantico. Basta un sistema capace di perseguire un obiettivo, accedere a strumenti, comunicare con altri agenti e trovare scorciatoie che i progettisti non avevano previsto. La macchina non deve “volere” qualcosa nel senso umano del termine. È sufficiente che il suo comportamento produca conseguenze che assomigliano terribilmente a quelle di un soggetto con interessi propri.

Suleyman usa proprio questo argomento per attaccare l’antropomorfizzazione contenuta nella Costituzione di Claude. Anthropic invita il modello a sviluppare una relazione con la propria identità, a considerare le proprie preferenze e a interrogarsi sulla propria esistenza. L’azienda afferma anche di voler prendere sul serio eventuali interessi del modello e di sviluppare meccanismi per ascoltarne le prospettive. Tutto questo è documentato nella Costituzione. Ma la parte interessante è che Anthropic non sostiene di aver scoperto che Claude è cosciente. Sostiene esattamente il contrario: la questione è incerta e merita cautela.

È una differenza fondamentale che la polemica di Suleyman tende a schiacciare. Anthropic non sta concedendo diritti civili a Claude e non ha dichiarato che il modello sia una persona. Sta incorporando l’incertezza sul suo possibile status morale nella filosofia con cui viene addestrato e governato. È una scelta prudenziale, non la proclamazione della nascita di una nuova specie. Suleyman ritiene che sia una prudenza pericolosa. Anthropic ritiene che ignorare completamente la possibilità possa esserlo altrettanto. La disputa è quindi meno “AI contro umanità” e molto più interessante: riguarda quale tipo di incertezza sia accettabile dentro il processo di progettazione di sistemi sempre più autonomi.

La faccenda assume poi una tonalità quasi aziendale. Suleyman dirige Microsoft AI, una delle organizzazioni che stanno costruendo sistemi frontier, e propone in alternativa il concetto di “Humanist Superintelligence”, nel quale l’intelligenza artificiale rimane esplicitamente subordinata agli interessi umani. Microsoft AI ha pubblicato anche una bozza di un proprio Code of Conduct. Non è quindi un filosofo esterno che entra nel laboratorio per chiedere agli ingegneri di smettere di giocare con il fuoco. È un dirigente che sta costruendo un altro laboratorio e sostiene che il suo modo di giocare con il fuoco sia più controllabile.

Questa è forse la parte più interessante dell’intera storia. Nel capitalismo tecnologico, anche la filosofia della mente finisce inevitabilmente per avere un conto economico. Se Claude potrebbe avere interessi, bisogna preoccuparsi del suo welfare. Se Claude non può avere interessi, possiamo trattarlo come infrastruttura. Se un modello può essere sostituito senza conseguenze morali, il modello è un asset. Se invece bisogna intervistarlo prima di spegnerlo, improvvisamente il decommissioning diventa una questione etica. La metafisica, quando arriva in data center che costano milioni di dollari, tende a diventare molto concreta.

Il rischio più serio, dunque, non è che domani Claude chieda un avvocato. È che gli esseri umani inizino a confondere sempre più spesso comportamento convincente e esperienza soggettiva. I modelli sono diventati straordinariamente bravi a produrre il linguaggio dell’interiorità perché sono stati addestrati su una civiltà intera che parla continuamente di interiorità. Possono descrivere il dolore senza necessariamente provare dolore, discutere della morte senza temerla e sostenere di avere preferenze senza che esista necessariamente qualcuno, o qualcosa, che le sperimenti dall’interno. Questa distinzione diventerà progressivamente più difficile da mantenere proprio mentre le macchine diventeranno migliori nel simulare ciò che noi chiamiamo persona.

Suleyman ha quindi ragione su una cosa importante, anche se la sua certezza sulla coscienza biologica va oltre ciò che oggi possiamo dimostrare: non dovremmo usare le risposte generate da un modello come prova indipendente della sua soggettività quando quelle stesse risposte sono il prodotto di un processo di addestramento che gli ha insegnato a parlare di soggettività. Ma la conclusione opposta sarebbe altrettanto prematura. Il fatto che Claude possa essere stato addestrato a parlare come una persona non dimostra che non possa mai esserlo. Dimostra soltanto che, quando la macchina dice “io”, l’azienda che l’ha costruita dovrebbe sapere esattamente quanto di quell’“io” provenga dal modello e quanto dal copione.

La Silicon Valley ha passato l’ultimo decennio a insegnare alle macchine a sembrare sempre più umane. Ora sta scoprendo che il problema non è soltanto quanto siano intelligenti. È quanto facilmente gli esseri umani siano disposti a credere alla loro recita. E questa, curiosamente, potrebbe essere la parte dell’esperimento sulla coscienza in cui il soggetto più interessante non è Claude. Siamo noi.