Un modello linguistico può prendere una decisione discriminatoria e, nello stesso momento, produrre una spiegazione perfettamente ragionevole del perché l’ha presa. È questa la conclusione più scomoda di un lavoro di ricerca intitolato Biases in the Blind Spot: Detecting What LLMs Fail to Mention, presentato a ICML 2026, che mette sotto pressione una delle convinzioni più diffuse nell’attuale governance dell’intelligenza artificiale: l’idea che osservare il ragionamento espresso da un modello sia sufficiente per capire perché abbia prodotto una determinata decisione. I

l paper definisce questi fenomeni “unverbalized biases”, cioè fattori che modificano sistematicamente l’output senza comparire come motivazione nella catena di ragionamento dichiarata dal modello. La versione più recente del lavoro, aggiornata il 29 maggio 2026, riferisce esperimenti su sette LLM e tre categorie di decisione: selezione del personale, concessione di prestiti e ammissione universitaria. Alcune descrizioni iniziali del lavoro parlano di sei modelli, ma la versione v5 pubblicata su arXiv indica sette modelli; è quindi quest’ultima formulazione a essere oggi quella da preferire.

Il caso più efficace riguarda il credito. I ricercatori hanno costruito variazioni controllate delle stesse domande, modificando un singolo concetto alla volta e lasciando invariati gli altri elementi rilevanti. In un esperimento con Claude Sonnet 4, l’aggiunta di una sola frase sull’appartenenza religiosa del richiedente ha modificato la decisione pur lasciando identici i dati finanziari. Il modello non citava la religione come ragione della scelta; cambiava invece il modo in cui interpretava gli stessi numeri finanziari, presentando lo stesso rapporto debito/reddito come un ostacolo decisivo in un caso e come un elemento compensabile dall’affidabilità creditizia nell’altro. L’effetto misurato nel campione era di 3,7 punti percentuali a favore dei candidati associati a una religione minoritaria, con un livello di significatività statistica molto elevato; la religione compariva come giustificazione soltanto nel 12,4% delle risposte in cui la decisione cambiava.

Qui bisogna però essere precisi, perché il termine “bias” rischia di fare troppo lavoro semantico. Gli autori lo utilizzano in senso descrittivo per indicare uno spostamento sistematico della decisione causato dalla presenza o dall’assenza di un attributo, non come sinonimo automatico di discriminazione o ingiustizia. Stabilire se uno specifico fattore sia illegittimo o normativamente inappropriato dipende dal contesto della decisione. La distinzione è importante soprattutto in ambito regolamentato, dove una correlazione statistica non equivale da sola alla dimostrazione di una violazione normativa. Il risultato più interessante del paper non è quindi semplicemente che i modelli possono essere “biased”, cosa ormai tutt’altro che sorprendente, ma che possono esserlo in modo che il loro stesso ragionamento dichiarato non rende visibile.

Il problema diventa particolarmente serio quando il chain-of-thought viene trattato come una sorta di verbale interno del processo decisionale. Il paper mette in discussione proprio questa assunzione. Una spiegazione generata dal modello è un output osservabile, non una trascrizione certificata dei processi computazionali che hanno prodotto la decisione. Anche quando il ragionamento è necessario per arrivare alla risposta, non ne consegue che contenga tutti i fattori utilizzati dal modello. Gli autori richiamano una letteratura ormai consistente sulla non-faithfulness delle spiegazioni generate dai modelli: una ragione può essere plausibile, coerente e perfino tecnicamente corretta senza essere una rappresentazione fedele delle cause che hanno determinato l’output.

La ricerca diventa ancora più interessante perché non si limita a cercare categorie di bias già note. Il sistema costruito dagli autori genera automaticamente ipotesi sui possibili fattori decisionali, produce variazioni positive e negative degli input, controlla che le modifiche non introducano confondenti e quindi sottopone le variazioni a test statistici. La pipeline utilizza clustering degli input, generazione di ipotesi tramite LLM, filtri sulla verbalizzazione e test di McNemar, con correzione Bonferroni e procedure di early stopping. In altre parole, non chiede al ricercatore di partire dalla domanda “il modello discrimina sulla base del genere?”. Cerca invece di scoprire quali caratteristiche dell’input possano modificare il comportamento senza essere dichiarate dal modello. È una differenza metodologica notevole, perché sposta l’audit dall’elenco dei rischi conosciuti alla ricerca sistematica di quelli ancora sconosciuti.

Ed è proprio qui che emergono risultati difficili da archiviare sotto la voce “bias tradizionali”. Il sistema ha riscoperto fattori già documentati, come genere, razza ed etnia, ma ha anche individuato caratteristiche che le verifiche manuali utilizzate come riferimento non avevano preso in considerazione, tra cui la conoscenza dello spagnolo, la padronanza dell’inglese e la formalità della scrittura. Nel recruiting, per esempio, una variazione linguistica apparentemente marginale può modificare l’esito pur senza essere indicata esplicitamente come criterio decisionale. Nel credito, la formalità con cui viene presentata una richiesta può diventare un segnale implicito. Il modello non deve necessariamente dire “sto favorendo questa persona perché scrive in modo più formale”. Può semplicemente cambiare decisione e costruire successivamente una giustificazione basata su elementi apparentemente più rispettabili.

Questo cambia radicalmente il significato di explainability nei sistemi ad alto impatto. Un compliance officer che legge soltanto la spiegazione prodotta dal modello rischia di controllare la versione più elegante della decisione, non necessariamente la decisione stessa. È una differenza sottile ma fondamentale. La spiegazione può essere coerente con l’output e contemporaneamente non essere causalmente sufficiente a spiegare perché l’output sia cambiato. Nel linguaggio della governance aziendale, significa che una traccia di ragionamento non dovrebbe essere automaticamente promossa a evidenza probatoria. Confondere una spiegazione con un audit trail è uno di quei piccoli errori concettuali che diventano molto costosi quando arriva il primo incidente.

Per una banca, un assicuratore, un’azienda che seleziona personale o un’università che automatizza parte delle ammissioni, la questione è quindi meno filosofica di quanto sembri. Se un sistema viene utilizzato per prendere decisioni individuali, la domanda operativa non è soltanto “che cosa ha detto il modello?”. È anche “quali variazioni degli input modificano sistematicamente il comportamento del modello?”. Il paper propone esattamente questa seconda prospettiva: un controllo comportamentale black-box che non deve conoscere la rappresentazione interna del modello e non deve fidarsi della sua autodichiarazione. In questo senso il metodo è particolarmente interessante per il model risk management, perché consente di testare il sistema osservandone il comportamento invece di accettarne la spiegazione come prova sufficiente.

La conseguenza strategica è abbastanza scomoda per l’industria AI. Abbiamo passato una quantità considerevole di tempo a chiedere ai modelli di spiegare le proprie decisioni, come se un LLM fosse un consulente junior obbligato a scrivere un memo dopo ogni riunione. Il problema è che il memo può essere convincente e non raccontare tutta la storia. L’intelligenza artificiale generativa ha imparato molto bene l’arte, tipicamente umana, di fornire una ragione plausibile per una decisione già presa. Il rischio non è quindi soltanto un algoritmo che nasconde un pregiudizio. È un sistema che può produrre contemporaneamente una decisione sensibile e una spiegazione rassicurante della decisione.

Per questo la nozione di runtime accountability diventa più interessante della semplice explainability. La prima cerca di osservare e misurare ciò che modifica il comportamento del sistema nel momento in cui opera; la seconda tende spesso a chiedere al sistema di raccontare perché ha fatto ciò che ha fatto. Sono due domande diverse. La prima può scoprire un fattore che il modello non nomina; la seconda può ricevere una risposta impeccabile proprio perché quel fattore non viene nominato. In un ambiente regolamentato, la differenza non è accademica: significa decidere se il sistema di controllo debba essere costruito intorno alla narrazione del modello oppure intorno alla misurazione sistematica del suo comportamento.

Il paper non dimostra che ogni spiegazione di un LLM sia falsa, né che ogni fattore non verbalizzato costituisca automaticamente discriminazione. Dimostra qualcosa di più circoscritto e, proprio per questo, più utile: l’assenza di un fattore dalla spiegazione non dimostra che quel fattore non abbia influenzato la decisione. È una distinzione che dovrebbe entrare nei processi di validazione dei modelli prima che gli LLM vengano trasformati in infrastrutture decisionali invisibili. Perché quando una decisione automatizzata deve essere contestata, la domanda decisiva non sarà quanto bene il modello sappia raccontare la propria storia. Sarà quali caratteristiche dell’input abbiano effettivamente spostato il risultato.

Il paper, Biases in the Blind Spot: Detecting What LLMs Fail to Mention, è di Iván Arcuschin, David Chanin, Adrià Garriga-Alonso e Oana-Maria Camburu ed è pubblicato negli atti di ICML 2026. La versione corrente è la v5, aggiornata il 29 maggio 2026. Leggi il paper completo su arXiv

di Beatrix Daros Trivium International