L’anonimato su Internet non è finito, ma la sua vecchia forma di protezione, quella che potremmo chiamare “oscurità pratica”, è diventata molto più fragile. Un gruppo di ricercatori di ETH Zurich, MATS e Anthropic ha dimostrato che i grandi modelli linguistici possono essere utilizzati per ricostruire l’identità reale associata a profili pseudonimi, sfruttando esclusivamente informazioni pubbliche e senza ricorrere a intrusioni informatiche, database rubati o accessi privilegiati. Il risultato è interessante proprio perché non descrive una nuova tecnica di hacking. Descrive qualcosa di molto più banale e, per questo, più inquietante: un sistema capace di leggere ciò che abbiamo scritto, collegare gli indizi, cercare corrispondenze sul Web e formulare un’ipotesi sull’identità dell’autore. In altre parole, l’AI non deve necessariamente violare la nostra privacy. Può semplicemente diventare molto brava a sommare le informazioni che abbiamo già regalato al mondo.

Lo studio, intitolato “Large-scale online deanonymization with LLMs”, è stato pubblicato inizialmente su arXiv nel febbraio 2026 ed è stato successivamente presentato nel programma di USENIX Security 2026. Gli autori sono Simon Lermen, Daniel Paleka, Joshua Swanson, Michael Aerni, Nicholas Carlini e Florian Tramèr; il gruppo comprende ricercatori di MATS, ETH Zurich e Anthropic. La ricerca parte da una constatazione che per chi lavora nella sicurezza informatica dovrebbe essere quasi ovvia, ma che il Web commerciale ha preferito dimenticare: uno pseudonimo non equivale a un’identità separata. Un account può non contenere nome e cognome, ma può contenere una combinazione di professione, città, interessi, abitudini linguistiche, eventi personali, competenze tecniche, riferimenti geografici e dettagli apparentemente insignificanti che, presi insieme, diventano una firma.

La novità tecnologica consiste nella capacità di automatizzare l’intero processo. I ricercatori descrivono una pipeline articolata in quattro fasi, indicata come Extract, Search, Reason e Calibrate. Nella prima fase il modello estrae dagli interventi pubblicati gli elementi che possono avere valore identificativo. Nella seconda utilizza rappresentazioni semantiche e ricerca per individuare potenziali corrispondenze. Nella terza analizza i candidati e verifica la coerenza tra gli indizi disponibili. Nella quarta cerca di calibrare la propria confidenza, riducendo il numero di identificazioni quando le evidenze non sono sufficienti. È una differenza sostanziale rispetto ai vecchi sistemi di deanonymization, che spesso richiedevano dataset strutturati, caratteristiche selezionate manualmente e un investigatore umano. Qui il materiale di partenza può essere semplicemente testo non strutturato.

Uno degli esperimenti ha collegato profili pseudonimi di Hacker News a profili LinkedIn utilizzando informazioni pubbliche e dati di riferimento disponibili nei profili. In questo scenario, i metodi basati su LLM hanno raggiunto fino al 68% di recall mantenendo una precisione del 90%, mentre i metodi classici utilizzati come baseline hanno ottenuto risultati prossimi allo zero in condizioni comparabili. Il dato va letto con attenzione: recall e precision non significano che il 68% di tutti gli utenti anonimi di Internet possa essere identificato. Misurano invece la capacità del sistema all’interno degli specifici dataset costruiti dai ricercatori, dove esisteva una ground truth necessaria per verificare il risultato. La differenza fra questi due significati è enorme, ed è precisamente il punto che tende a scomparire quando un paper scientifico attraversa la macchina dei social network.

La ricerca ha inoltre considerato corrispondenze fra utenti Reddit appartenenti a comunità differenti e una situazione ancora più interessante, nella quale la cronologia dello stesso utente viene separata temporalmente per verificare se due porzioni della sua attività possano essere ricondotte alla stessa persona. Il problema, quindi, non è soltanto trovare un nome e cognome. È riconoscere la continuità comportamentale di una persona attraverso contesti diversi. Una battuta ricorrente, un interesse specialistico, una particolare combinazione di hobby, un modo di descrivere il proprio lavoro o un riferimento locale possono sembrare irrilevanti presi singolarmente; un modello linguistico può invece trattarli come caratteristiche di un vettore identitario e cercare la stessa configurazione altrove.

Qui arriva la parte economicamente più interessante. La capacità di deanonymization non deve essere soltanto tecnicamente possibile; deve diventare abbastanza economica da poter essere utilizzata su larga scala. Il valore strategico degli LLM sta esattamente in questo passaggio. Un investigatore umano può impiegare ore per leggere forum, confrontare profili, cercare riferimenti e valutare ipotesi. Un agente dotato di accesso al Web può trasformare questa sequenza in una procedura automatizzata e ripetibile. Il problema della privacy digitale non cambia soltanto perché aumenta la precisione degli algoritmi; cambia perché diminuisce il costo marginale dell’investigazione. Quando il costo di cercare una persona passa da ore di lavoro umano a pochi dollari di calcolo e accesso ai servizi, cambia anche la classe di persone che può diventare un bersaglio. È una vecchia legge dell’informatica: ciò che prima era possibile ma troppo costoso diventa improvvisamente una pratica comune quando il costo crolla.

Questo non significa che ogni account anonimo sia oggi identificabile con un prompt. Il paper stesso mostra limiti importanti e gli esperimenti utilizzano dataset nei quali l’identità reale può essere verificata. L’accuratezza diminuisce quando cresce enormemente il numero dei candidati e quando gli utenti condividono pochi segnali distintivi. La ricerca non dimostra quindi che l’anonimato sia matematicamente impossibile, né che un modello possa automaticamente identificare qualsiasi utente di Reddit, X o Telegram. Dimostra qualcosa di più preciso: gli LLM hanno abbassato drasticamente la barriera tecnologica necessaria per tentare la deanonymization su testo pubblico non strutturato.

Il precedente storico è significativo. Nel 2008 Arvind Narayanan e Vitaly Shmatikov mostrarono che il dataset apparentemente anonimo del Netflix Prize poteva essere collegato a informazioni pubbliche presenti su IMDb utilizzando un numero relativamente ridotto di preferenze cinematografiche. La lezione era già chiara: l’anonimizzazione di un dataset non protegge necessariamente dall’incrocio con altre fonti. Nel 2016 Yves-Alexandre de Montjoye e altri ricercatori mostrarono inoltre quanto pochi punti di informazione possano essere sufficienti per distinguere individui all’interno di dataset di mobilità. Gli LLM aggiungono un ingrediente che mancava a molte delle tecniche precedenti: la capacità di lavorare direttamente con linguaggio naturale, contesto, ambiguità e informazioni qualitative. La macchina non deve più soltanto confrontare colonne. Può interpretare la storia che quelle colonne raccontano.

Il cambiamento più importante riguarda quindi il concetto stesso di pseudonimo. Per molto tempo abbiamo considerato l’identità digitale come una serie di compartimenti: account personale, account professionale, nickname Reddit, profilo GitHub, commenti sui forum. Il modello linguistico tende invece a vedere un’unica persona dietro tutti quei frammenti, perché non ragiona necessariamente per account ma per similarità semantica e combinazione di attributi. La privacy online è stata costruita in larga parte sull’idea che nessuno avesse il tempo, la capacità o l’interesse di ricomporre quei frammenti. Gli LLM stanno trasformando quella che era una protezione economica e cognitiva in un problema di automazione.

La conseguenza riguarda soprattutto gli utenti per i quali lo pseudonimo non è un vezzo da forum, ma una forma di protezione. Attivisti, whistleblower, persone che discutono di salute o sessualità, lavoratori che commentano pubblicamente il proprio settore, migranti, giornalisti, ricercatori e semplici cittadini che preferiscono separare la propria identità professionale dalla propria presenza online possono trovarsi davanti a un nuovo modello di rischio. Il punto non è che l’intelligenza artificiale “sappia chi siamo”. Il punto è che può diventare estremamente efficiente nel dimostrare che due pezzi della nostra vita digitale appartengono alla stessa persona.

La risposta non può essere l’illusione di cancellare Internet. La strategia più realistica consiste nel considerare ogni informazione pubblicata come un possibile elemento di correlazione futura. Città, datore di lavoro, settore professionale, eventi familiari, animali domestici, hobby molto specifici, fotografie, orari abituali e dettagli biografici non sono necessariamente identificativi individualmente, ma possono diventarlo quando vengono aggregati. Il problema della privacy nell’era degli agenti AI non è quindi soltanto ciò che pubblichiamo, ma la capacità automatizzata di collegare ciò che abbiamo pubblicato in momenti diversi e con identità diverse. Il Web aveva trasformato la memoria in un archivio; gli LLM stanno trasformando quell’archivio in un investigatore.

Il paper di riferimento è “Large-scale online deanonymization with LLMs” di Simon Lermen, Daniel Paleka, Joshua Swanson, Michael Aerni, Nicholas Carlini e Florian Tramèr, arXiv:2602.16800, pubblicato il 18 febbraio 2026 e successivamente presentato a USENIX Security 2026. Il lavoro è disponibile su arXiv e la relativa presentazione scientifica è disponibile presso USENIX Security 2026. Tra i precedenti citati dagli stessi autori figura “Robust De-anonymization of Large Sparse Datasets” di Narayanan e Shmatikov, relativo al caso Netflix, mentre il lavoro sulla mobilità di de Montjoye et al. costituisce un altro riferimento fondamentale nella storia della ricerca sulla re-identificazione dei dati.

Di Beatrix Daros Trivium International