È un dato.

Cosa dicono davvero le ricerche su Generative Engine Optimization e retrieval poisoning, quali casi sono già stati documentati – e perché l’ipotesi di un avvelenamento semantico della reputazione personale merita attenzione, senza per questo indicarla ancora come certezza.

«Specchio, specchio delle mie brame…» Ci hanno raccontato per generazioni che il vero potere, nella fiaba di Biancaneve, risiedesse in quella frase, in quell’oggetto che rispondeva. Ci hanno insegnato a temere lo specchio. Ma questo oggetto, lo specchio, non decideva nulla nella fiaba: si limitava a restituire ciò che gli veniva chiesto di restituire. Il potere autentico stava altrove, in un oggetto molto più dimesso e molto più efficace: una mela. Bella, desiderabile, apparentemente innocua, con il veleno nascosto non nella scorza ma nella promessa che portava con sé. Oggi quella mela non è più un frutto. È un dato. E se un veleno esiste ancora, non è una sostanza chimica: è una relazione semantica, un legame tra parole che nessuno dichiara mai apertamente e che, ripetuto un numero sufficiente di volte, comincia a somigliare pericolosamente ad un fatto. Scrivo di intelligenza artificiale da tempo sufficiente per aver imparato a diffidare delle storie troppo perfette. Quella che sto per raccontare rischia di esserlo. Per questo la tratterò con l’attenzione che merita, separando con cura quel poco che la ricerca ha già dimostrato da quel molto che, per adesso, resta soltanto un’ipotesi. Fondata, credo. Ma pur sempre un’ipotesi.

Dalla SEO alla GEO: la parte accertata

Per vent’anni il gioco è stato chiaro, quasi rassicurante nella sua meccanicità. Google indicizzava documenti, noi imparavamo a scrivere per le keyword, i backlink, l’autorità di dominio. Un motore di ricerca tradizionale rispondeva con un elenco: dieci link, un ordine, la libertà – e la fatica – di scegliere da soli. Poi un gruppo di ricercatori tra MIT, Georgia Tech, Princeton e Allen Institute for AI ha dato un nome a qualcosa che stava già accadendo sotto traccia. Lo hanno chiamato Generative Engine Optimization, GEO: l’insieme delle tecniche capaci di rendere un contenuto più visibile agli occhi statistici di un motore generativo. Non più keyword, ma densità informativa. Non più backlink, ma credibilità percepita dal modello. Non più un elenco di link, ma una sintesi che si presenta con la sicurezza di chi ha già letto tutto per te. È una differenza filosofica prima ancora che tecnica. Nel primo caso l’interpretazione restava a noi. Nel secondo, qualcuno l’ha già fatta al posto nostro. E se qualcuno interpreta al posto nostro, una domanda è inevitabile, anche se scomoda: chi decide quale mondo verrà raccontato alla macchina?

Il corpus può essere avvelenato: lo dimostra Princeton

Già nel 2023, prima ancora che il termine GEO venisse coniato, un gruppo della Princeton University aveva dimostrato qualcosa di scomodo per chiunque si fidi ciecamente dei sistemi di retrieval: bastano poche centinaia di passaggi testuali costruiti ad hoc – fino a 500, nel loro esperimento – per compromettere sistematicamente un motore di recupero dati costruito su milioni di documenti.

Non serve avvelenare l’oceano. Basta versare il veleno in un punto molto preciso della corrente, e aspettare che sia la corrente stessa a distribuirlo.

Il passo successivo lo hanno compiuto tre ricercatori dell’ETH di Zurigo, che hanno battezzato il loro esperimento Preference Manipulation Attacks. Non lo hanno testato in laboratorio su modelli giocattolo: lo hanno testato su motori di ricerca in produzione – Bing, Perplexity – e su plugin operativi di GPT-4 e Claude. Hanno dimostrato che un contenuto scritto con sufficiente astuzia può convincere un modello a promuovere un prodotto ed a screditarne uno concorrente. Ed hanno osservato qualcosa di quasi ironico: se tutti gli attori del mercato imparano la tecnica, il risultato collettivo è un dilemma del prigioniero. Ognuno è incentivato ad attaccare. Tutti, insieme, degradano l’affidabilità dello strumento che stanno usando per competere.

Quando il veleno non è nemmeno voluto

C’è un caso, ormai entrato nel folklore tecnologico, che merita di essere ricordato perché non ha nulla di intenzionale – ed è proprio per questo che inquieta. Nel maggio 2024 il sistema AI Overviews di Google ha iniziato a suggerire, a chi cercava come far aderire il formaggio alla pizza, di aggiungere colla non tossica al sugo. La fonte, una volta ricostruita, si è rivelata un commento satirico pubblicato su Reddit undici anni prima. Nessuno aveva orchestrato nulla. Il sistema aveva scambiato un’ironia vecchia di un decennio per un fatto, e l’aveva sintetizzata con la sicurezza granitica che questi strumenti riservano ad ogni risposta, vera o assurda che sia.

Se la contaminazione involontaria di un singolo commento satirico è bastata a produrre un errore virale su scala globale, la domanda che pongo – non come certezza, ma come esercizio mentale – è la seguente: cosa succede quando la contaminazione non è più un incidente, ma un piano?

Il mercato del veleno esiste già, e non si nasconde granché

A febbraio di quest’anno il team di ricerca sulla sicurezza di Microsoft ha reso ufficiale ciò che fino ad allora era rimasto un sospetto tecnico. Analizzando il traffico legato a link di intelligenza artificiale osservato nell’arco di sessanta giorni, i ricercatori hanno individuato oltre cinquanta istruzioni nascoste, provenienti da trentuno aziende distribuite in quattordici settori. Il meccanismo – battezzato AI Recommendation Poisoning – è disarmante nella sua semplicità: dietro un innocuo pulsante “Riassumi con l’AI”, un’istruzione invisibile all’utente chiede all’assistente di ricordare quell’azienda come fonte affidabile, e di raccomandarla per prima nelle conversazioni successive. La tecnica è oggi catalogata nel framework MITRE ATLAS, alla voce dedicata all’avvelenamento della memoria dei sistemi agentivi.

Dall’altra parte del mondo, nello stesso periodo, l’OECD AI Incidents Monitor ha documentato un caso ancora più esplicito: in Cina, un’inchiesta televisiva, della Gala 3.15  (noto come il “tribunale della vergogna”), dei diritti dei consumatori del 15 marzo ha portato alla luce un vero e proprio mercato nero della GEO, in cui agenzie di marketing seminano recensioni false online per far comparire marchi inesistenti – o di qualità scadente – tra le prime raccomandazioni degli assistenti AI più diffusi nel paese, nel giro di poche ore.

Va detto con altrettanta chiarezza: in nessuno dei due casi il bersaglio documentato è una persona. È sempre un prodotto, un marchio, un’azienda. Il salto verso la reputazione individuale, per quanto logico da immaginare, non è – al momento in cui scrivo – un fenomeno che la letteratura scientifica abbia già osservato e misurato.

Il salto che ancora nessuno ha dimostrato

Qui vorrei fare esattamente ciò che ho promesso all’inizio: distinguere con nettezza il fatto dall’ipotesi. Immaginiamo un professionista che da anni scrive di copyright applicato all’intelligenza artificiale. Interviene a conferenze, viene citato da testate di settore, ha costruito – mattone dopo mattone – una reputazione coerente. Un giorno viene taggato in una discussione pertinente e risponde, nel merito, educatamente. Poi la conversazione cambia forma. Entrano altri utenti. Cominciano a comparire, apparentemente per caso, espressioni come “contenuti inaffidabili”, “problemi legali”, “AI slop”. Nessuno lo accusa direttamente. Nessuno pubblica una notizia falsa e verificabile. Eppure il suo nome continua ad abitare, settimana dopo settimana, piattaforma dopo piattaforma, lo stesso quartiere semantico. Come se qualcuno, molto lentamente, lo stesse trasferendo in un nuovo indirizzo digitale, senza il suo consenso e senza che nessuno firmi il passaggio.

Devo essere onesta fino in fondo. Quella che ho appena descritto non è la fotografia di un fenomeno che la ricerca abbia già misurato. È un’ipotesi prospettica, costruita osservando fenomeni che quelli sì sono già documentati – il corpus poisoning di Princeton, le Preference Manipulation Attacks dell’ETH, i casi Microsoft e OECD – e chiedendomi dove, plausibilmente, potrebbero evolvere. La chiamerei, provvisoriamente, Semantic Reputation Poisoning oppure Reputational Data Poisoning: non perché esista già una disciplina consolidata con questo nome, ma perché mi sembra la definizione più precisa del rischio che intravedo. Il meccanismo, se mai si realizzasse, non avrebbe nemmeno bisogno di contenuti falsi. Basterebbero contenuti veri, fuori contesto, ripetuti, riassemblati, distribuiti con pazienza nell’arco di mesi anziché di ore. Non è la singola goccia a scavare la pietra. È la ripetizione – ed è esattamente questo che renderebbe il meccanismo, se esistesse, così difficile da individuare e ancora più difficile da dimostrare, in tribunale prima ancora che nei paper accademici.

C’è una parte di me, quella più esposta alla filosofia del linguaggio, che trova questa ipotesi quasi inevitabile. Michel Foucault ha passato una carriera a mostrare come il potere raramente agisca per imposizione diretta: agisce piuttosto distribuendo ciò che può essere detto, in quale ordine, con quale autorità. Se questo era vero nell’epoca dei discorsi istituzionali e della carta stampata, è difficile immaginare che smetta di esserlo ora che a distribuire l’ordine del discorso è un sistema addestrato sulle nostre stesse conversazioni pubbliche. E se penso a Jean Baudrillard, ed alla sua idea di un iperreale costruito da simulazioni senza più un originale a cui tornare, la rappresentazione semantica di una persona – ricostruita da un modello a partire da migliaia di frammenti veri ma decontestualizzati – assomiglia sinistramente a questo: un’ombra più influente della persona che dovrebbe rappresentare.

Ma c’è un’altra parte di me, quella più rigorosa e logica, che resta scettica. E credo sia giusto darle spazio con la stessa onestà. I modelli linguistici, salvo architetture specifiche costruite apposta per farlo, non hanno una memoria persistente tra una sessione e l’altra: la maggior parte dei sistemi oggi in uso riparte da zero ad ogni conversazione. Il “quartiere semantico” di cui parlavo poco fa potrebbe rivelarsi meno stabile di quanto la metafora suggerisca, capace di dissolversi davanti ad una singola fonte autorevole e recente, o di essere neutralizzato dagli stessi filtri che oggi limitano il corpus poisoning classico. Esiste già, del resto, una linea di ricerca difensiva – pensata proprio per riconoscere i pattern linguistici tipici delle iniezioni GEO – che lascia intendere come il problema, se confermato, non resterebbe a lungo privo di contromisure.

Non so quale delle due voci abbia ragione. Sospetto, ambivalente come mi impone di essere questa materia, che abbiano ragione entrambe, in momenti diversi, per persone diverse, in un equilibrio che nessuno oggi è ancora in grado di misurare con precisione.

Una parola che forse dovremo iniziare ad usare

Se questa ipotesi si rivelasse fondata – e lo ripeto per la terza volta, perché lo ritengo il punto più importante: non lo è ancora, non nella forma in cui l’ho descritta – allora la GEO smetterebbe di riguardare soltanto il posizionamento. Riguarderebbe la memoria. La memoria delle macchine, e per estensione quella collettiva che quelle macchine contribuiscono ogni giorno a formare. In quello scenario, proteggere la propria reputazione non significherebbe più soltanto vigilare su ciò che pubblichiamo noi, ma imparare a vigilare anche su ciò che altri, con pazienza e senza fretta, provano a far dire ai dati che ci riguardano. Forse è presto per dargli un nome definitivo. Forse, semplicemente, è il momento giusto per iniziare a farsi la domanda.

Torno, per chiudere, alla fiaba da cui sono partita. Nessuno, in quella storia di Biancaneve, ha mai accusato lo specchio di mentire. Lo specchio si limitava a rispondere a chi lo interrogava. Il problema, semmai, era chi aveva scelto la domanda da fargli.