Il web sta diventando una macchina che scrive a se stessa. Secondo una ricerca pubblicata da Pew Research Center nell’agosto 2026, circa una pagina web in lingua inglese su dieci presenta segnali significativi compatibili con una produzione o assistenza dell’intelligenza artificiale. Se il campione viene ristretto alle pagine pubblicate dopo il lancio di ChatGPT, nel novembre 2022, la quota sale a circa il 35%. Non significa che un terzo di Internet sia stato scritto interamente da un modello linguistico, distinzione tutt’altro che secondaria, ma indica qualcosa di più interessante: l’AI è ormai entrata nella catena industriale della produzione editoriale e non sembra avere alcuna intenzione di uscirne.

La ricerca di Pew, realizzata analizzando centinaia di migliaia di pagine provenienti da Common Crawl e utilizzando Open Pangram, non cerca una firma nascosta lasciata da ChatGPT in fondo all’articolo. Analizza invece pattern statistici e linguistici che sono diventati più frequenti nell’era dei modelli generativi. Alcune parole, alcune costruzioni sintattiche e perfino determinate abitudini di punteggiatura risultano più presenti nei testi recenti. L’em dash, per esempio, è diventato una specie di piccolo fossile digitale dell’epoca dei chatbot; alcune parole come “delve”, “interplay” e “testament” hanno aumentato sensibilmente la propria frequenza, mentre forme di negative parallelism, come “non è soltanto X, ma Y”, risultano molto più comuni rispetto al passato.

Naturalmente non basta un trattino lungo per incriminare uno scrittore. Sarebbe una versione linguistica della frenologia, con il detector al posto del cranio. Il punto della ricerca è statistico, non forense. Un testo può essere stato scritto da un essere umano e risultare compatibile con lo stile dei modelli; un testo può essere stato generato da un modello e successivamente riscritto da un editor fino a diventare difficilmente riconoscibile. La distinzione fra AI-generated e AI-assisted, quindi, è destinata a diventare sempre più importante, soprattutto mentre aziende, editori e motori di ricerca cercano un modo affidabile per misurare la presenza dell’intelligenza artificiale nei contenuti.

La distribuzione del fenomeno è forse ancora più significativa della percentuale complessiva. I domini commerciali .com mostrano segnali di paternità AI a un ritmo molto superiore rispetto ai domini .edu e .gov, dove la percentuale rimane intorno all’1%. I siti .org si collocano in una posizione intermedia. Nel 2021 le differenze erano molto più contenute; negli anni successivi la divergenza è diventata evidente. Non serve essere un economista di Harvard per capire il motivo. Un sito commerciale ha un incentivo diretto a produrre contenuti in quantità: traffico, pubblicità, affiliazioni, lead generation, e-commerce e visibilità sui motori di ricerca hanno trasformato il testo in un asset industriale.

L’intelligenza artificiale ha semplicemente eliminato una parte enorme del costo di produzione. Prima servivano redattori, copywriter, traduttori, revisori e qualche stagista sacrificabile. Ora basta un modello linguistico, qualche prompt, un CMS e una connessione API. La Silicon Valley lo chiama aumento della produttività. Il web potrebbe chiamarlo saturazione.

Il problema economico è infatti paradossale. Quando il costo marginale della produzione di contenuti tende verso lo zero, il contenuto perde parte del proprio valore proprio perché diventa abbondante. La scarsità si sposta altrove. Non è più difficile produrre mille articoli; è difficile produrre un articolo che meriti di essere ricordato, citato, verificato e utilizzato come fonte. L’AI ha trasformato la scrittura in una commodity e, contemporaneamente, ha aumentato il valore della reputazione di chi scrive.

Questo è il punto nel quale la discussione sull’AI slop smette di essere una questione estetica e diventa una questione infrastrutturale. Un Internet pieno di testi generati automaticamente non è soltanto più noioso. È un ambiente nel quale i sistemi di ricerca devono spendere sempre più capacità computazionale per distinguere informazione originale, riscrittura, aggregazione, contenuto commerciale e pura produzione sintetica. Google, Microsoft, OpenAI e gli altri grandi operatori dell’AI stanno costruendo sistemi che devono rispondere a una domanda apparentemente semplice: quali fonti meritano di essere utilizzate per costruire una risposta?

La risposta non può essere semplicemente “quelle scritte da esseri umani”. Anche perché l’essere umano ha prodotto per secoli una quantità sorprendente di materiale mediocre senza alcun aiuto della tecnologia. Un articolo umano non è automaticamente autorevole, così come un testo assistito dall’AI non è automaticamente inutile. La discriminante sarà sempre più nella qualità delle fonti, nella trasparenza, nell’esperienza, nell’originalità dell’analisi e nella responsabilità editoriale.

La seconda ricerca riportata in questi giorni, quella di Originality.ai sui libri religiosi pubblicati su Amazon, porta il problema fuori dal web editoriale e dentro l’economia dell’editoria. L’azienda ha analizzato 2.034 titoli appartenenti a quattordici categorie religiose e di credo, classificandone 1.272, pari al 63%, come “Likely AI”. La percentuale sarebbe particolarmente elevata nelle categorie Wicca, Witchcraft & Paganism, Hinduism e Taoism. Ma anche in questo caso occorre usare il dato con prudenza: si tratta di una classificazione probabilistica prodotta da un detector, non della prova che quei libri siano stati materialmente scritti da un modello.

La cautela è necessaria perché i detector di AI hanno già dimostrato di poter prendere cantonate spettacolari. Test condotti su testi storici e documenti autenticamente umani hanno prodotto risultati incompatibili tra loro. In un mondo nel quale un sistema può classificare un testo umano come generato dall’AI e un altro può classificarlo come umano al 100%, utilizzare il detector come tribunale definitivo sarebbe una pessima idea. L’AI detection è uno strumento statistico, non una macchina della verità.

Il fenomeno dei libri religiosi, tuttavia, rimane interessante anche se si eliminasse completamente il numero del 63%. Mostra quanto rapidamente l’AI possa essere utilizzata per trasformare micro-nicchie editoriali in mercati industriali. Una volta che un algoritmo può generare descrizione, biografia dell’autore, struttura del libro, capitoli, metadata e materiali promozionali, il limite non è più la capacità di scrivere. È la capacità di trovare un mercato disposto a comprare.

La conseguenza è quasi grottesca. Il libro, uno degli oggetti simbolici più antichi della cultura umana, rischia di diventare un prodotto programmatico destinato a intercettare una keyword. “Manuale sulla guarigione attraverso i cristalli” può essere prodotto come contenuto culturale, come esperienza personale oppure come semplice combinazione statistica di parole associate a una domanda commerciale. Il consumatore vede una copertina, un titolo, una descrizione e una promessa. Dietro potrebbe esserci un autore, un gruppo di autori, un ghostwriter o un modello linguistico. Il mercato non sempre lo sa e, in molti casi, non sembra particolarmente interessato a scoprirlo.

Questo introduce una questione molto più seria della semplice autenticità letteraria: la fiducia. Quando un lettore acquista un libro, legge un articolo o consulta una pagina web, presume implicitamente che dietro quelle parole esista una responsabilità. L’intelligenza artificiale separa invece facilmente produzione e responsabilità. Il modello genera il testo, il sito lo pubblica, l’editore monetizza e il lettore attribuisce implicitamente autorevolezza a una voce che forse non esiste.

Per l’editoria digitale questa trasformazione è radicale. Per anni la strategia SEO è stata costruita intorno alla produzione di contenuti sufficientemente numerosi, ottimizzati e pertinenti da intercettare la domanda degli utenti. L’AI rende questo modello molto meno difendibile. Se tutti possono produrre migliaia di pagine ottimizzate, la quantità perde rapidamente valore competitivo. La differenza si sposta verso segnali più difficili da replicare: autorevolezza, esperienza diretta, dati proprietari, citazioni verificabili, reputazione dell’autore, coerenza dell’entità editoriale e capacità di produrre informazioni che non siano semplicemente una riscrittura delle prime dieci pagine presenti su Google.

È anche il motivo per cui SEO e Generative Engine Optimization stanno convergendo. Un sistema di AI search non deve soltanto trovare una pagina pertinente; deve decidere se quella pagina è abbastanza affidabile da essere utilizzata per costruire una risposta. In questo ambiente, la produzione automatica di massa può diventare persino controproducente. Una rete di migliaia di articoli generici può aumentare la superficie indicizzabile, ma non necessariamente aumentare il peso dell’entità editoriale che li pubblica.

Il paradosso finale è che l’intelligenza artificiale potrebbe quindi rendere più preziosa proprio quella cosa che l’industria tecnologica ha considerato per decenni un limite: l’esperienza umana. Un modello può generare rapidamente una spiegazione brillante sulla strategia aziendale, ma non ha trascorso trent’anni in una sala riunioni osservando un progetto fallire perché il board aveva approvato la tecnologia sbagliata. Può descrivere una trasformazione digitale, ma non ha dovuto convincere un CFO a finanziarla quando il budget era già stato tagliato. Può produrre mille articoli sull’AI, ma non possiede automaticamente un punto di vista.

Il web del prossimo decennio potrebbe quindi essere molto meno una guerra fra esseri umani e macchine di quanto oggi suggerisca la retorica dell’industria. Sarà una competizione fra contenuti indistinguibili e contenuti riconoscibili. Quando tutti avranno accesso allo stesso esercito di modelli linguistici, il vantaggio competitivo non sarà più possedere l’AI. Sarà avere qualcosa che l’AI, da sola, non può comprare: una reputazione, una storia, una responsabilità e una voce editoriale che qualcuno sia disposto a riconoscere come propria.