L’ipotesi di Riemann è ancora lì, intatta, ostinata e perfettamente indifferente all’ennesimo assalto dell’intelligenza artificiale. Claude non l’ha dimostrata, non l’ha confutata, quello che è accaduto è, però, forse più interessante di un semplice titolo roboante sulla “AI che risolve la matematica”: una versione di ricerca non ancora rilasciata di Claude, incaricata di affrontare seriamente uno dei problemi più difficili della matematica moderna, ha trovato un nuovo risultato collegato alla funzione zeta di Riemann, portando dal 41,6% al 67,2% la quota minima dimostrabile degli zeri non banali che giacciono sulla cosiddetta retta critica. Anthropic ha pubblicato il risultato il 10 agosto 2026 e precisa che due suoi matematici lo hanno esaminato, mentre Brian Conrey e Dan Goldston, esperti di teoria analitica dei numeri, hanno verificato il lavoro con particolare attenzione.
La distinzione è fondamentale, perché confondere il 67,2% con una soluzione dell’ipotesi di Riemann sarebbe matematicamente sbagliato e giornalisticamente piuttosto pigro. La congettura, formulata da Bernhard Riemann nel 1859, afferma che tutti gli zeri non banali della funzione zeta hanno parte reale pari a 1/2. La funzione zeta non è un esercizio astratto da lavagna universitaria: è profondamente legata alla distribuzione dei numeri primi e, proprio per questo, l’ipotesi di Riemann è diventata uno dei grandi problemi aperti della matematica. Il Clay Mathematics Institute la inserisce tra i Millennium Prize Problems, con un premio di un milione di dollari per una dimostrazione valida. Dopo 167 anni, quel milione resta ancora sul tavolo.
Il punto interessante è ciò che accade appena si smette di chiedere “tutti” e si comincia a chiedere “almeno quanti”. Se non siamo in grado di dimostrare che il 100% degli zeri si trova sulla retta critica, possiamo tentare di stabilire una percentuale minima che certamente vi appartiene. È una linea di ricerca estremamente tecnica, sviluppata per decenni da matematici che hanno costruito progressivamente strumenti per aumentare quella soglia. Nel 1989 Brian Conrey pubblicò il celebre lavoro “More than two fifths of the zeros of the Riemann zeta function are on the critical line”, dimostrando che più del 40% degli zeri si trovava sulla retta critica.
La situazione è rimasta sostanzialmente inchiodata per decenni, fino a raggiungere il 41,6% come limite inferiore conosciuto. Claude, secondo Anthropic, ha invece individuato un modo per combinare risultati matematici precedenti di Siegfred Baluyot, Daniel Goldston, Ade Irma Suriajaya e Caroline Turnage-Butterbaugh con un lavoro di Enrico Bombieri, ottenendo una nuova dimostrazione che porta il limite al 67,2%. Non è una progressione lineare e certamente non significa che Claude abbia scoperto da solo una nuova teoria della funzione zeta. Il risultato nasce dall’assemblaggio e dalla reinterpretazione di strumenti matematici sviluppati da ricercatori umani nel corso di decenni, ma proprio questa capacità di attraversare rapidamente una letteratura altamente specializzata e trovare una combinazione produttiva è ciò che rende l’esperimento interessante.
La parte forse più sorprendente non è nemmeno il risultato matematico, ma il modo in cui è stato ottenuto. Jarred Sumner, membro dello staff di Anthropic e non matematico, ha chiesto a Claude di “prendere seriamente di mira” l’ipotesi di Riemann, lasciando al modello le decisioni matematiche. La prima campagna ha prodotto circa 650 idee, nessuna delle quali funzionante. Invece di concludere che il problema fosse troppo difficile, il sistema ha continuato a esplorare lo spazio delle possibilità. Nella seconda fase ha coordinato circa 60 sottoprocessi Claude per un giorno e mezzo, eseguendo circa 2.400 comandi shell, generando centinaia di script Python, effettuando migliaia di controlli numerici sugli zeri della funzione zeta e sottoponendo le proprie ipotesi a una sorta di revisione interna distribuita.
Il dato dei 31 milioni di token prodotti durante le due sessioni è quasi una caricatura dell’epoca dell’AI agentica, ma rivela qualcosa di importante. Non stiamo osservando semplicemente un chatbot che riceve una domanda e restituisce una risposta in pochi secondi. Stiamo osservando un sistema che esplora, fallisce, genera ipotesi alternative, scrive codice, effettua esperimenti, consulta la letteratura, verifica i propri risultati e coordina agenti specializzati. Anthropic riferisce inoltre che Claude ha analizzato 54 articoli disponibili su arXiv per verificare che il risultato non fosse già stato ottenuto, ha cercato controesempi e ha tentato di ricostruire indipendentemente la propria dimostrazione. È una differenza sostanziale rispetto al paradigma conversazionale con cui il grande pubblico continua a identificare i modelli linguistici.
C’è persino un elemento quasi comico nella dinamica uomo-macchina. Sumner non era un esperto di teoria dei numeri e, secondo Anthropic, per buona parte dell’esperimento il suo contributo si è ridotto a incoraggiare Claude con messaggi equivalenti a “continua” e “credici”. Sembra una scena da film motivazionale aziendale in cui il coach non capisce nulla della partita, ma sorprendentemente la squadra vince. In realtà la questione è più seria: Anthropic osserva che Claude inizialmente mostrava scetticismo sulla propria possibilità di ottenere risultati significativi e che questi semplici incoraggiamenti sembravano aiutarlo a perseverare. È un dettaglio apparentemente marginale, ma indica quanto i sistemi agentici possano essere sensibili non soltanto alla correttezza delle istruzioni, ma alla gestione della ricerca stessa.
La parte decisiva, tuttavia, arriva dopo la scoperta. Una delle debolezze più evidenti dell’AI scientifica è la distanza tra una risposta apparentemente brillante e una dimostrazione realmente verificabile. Un modello linguistico può produrre una pagina di formule dall’aspetto impeccabile e infilare nel mezzo un errore devastante, con la stessa tranquillità con cui un consulente PowerPoint inserisce una freccia rossa per spiegare una strategia che nessuno ha ancora definito. Anthropic ha quindi sottoposto il risultato a due matematici interni, Levent Alpöge e Ralph Furman, e ha fatto produrre a Claude una formalizzazione in Lean insieme a Eric Easley. La formalizzazione supera il validatore standard, offrendo una verifica meccanica dei passaggi formalizzati.
Questo non elimina il ruolo degli esseri umani. Lo rafforza. Brian Conrey, il matematico che nel 1989 aveva portato il limite oltre i due quinti, e Dan Goldston hanno esaminato il lavoro. La verifica di specialisti indipendenti rimane indispensabile, soprattutto perché la rilevanza di una dimostrazione matematica non dipende soltanto dalla sua consistenza formale, ma anche dal rapporto con la letteratura precedente, dalle ipotesi utilizzate e dalla corretta interpretazione del risultato. Anthropic stessa mantiene una posizione prudente e dichiara esplicitamente di non aspettarsi che la tecnica utilizzata da Claude conduca alla dimostrazione dell’ipotesi di Riemann.
Tecnicamente, il passaggio compiuto da Claude è tutt’altro che banale. Anthropic descrive un approccio basato su uno spazio di funzioni associato a una forma quadratica di Weil, combinando sottospazi positivi e negativi collegati agli zeri sulla retta e fuori dalla retta e sfruttando informazioni sui primi e secondi momenti. Il punto chiave sembra essere l’aver trattato l’intero spazio in maniera non diagonale, mettendo insieme strutture matematiche che esistevano già ma che non erano state combinate in questo modo per ottenere il nuovo limite. È precisamente qui che l’esperimento diventa interessante per la scienza: non nella fantasia della macchina che “capisce la matematica” come un genio solitario, ma nella capacità di attraversare rapidamente un enorme spazio di combinazioni teoriche e identificare una configurazione che merita di essere sottoposta al giudizio umano.
La vera notizia, dunque, non è che l’intelligenza artificiale abbia risolto l’ipotesi di Riemann. Non l’ha fatto. La notizia è che un sistema di AI ha trasformato un compito apertamente irragionevole in una ricerca matematica produttiva, fallendo 650 volte prima di trovare una direzione utile e utilizzando una quantità enorme di calcolo e di esplorazione agentica per arrivare a un risultato verificabile. Il salto dal 41,6% al 67,2% rappresenta 25,6 punti percentuali in un problema nel quale i progressi umani sul limite erano stati estremamente lenti. Il confronto temporale è impressionante, ma deve essere interpretato con cautela: Claude non ha semplicemente sostituito 37 anni di lavoro umano con un giorno e mezzo; ha potuto sfruttare proprio quei 37 anni di lavoro umano come materiale di partenza.
Questo è probabilmente il punto che l’industria tecnologica rischia di raccontare peggio. L’AI scientifica non deve necessariamente inventare dal nulla una nuova matematica per essere rivoluzionaria. Potrebbe essere sufficiente che diventi capace di leggere migliaia di risultati, comprendere le condizioni in cui sono validi, ricombinarli, testarli computazionalmente, cercare falle e trasformare una biblioteca di conoscenza umana in uno spazio di ricerca esplorabile a velocità industriale. La differenza rispetto al paradigma tradizionale non sarebbe quindi “macchine contro matematici”, ma matematici dotati di una macchina capace di esplorare milioni di sentieri che un essere umano non avrebbe né il tempo né la pazienza di percorrere.
Il paradosso finale è quasi elegante. Per ottenere questo risultato Claude ha dovuto essere convinto a non arrendersi; l’intelligenza artificiale più avanzata del momento ha avuto bisogno di qualcuno che le dicesse, in sostanza, di continuare a provare. Dietro i 31 milioni di token, i 60 agenti, i 2.400 comandi, le migliaia di verifiche numeriche e la formalizzazione in Lean rimane quindi una lezione meno spettacolare ma probabilmente più importante: la frontiera dell’AI scientifica non coincide con la capacità di produrre risposte, bensì con la capacità di sostenere una ricerca abbastanza a lungo da trasformare il fallimento in informazione. L’ipotesi di Riemann resta irrisolta, il milione di dollari resta intatto e la matematica non ha ancora trovato il suo momento ChatGPT. Ma per la prima volta, almeno in questo esperimento, una macchina non si è limitata a rispondere a una domanda matematica: ha contribuito a spostare ciò che sappiamo dimostrare.