Grok 4.7 è arrivato il 21 settembre e la notizia più interessante non è che xAI abbia costruito un nuovo modello, ma che abbia scelto di giocare una partita diversa da quella del semplice primato nei benchmark. La società di Elon Musk presenta Grok 4.7 come il suo modello più potente per coding e knowledge work, con un modello di addestramento più orientato ai problemi lunghi, maggiore capacità di verificare il proprio lavoro e un nuovo sistema di safeguard. Il prezzo di listino resta quello di Grok 4.6, 2 dollari per milione di token in ingresso e 6 dollari per milione in uscita, mentre una variante Fast promette il doppio della velocità al doppio del prezzo.

La differenza rispetto alla precedente generazione non sembra quindi essere soltanto una questione di dimensione. xAI afferma di avere utilizzato un base model più grande e un reinforcement learning più lungo, costruito attorno a problemi che richiedono ore di lavoro anziché risposte istantanee. È una modifica significativa nella filosofia progettuale: il modello non deve semplicemente produrre una risposta plausibile, deve mantenere una traiettoria di lavoro più lunga, controllare ciò che ha prodotto e correggere gli errori. In altre parole, il benchmark non è più soltanto “quanto è intelligente il modello?”, ma “quanto lavoro utile riesce a portare a termine prima di perdere il filo?”. È precisamente il territorio nel quale l’industria sta spostando la competizione dagli chatbot agli agenti.

I numeri raccontano però una storia più interessante dello slogan. Nei dati pubblicati da xAI, Grok 4.7 raggiunge il 46,3% su CursorBench 4.0, contro il 40,4% di Grok 4.6; su DeepSWE v1.1 arriva al 71%, mentre Grok 4.6 era al 65,2%. Ancora più evidente è il salto su Terminal-Bench, dove il nuovo modello raggiunge il 37,6%, contro il 20,3% del predecessore. Nell’AA Briefcase, dedicato a compiti di lavoro d’ufficio che richiedono più ore, Grok 4.7 arriva a 1.657 Elo, contro 1.546 di Grok 4.6. Il miglioramento rispetto alla generazione precedente è dunque concreto e distribuito su compiti diversi, anche se non coincide con un dominio assoluto dei benchmark.

La verifica indipendente di Artificial Analysis aggiunge un dettaglio ancora più importante. La società assegna a Grok 4.7 un Intelligence Index di 46, appena due punti sopra Grok 4.6, ma registra un miglioramento molto più consistente nei compiti agentici: 1.657 Elo nell’AA-Briefcase e 1.695 nel GDPval-AA. Nel coding agentico, Grok 4.7 utilizzato con Grok Build raggiunge 56 nell’Artificial Analysis Coding Agent Index, nove punti sopra Grok 4.6. Il modello migliora anche sulla frequenza delle allucinazioni misurata da AA, scesa dal 34% al 29%, ma il dato arriva con un prezzo nascosto: a livello xhigh Grok 4.7 utilizza mediamente circa 81.000 token di output per attività nell’Intelligence Index, più del doppio rispetto al modello precedente. L’intelligenza artificiale, scopriamo ancora una volta, non è gratuita: talvolta semplicemente nasconde il conto nella lunghezza del ragionamento.

Il confronto con i modelli frontier rende il quadro meno trionfalistico. Nel GDPval, Grok 4.7 raggiunge 1.695 Elo, mentre Claude Fable 5.1 arriva a 1.735. Nell’AA-Briefcase il distacco è 1.657 contro 1.678. Sul CursorBench 4.0 il risultato di Grok 4.7 è 46,3%, contro 51,8% di Fable 5.1. Nel Terminal-Bench il divario è ancora più marcato, con 37,6% per Grok contro 57,9% per Fable. Al tempo stesso Grok supera alcuni concorrenti su specifiche prove, compresa EEBench, dedicata all’ingegneria elettrica, e l’Harvey Legal Agent Benchmark. La fotografia corretta, quindi, non è quella di un nuovo dominatore del settore, ma di un modello che ha ridotto significativamente la distanza in alcune categorie e che rimane competitivo su altre.

Il punto strategico è il prezzo. Grok 4.7 costa 2 dollari per milione di token in ingresso e 6 dollari in uscita, mentre nella tabella comparativa pubblicata da xAI GPT-5.6 Sol è indicato a 4 e 20 dollari e Fable 5.1 a 10 e 50 dollari. Il confronto va naturalmente interpretato con cautela perché prezzi, modalità di reasoning e infrastrutture non sono perfettamente sovrapponibili, ma la logica industriale è evidente: xAI non deve necessariamente vincere ogni benchmark se riesce a offrire capacità sufficientemente vicine alla frontiera a un costo sensibilmente inferiore. Per un’azienda che costruisce agenti, software e automazioni su milioni di chiamate API, il costo marginale può contare più di qualche punto percentuale in un benchmark.

C’è poi un secondo elemento che merita attenzione: la distribuzione. Grok 4.7 è immediatamente disponibile in Grok Build, Cursor, tramite API e attraverso strumenti e model router di terze parti. Non c’è una lista d’attesa da attraversare come una piccola dogana digitale. Questo rende il modello interessante non soltanto per chi conversa con Grok, ma soprattutto per sviluppatori e imprese che vogliono inserirlo dentro workflow reali. La trasformazione dei modelli linguistici in infrastruttura aziendale sta infatti rendendo sempre meno importante il chatbot come prodotto finale e sempre più importante il modello come componente sostituibile di una catena software.

Anche la sicurezza entra nella nuova versione, con xAI che parla di un nuovo safeguard stack e dichiara risultati migliori nei test di resistenza ai jailbreak e nei domini dual-use. L’azienda riporta, tra gli altri dati, il 62,4% nel benchmark biosafety di LatchBio e un 3,3% di prompt rischiosi lasciati passare nel proprio test HackerBench v0.3. Sono tuttavia risultati dichiarati dalla stessa xAI e vanno quindi letti come evidenza del sistema di valutazione scelto dall’azienda, non come certificazione indipendente della sicurezza del modello. È una distinzione che nel mercato dell’AI continua a essere curiosamente impopolare, probabilmente perché rovina un po’ la grafica della slide.

Il lancio arriva inoltre dopo una sequenza di rinvii e aggiornamenti delle tempistiche attribuiti pubblicamente a Musk, elemento che rende il rilascio ancora più interessante dal punto di vista industriale. La cultura xAI resta quella di una società che comunica con estrema aggressività, promette iterazioni rapide e trasforma ogni nuova versione in una tappa della corsa verso una presunta frontiera definitiva. Ma Grok 4.7 suggerisce qualcosa di più concreto: la competizione dei grandi modelli sta entrando nella fase in cui l’efficienza, il costo per task, la capacità agentica, la disponibilità tramite API e la qualità del lavoro completato possono contare più del semplice titolo di “modello più intelligente”.

La partita di xAI, dunque, non è necessariamente conquistare ogni leaderboard. È comprimere il rapporto fra capacità e costo abbastanza da rendere Grok una scelta infrastrutturale plausibile per sviluppatori, aziende e prodotti che devono eseguire migliaia o milioni di operazioni. Grok 4.7 migliora nettamente rispetto a Grok 4.6, ma i dati indipendenti non mostrano una fuga solitaria dalla concorrenza; mostrano piuttosto un modello che si avvicina alla frontiera mentre mantiene una struttura di prezzo aggressiva. Nel mercato degli LLM, dove ogni nuovo modello viene annunciato come se avesse appena inventato l’intelligenza, potrebbe essere proprio questa la metrica più adulta: non quanto lontano arriva il modello in laboratorio, ma quanto lavoro economico riesce a produrre prima che arrivi la fattura