OpenAI ha lanciato GPT-6 Sol e GPT-6 Luna il 22 settembre 2026, a pochi minuti dalla presentazione di Claude Opus 5.5 da parte di Anthropic. La coincidenza temporale è quasi troppo perfetta per essere casuale, anche se nella Silicon Valley ormai persino una release note può avere la tensione narrativa di una crisi geopolitica. Il dato interessante, tuttavia, non è soltanto la simultaneità degli annunci. Sol e Luna rappresentano la risposta di OpenAI a una trasformazione precisa del mercato: la competizione fra modelli linguistici non si gioca più esclusivamente sulla capacità assoluta, ma sul rapporto fra intelligenza, velocità, costo dell’inference e capacità di svolgere lavoro autonomamente.
OpenAI colloca GPT-6 Sol e GPT-6 Luna sotto GPT-6 Astra, presentato il 3 settembre come il modello destinato ai compiti più complessi. Sol e Luna sono invece progettati per portare parte delle capacità della generazione Astra verso applicazioni più frequenti e scalabili. È una strategia che ricorda molto da vicino la segmentazione industriale già adottata da Anthropic: un modello di punta per i lavori ad alto valore, uno intermedio per l’uso professionale quotidiano e uno più economico per le operazioni ad alto volume. La differenza rispetto alla prima stagione dell’AI generativa è sostanziale. Il mercato non cerca più necessariamente il modello più intelligente possibile; cerca il modello sufficientemente intelligente che possa essere utilizzato milioni di volte senza trasformare il conto dell’inference in un problema per il CFO.
La riduzione dei prezzi rende evidente la direzione. GPT-6 Sol viene proposto a 2 dollari per milione di token in ingresso e 10 dollari per milione in uscita, mentre Luna scende a 0,10 dollari per l’input e 0,50 dollari per l’output. Secondo OpenAI, i prezzi rappresentano una significativa riduzione rispetto alle precedenti condizioni promozionali di GPT-5.6. La società attribuisce parte del miglioramento anche a un’inference più efficiente e a sistemi di caching più sofisticati. Dietro la terminologia tecnica si nasconde una dinamica economica molto concreta: ogni miglioramento dell’efficienza permette di abbassare il prezzo, aumentare l’utilizzo e contemporaneamente rendere sostenibili nuovi casi d’uso. È esattamente il meccanismo che ha trasformato il cloud da infrastruttura specialistica a componente ordinaria dell’economia digitale.
Anthropic risponde con Claude Opus 5.5, mantenendo un prezzo di 4 dollari per milione di token in ingresso e 20 dollari in uscita. Il confronto nominale favorisce quindi OpenAI sul costo unitario, ma il costo per token è diventato una metrica sempre meno sufficiente per valutare gli agenti. Un agente non viene pagato per parlare bene. Viene pagato per completare un compito. Se deve effettuare cinquanta chiamate a strumenti esterni, aprire documenti, controllare informazioni, utilizzare un browser, scrivere codice e correggersi autonomamente, il parametro economicamente significativo diventa il costo per risultato ottenuto. La token economy è stata il primo linguaggio finanziario dell’AI; la task economy potrebbe essere quello successivo.
OpenAI porta proprio questo argomento nei benchmark dedicati agli agenti. Su AutomationBench, sviluppato da Zapier per verificare la capacità di completare workflow aziendali attraverso 47 strumenti appartenenti a funzioni come vendite, marketing, operations, customer support, finanza e risorse umane, OpenAI dichiara per GPT-6 Sol un risultato del 33,2% al massimo livello di reasoning, con un costo di circa 0,27 dollari per task. Nel confronto riportato da OpenAI, Claude Opus 5 raggiunge il 26,9% con un costo per attività molto superiore. Il dato è interessante soprattutto perché sposta la discussione dal benchmark accademico al processo aziendale. Non interessa soltanto sapere se il modello conosce la risposta. Interessa sapere se riesce a portare a termine il lavoro.
Lo stesso principio appare in Agents’ Last Exam, benchmark che misura il comportamento degli agenti su attività lunghe e potenzialmente economicamente rilevanti distribuite in 55 sotto-industrie. OpenAI riporta per Sol un risultato del 56,4% al massimo livello di effort, sostenendo che il costo per task sia inferiore rispetto a Claude Opus 5. Il parametro “effort” è particolarmente significativo perché rende esplicito un elemento spesso nascosto nei confronti fra modelli: il ragionamento non è gratuito. Un modello può utilizzare più calcolo per controllare il proprio lavoro e aumentare la probabilità di successo, ma ogni incremento del reasoning ha un costo. L’intelligenza artificiale sta quindi introducendo qualcosa di molto simile a una politica di allocazione del capitale computazionale.
Anche OSWorld 2.0, che misura la capacità di un agente di utilizzare un computer attraverso interfacce grafiche e completare attività realistiche, produce un risultato indicativo. OpenAI attribuisce a GPT-6 Sol un punteggio del 60,5%, contro il 60,3% di Claude Opus 5 nella configurazione confrontata, sostenendo inoltre un costo significativamente inferiore. Qui emerge un passaggio tecnologico decisivo. L’AI non viene più valutata soltanto come sistema che produce testo, codice o immagini. Viene valutata come operatore digitale capace di interagire con applicazioni, strumenti e sistemi informativi. Il salto concettuale è enorme, perché quando il modello può utilizzare il software aziendale il valore non risiede più nella qualità della conversazione, ma nella quantità di lavoro che può essere trasferita dal dipendente all’agente.
Naturalmente i benchmark devono essere trattati con cautela. I risultati dipendono dalla configurazione del modello, dal livello di reasoning, dall’harness utilizzato, dagli strumenti disponibili e dalle modalità con cui viene calcolato il costo. OpenAI e Anthropic presentano ciascuna i propri dati in un contesto competitivo, quindi trasformare una singola tabella in una classifica universale sarebbe più marketing che analisi. Il benchmark serve a individuare una direzione, non a sostituire un test nel contesto reale dell’impresa.
La direzione, però, è piuttosto evidente. OpenAI e Anthropic stanno costruendo famiglie di modelli sempre più segmentate, nelle quali capacità e costo possono essere calibrati in funzione del lavoro da svolgere. Astra, Sol e Luna non rappresentano soltanto tre livelli di potenza. Rappresentano una possibile architettura economica dell’AI enterprise. Il modello più potente viene utilizzato quando il valore del risultato giustifica la spesa; quello intermedio gestisce la maggioranza delle attività; quello economico alimenta operazioni ad altissimo volume. La conseguenza è che l’architettura AI di un’azienda potrebbe assomigliare sempre meno a una singola API e sempre più a un sistema operativo cognitivo composto da modelli differenti.
Per i CTO questa evoluzione cambia anche il modo di progettare i sistemi. La domanda non dovrebbe essere quale sia il modello migliore, ma quale modello sia economicamente appropriato per ciascun processo, con quale livello di autonomia, quali dati possa utilizzare e quale soglia di rischio richieda supervisione umana. Un agente che risponde a una richiesta interna non ha lo stesso profilo di rischio di un agente che modifica un contratto, autorizza un pagamento o interviene su un sistema produttivo. L’AI enterprise diventa quindi una questione di orchestration, governance e controllo dei costi tanto quanto di machine learning.
Il tempismo del doppio lancio racconta infine qualcosa sullo stato del mercato. OpenAI e Anthropic non stanno più aspettando che una generazione tecnologica maturi prima di presentare la successiva. I modelli arrivano a distanza di giorni o addirittura di ore, mentre prezzi e benchmark vengono utilizzati per spostare immediatamente la percezione del mercato. È una corsa nella quale il vantaggio competitivo può durare quanto una notifica push. La vecchia ossessione della Silicon Valley per il modello più intelligente sta lasciando spazio a una domanda molto più prosaica e molto più importante: quanta attività economica può essere automatizzata per ogni dollaro di calcolo.
Questa è probabilmente la trasformazione più significativa introdotta da GPT-6 Sol e Luna. L’intelligenza artificiale sta entrando nella fase in cui il problema non è più dimostrare che una macchina può fare qualcosa, ma rendere abbastanza economico farlo continuamente. Quando il costo dell’intelligenza digitale scende abbastanza, la tecnologia smette di essere un esperimento e comincia a diventare infrastruttura. A quel punto la competizione fra OpenAI e Anthropic non riguarda soltanto chi costruisce il modello più capace. Riguarda chi riesce a trasformare il maggior numero di token in lavoro economico reale, senza trasformare ogni agente autonomo in un dipendente molto veloce, molto economico e occasionalmente creativo nel modo sbagliato.