Anthropic ha lanciato Claude Opus 5.5, il primo modello della nuova generazione Claude 5.5, e il dato più interessante è che il modello raggiunga, secondo l’azienda, prestazioni paragonabili a Claude Fable 5.1 sulla maggior parte dei lavori. Ma il punto strategico è un altro: Anthropic sta cercando di trasformare il costo dell’intelligenza artificiale in una variabile competitiva almeno quanto la qualità del modello. Opus 5.5 costa infatti il 40% in meno da eseguire rispetto a Opus 5, secondo Anthropic, mentre il prezzo API scende a 4 dollari per milione di token in input e 20 dollari per milione di token in output. I cache read, particolarmente importanti nei flussi agentici dove il modello deve mantenere e riutilizzare grandi quantità di contesto, scendono a 0,20 dollari per milione di token.

Il confronto con Claude Fable 5.1 rende ancora più evidente la strategia. Fable 5.1, presentato da Anthropic all’inizio di settembre come il proprio modello più capace per coding, knowledge work e attività autonome di lunga durata, viene offerto a 10 dollari per milione di token in input e 50 dollari in output, con cache read a 0,25 dollari. Anthropic aveva già ridotto il costo di Fable 5.1 rispetto alla generazione precedente, arrivando a stimare risparmi del 25% sui workload tipici e fino al 45% sui carichi fortemente agentici.

La scelta di Opus 5.5 è quindi meno spettacolare di una semplice gara al benchmark e molto più importante dal punto di vista industriale. Un modello che produce risultati comparabili utilizzando meno token, costando meno e mantenendo prestazioni elevate nei compiti agentici può modificare concretamente l’economia di un prodotto software. Il mercato dell’AI ha passato due anni a discutere di chi possieda il modello più intelligente; ora comincia a discutere di quanta intelligenza si possa comprare con un dollaro. È un passaggio meno sexy per le presentazioni PowerPoint, ma decisamente più interessante per CFO, CTO e responsabili infrastrutturali.

I numeri pubblicati da Anthropic mostrano un miglioramento particolarmente marcato nel coding agentico. Su Terminal-Bench 4.0, Opus 5.5 raggiunge il 66,4%, contro il 55,8% di Fable 5.1, il 52,3% di Opus 5 e il 57,9% di GPT-6 Astra. Su FrontierCode v1.1, che valuta quanto spesso le modifiche prodotte da un agente possano essere effettivamente integrate in un flusso di sviluppo, Opus 5.5 arriva al 54,4%, contro il 50,3% di Fable 5.1 e il 53,3% di GPT-6 Astra. Anche CursorBench 4.0 conferma la direzione, con il 57,8% di Opus 5.5 contro il 51,8% di Fable 5.1.

Ancora più significativo è GDPval-AA v2.1, che utilizza un sistema Elo per valutare il lavoro professionale in 44 occupazioni. Opus 5.5 raggiunge 1846 punti, contro 1735 di Fable 5.1 e 1708 di Opus 5. L’Elo non misura una percentuale di compiti completati, ma una forza relativa tra modelli, quindi il numero va letto diversamente dai benchmark pass-rate. È un dettaglio metodologico che spesso scompare nelle infografiche colorate con cui l’industria dell’AI ama raccontare la propria superiorità.

Opus 5.5 non domina però ogni categoria. Su AutomationBench, che valuta la capacità di completare autonomamente workflow aziendali, GPT-6 Astra raggiunge il 41,4%, mentre Opus 5.5 si ferma al 40%. Il dato è utile proprio perché ridimensiona la tentazione di trasformare una tabella di benchmark in una classifica universale. Un modello può essere particolarmente forte nella programmazione agentica e non esserlo altrettanto nella gestione completa di processi aziendali. L’intelligenza artificiale non è ancora un decatleta cognitivo, nonostante il marketing continui a presentarla come tale.

Anthropic lo riconosce esplicitamente nella pagina ufficiale di Opus 5.5: a questi livelli di capacità, sostiene l’azienda, i margini dei benchmark diventano una guida meno affidabile alle differenze nel mondo reale e, secondo i test interni, la distanza effettiva tra Opus 5.5 e Fable 5.1 è più ridotta di quanto suggeriscano alcuni punteggi. Questa ammissione è probabilmente più importante dei numeri stessi. Quando i modelli arrivano vicino alla soglia in cui entrambi riescono a svolgere un compito, la differenza economica può diventare più importante della differenza di accuratezza.

Il cuore commerciale di Opus 5.5 è quindi il rapporto tra capacità e costo. Nei sistemi agentici, il problema non è soltanto quanto costa una singola risposta, ma quante volte il modello deve leggere contesto, chiamare strumenti, correggere errori, verificare risultati e riprovare. Un agente che lavora per ore può moltiplicare il consumo di token molto più rapidamente di un chatbot tradizionale. Ridurre il prezzo del contesto riutilizzato significa intervenire direttamente sulla struttura dei costi del lavoro autonomo. In altre parole, Anthropic non sta semplicemente rendendo Claude più economico: sta cercando di rendere economicamente praticabile una categoria di software in cui gli agenti consumano continuamente capacità computazionale.

La scelta assume anche un significato particolare per Anthropic perché arriva dopo il lancio di Fable 5.1, modello che l’azienda aveva presentato come la propria frontiera per coding e knowledge work, e mentre Claude Mythos 5.1 rimane riservato a programmi di accesso controllato per attività avanzate di cybersecurity e life sciences. Fable 5.1 e Mythos 5.1 condividono lo stesso modello sottostante ma dispongono di livelli differenti di salvaguardie. Anthropic ha quindi costruito una gerarchia nella quale capacità, accessibilità e rischio non coincidono necessariamente.

Questa architettura diventa ancora più interessante considerando la posizione pubblica di Dario Amodei sulla velocità dello sviluppo dell’AI. Anthropic continua a sostenere la necessità di maggiore cautela mentre, nello stesso tempo, porta sul mercato un modello capace di eseguire autonomamente una quantità crescente di lavoro tecnico e professionale. Non c’è necessariamente una contraddizione: la strategia può essere letta come un tentativo di aumentare le capacità mantenendo più strutturato il controllo sui domini considerati ad alto rischio. La differenza tra prudenza e rallentamento, nel settore AI, è ormai diventata una questione molto concreta di governance del prodotto.

Il tema della sicurezza emerge infatti direttamente nella distribuzione di Opus 5.5. Anthropic lo considera sufficientemente capace in alcune aree sensibili da applicare salvaguardie comparabili a quelle dei propri modelli di livello Mythos. La società ha già documentato sistemi nei quali richieste relative alla cybersecurity vengono sottoposte a controlli e, in determinati casi, instradate verso modelli differenti. Questo meccanismo introduce una nuova variabile nell’esperienza degli sviluppatori: non basta più sapere quale modello si sta utilizzando, occorre sapere anche quale modello potrebbe effettivamente eseguire una determinata richiesta dopo l’applicazione delle policy di sicurezza.

Opus 5.5 è disponibile attraverso l’infrastruttura Anthropic e i principali cloud partner, inclusi Amazon Web Services, Google Cloud e Microsoft Azure. Anthropic prevede inoltre l’arrivo di Sonnet 5.5 e Haiku 5.5 nelle settimane successive, con una riduzione dei costi che dovrebbe estendersi all’intera famiglia. Se questa strategia verrà mantenuta, il vero effetto della generazione 5.5 potrebbe essere meno visibile nei benchmark e molto più evidente nei bilanci delle aziende che costruiscono applicazioni agentiche su larga scala.

La competizione fra Anthropic, OpenAI e gli altri laboratori sta quindi entrando in una fase diversa. Il vantaggio non appartiene necessariamente al modello che conquista ogni benchmark, ma a quello che consente a un’azienda di automatizzare un processo complesso con una combinazione accettabile di capacità, latenza, affidabilità, sicurezza e costo. È la parte meno glamour della rivoluzione AI, quella in cui improvvisamente compare il responsabile procurement con una calcolatrice. Ed è probabilmente proprio quella parte che deciderà quali modelli resteranno nei laboratori, quali finiranno nei prodotti e quali diventeranno infrastruttura quotidiana.

Opus 5.5 rappresenta dunque un cambio di metrica più che una semplice nuova versione. L’intelligenza artificiale entra nella fase in cui il progresso non viene misurato soltanto chiedendo se il modello sia più intelligente del precedente, ma se sia abbastanza intelligente da sostituire una sequenza di attività reali a un costo industrialmente sostenibile. La Silicon Valley ha passato molto tempo a vendere il futuro dell’intelligenza artificiale; adesso sta iniziando a vendere qualcosa di più concreto: minuti di lavoro digitale, eseguiti da agenti, fatturati a consumo. E questa volta il dettaglio contabile potrebbe essere più rivoluzionario del benchmark.