Meta è arrivata nella guerra dei coding agent con Muse Code, ma sarebbe riduttivo descriverlo come l’ennesimo concorrente di Claude Code o Codex. Il prodotto, rilasciato in beta il 5 agosto, è costruito attorno a Muse Spark 1.2, il nuovo modello di Meta dedicato alla programmazione, e nasce con un’ambizione più precisa: trasformare il terminale da semplice interfaccia per sviluppatori in un ambiente nel quale agenti software possano pianificare, modificare, testare e verificare autonomamente repository di grandi dimensioni. Reuters conferma che Muse Code è stato progettato per affrontare attività complesse, coordinare più sub-agent e lavorare su processi di sviluppo prolungati.

La differenza più interessante, tuttavia, non sta nel modello linguistico ma nell’architettura del runtime. Muse Code registra localmente chiamate al modello, esecuzioni degli strumenti, approvazioni e modifiche attraverso un event log che Meta definisce la singola fonte di verità dell’esecuzione. L’obiettivo è rendere il sistema replay-exact e restart-safe: se il processo si interrompe, l’agente non deve ricostruire da zero ciò che stava facendo, ma può riprendere esattamente dal punto precedente. È un dettaglio apparentemente poco spettacolare, soprattutto in un mercato nel quale ogni settimana viene annunciato un modello che “ragiona meglio”, ma per gli agenti autonomi potrebbe essere molto più importante di qualche punto percentuale in più su un benchmark.

Il problema dei coding agent, infatti, cambia radicalmente quando la durata dell’esecuzione passa da pochi minuti a diverse ore. Un assistente che genera una funzione in trenta secondi può permettersi di essere stateless. Un agente che modifica centinaia di file, esegue test, analizza errori, compila codice, lancia strumenti esterni e continua a iterare per una giornata ha invece bisogno di memoria operativa, controllo dello stato e soprattutto capacità di recupero dagli errori. La vera unità di misura dell’agentic software engineering non diventa più soltanto il token al secondo, ma la quantità di lavoro affidabile che il sistema riesce a completare senza supervisione umana.

Meta sembra aver capito questo passaggio e ha costruito Muse Code proprio intorno alla persistenza. Gli agenti secondari possono lavorare in parallelo e, quando un problema è sufficientemente grande, il sistema può distribuire il lavoro su sub-agent separati, riducendo collisioni e duplicazioni. È una logica molto diversa da quella del semplice chatbot che risponde a una richiesta di programmazione. Qui l’utente definisce un obiettivo e il sistema decide come scomporlo, quali strumenti utilizzare, quali modifiche effettuare e quando verificare il risultato.

Anche le competenze integrate raccontano questa filosofia. Muse Code dispone di comandi come /plan, che trasforma una richiesta in un piano soggetto ad approvazione, /grill, destinato a sottoporre il piano a una sorta di stress test, e /goal, orientato al raggiungimento dell’obiettivo finale. La sequenza è significativa perché sposta l’attenzione dalla generazione del codice alla gestione del processo. Il codice generato da un modello è ormai una commodity; la capacità di portare un progetto dal problema iniziale a una soluzione verificata, invece, è il vero campo di battaglia.

Meta ha inoltre co-addestrato Muse Spark 1.2 e Muse Code, cercando di evitare una delle debolezze tipiche degli agenti costruiti come semplice combinazione fra modello generalista e strumenti esterni. L’idea è che modello e harness agentico debbano essere ottimizzati insieme, perché un modello eccellente in una valutazione isolata può comportarsi molto diversamente quando deve utilizzare shell, filesystem, debugger, test runner e strumenti di ricerca per centinaia di passaggi consecutivi.

I numeri mostrano però una realtà meno trionfalistica della narrativa del lancio. Secondo i benchmark pubblicati da Meta, Muse Spark 1.2 con Muse Code raggiunge l’82,9% su Terminal-Bench 2.1, contro l’86,7% di Claude Code con Opus 5 e davanti all’81,8% attribuito a Codex con GPT-5.6 Terra e all’81,6% di Grok Build. Su DeepSWE 1.1 il distacco aumenta: Muse arriva al 59,3%, mentre Opus 5 raggiunge il 65,0% e Codex il 64,8%. Sul benchmark interno di coding di Meta, Muse si ferma al 70,6%, contro il 79,4% di Opus 5. I risultati suggeriscono quindi che Meta non ha ancora costruito il miglior coding agent del mercato; ha costruito piuttosto un sistema competitivo nel quale l’architettura potrebbe diventare più importante del punteggio assoluto del modello.

Questo è un punto che merita attenzione perché l’industria dell’intelligenza artificiale tende a trasformare ogni benchmark in una classifica mondiale di intelligenza, dimenticando che un agente software non è un modello isolato. È un sistema socio-tecnico composto da modello, prompt, strumenti, memoria, orchestrazione, sandbox, filesystem, gestione degli errori e policy di autorizzazione. Due modelli con prestazioni quasi identiche possono produrre risultati radicalmente diversi quando vengono inseriti in runtime differenti. Il benchmark misura una parte della macchina; il prodotto deve far funzionare tutto il resto.

Il test più significativo dichiarato da Meta riguarda proprio i task di lunga durata. Muse Code sarebbe riuscito a lavorare per oltre 1.000 chiamate agli strumenti, arrivando in alcuni casi a 24 ore consecutive, per ottimizzare kernel GPU su hardware NVIDIA Hopper. Se confermato in condizioni indipendenti, questo genere di risultato è molto più interessante della solita demo in cui un modello costruisce una todo app in trenta secondi. Ottimizzare iterativamente un kernel significa affrontare una sequenza di ipotesi, compilazioni, benchmark, errori e correzioni, dove ogni decisione successiva dipende dal risultato della precedente.

La componente multimodale amplia ulteriormente la strategia. In una dimostrazione, Meta mostra un video MP4 di un’abitazione utilizzato come input per produrre un sito web visivamente ricco con funzionalità di prenotazione. È la prosecuzione naturale della traiettoria che Meta aveva già avviato con la famiglia Muse: non limitarsi a testo e codice, ma utilizzare immagini, video e altri segnali come materiale operativo per l’agente. La programmazione diventa così una trasformazione multimodale: dal video all’interfaccia, dall’immagine al codice, dalla descrizione all’applicazione funzionante.

Meta, tuttavia, entra in un mercato già estremamente affollato. Anthropic ha trasformato Claude Code in uno dei riferimenti del coding agentico, OpenAI sta spingendo Codex verso un modello di lavoro con agenti paralleli e autonomi, mentre l’ecosistema open source ha prodotto alternative sempre più sofisticate. In questo scenario Meta non può semplicemente vincere perché dispone di un modello competitivo. Deve dimostrare che Muse Code produce più lavoro utile per unità di tempo, con meno interventi umani e soprattutto con meno errori catastrofici.

Qui emerge il problema più serio dell’intera categoria. Un coding agent che lavora per dieci minuti può essere supervisionato. Un agente che dispone di migliaia di chiamate agli strumenti e può continuare per 24 ore cambia la natura del rischio. Un bug nell’interpretazione dell’obiettivo non produce più necessariamente una risposta sbagliata; può produrre venti modifiche sbagliate, centinaia di esecuzioni, consumo di risorse cloud, cancellazioni di file, configurazioni alterate e una quantità di codice tecnicamente coerente ma concettualmente errato. L’autonomia moltiplica la produttività, ma moltiplica anche la superficie dell’errore.

Il runtime restart-safe di Muse Code diventa quindi contemporaneamente il suo punto di forza e un promemoria della difficoltà del problema. Rendere un agente capace di riprendere il lavoro dopo un crash significa riconoscere che il crash non è più un’eccezione marginale, ma una condizione ordinaria di sistemi che eseguono processi lunghi e complessi. La domanda successiva sarà inevitabilmente più difficile: da quale stato deve ripartire un agente quando non è il computer ad essere andato in errore, ma è l’agente stesso ad aver preso una decisione sbagliata?

Meta sta dunque entrando nella competizione con un prodotto che, almeno sulla carta, non cerca di vincere soltanto sulla qualità della generazione del codice. Cerca di competere sulla continuità dell’esecuzione, sull’orchestrazione dei sub-agent e sulla capacità di trasformare un obiettivo software in una sequenza autonoma di operazioni verificabili. È una distinzione strategica importante perché il mercato dei coding assistant sta rapidamente maturando verso una fase nella quale scrivere codice sarà la parte meno interessante del problema.

Anche il modello economico riflette questa impostazione. Muse Code viene distribuito in beta con pricing pay-as-you-go; Reuters indica 1,25 dollari per milione di token di input e 4,25 dollari per milione di token di output nella versione standard. Questo approccio è particolarmente significativo per un agente che può effettuare migliaia di chiamate: il costo reale non sarà quello della singola richiesta, ma quello dell’intero percorso necessario per completare un obiettivo. In altre parole, il vero KPI non è quanto costa un token, ma quanto costa far funzionare un progetto.

Meta arriva quindi tardi nella corsa, ma non necessariamente fuori tempo. Il vantaggio competitivo di Muse Code non è oggi un dominio netto nei benchmark, dove Anthropic rimane davanti in diversi test; è la scommessa architetturale su agenti persistenti, esecuzioni recuperabili e lavoro software di lunga durata. La Silicon Valley continua a vendere l’idea che il prossimo modello sarà quello definitivo. Nel frattempo, la parte più interessante dell’intelligenza artificiale sta diventando molto meno romantica: costruire sistemi che non perdano il filo, non distruggano il repository e sappiano cosa stavano facendo ieri sera quando qualcuno riaccende il terminale questa mattina.

https://dev.meta.ai/install.sh | per l’installazione