Alibaba sta facendo qualcosa di più interessante che lanciare un nuovo modello. Sta cambiando il modo in cui il mercato dovrebbe misurare l’intelligenza artificiale. Qwen 3.8-Flash-Next, la cui uscita è prevista oggi 26 agosto 2026, viene presentato da Qwen come un’anteprima dell’architettura sulla quale sarà costruita la futura famiglia Qwen4. La pagina ufficiale su Hugging Face lo definisce esplicitamente “A Preview of the Qwen4 Architecture”, mentre le informazioni disponibili indicano un modello multimodale basato su una configurazione Mixture-of-Experts.
La cifra che sta attirando l’attenzione è apparentemente semplice: circa 125 miliardi di parametri complessivi, con soltanto 6 miliardi attivi per ogni token. È una distinzione che sembra matematica e invece è economica. In un modello denso, la maggior parte della rete partecipa a ogni passaggio computazionale; in un sistema MoE, invece, il router seleziona soltanto alcuni esperti per elaborare una determinata porzione dell’input. Il risultato è che la capacità complessiva del modello può crescere molto più rapidamente della quantità di calcolo necessaria per ogni singolo token. Non significa, come qualcuno ha già scritto, che un modello da 125 miliardi “costi come” uno da 6 miliardi. La memoria, il caricamento dei pesi, il traffico tra componenti, il routing e l’infrastruttura di serving continuano a esistere. Significa però che il costo computazionale dell’inferenza può essere drasticamente inferiore rispetto a quello di un modello denso con la stessa dimensione totale.
La cautela è necessaria perché una parte delle specifiche circolate prima del rilascio non è ancora stata validata da benchmark indipendenti. Le anticipazioni riportano anche circa 51 miliardi di parametri associati a una componente N-gram, un elemento particolarmente interessante perché introduce una forma di memoria parametrica basata su lookup invece di affidare tutto il lavoro alle moltiplicazioni matriciali tradizionali. Le informazioni disponibili prima del rilascio devono però essere separate con disciplina dai dati ufficialmente verificati. La stessa pagina Hugging Face, al momento della consultazione, mostrava il modello come release imminente e non ancora disponibile.
È proprio questa combinazione a rendere Qwen3.8-Flash-Next più importante del suo nome quasi burocratico. Il numero “3.8” suggerisce una semplice evoluzione della generazione precedente; la parola “Next” racconta invece la strategia reale. Alibaba sta utilizzando un modello preliminare come veicolo per introdurre una nuova architettura nell’ecosistema degli sviluppatori prima che arrivi il prodotto principale. È una scelta industriale molto più sofisticata del consueto rituale della Silicon Valley, dove si annuncia un modello, si pubblicano tre grafici, si confrontano benchmark scelti con cura e si proclama che l’umanità ha appena fatto un altro passo verso l’intelligenza generale.
Qui il meccanismo è diverso. Prima arriva l’architettura, poi arriverà la famiglia di modelli. Gli sviluppatori possono quindi iniziare ad adattare runtime, sistemi di quantizzazione, framework di inferenza e strumenti di deployment prima dell’arrivo di Qwen4. Le anticipazioni disponibili indicano inoltre che Qwen3.8-Flash-Next introduce cambiamenti architetturali rilevanti, fra cui una configurazione ibrida GDN e Qwen Sparse Attention. Se queste caratteristiche saranno confermate nella release definitiva, il messaggio diventa ancora più chiaro: Alibaba non sta semplicemente aumentando il numero dei parametri, sta cercando di modificare il rapporto fra capacità, memoria e costo di inferenza.
Questo è il punto sul quale il mercato occidentale farebbe bene a concentrarsi. La prima fase della competizione sull’AI è stata dominata dalla domanda “quanto è grande il modello?”. La seconda sta diventando “quanto costa ottenere un token utile?”. Sono due metriche molto diverse. Un modello gigantesco può essere impressionante in laboratorio e diventare economicamente scomodo quando deve generare milioni o miliardi di token in produzione. Un’architettura più parsimoniosa, al contrario, può essere meno spettacolare sulla slide degli investitori e molto più interessante sul conto economico del CFO.
La differenza diventa ancora più evidente quando si parla di open weights. Un modello aperto non obbliga l’azienda a consegnare dati e workload a un provider esterno per ogni inferenza. Può essere quantizzato, adattato, fine-tuned e installato su infrastrutture proprie, compatibilmente con licenza e requisiti hardware. Questo sposta la competizione dall’accesso al modello alla capacità di industrializzarlo. Alibaba, DeepSeek e altri laboratori cinesi hanno costruito negli ultimi anni una dinamica nella quale il modello non è soltanto un servizio cloud, ma un componente distribuibile dell’infrastruttura software. È una differenza strategica che tende a diventare invisibile finché non arriva la fattura del cloud.
Qwen parte inoltre da una posizione particolarmente forte nell’ecosistema open model. La collezione Qwen3.8 su Hugging Face mostra già modelli che vanno da un 27B multimodale fino a una configurazione da 2,4 trilioni di parametri, segno di una strategia che non punta a un singolo modello universale ma a una famiglia articolata per dimensioni, costi e scenari di utilizzo. La vera forza di questo approccio non è necessariamente che ogni modello sia il migliore in assoluto. È che gli sviluppatori possono scegliere un punto della curva costo-prestazioni senza dover cambiare completamente ecosistema.
La questione dei 6 miliardi attivi per token va quindi letta come un’indicazione architetturale, non come una promessa di prestazioni. Non sappiamo ancora se Qwen3.8-Flash-Next sarà competitivo con i migliori modelli proprietari in ragionamento, coding, multimodalità o agentic workloads. Non sappiamo neppure quanto sarà efficiente nella pratica su diverse GPU e configurazioni di memoria. I benchmark sono ancora il pezzo mancante del puzzle e qualsiasi classifica pubblicata prima della disponibilità effettiva dei pesi sarebbe più marketing che scienza.
Il significato economico, tuttavia, è già leggibile. L’AI sta entrando nella fase in cui l’efficienza dell’inferenza conta quasi quanto la qualità del modello. Per un’impresa che deve gestire agenti autonomi, copiloti interni, ricerca documentale, generazione di codice o sistemi multimodali su larga scala, una riduzione del numero di parametri attivati può avere conseguenze molto più concrete di un miglioramento marginale su un benchmark. Un punto percentuale in più su una classifica accademica entusiasma il laboratorio; una riduzione significativa del costo per milione di token interessa il consiglio di amministrazione.
La scelta cinese di anticipare l’architettura prima del flagship introduce inoltre un elemento di strategia industriale che merita attenzione. Se Qwen4 arriverà su una base già assimilata dall’ecosistema, Alibaba non dovrà convincere gli sviluppatori a ricominciare da zero. Runtime, toolchain, quantizzazione e applicazioni potranno essere già in fase di adattamento. In altre parole, il vantaggio competitivo potrebbe non essere il modello al momento del lancio, ma la velocità con cui l’intero ecosistema riesce a trasformarlo in infrastruttura.
È qui che la guerra dei modelli cambia natura. La Silicon Valley ha costruito gran parte della narrativa sull’AI intorno alla scarsità: pochi laboratori, enormi cluster, modelli chiusi, accesso via API e miliardi di dollari necessari per raggiungere la frontiera. Il modello cinese degli open weights introduce una logica differente: rendere rapidamente disponibile una tecnologia abbastanza potente, lasciare che la comunità la ottimizzi e utilizzare la scala dell’ecosistema come moltiplicatore. Non è necessariamente superiore in ogni circostanza, ma è terribilmente efficace nel comprimere i tempi di adozione.
Qwen3.8-Flash-Next, dunque, potrebbe essere ricordato non per essere il miglior modello del 26 agosto 2026, ma per aver anticipato una direzione. Il parametro che conta sempre meno è il numero stampato sulla confezione. Conta quanto di quella capacità viene realmente utilizzato per produrre ogni token, quanto costa mantenerla in memoria, quanto velocemente può essere eseguita e quanto facilmente può essere trasformata in software industriale. La prossima generazione dell’AI non sarà necessariamente quella con più parametri. Potrebbe essere quella che spreca meno calcolo per ottenere la stessa intelligenza. E, dopo anni in cui la Silicon Valley ha trattato i megawatt come se fossero una nuova forma di genialità, sarebbe una piccola ma significativa inversione di prospettiva.