Xiaomi ha appena mostrato un prototipo che racconta meglio di molti keynote dove potrebbe dirigersi l’economia dell’intelligenza artificiale. Si chiama AI Cube e non è, almeno per ora, un prodotto commerciale, né la presunta macchina capace di mandare in pensione Nvidia che alcuni titoli stanno già immaginando. È qualcosa di più interessante: un piccolo sistema progettato per eseguire localmente modelli linguistici di dimensioni molto elevate, costruito attorno a tre chip sviluppati dalla stessa Xiaomi, XRING O3, O100 e D100. Il prototipo raggiunge una potenza sostenuta dichiarata di 150 watt e, secondo Xiaomi, può gestire localmente un modello da 120 miliardi di parametri insieme a un modello più piccolo da 3 miliardi, con la possibilità di alternare una modalità rapida e una più pesante.
La prima cosa da correggere riguarda uno dei numeri più ripetuti nelle ultime ore. I 1,22 TB/s non sono la bandwidth dell’intero computer e non rappresentano la velocità alla quale il sistema può necessariamente leggere tutta la memoria utilizzata dal modello. Sono attribuiti all’XRING O100, un acceleratore AI costruito con packaging 3D a 6 nanometri, dotato di 28.672 connessioni dati effettive e di una tecnologia di memoria ad alta prossimità. Il D100, invece, è un chip a 3 nanometri con CPU a 20 core e NPU a 16 core, progettato per workload AI e sistemi intelligenti e indicato da Xiaomi come capace di supportare fino a 160 GB di memoria. Sono numeri importanti, ma appartengono a componenti differenti e metterli tutti nella stessa casella della performance sarebbe tecnicamente scorretto.
La differenza non è un dettaglio semantico. Nei sistemi per inferenza dei grandi modelli linguistici, la capacità di memoria determina quanto del modello può essere caricato, mentre la bandwidth contribuisce a determinare quanto rapidamente i dati possono essere movimentati durante l’esecuzione. Un sistema può avere una quantità enorme di memoria e una bandwidth insufficiente, oppure una bandwidth straordinaria associata a una capacità che non consente di contenere l’intero modello. Quando si parla di LLM, inoltre, bisogna considerare la KV cache, il contesto, gli overhead del runtime e le strutture temporanee utilizzate durante l’inferenza. Il numero di parametri, da solo, racconta quindi soltanto una parte della storia.
Il caso dei 120 miliardi è particolarmente istruttivo. Un modello da 120B in FP16 richiederebbe teoricamente circa 240 GB soltanto per i pesi, prima ancora di considerare memoria per contesto e runtime. In INT8 siamo nell’ordine dei 120 GB, mentre una rappresentazione a quattro bit scende grossolanamente verso 60 GB, a cui occorre comunque aggiungere overhead e cache. Di conseguenza, quando Xiaomi afferma che AI Cube può eseguire un modello da 120B, non bisogna immaginare automaticamente un modello pienamente rappresentato a precisione elevata. La quantizzazione è quasi certamente parte essenziale della dimostrazione. Non è una stranezza né un trucco: è ormai una tecnica normale per portare modelli molto grandi su sistemi locali, ma cambia radicalmente il significato tecnico della frase “120B in locale”.
La seconda notizia, forse ancora più significativa, riguarda la strategia industriale di Xiaomi. L’azienda non sta semplicemente costruendo un computer. Sta progressivamente cercando di ridurre la propria dipendenza da fornitori esterni di semiconduttori, sviluppando una famiglia proprietaria di chip che comprende il processore general purpose XRING O3, l’acceleratore AI O100 e il D100 destinato anche a workload automotive. Reuters riferisce che Xiaomi ha investito oltre 20 miliardi di yuan, circa 3 miliardi di dollari, nello sviluppo dei propri chip e che la struttura dedicata ai semiconduttori ha superato le 3.000 persone. L’O3 viene prodotto con tecnologia a 3 nanometri di TSMC, mentre O100 e D100 sono destinati a entrare nei prodotti successivamente.
Questa è una scelta industriale molto diversa dalla semplice ricerca del modello linguistico più brillante. Xiaomi sta tentando di controllare una porzione crescente dello stack, dal silicio al dispositivo fino all’intelligenza artificiale che vi gira sopra. È una strategia che ha precedenti illustri. Apple ha trasformato il controllo del processore in un vantaggio competitivo perché ha potuto progettare hardware e software come un unico sistema. Nvidia ha fatto qualcosa di analogo su scala diversa, costruendo attorno alle GPU un ecosistema software che comprende CUDA, librerie, compilatori e strumenti di sviluppo. Xiaomi ora prova a fare qualcosa di simile nell’AI edge, con un approccio che potrebbe avere conseguenze importanti se riuscirà a trasformare le specifiche del laboratorio in una piattaforma utilizzabile dagli sviluppatori.
Perché il problema non sarà il transistor. Sarà il software. Un acceleratore nuovo può avere una bandwidth straordinaria e una grande efficienza teorica, ma se non dispone di driver maturi, kernel ottimizzati, supporto ai principali framework e strumenti di profiling, il suo valore reale crolla rapidamente. Il mercato dell’AI ha già dimostrato che l’hardware senza ecosistema software è una commodity sofisticata. La difficoltà per Xiaomi sarà fare in modo che modelli open-weight possano essere quantizzati, caricati ed eseguiti attraverso stack familiari agli sviluppatori, senza costringerli a riscrivere metà dell’infrastruttura per ottenere una performance decente.
Qui entra in gioco anche la scelta architetturale. Xiaomi ha mostrato un sistema capace di lavorare contemporaneamente con un modello molto grande e con uno decisamente più piccolo, introducendo un meccanismo di commutazione fra modalità veloci e lente. È un’idea coerente con l’evoluzione dei sistemi agentici: non tutte le richieste hanno bisogno dello stesso modello. Un classificatore, una risposta semplice o una trasformazione di testo possono essere gestiti da un modello compatto; un problema complesso può essere affidato a un modello più pesante. Il futuro dell’inferenza potrebbe quindi essere meno “un modello per tutto” e più una gerarchia dinamica di modelli, selezionati in funzione del costo, della latenza e della complessità della richiesta.
Xiaomi ha inoltre mostrato un prototipo O100 basato sulla collaborazione fra XRING O3 e O100 nel quale il modello MiMo edge avrebbe raggiunto 295 token al secondo. Anche qui bisogna evitare la tentazione di trasformare un benchmark interno in una legge della fisica. Il risultato riguarda una configurazione specifica e un modello specifico ottimizzato per quell’ecosistema, non dimostra che un LLM generico da 120B possa produrre centinaia di token al secondo sullo stesso hardware. Senza benchmark indipendenti, con modelli open-weight e workload riproducibili, qualsiasi confronto diretto con GPU Nvidia, AMD o sistemi Apple rimane prematuro.
Il punto economico, tuttavia, resta intatto. L’inferenza è destinata a diventare una delle principali voci di costo dell’AI. Addestrare un modello frontier richiede enormi quantità di capitale, ma anche utilizzare quel modello milioni o miliardi di volte comporta costi ricorrenti di energia, memoria, networking e accelerazione. Per alcune applicazioni il cloud resterà imbattibile, soprattutto quando il carico è variabile e la scala giustifica infrastrutture centralizzate. Per altre, soprattutto in ambito industriale, sanitario, finanziario, governativo e corporate, la possibilità di mantenere l’inferenza all’interno del perimetro aziendale può diventare economicamente e strategicamente molto più interessante.
La private AI non nasce quindi soltanto da una preoccupazione per la privacy. Nasce da una combinazione di latenza, sovranità del dato, costi ricorrenti e controllo operativo. Un’azienda che deve interrogare continuamente documentazione proprietaria, codice, manuali tecnici, database interni o sistemi gestionali potrebbe preferire una macchina locale che lavora 24 ore al giorno a una fattura cloud che cresce insieme al successo del progetto. Il paradosso è che l’AI più economica potrebbe, in determinati casi, essere quella che non passa affatto dal cloud.
Questo non significa che i data center siano destinati a scomparire. Al contrario, continueranno a concentrare i workload più pesanti, l’addestramento dei modelli frontier e le applicazioni che richiedono enormi capacità elastiche. Ma la frontiera potrebbe frammentarsi. Una parte dell’intelligenza resterà nei grandi cluster, un’altra si sposterà verso workstation, server aziendali, automobili, smartphone e dispositivi industriali. Il valore si distribuirà lungo tutta la catena, e la capacità di decidere dove eseguire un modello diventerà una scelta architetturale prima ancora che una scelta tecnologica.
È qui che il caso Xiaomi assume un significato geopolitico. La Cina non deve necessariamente costruire il modello più potente del mondo per diventare competitiva nell’economia dell’AI. Può puntare su modelli open-weight, ottimizzarli per hardware proprietario, produrre dispositivi a costi aggressivi e costruire un ecosistema capace di portarli rapidamente sul mercato. È una strategia industriale meno spettacolare della corsa all’AGI, ma potenzialmente molto efficace. La storia dell’informatica insegna che non sempre vince chi inventa il computer più sofisticato; spesso vince chi riesce a trasformare una tecnologia sufficientemente buona in una piattaforma economica, scalabile e onnipresente.
Per ora, però, AI Cube resta un prototipo. Xiaomi non ha comunicato prezzo e data di commercializzazione, mentre O100 e D100 sono indicati per l’utilizzo nei prodotti a partire dal 2027. Questo impedisce qualsiasi conclusione seria sul rapporto prezzo/prestazioni e rende ancora più azzardato parlare di un concorrente diretto delle infrastrutture Nvidia. Il prodotto deve ancora dimostrare affidabilità, disponibilità, supporto software e performance riproducibili su modelli non preparati specificamente per il suo hardware.
La cosa che Xiaomi ha mostrato, però, è sufficiente per capire dove si sta spostando la competizione. Il vantaggio nell’AI non sarà determinato soltanto da chi possiede il modello più intelligente, ma da chi riesce a farlo funzionare con il minor costo energetico, nella memoria giusta, con una latenza accettabile e senza trasformare ogni inferenza in un viaggio di andata e ritorno verso un data center. La partita si sta spostando dal puro modello all’intero sistema.
La Silicon Valley ha costruito una narrativa fondata sulla scarsità dell’intelligenza artificiale. La prossima fase potrebbe essere dominata dalla scarsità di ciò che serve per renderla economicamente sostenibile: memoria, banda, energia, packaging, acceleratori e software. Xiaomi non ha ancora vinto questa partita, e sarebbe ingenuo sostenerlo. Ha però fatto qualcosa di più utile di una promessa: ha mostrato un’architettura concreta che prova a mettere molta capacità di inferenza dentro un sistema da 150 watt. Se il prezzo sarà competitivo e il software sarà all’altezza, il problema per i grandi operatori non sarà che esista un nuovo mini-PC cinese. Sarà che sempre più aziende potrebbero scoprire di non avere bisogno di affittare tutta l’intelligenza del mondo per ottenere quella che serve davvero.
Qui tutte le notizie: https://www.notebookcheck.net/Xiaomi-unveils-AI-Cube-mini-PC-with-three-Xring-chips-and-150-W-performance.1376717.0.html