Nei siti specializzati e i quelli generalisti si parla sempre di Claude, di ChatGPT, di Grok e Gemini, e molti pensano che il mondo dell’IA gira solo intorno a queste big tech americane.
Ma non è così, oggi vediamo quelli che di solito vengono chiamati “modelli open source”, con le loro caratteristiche e qualche caso d’uso

Questa settimana voglio mostrarvi il mondo dietro ai questi open source, che spesso si nascondono dietro le API di AWS, Google Cloud e dei cloud europei.
Vediamo quanti sono, che “taglie” hanno, a cosa servono.
Così la settimana prossima vedremo invece come si usano davvero, e perché la scelta tra Stati Uniti ed Europa è più di una mera questione di prezzo.

Il 2 aprile 2026 Google DeepMind ha rilasciato Gemma 4.
E non un modello solo, ma quattro. Sotto lo stesso nome, lo stesso giorno, sono usciti una versione da 2 miliardi di parametri che gira su uno smartphone e una da 31 miliardi che serve un cluster di GPU.
Stessa famiglia, stessa azienda, ma con una distanza di scala che è come paragonare una bicicletta a una portaerei.
E Gemma non è un unicum, i modelli Open sono quasi tutti così.
Ogni famiglia di modelli open, da Llama a Mistral a Qwen, viene rilasciata in mezza dozzina di taglie diverse.

Non è marketing. È che un modello da infilare in un’app per smartphone e un modello che deve ragionare su un intero repository di codice non possono essere lo stesso oggetto, per quanto portino la stesso nome e la stessa versione.

Open weight != open source

Prima di guardare numeri e nomi facciamo una precisione, vale la pena chiarire i termini, perché vengono usati come sinonimi e non lo sono.
Nella maggior parte dei casi questi modelli sono open weight: l’azienda pubblica i parametri già addestrati, e chiunque può scaricarli e farli girare, ma la ricetta con cui sono stati costruiti resta chiusa.

Le licenze poi non sono tutte uguali. Mistral, Google e la linea open di Qwen hanno scelto Apache 2.0, permissiva, uso commerciale senza condizioni.
DeepSeek distribuisce con licenza MIT, ancora più semplice.
Meta invece pubblica Llama con una licenza community propria, che impone alcune restrizioni d’uso e non è riconosciuta come open source in senso stretto.

Sono dettagli da contratto, ma per chi deve costruirci sopra un prodotto commerciale fanno la differenza tra la scelta di uno o dell’altro.

Due numeri, non uno

Ed ora i numeri.
Dal 2024 in avanti, la taglia di un modello si misura su due numeri.
C’è il totale dei parametri, e c’è quanti di quei parametri si “accendono” davvero per rispondere a una singola domanda.

Questa architettura si chiama mixture of experts, esperti misti.
Il modello è diviso in blocchi specializzati, e per ogni richiesta ne vengono attivati solo alcuni.

DeepSeek V4 Pro, per fare un esempio concreto, ha 1.600 miliardi di parametri totali, ma ne accende circa 49 miliardi per volta.

Llama 4 Maverick ne ha 400 miliardi totali e ne attiva 17.

Qwen 3.5 segue lo stesso schema, 397 miliardi totali, 17 attivi.

È un trucco che permette di avere la conoscenza di un gigante con il conto energetico di un modello molto più piccolo, e spiega perché i modelli enormi siano diventati, paradossalmente, anche più economici da far girare.

Ci sono poi quelli che vengono chiamati modelli “densi”, dove tutti i parametri lavorano sempre.
Gemma 4 nella versione a 31 miliardi, per esempio.

Più semplici da costruire, ma più cari da eseguire a parità di dimensione, perché nessun blocco resta a riposo.

Vediamo le famiglie più famose, una per una

Llama, di Meta, resta il nome più generalista.
Partiamo dalla versione 3.1 fino a Llama 4 Maverick e Scout, con quest’ultimo capace di gestire un contesto fino a 10 milioni di token, che a lume di naso è sufficiente per un’intera codebase di un progetto di media grandezza o un libro intero caricato in un colpo solo.
È multimodale, ossia legge immagini oltre al testo, ed è la scelta di default per chi vuole un modello tuttofare senza specializzazioni particolari.

Mistral, francese, ha costruito una famiglia più segmentata, e per tanti versi la più versatile.
Large per i compiti pesanti, Small e Ministral (3, 8, 14 miliardi) per l’edge,
Devstral costruita appositamente per il codice, Magistral per il ragionamento, Voxtral per l’audio.

Il punto di forza dichiarato è noto per chi la usa, è realmente multilingua (almeno per le lingue europee). Sono oltre venti le lingue supportate, italiano compreso, con una qualità che più che spesso supera i modelli americani tarati principalmente sull’inglese.

Qwen, di Alibaba, copre l’intervallo più ampio in assoluto. Si va da 0,8 miliardi fino a 397.
La sua reputazione se l’è costruita sul codice agentico, cioè sulla capacità di usare strumenti esterni e pianificare più passaggi da solo, e sulla visione, con la variante Qwen3-VL capace di leggere immagini e documenti insieme al testo.
É molto amato dai programmatori.

DeepSeek è quello che ha fatto più rumore, spesso non per i motivi strettamente tecnici.
É il modello con i punteggi più alti sui benchmark di ragionamento e coding tra tutti gli open, grazie proprio all’architettura a esperti misti spinta all’estremo.
Il costo per token è tra i più bassi del mercato, ed è la ragione per cui compare in quasi tutti i cataloghi cloud nonostante l’origine cinese sollevi, comprensibilmente, qualche domanda in più su dove finiscano i dati durante l’uso.

Gemma, di Google, gioca la partita opposta. Gli open weight di Google non puntano al record sui benchmark, punta a girare bene su poco hardware.
Le varianti E2B ed E4B sono pensate per telefoni e laptop, mentre la 31B dense per chi vuole qualcosa di più robusto ma ancora gestibile su una singola macchina con una scheda grafica adeguata.

Phi, di Microsoft, segue la stessa filosofia di Gemma ma la spinge al limite. Modelli piccolissimi, allenati su dati sintetici curati con attenzione quasi maniacale, che ottengono risultati di ragionamento sproporzionati rispetto alla loro dimensione.
Un Phi-4 da 14 miliardi gira comodamente su un laptop e in certi compiti tiene testa a modelli dieci volte più grandi.

Ogni taglia ha il suo motivo di essere

Programmare, scrivere testi, capire un comando in linguaggio naturale, automatizzare un foglio Excel sono compiti diversi, e infatti chiedono modelli diversi, non lo stesso modello usato quattro volte.

Per il codice la fascia che conta davvero è quella specializzata, non quella generalista.

Modelli per il coding

Qwen3-Coder e Devstral di Mistral sono pensati apposta per questo, e già nella taglia media, intorno ai 30-35 miliardi di parametri attivi, reggono bene il refactoring di un progetto reale.
Per il completamento in tempo reale mentre si scrive, dentro un editor, la scelta giusta è un modello piccolo e velocissimo come Codestral, dove la latenza conta più della profondità di ragionamento.
Il salto verso DeepSeek V4 o Qwen3.5 nella sua versione piena ha senso solo quando il problema è davvero complesso, un bug che attraversa più file o un’architettura da ripensare da zero: lì la spesa maggiore si giustifica.

Modelli per i testi

Per scrivere testi, un articolo, una mail importante, un contenuto che qualcuno leggerà con attenzione, la qualità della lingua conta più della velocità.
Mistral Large si fa notare proprio in questi ambiti, per il modo in cui gestisce l’italiano e le altre lingue europee senza quella patina di traduzione dall’inglese che si sente ancora in molti modelli americani.
Llama 4 Maverick resta un’alternativa solida per un testo generico in inglese. Per una bozza veloce, un riassunto, una mail di routine, un modello piccolo come Gemma 4 o Ministral 8B basta e avanza, e costa una frazione.

Modelli per interpretare comandi

Capire un comando in linguaggio naturale e trasformarlo in un’azione, “prenota questa riunione”, “cerca questo file e mandalo a Marco”, è tutta un’altra storia.
Qui il modello non deve scrivere bene, deve capire cosa l’utente vuole fare e chiamare lo strumento giusto.
È il campo del tool calling, ed è dove Qwen3 e Llama 4 si sono guadagnati la reputazione migliore, perché sono stati allenati apposta a scegliere tra più funzioni disponibili e a incatenare più passaggi da soli.
Anche qui, però, non serve il modello più grande. Qwen3.6-35B-A3B interpreta un comando quotidiano meglio e più in fretta di un DeepSeek V4 per fare la stessa cosa.

Modelli per automatizzare attività

Automatizzare operazioni su Excel o sulla posta, estrarre dati da una mail e aggiornare una riga, leggere una tabella e generare un report, è probabilmente il caso dove la taglia piccola vince a mani basse.
Il compito è ripetitivo, il formato di input e output è quasi sempre lo stesso, e quello che serve davvero è affidabilità nel restituire un output strutturato, non creatività. Modelli come Phi-4 di Microsoft o Ministral 3B, affiancati a poche righe di codice che validano l’output prima di scriverlo nel foglio, fanno il lavoro a una frazione del costo di un modello frontier, e soprattutto rispondono in millisecondi invece che in secondi. E su mille righe di un foglio Excel, la differenza si vede.

“Che taglia signore?”

La scelta si riduce a tre domande, sempre le stesse:
che hardware hai a disposizione,
quanto puoi aspettare per una risposta,
quanto è davvero complicato il compito.

Un modello da pochi miliardi di parametri, tipo Gemma E4B o Ministral 8B, basta e avanza per classificare un testo, riassumere una mail, far funzionare un assistente offline, chiedergli di ragionare su un problema complesso è come chiedere a una bicicletta di trainare un rimorchio.

Nella fascia di mezzo, tra 20 e 35 miliardi, si trovano modelli come Qwen3.6-35B-A3B, che girano su una singola GPU da fissato per il gaming.
É il punto in cui si ferma la maggior parte delle applicazioni aziendali reali, perché il salto verso i modelli più grandi si sente, ma costa.

In cima ci sono i giganti da centinaia di miliardi, DeepSeek V4, Llama 4 Maverick, Mistral Large 3. Per questi servono un cluster di GPU e si giustificano solo quando il compito lo richiede sul serio, come ragionare su codice complesso o pianificare compiti con molti passaggi.

Sapere rispondere a queste tre domande prima di scegliere un modello risparmia più soldi di qualsiasi trattativa sul prezzo per token.
E soprattutto prepara alla domanda successiva, quella a cui dedichiamo l’articolo della prossima settimana, ossia “una volta scelto il modello giusto, dove lo si fa girare?” e vedremo anche le implicazioni legali sulla gestione dei dati.