È uscito il Corso Java Completo
Torna al blog

7B, 70B, 405B: cosa significano i parametri di un modello AI

Cosa sono i parametri di un modello AI, cosa significano le sigle 7B e 70B, quanta memoria serve per eseguirli e perché più grande non vuol dire migliore.

Edoardo Midali

Edoardo Midali

Developer · Content Creator

6 min di lettura

Scorrendo l'elenco dei modelli AI scaricabili trovi sigle come 7B, 13B, 70B, 405B. Sono numeri che determinano se un modello girerà sul tuo computer o no, quanto sarà bravo e quanto costerà usarlo. In questo articolo ti spiego cosa misurano davvero, come si calcola la memoria necessaria e perché il numero più grande non è automaticamente la scelta migliore.

Cosa sono i parametri

I parametri sono i valori numerici interni al modello, quelli che vengono aggiustati durante l'addestramento e in cui è "immagazzinato" ciò che il modello ha imparato. La B sta per miliardi: un modello 7B ne ha circa sette miliardi.

Un'analogia utile, tenendo presente che è imprecisa: sono come le connessioni di una rete. Più connessioni significa più capacità di rappresentare sfumature e relazioni — non necessariamente più intelligenza.

Il funzionamento sottostante è quello descritto in cos'è un Transformer: i parametri sono i pesi che determinano come ogni token influenza gli altri.

Le taglie e cosa ci fai

Un quadro orientativo delle categorie:

TagliaUso tipico
1-3BCompiti semplici, dispositivi mobili, classificazione
7-8BLa taglia più usata in locale. Buona su compiti generali
13-14BUn gradino sopra, ancora accessibile
30-40BServe hardware serio
70BQualità alta, richiede hardware professionale
200B+Praticamente solo via API

I modelli commerciali più noti non dichiarano il numero di parametri, ma si collocano nella fascia alta.

Quanta memoria serve

È la domanda pratica che conta, e c'è una regola semplice per rispondere.

Ogni parametro occupa spazio in memoria. Quanto dipende dalla precisione con cui è memorizzato:

PrecisioneByte per parametroModello 7B occupa
16 bit (originale)2~14 GB
8 bit1~7 GB
4 bit0,5~3,5 GB

La formula pratica: miliardi di parametri × byte per parametro = GB necessari. Poi aggiungi circa il 20% per il contesto e il funzionamento.

Ridurre la precisione si chiama quantizzazione, ed è ciò che rende eseguibili in locale modelli che altrimenti non ci starebbero. Un 7B a 4 bit sta in circa 4-5 GB di VRAM: gira su una scheda video di fascia media.

La perdita di qualità nel passare a 8 bit è generalmente trascurabile; a 4 bit è contenuta e quasi sempre accettabile; sotto i 4 bit diventa evidente.

Il punto pratico più importante: un modello 13B quantizzato a 4 bit di solito rende meglio di un 7B a piena precisione, occupando spazio simile. Se devi scegliere, conviene un modello più grande più compresso.

Sull'esecuzione locale ho scritto una guida dedicata: far girare un LLM in locale.

Perché più grande non è sempre meglio

Qui sta il fraintendimento più diffuso.

I parametri non sono l'unico fattore, e nemmeno il più determinante. Contano almeno quanto:

La qualità dei dati di addestramento. Un modello addestrato su dati curati batte regolarmente un modello più grande addestrato su materiale grezzo. È probabilmente la variabile più importante in assoluto.

La quantità di addestramento. Si è capito che molti modelli grandi erano sotto-addestrati: con più dati sugli stessi parametri rendevano molto di più.

Il post-addestramento. Il lavoro di rifinitura successivo — allineamento, istruzioni, preferenze — incide enormemente sull'utilità pratica.

La specializzazione. Un modello piccolo addestrato su un dominio specifico batte un modello generalista molto più grande su quel dominio. È il ragionamento del fine-tuning.

Il risultato concreto: modelli da 7-8B di oggi superano modelli da 70B di due o tre anni fa. Confrontare i parametri tra generazioni diverse non ha senso.

Il caso dei Mixture of Experts

Una complicazione utile da conoscere, perché rende i numeri ingannevoli.

Alcuni modelli usano un'architettura chiamata Mixture of Experts (MoE): hanno moltissimi parametri totali, ma per ogni token ne attivano solo una frazione, instradando il lavoro verso le parti più adatte.

La conseguenza pratica: un modello MoE può dichiarare centinaia di miliardi di parametri ma comportarsi, in velocità, come uno molto più piccolo. Serve però la memoria per l'intero modello, anche se ne usa poco per volta.

Quando confronti due modelli, verifica se uno dei due è MoE: altrimenti stai confrontando numeri che misurano cose diverse.

Come scegliere davvero

Non scegliere in base ai parametri. Il criterio sensato è, in ordine:

  1. Il modello sta nella mia memoria? Applica la formula sopra. Se non ci sta, il resto è irrilevante.
  2. Va bene sul mio compito specifico? Provalo sui tuoi casi reali, non sui benchmark generici.
  3. La velocità è accettabile? Un modello grande che risponde in un minuto può essere inutilizzabile per un uso interattivo.
  4. Solo a parità di questi, guarda le dimensioni.

Sui benchmark vale un'avvertenza: sono utili come indicazione grossolana, ma i punteggi si ottimizzano, e un modello che eccelle nelle classifiche può deludere sul tuo caso d'uso concreto. Dieci minuti di prova sui tuoi dati dicono più di qualunque tabella comparativa.

E soprattutto: chiediti se ti serve davvero un modello locale. Per la maggior parte degli usi, chiamare l'API di un modello commerciale costa meno e rende di più che gestire hardware. Il locale ha senso per privacy, volumi molto alti o esigenze specifiche — non per default.

In sintesi

I parametri sono i valori interni in cui il modello immagazzina quello che ha imparato, e la sigla B indica i miliardi. Determinano soprattutto quanta memoria serve per eseguirlo: la formula è parametri × byte per parametro, con la quantizzazione che riduce il secondo fattore.

Ma non determinano la qualità da soli. Dati di addestramento, quantità di training, post-addestramento e specializzazione contano quanto o più della taglia — al punto che i modelli piccoli di oggi battono quelli grandi di qualche anno fa.

La regola pratica più utile: a parità di memoria, un modello più grande e quantizzato batte quasi sempre uno più piccolo a piena precisione.

E il criterio di scelta non è il numero: è se sta nella tua memoria, se funziona sul tuo compito e se risponde abbastanza in fretta.