È uscito il Corso Java Completo
Torna al blog

Quantizzazione dei modelli AI: cos'è e quale scegliere

Cos'è la quantizzazione di un modello AI, cosa significano le sigle Q4 e Q8, quanta qualità si perde davvero e come scegliere la versione giusta da scaricare.

Edoardo Midali

Edoardo Midali

Developer · Content Creator

5 min di lettura

Vai a scaricare un modello AI e ti trovi davanti quindici versioni dello stesso file: Q4_K_M, Q5_K_S, Q8_0, e sigle simili. Occupano da 4 a 15 GB, e non è ovvio quale prendere. Dietro quelle sigle c'è la quantizzazione, la tecnica che rende eseguibili in locale modelli che altrimenti non ci starebbero. In questo articolo ti spiego cosa fa, quanto costa in qualità e quale scegliere.

Cos'è la quantizzazione

La quantizzazione riduce la precisione con cui sono memorizzati i parametri di un modello: da numeri a 16 bit si passa a 8, 5 o 4 bit. Il modello occupa molta meno memoria, restando sostanzialmente lo stesso modello.

Un'analogia utile: è come salvare una fotografia in JPEG invece che senza compressione. Il file diventa una frazione, l'immagine resta riconoscibile, e a compressione moderata la differenza non si vede. Spingendo troppo, invece, gli artefatti diventano evidenti.

Perché conta

I parametri di un modello sono miliardi di numeri, e ognuno occupa spazio in memoria.

PrecisioneByte per parametroModello 7BModello 70B
16 bit (originale)2~14 GB~140 GB
8 bit1~7 GB~70 GB
5 bit~0,65~4,5 GB~45 GB
4 bit~0,5~3,5 GB~35 GB

La differenza pratica è tra "non posso eseguirlo" e "gira sul mio computer". Un 7B originale non entra in una scheda video da 8 GB; quantizzato a 4 bit ci sta comodamente.

Ed è ciò che rende praticabile far girare un LLM in locale senza hardware professionale.

Quanta qualità si perde

La domanda giusta, e la risposta è meno drammatica di quanto ci si aspetti:

LivelloPerditaGiudizio
8 bitTrascurabilePraticamente indistinguibile
6 bitMolto piccolaOttimo compromesso
5 bitPiccolaBuon equilibrio
4 bitContenuta ma percepibileLo standard di fatto
3 bitEvidenteSolo se non c'è alternativa
2 bitGraveGeneralmente da evitare

Il punto pratico che conta di più: a parità di memoria disponibile, un modello più grande quantizzato batte quasi sempre uno più piccolo a precisione piena. Un 13B a 4 bit rende meglio di un 7B a 8 bit, occupando spazio simile. Se devi scegliere, prendi il modello più grande che ci sta.

Dove la perdita si nota di più: compiti che richiedono precisione — matematica, codice, ragionamento in più passaggi, seguire istruzioni complesse. Su conversazione, riassunti e scrittura la differenza tra 4 e 8 bit è difficile da percepire.

Decifrare le sigle

Ecco come si legge un nome come Q4_K_M:

Q4 — 4 bit di precisione. Il numero principale.

K — indica lo schema "K-quant", che applica precisioni diverse alle diverse parti del modello: più bit dove servono, meno dove incidono poco. È nettamente migliore degli schemi vecchi a precisione uniforme, e va preferito quando disponibile.

S / M / L — small, medium, large: quanto è aggressiva la compressione dentro quello schema. Q4_K_M è più grande e migliore di Q4_K_S.

Un Q4_K_M rende meglio di un Q4_0 pur avendo lo stesso "4": lo schema conta quanto il numero di bit.

Esistono poi formati diversi a seconda di dove esegui il modello (GGUF per l'esecuzione su CPU e sistemi misti, altri formati per l'esecuzione interamente su GPU). L'interfaccia che usi in genere ti indica quale formato le serve.

Quale scegliere

Il criterio pratico, partendo dalla memoria che hai:

Calcola quanto spazio hai davvero. Se hai 8 GB di VRAM, non puntare a riempirli: servono 1-2 GB per il contesto e il sistema. Punta a un file da 5-6 GB.

Poi scegli così:

Memoria disponibileScelta ragionevole
6-8 GBUn 7-8B in Q4_K_M
12 GBUn 13-14B in Q4_K_M, o un 7B in Q6
16 GBUn 14B in Q5/Q6
24 GB+Un 30B+ in Q4, o modelli medi a precisione alta

La regola generale: prendi il modello più grande che ci sta, in Q4_K_M o Q5_K_M. È il compromesso che funziona nella grande maggioranza dei casi.

Sali a Q6 o Q8 solo se il compito richiede precisione (codice, matematica) e hai memoria in abbondanza.

Scendi sotto Q4 solo se non hai alternative — e sapendo che il degrado si vede.

Cosa la quantizzazione non fa

Vale la pena essere chiari, perché genera aspettative sbagliate.

Non rende un modello piccolo bravo quanto uno grande. Comprime, non migliora.

Non velocizza sempre. Riduce la memoria occupata e il traffico verso di essa, il che spesso aiuta — ma su alcune combinazioni di hardware la decompressione aggiunge lavoro. Il guadagno principale è di memoria, non di velocità.

Non elimina i limiti del modello. Le allucinazioni, i limiti di conoscenza e gli errori di ragionamento restano — semmai, a quantizzazioni aggressive, peggiorano leggermente.

Non serve per le API. Se usi un modello via API, la quantizzazione è un problema del fornitore, non tuo. È un tema che riguarda solo chi esegue modelli in proprio.

In sintesi

La quantizzazione riduce la precisione dei parametri per far entrare un modello in molta meno memoria. A 8 bit la perdita è trascurabile, a 4 bit è contenuta e accettabile per la maggior parte degli usi, sotto i 4 bit diventa evidente.

Nelle sigle, il numero indica i bit e la lettera K uno schema più intelligente che distribuisce la precisione dove serve: Q4_K_M è il punto di equilibrio più usato, e a ragione.

Il principio pratico da ricordare è uno: a parità di memoria, un modello più grande e quantizzato batte uno più piccolo a piena precisione.

E la scelta parte sempre dalla memoria disponibile, tenendo un paio di GB di margine per il contesto — non dal nome del modello.