Quantizzazione dei modelli AI: cos'è e quale scegliere
Cos'è la quantizzazione di un modello AI, cosa significano le sigle Q4 e Q8, quanta qualità si perde davvero e come scegliere la versione giusta da scaricare.
Vai a scaricare un modello AI e ti trovi davanti quindici versioni dello stesso file: Q4_K_M, Q5_K_S, Q8_0, e sigle simili. Occupano da 4 a 15 GB, e non è ovvio quale prendere. Dietro quelle sigle c'è la quantizzazione, la tecnica che rende eseguibili in locale modelli che altrimenti non ci starebbero. In questo articolo ti spiego cosa fa, quanto costa in qualità e quale scegliere.
Cos'è la quantizzazione
La quantizzazione riduce la precisione con cui sono memorizzati i parametri di un modello: da numeri a 16 bit si passa a 8, 5 o 4 bit. Il modello occupa molta meno memoria, restando sostanzialmente lo stesso modello.
Un'analogia utile: è come salvare una fotografia in JPEG invece che senza compressione. Il file diventa una frazione, l'immagine resta riconoscibile, e a compressione moderata la differenza non si vede. Spingendo troppo, invece, gli artefatti diventano evidenti.
Perché conta
I parametri di un modello sono miliardi di numeri, e ognuno occupa spazio in memoria.
| Precisione | Byte per parametro | Modello 7B | Modello 70B |
|---|---|---|---|
| 16 bit (originale) | 2 | ~14 GB | ~140 GB |
| 8 bit | 1 | ~7 GB | ~70 GB |
| 5 bit | ~0,65 | ~4,5 GB | ~45 GB |
| 4 bit | ~0,5 | ~3,5 GB | ~35 GB |
La differenza pratica è tra "non posso eseguirlo" e "gira sul mio computer". Un 7B originale non entra in una scheda video da 8 GB; quantizzato a 4 bit ci sta comodamente.
Ed è ciò che rende praticabile far girare un LLM in locale senza hardware professionale.
Quanta qualità si perde
La domanda giusta, e la risposta è meno drammatica di quanto ci si aspetti:
| Livello | Perdita | Giudizio |
|---|---|---|
| 8 bit | Trascurabile | Praticamente indistinguibile |
| 6 bit | Molto piccola | Ottimo compromesso |
| 5 bit | Piccola | Buon equilibrio |
| 4 bit | Contenuta ma percepibile | Lo standard di fatto |
| 3 bit | Evidente | Solo se non c'è alternativa |
| 2 bit | Grave | Generalmente da evitare |
Il punto pratico che conta di più: a parità di memoria disponibile, un modello più grande quantizzato batte quasi sempre uno più piccolo a precisione piena. Un 13B a 4 bit rende meglio di un 7B a 8 bit, occupando spazio simile. Se devi scegliere, prendi il modello più grande che ci sta.
Dove la perdita si nota di più: compiti che richiedono precisione — matematica, codice, ragionamento in più passaggi, seguire istruzioni complesse. Su conversazione, riassunti e scrittura la differenza tra 4 e 8 bit è difficile da percepire.
Decifrare le sigle
Ecco come si legge un nome come Q4_K_M:
Q4 — 4 bit di precisione. Il numero principale.
K — indica lo schema "K-quant", che applica precisioni diverse alle diverse parti del modello: più bit dove servono, meno dove incidono poco. È nettamente migliore degli schemi vecchi a precisione uniforme, e va preferito quando disponibile.
S / M / L — small, medium, large: quanto è aggressiva la compressione dentro quello schema. Q4_K_M è più grande e migliore di Q4_K_S.
Un Q4_K_M rende meglio di un Q4_0 pur avendo lo stesso "4": lo schema conta quanto il numero di bit.
Esistono poi formati diversi a seconda di dove esegui il modello (GGUF per l'esecuzione su CPU e sistemi misti, altri formati per l'esecuzione interamente su GPU). L'interfaccia che usi in genere ti indica quale formato le serve.
Quale scegliere
Il criterio pratico, partendo dalla memoria che hai:
Calcola quanto spazio hai davvero. Se hai 8 GB di VRAM, non puntare a riempirli: servono 1-2 GB per il contesto e il sistema. Punta a un file da 5-6 GB.
Poi scegli così:
| Memoria disponibile | Scelta ragionevole |
|---|---|
| 6-8 GB | Un 7-8B in Q4_K_M |
| 12 GB | Un 13-14B in Q4_K_M, o un 7B in Q6 |
| 16 GB | Un 14B in Q5/Q6 |
| 24 GB+ | Un 30B+ in Q4, o modelli medi a precisione alta |
La regola generale: prendi il modello più grande che ci sta, in Q4_K_M o Q5_K_M. È il compromesso che funziona nella grande maggioranza dei casi.
Sali a Q6 o Q8 solo se il compito richiede precisione (codice, matematica) e hai memoria in abbondanza.
Scendi sotto Q4 solo se non hai alternative — e sapendo che il degrado si vede.
Cosa la quantizzazione non fa
Vale la pena essere chiari, perché genera aspettative sbagliate.
Non rende un modello piccolo bravo quanto uno grande. Comprime, non migliora.
Non velocizza sempre. Riduce la memoria occupata e il traffico verso di essa, il che spesso aiuta — ma su alcune combinazioni di hardware la decompressione aggiunge lavoro. Il guadagno principale è di memoria, non di velocità.
Non elimina i limiti del modello. Le allucinazioni, i limiti di conoscenza e gli errori di ragionamento restano — semmai, a quantizzazioni aggressive, peggiorano leggermente.
Non serve per le API. Se usi un modello via API, la quantizzazione è un problema del fornitore, non tuo. È un tema che riguarda solo chi esegue modelli in proprio.
In sintesi
La quantizzazione riduce la precisione dei parametri per far entrare un modello in molta meno memoria. A 8 bit la perdita è trascurabile, a 4 bit è contenuta e accettabile per la maggior parte degli usi, sotto i 4 bit diventa evidente.
Nelle sigle, il numero indica i bit e la lettera K uno schema più intelligente che distribuisce la precisione dove serve: Q4_K_M è il punto di equilibrio più usato, e a ragione.
Il principio pratico da ricordare è uno: a parità di memoria, un modello più grande e quantizzato batte uno più piccolo a piena precisione.
E la scelta parte sempre dalla memoria disponibile, tenendo un paio di GB di margine per il contesto — non dal nome del modello.