Tecnologia

IQ3_S vs Q4_K_M: quale quantizzazione GGUF fa stare 27B in 16 GB

Verificato da Michael Kerkhoff, aggiornato al

Definizione
La differenza è un piano di memoria: Q4_K_M comprime un modello 27B a circa 15 GB e riempie quasi del tutto una scheda da 16 GB — lo spazio che avanza per la KV-cache diventa il collo di bottiglia sulla lunghezza del contesto. IQ3_S con la ricerca per tensore (GSQ+RCO di IST-DASLab) arriva a 11,8 GB mantenendo il 99,8 % della media dei task rispetto alla base BF16, con una riduzione di 4,6×. Sul portatile da 16 GB, IQ3_S è il punto razionale; Q4_K_M resta il default comprovato quando la scheda offre più spazio.
Categoria
Tecnologia
Opzioni
IQ3_S (GSQ+RCO)Q4_K_M (classica, uniforme)

Confronto Dettagliato

Un'analisi comparativa dei fattori chiave per aiutarLa a fare la scelta giusta.

IQ3_S (GSQ+RCO) vs Q4_K_M (classica, uniforme)
FattoreIQ3_S (GSQ+RCO)Q4_K_M (classica, uniforme)
Dimensione del file11,8 GB — 4,6 volte più piccolo della base BF16 (53,8 GB) Vincitorecirca 15 GB — circa 3,6 volte più piccolo della base BF16
Margine per la KV-cache3–4 GB restano su schede da 16 GB — contesti fino a ~100k token restano utilizzabili Vincitoremeno di 1 GB residuo — le finestre lunghe toccano presto il limite VRAM
Qualità dei task99,8 % di media: AIME25 100,00, GPQA-Diamond 89,39, LiveCodeBench v6 85,71 — AIME e LCB esattamente al livello della basequasi senza perdita sui modelli densi, tipicamente 99–100 % della media FP16
Velocità di decodifica~40 tok/s misurati su RTX 5060 Ti 16 GB, 552 tok/s di prefill a 112k di contesto Vincitoreanaloga sulle schede più grandi; su 16 GB il file più piccolo trasferisce meno memoria dei pesi
Compatibilitàfile GGUF standard, funziona subito con llama.cpp, Ollama e LM Studiodefault consolidato di tutta la filiera GGUF
Stabilità del contesto lungo17–30 tok/s a fine finestra 112k piena — il rate scende con la KV-cache ma resta utilizzabile Vincitorefinestra e cache si contendono gli ultimi gigabyte; rischio OOM nella fascia alta
Riproducibilitàassegnazione dei tensore fornita come .rco-allocation.txt più matrice di importance (1000 × 4096 token) nel repo Vincitoreschema standardizzato e ben documentato, senza file di audit per tensore
Supporto multimodalestesso file mmproj (BF16, 0,9 GB) per tutti i livelli IQ; build MTP +0,35 GBstesso mmproj — nessun svantaggio, è identico per entrambi i livelli
Punteggio Totale · 3 pareggi5 / 80 / 8

Statistiche Chiave

Dati reali da fonti verificate del settore per supportare la Sua decisione.

Tutte le statistiche provengono da fonti terze verificate. Fonte, anno e link diretto sono mostrati su ogni metrica.

Quando Scegliere Ogni Opzione

Una guida chiara basata sulla Sua situazione specifica ed esigenze.

La Nostra Raccomandazione

IQ3_S vince sulle schede da 16 GB su tre dimensioni — dimensione del file, margine KV, stabilità del contesto lungo — con qualità praticamente identica (99,8 % di media, AIME25 e LiveCodeBench esattamente al livello della base). Q4_K_M tiene dove la scheda offre più di 18 GB e lo schema uniforme è lo standard atteso. Regola di decisione: misurate la finestra di contesto realmente usata, poi scegliete il file che lascia 3 GB a cache e attivazioni — con questo calcolo IQ3_S sta in 16 GB, Q4_K_M appena sotto.

Scelga IQ3_S (GSQ+RCO) quando...
  • 16 GB di VRAM è il limite rigido
  • servono contesti fino a ~100k con margine reale
  • la media dei task deve restare sopra il 99 %
  • serve un’assegnazione per tensore con file di audit
Scelga Q4_K_M (classica, uniforme) quando...
  • sono disponibili più di 18 GB di VRAM
  • la toolchain attende lo schema uniforme standard
  • i cache Q4_K_M esistenti non vanno ricostruiti
  • conta la larghezza di bit massima per layer

Risposte alle domande comuni su questo confronto.

Domande Frequenti

(01)Quale file prendo su una scheda da 16 GB?
IQ3_S (11,8 GB) per la qualità piena e contesti 100k–112k. IQ2_S (9,3 GB) se serve più margine per batch grandi o finestre più lunghe — raggiunge già il livello base su AIME25. IQ2_XS è la scelta per i notebook da 12 GB, dove 8,4 GB più mmproj stanno ancora comodi.
(02)Q4_K_M diventa obsoleta?
No. Sopra i 16 GB, Q4_K_M resta il default comprovato quasi senza perdita e ogni toolchain la comprende. Il vantaggio di IQ3_S è una conseguenza geometrica, non magia algoritmica: 3,4 GB di pesi in meno, 3,4 GB di cache in più.
(03)I 40 tok/s valgono per ogni contesto?
Pianificate un intervallo, non un numero: fino a ~50 tok/s a inizio finestra, 25–30 tok/s a fine contesto 112k pieno. Il prefill resta a 552 tok/s, in parallelo sui token del prompt.
(04)Serve la variante -mtp?
Se l’harness supporta il decodifico speculativo: sì. La testa MTP costa solo 0,35 GB, non cambia i pesi e accelera la decodifica in modo misurabile. Senza supporto MTP, il file standard basta.

Ha bisogno di aiuto per decidere?

Prenoti una consulenza gratuita di 30 minuti e La aiuteremo a determinare l'approccio migliore per il Suo progetto specifico.

Consulenza gratuita · Senza impegno · Risposta personale