---
type: "Comparison"
title: "IQ3_S vs Q4_K_M: quale quantizzazione GGUF fa stare 27B in 16 GB"
description: "IQ3_S (GSQ+RCO) vs Q4_K_M (classica, uniforme)"
resource: "https://www.contextstudios.ai/it/confronto/iq3-s-vs-q4-k-m"
language: "it"
tags: ["IQ3_S", "Q4_K_M", "quantizzazione GGUF", "16 GB VRAM", "Qwen3.8-27B", "llama.cpp"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T22:10:00.840Z"
status: "stable"
---

# IQ3_S vs Q4_K_M: quale quantizzazione GGUF fa stare 27B in 16 GB

La differenza è un piano di memoria: Q4_K_M comprime un modello 27B a circa 15 GB e riempie quasi del tutto una scheda da 16 GB — lo spazio che avanza per la KV-cache diventa il collo di bottiglia sulla lunghezza del contesto. IQ3_S con la ricerca per tensore (GSQ+RCO di IST-DASLab) arriva a 11,8 GB mantenendo il 99,8 % della media dei task rispetto alla base BF16, con una riduzione di 4,6×. Sul portatile da 16 GB, IQ3_S è il punto razionale; Q4_K_M resta il default comprovato quando la scheda offre più spazio.

## Confronto Dettagliato

| Fattore | IQ3_S (GSQ+RCO) | Q4_K_M (classica, uniforme) | Vincitore |
|--------|------|------|--------|
| Dimensione del file | 11,8 GB — 4,6 volte più piccolo della base BF16 (53,8 GB) | circa 15 GB — circa 3,6 volte più piccolo della base BF16 | IQ3_S (GSQ+RCO) |
| Margine per la KV-cache | 3–4 GB restano su schede da 16 GB — contesti fino a ~100k token restano utilizzabili | meno di 1 GB residuo — le finestre lunghe toccano presto il limite VRAM | IQ3_S (GSQ+RCO) |
| Qualità dei task | 99,8 % di media: AIME25 100,00, GPQA-Diamond 89,39, LiveCodeBench v6 85,71 — AIME e LCB esattamente al livello della base | quasi senza perdita sui modelli densi, tipicamente 99–100 % della media FP16 | Pareggio |
| Velocità di decodifica | ~40 tok/s misurati su RTX 5060 Ti 16 GB, 552 tok/s di prefill a 112k di contesto | analoga sulle schede più grandi; su 16 GB il file più piccolo trasferisce meno memoria dei pesi | IQ3_S (GSQ+RCO) |
| Compatibilità | file GGUF standard, funziona subito con llama.cpp, Ollama e LM Studio | default consolidato di tutta la filiera GGUF | Pareggio |
| Stabilità del contesto lungo | 17–30 tok/s a fine finestra 112k piena — il rate scende con la KV-cache ma resta utilizzabile | finestra e cache si contendono gli ultimi gigabyte; rischio OOM nella fascia alta | IQ3_S (GSQ+RCO) |
| Riproducibilità | assegnazione dei tensore fornita come .rco-allocation.txt più matrice di importance (1000 × 4096 token) nel repo | schema standardizzato e ben documentato, senza file di audit per tensore | IQ3_S (GSQ+RCO) |
| Supporto multimodale | stesso file mmproj (BF16, 0,9 GB) per tutti i livelli IQ; build MTP +0,35 GB | stesso mmproj — nessun svantaggio, è identico per entrambi i livelli | Pareggio |

## Statistiche Chiave

- **Qwen3.8-27B in IQ3_S: 11,8 GB a 3,50 bpw con AIME25 100,00 / GPQA-Diamond 89,39 / LiveCodeBench v6 85,71 — contro 53,8 GB della base BF16 (GPQA 89,90)** — [model card IST-DASLab](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **~40 tok/s di media con IQ3_S su RTX 5060 Ti 16 GB; 552 tok/s di prefill a 112k di contesto; 25–30 tok/s a fine finestra piena** — [misure della community (discussione HF)](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/discussions/6) (2026)
- **~136 tok/s con IQ3_S su RTX 5090, contesto lungo** — [model card IST-DASLab](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **Con la vecchia logica uniforme un modello denso 27B richiedeva 18–20 GB; la ricerca per tensore lo porta sotto la linea dei 16 GB** — [model card IST-DASLab](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **Anche il livello più piccolo IQ2_XS (8,4 GB, 2,50 bpw) porta 96,67 su AIME25 — sopra la base BF16 in zero-shot** — [model card IST-DASLab](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **La compressione densa ha un pavimento rigido intorno a 2,5 bpw: sotto, la media dei task collassa** — [model card IST-DASLab](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)

## Scelga IQ3_S (GSQ+RCO) quando...

- 16 GB di VRAM è il limite rigido
- servono contesti fino a ~100k con margine reale
- la media dei task deve restare sopra il 99 %
- serve un’assegnazione per tensore con file di audit

## Scelga Q4_K_M (classica, uniforme) quando...

- sono disponibili più di 18 GB di VRAM
- la toolchain attende lo schema uniforme standard
- i cache Q4_K_M esistenti non vanno ricostruiti
- conta la larghezza di bit massima per layer

## La Nostra Raccomandazione

IQ3_S vince sulle schede da 16 GB su tre dimensioni — dimensione del file, margine KV, stabilità del contesto lungo — con qualità praticamente identica (99,8 % di media, AIME25 e LiveCodeBench esattamente al livello della base). Q4_K_M tiene dove la scheda offre più di 18 GB e lo schema uniforme è lo standard atteso. Regola di decisione: misurate la finestra di contesto realmente usata, poi scegliete il file che lascia 3 GB a cache e attivazioni — con questo calcolo IQ3_S sta in 16 GB, Q4_K_M appena sotto.

## Domande Frequenti

**Q: Quale file prendo su una scheda da 16 GB?**
A: IQ3_S (11,8 GB) per la qualità piena e contesti 100k–112k. IQ2_S (9,3 GB) se serve più margine per batch grandi o finestre più lunghe — raggiunge già il livello base su AIME25. IQ2_XS è la scelta per i notebook da 12 GB, dove 8,4 GB più mmproj stanno ancora comodi.

**Q: Q4_K_M diventa obsoleta?**
A: No. Sopra i 16 GB, Q4_K_M resta il default comprovato quasi senza perdita e ogni toolchain la comprende. Il vantaggio di IQ3_S è una conseguenza geometrica, non magia algoritmica: 3,4 GB di pesi in meno, 3,4 GB di cache in più.

**Q: I 40 tok/s valgono per ogni contesto?**
A: Pianificate un intervallo, non un numero: fino a ~50 tok/s a inizio finestra, 25–30 tok/s a fine contesto 112k pieno. Il prefill resta a 552 tok/s, in parallelo sui token del prompt.

**Q: Serve la variante -mtp?**
A: Se l’harness supporta il decodifico speculativo: sì. La testa MTP costa solo 0,35 GB, non cambia i pesi e accelera la decodifica in modo misurabile. Senza supporto MTP, il file standard basta.

