---
type: "Comparison"
title: "IQ3_S vs livelli IQ2: quantizzazione GGUF per stack laptop da 16 GB (2026)"
description: "Quantizzazione GGUF per laptop 16 GB nel 2026: IQ3_S (11,8 GB, 99,8% della qualità di base) vs IQ2_S e IQ2_XS per margine KV, schede da 12 GB e job a batch — con numeri misurati."
resource: "https://www.contextstudios.ai/it/confronto/gguf-quantization-iq3-s-vs-iq2-tiers"
language: "it"
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T22:10:43.368Z"
status: "stable"
---

# IQ3_S vs livelli IQ2: quantizzazione GGUF per stack laptop da 16 GB (2026)

Le release GSQ+RCO di IST-DASLab trasformano la quantizzazione in una decisione con numeri misurati: Qwen3.8-27B esce in GGUF su quattro livelli da 8,4 a 11,8 GB, e il livello consigliato IQ3_S mantiene il 99,8% della media task BF16 con una riduzione 4,6× — interamente dentro una GPU 16 GB di fascia media. Con la vecchia logica di quantizzazione uniforme un modello denso 27B richiedeva 18–20 GB; la ricerca per tensore lo spinge sotto il bordo. La vera domanda sul laptop: quale file scaricare — il livello più grande che riproduce la qualità di base (AIME25 e LiveCodeBench esatti, GPQA-Diamond scostato di 0,51 punti), o un livello IQ2 più piccolo che compra margine per la cache KV e i batch. Questo confronto pesa qualità, margine, compatibilità hardware, throughput e setup — e termina con la regola decisionale.

## Confronto Dettagliato

| Fattore | IQ3_S (3,5 bpw, 11,8 GB) — il livello di qualità consigliato | Livelli IQ2 (2,75/2,5 bpw, 9,3/8,4 GB) — i livelli di margine | Vincitore |
|--------|------|------|--------|
| Qualità dei task a contesto pieno | AIME25 (100,00) e LiveCodeBench v6 (85,71) riprodotte esattamente; GPQA-Diamond scostato di 0,51 punti — media task del 99,8% a 3,5 bpw. | IQ2_S raggiunge il livello di base su AIME25 ma resta indietro su GPQA-Diamond (86,36 vs 89,39); IQ2_XS è il più basso a 84,85 con 2,5 bpw. | IQ3_S (3,5 bpw, 11,8 GB) — il livello di qualità consigliato |
| Margine VRAM per contesto e cache KV | Su una scheda da 16 GB il file da 11,8 GB lascia 3–4 GB per cache KV e attivazioni — contesti fino a ~100k praticamente usabili. | 6,7–7,6 GB liberi su 16 GB: più finestra per contesti 112k e batch paralleli più grandi. | Livelli IQ2 (2,75/2,5 bpw, 9,3/8,4 GB) — i livelli di margine |
| Compatibilità con schede più vecchie e piccole | Richiede la classe 16 GB piena; su una RX 6800M da 12 GB riempie quasi la scheda (97% a 4k di contesto). | IQ2_XS lascia ~1,3 GB di margine anche sulle GPU laptop da 12 GB — l'unico livello che ci sta comodamente. | Livelli IQ2 (2,75/2,5 bpw, 9,3/8,4 GB) — i livelli di margine |
| Throughput interattivo e a batch | Stessa velocità per token: ~40 tok/s su una RTX 5060 Ti (552 tok/s di prefill a 112k), ~136 tok/s su una 5090; il testo in streaming resta sopra la velocità di lettura. | Identica velocità di decoding, ma l'impronta più piccola consente batch più grandi — la leva per estrazione e classificazione. | Livelli IQ2 (2,75/2,5 bpw, 9,3/8,4 GB) — i livelli di margine |
| Setup e flusso di lavoro | GGUF standard per llama.cpp, Ollama, LM Studio; la build -mtp opzionale (+0,35 GB) aggiunge il decoding speculativo con pesi identici. | Stessi file, stessi strumenti, stesso mmproj da 0,9 GB per la visione — zero costi di migrazione. | IQ3_S (3,5 bpw, 11,8 GB) — il livello di qualità consigliato |

## Statistiche Chiave

- **I livelli GGUF di Qwen3.8-27B vanno da 8,4 a 11,8 GB; IQ3_S mantiene il 99,8% della media task BF16 con riduzione 4,6×** — [Model card ISTA-DASLab](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **~40 tok/s medi di decoding e 552 tok/s di prefill a 112k di contesto su una scheda desktop da 16 GB** — [Misure community RTX 5060 Ti](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/discussions/6) (2026)

## Scelga IQ3_S (3,5 bpw, 11,8 GB) — il livello di qualità consigliato quando...

- Lavorate in modo interattivo su una scheda da 16 GB — chat, assistenti di codice, loop agentici — e volete il ragionamento di base senza perdite misurabili.
- Servono ~100k di contesto a qualità piena; i 3–4 GB residui del file da 11,8 GB coprono la vostra finestra.
- I vostri task sono valutati o heavy di ragionamento (Q&A stile GPQA, codice multi-step), dove il divario di 3–5 punti dei livelli IQ2 emerge davvero.
- Potete permettervi la variante MTP (+0,35 GB) e volete il decoding speculativo sopra il livello di qualità.

## Scelga Livelli IQ2 (2,75/2,5 bpw, 9,3/8,4 GB) — i livelli di margine quando...

- Girate su una GPU laptop da 12 GB — IQ2_XS a 8,4 GB è l'unico livello che sta con ~1,3 GB di margine.
- Elaborate job a batch (classificazione, estrazione, molti documenti) dove 3–5 punti GPQA contano poco e i batch più grandi dominano il throughput.
- Volete spazio KV massimo per finestre molto lunghe o più sessioni concorrenti su una scheda.
- Fate prototipi e apprezzate cicli di caricamento rapidi più dell'ultimo mezzo percento di qualità.

## La Nostra Raccomandazione

Nessun vincitore universale — l'asse è esattezza di qualità contro margine. IQ3_S è la scelta razionale per il segmento 16 GB nel 2026: AIME25 e LiveCodeBench riprodotte esattamente, GPQA-Diamond scostato di 0,51 punti, e ~40 tok/s su una RTX 5060 Ti mantengono il modello sopra la velocità di lettura anche con contesto lungo. I livelli IQ2 sono strumenti diversi, non peggiore: su una scheda da 12 GB IQ2_XS è l'unico livello con margine reale, e per il lavoro a batch i file più piccoli comprano più spazio KV e batch più grandi per un divario GPQA di 3–5 punti che raramente emerge in task brevi. La regola decisionale: lavoro interattivo e valutato su 16 GB → IQ3_S; scheda da 12 GB o puro throughput a batch → IQ2_S o IQ2_XS. La compressione densa ha un pavimento duro vicino a 2,5 bpw, quindi questi file coprono già l'intervallo utile — e i file .rco-allocation.txt rendono verificabile il budget di ogni livello.

## Domande Frequenti

**Q: Quale file GGUF prendo su una scheda da 16 GB?**
A: IQ3_S da 11,8 GB se serve la qualità piena fino a ~100k–112k di contesto. IQ2_S da 9,3 GB per più margine su batch grandi o finestre lunghe — raggiunge già il livello di base su AIME25. IQ2_XS è la scelta per i laptop da 12 GB.

**Q: I 40 tok/s sulla 5060 Ti sono un valore fisso?**
A: No — la velocità dipende dal contesto: fino a ~50 tok/s all'inizio della finestra, ~25–30 tok/s verso la fine di un contesto 112k pieno. Il prefill resta a 552 tok/s perché gira in parallelo sui token del prompt. Per la latenza degli agenti pianificate un intervallo, non un numero singolo.

**Q: Serve la variante -mtp?**
A: Se il vostro harness supporta il decoding speculativo: sì. La testa MTP costa solo 0,35 GB, accelera il decoding in modo misurabile e mantiene qualità identica perché l'allocazione dei tensori di base non cambia.

**Q: Come battono questi livelli le quantizzazioni dinamiche precedenti?**
A: GSQ+RCO ottimizza per tensore invece che per gruppo di livelli: a 8,4 GB IQ2_XS supera l'UD-IQ2_S della stessa dimensione di 10 punti su AIME25; a ~12 GB IQ3_S supera di 3,33 punti con 0,2 GB in meno. Tutti i file restano GGUF standard.

