---
type: "Comparison"
title: "IQ3_S vs IQ2-Tiers: GGUF-Quantisierung für 16-GB-Laptop-Stacks (2026)"
description: "GGUF-Quantisierung für 16-GB-Laptops 2026: IQ3_S (11,8 GB, 99,8 % der Basisqualität) vs IQ2_S und IQ2_XS für KV-Headroom, 12-GB-Karten und Batch-Jobs — mit gemessenen Zahlen."
resource: "https://www.contextstudios.ai/de/vergleich/gguf-quantization-iq3-s-vs-iq2-tiers"
language: "de"
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T22:11:50.033Z"
status: "stable"
---

# IQ3_S vs IQ2-Tiers: GGUF-Quantisierung für 16-GB-Laptop-Stacks (2026)

Die GSQ+RCO-Releases von IST-DASLab machen aus Quantisierung eine Entscheidung mit gemessenen Zahlen: Qwen3.8-27B erscheint als GGUF in vier Stufen von 8,4 bis 11,8 GB, und die empfohlene IQ3_S hält 99,8 % des BF16-Basis-Durchschnitts bei 4,6-facher Reduktion — vollständig innerhalb einer Mittelklasse-16-GB-GPU. Nach der alten Uniform-Quantisierungslogik brauchte ein 27B-dichtes Modell 18–20 GB; die Tensor-für-Tensor-Suche drückt es unter die Kante. Die eigentliche Frage auf dem Laptop: Welche Datei laden — die größte Stufe, die die Basisqualität reproduziert (AIME25 und LiveCodeBench exakt, GPQA-Diamond um 0,51 Punkte versetzt), oder eine kleinere IQ2-Stufe, die KV-Cache-Headroom und Batch-Kapazität kauft? Dieser Vergleich weighing Qualität, Headroom, Hardware-Fit, Durchsatz und Setup — und endet mit der Entscheidungsregel.

## Detaillierter Vergleich

| Faktor | IQ3_S (3,5 bpw, 11,8 GB) — die empfohlene Qualitätsstufe | IQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen | Gewinner |
|--------|------|------|--------|
| Aufgabenqualität bei vollem Kontext | AIME25 (100,00) und LiveCodeBench v6 (85,71) exakt reproduziert; GPQA-Diamond um 0,51 Punkte versetzt — 99,8 % Aufgabendurchschnitt bei 3,5 bpw. | IQ2_S erreicht Basisniveau bei AIME25, liegt aber hinter GPQA-Diamond (86,36 vs 89,39); IQ2_XS ist mit 2,5 bpw am niedrigsten bei 84,85. | IQ3_S (3,5 bpw, 11,8 GB) — die empfohlene Qualitätsstufe |
| VRAM-Headroom für Kontext und KV-Cache | Auf einer 16-GB-Karte lässt die 11,8-GB-Datei 3–4 GB für KV-Cache und Activationen — Kontexte bis ~100k sind praktisch nutzbar. | 6,7–7,6 GB frei auf 16 GB: mehr Fenster für 112k-Kontexte und größere parallele Batches. | IQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen |
| Fit auf älteren und kleineren Karten | Braucht die volle 16-GB-Klasse; auf einer 12-GB RX 6800M füllt es die Karte fast (97 % bei 4k-Kontext). | IQ2_XS lässt ~1,3 GB Headroom selbst auf 12-GB-Laptop-GPUs — die einzige Stufe, die dort bequem passt. | IQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen |
| Interaktiver und Batch-Durchsatz | Gleiche Token-Geschwindigkeit: ~40 tok/s auf einer RTX 5060 Ti (552 tok/s Prefill bei 112k), ~136 tok/s auf einer 5090; gestreamter Text bleibt über Lesegeschwindigkeit. | Identische Decode-Geschwindigkeit, aber der kleinere Footprint erlaubt größere Batch-Größen — der Hebel für Extraktion und Klassifikation. | IQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen |
| Setup und Workflow | Normales GGUF für llama.cpp, Ollama, LM Studio; optional ergänzt der -mtp-Build (+0,35 GB) spekulatives Decoding mit identischen Gewichten. | Dieselben Dateien, dieselben Tools, dasselbe 0,9-GB-mmproj für Vision — keine Migrationskosten. | IQ3_S (3,5 bpw, 11,8 GB) — die empfohlene Qualitätsstufe |

## Wichtige Statistiken

- **Qwen3.8-27B-GGUF-Tiers erscheinen mit 8,4–11,8 GB; IQ3_S hält 99,8 % des BF16-Aufgabendurchschnitts bei 4,6-facher Reduktion** — [ISTA-DASLab Model Card](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **~40 tok/s Decode-Durchschnitt und 552 tok/s Prefill bei 112k-Kontext auf einer 16-GB-Desktop-Karte** — [Community-Messungen RTX 5060 Ti](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/discussions/6) (2026)

## Wählen Sie IQ3_S (3,5 bpw, 11,8 GB) — die empfohlene Qualitätsstufe, wenn...

- Sie arbeiten interaktiv auf einer 16-GB-Karte — Chat, Coding-Assistenten, Agent-Loops — und wollen Basis-Reasoning ohne messbaren Verlust.
- Sie brauchen ~100k Kontext bei voller Aufgabenqualität; die 3–4 GB Rest der 11,8-GB-Datei decken Ihr Fenster ab.
- Ihre Aufgaben sind benotet oder reasoningschwer (GPQA-artige Q&A, mehrstufiger Code), wo die 3–5 Punkte Lücke der IQ2-Tiers tatsächlich sichtbar wird.
- Sie können sich die MTP-Variante (+0,35 GB) leisten und wollen spekulatives Decoding obenauf.

## Wählen Sie IQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen, wenn...

- Sie laufen auf einer 12-GB-Laptop-GPU — IQ2_XS mit 8,4 GB ist die einzige Stufe, die mit ~1,3 GB Headroom passt.
- Sie verarbeiten Batch-Jobs (Klassifikation, Extraktion, viele Dokumente), wo 3–5 GPQA-Punkte selten ins Gewicht fallen und größere Batch-Größen den Durchsatz dominieren.
- Sie wollen maximalen KV-Cache-Raum für sehr lange Fenster oder mehrere parallele Sessions auf einer Karte.
- Sie prototypen und schätzen schnelle Load/Teardown-Zyklen mehr als das letzte halbe Prozent Qualität.

## Unsere Empfehlung

Es gibt keinen universellen Sieger — die Achse ist Qualitätsexaktheit versus Headroom. IQ3_S ist die rationale Default für das 16-GB-Feld von 2026: AIME25 und LiveCodeBench exakt reproduziert, GPQA-Diamond um 0,51 Punkte versetzt, und ~40 tok/s auf einer RTX 5060 Ti halten das Modell auch bei langem Kontext über Lesegeschwindigkeit. Die IQ2-Tiers sind andere Instrumente, keine schlechteren: Auf einer 12-GB-Karte ist IQ2_XS die einzige Stufe mit echtem Headroom, und für Batch-Arbeit kaufen die kleineren Dateien mehr KV-Raum und größere Batches für eine 3–5-Punkte-GPQA-Lücke, die in kurzen, formatartigen Aufgaben selten sichtbar wird. Die Entscheidungsregel: interaktive und benotete Arbeit auf 16 GB → IQ3_S; 12-GB-Karte oder reiner Batch-Durchsatz → IQ2_S oder IQ2_XS. Dichte Kompression hat eine harte Untergrenze nahe 2,5 bpw, diese Dateien decken also den nutzbaren Bereich ab — und die .rco-allocation.txt-Dateien machen jedes Stufen-Budget überprüfbar.

## Häufig gestellte Fragen

**Q: Welche GGUF-Datei nehme ich auf einer 16-GB-Karte?**
A: IQ3_S mit 11,8 GB, wenn Sie volle Modellqualität brauchen und bis ~100k–112k Kontext arbeiten. IQ2_S mit 9,3 GB, wenn Sie mehr Headroom für große Batches oder lange Fenster wollen — es erreicht bei AIME25 bereits Basisniveau. IQ2_XS ist die Wahl für 12-GB-Laptops.

**Q: Sind 40 tok/s auf der 5060 Ti ein fester Wert?**
A: Nein — die Rate hängt vom Kontext ab: bis ~50 tok/s am Fensteranfang, ~25–30 tok/s gegen Ende eines gefüllten 112k-Kontexts. Prefill bleibt bei 552 tok/s, weil es parallel über Prompt-Tokens läuft. Planen Sie für Agent-Latenz eine Spanne, keinen Einzelwert.

**Q: Brauche ich die -mtp-Variante?**
A: Wenn Ihr Harness spekulatives Decoding unterstützt: ja. Der MTP-Head kostet nur 0,35 GB, beschleunigt das Decoding messbar und hält die Qualität identisch, weil die Tensor-Allokation des Basismodells unverändert bleibt.

**Q: Wie schlagen diese Tiers ältere dynamische Quantisierungen?**
A: GSQ+RCO optimiert pro Tensor statt pro Ebenengruppe: Bei 8,4 GB führt IQ2_XS das gleich große UD-IQ2_S um 10 Punkte auf AIME25; bei ~12 GB führt IQ3_S mit 0,2 GB weniger Größe um 3,33 Punkte. Alle Dateien bleiben Standard-GGUF.

