---
type: "Comparison"
title: "IQ3_S vs Q4_K_M: Welche GGUF-Quantisierung 27B unter 16 GB bringt"
description: "IQ3_S (GSQ+RCO) vs Q4_K_M (klassisch, uniform)"
resource: "https://www.contextstudios.ai/de/vergleich/iq3-s-vs-q4-k-m"
language: "de"
tags: ["IQ3_S", "Q4_K_M", "GGUF Quantisierung", "16 GB VRAM", "Qwen3.8-27B", "llama.cpp"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T22:11:42.418Z"
status: "stable"
---

# IQ3_S vs Q4_K_M: Welche GGUF-Quantisierung 27B unter 16 GB bringt

Der Unterschied heißt Speicherplan: Q4_K_M komprimiert ein 27B-Modell auf rund 15 GB und füllt damit eine 16-GB-Karte fast vollständig — die Lücke zum KV-Cache wird zum Flaschenhals für die Kontextlänge. IQ3_S erreicht mit Per-Tensor-Suche (GSQ+RCO vom IST-DASLab) 11,8 GB bei 99,8 Prozent Task-Schnitt gegenüber dem BF16-Base — das ist die 4,6-fache Verkleinerung. Auf dem Laptop mit 16 GB VRAM ist IQ3_S damit der rationale Endpunkt; Q4_K_M bleibt der bewährte Default, wenn die Karte mehr Platz bietet.

## Detaillierter Vergleich

| Faktor | IQ3_S (GSQ+RCO) | Q4_K_M (klassisch, uniform) | Gewinner |
|--------|------|------|--------|
| Dateigröße | 11,8 GB — 4,6-fach kleiner als der BF16-Base (53,8 GB) | rund 15 GB — etwa 3,6-fach kleiner als der BF16-Base | IQ3_S (GSQ+RCO) |
| Puffer für KV-Cache | 3–4 GB bleiben auf 16-GB-Karten — Kontexte bis etwa 100k Tokens praktisch nutzbar | unter 1 GB bleibt — lange Fenster laufen früh an die VRAM-Kante | IQ3_S (GSQ+RCO) |
| Task-Qualität | 99,8 % Task-Schnitt: AIME25 100,00, GPQA-Diamond 89,39, LiveCodeBench v6 85,71 — AIME und LCB exakt wie der Base | near-lossless auf Dense-Modellen, typischerweise 99–100 % des FP16-Schnitts | Unentschieden |
| Dekodier-Tempo | ~40 tok/s auf RTX 5060 Ti 16 GB gemessen, 552 tok/s Prefill bei 112k Kontext | ähnlich schnell auf großen Karten; auf 16 GB streamt die kleinere Datei weniger Gewichts-Speicher | IQ3_S (GSQ+RCO) |
| Kompatibilität | normale GGUF-Datei, läuft out of the box in llama.cpp, Ollama und LM Studio | etablierter Default aller GGUF-Tools | Unentschieden |
| Langkontext-Stabilität | 17–30 tok/s am Ende eines vollen 112k-Fensters — die Rate fällt mit dem KV-Cache, bleibt aber nutzbar | Fenster und Cache streiten um die letzten Gigabytes; OOM-Gefahr im oberen Bereich | IQ3_S (GSQ+RCO) |
| Nachvollziehbarkeit | Tensor-Zuweisung als .rco-allocation.txt plus Importance-Matrix (1000 × 4096 Tokens) im Repo | standardisiertes, gut dokumentiertes Schema ohne Tensor-Audit-Datei | IQ3_S (GSQ+RCO) |
| Multimodal-Support | identische mmproj-Datei (BF16, 0,9 GB) für alle IQ-Stufen; MTP-Build +0,35 GB | selbe mmproj-Datei — kein Nachteil, sie ist für beide Stufen identisch | Unentschieden |

## Wichtige Statistiken

- **Qwen3.8-27B als IQ3_S: 11,8 GB bei 3,50 bpw mit AIME25 100,00 / GPQA-Diamond 89,39 / LiveCodeBench v6 85,71 — gegen 53,8 GB BF16-Base (GPQA 89,90)** — [ISTA-DASLab Model Card](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **~40 tok/s im Mittel mit IQ3_S auf der RTX 5060 Ti 16 GB; 552 tok/s Prefill bei 112k Kontext; 25–30 tok/s gegen Ende des vollen Fensters** — [Community-Messungen (HF-Discussion)](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/discussions/6) (2026)
- **~136 tok/s mit IQ3_S auf der RTX 5090, long context** — [ISTA-DASLab Model Card](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **Mit alter Uniform-Quantisierung brauchte ein 27B-Dense-Modell 18–20 GB; die Per-Tensor-Suche drückt es unter die 16-GB-Kante** — [ISTA-DASLab Model Card](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **Schon die kleinste Stufe IQ2_XS (8,4 GB, 2,50 bpw) liefert 96,67 auf AIME25 und liegt im Zero-Shot damit über dem BF16-Base-Wert** — [ISTA-DASLab Model Card](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **Dichte Kompression hat eine harte Untergrenze bei etwa 2,5 bpw: darunter kollabiert der Task-Schnitt** — [ISTA-DASLab Model Card](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)

## Wählen Sie IQ3_S (GSQ+RCO), wenn...

- 16 GB VRAM ist die harte Obergrenze
- Kontexte bis ~100k mit echtem Puffer gefragt sind
- der Task-Schnitt über 99 % liegen muss
- nachvollziehbare Tensor-Zuweisung mit Audit-Datei gewünscht ist

## Wählen Sie Q4_K_M (klassisch, uniform), wenn...

- mehr als 18 GB VRAM zur Verfügung stehen
- ein uniform dokumentiertes Standard-Schema von der Toolchain erwartet wird
- bestehende Q4_K_M-Caches nicht neu aufgebaut werden sollen
- maximale Bitbreite pro Layer bei Standardunterstützung zählt

## Unsere Empfehlung

IQ3_S gewinnt auf 16-GB-Karten in drei Dimensionen: Dateigröße, KV-Puffer, Langkontext-Stabilität — bei praktisch identischer Qualität (99,8 % Task-Schnitt, AIME25 und LiveCodeBench exakt wie der Base). Q4_K_M hält mit, wo die Karte mehr als 18 GB bietet und das uniforme Schema als Standard erwartet wird. Die Entscheidungsregel: zuerst das längenmäßig genutzte Kontextfenster messen, dann die Datei so wählen, dass 3 GB für Cache und Aktivierungen bleiben — mit dieser Rechnung landet IQ3_S auf 16 GB, Q4_K_M knapp darunter.

## Häufig gestellte Fragen

**Q: Welche Datei nehme ich auf einer 16-GB-Karte?**
A: IQ3_S mit 11,8 GB für volle Modellqualität und 100k–112k Kontext. IQ2_S (9,3 GB), wenn mehr Puffer für große Batches oder längere Fenster gebraucht wird — es erreicht das AIME25-Basisniveau bereits. IQ2_XS ist die Wahl für 12-GB-Notebooks, wo 8,4 GB plus mmproj noch mit Luft zwischen die Layouts passt.

**Q: Ist Q4_K_M damit obsolet?**
A: Nein. Auf Karten mit mehr als 16 GB bleibt Q4_K_M der bewährte near-lossless-Default, und jede Toolchain versteht ihn. Der Vorteil von IQ3_S ist keine Algorithmus-Magie, sondern eine geometrische Konsequenz: 3,4 GB weniger Gewichte, 3,4 GB mehr Cache.

**Q: Gelten die 40 tok/s für jeden Kontext?**
A: Nein, als Spanne planen: zu Beginn des Fensters bis ~50 tok/s, gegen Ende des vollen 112k-Kontexts 25–30 tok/s. Der Prefill-Durchsatz von 552 tok/s läuft davon unberührt parallel über die Prompt-Tokens.

**Q: Brauche ich die -mtp-Variante?**
A: Wenn dein Harness Speculative Decoding unterstützt: ja. Der MTP-Head kostet nur 0,35 GB, ändert nichts an den Gewichten und beschleunigt die Dekodierung messbar. Ohne MTP-Unterstützung reicht die Standarddatei.

