Technologie

IQ3_S vs Q4_K_M: Welche GGUF-Quantisierung 27B unter 16 GB bringt

Geprüft von Michael Kerkhoff, Stand

Definition
Der Unterschied heißt Speicherplan: Q4_K_M komprimiert ein 27B-Modell auf rund 15 GB und füllt damit eine 16-GB-Karte fast vollständig — die Lücke zum KV-Cache wird zum Flaschenhals für die Kontextlänge. IQ3_S erreicht mit Per-Tensor-Suche (GSQ+RCO vom IST-DASLab) 11,8 GB bei 99,8 Prozent Task-Schnitt gegenüber dem BF16-Base — das ist die 4,6-fache Verkleinerung. Auf dem Laptop mit 16 GB VRAM ist IQ3_S damit der rationale Endpunkt; Q4_K_M bleibt der bewährte Default, wenn die Karte mehr Platz bietet.
Kategorie
Technologie
Optionen
IQ3_S (GSQ+RCO)Q4_K_M (klassisch, uniform)

Detaillierter Vergleich

Eine Gegenüberstellung der wichtigsten Faktoren für Ihre Entscheidung.

IQ3_S (GSQ+RCO) vs Q4_K_M (klassisch, uniform)
FaktorIQ3_S (GSQ+RCO)Q4_K_M (klassisch, uniform)
Dateigröße11,8 GB — 4,6-fach kleiner als der BF16-Base (53,8 GB) Gewinnerrund 15 GB — etwa 3,6-fach kleiner als der BF16-Base
Puffer für KV-Cache3–4 GB bleiben auf 16-GB-Karten — Kontexte bis etwa 100k Tokens praktisch nutzbar Gewinnerunter 1 GB bleibt — lange Fenster laufen früh an die VRAM-Kante
Task-Qualität99,8 % Task-Schnitt: AIME25 100,00, GPQA-Diamond 89,39, LiveCodeBench v6 85,71 — AIME und LCB exakt wie der Basenear-lossless auf Dense-Modellen, typischerweise 99–100 % des FP16-Schnitts
Dekodier-Tempo~40 tok/s auf RTX 5060 Ti 16 GB gemessen, 552 tok/s Prefill bei 112k Kontext Gewinnerähnlich schnell auf großen Karten; auf 16 GB streamt die kleinere Datei weniger Gewichts-Speicher
Kompatibilitätnormale GGUF-Datei, läuft out of the box in llama.cpp, Ollama und LM Studioetablierter Default aller GGUF-Tools
Langkontext-Stabilität17–30 tok/s am Ende eines vollen 112k-Fensters — die Rate fällt mit dem KV-Cache, bleibt aber nutzbar GewinnerFenster und Cache streiten um die letzten Gigabytes; OOM-Gefahr im oberen Bereich
NachvollziehbarkeitTensor-Zuweisung als .rco-allocation.txt plus Importance-Matrix (1000 × 4096 Tokens) im Repo Gewinnerstandardisiertes, gut dokumentiertes Schema ohne Tensor-Audit-Datei
Multimodal-Supportidentische mmproj-Datei (BF16, 0,9 GB) für alle IQ-Stufen; MTP-Build +0,35 GBselbe mmproj-Datei — kein Nachteil, sie ist für beide Stufen identisch
Gesamtpunktzahl · 3 unentschieden5 / 80 / 8

Wichtige Statistiken

Echte Daten aus verifizierten Branchenquellen zur Unterstützung Ihrer Entscheidung.

Alle Statistiken stammen aus verifizierten Drittquellen. Quelle, Jahr und Original-Link werden direkt bei jeder Kennzahl angezeigt.

Wann Sie welche Option wählen sollten

Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.

Unsere Empfehlung

IQ3_S gewinnt auf 16-GB-Karten in drei Dimensionen: Dateigröße, KV-Puffer, Langkontext-Stabilität — bei praktisch identischer Qualität (99,8 % Task-Schnitt, AIME25 und LiveCodeBench exakt wie der Base). Q4_K_M hält mit, wo die Karte mehr als 18 GB bietet und das uniforme Schema als Standard erwartet wird. Die Entscheidungsregel: zuerst das längenmäßig genutzte Kontextfenster messen, dann die Datei so wählen, dass 3 GB für Cache und Aktivierungen bleiben — mit dieser Rechnung landet IQ3_S auf 16 GB, Q4_K_M knapp darunter.

Wählen Sie IQ3_S (GSQ+RCO), wenn...
  • 16 GB VRAM ist die harte Obergrenze
  • Kontexte bis ~100k mit echtem Puffer gefragt sind
  • der Task-Schnitt über 99 % liegen muss
  • nachvollziehbare Tensor-Zuweisung mit Audit-Datei gewünscht ist
Wählen Sie Q4_K_M (klassisch, uniform), wenn...
  • mehr als 18 GB VRAM zur Verfügung stehen
  • ein uniform dokumentiertes Standard-Schema von der Toolchain erwartet wird
  • bestehende Q4_K_M-Caches nicht neu aufgebaut werden sollen
  • maximale Bitbreite pro Layer bei Standardunterstützung zählt

Häufige Fragen zu diesem Vergleich beantwortet.

Häufig gestellte Fragen

(01)Welche Datei nehme ich auf einer 16-GB-Karte?
IQ3_S mit 11,8 GB für volle Modellqualität und 100k–112k Kontext. IQ2_S (9,3 GB), wenn mehr Puffer für große Batches oder längere Fenster gebraucht wird — es erreicht das AIME25-Basisniveau bereits. IQ2_XS ist die Wahl für 12-GB-Notebooks, wo 8,4 GB plus mmproj noch mit Luft zwischen die Layouts passt.
(02)Ist Q4_K_M damit obsolet?
Nein. Auf Karten mit mehr als 16 GB bleibt Q4_K_M der bewährte near-lossless-Default, und jede Toolchain versteht ihn. Der Vorteil von IQ3_S ist keine Algorithmus-Magie, sondern eine geometrische Konsequenz: 3,4 GB weniger Gewichte, 3,4 GB mehr Cache.
(03)Gelten die 40 tok/s für jeden Kontext?
Nein, als Spanne planen: zu Beginn des Fensters bis ~50 tok/s, gegen Ende des vollen 112k-Kontexts 25–30 tok/s. Der Prefill-Durchsatz von 552 tok/s läuft davon unberührt parallel über die Prompt-Tokens.
(04)Brauche ich die -mtp-Variante?
Wenn dein Harness Speculative Decoding unterstützt: ja. Der MTP-Head kostet nur 0,35 GB, ändert nichts an den Gewichten und beschleunigt die Dekodierung messbar. Ohne MTP-Unterstützung reicht die Standarddatei.

Brauchen Sie Hilfe bei der Entscheidung?

Buchen Sie ein kostenloses 30-minütiges Beratungsgespräch und wir helfen Ihnen, den besten Ansatz für Ihr Projekt zu bestimmen.

Kostenlose Beratung · Unverbindlich · Persönliche Antwort