Technologie

IQ3_S vs IQ2-Tiers: GGUF-Quantisierung für 16-GB-Laptop-Stacks (2026)

GGUF-Quantisierung für 16-GB-Laptops 2026: IQ3_S (11,8 GB, 99,8 % der Basisqualität) vs IQ2_S und IQ2_XS für KV-Headroom, 12-GB-Karten und Batch-Jobs — mit gemessenen Zahlen.

Geprüft von Michael Kerkhoff, Stand

Definition
Die GSQ+RCO-Releases von IST-DASLab machen aus Quantisierung eine Entscheidung mit gemessenen Zahlen: Qwen3.8-27B erscheint als GGUF in vier Stufen von 8,4 bis 11,8 GB, und die empfohlene IQ3_S hält 99,8 % des BF16-Basis-Durchschnitts bei 4,6-facher Reduktion — vollständig innerhalb einer Mittelklasse-16-GB-GPU. Nach der alten Uniform-Quantisierungslogik brauchte ein 27B-dichtes Modell 18–20 GB; die Tensor-für-Tensor-Suche drückt es unter die Kante. Die eigentliche Frage auf dem Laptop: Welche Datei laden — die größte Stufe, die die Basisqualität reproduziert (AIME25 und LiveCodeBench exakt, GPQA-Diamond um 0,51 Punkte versetzt), oder eine kleinere IQ2-Stufe, die KV-Cache-Headroom und Batch-Kapazität kauft? Dieser Vergleich weighing Qualität, Headroom, Hardware-Fit, Durchsatz und Setup — und endet mit der Entscheidungsregel.
Kategorie
Technologie
Optionen
IQ3_S (3,5 bpw, 11,8 GB) — die empfohlene QualitätsstufeIQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen

Detaillierter Vergleich

Eine Gegenüberstellung der wichtigsten Faktoren für Ihre Entscheidung.

IQ3_S (3,5 bpw, 11,8 GB) — die empfohlene Qualitätsstufe vs IQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen
FaktorIQ3_S (3,5 bpw, 11,8 GB) — die empfohlene QualitätsstufeIQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen
Aufgabenqualität bei vollem KontextAIME25 (100,00) und LiveCodeBench v6 (85,71) exakt reproduziert; GPQA-Diamond um 0,51 Punkte versetzt — 99,8 % Aufgabendurchschnitt bei 3,5 bpw. GewinnerIQ2_S erreicht Basisniveau bei AIME25, liegt aber hinter GPQA-Diamond (86,36 vs 89,39); IQ2_XS ist mit 2,5 bpw am niedrigsten bei 84,85.
VRAM-Headroom für Kontext und KV-CacheAuf einer 16-GB-Karte lässt die 11,8-GB-Datei 3–4 GB für KV-Cache und Activationen — Kontexte bis ~100k sind praktisch nutzbar.6,7–7,6 GB frei auf 16 GB: mehr Fenster für 112k-Kontexte und größere parallele Batches. Gewinner
Fit auf älteren und kleineren KartenBraucht die volle 16-GB-Klasse; auf einer 12-GB RX 6800M füllt es die Karte fast (97 % bei 4k-Kontext).IQ2_XS lässt ~1,3 GB Headroom selbst auf 12-GB-Laptop-GPUs — die einzige Stufe, die dort bequem passt. Gewinner
Interaktiver und Batch-DurchsatzGleiche Token-Geschwindigkeit: ~40 tok/s auf einer RTX 5060 Ti (552 tok/s Prefill bei 112k), ~136 tok/s auf einer 5090; gestreamter Text bleibt über Lesegeschwindigkeit.Identische Decode-Geschwindigkeit, aber der kleinere Footprint erlaubt größere Batch-Größen — der Hebel für Extraktion und Klassifikation. Gewinner
Setup und WorkflowNormales GGUF für llama.cpp, Ollama, LM Studio; optional ergänzt der -mtp-Build (+0,35 GB) spekulatives Decoding mit identischen Gewichten. GewinnerDieselben Dateien, dieselben Tools, dasselbe 0,9-GB-mmproj für Vision — keine Migrationskosten.
Gesamtpunktzahl · 0 unentschieden2 / 53 / 5

Wichtige Statistiken

Echte Daten aus verifizierten Branchenquellen zur Unterstützung Ihrer Entscheidung.

Alle Statistiken stammen aus verifizierten Drittquellen. Quelle, Jahr und Original-Link werden direkt bei jeder Kennzahl angezeigt.

Wann Sie welche Option wählen sollten

Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.

Unsere Empfehlung

Es gibt keinen universellen Sieger — die Achse ist Qualitätsexaktheit versus Headroom. IQ3_S ist die rationale Default für das 16-GB-Feld von 2026: AIME25 und LiveCodeBench exakt reproduziert, GPQA-Diamond um 0,51 Punkte versetzt, und ~40 tok/s auf einer RTX 5060 Ti halten das Modell auch bei langem Kontext über Lesegeschwindigkeit. Die IQ2-Tiers sind andere Instrumente, keine schlechteren: Auf einer 12-GB-Karte ist IQ2_XS die einzige Stufe mit echtem Headroom, und für Batch-Arbeit kaufen die kleineren Dateien mehr KV-Raum und größere Batches für eine 3–5-Punkte-GPQA-Lücke, die in kurzen, formatartigen Aufgaben selten sichtbar wird. Die Entscheidungsregel: interaktive und benotete Arbeit auf 16 GB → IQ3_S; 12-GB-Karte oder reiner Batch-Durchsatz → IQ2_S oder IQ2_XS. Dichte Kompression hat eine harte Untergrenze nahe 2,5 bpw, diese Dateien decken also den nutzbaren Bereich ab — und die .rco-allocation.txt-Dateien machen jedes Stufen-Budget überprüfbar.

Wählen Sie IQ3_S (3,5 bpw, 11,8 GB) — die empfohlene Qualitätsstufe, wenn...
  • Sie arbeiten interaktiv auf einer 16-GB-Karte — Chat, Coding-Assistenten, Agent-Loops — und wollen Basis-Reasoning ohne messbaren Verlust.
  • Sie brauchen ~100k Kontext bei voller Aufgabenqualität; die 3–4 GB Rest der 11,8-GB-Datei decken Ihr Fenster ab.
  • Ihre Aufgaben sind benotet oder reasoningschwer (GPQA-artige Q&A, mehrstufiger Code), wo die 3–5 Punkte Lücke der IQ2-Tiers tatsächlich sichtbar wird.
  • Sie können sich die MTP-Variante (+0,35 GB) leisten und wollen spekulatives Decoding obenauf.
Wählen Sie IQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen, wenn...
  • Sie laufen auf einer 12-GB-Laptop-GPU — IQ2_XS mit 8,4 GB ist die einzige Stufe, die mit ~1,3 GB Headroom passt.
  • Sie verarbeiten Batch-Jobs (Klassifikation, Extraktion, viele Dokumente), wo 3–5 GPQA-Punkte selten ins Gewicht fallen und größere Batch-Größen den Durchsatz dominieren.
  • Sie wollen maximalen KV-Cache-Raum für sehr lange Fenster oder mehrere parallele Sessions auf einer Karte.
  • Sie prototypen und schätzen schnelle Load/Teardown-Zyklen mehr als das letzte halbe Prozent Qualität.

Häufige Fragen zu diesem Vergleich beantwortet.

Häufig gestellte Fragen

(01)Welche GGUF-Datei nehme ich auf einer 16-GB-Karte?
IQ3_S mit 11,8 GB, wenn Sie volle Modellqualität brauchen und bis ~100k–112k Kontext arbeiten. IQ2_S mit 9,3 GB, wenn Sie mehr Headroom für große Batches oder lange Fenster wollen — es erreicht bei AIME25 bereits Basisniveau. IQ2_XS ist die Wahl für 12-GB-Laptops.
(02)Sind 40 tok/s auf der 5060 Ti ein fester Wert?
Nein — die Rate hängt vom Kontext ab: bis ~50 tok/s am Fensteranfang, ~25–30 tok/s gegen Ende eines gefüllten 112k-Kontexts. Prefill bleibt bei 552 tok/s, weil es parallel über Prompt-Tokens läuft. Planen Sie für Agent-Latenz eine Spanne, keinen Einzelwert.
(03)Brauche ich die -mtp-Variante?
Wenn Ihr Harness spekulatives Decoding unterstützt: ja. Der MTP-Head kostet nur 0,35 GB, beschleunigt das Decoding messbar und hält die Qualität identisch, weil die Tensor-Allokation des Basismodells unverändert bleibt.
(04)Wie schlagen diese Tiers ältere dynamische Quantisierungen?
GSQ+RCO optimiert pro Tensor statt pro Ebenengruppe: Bei 8,4 GB führt IQ2_XS das gleich große UD-IQ2_S um 10 Punkte auf AIME25; bei ~12 GB führt IQ3_S mit 0,2 GB weniger Größe um 3,33 Punkte. Alle Dateien bleiben Standard-GGUF.

Brauchen Sie Hilfe bei der Entscheidung?

Buchen Sie ein kostenloses 30-minütiges Beratungsgespräch und wir helfen Ihnen, den besten Ansatz für Ihr Projekt zu bestimmen.

Kostenlose Beratung · Unverbindlich · Persönliche Antwort