Wann Sie welche Option wählen sollten
Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.
Unsere Empfehlung
Es gibt keinen universellen Sieger — die Achse ist Qualitätsexaktheit versus Headroom. IQ3_S ist die rationale Default für das 16-GB-Feld von 2026: AIME25 und LiveCodeBench exakt reproduziert, GPQA-Diamond um 0,51 Punkte versetzt, und ~40 tok/s auf einer RTX 5060 Ti halten das Modell auch bei langem Kontext über Lesegeschwindigkeit. Die IQ2-Tiers sind andere Instrumente, keine schlechteren: Auf einer 12-GB-Karte ist IQ2_XS die einzige Stufe mit echtem Headroom, und für Batch-Arbeit kaufen die kleineren Dateien mehr KV-Raum und größere Batches für eine 3–5-Punkte-GPQA-Lücke, die in kurzen, formatartigen Aufgaben selten sichtbar wird. Die Entscheidungsregel: interaktive und benotete Arbeit auf 16 GB → IQ3_S; 12-GB-Karte oder reiner Batch-Durchsatz → IQ2_S oder IQ2_XS. Dichte Kompression hat eine harte Untergrenze nahe 2,5 bpw, diese Dateien decken also den nutzbaren Bereich ab — und die .rco-allocation.txt-Dateien machen jedes Stufen-Budget überprüfbar.
- Wählen Sie IQ3_S (3,5 bpw, 11,8 GB) — die empfohlene Qualitätsstufe, wenn...
- Sie arbeiten interaktiv auf einer 16-GB-Karte — Chat, Coding-Assistenten, Agent-Loops — und wollen Basis-Reasoning ohne messbaren Verlust.
- Sie brauchen ~100k Kontext bei voller Aufgabenqualität; die 3–4 GB Rest der 11,8-GB-Datei decken Ihr Fenster ab.
- Ihre Aufgaben sind benotet oder reasoningschwer (GPQA-artige Q&A, mehrstufiger Code), wo die 3–5 Punkte Lücke der IQ2-Tiers tatsächlich sichtbar wird.
- Sie können sich die MTP-Variante (+0,35 GB) leisten und wollen spekulatives Decoding obenauf.
- Wählen Sie IQ2-Tiers (2,75/2,5 bpw, 9,3/8,4 GB) — die Headroom-Stufen, wenn...
- Sie laufen auf einer 12-GB-Laptop-GPU — IQ2_XS mit 8,4 GB ist die einzige Stufe, die mit ~1,3 GB Headroom passt.
- Sie verarbeiten Batch-Jobs (Klassifikation, Extraktion, viele Dokumente), wo 3–5 GPQA-Punkte selten ins Gewicht fallen und größere Batch-Größen den Durchsatz dominieren.
- Sie wollen maximalen KV-Cache-Raum für sehr lange Fenster oder mehrere parallele Sessions auf einer Karte.
- Sie prototypen und schätzen schnelle Load/Teardown-Zyklen mehr als das letzte halbe Prozent Qualität.