Wann Sie welche Option wählen sollten
Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.
Unsere Empfehlung
IQ3_S gewinnt auf 16-GB-Karten in drei Dimensionen: Dateigröße, KV-Puffer, Langkontext-Stabilität — bei praktisch identischer Qualität (99,8 % Task-Schnitt, AIME25 und LiveCodeBench exakt wie der Base). Q4_K_M hält mit, wo die Karte mehr als 18 GB bietet und das uniforme Schema als Standard erwartet wird. Die Entscheidungsregel: zuerst das längenmäßig genutzte Kontextfenster messen, dann die Datei so wählen, dass 3 GB für Cache und Aktivierungen bleiben — mit dieser Rechnung landet IQ3_S auf 16 GB, Q4_K_M knapp darunter.
- Wählen Sie IQ3_S (GSQ+RCO), wenn...
- 16 GB VRAM ist die harte Obergrenze
- Kontexte bis ~100k mit echtem Puffer gefragt sind
- der Task-Schnitt über 99 % liegen muss
- nachvollziehbare Tensor-Zuweisung mit Audit-Datei gewünscht ist
- Wählen Sie Q4_K_M (klassisch, uniform), wenn...
- mehr als 18 GB VRAM zur Verfügung stehen
- ein uniform dokumentiertes Standard-Schema von der Toolchain erwartet wird
- bestehende Q4_K_M-Caches nicht neu aufgebaut werden sollen
- maximale Bitbreite pro Layer bei Standardunterstützung zählt