Technologie

IQ3_S vs Q4_K_M : quelle quantification GGUF pour tenir 27B en 16 Go

Vérifié par Michael Kerkhoff, état au

Définition
La différence tient dans le plan mémoire : Q4_K_M compressse un modèle 27B à environ 15 Go et remplit presque toute une carte 16 Go — l'espace restant pour le KV-cache devient le goulot pour la longueur de contexte. IQ3_S atteint 11,8 Go grâce à la recherche par tenseur (GSQ+RCO, IST-DASLab) et conserve 99,8 % de la moyenne des tâches par rapport à la base BF16, soit une réduction de 4,6×. Sur un portable 16 Go, IQ3_S est le point final rationnel ; Q4_K_M reste le valeur sûre dès que la carte offre plus de place.
Catégorie
Technologie
Options
IQ3_S (GSQ+RCO)Q4_K_M (classique, uniforme)

Comparaison Détaillée

Une analyse comparative des facteurs clés pour vous aider à faire le bon choix.

IQ3_S (GSQ+RCO) vs Q4_K_M (classique, uniforme)
FacteurIQ3_S (GSQ+RCO)Q4_K_M (classique, uniforme)
Taille du fichier11,8 Go — 4,6× plus petit que la base BF16 (53,8 Go) Gagnantenviron 15 Go — environ 3,6× plus petit que la base BF16
Marge pour le KV-cache3–4 Go restent sur une carte 16 Go — les contextes jusqu’à ~100k tokens restent utilisables Gagnantmoins de 1 Go restant — les fenêtres longues butent tôt sur le mur VRAM
Qualité des tâches99,8 % de moyenne : AIME25 100,00, GPQA-Diamond 89,39, LiveCodeBench v6 85,71 — AIME et LCB au niveau exact de la basepresque sans perte sur les modèles denses, typiquement 99–100 % de la moyenne FP16
Débit de décodage~40 tok/s mesurés sur RTX 5060 Ti 16 Go, 552 tok/s de préfill à 112k de contexte Gagnantaussi rapide sur les grandes cartes ; sur 16 Go, le fichier plus petit déplace moins de mémoire de poids
Compatibilitéfichier GGUF standard, fonctionne d’emblée dans llama.cpp, Ollama et LM Studiodéfaut établi de toute la chaîne GGUF
Stabilité en contexte long17–30 tok/s en fin de fenêtre 112k pleine — le débit baisse avec le KV-cache mais reste utilisable Gagnantfenêtre et cache se disputent les derniers gigaoctets ; risque OOM en haut de plage
Auditableattribution des tenseurs fournie en .rco-allocation.txt plus matrice d’importance (1000 × 4096 tokens) dans le dépôt Gagnantschéma standardisé et bien documenté, sans fichier d’audit par tenseur
Prise en charge multimodalefichier mmproj identique (BF16, 0,9 Go) pour tous les paliers IQ ; build MTP +0,35 Gomême fichier mmproj — pas d’inconvénient, il est identique pour les deux paliers
Score Total · 3 égalités5 / 80 / 8

Statistiques Clés

Données réelles provenant de sources vérifiées du secteur pour appuyer votre décision.

Toutes les statistiques proviennent de sources tierces vérifiées. La source, l'année et le lien direct sont affichés pour chaque chiffre.

Quand Choisir Chaque Option

Un guide clair basé sur votre situation spécifique et vos besoins.

Notre Recommandation

IQ3_S gagne sur les cartes 16 Go sur trois dimensions — taille de fichier, marge KV, stabilité en contexte long — pour une qualité pratiquement identique (99,8 % de moyenne, AIME25 et LiveCodeBench exactement au niveau de la base). Q4_K_M tient la distance quand la carte offre plus de 18 Go et que le schéma uniforme est le standard attendu. Règle de décision : mesurez la fenêtre de contexte réellement utilisée, puis choisissez le fichier qui laisse 3 Go au cache et aux activations — ce calcul place IQ3_S sur 16 Go, Q4_K_M juste en dessous.

Choisissez IQ3_S (GSQ+RCO) quand...
  • 16 Go de VRAM est le plafond dur
  • des contextes jusqu’à ~100k avec vraie marge
  • une moyenne de tâches au-dessus de 99 %
  • une attribution par tenseur auditable est souhaitée
Choisissez Q4_K_M (classique, uniforme) quand...
  • plus de 18 Go de VRAM sont disponibles
  • la chaîne attend le schéma uniforme standard
  • les caches Q4_K_M existants ne doivent pas être reconstruits
  • la largeur de bits maximale par couche compte

Réponses aux questions courantes sur cette comparaison.

Questions Fréquentes

(01)Quel fichier prendre sur une carte 16 Go ?
IQ3_S (11,8 Go) pour la qualité pleine et un contexte 100k–112k. IQ2_S (9,3 Go) s’il faut plus de marge pour de gros batches ou des fenêtres plus longues — il atteint déjà le niveau de base sur AIME25. IQ2_XS convient aux portables 12 Go, où 8,4 Go plus le mmproj laissent de l’air entre les layouts.
(02)Q4_K_M devient-il obsolète ?
Non. Au-delà de 16 Go, Q4_K_M reste le défaut éprouvé, presque sans perte, et toutes les chaînes le comprennent. L’avantage d’IQ3_S est une conséquence géométrique, pas une magie d’algorithme : 3,4 Go de poids en moins, 3,4 Go de cache en plus.
(03)Les 40 tok/s valent-ils pour tout contexte ?
Retenez une plage, pas un chiffre : jusqu’à ~50 tok/s en début de fenêtre, 25–30 tok/s en fin de contexte 112k plein. Le préfill reste à 552 tok/s, en parallèle sur les tokens du prompt.
(04)Faut-il la variante -mtp ?
Si votre harnais accepte le décodage spéculatif : oui. La tête MTP ne coûte que 0,35 Go, ne change pas les poids et accélère le décodage de façon mesurable. Sans support MTP, le fichier standard suffit.

Besoin d'aide pour décider ?

Réservez une consultation gratuite de 30 minutes et nous vous aiderons à déterminer la meilleure approche pour votre projet spécifique.

Consultation gratuite · Sans engagement · Réponse personnelle