Technologie

IQ3_S vs paliers IQ2 : quantification GGUF pour stacks 16 Go (2026)

Quantification GGUF pour laptops 16 Go en 2026 : IQ3_S (11,8 Go, 99,8 % de la qualité de base) contre IQ2_S et IQ2_XS pour la marge KV, les cartes 12 Go et les jobs par lots — chiffres mesurés.

Vérifié par Michael Kerkhoff, état au

Définition
Les releases GSQ+RCO d'IST-DASLab transforment la quantification en décision chiffrée : Qwen3.8-27B existe en GGUF sur quatre paliers de 8,4 à 11,8 Go, et le palier recommandé IQ3_S conserve 99,8 % de la moyenne de tâches BF16 avec une réduction 4,6× — entièrement dans un GPU 16 Go de milieu de gamme. Avec l'ancienne logique de quantification uniforme, un modèle dense 27B exigeait 18–20 Go ; la recherche par tenseur le fait passer sous le seuil. La vraie question sur laptop : quel fichier télécharger — le plus grand palier qui reproduit la qualité de base (AIME25 et LiveCodeBench exacts, GPQA-Diamond à 0,51 point), ou un palier IQ2 plus petit qui achète de la marge pour le cache KV et les batchs. Cette comparaison pèse qualité, marge, compatibilité matérielle, débit et configuration — et se termine par la règle de décision.
Catégorie
Technologie
Options
IQ3_S (3,5 bpw, 11,8 Go) — le palier qualité recommandéPaliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge

Comparaison Détaillée

Une analyse comparative des facteurs clés pour vous aider à faire le bon choix.

IQ3_S (3,5 bpw, 11,8 Go) — le palier qualité recommandé vs Paliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge
FacteurIQ3_S (3,5 bpw, 11,8 Go) — le palier qualité recommandéPaliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge
Qualité de tâche en contexte pleinAIME25 (100,00) et LiveCodeBench v6 (85,71) reproduits à l'identique ; GPQA-Diamond à 0,51 point — moyenne de tâches de 99,8 % à 3,5 bpw. GagnantIQ2_S atteint le niveau de base sur AIME25 mais reste derrière sur GPQA-Diamond (86,36 contre 89,39) ; IQ2_XS est le plus bas à 84,85 avec 2,5 bpw.
Marge VRAM pour contexte et cache KVSur une carte 16 Go, le fichier de 11,8 Go laisse 3–4 Go pour le cache KV et les activations — contextes jusqu'à ~100k pratiquement utilisables.6,7–7,6 Go libres sur 16 Go : plus de fenêtre pour les contextes 112k et de plus grands batchs parallèles. Gagnant
Compatibilité cartes anciennes et petitesExige la classe 16 Go pleine ; sur une RX 6800M 12 Go, il remplit presque la carte (97 % à 4k de contexte).IQ2_XS laisse ~1,3 Go de marge même sur les GPU laptop 12 Go — le seul palier qui y passe à l'aise. Gagnant
Débit interactif et par lotsMême vitesse par token : ~40 tok/s sur une RTX 5060 Ti (552 tok/s de prefill à 112k), ~136 tok/s sur une 5090 ; le texte streamé reste au-dessus de la vitesse de lecture.Vitesse de décodage identique, mais l'emprise plus petite permet de plus grands batchs — le levier pour l'extraction et la classification. Gagnant
Configuration et flux de travailGGUF standard pour llama.cpp, Ollama, LM Studio ; le build -mtp optionnel (+0,35 Go) ajoute le décodage spéculatif avec des poids identiques. GagnantMêmes fichiers, mêmes outils, même mmproj de 0,9 Go pour la vision — zéro coût de migration.
Score Total · 0 égalités2 / 53 / 5

Statistiques Clés

Données réelles provenant de sources vérifiées du secteur pour appuyer votre décision.

Toutes les statistiques proviennent de sources tierces vérifiées. La source, l'année et le lien direct sont affichés pour chaque chiffre.

Quand Choisir Chaque Option

Un guide clair basé sur votre situation spécifique et vos besoins.

Notre Recommandation

Pas de gagnant universel — l'axe est exactitude de qualité contre marge. IQ3_S est le choix rationnel pour le segment 16 Go en 2026 : AIME25 et LiveCodeBench reproduits à l'identique, GPQA-Diamond à 0,51 point près, et ~40 tok/s sur une RTX 5060 Ti maintiennent le modèle au-dessus de la vitesse de lecture même en contexte long. Les paliers IQ2 sont d'autres instruments, pas de moins bons : sur une carte 12 Go, IQ2_XS est le seul palier avec une vraie marge, et pour le travail par lots, les fichiers plus petits achètent plus d'espace KV et de plus grands batchs pour un écart GPQA de 3 à 5 points rarement visible sur des tâches courtes. La règle de décision : travail interactif et noté sur 16 Go → IQ3_S ; carte 12 Go ou débit pur par lots → IQ2_S ou IQ2_XS. La compression dense a un plancher dur près de 2,5 bpw, ces fichiers couvrent donc la plage utile — et les fichiers .rco-allocation.txt rendent le budget de chaque palier vérifiable.

Choisissez IQ3_S (3,5 bpw, 11,8 Go) — le palier qualité recommandé quand...
  • Vous travaillez en interactif sur une carte 16 Go — chat, assistants de code, boucles d'agents — et vous voulez le raisonnement de base sans perte mesurable.
  • Vous avez besoin d'environ 100k de contexte à qualité pleine ; les 3–4 Go restants du fichier 11,8 Go couvrent votre fenêtre.
  • Vos tâches sont notées ou à fort raisonnement (Q&A type GPQA, code multi-étapes), où l'écart de 3–5 points des paliers IQ2 apparaît réellement.
  • Vous pouvez vous permettre la variante MTP (+0,35 Go) et voulez le décodage spéculatif par-dessus le palier qualité.
Choisissez Paliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge quand...
  • Vous tournez sur un GPU laptop 12 Go — IQ2_XS à 8,4 Go est le seul palier qui passe avec ~1,3 Go de marge.
  • Vous traitez des jobs par lots (classification, extraction, nombreux documents) où 3–5 points GPQA pèsent peu et où les grands batchs dominent le débit.
  • Vous voulez un espace KV maximal pour de très longues fenêtres ou plusieurs sessions simultanées sur une carte.
  • Vous prototypez et préférez des cycles de chargement rapides au dernier demi pourcent de qualité.

Réponses aux questions courantes sur cette comparaison.

Questions Fréquentes

(01)Quel fichier GGUF prendre sur une carte 16 Go ?
IQ3_S à 11,8 Go si vous avez besoin de la qualité pleine jusqu'à ~100k–112k de contexte. IQ2_S à 9,3 Go pour plus de marge sur les grands batchs ou les longues fenêtres — il atteint déjà le niveau de base sur AIME25. IQ2_XS est le choix pour les laptops 12 Go.
(02)Les 40 tok/s sur la 5060 Ti sont-ils fixes ?
Non — le débit dépend du contexte : jusqu'à ~50 tok/s en début de fenêtre, ~25–30 tok/s vers la fin d'un contexte 112k rempli. Le prefill reste à 552 tok/s car il s'exécute en parallèle sur les tokens du prompt. Planifiez une plage pour la latence des agents, pas une valeur unique.
(03)Faut-il la variante -mtp ?
Si votre harnais supporte le décodage spéculatif : oui. La tête MTP ne coûte que 0,35 Go, accélère le décodage de façon mesurable et garde une qualité identique car l'allocation des tenseurs de base est inchangée.
(04)Comment ces paliers battent-ils les quantifications dynamiques plus anciennes ?
GSQ+RCO optimise par tenseur et non par groupe de couches : à 8,4 Go, IQ2_XS devance l'UD-IQ2_S de même taille de 10 points sur AIME25 ; à ~12 Go, IQ3_S devance de 3,33 points avec 0,2 Go de moins. Tous les fichiers restent du GGUF standard.

Besoin d'aide pour décider ?

Réservez une consultation gratuite de 30 minutes et nous vous aiderons à déterminer la meilleure approche pour votre projet spécifique.

Consultation gratuite · Sans engagement · Réponse personnelle