---
type: "Comparison"
title: "IQ3_S vs paliers IQ2 : quantification GGUF pour stacks 16 Go (2026)"
description: "Quantification GGUF pour laptops 16 Go en 2026 : IQ3_S (11,8 Go, 99,8 % de la qualité de base) contre IQ2_S et IQ2_XS pour la marge KV, les cartes 12 Go et les jobs par lots — chiffres mesurés."
resource: "https://www.contextstudios.ai/fr/comparaison/gguf-quantization-iq3-s-vs-iq2-tiers"
language: "fr"
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-08T22:10:48.391Z"
status: "stable"
---

# IQ3_S vs paliers IQ2 : quantification GGUF pour stacks 16 Go (2026)

Les releases GSQ+RCO d'IST-DASLab transforment la quantification en décision chiffrée : Qwen3.8-27B existe en GGUF sur quatre paliers de 8,4 à 11,8 Go, et le palier recommandé IQ3_S conserve 99,8 % de la moyenne de tâches BF16 avec une réduction 4,6× — entièrement dans un GPU 16 Go de milieu de gamme. Avec l'ancienne logique de quantification uniforme, un modèle dense 27B exigeait 18–20 Go ; la recherche par tenseur le fait passer sous le seuil. La vraie question sur laptop : quel fichier télécharger — le plus grand palier qui reproduit la qualité de base (AIME25 et LiveCodeBench exacts, GPQA-Diamond à 0,51 point), ou un palier IQ2 plus petit qui achète de la marge pour le cache KV et les batchs. Cette comparaison pèse qualité, marge, compatibilité matérielle, débit et configuration — et se termine par la règle de décision.

## Comparaison Détaillée

| Facteur | IQ3_S (3,5 bpw, 11,8 Go) — le palier qualité recommandé | Paliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge | Gagnant |
|--------|------|------|--------|
| Qualité de tâche en contexte plein | AIME25 (100,00) et LiveCodeBench v6 (85,71) reproduits à l'identique ; GPQA-Diamond à 0,51 point — moyenne de tâches de 99,8 % à 3,5 bpw. | IQ2_S atteint le niveau de base sur AIME25 mais reste derrière sur GPQA-Diamond (86,36 contre 89,39) ; IQ2_XS est le plus bas à 84,85 avec 2,5 bpw. | IQ3_S (3,5 bpw, 11,8 Go) — le palier qualité recommandé |
| Marge VRAM pour contexte et cache KV | Sur une carte 16 Go, le fichier de 11,8 Go laisse 3–4 Go pour le cache KV et les activations — contextes jusqu'à ~100k pratiquement utilisables. | 6,7–7,6 Go libres sur 16 Go : plus de fenêtre pour les contextes 112k et de plus grands batchs parallèles. | Paliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge |
| Compatibilité cartes anciennes et petites | Exige la classe 16 Go pleine ; sur une RX 6800M 12 Go, il remplit presque la carte (97 % à 4k de contexte). | IQ2_XS laisse ~1,3 Go de marge même sur les GPU laptop 12 Go — le seul palier qui y passe à l'aise. | Paliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge |
| Débit interactif et par lots | Même vitesse par token : ~40 tok/s sur une RTX 5060 Ti (552 tok/s de prefill à 112k), ~136 tok/s sur une 5090 ; le texte streamé reste au-dessus de la vitesse de lecture. | Vitesse de décodage identique, mais l'emprise plus petite permet de plus grands batchs — le levier pour l'extraction et la classification. | Paliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge |
| Configuration et flux de travail | GGUF standard pour llama.cpp, Ollama, LM Studio ; le build -mtp optionnel (+0,35 Go) ajoute le décodage spéculatif avec des poids identiques. | Mêmes fichiers, mêmes outils, même mmproj de 0,9 Go pour la vision — zéro coût de migration. | IQ3_S (3,5 bpw, 11,8 Go) — le palier qualité recommandé |

## Statistiques Clés

- **Les paliers GGUF de Qwen3.8-27B vont de 8,4 à 11,8 Go ; IQ3_S conserve 99,8 % de la moyenne de tâches BF16 avec une réduction 4,6×** — [Fiche modèle ISTA-DASLab](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF) (2026)
- **~40 tok/s de décodage moyen et 552 tok/s de prefill à 112k de contexte sur une carte desktop 16 Go** — [Mesures communautaires RTX 5060 Ti](https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/discussions/6) (2026)

## Choisissez IQ3_S (3,5 bpw, 11,8 Go) — le palier qualité recommandé quand...

- Vous travaillez en interactif sur une carte 16 Go — chat, assistants de code, boucles d'agents — et vous voulez le raisonnement de base sans perte mesurable.
- Vous avez besoin d'environ 100k de contexte à qualité pleine ; les 3–4 Go restants du fichier 11,8 Go couvrent votre fenêtre.
- Vos tâches sont notées ou à fort raisonnement (Q&A type GPQA, code multi-étapes), où l'écart de 3–5 points des paliers IQ2 apparaît réellement.
- Vous pouvez vous permettre la variante MTP (+0,35 Go) et voulez le décodage spéculatif par-dessus le palier qualité.

## Choisissez Paliers IQ2 (2,75/2,5 bpw, 9,3/8,4 Go) — les paliers de marge quand...

- Vous tournez sur un GPU laptop 12 Go — IQ2_XS à 8,4 Go est le seul palier qui passe avec ~1,3 Go de marge.
- Vous traitez des jobs par lots (classification, extraction, nombreux documents) où 3–5 points GPQA pèsent peu et où les grands batchs dominent le débit.
- Vous voulez un espace KV maximal pour de très longues fenêtres ou plusieurs sessions simultanées sur une carte.
- Vous prototypez et préférez des cycles de chargement rapides au dernier demi pourcent de qualité.

## Notre Recommandation

Pas de gagnant universel — l'axe est exactitude de qualité contre marge. IQ3_S est le choix rationnel pour le segment 16 Go en 2026 : AIME25 et LiveCodeBench reproduits à l'identique, GPQA-Diamond à 0,51 point près, et ~40 tok/s sur une RTX 5060 Ti maintiennent le modèle au-dessus de la vitesse de lecture même en contexte long. Les paliers IQ2 sont d'autres instruments, pas de moins bons : sur une carte 12 Go, IQ2_XS est le seul palier avec une vraie marge, et pour le travail par lots, les fichiers plus petits achètent plus d'espace KV et de plus grands batchs pour un écart GPQA de 3 à 5 points rarement visible sur des tâches courtes. La règle de décision : travail interactif et noté sur 16 Go → IQ3_S ; carte 12 Go ou débit pur par lots → IQ2_S ou IQ2_XS. La compression dense a un plancher dur près de 2,5 bpw, ces fichiers couvrent donc la plage utile — et les fichiers .rco-allocation.txt rendent le budget de chaque palier vérifiable.

## Questions Fréquentes

**Q: Quel fichier GGUF prendre sur une carte 16 Go ?**
A: IQ3_S à 11,8 Go si vous avez besoin de la qualité pleine jusqu'à ~100k–112k de contexte. IQ2_S à 9,3 Go pour plus de marge sur les grands batchs ou les longues fenêtres — il atteint déjà le niveau de base sur AIME25. IQ2_XS est le choix pour les laptops 12 Go.

**Q: Les 40 tok/s sur la 5060 Ti sont-ils fixes ?**
A: Non — le débit dépend du contexte : jusqu'à ~50 tok/s en début de fenêtre, ~25–30 tok/s vers la fin d'un contexte 112k rempli. Le prefill reste à 552 tok/s car il s'exécute en parallèle sur les tokens du prompt. Planifiez une plage pour la latence des agents, pas une valeur unique.

**Q: Faut-il la variante -mtp ?**
A: Si votre harnais supporte le décodage spéculatif : oui. La tête MTP ne coûte que 0,35 Go, accélère le décodage de façon mesurable et garde une qualité identique car l'allocation des tenseurs de base est inchangée.

**Q: Comment ces paliers battent-ils les quantifications dynamiques plus anciennes ?**
A: GSQ+RCO optimise par tenseur et non par groupe de couches : à 8,4 Go, IQ2_XS devance l'UD-IQ2_S de même taille de 10 points sur AIME25 ; à ~12 Go, IQ3_S devance de 3,33 points avec 0,2 Go de moins. Tous les fichiers restent du GGUF standard.

