16 Go suffisent : le tableau de mesures Qwen3.8-27B GGUF
TL;DR : IST-DASLab livre Qwen3.8-27B en GGUF dans quatre tailles — de 8,4 à 11,8 Go. Le niveau recommandé IQ3_S conserve 99,8 % des performances de base avec une réduction de 4,6× et tient entièrement sur les GPU 16 Go de milieu de gamme. Cet article apporte le tableau des fichiers, les débits de tokens mesurés et une règle de décision entre usage batch et interactif.
Ce que GSQ et RCO changent concrètement
Les deux abréviations désignent une procédure en deux étapes qui dépasse les quantifications dynamiques Unsloth connues, à taille de fichier égale.
GSQ (Gumbel-Softmax Quantization) quantifie chaque tenseur individuellement : elle apprend l'affectation de grille par coordonnée et les échelles par groupe conjointement via une relaxation Gumbel-Softmax. Effet : à 2–3 bits par poids, GSQ comble l'écart entre quantification scalaire et vectorielle, tout en restant un GGUF standard exécutable dans llama.cpp, Ollama et LM Studio.
RCO (Riemannian Constrained Optimization) répartit ensuite les types de quantification sur les tenseurs. La limite de budget de taille est formulée comme une variété riemannienne lissée dans l'espace des logits, si bien que le gradient optimise directement la perte de tâche — sans jamais violer le budget.
Le résultat par fichier n'est pas uniforme mais optimisé au niveau du tenseur. Rien ne change dans le workflow : ce sont des fichiers GGUF normaux.
hf download ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf --local-dir .
llama-cli -m Qwen3.8-27B-GSQ-RCO-IQ3_S.gguf -p "Explain mixed-precision quantization." -ngl 99
Le tableau de mesures : empreinte par niveau de fichier
Les quatre fichiers publiés avec le vrai bits-par-poids moyen du fichier entier, plus les valeurs de benchmark de la carte modèle contre la base BF16 (53,8 Go) :
| Fichier | bpw | Taille | AIME25 | GPQA-Diamond | LiveCodeBench v6 | Appréciation |
|---|---|---|---|---|---|---|
| IQ2_XS | 2,50 | 8,4 Go | 96,67 | 84,85 | 76,57 | plus petit niveau, zero-shot au-dessus de BF16 |
| IQ2_S | 2,75 | 9,3 Go | 100,00 | 86,36 | 82,29 | atteint le niveau de base sur AIME25 |
| IQ3_XXS | 3,00 | 10,1 Go | 100,00 | 88,89 | 84,57 | point polyvalent solide |
| IQ3_S | 3,50 | 11,8 Go | 100,00 | 89,39 | 85,71 | recommandé : sans perte de tâche (99,8 % de moyenne) |
| Base BF16 | 16,00 | 53,8 Go | 100,00 | 89,90 | 85,71 | référence |
Trois observations portent la décision d'achat :
- IQ3_S est le point optimal. AIME25 et LiveCodeBench sont reproduits exactement ; GPQA-Diamond ne manque que 0,51 point — avec une réduction de 4,6×.
- L'avantage croît sur les petits fichiers. À 8,4 Go, IQ2_XS devance UD-IQ2_S de même taille de 10,00 points sur AIME25 et 8,59 sur GPQA-Diamond.
- Il y a des extras : un fichier mmproj (BF16, 0,9 Go) pour l'entrée vision et des builds -mtp optionnels (+0,35 Go) avec tête Multi-Token-Prediction pour le décodage spéculatif — même qualité, plus de vitesse.
Vitesse en pratique : cartes 16 Go en comparaison
Les valeurs de la carte modèle sont sans dimension ; pour la vitesse, comptent les mesures communautaires sur matériel réel. Points d'ancrage signalés :
| Carte / réglage | Résultat |
|---|---|
| RTX 5090 (flagship desktop) | ~136 tok/s avec IQ3_S, contexte long |
| RTX 5060 Ti 16 Go (desktop) | ~40 tok/s en moyenne, 552 tok/s de prefill à 112k de contexte |
| 5060 Ti, contexte 112k rempli | 17–30 tok/s, ~25–30 vers la fin de la fenêtre |
| RX 6800M 12 Go (portable) | IQ3_S remplit presque la carte (97 % à 4K de contexte) ; IQ2_XS laisse ~1,3 Go de marge |
Le motif : entre 40 et 136 tok/s, la classe 27B situed confortablement au-dessus de la vitesse de lecture. Sur les contextes longs, le débit baisse car le cache KV grandit — Qwen3.8 est un hybride gated-delta-net avec attention linéaire dans la plupart des couches, ce qui réduit la taxe de contexte par rapport aux transformeurs purs sans l'éliminer.
Règle de décision : 40 tok/s suffisent-ils ?
Oui, pour tout ce qui est interactif. 40 tok/s correspondent environ au double de la vitesse de lecture humaine ; le texte en streaming paraît fluide.
Pour la classification par usage :
- Sessions interactives (chat, boucles d'agents) : IQ3_S sur carte 16 Go. Les 11,8 Go laissent 3–4 Go pour le cache KV et les activations — des contextes jusqu'à ~100k sont pratiquement utilisables.
- Jobs batch (classification, extraction, nombreux documents) : IQ2_XS ou IQ2_S. À 8,4–9,3 Go, ils tiennent même sur d'anciennes cartes 12 Go avec de l'air pour de plus gros batches ; les 3–4 points de moins sur GPQA sont rarement pertinents pour des tâches courtes et formelles.
- Multimodal : le niveau IQ correspondant plus le fichier mmproj de 0,9 Go — identique pour tous les niveaux.
Le point des 16 Go est le vrai seuil : avec l'ancienne logique de quantification uniforme, un modèle dense 27B exigeait 18–20 Go. La recherche par tenseur le fait passer sous l'arête — et les affectations sont livrées en .rco-allocation.txt dans le repo, donc vérifiables.
La limite : le dense 27B touche sa fin
La compression dense a un plancher dur : à 2,5 bpw la moyenne de tâche est proche de la valeur de base ; en dessous elle s'effondre. Qui veut plus de paramètres change d'architecture — les modèles MoE avec streaming de couches depuis le NVMe (p. ex. Kimi K3 2,8T sur quatre SSD) contournent le seuil RAM mais tombent à ~1 tok/s. Entre ces deux pôles se tient la classe dense 27B : un modèle complet en RAM, des mesures à 40–136 fois le taux du offload. Pour la plupart des setups portable 2026, IQ3_S est le point final rationnel.
FAQ
Quel fichier GGUF prendre sur une carte 16 Go ? Prenez IQ3_S à 11,8 Go si vous avez besoin de la pleine qualité et travaillez avec 100k–112k de contexte. Prenez IQ2_S à 9,3 Go si vous voulez plus de marge pour de gros batches ou des fenêtres longues — il atteint déjà le niveau de base AIME25. IQ2_XS est le choix pour les portables 12 Go, où 8,4 Go plus mmproj passent encore avec de l'air entre les mises en page.
40 tok/s sur la 5060 Ti est-il une valeur fixe ? Non, le débit dépend du contexte : jusqu'à ~50 tok/s mesurés en début de fenêtre, ~25–30 tok/s vers la fin d'un contexte 112k plein. Le prefill de 552 tok/s n'est pas affecté, car il tourne en parallèle sur les tokens du prompt. Planifiez une plage plutôt qu'un nombre pour calculer les latences de vos agents.
Ai-je besoin de la variante -mtp ? Si vous faites tourner llama.cpp avec décodage spéculatif : oui, la tête MTP ne coûte que 0,35 Go et accélère mesurablement le décodage sans changer les poids. La qualité reste identique car l'allocation tensorielle de base est la même. Sans support MTP dans votre harnais, le fichier standard suffit.
Quelle différence avec les quantifications dynamiques Unsloth ? Les deux sont optimisées par tenseur, mais GSQ+RCO donnent plus de points à taille égale ou inférieure : à 8,4 Go IQ2_XS mène de 10 points sur AIME25 ; à ~12 Go IQ3_S mène de 3,33 points avec 0,2 Go de moins. Sur GPQA-Diamond, UD-IQ3_S est marginalement devant (0,51 point) — un compromis sans importance pratique à 99,8 % de moyenne de tâche.
Comment vérifier moi-même l'allocation d'un fichier ? Chaque niveau livre un fichier tensor-allocation dans le repo indiquant le type de quantification assigné par tenseur plus l'histogramme des largeurs de bits. Ainsi on vérifie le respect du budget sans charger le modèle. En complément, la matrice d'importance (imatrix-qwen3.8-27b.gguf, 1000 × 4096 tokens) est fournie, rendant la quantification reproductible.
Sources
- https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF — carte modèle avec le tableau de mesures complet (consultée le 17.09.2026)
- https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF/discussions/6 — mesures communautaires sur RTX 5060 Ti (contexte 112k)
- https://arxiv.org/abs/2604.18556 — GSQ : quantification scalaire de haute précision à faible précision via échantillonnage Gumbel-Softmax
- https://arxiv.org/abs/2605.00649 — RCO : compression de modèle sous contraintes exactes de budget via variétés riemanniennes
- https://github.com/IST-DASLab/GSQ — implémentation de référence
- https://github.com/IST-DASLab/RCO — implémentation de référence
- https://velstech.net/qwen38-27b-gsq-rco-rx6800m — test indépendant sur portable 12 Go (RX 6800M)