Qwen 3.8 27B : le guide hardware, de la RTX 3090 au DGX Spark
Le 14 août 2026, l'équipe Qwen d'Alibaba a publié les poids de Qwen3.8-27B sous licence Apache 2.0 sur Hugging Face – en faisant le modèle local le plus intéressant du moment dans la classe des 27B. Un modèle vision-langage dense et nativement multimodal (texte, image, vidéo), avec un contexte natif de 262 144 tokens (extensible à 1M via YaRN), une tête de multi-token prediction (MTP) intégrée et un score Artificial Analysis de 52 – ce qui le place devant des modèles frontier bien plus gros sur l'Agentic Index. Sur X, le développeur Sero (@0xSero) a résumé la situation : un modèle qui tourne sur ~3 000 $ de matériel bat soudain tout ce qui était l'état de l'art il y a quatre mois.
La question décisive pour quiconque veut l'auto-héberger : quel matériel fait tourner ce modèle – et à quelle vitesse ? La réponse honnête a deux niveaux. Les benchmarks de base du week-end de sortie (llama.cpp sans tuning), et ce que la communauté en a fait en seulement cinq jours. Selon la plateforme, l'écart est d'un facteur 2 à 8. Nous avons compilé les deux : les séries de mesures de Hardware Corner, les tests de Simon Willison, les dépôts GitHub de Mia AI Lab, r0b0tlab et syv-ai, les discussions Hugging Face, la sortie de DFlash 2 par z-lab/Inco AI et les posts X des premiers jours.
⚡ État au 19 août 2026. Cet écosystème bouge chaque jour – tous les chiffres sont des instantanés, sources à l'appui.
Le modèle en 60 secondes
- 27,8 milliards de paramètres, dense – pas de mixture-of-experts. Chaque token généré traverse tout le réseau. La bande passante mémoire devient donc le facteur décisif – et le décodage spéculatif le plus gros levier, car il vérifie plusieurs tokens par forward pass.
- Architecture : 64 couches, dont 48 Gated DeltaNet et 16 full attention, plus une tête MTP entraînée, livrée dans le checkpoint.
- Multimodal : compréhension native des images et vidéos (les utilisateurs GGUF ont besoin en plus du projecteur vision de ~0,93 Go).
- Modes de raisonnement :
xhigh(par défaut !),medium,low. Le défaut sur-réfléchit massivement – Simon Willison a mis 21 minutes sur un prompt SVG avec, contre à peine plus de 2 minutes sans raisonnement. Pour du matériel local :lowoumedium.
Besoins mémoire : le vrai ticket d'entrée
Le checkpoint BF16 complet pèse ~56 Go. Seule la quantification en fait un modèle grand public :
| Format | Taille du fichier | Mémoire totale réaliste |
|---|---|---|
| UD-Q2_K_XL (2 bits) | 10,7 Go | 16–24 Go |
| UD-Q3_K_XL (3 bits) | 13,4 Go | 24 Go |
| Q4_K_M (4 bits standard) | 17,1 Go | 24–32 Go |
| UD-Q4_K_XL (4 bits dynamique) | 17,9 Go | 24–32 Go |
| Q6_K | 22,9 Go | 32–48 Go |
| Q8_0 | 29,1 Go | 48–64 Go |
| NVFP4 (Blackwell uniquement) | ~16,5 Go | 24–32 Go VRAM |
| BF16 | ~56 Go | 64 Go+ |
S'y ajoute le cache KV : avec un build Q4, Hardware Corner a mesuré 18 Go à 4k, 22 Go à 64k, 26 Go à 128k et 34 Go à 256k de contexte. La communauté a déjà repoussé ces limites – cache KV en FP8 (empreinte divisée par deux), embeddings quantifiés (2,6 Go économisés, voir plus bas) et quantification KV dans llama.cpp. Règle de base malgré tout :
24 Go de VRAM = 64k de contexte sans effort. 32 Go = 128k. Les 262k complets ne tiennent sur 24 Go qu'avec du tuning – ou avec de la mémoire unifiée.
1. PC de bureau classique avec GPU (RTX 3090 / 4090 / 5090)
Baseline : llama.cpp, Q4, MTP désactivé (Hardware Corner)
| Contexte | RTX 3090 (24 Go) – Prefill / Decode | RTX 4090 (24 Go) – Prefill / Decode | RTX 5090 (32 Go) – Prefill / Decode |
|---|---|---|---|
| 4k | 1 308 / 40,3 t/s | 2 963 / 46,2 t/s | 3 750 / 74,8 t/s |
| 32k | 977 / 37,0 t/s | 2 367 / 42,2 t/s | 1 146 / 29,0 t/s |
| 64k | 767 / 34,0 t/s | 1 918 / 38,4 t/s | 718 / 26,2 t/s |
| 128k | – (limite VRAM) | – (limite VRAM) | 461 / 22,8 t/s |
Voilà ce qu'on obtient en lançant simplement llama-server. Solide – mais très en dessous de ce que le matériel peut faire.
Ce que la communauté en a fait (au 19/08)
RTX 3090 – la star de la semaine. Le dépôt syv-ai/qwen38-27b-rtx3090 montre ce qu'un stack vLLM optimisé obtient sur une seule 3090, même bridée à 250 W : ~114 t/s en mono-utilisateur avec le sampling par défaut (118–124 t/s en greedy) et 64k de contexte, encore 95–100 t/s à 150k de contexte – et en mode batch ~1 000 t/s agrégés sur 64 requêtes parallèles. Les ingrédients : GEMMs int8 sur tensor cores, drafts MTP avec vocabulaire réduit, LM head int4 calibrée, et une astuce qui libère 2,6 Go de VRAM : Qwen3.8 a des embeddings non liés, et les quants W4A16 publics traînent deux matrices BF16 de 2,5 Go non quantifiées – le dépôt les requantifie toutes deux en int8 sans perte de qualité mesurable.
RTX 5090. Un développeur japonais (note.com) avait le modèle dans son setup quotidien environ une heure après la sortie et mesure 148,3 t/s sur du code et 128,6 t/s sur de la prose japonaise avec une configuration de décodage spéculatif affinée. Une discussion Hugging Face rapporte 98 t/s avec le quant Q6 plus MTP, et l'équipe SGLang 200+ t/s avec NVFP4 + décodage spéculatif. La série de mesures KGP Talkie (45 configurations) confirme le mécanisme : --spec-type draft-mtp à profondeur de draft 3 = un facteur 1,81 gratuit, sans perte, puisque les tokens spéculatifs sont vérifiés.
La preuve Blackwell 24 Go. Sur une RTX PRO 4000 (24 Go), le modèle tourne à 50,4 t/s en moyenne de production – avec les 256k de contexte complets, grâce à des patchs llama.cpp épinglés. Le MTP embarqué y a fait passer le débit de 21,2 à 59,5 t/s (2,81x) ; le build custom a ajouté +22 % par rapport au master propre.
Nouveau verdict : la 3090 n'est plus seulement le choix budget – avec le bon stack, c'est un nœud de serving à part entière. La 4090 profite des mêmes leviers. La 5090 reste le GPU unique le plus rapide, mais l'écart se réduit dès que la spéculation tourne partout.
2. Laptop avec GPU : le cas RTX 5080 (16 Go)
Ici, ça reste inconfortable, pour une seule raison : la RTX 5080 Laptop a 16 Go de VRAM – et le plus petit fichier 4 bits utilisable pèse 17,1 Go. Le Q4 ne tient pas entièrement sur la carte. Trois options réalistes :
- UD-Q3_K_XL (13,4 Go) entièrement en VRAM. Tourne proprement avec 8–16k de contexte et profite des ~896 Go/s de la carte. Des mesures fiables pour cette combinaison exacte manquent encore ; l'arithmétique de bande passante suggère des débits de décodage dans la ligue de la baseline desktop 24 Go – avec la perte de qualité d'un quant 3 bits.
- Q4 avec offload partiel vers la RAM système. Une épreuve de patience : le test de référence sur une RTX 5070 Ti Laptop (12 Go) a donné 3,3–4,5 t/s en décodage et 20–27 t/s en prefill. Sur 16 Go la part offloadée est plus petite, mais le schéma reste : dès que des poids vivent en RAM système, la vitesse s'effondre à un chiffre.
- NVFP4 (~16,5 Go de poids) est également trop juste sur 16 Go une fois le cache KV et le runtime ajoutés.
Verdict laptop : 16 Go est l'entre-deux ingrat pour ce modèle. Qui achète un laptop exprès pour lui vise la RTX 5090 Laptop (24 Go) – Q4/Q5 y tiennent entièrement en VRAM, et les recettes de tuning desktop (MTP, DFlash 2) se transfèrent, bridées par les limites de puissance et le refroidissement. Sur la 5080, le modèle reste une expérimentation, pas un daily driver.
3. Mac mini (M4 / M4 Pro)
Apple Silicon inverse la logique : au lieu d'une limite VRAM dure, il y a la mémoire unifiée, presque entièrement accessible au GPU. Le prix à payer : la bande passante.
| Configuration | Bande passante | Ce qui tourne | Verdict |
|---|---|---|---|
| M4, 16 Go | 120 Go/s | 2 bits seulement, contexte court | expérimentation, pas un conseil d'achat |
| M4, 24–32 Go | 120 Go/s | Q3/Q4 | tourne, mais lentement (t/s à un chiffre réaliste) |
| M4 Pro, 48 Go | 273 Go/s | Q4 à Q8 avec de la marge | meilleur rapport qualité-prix Mac |
| M4 Pro, 64 Go | 273 Go/s | Q8 + vision + grand contexte | confortable |
Point de référence pour la borne basse : un M2 Pro avec 16 Go a atteint 7,1 t/s mesurés avec le quant 2 bits – la même machine a échoué complètement en 4 bits. Seul le M4 Pro, avec 2,3x la bande passante, fait du Mac mini un hôte Qwen sérieux. Important pour tous les Mac : utiliser MLX plutôt que GGUF (détails dans la section MacBook) – sur les puces M5, cela apporte environ 40 % de décodage en plus.
4. MacBook Pro (M4 Pro / M4 Max / M5 Pro / M5 Max)
Baseline : llama.cpp/LM Studio sur M5 Max (128 Go)
| Contexte | Prefill (t/s) | Decode (t/s) |
|---|---|---|
| 4k | 834 | 31,4 |
| 16k | 544 | 23,6 |
| 32k | 517 | 21,6 |
| 64k | 425 | 18,2 |
Simon Willison confirme l'ordre de grandeur en pratique : 15–30 t/s dans LM Studio – assez pour le chat, les agents de codage (testés avec Pi) et les tâches vision, mais nettement plus lent que les API hébergées.
Le saut MLX
La communauté MLX a vite enchaîné : une conversion MLX mesurée atteint ~33 t/s en 4 bits sur le M5 Max avec seulement 15,5 Go de mémoire au pic (8 bits : ~18 t/s à 28,9 Go, BF16 : ~10 t/s à 54 Go). Sur le M5 Pro, un test de déploiement documente +40 % par rapport au GGUF : de ~28 à ~40 t/s – les accélérateurs neuronaux du GPU M5 paient directement. Deux réserves : la conversion mlx-lm pure est texte uniquement (l'encodeur vision et le drafter MTP sont retirés) ; pour les images, prendre les builds mlx-vlm de mlx-community. Et depuis le 18/08, le décodage spéculatif existe aussi sur Mac : le build oMLX avec support DFlash 2 tourne, selon la démo d'Inco, sur le M5 Max avec le modèle MLX 4 bits plus le drafter DFlash 2 – mettant des valeurs bien au-delà de 40 t/s à portée sur Apple Silicon aussi.
Situer les variantes : un MacBook Pro M4 Pro (24–48 Go) se comporte comme le Mac mini M4 Pro. Le M4 Max / M5 Max à partir de 36–48 Go est le choix laptop Apple confortable. Le grand avantage face à n'importe quel laptop Windows demeure : 64–128 Go de mémoire unifiée permettent Q8, vision et longs contextes en même temps – en silence, sur batterie.
5. Mac Studio (M4 Max / M3 Ultra)
| Configuration | Bande passante | Verdict |
|---|---|---|
| M4 Max, 36 Go | 410 Go/s | Q4/Q5 rapides ; Q8 devient juste |
| M4 Max (GPU 40 cœurs), 64 Go | 546 Go/s | sweet spot : Q8, vision, long contexte, place pour d'autres apps |
| M3 Ultra, 96 Go+ | 819 Go/s | décodage Mac le plus rapide, même BF16 possible – overkill pour un seul 27B |
Le Mac Studio est la voie workstation silencieuse. À 546 Go/s, le M4 Max se situe bien au-dessus du niveau MacBook, et les débits de décodage montent d'autant – vers le territoire de la baseline RTX 3090, sans bruit de ventilateur. Même règle ici : utiliser les builds MLX, et avec oMLX + DFlash 2, la spéculation s'ajoute. Le M3 Ultra double presque la bande passante ; difficile à justifier économiquement pour Qwen 3.8 27B seul, intéressant si des modèles 70B+ doivent tourner sur la même machine.
6. NVIDIA DGX Spark (GB10) : d'enfant à problèmes à nœud de serving
Le Spark est le meilleur exemple de la vitesse à laquelle le tableau s'est inversé en cinq jours.
Baseline : llama.cpp, Q4 (Hardware Corner, Dell Pro Max GB10)
| Contexte | Prefill (t/s) | Decode (t/s) |
|---|---|---|
| 4k | 813 | 12,2 |
| 64k | 576 | 9,7 |
| 128k | 442 | 8,0 |
| 256k | 228 | 5,9 |
Avec 273 Go/s de bande passante LPDDR5x, le 27B dense est poussif dans llama.cpp stock – Simon Willison obtenait 15–30 t/s dans LM Studio et gagnait déjà +72 % avec --spec-type draft-mtp.
État communautaire au 19/08 : SGLang + NVFP4 + spéculation
Mia AI Lab (MiaAI-Lab/Qwen3.8-27B-SGLang-DGX-Spark) a fait du Spark un vrai serveur : ~33–35 t/s en flux unique avec MTP et ~195–210 t/s agrégés sur 10 flux parallèles – avec jusqu'à 1M de contexte via YaRN, sans différence de vitesse entre 256k et 1M. S'y ajoutent des correctifs système concrets : le GB10 cache 10 cœurs CPU rapides et 10 lents – épingler le serveur sur les rapides a rapporté +5 %, et un correctif d'une double réservation mémoire dans le pool d'état GDN a libéré d'autres réserves. Le dépôt jumeau fournit l'équivalent vLLM avec NVFP4 d'Unsloth, cache KV FP8 et MTP.
r0b0tlab (qwen38-27b-nvfp4-sm121-sglang) fournit les évaluations soigneusement appariées correspondantes sur le Spark (NVFP4, think-off) : DFlash 2 en vainqueur de production à 28,4 t/s en flux unique et une échelle de concurrence de 23,5 (c1) à 55,0 (c4) jusqu'à 92,1 t/s à c8 – la variante EAGLE/MTP atteint même 123,9 t/s à c8. Sur le vrai jeu de 200 tâches de qualité, DFlash 2 a fait en moyenne 47,5 t/s de bout en bout, +40 % par rapport au setup DSpark précédent, à scores GSM8K/HumanEval/IFEval identiques.
Nouveau verdict Spark : plus un boulet de vitesse, mais un nœud de serving silencieux de 128 Go pour petites équipes – et il reste unique en ce que 256k–1M de contexte y tiennent tout simplement.
7. AMD Strix Halo (Ryzen AI Max+ 395)
Strix Halo (Radeon 8060S, jusqu'à 128 Go LPDDR5X, 256 Go/s) est la réponse x86 à la mémoire unifiée d'Apple – avec une communauté de tuning très active :
| Setup | Decode (t/s) | Source |
|---|---|---|
| Jour de sortie, Q5 / Q8, sans tuning | 10,5 / 7,5 | Reddit r/StrixHalo |
| Baseline Q4_K_M vs MTP optimisé | 10,7 → 30,3 (facteur 2,83) | Hugging Face (kingjones777) |
| AMD officiel, llama.cpp Vulkan, MTP=4 | jusqu'à 24,5 | Blog AMD (jour 0) |
| Build communautaire ROCmFP4 + MTP | 30,6–36,0 | GitHub (julianmb/q38rocm) |
| Stack de spéculation (MTP n12 + ngram), ctx 96k | 59,7–64 à froid / 11–24 en chat réel | GitHub (KyaniteLabs) |
Les enseignements clés :
- Le MTP est le plus gros levier isolé sur Strix Halo – jusqu'à un facteur 2,83. Mais : la profondeur de draft par défaut de llama.cpp (16) divise le débit par deux ; l'optimum est 3–4.
- Split de backend : ROCm offre le meilleur prefill à partir de 16k (~330 vs ~267 t/s), Vulkan le meilleur décodage.
- Le prefill est le talon d'Achille : un prompt de 32k prend environ deux minutes avant le premier token.
- Attention aux records : les chiffres de 60 t/s sont des meilleurs scores à froid ; la spéculation n-gram peut en plus fausser les benchmarks, car les prompts répétés entraînent le cache – un testeur a vu ~180 t/s apparents là où ~47 étaient réels. Le réaliste est 11–24 t/s en chat effectif – après tuning, c'est le niveau MacBook, avec 128 Go de mémoire à un prix bien plus bas. Une voie DFlash 2 pour ROCm se dessine (le PR llama.cpp est agnostique au backend) ; les chiffres Strix mesurés manquent encore.
Tuning de vitesse : les quatre leviers qui marchent partout
- Baisser
reasoning_effort. Le défautxhighest inutilisable sur du matériel grand public. Mesuré : raisonnement coupé = réponse visible 10x plus vite,mediumne coûte presque rien. Même l'endpoint communautaire gratuit de HF est depuis passé àmediumpar défaut. - DFlash 2 (nouveau, 18/08) – le nouveau levier de tête. Le drafter block-diffusion de z-lab/Inco AI (
z-lab/Qwen3.8-27B-DFlash2, miroir deincoai/…) est un modèle de draft de 2B (~4 Go) qui esquisse des blocs entiers de tokens en parallèle ; un sélecteur léger choisit le chemin cohérent, le modèle cible vérifie – sortie prouvée identique (rejection sampling). La mesure de la model card sur une H200 (SGLang, bloc 8) : flux unique de 69 t/s en autorégressif à 184–236 t/s selon la tâche (2,67–3,43x) – la tête MTP native y atteint 135–179 t/s. Longueur d'acceptation moyenne : 4,80 tokens par vérification contre 4,28 pour MTP. Disponible dans SGLang (PR #35371, fusionné le 19/08), vLLM, llama.cpp (--spec-type draft-dflash) et via oMLX sur Apple Silicon. - Activer le MTP quand aucun drafter DFlash 2 n'est disponible (
--spec-type draft-mtp, profondeur 3–4) : +72 % sur le Spark, +81 % sur la 5090, +183 % sur Strix Halo. La tête est déjà dans le GGUF (couche 64) – aucun second téléchargement nécessaire. - Libérer de la mémoire : quantifier le cache KV (q8_0/q4_0, ou FP8 dans vLLM/SGLang – empreinte KV divisée par deux) et, sur les quants W4A16, requantifier en int8 les deux matrices d'embeddings de 2,5 Go non quantifiées (2,6 Go de VRAM récupérés, aucune perte de qualité mesurable). C'est exactement cette combinaison qui amène 150k–262k de contexte sur des cartes 24 Go.
Concurrence : du poste unique au serving – désormais avec de vrais chiffres
Parce que Qwen 3.8 27B est dense, chaque token lit les 27B de paramètres – le flux unique est limité par la bande passante. C'est précisément pourquoi le batching scale de façon disproportionnée : les lectures de poids sont amorties sur le batch. La communauté l'a maintenant mesuré :
| Système | Flux unique | Agrégé en concurrence | Source |
|---|---|---|---|
| RTX 3090 (250 W !), vLLM optimisé | ~114 t/s | ~1 000 t/s @ 64 requêtes | syv-ai |
| DGX Spark, SGLang + MTP | 33–35 t/s | 195–210 t/s @ 10 flux | Mia AI Lab |
| DGX Spark, SGLang + DFlash 2 / EAGLE | 28 / 26 t/s | 92 / 124 t/s @ c8 | r0b0tlab |
| H200, SGLang + DFlash 2 | 184–236 t/s | 1 090–1 368 @ c8 · 1 525–1 952 @ c32 | model card z-lab |
| H200 (endpoint communautaire), spec decoding | 70 → 126 t/s | – | V. Mustar (HF) |
Trois règles en découlent :
- La spéculation perd de la valeur quand la charge monte – mais à des rythmes différents. Sur la 3090, le point de bascule vers le pur continuous batching se situait vers ~8 utilisateurs parallèles (syv-ai). La mesure H200 de z-lab montre le même schéma avec précision : à c32, MTP/DSpark tombent à 0,77–1,13x (parfois plus lents que l'autorégressif), tandis que DFlash 2 tient encore 1,16–1,45x – un meilleur drafter repousse nettement le point de bascule.
- Le budget KV détermine la concurrence : ~64 Ko/token en BF16 par séquence dans les 16 couches full attention (FP8 : la moitié) – sur une 5090 après les poids NVFP4, assez pour 20+ sessions 8k parallèles. Piège SGLang sur ce modèle hybride GDN :
--mamba-full-memory-ratio(défaut 0,9) surprovisionne le pool KV et plafonne silencieusement la concurrence. - Ollama/LM Studio traitent les requêtes de façon largement séquentielle – mauvais choix pour le serving. Sur Mac et Strix Halo, 2–4 flux parallèles restent le maximum raisonnable.
Comparatif global (au 19/08/2026)
| Matériel | Mémoire | Decode baseline | Optimisé communauté | Contexte max pratique | Caractère |
|---|---|---|---|---|---|
| RTX 3090 | 24 Go | 40 t/s | 114 t/s solo · ~1 000 t/s @64 | 150k–262k (optimisé) | vainqueur qualité-prix et serving |
| RTX 4090 | 24 Go | 46 t/s | recettes 3090 transférables, plus vite | 64k+ | la carte 24 Go la plus rapide |
| RTX 5090 | 32 Go | 75 t/s | 148 t/s (spec) · 200+ (NVFP4/SGLang) | 128k+ | roi de la vitesse |
| RTX 5080 Laptop | 16 Go | Q3 en VRAM ou ~4 t/s (offload) | – | 8–16k | l'entre-deux ingrat |
| RTX 5090 Laptop | 24 Go | ~baseline 3090 (limitée thermiquement) | recettes desktop transférables | 64k | le vrai choix laptop |
| Mac mini M4 Pro 48 Go | 273 Go/s | t/s à deux chiffres bas | MLX +~40 % | 64k+ | meilleur Mac d'entrée |
| MacBook Pro M5 Pro/Max | jusqu'à 128 Go | 28–31 t/s (GGUF) | ~40 t/s (M5 Pro, MLX) · 33+ (M5 Max, MLX 4 bits) · DFlash 2 via oMLX | 128k+ | polyvalent mobile |
| Mac Studio M4 Max 64 Go | 546 Go/s | ~classe baseline 3090 | MLX + DFlash 2 | 128k+ | workstation silencieuse |
| DGX Spark (GB10) | 128 Go | 12 t/s | 33–35 t/s solo · 195–210 t/s @10 | 256k–1M | nœud de serving long contexte |
| Strix Halo 128 Go | 256 Go/s | 8–11 t/s | 24–36 t/s (MTP), réel 11–24 en chat | 96k+ | mémoire unifiée qualité-prix |
Conclusion
Qwen 3.8 27B est le premier modèle ouvert à faire tenir vision, 262k de contexte, tool calling et de vraies capacités de codage dans un fichier de 17 Go. La leçon principale de la première semaine : le matériel est rarement le goulot d'étranglement – c'est le stack d'inférence qui l'est. Entre llama.cpp stock et un setup vLLM/SGLang optimisé avec MTP ou DFlash 2, il y a un facteur 2 à 8, à matériel identique.
- Serving & qualité-prix : une RTX 3090 d'occasion + le stack syv-ai – 114 t/s solo, ~1 000 t/s en batch, pour une fraction d'un setup datacenter.
- Vitesse mono-utilisateur maximale : RTX 5090 avec NVFP4 + spéculation (148–200+ t/s).
- Mac : Mac mini M4 Pro 48 Go pour démarrer, Mac Studio M4 Max 64 Go pour le confort – dans tous les cas MLX plutôt que GGUF, et garder oMLX + DFlash 2 à l'œil.
- En déplacement : MacBook Pro M5 Pro/Max à partir de 48 Go (~40 t/s avec MLX) ou RTX 5090 Laptop – pas la 5080.
- Long contexte & petite équipe : DGX Spark avec la recette Mia AI Lab ou r0b0tlab – 210 t/s agrégés jusqu'à 1M de contexte.
- 128 Go petit budget : Strix Halo, au niveau MacBook après tuning MTP.
Et où que vous tourniez : reasoning_effort sur low/medium, activer DFlash 2 ou MTP, quantifier le cache KV et les embeddings. Ces gestes comptent plus que la prochaine génération de GPU.
Sources (consultées du 15 au 19/08/2026) : model card Qwen3.8-27B · benchmarks Hardware Corner · Simon Willison · syv-ai/qwen38-27b-rtx3090 (GitHub) · MiaAI-Lab/Qwen3.8-27B-SGLang-DGX-Spark (GitHub) & @MiaAI_lab sur X · r0b0tlab/qwen38-27b-nvfp4-sm121-sglang (GitHub) · Inco AI : DFlash 2 & z-lab/Qwen3.8-27B-DFlash2 (benchmarks H200) · setup spéculatif RTX 5090 (note.com) · 50 t/s sur Blackwell 24 Go à 256k (piszczek.pl) · KGP Talkie : 45 configurations llama.cpp · @witcheer, @victormustar & @0xSero sur X · mesures MLX M5 Max & mlx-community · dépôt & guide GGUF Unsloth · blog AMD jour 0 · julianmb/q38rocm & KyaniteLabs (GitHub) · cookbook SGLang · guide hardware Kingy.ai · VentureBeat. Toutes les valeurs sont des mesures communautaires ou constructeurs des cinq premiers jours après la sortie ; les états logiciels changent chaque jour.