En juillet, notre guide Best Open-Weight LLMs 2026 présentait les meilleurs modèles ouverts du moment : Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4 et Mistral. Beaucoup de choses ont changé depuis. Trois nouveaux modèles Flash ont bouleversé le paysage de l'auto-hébergement, et un modèle de 2,5 milliards de paramètres bat aujourd'hui des concurrents quatre fois plus gros. Cet article dresse l'état des lieux de septembre 2026 — et répond à la question que le guide laissait volontairement ouverte : sur quel matériel tout cela tourne-t-il réellement ?
Les trois modèles Flash de septembre 2026
| Modèle | Architecture | Actif par token | Contexte | Licence | Sortie |
|---|---|---|---|---|---|
| GLM-5.3-Flash (Z.ai) | 320B MoE, attention hybride linéaire+sparse | ~18B | 1M | MIT | 26.08.2026 |
| DeepSeek V4.1 Flash | 552B MoE + Engram n-gram | ~14B | 1M | MIT | 10.09.2026 |
| Qwen3.8-Flash-Next (Alibaba) | 125B MoE + 51B n-gram, Gated DeltaNet | ~6B | 262K natif, 1M avec YaRN | Qwen Community | 28.08.2026 |
Les trois sont des modèles mixture-of-experts qui n'activent qu'une fraction de leurs paramètres par token — c'est la seule raison pour laquelle ils tournent sur du matériel grand public. Les différences sont dans le détail.
GLM-5.3-Flash est le codeur open-weight le plus fort de la classe Flash : Terminal-Bench 2.1 à 84,3, DeepSWE v1.1 à 63,4. Z.ai a publié les poids MIT le 26 août — le jour même où le modèle jusque-là anonyme « Ox Alpha » a été identifié. Le hic pour l'auto-hébergement : les poids FP8 natifs pèsent environ 306 GiB, une machine de 128 Go ne suffit pas.
DeepSeek V4.1 Flash (ouvert depuis le 10 septembre) n'est pas une itération de V4 Flash mais une reconstruction : son propre tokenizer, son propre graphe d'inférence, 189 GiB de tables Engram qui restent sur SSD dans le paquet Q2 pendant que 152 GiB de poids principaux tournent en mémoire. Côté prix, c'est l'aubaine : 0,15 $ d'entrée / 0,60 $ de sortie par million de tokens (hors pic).
Qwen3.8-Flash-Next est le checkpoint d'aperçu de l'architecture Qwen4 : un modèle principal de 125B plus une couche d'embedding n-gram de 51B, seulement ~6B de paramètres actifs, avec entrée image et vidéo natives. 262K de contexte nativement, extensible à 1M via YaRN — mais cette configuration YaRN devient alors votre problème de déploiement, pas celui du fournisseur.
La matrice matérielle : qu'est-ce qui tient vraiment où
La réponse honnête à « quel matériel ? » dépend de la quantification. Les quants communautaires de septembre 2026 dessinent un tableau clair :
Portable et desktop (16–64 Go) : C'est le royaume de Qwen3.8-27B (Apache 2.0, ~19 Go en 4-bit, entrée image et vidéo natives), numéro un de plusieurs classements de septembre. MiniCPM5-2B (Apache 2.0, ~2,4 Go en GGUF Q4) est la pépite : 131K de contexte, 69,1 sur LiveCodeBench v6 — à 2,52B de paramètres, il bat Qwen3.5-4B de presque 13 points. Pour de l'agentique avec tool-calling à petit budget, c'est la voie locale abordable.
128 Go (Mac Studio, station de travail) : Qwen3.8-Flash-Next en conversion MLX 4-bit (112 Go) est le nouveau favori — environ 49 tok/s estimés sur un M5 Max, car seuls 6B de paramètres défilent par token. GLM-5.3-Flash tient tout juste en quant 3-bit (120 Go). DeepSeek V4.1 Flash passe ici par le streaming SSD : le paquet ds4 (Metal) garde 152 GiB de poids principaux résidents et lit les tables Engram depuis le SSD.
DGX Spark (1× 128 Go unifiée) : Trois quants communautaires font tenir GLM-5.3-Flash sur une seule Spark — la recette la plus complète (EXL3 2,05 bpw + drafter DFlash2) décode la sortie structurée à 64,1 tok/s (médiane sur 5 essais), la prose vers ~30 tok/s. DeepSeek V4.1 Flash en EXL3 1,59 bpw tourne aussi sur une Spark : 15–17 tok/s à froid, jusqu'à ~25 tok/s avec cache de préfixe. Une Spark suffit pour les deux — avec des pertes de qualité documentées dans les reçus de fidélité KLD-vs-BF16 respectifs.
2–4× DGX Spark : Le point idéal pour le sérieux. GLM-5.3-Flash en EXL3 4 bpw sur 2× Spark (TP2) : 48–52 tok/s en code, 19 tok/s en prose, contexte 1M. DeepSeek V4.1 Flash sur 4× Spark (TP4) : 40,5 tok/s en flux simple avec le checkpoint officiel de 510 Go, et les quants communautaires (EXL3 3,5 bpw) poussent cela vers ~61 tok/s avec un pool KV de 3,4M tokens à 1M de contexte.
Nœud multi-GPU (8× H200 etc.) : À partir de là, les trois tournent en qualité FP8/BF16 native. GLM-5.3-Flash a en pratique besoin d'un nœud 8 GPU au minimum ; DeepSeek V4.1 Flash veut 2× H200 au mieux ; Qwen3.8-Flash-Next reste le plus flexible avec son empreinte plus réduite.
Ce qui a changé depuis juillet — en trois phrases
Premièrement : la classe Flash (18B actifs et moins) a atteint le seuil de qualité où l'auto-hébergement devient sérieux pour les workloads agents — GLM-5.3-Flash se classe en codage agentique devant une bonne partie de ce que seuls les modèles API savaient faire. Deuxièmement : les tables Engram n-gram (DeepSeek, Qwen) ont instauré le nouveau schéma de conception — d'immenses tables de lookup restent sur SSD, seuls les poids chauds sont résidents. Troisièmement : les licences ont divergé — MIT (GLM-5.3-Flash, DeepSeek), Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss), Qwen Community (Flash-Next) et une licence personnalisée sur le flagship GLM-5.3. À vérifier avant tout déploiement commercial.
Questions fréquentes
Quel modèle est le meilleur point d'entrée dans l'hébergement local de LLM en septembre 2026 ? Pour la majorité : Qwen3.8-27B. Apache 2.0, ~19 Go en 4-bit, tourne sous Ollama, LM Studio, llama.cpp et vLLM, entrée image et vidéo natives, et il domine les classements open-source de sa catégorie. Il n'y a aucune bonne raison de démarrer plus cher ou moins commodément.
Faut-il vraiment 8 GPU pour GLM-5.3-Flash ? Non — mais pour la pleine qualité, oui. Les poids FP8 natifs (~306 GiB) exigent en pratique un nœud de 8 GPU. Sur un Mac 128 Go ou une DGX Spark, des quants communautaires (3-bit ou EXL3 2,05 bpw) tournent avec des mesures de fidélité documentées face au BF16. La perte de qualité est mesurable mais acceptable pour le chat et les workloads agents.
Quelle différence entre Qwen3.8-Flash (API) et Qwen3.8-Flash-Next ? qwen3.8-flash est le service API sur QwenCloud avec 1M de contexte d'office. Qwen3.8-Flash-Next est le checkpoint ouvert derrière — avec 262K de contexte natif. Si vous voulez YaRN à 1M, vous le configurez vous-même ; si vous voulez la simplicité, prenez l'API.
DeepSeek V4.1 Flash tourne-t-il sur un seul appareil de 128 Go ? Oui, avec des compromis. Sur Mac via ds4 avec streaming SSD des tables Engram (Q2 : 152 GiB résidents). Sur DGX Spark en EXL3 1,59 bpw à 15–25 tok/s. Rien de comparable à un setup 4× Spark (TP4, 40–61 tok/s) — mais cela tourne.
Quelle licence est la plus simple pour un usage commercial ? Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss) et MIT (GLM-5.3-Flash, DeepSeek V4.1 Flash) sont pratiquement sans restriction commerciale. La licence Qwen Community du checkpoint Flash-Next et la licence personnalisée du flagship GLM-5.3 comportent des conditions — à lire avant un déploiement en production.
Le guide de juillet reste-t-il valable ? Oui, comme panorama des familles établies (Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4). Cet article y ajoute la génération Flash d'août/septembre 2026. Pour notre approche de l'IA locale en production, voir Context Studios Local AI.
Sources
- Yotta Labs : DeepSeek V4 Flash vs GLM 5.3 Flash vs Qwen Flash-Next (2026)
- Regolo : DeepSeek V4 Flash vs Qwen3.8-Flash-Next vs GLM-5.3-Flash — quality-to-price 2026
- LLMCheck : State of Open-Source Local LLMs, September 2026
- vcruz305 : GLM-5.3-Flash-EXL3-K2 (Hugging Face, mesures single-Spark)
- Market Intelligence Research : GLM-5.3-Flash on a single DGX Spark — three community quantizations
- NVIDIA Developer Forums : DeepSeek-V4.1-Flash EXL3 2.9 bpw on 2× DGX Sparks
- NVIDIA Developer Forums : DeepSeek-V4.1-Flash is now open-sourced (TP4 measurements)
- vcruz305 : DeepSeek-V4.1-Flash-EXL3-DGX-Spark-recipe (single Spark)
- bot-lab-21 : DeepSeek-V4.1-Flash-EXL3-3.5bpw-Pollard (4× Spark TP4)
- dwarfstar.sh : ds4 September 2026 — DeepSeek V4.1 and Qwen3.8 Flash Next on Metal
- Dev.to : GLM-5.3-Flash vs Qwen3.8-Flash-Next vs DeepSeek V4 Flash — benchmark tier
- Fernando Nog : DeepSeek-V4.1-Flash vs GLM-5.3-Flash vs Qwen3.8-Flash — API pricing snapshot
- CourionAI : MiniCPM5-2B — a 2.5B model beats bigger rivals
- Local Inference Lab : RTX 6000 Pro daily summaries — DSV4.1 EXL3, Qwen 3.8 Flash Next vLLM configs