Local AI

LLM ouverts actuels et le matériel sur lequel ils tournent (septembre 2026)

LLM ouverts actuels et le matériel sur lequel ils tournent (septembre 2026)

En juillet, notre guide Best Open-Weight LLMs 2026 présentait les meilleurs modèles ouverts du moment : Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4 et Mistral. Beaucoup de choses ont changé depuis. Trois nouveaux modèles Flash ont bouleversé le paysage de l'auto-hébergement, et un modèle de 2,5 milliards de paramètres bat aujourd'hui des concurrents quatre fois plus gros. Cet article dresse l'état des lieux de septembre 2026 — et répond à la question que le guide laissait volontairement ouverte : sur quel matériel tout cela tourne-t-il réellement ?

Les trois modèles Flash de septembre 2026

ModèleArchitectureActif par tokenContexteLicenceSortie
GLM-5.3-Flash (Z.ai)320B MoE, attention hybride linéaire+sparse~18B1MMIT26.08.2026
DeepSeek V4.1 Flash552B MoE + Engram n-gram~14B1MMIT10.09.2026
Qwen3.8-Flash-Next (Alibaba)125B MoE + 51B n-gram, Gated DeltaNet~6B262K natif, 1M avec YaRNQwen Community28.08.2026

Les trois sont des modèles mixture-of-experts qui n'activent qu'une fraction de leurs paramètres par token — c'est la seule raison pour laquelle ils tournent sur du matériel grand public. Les différences sont dans le détail.

GLM-5.3-Flash est le codeur open-weight le plus fort de la classe Flash : Terminal-Bench 2.1 à 84,3, DeepSWE v1.1 à 63,4. Z.ai a publié les poids MIT le 26 août — le jour même où le modèle jusque-là anonyme « Ox Alpha » a été identifié. Le hic pour l'auto-hébergement : les poids FP8 natifs pèsent environ 306 GiB, une machine de 128 Go ne suffit pas.

DeepSeek V4.1 Flash (ouvert depuis le 10 septembre) n'est pas une itération de V4 Flash mais une reconstruction : son propre tokenizer, son propre graphe d'inférence, 189 GiB de tables Engram qui restent sur SSD dans le paquet Q2 pendant que 152 GiB de poids principaux tournent en mémoire. Côté prix, c'est l'aubaine : 0,15 $ d'entrée / 0,60 $ de sortie par million de tokens (hors pic).

Qwen3.8-Flash-Next est le checkpoint d'aperçu de l'architecture Qwen4 : un modèle principal de 125B plus une couche d'embedding n-gram de 51B, seulement ~6B de paramètres actifs, avec entrée image et vidéo natives. 262K de contexte nativement, extensible à 1M via YaRN — mais cette configuration YaRN devient alors votre problème de déploiement, pas celui du fournisseur.

La matrice matérielle : qu'est-ce qui tient vraiment où

La réponse honnête à « quel matériel ? » dépend de la quantification. Les quants communautaires de septembre 2026 dessinent un tableau clair :

Portable et desktop (16–64 Go) : C'est le royaume de Qwen3.8-27B (Apache 2.0, ~19 Go en 4-bit, entrée image et vidéo natives), numéro un de plusieurs classements de septembre. MiniCPM5-2B (Apache 2.0, ~2,4 Go en GGUF Q4) est la pépite : 131K de contexte, 69,1 sur LiveCodeBench v6 — à 2,52B de paramètres, il bat Qwen3.5-4B de presque 13 points. Pour de l'agentique avec tool-calling à petit budget, c'est la voie locale abordable.

128 Go (Mac Studio, station de travail) : Qwen3.8-Flash-Next en conversion MLX 4-bit (112 Go) est le nouveau favori — environ 49 tok/s estimés sur un M5 Max, car seuls 6B de paramètres défilent par token. GLM-5.3-Flash tient tout juste en quant 3-bit (120 Go). DeepSeek V4.1 Flash passe ici par le streaming SSD : le paquet ds4 (Metal) garde 152 GiB de poids principaux résidents et lit les tables Engram depuis le SSD.

DGX Spark (1× 128 Go unifiée) : Trois quants communautaires font tenir GLM-5.3-Flash sur une seule Spark — la recette la plus complète (EXL3 2,05 bpw + drafter DFlash2) décode la sortie structurée à 64,1 tok/s (médiane sur 5 essais), la prose vers ~30 tok/s. DeepSeek V4.1 Flash en EXL3 1,59 bpw tourne aussi sur une Spark : 15–17 tok/s à froid, jusqu'à ~25 tok/s avec cache de préfixe. Une Spark suffit pour les deux — avec des pertes de qualité documentées dans les reçus de fidélité KLD-vs-BF16 respectifs.

2–4× DGX Spark : Le point idéal pour le sérieux. GLM-5.3-Flash en EXL3 4 bpw sur 2× Spark (TP2) : 48–52 tok/s en code, 19 tok/s en prose, contexte 1M. DeepSeek V4.1 Flash sur 4× Spark (TP4) : 40,5 tok/s en flux simple avec le checkpoint officiel de 510 Go, et les quants communautaires (EXL3 3,5 bpw) poussent cela vers ~61 tok/s avec un pool KV de 3,4M tokens à 1M de contexte.

Nœud multi-GPU (8× H200 etc.) : À partir de là, les trois tournent en qualité FP8/BF16 native. GLM-5.3-Flash a en pratique besoin d'un nœud 8 GPU au minimum ; DeepSeek V4.1 Flash veut 2× H200 au mieux ; Qwen3.8-Flash-Next reste le plus flexible avec son empreinte plus réduite.

Ce qui a changé depuis juillet — en trois phrases

Premièrement : la classe Flash (18B actifs et moins) a atteint le seuil de qualité où l'auto-hébergement devient sérieux pour les workloads agents — GLM-5.3-Flash se classe en codage agentique devant une bonne partie de ce que seuls les modèles API savaient faire. Deuxièmement : les tables Engram n-gram (DeepSeek, Qwen) ont instauré le nouveau schéma de conception — d'immenses tables de lookup restent sur SSD, seuls les poids chauds sont résidents. Troisièmement : les licences ont divergé — MIT (GLM-5.3-Flash, DeepSeek), Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss), Qwen Community (Flash-Next) et une licence personnalisée sur le flagship GLM-5.3. À vérifier avant tout déploiement commercial.

Questions fréquentes

Quel modèle est le meilleur point d'entrée dans l'hébergement local de LLM en septembre 2026 ? Pour la majorité : Qwen3.8-27B. Apache 2.0, ~19 Go en 4-bit, tourne sous Ollama, LM Studio, llama.cpp et vLLM, entrée image et vidéo natives, et il domine les classements open-source de sa catégorie. Il n'y a aucune bonne raison de démarrer plus cher ou moins commodément.

Faut-il vraiment 8 GPU pour GLM-5.3-Flash ? Non — mais pour la pleine qualité, oui. Les poids FP8 natifs (~306 GiB) exigent en pratique un nœud de 8 GPU. Sur un Mac 128 Go ou une DGX Spark, des quants communautaires (3-bit ou EXL3 2,05 bpw) tournent avec des mesures de fidélité documentées face au BF16. La perte de qualité est mesurable mais acceptable pour le chat et les workloads agents.

Quelle différence entre Qwen3.8-Flash (API) et Qwen3.8-Flash-Next ? qwen3.8-flash est le service API sur QwenCloud avec 1M de contexte d'office. Qwen3.8-Flash-Next est le checkpoint ouvert derrière — avec 262K de contexte natif. Si vous voulez YaRN à 1M, vous le configurez vous-même ; si vous voulez la simplicité, prenez l'API.

DeepSeek V4.1 Flash tourne-t-il sur un seul appareil de 128 Go ? Oui, avec des compromis. Sur Mac via ds4 avec streaming SSD des tables Engram (Q2 : 152 GiB résidents). Sur DGX Spark en EXL3 1,59 bpw à 15–25 tok/s. Rien de comparable à un setup 4× Spark (TP4, 40–61 tok/s) — mais cela tourne.

Quelle licence est la plus simple pour un usage commercial ? Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss) et MIT (GLM-5.3-Flash, DeepSeek V4.1 Flash) sont pratiquement sans restriction commerciale. La licence Qwen Community du checkpoint Flash-Next et la licence personnalisée du flagship GLM-5.3 comportent des conditions — à lire avant un déploiement en production.

Le guide de juillet reste-t-il valable ? Oui, comme panorama des familles établies (Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4). Cet article y ajoute la génération Flash d'août/septembre 2026. Pour notre approche de l'IA locale en production, voir Context Studios Local AI.

Sources

Un sujet pour votre équipe ? Parlons-en 30 minutes.

Nous identifions ce qui fonctionne vraiment dans votre entreprise — concret, sans avalanche de slides.

Sans engagement · 30 minutes · Devis sous 48 h