Im Juli haben wir im Guide Best Open-Weight LLMs 2026 die damals beste Auswahloffene Modelle vorgestellt: Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4 und Mistral. Seitdem ist viel passiert. Drei neue Flash-Modelle haben die Selbst-Hosting-Landschaft umgekrempelt, und ein 2,5-Milliarden-Parameter-Modell schlägt viermal so große Konkurrenten. Dieser Artikel fasst zusammen, was im September 2026 aktuell ist — und beantwortet die Frage, die der Guide bewusst offen ließ: auf welcher Hardware läuft das wirklich?
Die drei Flash-Modelle im September 2026
| Modell | Architektur | Aktiv pro Token | Kontext | Lizenz | Release |
|---|---|---|---|---|---|
| GLM-5.3-Flash (Z.ai) | 320B MoE, hybrid linear+sparse Attention | ~18B | 1M | MIT | 26.08.2026 |
| DeepSeek V4.1 Flash | 552B MoE + Engram n-gram | ~14B | 1M | MIT | 10.09.2026 |
| Qwen3.8-Flash-Next (Alibaba) | 125B MoE + 51B n-gram, Gated DeltaNet | ~6B | 262K nativ, 1M mit YaRN | Qwen Community | 28.08.2026 |
Alle drei sind Mixture-of-Experts-Modelle, die pro Token nur einen Bruchteil ihrer Parameter aktivieren — deshalb laufen sie überhaupt auf Consumer-Hardware. Die Unterschiede liegen im Detail.
GLM-5.3-Flash ist der stärkste Open-Weight-Coder der Flash-Klasse: Terminal-Bench 2.1 bei 84,3, DeepSWE v1.1 bei 63,4. Z.ai hat die MIT-Weights am 26. August veröffentlicht — demselben Tag, an dem das vorher anonym getestete Modell „Ox Alpha" identifiziert wurde. Der Haken für Selbst-Hoster: Die nativen FP8-Weights wiegen rund 306 GiB, ein einzelner 128-GB-Rechner reicht dafür nicht.
DeepSeek V4.1 Flash (seit 10. September offen) ist der Nachfolger von V4 Flash — keine Architektur-Iteration, sondern ein Neubau: eigene Tokenizer, eigener Inference-Graph, 189 GiB Engram-Tabellen, die im Q2-Paket auf der SSD bleiben, während 152 GiB Hauptgewichte resident laufen. Beim Preis ist es der Sparfuchs: 0,15 $ Input / 0,60 $ Output pro Million Tokens (off-peak).
Qwen3.8-Flash-Next ist der Vorschau-Checkpoint auf die Qwen4-Architektur: 125B Hauptmodell plus eine 51B n-gram-Embedding-Schicht, nur ~6B aktive Parameter, dafür native Bild- und Video-Eingabe. 262K Kontext nativ, per YaRN auf 1M erweiterbar — aber die YaRN-Konfiguration ist dann dein Deployment-Problem, nicht das des Anbieters.
Die Hardware-Matrix: was passt wirklich wohin
Die ehrliche Antwort auf „welche Hardware?" hängt von der Quantisierung ab. Die Community-Quants von September 2026 zeichnen ein klares Bild:
Laptop und Desktop (16–64 GB): Hier spielt Qwen3.8-27B (Apache 2.0, ~19 GB bei 4-Bit, native Bild- und Video-Eingabe) die Nummer 1 — es führt mehrere September-Leaderboards an. MiniCPM5-2B (Apache 2.0, ~2,4 GB als Q4-GGUF) ist der Geheimtipp: 131K Kontext, 69,1 auf LiveCodeBench v6 — mit 2,52B Parametern schlägt es Qwen3.5-4B um fast 13 Punkte. Wer agentische Tools mit Tool-Calling braucht, fährt damit erschwinglich und lokal.
128 GB (Mac Studio, Workstation): Qwen3.8-Flash-Next als 4-Bit-MLX-Konvertierung (112 GB) ist hier der neue Favorit — etwa 49 tok/s geschätzt auf einem M5 Max, weil nur 6B Parameter pro Token streamen. GLM-5.3-Flash passt als 3-Bit-Quant (120 GB) knapp hinein. DeepSeek V4.1 Flash läuft hier über SSD-Streaming: Das ds4-Paket (Metal) hält 152 GiB Hauptgewichte resident und liest die Engram-Tabellen von der SSD.
DGX Spark (1× 128 GB unified): Drei Community-Quants bringen GLM-5.3-Flash auf eine einzelne Spark — die vollständigste Receipe (EXL3 2,05 bpw + DFlash2-Drafter) dekodiert strukturierte Ausgaben mit 64,1 tok/s (5-Run-Median), Prosa bei ~30 tok/s. DeepSeek V4.1 Flash als EXL3 1,59 bpw läuft ebenfalls auf einer Spark: 15–17 tok/s frisch, bis ~25 tok/s mit Prefix-Cache. Ein Spark reicht also für beide — mit Qualitätseinbußen, die die jeweiligen Fidelity-Receipts (KLD-vs-BF16) dokumentieren.
2–4× DGX Spark: Der Sweet Spot für Ernsthaftes. GLM-5.3-Flash als EXL3 4 bpw auf 2× Spark (TP2): 48–52 tok/s Code, 19 tok/s Prosa, 1M-Kontext. DeepSeek V4.1 Flash auf 4× Spark (TP4): 40,5 tok/s single-stream mit dem offiziellen 510-GB-Checkpoint, die Community-Quants (EXL3 3,5 bpw) pushen das auf ~61 tok/s mit 3,4M-Token-KV-Pool bei 1M Kontext.
Multi-GPU-Node (8× H200 o. ä.): Ab hier laufen alle drei in nativer FP8/BF16-Qualität. GLM-5.3-Flash braucht realistisch einen 8-GPU-Knoten als Floor; DeepSeek V4.1 Flash will 2× H200 minimum; Qwen3.8-Flash-Next ist mit seinem kleineren Footprint flexibler.
Was sich seit Juli geändert hat — in drei Sätzen
Erstens: Die Flash-Klasse (18B aktiv und darunter) hat die Qualitätsschwelle erreicht, an der Selbst-Hosting für Agent-Workloads ernsthaft wird — GLM-5.3-Flash liegt bei agentic coding vor allem, was vorher nur API-Modelle konnten. Zweitens: n-gram-Engram-Tabellen (DeepSeek, Qwen) haben das neue Design-Muster etabliert — große Lookup-Tabellen bleiben auf der SSD, nur die heißen Gewichte sind resident. Drittens: Die Lizenzen sind auseinandergelaufen — MIT (GLM-5.3-Flash, DeepSeek), Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss), Qwen Community (Flash-Next) und eine Custom-Lizenz beim GLM-5.3-Flagship. Für kommerzielle Deployments vor dem Deployment prüfen.
Häufige Fragen
Welches Modell ist der beste Einstieg in lokales LLM-Hosting im September 2026? Für die allermeisten: Qwen3.8-27B. Apache 2.0, ~19 GB bei 4-Bit, läuft in Ollama, LM Studio, llama.cpp und vLLM, native Bild- und Video-Eingabe, und es führt die Open-Source-Leaderboards seiner Klasse an. Es gibt keinen vernünftigen Grund, teurer oder unpraktischer zu starten.
Brauche ich für GLM-5.3-Flash zwingend 8 GPUs? Nein — aber für volle Qualität ja. Die nativen FP8-Weights (~306 GiB) brauchen realistisch einen 8-GPU-Knoten. Auf einem 128-GB-Mac oder einer DGX Spark laufen Community-Quants (3-Bit bzw. EXL3 2,05 bpw), dokumentiert mit Fidelity-Messungen gegen BF16. Die Qualitätseinbußen sind messbar, aber für Chat- und Agent-Workloads akzeptabel.
Was ist der Unterschied zwischen Qwen3.8-Flash (API) und Qwen3.8-Flash-Next? qwen3.8-flash ist der API-Service auf QwenCloud mit 1M Kontext ab Werk. Qwen3.8-Flash-Next ist der offene Checkpoint dahinter — mit 262K nativem Kontext. Wer YaRN auf 1M will, konfiguriert das selbst; wer es einfach haben will, nimmt die API.
Läuft DeepSeek V4.1 Flash auf einem einzelnen 128-GB-Gerät? Ja, mit Kompromissen. Auf dem Mac über ds4 mit SSD-Streaming der Engram-Tabellen (Q2: 152 GiB resident). Auf der DGX Spark als EXL3 1,59 bpw mit 15–25 tok/s. Beides ist kein Vergleich zu einem 4×-Spark-Setup (TP4, 40–61 tok/s) — aber es läuft.
Welche Lizenz ist für kommerzielle Nutzung am unkompliziertesten? Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss) und MIT (GLM-5.3-Flash, DeepSeek V4.1 Flash) sind praktisch uneingeschränkt kommerziell nutzbar. Die Qwen-Community-Lizenz beim Flash-Next-Checkpoint und die GLM-5.3-Custom-Lizenz beim Flagship haben Bedingungen — vor einem produktiven Deployment lesen.
Bleibt der Juli-Guide aktuell? Ja, als Überblick über die etablierten Familien (Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4). Dieser Artikel ergänzt ihn um die Flash-Generation von August/September 2026. Für unseren Ansatz, lokale KI in Produktion zu betreiben, siehe Context Studios Local AI.
Sources
- Yotta Labs: DeepSeek V4 Flash vs GLM 5.3 Flash vs Qwen Flash-Next (2026)
- Regolo: DeepSeek V4 Flash vs Qwen3.8-Flash-Next vs GLM-5.3-Flash — quality-to-price 2026
- LLMCheck: State of Open-Source Local LLMs, September 2026
- vcruz305: GLM-5.3-Flash-EXL3-K2 (Hugging Face, single-Spark Messwerte)
- Market Intelligence Research: GLM-5.3-Flash on a single DGX Spark — three community quantizations
- NVIDIA Developer Forums: DeepSeek-V4.1-Flash EXL3 2.9 bpw on 2× DGX Sparks
- NVIDIA Developer Forums: DeepSeek-V4.1-Flash is now open-sourced (TP4 measurements)
- vcruz305: DeepSeek-V4.1-Flash-EXL3-DGX-Spark-recipe (single Spark)
- bot-lab-21: DeepSeek-V4.1-Flash-EXL3-3.5bpw-Pollard (4× Spark TP4)
- dwarfstar.sh: ds4 September 2026 — DeepSeek V4.1 and Qwen3.8 Flash Next on Metal
- Dev.to: GLM-5.3-Flash vs Qwen3.8-Flash-Next vs DeepSeek V4 Flash — benchmark tier
- Fernando Nog: DeepSeek-V4.1-Flash vs GLM-5.3-Flash vs Qwen3.8-Flash — API pricing snapshot
- CourionAI: MiniCPM5-2B — a 2.5B model beats bigger rivals
- Local Inference Lab: RTX 6000 Pro daily summaries — DSV4.1 EXL3, Qwen 3.8 Flash Next vLLM configs