---
type: "BlogPosting"
title: "Aktuelle Open-Weight-LLMs & die Hardware, auf der sie laufen (September 2026)"
description: "GLM-5.3-Flash, DeepSeek V4.1 Flash und Qwen3.8-Flash-Next im Überblick — und die ehrliche Hardware-Matrix: was läuft auf Laptop, Mac Studio, DGX Spark und Multi-GPU-Node?"
resource: "https://www.contextstudios.ai/de/blog/aktuelle-open-weight-llms-die-hardware-auf-der-sie-laufen-september-2026"
language: "de"
tags: ["Local AI", "Open Weights", "LLM", "Self-Hosting", "Hardware", "GLM-5.3-Flash", "DeepSeek", "Qwen"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-05T02:03:41.924Z"
status: "stable"
---

# Aktuelle Open-Weight-LLMs & die Hardware, auf der sie laufen (September 2026)

Published: 2026-09-30
Tags: Local AI, Open Weights, LLM, Self-Hosting, Hardware, GLM-5.3-Flash, DeepSeek, Qwen

![Aktuelle Open-Weight-LLMs & die Hardware, auf der sie laufen (September 2026)](https://wary-platypus-754.convex.cloud/api/storage/da44d2d4-baa7-47f8-9f02-61b0fc086c2a)

Im Juli haben wir im Guide [Best Open-Weight LLMs 2026](/de/guides/best-open-weight-llms-2026) die damals beste Auswahloffene Modelle vorgestellt: Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4 und Mistral. Seitdem ist viel passiert. Drei neue Flash-Modelle haben die Selbst-Hosting-Landschaft umgekrempelt, und ein 2,5-Milliarden-Parameter-Modell schlägt viermal so große Konkurrenten. Dieser Artikel fasst zusammen, was im September 2026 aktuell ist — und beantwortet die Frage, die der Guide bewusst offen ließ: **auf welcher Hardware läuft das wirklich?**

## Die drei Flash-Modelle im September 2026

| Modell | Architektur | Aktiv pro Token | Kontext | Lizenz | Release |
|---|---|---|---|---|---|
| GLM-5.3-Flash (Z.ai) | 320B MoE, hybrid linear+sparse Attention | ~18B | 1M | MIT | 26.08.2026 |
| DeepSeek V4.1 Flash | 552B MoE + Engram n-gram | ~14B | 1M | MIT | 10.09.2026 |
| Qwen3.8-Flash-Next (Alibaba) | 125B MoE + 51B n-gram, Gated DeltaNet | ~6B | 262K nativ, 1M mit YaRN | Qwen Community | 28.08.2026 |

Alle drei sind Mixture-of-Experts-Modelle, die pro Token nur einen Bruchteil ihrer Parameter aktivieren — deshalb laufen sie überhaupt auf Consumer-Hardware. Die Unterschiede liegen im Detail.

**GLM-5.3-Flash** ist der stärkste Open-Weight-Coder der Flash-Klasse: Terminal-Bench 2.1 bei 84,3, DeepSWE v1.1 bei 63,4. Z.ai hat die MIT-Weights am 26. August veröffentlicht — demselben Tag, an dem das vorher anonym getestete Modell „Ox Alpha" identifiziert wurde. Der Haken für Selbst-Hoster: Die nativen FP8-Weights wiegen rund 306 GiB, ein einzelner 128-GB-Rechner reicht dafür nicht.

**DeepSeek V4.1 Flash** (seit 10. September offen) ist der Nachfolger von V4 Flash — keine Architektur-Iteration, sondern ein Neubau: eigene Tokenizer, eigener Inference-Graph, 189 GiB Engram-Tabellen, die im Q2-Paket auf der SSD bleiben, während 152 GiB Hauptgewichte resident laufen. Beim Preis ist es der Sparfuchs: 0,15 $ Input / 0,60 $ Output pro Million Tokens (off-peak).

**Qwen3.8-Flash-Next** ist der Vorschau-Checkpoint auf die Qwen4-Architektur: 125B Hauptmodell plus eine 51B n-gram-Embedding-Schicht, nur ~6B aktive Parameter, dafür native Bild- und Video-Eingabe. 262K Kontext nativ, per YaRN auf 1M erweiterbar — aber die YaRN-Konfiguration ist dann dein Deployment-Problem, nicht das des Anbieters.

## Die Hardware-Matrix: was passt wirklich wohin

Die ehrliche Antwort auf „welche Hardware?" hängt von der Quantisierung ab. Die Community-Quants von September 2026 zeichnen ein klares Bild:

**Laptop und Desktop (16–64 GB):** Hier spielt Qwen3.8-27B (Apache 2.0, ~19 GB bei 4-Bit, native Bild- und Video-Eingabe) die Nummer 1 — es führt mehrere September-Leaderboards an. MiniCPM5-2B (Apache 2.0, ~2,4 GB als Q4-GGUF) ist der Geheimtipp: 131K Kontext, 69,1 auf LiveCodeBench v6 — mit 2,52B Parametern schlägt es Qwen3.5-4B um fast 13 Punkte. Wer agentische Tools mit Tool-Calling braucht, fährt damit erschwinglich und lokal.

**128 GB (Mac Studio, Workstation):** Qwen3.8-Flash-Next als 4-Bit-MLX-Konvertierung (112 GB) ist hier der neue Favorit — etwa 49 tok/s geschätzt auf einem M5 Max, weil nur 6B Parameter pro Token streamen. GLM-5.3-Flash passt als 3-Bit-Quant (120 GB) knapp hinein. DeepSeek V4.1 Flash läuft hier über SSD-Streaming: Das ds4-Paket (Metal) hält 152 GiB Hauptgewichte resident und liest die Engram-Tabellen von der SSD.

**DGX Spark (1× 128 GB unified):** Drei Community-Quants bringen GLM-5.3-Flash auf eine einzelne Spark — die vollständigste Receipe (EXL3 2,05 bpw + DFlash2-Drafter) dekodiert strukturierte Ausgaben mit 64,1 tok/s (5-Run-Median), Prosa bei ~30 tok/s. DeepSeek V4.1 Flash als EXL3 1,59 bpw läuft ebenfalls auf einer Spark: 15–17 tok/s frisch, bis ~25 tok/s mit Prefix-Cache. Ein Spark reicht also für beide — mit Qualitätseinbußen, die die jeweiligen Fidelity-Receipts (KLD-vs-BF16) dokumentieren.

**2–4× DGX Spark:** Der Sweet Spot für Ernsthaftes. GLM-5.3-Flash als EXL3 4 bpw auf 2× Spark (TP2): 48–52 tok/s Code, 19 tok/s Prosa, 1M-Kontext. DeepSeek V4.1 Flash auf 4× Spark (TP4): 40,5 tok/s single-stream mit dem offiziellen 510-GB-Checkpoint, die Community-Quants (EXL3 3,5 bpw) pushen das auf ~61 tok/s mit 3,4M-Token-KV-Pool bei 1M Kontext.

**Multi-GPU-Node (8× H200 o. ä.):** Ab hier laufen alle drei in nativer FP8/BF16-Qualität. GLM-5.3-Flash braucht realistisch einen 8-GPU-Knoten als Floor; DeepSeek V4.1 Flash will 2× H200 minimum; Qwen3.8-Flash-Next ist mit seinem kleineren Footprint flexibler.

## Was sich seit Juli geändert hat — in drei Sätzen

Erstens: Die Flash-Klasse (18B aktiv und darunter) hat die Qualitätsschwelle erreicht, an der Selbst-Hosting für Agent-Workloads ernsthaft wird — GLM-5.3-Flash liegt bei agentic coding vor allem, was vorher nur API-Modelle konnten. Zweitens: n-gram-Engram-Tabellen (DeepSeek, Qwen) haben das neue Design-Muster etabliert — große Lookup-Tabellen bleiben auf der SSD, nur die heißen Gewichte sind resident. Drittens: Die Lizenzen sind auseinandergelaufen — MIT (GLM-5.3-Flash, DeepSeek), Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss), Qwen Community (Flash-Next) und eine Custom-Lizenz beim GLM-5.3-Flagship. Für kommerzielle Deployments vor dem Deployment prüfen.

## Häufige Fragen

**Welches Modell ist der beste Einstieg in lokales LLM-Hosting im September 2026?**
Für die allermeisten: Qwen3.8-27B. Apache 2.0, ~19 GB bei 4-Bit, läuft in Ollama, LM Studio, llama.cpp und vLLM, native Bild- und Video-Eingabe, und es führt die Open-Source-Leaderboards seiner Klasse an. Es gibt keinen vernünftigen Grund, teurer oder unpraktischer zu starten.

**Brauche ich für GLM-5.3-Flash zwingend 8 GPUs?**
Nein — aber für volle Qualität ja. Die nativen FP8-Weights (~306 GiB) brauchen realistisch einen 8-GPU-Knoten. Auf einem 128-GB-Mac oder einer DGX Spark laufen Community-Quants (3-Bit bzw. EXL3 2,05 bpw), dokumentiert mit Fidelity-Messungen gegen BF16. Die Qualitätseinbußen sind messbar, aber für Chat- und Agent-Workloads akzeptabel.

**Was ist der Unterschied zwischen Qwen3.8-Flash (API) und Qwen3.8-Flash-Next?**
qwen3.8-flash ist der API-Service auf QwenCloud mit 1M Kontext ab Werk. Qwen3.8-Flash-Next ist der offene Checkpoint dahinter — mit 262K nativem Kontext. Wer YaRN auf 1M will, konfiguriert das selbst; wer es einfach haben will, nimmt die API.

**Läuft DeepSeek V4.1 Flash auf einem einzelnen 128-GB-Gerät?**
Ja, mit Kompromissen. Auf dem Mac über ds4 mit SSD-Streaming der Engram-Tabellen (Q2: 152 GiB resident). Auf der DGX Spark als EXL3 1,59 bpw mit 15–25 tok/s. Beides ist kein Vergleich zu einem 4×-Spark-Setup (TP4, 40–61 tok/s) — aber es läuft.

**Welche Lizenz ist für kommerzielle Nutzung am unkompliziertesten?**
Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss) und MIT (GLM-5.3-Flash, DeepSeek V4.1 Flash) sind praktisch uneingeschränkt kommerziell nutzbar. Die Qwen-Community-Lizenz beim Flash-Next-Checkpoint und die GLM-5.3-Custom-Lizenz beim Flagship haben Bedingungen — vor einem produktiven Deployment lesen.

**Bleibt der Juli-Guide aktuell?**
Ja, als Überblick über die etablierten Familien (Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4). Dieser Artikel ergänzt ihn um die Flash-Generation von August/September 2026. Für unseren Ansatz, lokale KI in Produktion zu betreiben, siehe [Context Studios Local AI](/de/local-ai).

## Sources

- [Yotta Labs: DeepSeek V4 Flash vs GLM 5.3 Flash vs Qwen Flash-Next (2026)](https://yottalabs.ai/post/deepseek-v4-flash-vs-glm-5-3-flash-vs-qwen-flash-next-2026)
- [Regolo: DeepSeek V4 Flash vs Qwen3.8-Flash-Next vs GLM-5.3-Flash — quality-to-price 2026](https://regolo.ai/deepseek-v4-flash-vs-qwen3-8-flash-next-vs-glm-5-3-flash-the-real-leader-in-quality-to-price-in-2026/)
- [LLMCheck: State of Open-Source Local LLMs, September 2026](https://llmcheck.net/blog/state-of-open-source-local-llms-september-2026)
- [vcruz305: GLM-5.3-Flash-EXL3-K2 (Hugging Face, single-Spark Messwerte)](https://huggingface.co/vcruz305/GLM-5.3-Flash-EXL3-K2)
- [Market Intelligence Research: GLM-5.3-Flash on a single DGX Spark — three community quantizations](https://marketintelligenceresearch.com/blog/glm-53-flash-single-dgx-spark-three-community-quantizations)
- [NVIDIA Developer Forums: DeepSeek-V4.1-Flash EXL3 2.9 bpw on 2× DGX Sparks](https://forums.developer.nvidia.com/t/deepseek-v4-1-flash-exl3-2-9-bpw-for-2x-dgx-sparks/383242)
- [NVIDIA Developer Forums: DeepSeek-V4.1-Flash is now open-sourced (TP4 measurements)](https://forums.developer.nvidia.com/t/deepseek-v4-1-flash-is-now-open-sourced/382894)
- [vcruz305: DeepSeek-V4.1-Flash-EXL3-DGX-Spark-recipe (single Spark)](https://github.laiyagushi.com/vcruz305/DeepSeek-V4.1-Flash-EXL3-DGX-Spark-recipe)
- [bot-lab-21: DeepSeek-V4.1-Flash-EXL3-3.5bpw-Pollard (4× Spark TP4)](https://huggingface.co/bot-lab-21/DeepSeek-V4.1-Flash-EXL3-3.5bpw-Pollard)
- [dwarfstar.sh: ds4 September 2026 — DeepSeek V4.1 and Qwen3.8 Flash Next on Metal](https://dwarfstar.sh/blog/ds4-september-v41-qwen38-and-a-bigger-runtime)
- [Dev.to: GLM-5.3-Flash vs Qwen3.8-Flash-Next vs DeepSeek V4 Flash — benchmark tier](https://dev.to/shaam_ai/glm-53-flash-vs-qwen38-flash-next-vs-deepseek-v4-flash-56fe)
- [Fernando Nog: DeepSeek-V4.1-Flash vs GLM-5.3-Flash vs Qwen3.8-Flash — API pricing snapshot](https://fernando-nog.netlify.app/deepseek-v4-1-flash-vs-glm-5-3-flash-vs-qwen-3-8-flash-agentic-coding)
- [CourionAI: MiniCPM5-2B — a 2.5B model beats bigger rivals](https://courionai.com/news/2026-09-09-minicpm5-2b-on-device-model/)
- [Local Inference Lab: RTX 6000 Pro daily summaries — DSV4.1 EXL3, Qwen 3.8 Flash Next vLLM configs](https://github.com/local-inference-lab/rtx6kpro/blob/master/daily-summaries/2026-09/2026-09-23.md)


## Related

- [LLM-Entwicklung](https://www.contextstudios.ai/de/llm-entwicklung.md)
- [KI-Entwicklung](https://www.contextstudios.ai/de/ki-entwicklung.md)
- [LLM-Integration](https://www.contextstudios.ai/de/llm-integration.md)
- [KI-Beratung](https://www.contextstudios.ai/de/ki-beratung.md)
