Local AI

Aktuelle Open-Weight-LLMs & die Hardware, auf der sie laufen (September 2026)

Aktuelle Open-Weight-LLMs & die Hardware, auf der sie laufen (September 2026)

Im Juli haben wir im Guide Best Open-Weight LLMs 2026 die damals beste Auswahloffene Modelle vorgestellt: Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4 und Mistral. Seitdem ist viel passiert. Drei neue Flash-Modelle haben die Selbst-Hosting-Landschaft umgekrempelt, und ein 2,5-Milliarden-Parameter-Modell schlägt viermal so große Konkurrenten. Dieser Artikel fasst zusammen, was im September 2026 aktuell ist — und beantwortet die Frage, die der Guide bewusst offen ließ: auf welcher Hardware läuft das wirklich?

Die drei Flash-Modelle im September 2026

ModellArchitekturAktiv pro TokenKontextLizenzRelease
GLM-5.3-Flash (Z.ai)320B MoE, hybrid linear+sparse Attention~18B1MMIT26.08.2026
DeepSeek V4.1 Flash552B MoE + Engram n-gram~14B1MMIT10.09.2026
Qwen3.8-Flash-Next (Alibaba)125B MoE + 51B n-gram, Gated DeltaNet~6B262K nativ, 1M mit YaRNQwen Community28.08.2026

Alle drei sind Mixture-of-Experts-Modelle, die pro Token nur einen Bruchteil ihrer Parameter aktivieren — deshalb laufen sie überhaupt auf Consumer-Hardware. Die Unterschiede liegen im Detail.

GLM-5.3-Flash ist der stärkste Open-Weight-Coder der Flash-Klasse: Terminal-Bench 2.1 bei 84,3, DeepSWE v1.1 bei 63,4. Z.ai hat die MIT-Weights am 26. August veröffentlicht — demselben Tag, an dem das vorher anonym getestete Modell „Ox Alpha" identifiziert wurde. Der Haken für Selbst-Hoster: Die nativen FP8-Weights wiegen rund 306 GiB, ein einzelner 128-GB-Rechner reicht dafür nicht.

DeepSeek V4.1 Flash (seit 10. September offen) ist der Nachfolger von V4 Flash — keine Architektur-Iteration, sondern ein Neubau: eigene Tokenizer, eigener Inference-Graph, 189 GiB Engram-Tabellen, die im Q2-Paket auf der SSD bleiben, während 152 GiB Hauptgewichte resident laufen. Beim Preis ist es der Sparfuchs: 0,15 $ Input / 0,60 $ Output pro Million Tokens (off-peak).

Qwen3.8-Flash-Next ist der Vorschau-Checkpoint auf die Qwen4-Architektur: 125B Hauptmodell plus eine 51B n-gram-Embedding-Schicht, nur ~6B aktive Parameter, dafür native Bild- und Video-Eingabe. 262K Kontext nativ, per YaRN auf 1M erweiterbar — aber die YaRN-Konfiguration ist dann dein Deployment-Problem, nicht das des Anbieters.

Die Hardware-Matrix: was passt wirklich wohin

Die ehrliche Antwort auf „welche Hardware?" hängt von der Quantisierung ab. Die Community-Quants von September 2026 zeichnen ein klares Bild:

Laptop und Desktop (16–64 GB): Hier spielt Qwen3.8-27B (Apache 2.0, ~19 GB bei 4-Bit, native Bild- und Video-Eingabe) die Nummer 1 — es führt mehrere September-Leaderboards an. MiniCPM5-2B (Apache 2.0, ~2,4 GB als Q4-GGUF) ist der Geheimtipp: 131K Kontext, 69,1 auf LiveCodeBench v6 — mit 2,52B Parametern schlägt es Qwen3.5-4B um fast 13 Punkte. Wer agentische Tools mit Tool-Calling braucht, fährt damit erschwinglich und lokal.

128 GB (Mac Studio, Workstation): Qwen3.8-Flash-Next als 4-Bit-MLX-Konvertierung (112 GB) ist hier der neue Favorit — etwa 49 tok/s geschätzt auf einem M5 Max, weil nur 6B Parameter pro Token streamen. GLM-5.3-Flash passt als 3-Bit-Quant (120 GB) knapp hinein. DeepSeek V4.1 Flash läuft hier über SSD-Streaming: Das ds4-Paket (Metal) hält 152 GiB Hauptgewichte resident und liest die Engram-Tabellen von der SSD.

DGX Spark (1× 128 GB unified): Drei Community-Quants bringen GLM-5.3-Flash auf eine einzelne Spark — die vollständigste Receipe (EXL3 2,05 bpw + DFlash2-Drafter) dekodiert strukturierte Ausgaben mit 64,1 tok/s (5-Run-Median), Prosa bei ~30 tok/s. DeepSeek V4.1 Flash als EXL3 1,59 bpw läuft ebenfalls auf einer Spark: 15–17 tok/s frisch, bis ~25 tok/s mit Prefix-Cache. Ein Spark reicht also für beide — mit Qualitätseinbußen, die die jeweiligen Fidelity-Receipts (KLD-vs-BF16) dokumentieren.

2–4× DGX Spark: Der Sweet Spot für Ernsthaftes. GLM-5.3-Flash als EXL3 4 bpw auf 2× Spark (TP2): 48–52 tok/s Code, 19 tok/s Prosa, 1M-Kontext. DeepSeek V4.1 Flash auf 4× Spark (TP4): 40,5 tok/s single-stream mit dem offiziellen 510-GB-Checkpoint, die Community-Quants (EXL3 3,5 bpw) pushen das auf ~61 tok/s mit 3,4M-Token-KV-Pool bei 1M Kontext.

Multi-GPU-Node (8× H200 o. ä.): Ab hier laufen alle drei in nativer FP8/BF16-Qualität. GLM-5.3-Flash braucht realistisch einen 8-GPU-Knoten als Floor; DeepSeek V4.1 Flash will 2× H200 minimum; Qwen3.8-Flash-Next ist mit seinem kleineren Footprint flexibler.

Was sich seit Juli geändert hat — in drei Sätzen

Erstens: Die Flash-Klasse (18B aktiv und darunter) hat die Qualitätsschwelle erreicht, an der Selbst-Hosting für Agent-Workloads ernsthaft wird — GLM-5.3-Flash liegt bei agentic coding vor allem, was vorher nur API-Modelle konnten. Zweitens: n-gram-Engram-Tabellen (DeepSeek, Qwen) haben das neue Design-Muster etabliert — große Lookup-Tabellen bleiben auf der SSD, nur die heißen Gewichte sind resident. Drittens: Die Lizenzen sind auseinandergelaufen — MIT (GLM-5.3-Flash, DeepSeek), Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss), Qwen Community (Flash-Next) und eine Custom-Lizenz beim GLM-5.3-Flagship. Für kommerzielle Deployments vor dem Deployment prüfen.

Häufige Fragen

Welches Modell ist der beste Einstieg in lokales LLM-Hosting im September 2026? Für die allermeisten: Qwen3.8-27B. Apache 2.0, ~19 GB bei 4-Bit, läuft in Ollama, LM Studio, llama.cpp und vLLM, native Bild- und Video-Eingabe, und es führt die Open-Source-Leaderboards seiner Klasse an. Es gibt keinen vernünftigen Grund, teurer oder unpraktischer zu starten.

Brauche ich für GLM-5.3-Flash zwingend 8 GPUs? Nein — aber für volle Qualität ja. Die nativen FP8-Weights (~306 GiB) brauchen realistisch einen 8-GPU-Knoten. Auf einem 128-GB-Mac oder einer DGX Spark laufen Community-Quants (3-Bit bzw. EXL3 2,05 bpw), dokumentiert mit Fidelity-Messungen gegen BF16. Die Qualitätseinbußen sind messbar, aber für Chat- und Agent-Workloads akzeptabel.

Was ist der Unterschied zwischen Qwen3.8-Flash (API) und Qwen3.8-Flash-Next? qwen3.8-flash ist der API-Service auf QwenCloud mit 1M Kontext ab Werk. Qwen3.8-Flash-Next ist der offene Checkpoint dahinter — mit 262K nativem Kontext. Wer YaRN auf 1M will, konfiguriert das selbst; wer es einfach haben will, nimmt die API.

Läuft DeepSeek V4.1 Flash auf einem einzelnen 128-GB-Gerät? Ja, mit Kompromissen. Auf dem Mac über ds4 mit SSD-Streaming der Engram-Tabellen (Q2: 152 GiB resident). Auf der DGX Spark als EXL3 1,59 bpw mit 15–25 tok/s. Beides ist kein Vergleich zu einem 4×-Spark-Setup (TP4, 40–61 tok/s) — aber es läuft.

Welche Lizenz ist für kommerzielle Nutzung am unkompliziertesten? Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss) und MIT (GLM-5.3-Flash, DeepSeek V4.1 Flash) sind praktisch uneingeschränkt kommerziell nutzbar. Die Qwen-Community-Lizenz beim Flash-Next-Checkpoint und die GLM-5.3-Custom-Lizenz beim Flagship haben Bedingungen — vor einem produktiven Deployment lesen.

Bleibt der Juli-Guide aktuell? Ja, als Überblick über die etablierten Familien (Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4). Dieser Artikel ergänzt ihn um die Flash-Generation von August/September 2026. Für unseren Ansatz, lokale KI in Produktion zu betreiben, siehe Context Studios Local AI.

Sources

Thema für Ihr Team? Sprechen wir 30 Minuten.

Wir ordnen ein, was davon in Ihrem Unternehmen trägt — konkret, ohne Folienschlacht.

Unverbindlich · 30 Minuten · Angebot in 48 h