Lokale KI · Rezept · 2× DGX Spark

GLM-5.3-Flash 320B NVFP4 mit vLLM auf 2× DGX Spark (Vision)

GLM-5.3-Flash 320B NVFP4 mit vLLM auf 2× DGX Spark (Vision): 21,2 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von sfxnz

21,2tok/sAlltag

1 Anfrage, Prosa-Prompt, mit DFlash2 (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis42mit Denken

Engine

Engine
vLLM
Quantisierung
NVFP4 weight-only auf routed experts (~181 GiB), fp8_e4m3 KV (4.14-GiB-Pin), Marlin MoE, DFlash2-7
Modellfamilie
GLM-5.3-Flash
Kontext
327.680
Parameter
320B total / 18B active (README); HF-API safetensors total 165,496,249,182
Kreator
sfxnz
GitHub-Sterne
17
Repo-Stand
15. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)21,2 tok/sBench_decode.py, streamed greedy, thinking off, 200 Completion-Tokens, 3-run-Median; Rebench 2026-09-02: Median 21.179 (3 Läufe); TTFT p50 0.33 s Quelle 
  • Spitze (Decode)67,6 tok/sStructured (Count 1→200) aus evidence/rebench bench.txt SUMMARY; acceptance_len 7.844 Quelle 

Prefill je Kontext

  • 8k (~10,271 Prompt-Tokens)1.425 tok/sUnique-salt 8k-word needle, TTFT 7.2 s; Repeat desselben Prompts: 2600 tok/s warm (prefix cache) Quelle 

Was brauche ich

Hardware
2 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
vLLM
Kontext
327.680 Token

Verwandte Rezepte

2× DGX Spark
97,6tok/sAlltag

HumanEval 97,6 % / GSM8K 98,0 % mit FP8-KV und 4-bit dense Quelle 

Intelligenz42mit Denken
  • ≤ 3 bit: Quantisierung kann Qualität kosten
  • Eigener Kernel nötig
  • Nicht kommerziell
  • Lizenz ungeklärt

EXL3/TR3 4bpw routed experts + 4-bit dense, BF16 elsewhere, FP8 KVTensorFold v0.5.0 (52 patches: DFlash2+copy drafts, 4-bit dense, FP8 KV, RoCE one-shot all-gather, shared KV pool, vision, tool calling)Gewichte Repo Stand 30. Sept. 2026

Details

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.