Lokale KI · Rezept · 4× DGX Spark

GLM-5.2 753.3B EXL3 3.5 bpw mit vLLM auf 4× DGX Spark

GLM-5.2 753.3B EXL3 3.5 bpw mit vLLM auf 4× DGX Spark: 20,2 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von fujitsupolycom

20,2tok/sAlltag

1 Anfrage, realistischer Prompt, mit MTP (fixed-4, greedy Draft) (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis34mit Denkenohne Denken 22

Engine

Engine
vLLM
Quantisierung
EXL3 3.5 bpw gemischt (TR3v4), dynamisches NVFP4 MLA + FP8 RoPE KV (nvfp4_ds_mla), target-only exact Q40
Modellfamilie
GLM-5.2
Kontext
1.048.576
Parameter
753.3B MoE lt. zai-org/GLM-5.2 (HF-API Tensoren)
Kreator
fujitsupolycom
GitHub-Sterne
82
Repo-Stand
27. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)20,2 tok/sKontext 16K decode · Einzelbeobachtung; unique cold prompts, temp 1.0 / top-p 0.95; Workload-Typ in der Quelle nicht klassifiziert Quelle 
  • Spitze (Decode)25,4 tok/sCoding Peak, Mittel über 5 normal requests (Median 25.57, Range 22.70–26.92), temp 1.0 Quelle 

Prefill je Kontext

  • 16K671 tok/s16.386 Prompt-Tokens, TTFT 24.41 s Quelle 

Was brauche ich

Hardware
4 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
1.048.576 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.