Lokale KI · Rezept · 4× DGX Spark

GLM-5.2 753B INT4/INT8 mit vLLM auf 4× DGX Spark

GLM-5.2 753B INT4/INT8 mit vLLM auf 4× DGX Spark: 32,5 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

32,5tok/sSpitze

1 Anfrage, Bestwert der Quelle, Kontext 200k

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
QuantTrio Int4-Int8Mix (W4A16 MoE-Experts / W8A16 dense+MTP, compressed-tensors, data-free; Layer 0 + Attention-Indexer BF16); KV nvfp4_ds_mla (400 B/Token)
Modellfamilie
GLM-5.2
Kontext
316.000
Parameter
753B MoE, alle 256 Experts intakt (unpruned, README)
Kreator
Weschera
GitHub-Sterne
1
Repo-Stand
20. Aug. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Spitze (Decode)32,5 tok/sKontext 200K · Speed-Night 2–3: 512-tok temp-0-Completions, TTFT excluded; peak 36.0; fp8-KV-Profil Quelle 

Was brauche ich

Hardware
4 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
316.000 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • Experimentell
  • Eigener Kernel nötig

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.