Lokale KI · Rezept · 3× DGX Spark

GLM-5.2 753B NVFP4 mit vLLM auf 3× DGX Spark

GLM-5.2 753B NVFP4 mit vLLM auf 3× DGX Spark: 13,6 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von MiaAI-Lab

13,6tok/sGemischt

1 Anfrage, gemischtes Prompt-Set, mit MTP (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM custom :k12l1-vision
Quantisierung
NVFP4+AQLM hybrid, nvfp4_ds_mla KV
Modellfamilie
GLM-5.2
Kontext
380.928
Parameter
~753B
Kreator
MiaAI-Lab
GitHub-Sterne
73
Repo-Stand
22. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Gemischt (Decode)13,6 tok/sKontext kurz (Pfad A, nvfp4_ds_mla KV, Vision-Config) · „mixed“ = Prosa/Chat laut README; boot-matched, warm≥5, r1 13.7 / r2 13.6 (niedrigerer Wert); thinking off; README-Kopf: „~13.6–19“ Quelle 
  • Spitze (Decode)20,9 tok/sKontext kurz (Pfad A, Vision-Config) · „structured“ = coding/tight format laut README; r1 21.0 / r2 20.9; README-Kopf „~21“ Quelle 

Was brauche ich

Hardware
3 × NVIDIA DGX Spark (GB10)
Engine
vLLM custom :k12l1-vision
Kontext
380.928 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.