Lokale KI · Rezept · 2× DGX Spark

GLM-5.3-Flash EXL3 mit TensorFold auf 2× DGX Spark (1M Kontext, 4 Streams)

GLM-5.3-Flash EXL3 mit TensorFold auf 2× DGX Spark (1M Kontext, 4 Streams): 97,6 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von MiaAI-Lab

97,6tok/sAlltag

HumanEval 97,6 % / GSM8K 98,0 % mit FP8-KV und 4-bit dense

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis42mit Denken

≤ 3 bit: Quantisierung kann Qualität kosten

Engine

Engine
TensorFold v0.5.0 (52 patches: DFlash2+copy drafts, 4-bit dense, FP8 KV, RoCE one-shot all-gather, shared KV pool, vision, tool calling)
Quantisierung
EXL3/TR3 4bpw routed experts + 4-bit dense, BF16 elsewhere, FP8 KV
Modellfamilie
GLM-5.3-Flash
Kontext
1.048.576
Parameter
320B MoE / 18B active
Kreator
MiaAI-Lab
GitHub-Sterne
21
Repo-Stand
30. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)60,4 tok/sProsa, 1 Request, GPU-Clocks 2200 MHz, sparkDash via OpenAI-API; TTFT 170 ms Quelle 

Decode · parallele Anfragen

Summe über alle Streams ist markiert; pro Anfrage ist es entsprechend weniger.

  • 4 parallele Anfragen228 tok/sSpitze (Decode) · Strukturierte Ausgabe ×4 aggregiert (61,1 pro Request); Prosa ×4: 108,8 aggregiert Quelle 

Prefill je Kontext

  • 32K1.979 tok/s32.790-Token-Prompt (TTFT 16,57 s); 131k: 1.837,9; 262k: 1.641,7; 981k NiaH: 1.015, Needle gefunden Quelle 

Zeit bis zum ersten Token

Kürzer ist besser.

  • Prompt nicht angegeben170 msProsa bei 1 Request (strukturiert: 149 ms) Quelle 

Was brauche ich

Hardware
2 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
TensorFold v0.5.0 (52 patches: DFlash2+copy drafts, 4-bit dense, FP8 KV, RoCE one-shot all-gather, shared KV pool, vision, tool calling)
Kontext
1.048.576 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • ≤ 3 bit: Quantisierung kann Qualität kostenBei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.
  • Eigener Kernel nötig
  • vision
  • tool-calling
  • Nicht kommerziell
  • Lizenz ungeklärt

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.