Lokale KI · Rezept · 1× DGX Spark

GLM-5.3-Flash 320B UD-IQ3_XXS mit llama.cpp auf 1× DGX Spark

GLM-5.3-Flash 320B UD-IQ3_XXS mit llama.cpp auf 1× DGX Spark: 20,8 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

20,8tok/sGemischt

1 Anfrage, gemischtes Prompt-Set, mit MTP

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

≤ 3 bit: Quantisierung kann Qualität kosten

Engine

Engine
llama.cpp
Quantisierung
Unsloth Dynamic UD-IQ3_XXS GGUF (120,4 GB, 4 Shards); KV q8_0
Modellfamilie
GLM-5.3-Flash
Kontext
65.536
Parameter
320B / A18B MoE (README)
Kreator
Weschera
GitHub-Sterne
5
Repo-Stand
4. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Gemischt (Decode)20,8 tok/sMedian p10–p90 11.6–25.1, 50 Requests / 26K Tokens, thinking OFF, aus der Benchmark-Run; MTP n=2 Quelle 
  • Spitze (Decode)20,8 tok/sMedian p10–p90 11.6–25.1, 50 Requests / 26K Tokens, thinking OFF, aus der Benchmark-Run; MTP n=2 Quelle 

Prefill je Kontext

  • 7K270 tok/s6.981-token-Prompt in 26 s, README '~270 tok/s' → approx Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Engine
llama.cpp
Kontext
65.536 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • ≤ 3 bit: Quantisierung kann Qualität kostenBei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.

Quellen

Verwandte Rezepte

2× DGX Spark
97,6tok/sAlltag

HumanEval 97,6 % / GSM8K 98,0 % mit FP8-KV und 4-bit dense Quelle 

Intelligenz42mit Denken
  • ≤ 3 bit: Quantisierung kann Qualität kosten
  • Eigener Kernel nötig
  • Nicht kommerziell
  • Lizenz ungeklärt

EXL3/TR3 4bpw routed experts + 4-bit dense, BF16 elsewhere, FP8 KVTensorFold v0.5.0 (52 patches: DFlash2+copy drafts, 4-bit dense, FP8 KV, RoCE one-shot all-gather, shared KV pool, vision, tool calling)Gewichte Repo Stand 30. Sept. 2026

Details

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.