Lokale KI · Rezept · 2× DGX Spark

DeepSeek-V4.1-Flash EXL3 2.0 bpw mit vLLM auf 2× DGX Spark

DeepSeek-V4.1-Flash EXL3 2.0 bpw mit vLLM auf 2× DGX Spark: 42,6 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von sfxnz

42,6tok/sAlltag

1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis40mit Denkenohne Denken 25Wert des Originalmodells. Stark komprimiert (~2 Bit), Intelligenz dürfte deutlich niedriger liegen.

≤ 3 bit: Quantisierung kann Qualität kosten

Engine

Engine
vLLM
Quantisierung
EXL3 2.0 bpw MCG (routed experts, tail-biting Viterbi re-encoded, scale refit), lm_head MXFP8, KV fp8 (8-GiB-Pin), DSpark-3
Modellfamilie
DeepSeek-V4.1-Flash
Kontext
1.048.576
Parameter
Basis deepseek-ai/DeepSeek-V4.1-Flash: 763,205,315,794 Parameter (HF-API safetensors total); EXL3-2.0bpw-Pack ~334 GB auf der Platte
Kreator
sfxnz
GitHub-Sterne
23
Repo-Stand
27. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)42,6 tok/sKontext 512-token prose · L.A.I.L-Zelle (tools/measure_lail_prose.py), n=20 gepoolt über 2 Boots (V-1/V-2), Round 36; ms/step 48.78; +85 % vs. published 23 Quelle 
  • Spitze (Decode)84,2 tok/sBench_decode.py 'structured' (Count 1→200), Median; Round 36 arm_median 84.279 Quelle 

Prefill je Kontext

  • 8K838 tok/sRound 34 (Review-Kampagne, Engram WILLNEED read-ahead); s13-Boot Quelle 

Was brauche ich

Hardware
2 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
1.048.576 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • ≤ 3 bit: Quantisierung kann Qualität kostenBei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.
  • Experimentell
  • Eigener Kernel nötig

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.