1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
Lokale KI · Rezept · 2× DGX Spark
DeepSeek-V4.1-Flash EXL3 2.0 bpw mit vLLM auf 2× DGX Spark
DeepSeek-V4.1-Flash EXL3 2.0 bpw mit vLLM auf 2× DGX Spark: 42,6 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).
von sfxnz
≤ 3 bit: Quantisierung kann Qualität kosten
Engine
- Engine
- vLLM
- Quantisierung
- EXL3 2.0 bpw MCG (routed experts, tail-biting Viterbi re-encoded, scale refit), lm_head MXFP8, KV fp8 (8-GiB-Pin), DSpark-3
- Modellfamilie
- DeepSeek-V4.1-Flash
- Kontext
- 1.048.576
- Parameter
- Basis deepseek-ai/DeepSeek-V4.1-Flash: 763,205,315,794 Parameter (HF-API safetensors total); EXL3-2.0bpw-Pack ~334 GB auf der Platte
- Kreator
- sfxnz
- GitHub-Sterne
- 23
- Repo-Stand
- 27. Sept. 2026
Messwerte
Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.
Decode · 1 Anfrage
Prefill je Kontext
Was brauche ich
- Hardware
- 2 × NVIDIA DGX Spark (GB10)
- Gewichte
- Hauptgewichtsfxnz/DeepSeek-V4.1-Flash-EXL3 MIT
- Basisdeepseek-ai/DeepSeek-V4.1-Flash MIT
- Engine
- vLLM
- Kontext
- 1.048.576 Token
Hinweise
Was vor dem Nachbauen wichtig ist.
- ≤ 3 bit: Quantisierung kann Qualität kostenBei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.
- Experimentell
- Eigener Kernel nötig
Quellen
Verwandte Rezepte
1 Anfrage, Prosa-Prompt, Kontext 32788, mit DSPARK Quelle
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit MTP/EAGLE (spekulativ, ~59 ms/step) (laut Rezept) Quelle
- Eigener Kernel nötig
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
- ≤ 3 bit: Quantisierung kann Qualität kosten
- Eigener Kernel nötig
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
- ≤ 3 bit: Quantisierung kann Qualität kosten
- Experimentell
- Eigener Kernel nötig
Lokale KI im eigenen Unternehmen?
Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.