Lokale KI · Rezept · 3× DGX Spark

DeepSeek-V4.1-Flash 763B EXL3 3.5 bpw mit vLLM auf 3× DGX Spark

DeepSeek-V4.1-Flash 763B EXL3 3.5 bpw mit vLLM auf 3× DGX Spark: 46 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von tonyd2wild

46tok/sGemischt

1 Anfrage, gemischtes Prompt-Set, mit DSpark (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis40mit Denkenohne Denken 25

Engine

Engine
vLLM
Quantisierung
EXL3 3.5 bpw routed experts (Pollard) + FP8 Rest
Modellfamilie
DeepSeek-V4.1-Flash
Kontext
300.000
Parameter
~763B MoE
Kreator
tonyd2wild
GitHub-Sterne
86
Repo-Stand
19. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Gemischt (Decode)46 tok/sC1 aggregate über 8 Kategorien (Counting ausgenommen); per-stream Mittel 51.46 Quelle 
  • Spitze (Decode)70,1 tok/sKategorie coding, exl3tp3a11 Quelle 

Prefill je Kontext

  • 93.3351.199 tok/sCold, unique prefix, TTFT 77.865 s Quelle 

Was brauche ich

Hardware
3 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
300.000 Token

Verwandte Rezepte

2× DGX Spark
42,6tok/sAlltag

1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle 

Intelligenz40mit Denkenohne Denken 25Wert des Originalmodells. Stark komprimiert (~2 Bit), Intelligenz dürfte deutlich niedriger liegen.
  • ≤ 3 bit: Quantisierung kann Qualität kosten
  • Experimentell
  • Eigener Kernel nötig

EXL3 2.0 bpw MCG (routed experts, tail-biting Viterbi re-encoded, scale refit), lm_head MXFP8, KV fp8 (8-GiB-Pin), DSpark-3vLLMGewichte Repo Stand 27. Sept. 2026

Details

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.