Lokale KI · Rezept · 4× DGX Spark

DeepSeek-V4-Flash 305B NVFP4 mit vLLM auf 4× DGX Spark

DeepSeek-V4-Flash 305B NVFP4 mit vLLM auf 4× DGX Spark: 42 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von tonyd2wild

42tok/sAlltag

1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
FP8/FP4 Original-Checkpoint + NVFP4 KV (nvfp4_ds_mla)
Modellfamilie
DeepSeek-V4-Flash
Kontext
1.048.576
Parameter
~305B MoE
Kreator
tonyd2wild
GitHub-Sterne
486
Repo-Stand
10. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)42 tok/sKontext kurz (5 Prosa-Prompts, 24–41 Prompt-Tokens) · C1 Median Kategorie prose, thinking off, 2026-09-02; CURRENT.md: „prose 42 tok/s“ Quelle 
  • Gemischt (Decode)74,2 tok/sKontext kurz, 40 Prompts / 8 Kategorien · C1 decode Median über alle 40 Prompts Quelle 
  • Spitze (Decode)98,3 tok/sKontext kurz (5 Coding-Prompts) · C1 Median Kategorie coding; CURRENT.md: „code 98 tok/s“ Quelle 

Prefill je Kontext

  • ~1.5K4.868 tok/sCold, c1 (README SGLang-Repo Z.68); CURRENT.md: „~4.6K tok/s, flat from 14K to 182K“ Quelle 

Was brauche ich

Hardware
4 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
1.048.576 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.