Lokale KI · Rezept · 4× DGX Spark

DeepSeek-V4-Flash-0731 304.6B FP8 mit vLLM auf 4× DGX Spark

DeepSeek-V4-Flash-0731 304.6B FP8 mit vLLM auf 4× DGX Spark: 68,8 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von fujitsupolycom

68,8tok/sAlltag

1 Anfrage, realistischer Prompt, mit DSpark (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis34mit Denken

Engine

Engine
vLLM
Quantisierung
Stock-Checkpoint (FP8 block-quantisiert, fp8_ds_mla KV)
Modellfamilie
DeepSeek-V4-Flash-0731
Kontext
1.048.576
Parameter
304.6B MoE (Summe der Safetensors-Tensoren lt. HF-API; 296.4B INT8-Experten)
Kreator
fujitsupolycom
GitHub-Sterne
82
Repo-Stand
27. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)68,8 tok/sKontext 16K decode · Mittel aus 5 Beobachtungen (±20.05); unique cold prompts, temp 1.0; Workload-Klasse in der Quelle nicht klassifiziert Quelle 
  • Spitze (Decode)106 tok/sKontext 2K decode · Mittel aus 5 Beobachtungen (±25.67) Quelle 

Prefill je Kontext

  • 16K2.488 tok/sMittel aus 3 Beobachtungen, TTFT 6.586 s Quelle 

Was brauche ich

Hardware
4 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
1.048.576 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.