Lokale KI · Rezept · 2× DGX Spark

DeepSeek-V4-Flash NVFP4 mit vLLM auf 2× DGX Spark

DeepSeek-V4-Flash NVFP4 mit vLLM auf 2× DGX Spark: 65,4 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

65,4tok/sSpitze

1 Anfrage, Bestwert der Quelle

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
NVFP4-KV-Pfad (Stage C: 584-byte padded envelope via nvfp4_ds_mla; NICHT der 416-byte true-layout Fix — dokumentiert gescheitert >411 prompt tokens)
Modellfamilie
DeepSeek-V4-Flash
Kontext
1.048.576
Kreator
Weschera
GitHub-Sterne
8
Repo-Stand
2. Juli 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Spitze (Decode)65,4 tok/sP256/g256, bester 1M-Profil-Wert; acceptance 0.718, accepted/draft 3.59; TTFC 0.324 s; >50 tok/s in allen 5 Probes Quelle 

Was brauche ich

Hardware
2 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
1.048.576 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.