Lokale KI · Rezept · 4× DGX Spark

DeepSeek-V4-Flash 291B FP8 mit vLLM auf 4× DGX Spark

DeepSeek-V4-Flash 291B FP8 mit vLLM auf 4× DGX Spark: 46 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von tonyd2wild

46tok/sAlltag

1 Anfrage, Prosa-Prompt, mit DSpark

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
FP8
Modellfamilie
DeepSeek-V4-Flash
Kontext
—
Parameter
~291B
Kreator
tonyd2wild
GitHub-Sterne
7
Repo-Stand
2. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)46 tok/sPrivater Produktions-Stack des Autors (DSpark-k=5-Drafter + fused-Markov-argmax), nicht der öffentliche MTP-k2-Launcher (README „That stack rides a private image“); non-streaming, temp 0, max_tokens 200, Nonce am Anfang jedes Requests; prose = realistischer Worst case (niedrigste Draft-Acceptance); TP2-Vergleich 42 -> 46 (+9 %) Quelle 
  • Spitze (Decode)120 tok/sPrivater Produktions-Stack des Autors (DSpark-k=5-Drafter + fused-Markov-argmax), nicht der öffentliche MTP-k2-Launcher (README „That stack rides a private image“); non-streaming, temp 0, max_tokens 200, Nonce am Anfang jedes Requests; Count-to-300-Headline-Stream peakte bei ~127 t/s Quelle 

Was brauche ich

Hardware
4 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
vLLM

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.