Lokale KI · Rezept · 3× DGX Spark

DeepSeek-V4-Flash 305B FP8 mit vLLM auf 3× DGX Spark

DeepSeek-V4-Flash 305B FP8 mit vLLM auf 3× DGX Spark: 41,9 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von MiaAI-Lab

41,9tok/sAlltag

1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM ghcr.io/anemll/dspark-vllm-gx10:0.1.1
Quantisierung
Original-Checkpoint (FP8/FP4) , TP3-Head-Pad 64→72
Modellfamilie
DeepSeek-V4-Flash
Kontext
1.048.576
Parameter
~305B MoE
Kreator
MiaAI-Lab
GitHub-Sterne
1.427
Repo-Stand
26. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)41,9 tok/sWarm, Prosa-Prompts, 512 Output-Tokens, TP=3 16 Slots, 2026-09-02 (TP=2: 38.6) Quelle 
  • Spitze (Decode)41,9 tok/sWarm, Prosa-Prompts, 512 Output-Tokens, TP=3 16 Slots, 2026-09-02 (TP=2: 38.6) Quelle 

Was brauche ich

Hardware
3 × NVIDIA DGX Spark (GB10)
Engine
vLLM ghcr.io/anemll/dspark-vllm-gx10:0.1.1
Kontext
1.048.576 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.