1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
Lokale KI · Rezept · 4× DGX Spark
DeepSeek-V4-Flash-0731 304.6B FP8 mit vLLM auf 4× DGX Spark
DeepSeek-V4-Flash-0731 304.6B FP8 mit vLLM auf 4× DGX Spark: 68,8 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).
von fujitsupolycom
Engine
- Engine
- vLLM
- Quantisierung
- Stock-Checkpoint (FP8 block-quantisiert, fp8_ds_mla KV)
- Modellfamilie
- DeepSeek-V4-Flash-0731
- Kontext
- 1.048.576
- Parameter
- 304.6B MoE (Summe der Safetensors-Tensoren lt. HF-API; 296.4B INT8-Experten)
- Kreator
- fujitsupolycom
- GitHub-Sterne
- 82
- Repo-Stand
- 27. Sept. 2026
Messwerte
Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.
Decode · 1 Anfrage
Prefill je Kontext
Was brauche ich
- Hardware
- 4 × NVIDIA DGX Spark (GB10)
- Gewichte
- Hauptgewichtdeepseek-ai/DeepSeek-V4-Flash-0731 MIT
- Engine
- vLLM
- Kontext
- 1.048.576 Token
Hinweise
Was vor dem Nachbauen wichtig ist.
- Eigener Kernel nötig
Quellen
Verwandte Rezepte
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit DSpark Quelle
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
- Eigener Kernel nötig
1 Anfrage, Prosa-Prompt, mit DFlash2 (laut Rezept) Quelle
- Eigener Kernel nötig
- Nicht kommerziell
1 Anfrage, realistischer Prompt, mit Qwen MTP3 probabilistic mit standard rejection (laut Rezept) Quelle
- Eigener Kernel nötig
Lokale KI im eigenen Unternehmen?
Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.