Lokale KI · Rezept · 2× DGX Spark

Qwen3.8-Flash-Next NVFP4 mit vLLM auf 2× DGX Spark (Vision)

Qwen3.8-Flash-Next NVFP4 mit vLLM auf 2× DGX Spark (Vision): 43,2 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von sfxnz

43,2tok/sAlltag

1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis40mit Denken

Engine

Engine
vLLM
Quantisierung
ModelOpt NVFP4 W4A4 routed experts, PLE-n-gram-Tabelle per-Tensor FP8, MTP-Experten FP8_BLOCK_SCALES (gs 128), KV auto, Marlin/FlashInfer via moe-backend auto
Modellfamilie
Qwen3.8-Flash-Next
Kontext
262.144
Parameter
HF-API safetensors total 119,602,003,859
Kreator
sfxnz
GitHub-Sterne
0
Repo-Stand
15. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)43,2 tok/sBench_decode.py, streamed greedy, thinking off, 200 Completion-Tokens, 3-run-Median; evidence opt-c4-native-ctx-262144: 43.16; TTFT p50 0.17 s Quelle 
  • Spitze (Decode)55,5 tok/sStructured (Count 1→200); evidence: 55.47; TTFT p50 0.15 s Quelle 

Was brauche ich

Hardware
2 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
vLLM
Kontext
262.144 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.