Lokale KI · Rezept · 2× DGX Spark

Qwen3.8-Flash-Next NVFP4 mit vLLM auf 2× DGX Spark (Weschera)

Qwen3.8-Flash-Next NVFP4 mit vLLM auf 2× DGX Spark (Weschera): 33 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

33tok/sAlltag

1 Anfrage, Prosa-Prompt, mit MTP

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
NVFP4 (ModelOpt MIXED_PRECISION: NVFP4 Experts, FP8 dense/PLE/MTP); BF16 KV (Pflicht — QSA lehnt fp8-KV ab)
Modellfamilie
Qwen3.8-Flash-Next
Kontext
131.072
Kreator
Weschera
GitHub-Sterne
0
Repo-Stand
5. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)33 tok/sREADME '~33 tok/s (MTP-3)' → approx (~-Marker) Quelle 
  • Spitze (Decode)58 tok/sStructured JSON '~58 tok/s' → approx Quelle 

Was brauche ich

Hardware
2 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
vLLM
Kontext
131.072 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.