Lokale KI · Rezept · 2× DGX Spark

Qwen3.8-Flash-Next NVFP4 mit SGLang auf 2× DGX Spark

Qwen3.8-Flash-Next NVFP4 mit SGLang auf 2× DGX Spark: 41,7 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

41,7tok/sGemischt

1 Anfrage, gemischtes Prompt-Set, mit NEXTN (MTP) (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
SGLang
Quantisierung
NVFP4 (modelopt_fp4, RadixArk-Checkpoint); BF16 SSM; NEXTN-Draft in-checkpoint
Modellfamilie
Qwen3.8-Flash-Next
Kontext
262.144
Kreator
Weschera
GitHub-Sterne
1
Repo-Stand
27. Aug. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Gemischt (Decode)41,7 tok/sV2-Recipe (SM121-Gate-Bypass + Dispatch-Kernel), temp 0, 3-Run-Median; gemessen bei mem-fraction 0.70 — nach Korrektur auf 0.80 wahrscheinlich konservativ Quelle 
  • Spitze (Decode)49,8 tok/sThinking, 6000-token-Generierungen (49.8–50.5 im Text); faster als non-thinking Quelle 

Was brauche ich

Hardware
2 × NVIDIA DGX Spark (GB10)
Engine
SGLang
Kontext
262.144 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • Eigener Kernel nötig
  • Lizenz ungeklärt

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.