Lokale KI · Rezept · 4× DGX Spark

Qwen3.8-Flash-Next 125B NVFP4 mit vLLM auf 4× DGX Spark

Qwen3.8-Flash-Next 125B NVFP4 mit vLLM auf 4× DGX Spark: 40,5 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von tonyd2wild

40,5tok/sGemischt

1 Anfrage, gemischtes Prompt-Set, mit MTP (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis40mit Denken

Engine

Engine
vLLM nightly 8a728663 + PLE-mmap-Patch
Quantisierung
NVFP4 (nvidia), FP8 KV
Modellfamilie
Qwen3.8-Flash-Next
Kontext
262.144
Parameter
125B-A6B
Kreator
tonyd2wild
GitHub-Sterne
125
Repo-Stand
7. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Gemischt (Decode)40,5 tok/sSingle stream, median of 40 prompts; TTFT 220 ms Quelle 
  • Spitze (Decode)40,5 tok/sSingle stream, median of 40 prompts; TTFT 220 ms Quelle 

Prefill je Kontext

Was brauche ich

Hardware
4 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
vLLM nightly 8a728663 + PLE-mmap-Patch
Kontext
262.144 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • Eigener Kernel nötig
  • Lizenz ungeklärt

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.