Lokale KI · Rezept · 1× DGX Spark

Qwen3.8-Flash-Next NVFP4 mit vLLM auf 1× DGX Spark

Qwen3.8-Flash-Next NVFP4 mit vLLM auf 1× DGX Spark: 82 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von myllmbox

82tok/sSpitze

1 Anfrage, Code-Prompt

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis40mit Denken

Engine

Engine
vLLM
Quantisierung
hibrid48: kalibrierter Body mit NVFP4-Output-Head (0.33 GiB), bf16-KV (27G-Pin), NVFP4-n-gram-Tabelle, Marlin MoE
Modellfamilie
Qwen3.8-Flash-Next
Kontext
262.144
Kreator
myllmbox
GitHub-Sterne
79
Repo-Stand
26. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Spitze (Decode)82 tok/sSingle-stream-Peak aus einem vollständigen Thinking-on-Request (Code-Phase); Average desselben Requests 57 Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
262.144 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • Eigener Kernel nötig
  • Lizenz ungeklärt

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.