Lokale KI · Rezept · 1× DGX Spark

Qwen3.8-27B NVFP4 mit SGLang auf 1× DGX Spark (Weschera)

Qwen3.8-27B NVFP4 mit SGLang auf 1× DGX Spark (Weschera): 25,2 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

25,2tok/sGemischt

1 Anfrage, gemischtes Prompt-Set, mit DFlash2 (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
SGLang
Quantisierung
NVFP4 (RadixArk) + BF16-Draft; quantized lm_head-Adapter (TP=1, 256-token selector chunks, FP32 top-k — r0b0tlab-Ansatz)
Modellfamilie
Qwen3.8-27B
Kontext
262.144
Parameter
27B (dicht, hybrid Gated-DeltaNet VLM lt. Schwester-Repo)
Kreator
Weschera
GitHub-Sterne
29
Repo-Stand
21. Aug. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Gemischt (Decode)25,2 tok/sKontext 1024 in / 256 out · Ladder C1, Median aus 3 Quelle 
  • Spitze (Decode)42 tok/sKontext 512 in / 2048 out · Dedicated C1, Median aus 5 Runs, gate-qualified boot (Boot-Lottery-Gate MIN_TPS=39); synthetic random tokens ~ worst case für den Drafter; Block-8-Vorgänger 34.08, r0b0tlab 28.38 Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
SGLang
Kontext
262.144 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • Eigener Kernel nötig

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.