Lokale KI · Rezept · 1× DGX Spark

Qwen3.6-35B NVFP4 mit SGLang auf 1× DGX Spark

Qwen3.6-35B NVFP4 mit SGLang auf 1× DGX Spark: 92,2 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

92,2tok/sSpitze

1 Anfrage, Bestwert der Quelle, Kontext 64k

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
SGLang
Quantisierung
NVFP4 (qwen36-35b-nvfp4 Checkpoint)
Modellfamilie
Qwen3.6-35B
Kontext
262.144
Kreator
Weschera
GitHub-Sterne
1
Repo-Stand
12. Juli 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Spitze (Decode)92,2 tok/sKontext 64K · Single stream (cache-off); vLLM 93.7 — innerhalb noise; 256k: 65.4/70.9 Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
SGLang
Kontext
262.144 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.