Lokale KI · Rezept · 4× DGX Spark

Qwen3.8-27B EXL3 mit vLLM auf 4× DGX Spark

Qwen3.8-27B EXL3 mit vLLM auf 4× DGX Spark: 35,1 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von fujitsupolycom

35,1tok/sAlltag

1 Anfrage, realistischer Prompt, mit Qwen MTP3 probabilistic mit standard rejection (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysis34mit Denkenohne Denken 20

Engine

Engine
vLLM
Quantisierung
EXL3 K5/K6 gemischt, 21.59 GB (hf hydrated); FP8 KV (kv_cache_dtype fp8); EXL3-Prefill FP8, Tile 256
Modellfamilie
Qwen3.8-27B
Kontext
1.048.576
Parameter
27.8B dense (Qwen/Qwen3.8-27B, HF-API)
Kreator
fujitsupolycom
GitHub-Sterne
82
Repo-Stand
27. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)35,1 tok/sKontext 16K decode · N=5 Mittel; unique cold prompts, temp 1.0, top-p 0.95/top-k 20 aus der generation_config der Quelle; Workload-Typ in der Quelle nicht klassifiziert Quelle 
  • Spitze (Decode)48,5 tok/sCoding Peak, 15/15 requests, Mittel (Median 47.89, Range 44.57–52.13) Quelle 

Prefill je Kontext

Was brauche ich

Hardware
4 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
vLLM
Kontext
1.048.576 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.