Lokale KI · Rezept · 1× DGX Spark

Qwen3.8-27B NVFP4 mit vLLM auf 1× DGX Spark (Weschera)

Qwen3.8-27B NVFP4 mit vLLM auf 1× DGX Spark (Weschera): 45 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

45tok/sAlltag

1 Anfrage, Prosa-Prompt, mit MTP

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
NVFP4 (unsloth; compressed-tensors) + fp8 KV + triton_attn (fp8-KV auf GB10 nur mit triton, FA kann kein fp8-KV auf sm_121)
Modellfamilie
Qwen3.8-27B
Kontext
262.144
Parameter
27B (dicht, hybrid Gated-DeltaNet VLM, 262K nativ, MTP-Head)
Kreator
Weschera
GitHub-Sterne
1
Repo-Stand
15. Aug. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)45 tok/sApple-Silicon-Lane: mlx-community 4-bit + MTP-4bit-Sidecar via mlx-vlm, M4 Max 128 GB, ~45 tok/s (55 % acceptance, temp 0.7, single session) → approx; plain MLX 29.5 Quelle 
  • Spitze (Decode)45 tok/sApple-Silicon-Lane: mlx-community 4-bit + MTP-4bit-Sidecar via mlx-vlm, M4 Max 128 GB, ~45 tok/s (55 % acceptance, temp 0.7, single session) → approx; plain MLX 29.5 Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
vLLM
Kontext
262.144 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.