Lokale KI · Rezept · 1× DGX Spark

Qwen3.8-Flash-Next 125B UD-Q4_K_XL mit llama.cpp auf 1× DGX Spark

Qwen3.8-Flash-Next 125B UD-Q4_K_XL mit llama.cpp auf 1× DGX Spark: 24,2 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

24,2tok/sAlltag

1 Anfrage, Prosa-Prompt, mit Draft

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
llama.cpp
Quantisierung
Unsloth UD-Q4_K_XL GGUF (103,7 GiB, 4 Shards; PLE ≥4-bit) + MTP-Draft shared-Q8_0 (2,6 GiB)
Modellfamilie
Qwen3.8-Flash-Next
Kontext
262.144
Parameter
125B MoE, 6B aktiv, +51B n-gram-Embedding, +4B MTP (README)
Kreator
Weschera
GitHub-Sterne
8
Repo-Stand
2. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)24,2 tok/sDraft-N 4, Acceptance 38 % — MTP bricht auf Prose gerade mal eben (n=8: 14.6, schlechter als off) Quelle 
  • Spitze (Decode)47,1 tok/sDraft-N 4 (empfohlen), Acceptance 90 %; server-side timings.predicted_per_second, temp 0, fixed seed; Sweep n=5: 48.3 (88 %) Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Engine
llama.cpp
Kontext
262.144 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.