Lokale KI · Rezept · 1× DGX Spark

Qwen3.8-Flash-Next 80B UD-IQ4_XS mit llama.cpp auf 1× DGX Spark

Qwen3.8-Flash-Next 80B UD-IQ4_XS mit llama.cpp auf 1× DGX Spark: 26,9 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

26,9tok/sGemischt

1 Anfrage, gemischtes Prompt-Set, ohne Spekulation

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
llama.cpp
Quantisierung
Unsloth UD-IQ4_XS GGUF (94 GB)
Modellfamilie
Qwen3.8-Flash-Next
Kontext
262.144
Parameter
80B-Klasse hybrid SSM + sparse-attention MoE (README; ohne Params-Auflösung)
Kreator
Weschera
GitHub-Sterne
9
Repo-Stand
27. Aug. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Gemischt (Decode)26,9 tok/s3-Run-Median, temp 0; 65K- und 262K-Config je 26.9 (262K: kurze Prompts) Quelle 
  • Spitze (Decode)26,9 tok/s3-Run-Median, temp 0; 65K- und 262K-Config je 26.9 (262K: kurze Prompts) Quelle 

Prefill je Kontext

  • 185K181 tok/s@185K-Prompt; 65K-Config ~193 tok/s (~-Marker) Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
llama.cpp
Kontext
262.144 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.