Lokale KI · Rezept · 1× DGX Spark

Spark-X2.5-4B BF16 mit SGLang auf 1× DGX Spark

Spark-X2.5-4B BF16 mit SGLang auf 1× DGX Spark: 21,8 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

21,8tok/sAlltag

1 Anfrage, Prosa-Prompt, ohne Spekulation

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
SGLang
Quantisierung
BF16 (unquantisiert)
Modellfamilie
Spark-X2.5-4B
Kontext
131.072
Parameter
4B (Modellname)
Kreator
Weschera
GitHub-Sterne
0
Repo-Stand
7. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)21,8 tok/sThinking-off short prose, 2 Runs: 21.77 / 21.89 (411 tokens in 18.99 s im einen) → Mittel als approx; pagoda whole-run 19.62 output tok/s über 58,330 tokens (49 min 33 s) Quelle 
  • Spitze (Decode)21,8 tok/sThinking-off short prose, 2 Runs: 21.77 / 21.89 (411 tokens in 18.99 s im einen) → Mittel als approx; pagoda whole-run 19.62 output tok/s über 58,330 tokens (49 min 33 s) Quelle 

Was brauche ich

Hardware
1 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
SGLang
Kontext
131.072 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.