Lokale KI · Rezept · 4× DGX Spark

Qwen3.8-2.4T-A95B UD-Q1_0 mit llama.cpp auf 4× DGX Spark

Qwen3.8-2.4T-A95B UD-Q1_0 mit llama.cpp auf 4× DGX Spark: 7,76 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

7,76tok/sSpitze

1 Anfrage, Bestwert der Quelle, Prompt 121 Token

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

≤ 3 bit: Quantisierung kann Qualität kosten

Engine

Engine
llama.cpp
Quantisierung
Unsloth UD-Q1_0 GGUF (1-bit dynamic, 397,256,393,248 bytes, 10 Shards); MODEL_SHA256SUMS im Repo
Modellfamilie
Qwen3.8-2.4T-A95B
Kontext
65.536
Parameter
2.4T total / 95B aktiv (Modellname/README)
Kreator
Weschera
GitHub-Sterne
0
Repo-Stand
13. Aug. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Spitze (Decode)7,76 tok/sKontext 121-token prompt · Qualified pagoda run 2026-08-12: 53,448 Completion-Tokens in 6,883.90 s, natural stop; API-Completion-Throughput genau dieses Long-Runs; first token 5.78 s; 64.87 % MTP-Acceptance Quelle 

Was brauche ich

Hardware
4 × NVIDIA DGX Spark (GB10)
Gewichte
Engine
llama.cpp
Kontext
65.536 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • ≤ 3 bit: Quantisierung kann Qualität kostenBei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.
  • Experimentell
  • Lizenz ungeklärt

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.