1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
Lokale KI · Rezept · 4× DGX Spark
Qwen3.8-2.4T-A95B UD-Q1_0 mit llama.cpp auf 4× DGX Spark
Qwen3.8-2.4T-A95B UD-Q1_0 mit llama.cpp auf 4× DGX Spark: 7,76 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).
von Weschera
≤ 3 bit: Quantisierung kann Qualität kosten
Engine
- Engine
- llama.cpp
- Quantisierung
- Unsloth UD-Q1_0 GGUF (1-bit dynamic, 397,256,393,248 bytes, 10 Shards); MODEL_SHA256SUMS im Repo
- Modellfamilie
- Qwen3.8-2.4T-A95B
- Kontext
- 65.536
- Parameter
- 2.4T total / 95B aktiv (Modellname/README)
- Kreator
- Weschera
- GitHub-Sterne
- 0
- Repo-Stand
- 13. Aug. 2026
Messwerte
Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.
Decode · 1 Anfrage
Was brauche ich
- Hardware
- 4 × NVIDIA DGX Spark (GB10)
- Gewichte
- Hauptgewichtunsloth/Qwen3.8-2.4T-A95B-GGUF other
- Engine
- llama.cpp
- Kontext
- 65.536 Token
Hinweise
Was vor dem Nachbauen wichtig ist.
- ≤ 3 bit: Quantisierung kann Qualität kostenBei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.
- Experimentell
- Lizenz ungeklärt
Quellen
Verwandte Rezepte
1 Anfrage, realistischer Prompt, mit DSpark (laut Rezept) Quelle
- Eigener Kernel nötig
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit DSpark Quelle
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
- Eigener Kernel nötig
1 Anfrage, Prosa-Prompt, mit DFlash2 (laut Rezept) Quelle
- Eigener Kernel nötig
- Nicht kommerziell
Lokale KI im eigenen Unternehmen?
Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.