1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
Lokale KI · Rezept · 3× DGX Spark
DeepSeek-V4.1-Flash 763B EXL3 3.5 bpw mit vLLM auf 3× DGX Spark
DeepSeek-V4.1-Flash 763B EXL3 3.5 bpw mit vLLM auf 3× DGX Spark: 46 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).
von tonyd2wild
Engine
- Engine
- vLLM
- Quantisierung
- EXL3 3.5 bpw routed experts (Pollard) + FP8 Rest
- Modellfamilie
- DeepSeek-V4.1-Flash
- Kontext
- 300.000
- Parameter
- ~763B MoE
- Kreator
- tonyd2wild
- GitHub-Sterne
- 86
- Repo-Stand
- 19. Sept. 2026
Messwerte
Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.
Decode · 1 Anfrage
Prefill je Kontext
Was brauche ich
- Hardware
- 3 × NVIDIA DGX Spark (GB10)
- Gewichte
- Hauptgewichtbot-lab-21/DeepSeek-V4.1-Flash-EXL3-3.5bpw-Pollard MIT
- Basisdeepseek-ai/DeepSeek-V4.1-Flash MIT
- Engine
- vLLM
- Kontext
- 300.000 Token
Hinweise
Was vor dem Nachbauen wichtig ist.
- Experimentell
- Eigener Kernel nötig
Quellen
Verwandte Rezepte
1 Anfrage, Prosa-Prompt, Kontext 32788, mit DSPARK Quelle
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit MTP/EAGLE (spekulativ, ~59 ms/step) (laut Rezept) Quelle
- Eigener Kernel nötig
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
- ≤ 3 bit: Quantisierung kann Qualität kosten
- Experimentell
- Eigener Kernel nötig
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
- ≤ 3 bit: Quantisierung kann Qualität kosten
- Eigener Kernel nötig
Lokale KI im eigenen Unternehmen?
Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.