Lokale KI · Rezept · 2× DGX Spark

MiMo-V2.6-Flash-RL 309B-A15B mit vLLM auf 2× DGX Spark

MiMo-V2.6-Flash-RL 309B-A15B mit vLLM auf 2× DGX Spark: 38 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von myllmbox

38tok/sSpitze

1 Anfrage, Code-Prompt

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
vLLM
Quantisierung
Offizieller Checkpoint wie veröffentlicht (bf16); KV bf16 19G/Box-Pin; Marlin MoE
Modellfamilie
MiMo-V2.6-Flash-RL
Kontext
300.000
Parameter
309B MoE / 15B active (README); HF-API safetensors total 310,756,322,688
Kreator
myllmbox
GitHub-Sterne
1
Repo-Stand
27. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Spitze (Decode)38 tok/sLadder 'Thinking off, code prompt', Steady-state-Average (6 Läufe); Peak 40 Quelle 

Prefill je Kontext

Was brauche ich

Hardware
2 × NVIDIA DGX Spark (GB10)
Engine
vLLM
Kontext
300.000 Token

Verwandte Rezepte

2× DGX Spark
42,6tok/sAlltag

1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle 

Intelligenz40mit Denkenohne Denken 25Wert des Originalmodells. Stark komprimiert (~2 Bit), Intelligenz dürfte deutlich niedriger liegen.
  • ≤ 3 bit: Quantisierung kann Qualität kosten
  • Experimentell
  • Eigener Kernel nötig

EXL3 2.0 bpw MCG (routed experts, tail-biting Viterbi re-encoded, scale refit), lm_head MXFP8, KV fp8 (8-GiB-Pin), DSpark-3vLLMGewichte Repo Stand 27. Sept. 2026

Details
2× DGX Spark
97,6tok/sAlltag

HumanEval 97,6 % / GSM8K 98,0 % mit FP8-KV und 4-bit dense Quelle 

Intelligenz42mit Denken
  • ≤ 3 bit: Quantisierung kann Qualität kosten
  • Eigener Kernel nötig
  • Nicht kommerziell
  • Lizenz ungeklärt

EXL3/TR3 4bpw routed experts + 4-bit dense, BF16 elsewhere, FP8 KVTensorFold v0.5.0 (52 patches: DFlash2+copy drafts, 4-bit dense, FP8 KV, RoCE one-shot all-gather, shared KV pool, vision, tool calling)Gewichte Repo Stand 30. Sept. 2026

Details

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.