Lokale KI · Rezept · 1× RTX PRO 6000

MiMo-V2.6-Flash EXL3 2.20 bpw mit ExLlamaV3 auf 1× RTX PRO 6000

von vcruz305

184tok/sSpitze

1 Anfrage, Bestwert der Quelle, Kontext 64k

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

≤ 3 bit: Quantisierung kann Qualität kosten

Engine

Engine
ExLlamaV3 (native /v1 server) v1.5.1.post1 (Fork)
Quantisierung
EXL3 2.20bpw (86.94 GB)
Modellfamilie
MiMo-V2.6-Flash
Kontext
65.536
Parameter
48 Layer, 256 routed Experten top-8
Kreator
vcruz305
GitHub-Sterne
0
Repo-Stand
25. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Für dieses Rezept sind keine Messwerte mit Quelle belegt.

Was brauche ich

Hardware
1 × NVIDIA RTX PRO 6000 Blackwell
Engine
ExLlamaV3 (native /v1 server) v1.5.1.post1 (Fork)
Kontext
65.536 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • ≤ 3 bit: Quantisierung kann Qualität kostenBei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.
  • Eigener Kernel nötig

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.