Lokale KI · Rezept · 1× Mac

DeepSeek-V4-Flash 284B IQ2_XXS mit DwarfStar auf 1× Mac (Vision)

DeepSeek-V4-Flash 284B IQ2_XXS mit DwarfStar auf 1× Mac (Vision): 28,5 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

28,5tok/sAlltag

1 Anfrage, Prosa-Prompt, Kontext 32k, mit DSpark (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

≤ 3 bit: Quantisierung kann Qualität kosten

Engine

Engine
ds4 (DwarfStar)
Quantisierung
IQ2_XXS imatrix q2 (antirez), w2Q2K/AProjQ8/SExpQ8/OutQ8; GGUF 86,720,111,776 bytes
Modellfamilie
DeepSeek-V4-Flash
Kontext
1.048.576
Parameter
284B / 13B aktiv + ViT (lt. Schwester-vLLM-Repo sfxnz/Vision-Exp; hier nicht separat belegt)
Kreator
Weschera
GitHub-Sterne
2
Repo-Stand
2. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)28,5 tok/sKontext 32K · Thinking off, 404 tokens Quelle 
  • Spitze (Decode)31,7 tok/sKontext 32K · Thinking off, code prompt, 1,656 tokens; @1M ctx: 32.0 Quelle 

Was brauche ich

Hardware
1 × Mac / Apple Silicon
Engine
ds4 (DwarfStar)
Kontext
1.048.576 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • ≤ 3 bit: Quantisierung kann Qualität kostenBei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.

Quellen

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.