Lokale KI · Rezept · 1× Mac

Qwen3.8-27B mit MLX auf 1× Mac

Qwen3.8-27B mit MLX auf 1× Mac: 53,3 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

53,3tok/sAlltag

1 Anfrage, Prosa-Prompt, mit MTP (nativ) (laut Rezept)

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
oMLX 0.6.3rc2
Quantisierung
oQ4e (4-bit affine g64, 166 sens. Tensoren 5-bit; Stock-Qwen3.8-27B-Konversion)
Modellfamilie
Qwen3.8-27B
Kontext
262.144
Parameter
27B (dicht, lt. Modellname)
Kreator
Weschera
GitHub-Sterne
64
Repo-Stand
21. Aug. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)53,3 tok/sMittel aus 3 Reps, temp 0, thinking off, 320 gen. Tokens, ~2,1–2,4K-Token-Prompts; +11 % vs. 48.0 (oMLX 0.6.1) Quelle 
  • Spitze (Decode)72,1 tok/sMTP-Acceptance Code 99,6 % (tok/cycle 3.76); Prose-Acceptance 78 % Quelle 

Prefill je Kontext

  • 4K274 tok/sANE-Prefill (vorher ~83); raw JSON ane-mtp3-results.json im Repo Quelle 

Was brauche ich

Hardware
1 × Mac / Apple Silicon
Gewichte
Engine
oMLX 0.6.3rc2
Kontext
262.144 Token

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.