Lokale KI · Rezept · 1× Mac

Qwen3.8-Flash-Next 125B mit MLX auf 1× Mac

Qwen3.8-Flash-Next 125B mit MLX auf 1× Mac: 83,1 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

83,1tok/sSpitze

1 Anfrage, Code-Prompt

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
oMLX 0.6.4 (custom kernels)
Quantisierung
oQ4e gemischt (4-bit gesamt, group 64, MLX safetensors)
Modellfamilie
Qwen3.8-Flash-Next
Kontext
—
Parameter
125B MoE / 6B aktiv (+51B PLE, +4B MTP) lt. Schwester-Repo Qwen3.8-Flash-Next-1x-DGX-Spark; oMLX-Footprint ~103,94 GB
Kreator
Weschera
GitHub-Sterne
13
Repo-Stand
30. Aug. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Spitze (Decode)83,1 tok/sKontext 5,999-token-Sequenz · 1.200-Zeilen-Sequenz, MTP6 + aggressive Burst; byte-identisch validiert; frischer Zustand ( kontrollierte Messung, kein Dauerzustand) Quelle 

Prefill je Kontext

  • 15,416-token-Prompt215 tok/s215–220 prompt tok/s in Wiederholungsmessungen (Bereich); TTFT 70–72 s; balanced prefill nötig, damit der 15,416-token-Prompt admitted wird → approx Quelle 

Was brauche ich

Hardware
1 × Mac / Apple Silicon
Gewichte
Engine
oMLX 0.6.4 (custom kernels)

Verwandte Rezepte

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.