Lokale KI · Rezept · 1× Mac

Bonsai-2-27B Q8_0 mit llama.cpp auf 1× Mac

Bonsai-2-27B Q8_0 mit llama.cpp auf 1× Mac: 10,6 tok/s laut github.com (Datensatz-Stand: 29. Sept. 2026).

von Weschera

10,6tok/sAlltag

1 Anfrage, Prosa-Prompt, ohne Spekulation

Quelle: github.com
Intelligenz (Originalmodell) · Artificial Analysiskein unabhängiger Wert

Engine

Engine
llama.cpp (prism fork)
Quantisierung
Ternary PQ2_0 (empfohlen) / PTQ1_0 (5,9 GB); mmproj-Q8_0 für Vision
Modellfamilie
Bonsai-2-27B (Qwen3.8-27B-Basis)
Kontext
131.072
Parameter
27B ternär 1.72 bits/weight (README); PQ2_0 7,2 GB
Kreator
Weschera
GitHub-Sterne
0
Repo-Stand
18. Sept. 2026

Messwerte

Alle belegten Werte dieses Rezepts, je mit Bedingung und Quelle. Balken im Verhältnis zum größten Wert der Gruppe.

Decode · 1 Anfrage

  • Alltag (Decode)10,6 tok/sMac mini M4 24 GB, PQ2_0 — 3-Rep-Ladder WÄHREND parallel laufendem Spark-Bench (GPU-Contention); idle-Qualifizierung 11.0 → approx; TTFTs dieser Ladder sind Queueing-Artifacts Quelle 
  • Spitze (Decode)34,5 tok/sPQ2_0 Studio; 3 Reps Mittel, temp 0, thinking off, 320 tokens, ~2,1–2,4K prompts (bench-chat.py); flat prose=code → kein Spec-Decoding, rein bandgebunden Quelle 

Prefill je Kontext

  • Prompt nicht angegeben242 tok/sPQ2_0 Studio (PTQ1_0: 205); Ternary-Unpacking macht Prefill langsamer als 4-bit-affin (242 vs 274) Quelle 

Was brauche ich

Hardware
1 × Mac / Apple Silicon
Gewichte
Engine
llama.cpp (prism fork)
Kontext
131.072 Token

Hinweise

Was vor dem Nachbauen wichtig ist.

  • Eigener Kernel nötig

Quellen

Verwandte Rezepte

1× Mac
6,14tok/sGemischt

1 Anfrage, gemischtes Prompt-Set, Kontext 1k, ohne Spekulation Quelle 

Intelligenz45mit DenkenWert des Originalmodells. Stark komprimiert (~2,1 Bit), Intelligenz dürfte deutlich niedriger liegen.
  • ≤ 3 bit: Quantisierung kann Qualität kosten
  • Streamt von SSD
  • Lizenz ungeklärt

UD-IQ2_XXS routed, blk78 Q2K, 196.58 GiBDwarfStar (ds4) main@0aaea5a (2026-09-20)Gewichte Repo Stand 25. Sept. 2026

Details

← Zur Übersicht

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.