Local AI

tok/s ist nicht tok/s — Local-LLM-Benchmarks richtig lesen

tok/s ist nicht tok/s — Local-LLM-Benchmarks richtig lesen

„Der läuft mit 250 Token pro Sekunde!" — diese Zahl steht in fast jedem Benchmark-Post der Local-AI-Szene. Und sie ist fast immer nur die halbe Wahrheit. Wir haben die 300 Community-Rezepte in unserer lokalen KI-Datenbank analysiert und zeigen, welche Zahlen man glauben darf, welche man einordnen muss — und wie man in fünf Minuten selbst sauber misst.

Falle 1: Decode, Prefill und der „Mean Wall TPS"

Der größte Fehler passiert schon beim Lesen: Decode-Tok/s (wie schnell der Text beim Schreiben zusehst) und Prefill-Tok/s (wie schnell der Prompt verarbeitet wird) sind unterschiedliche Welten. Auf einer RTX PRO 6000 hat ein Rezept 14.842 tok/s Prefill gemessen — bei 207 tok/s Decode. Wer nur „2.000 tok/s" tweetet, hat vermutlich den Prompt-Verarbeitungswert gepostet, der sich bei langen Kontexten oder wiederholten Prompts (Prefix-Cache!) dramatisch unterscheidet.

Dazu kommt der „Mean Wall TPS"-Trick: Ein Rezept misst 251,8 tok/s als „mean wall TPS" über mehrere Streams. Das ist aggregierter Durchsatz — kein einzelner Nutzer sieht diese Geschwindigkeit. Single-Stream sind es realistisch 40–60 tok/s auf derselben Hardware. Both numbers are correct. Nur eine davon beantwortet deine Frage.

Falle 2: Der Benchmark-Aufbau bestimmt das Ergebnis

Zwei Rezepte für denselben 35B-A3B-Typ auf zwei RTX 5090: 249,4 tok/s mit NVFP4-Quantisierung, 251,8 tok/s mit AutoRound INT4. Klingt identisch? Der zweite Wert stammt aus einem 800-Wort-Essay-Prompt, der erste aus kurzen strukturierten Abfragen. Der Benchmark-Prompt entscheidet über das Ergebnis:

  • Kurze strukturierte Prompts (Tabellen, Zählen): Drafter-Akzeptanz hoch, künstlich schnelle Zahlen
  • 800-Wort-Essay: reales Wandtempo ohne Drafter-Vorteil
  • Lauter „count to 300"-Tests: reine Show-Werte, die im Alltag nie vorkommen

Ein seriömes Rezept trennt deshalb: Code, Prosa, strukturierte Ausgaben, jeweils mit und ohne Speculative Decoding. Wer nur eine Zahl nennt, ohne zu sagen was gemessen wurde, hat in der Regel die schönste ausgesucht.

Falle 3: Quantisierung ohne Fidelity-Nachweis

2,05 bit pro Gewicht klingt nach „nicht nutzbar", 8,49 bit nach „natürlich besser". Real ist es komplizierter. Ein 2-bit-EXL3-Rezept (GLM-5.3-Flash auf einer DGX Spark) erreicht 18,9 tok/s Decode mit dokumentierter Abweichung vom Original (KLD-Metrik, Top-1-Übereinstimmung 78,8 %). Ein 4-bit-EXL3-Rezept auf zwei Sparks dekodiert bei 36,1 tok/s — doppelt so schnell und messbar näher am Original.

Die Regel: Nicht die Bit-Zahl allein entscheidet, sondern Bit-Zahl plus dokumentierte Fidelity. Ein Rezept ohne KLD-/PPL-Angabe ist eine Behauptung, kein Messergebnis. Und: 2-bit kann für Chat völlig ausreichend sein, für Code-Agents aber messbar brechen — deshalb trennen seriöse Rezepte das nach Anwendungsfall.

Falle 4: Vendor-Zahlen vs. Standard-Harnesses

Hersteller-Benchmarks laufen oft auf eigenen Scaffolds. Community-Messungen zeigen regelmäßig 15–20 Punkte Abstand zwischen Vendor-Scaffold und Standard-Harness (Terminal-Bench, SWE-bench). Das heißt nicht, dass Hersteller lügen — aber dass der Testaufbau anders (günstiger) ist. Für Kaufentscheidungen zählen die zertifizierten Werte, für Real-Einsatz die Community-Rezepte.

Die 5-Minuten-Selbstmessung

So prüfst du ein Rezept nach, bevor du es übernimmst:

  1. Welche Zahl, welcher Modus? Decode oder Prefill? Single-Stream oder aggregiert? Steht es dabei?
  2. Welcher Prompt? Prosa-Essay (realistisch) oder „count to 300" (Drafter-Show)?
  3. Welche Quantisierung, welche Fidelity? bpw + KLD/PPL gegen das Original dokumentiert?
  4. Welche Software? Engine-Version mit angegeben? Ein vLLM-Update kann 10 % ausmachen.
  5. Selbst nachmessen: Gleicher Prompt, gleiche Einstellung, dreimal laufen lassen, Median nehmen. Dein Rig, deine Version, deine Zahl.

Welche Zahlen darf man glauben?

Die ehrlichsten Zahlen in unserer Datenbank kommen von Rezepten, die alle drei Dimensionen trennen: Anwendungsfälle (Prosa/Code/strukturiert), Betriebsmodi (Speculative Decoding an/aus) und Korrektheit (KLD gegen Original). Diese Rezepte haben die längsten Notizen und die weniger spektakulären Zahlen. Genau das ist das Qualitätsmerkmal.

Alle in diesem Artikel genannten Messwerte stammen aus der öffentlichen Recipe-Datenbank auf unserer Local-AI-Themenseite — jedes Rezept verlinkt auf das Original-Repository mit Methodik und Nachmessungs-Anleitung.

Häufige Fragen

Warum unterscheiden sich zwei Rezepte für dasselbe Modell auf derselben Hardware so stark? Weil „dieselbe Hardware" selten dieselbe Hardware ist: Power-Limit (300 W vs. 600 W bei einer RTX 3090), PCIe-Lanes, Engine-Version, KV-Cache-Typ und der Benchmark-Prompt selbst verschieben das Ergebnis um Faktoren. Ein seriöses Rezept dokumentiert genau diese Parameter — deshalb sind sie Teil unserer Recipe-Datenfelder.

Ist Speculative Decoding eine geschummelte Zahl? Nein, aber es ist eine andere Betriebsart. Speculative Decoding (z. B. mit einem Draft-Modell) liefert bei gleicher Qualität schnellere Ausgabe — die Akzeptanzrate hängt aber vom Prompt ab. Strukturierte Ausgaben profitieren massiv, freie Prosa kaum. Seriöse Messungen trennen beides; „nur eine Zahl" ist ein Warnsignal.

Was bedeutet KLD oder Top-1-Agreement bei Quantisierungen? KLD (KL-Divergence) misst, wie stark die Quantisierungsabweichung des Modells vom Original abweicht — je niedriger, desto treuer. Top-1-Agreement gibt an, wie oft Quant- und Originalmodell denselben Token wählen (78,8 % bei 2-bit, über 94 % bei guten 4-bit-Packs). Ohne diese Zahl ist eine Quantisierung eine Geschmacksfrage mit Risiko.

Sind hohe Prefill-Werte relevant für mich? Sehr — wenn du lange Dokumente oder wiederholte System-Prompts verarbeitest. Prefill entscheidet über die Wartezeit bis zum ersten Token. Bei wiederkehrenden Prompts kommt der Prefix-Cache dazu: dieselbe Prompt-Vorsilbe wird nicht neu berechnet. Für Chat-Kurzsessions ist Decode wichtiger, für RAG- und Agent-Workloads oft das Prefill.

Warum sollte ich Community-Rezepten vertrauen statt Hersteller-Benchmarks? Weil Community-Rezepte nachmessbar sind: Repository, Engine-Version, Prompt, Hardware-Konfiguration — alles offen. Herstellerzahlen sind Marketing-Aussagen mit unbekanntem Scaffold. Unsere Recipe-Datenbank verlinkt jedes Rezept auf das Original, damit du es auf deinem Rig verifizieren kannst.

Quellen

Thema für Ihr Team? Sprechen wir 30 Minuten.

Wir ordnen ein, was davon in Ihrem Unternehmen trägt — konkret, ohne Folienschlacht.

Unverbindlich · 30 Minuten · Angebot in 48 h