Local AI

Ein Modell, sechs Hardware-Stufen — was wir gemessen haben

Ein Modell, sechs Hardware-Stufen — was wir gemessen haben

Wie schnell wird ein und dasselbe Modell auf unterschiedlicher Hardware? Und was verliert man dabei? Wir haben alle Qwen3.8-Flash-Next-Rezepte aus unserer Datenbank nebeneinandergelegt — von der RTX 3090 bis zum RTX-PRO-6000-Node. Das Ergebnis ist die ehrlichste Antwort auf die Frage „Welche Hardware brauche ich?", die man geben kann: eine Tabelle aus Messungen, keine Marketingfolie.

Das Modell in 30 Sekunden

Qwen3.8-Flash-Next ist der offene Vorschau-Checkpoint auf Qwen4: 125B Hauptmodell plus 51B n-gram-Embedding-Schicht (die bleibt teils auf der SSD), nur ~6B aktive Parameter pro Token, native Bild- und Video-Eingabe, 262K Kontext (1M per YaRN). Die kleine aktive Parameterzahl macht es zum idealen Testkandidaten für Hardware-Stufen: Es läuft auf fast allem — aber wie schnell, das ist der Unterschied.

Die Messreihe: sechs Stufen, ein Modell

Alle Werte: beste Single-Stream-Decode-Zahl je Rezept, Prosa-/Real-Workload vorzugsweise, aus der Recipe-Datenbank (Creator-Name dabei):

StufeSetupQuanttok/s (typ)Rezept von
RTX 3090 (1×)EXL3 2.5 bpw41,5 GiB~38,6*r0b0tlab
RTX 3090 (2×)GGUF Q4, CPU-MoEUD-Q4_K_XL36,8club3090
RTX 5090 (1×)GGUF Q2, CPU-MoEUD-Q2_K_XL~59,7notwitcheer
DGX Spark (1×)NVFP4 + FP8 KV6,78 bpw48,7MiaAI-Lab
DGX Spark (2×)NVFP4 TP28,49 bpw54,4MiaAI-Lab
Mac Studio M4 MaxoMLX, MTP6oQ4e~83**weschera
RTX PRO 6000 (1×)NVFP4, SGLangModelOpt~207jpezzulli

* peak-Wert. ** peak mit MTP-Spezulation; der reale Prosa-Wert liegt niedriger.

Was die Tabelle wirklich sagt

1. Die Sprünge sind nicht linear. Von der 3090 (36,8) zur 5090 (~60) ist es Faktor 1,6 — aber von der 5090 zur PRO 6000 (207) Faktor 3,5. Der Grund: Die PRO-6000-Rezepte laufen in nativer NVFP4 mit vollem KV-Throughput, während die Consumer-Karten mit CPU-MoE-Offloading arbeiten (Experten wandern in den RAM). Dieselbe Modellfamilie, grundverschiedene Betriebsmodi.

2. Unified Memory ist ein eigener Wettbewerb. Die Mac- und Spark-Werte sind nicht mit den RTX-Werten direkt vergleichbar: MLX mit MTP-Spezulation (weschera, ~83 tok/s peak) gewinnt durch Speculation, nicht durch Bandbreite. Im Nüchtern-Vergleich Prosa ohne Drafter liegen Spark (48,7) und M5 Max (48,4, antirez/ds4) praktisch gleichauf — unterschiedliche Ökosysteme, identische Realität.

3. Quantisierung entscheidet über die Stufen-Grenze. Auf der 3090 läuft Flash-Next nur mit 2,5–3 bpw (41,5 GiB in 24 GB VRAM geht nicht anders). Auf der Spark sind es NVFP4/6,78 bpw, auf der PRO 6000 native FP4-Klasse. Derselbe Prüf-Benchmark am BF16-Original zeigt: die höheren bpw-Stufen gewinnen nicht nur Geschwindigkeit, sondern messbar Korrektheit. Mehr VRAM kauft dir bessere Bits.

4. Prefill ist die heimliche Stufen-Belohnung. Decode-Tok/s dominieren die Diskussion, aber die Prefill-Werte zeigen die echte Hierarchie: ~664 (3090) → ~900 (5090) → ~1.492 (Spark/M5 Max) → ~12.073–14.842 (PRO 6000). Wer lange Dokumente oder Agent-Kontexte füttert, erlebt die PRO 6000 nicht als „etwas schneller", sondern als andere Klasse.

Welche Stufe für wen?

  • Gelegenheits-Chat und Experimente: 1× RTX 3090 — 37–39 tok/s sind fürs Chatten völlig ausreichend, die Karte hast du vielleicht schon.
  • Ernsthafte Einzel-Nutzung: DGX Spark oder Mac Studio — ~49 tok/s Decode mit vollerer Quantisierung fühlen sich wie „flüssig reden" an.
  • RAG, Agenten, lange Kontexte: RTX PRO 6000 — das Prefill-Argument entscheidet, nicht der Decode-Wert.
  • Mehrbenutzer: 2× Spark oder PRO 6000 mit vLLM/SGLang — Concurrency braucht KV-Pool, nicht Einzelspitze.

Jede Zeile dieser Tabelle ist ein echtes, nachmessbares Rezept aus unserer Local-AI-Datenbank — mit Serve-Flags, Original-Repo und Messmethodik. Wähle deine Stufe, kopiere das Rezept, miss nach.

Häufige Fragen

Lohnt sich das Upgrade von 3090 auf 5090 für dieses Modell? Für Decode: +60 % (36,8 → ~60 tok/s mit ähnlichem Quant). Fürs Erlebnis: merklich, aber nicht umwerfend. Der große Sprung liegt bei Prefill (664 → 900) und darin, dass die 5090 Q4-Quants komfortabel schafft. Wer schon eine 3090 hat und nur chatet: eher nicht.

Warum ist der Mac-Wert (83 tok/s) mit MTP so viel höher als der Spark-Wert? MTP (Multi-Token-Prediction) ist Speculation: mehrere Tokens pro Schritt raten und verifizieren. Die oMLX-Implementierung von weschera nutzt das aggressiv (MTP6). Ohne Speculation liegen Mac M5 Max und DGX Spark gleichauf (~48). Speculation ist ein Software-Feature, kein Hardware-Vorteil.

Ist 2,5 bpw auf der 3090 noch dasselbe Modell? Es ist dasselbe Modell mit messbar mehr Abweichung vom Original. Für Chat ja, für Code-Agenten kritisch — und genau das dokumentieren die KLD-Werte der Rezepte. Wer Code-Agent-qualität will, braucht mindestens die 5090-Klasse (Q4) oder die Spark (NVFP4).

Was bringt die 2×-Spark gegenüber 1×? Mit TP2: volle NVFP4-Qualität (8,49 bpw effektiv), 54,4 tok/s statt 48,7 — und vor allem der doppelte KV-Pool für längere Kontexte und mehr Concurrency. Der Schritt ist Qualitäts- und Kapazitätssprung zugleich, nicht nur Geschwindigkeit.

Stimmt es, dass die PRO 6000 „andere Klasse" ist? Bei Prefill: eindeutig ja — 12.000–14.800 tok/s gegen 664–1.492 auf Consumer/Unified. Das ist der Unterschied zwischen „Dokument hochladen, Kaffee holen" und „Dokument ist schon gelesen". Wer Agent-Workloads mit langen Kontexten fährt, kauft für Prefill, nicht für Decode.

Quellen

Thema für Ihr Team? Sprechen wir 30 Minuten.

Wir ordnen ein, was davon in Ihrem Unternehmen trägt — konkret, ohne Folienschlacht.

Unverbindlich · 30 Minuten · Angebot in 48 h