Wie schnell wird ein und dasselbe Modell auf unterschiedlicher Hardware? Und was verliert man dabei? Wir haben alle Qwen3.8-Flash-Next-Rezepte aus unserer Datenbank nebeneinandergelegt — von der RTX 3090 bis zum RTX-PRO-6000-Node. Das Ergebnis ist die ehrlichste Antwort auf die Frage „Welche Hardware brauche ich?", die man geben kann: eine Tabelle aus Messungen, keine Marketingfolie.
Das Modell in 30 Sekunden
Qwen3.8-Flash-Next ist der offene Vorschau-Checkpoint auf Qwen4: 125B Hauptmodell plus 51B n-gram-Embedding-Schicht (die bleibt teils auf der SSD), nur ~6B aktive Parameter pro Token, native Bild- und Video-Eingabe, 262K Kontext (1M per YaRN). Die kleine aktive Parameterzahl macht es zum idealen Testkandidaten für Hardware-Stufen: Es läuft auf fast allem — aber wie schnell, das ist der Unterschied.
Die Messreihe: sechs Stufen, ein Modell
Alle Werte: beste Single-Stream-Decode-Zahl je Rezept, Prosa-/Real-Workload vorzugsweise, aus der Recipe-Datenbank (Creator-Name dabei):
| Stufe | Setup | Quant | tok/s (typ) | Rezept von |
|---|---|---|---|---|
| RTX 3090 (1×) | EXL3 2.5 bpw | 41,5 GiB | ~38,6* | r0b0tlab |
| RTX 3090 (2×) | GGUF Q4, CPU-MoE | UD-Q4_K_XL | 36,8 | club3090 |
| RTX 5090 (1×) | GGUF Q2, CPU-MoE | UD-Q2_K_XL | ~59,7 | notwitcheer |
| DGX Spark (1×) | NVFP4 + FP8 KV | 6,78 bpw | 48,7 | MiaAI-Lab |
| DGX Spark (2×) | NVFP4 TP2 | 8,49 bpw | 54,4 | MiaAI-Lab |
| Mac Studio M4 Max | oMLX, MTP6 | oQ4e | ~83** | weschera |
| RTX PRO 6000 (1×) | NVFP4, SGLang | ModelOpt | ~207 | jpezzulli |
* peak-Wert. ** peak mit MTP-Spezulation; der reale Prosa-Wert liegt niedriger.
Was die Tabelle wirklich sagt
1. Die Sprünge sind nicht linear. Von der 3090 (36,8) zur 5090 (~60) ist es Faktor 1,6 — aber von der 5090 zur PRO 6000 (207) Faktor 3,5. Der Grund: Die PRO-6000-Rezepte laufen in nativer NVFP4 mit vollem KV-Throughput, während die Consumer-Karten mit CPU-MoE-Offloading arbeiten (Experten wandern in den RAM). Dieselbe Modellfamilie, grundverschiedene Betriebsmodi.
2. Unified Memory ist ein eigener Wettbewerb. Die Mac- und Spark-Werte sind nicht mit den RTX-Werten direkt vergleichbar: MLX mit MTP-Spezulation (weschera, ~83 tok/s peak) gewinnt durch Speculation, nicht durch Bandbreite. Im Nüchtern-Vergleich Prosa ohne Drafter liegen Spark (48,7) und M5 Max (48,4, antirez/ds4) praktisch gleichauf — unterschiedliche Ökosysteme, identische Realität.
3. Quantisierung entscheidet über die Stufen-Grenze. Auf der 3090 läuft Flash-Next nur mit 2,5–3 bpw (41,5 GiB in 24 GB VRAM geht nicht anders). Auf der Spark sind es NVFP4/6,78 bpw, auf der PRO 6000 native FP4-Klasse. Derselbe Prüf-Benchmark am BF16-Original zeigt: die höheren bpw-Stufen gewinnen nicht nur Geschwindigkeit, sondern messbar Korrektheit. Mehr VRAM kauft dir bessere Bits.
4. Prefill ist die heimliche Stufen-Belohnung. Decode-Tok/s dominieren die Diskussion, aber die Prefill-Werte zeigen die echte Hierarchie: ~664 (3090) → ~900 (5090) → ~1.492 (Spark/M5 Max) → ~12.073–14.842 (PRO 6000). Wer lange Dokumente oder Agent-Kontexte füttert, erlebt die PRO 6000 nicht als „etwas schneller", sondern als andere Klasse.
Welche Stufe für wen?
- Gelegenheits-Chat und Experimente: 1× RTX 3090 — 37–39 tok/s sind fürs Chatten völlig ausreichend, die Karte hast du vielleicht schon.
- Ernsthafte Einzel-Nutzung: DGX Spark oder Mac Studio — ~49 tok/s Decode mit vollerer Quantisierung fühlen sich wie „flüssig reden" an.
- RAG, Agenten, lange Kontexte: RTX PRO 6000 — das Prefill-Argument entscheidet, nicht der Decode-Wert.
- Mehrbenutzer: 2× Spark oder PRO 6000 mit vLLM/SGLang — Concurrency braucht KV-Pool, nicht Einzelspitze.
Jede Zeile dieser Tabelle ist ein echtes, nachmessbares Rezept aus unserer Local-AI-Datenbank — mit Serve-Flags, Original-Repo und Messmethodik. Wähle deine Stufe, kopiere das Rezept, miss nach.
Häufige Fragen
Lohnt sich das Upgrade von 3090 auf 5090 für dieses Modell? Für Decode: +60 % (36,8 → ~60 tok/s mit ähnlichem Quant). Fürs Erlebnis: merklich, aber nicht umwerfend. Der große Sprung liegt bei Prefill (664 → 900) und darin, dass die 5090 Q4-Quants komfortabel schafft. Wer schon eine 3090 hat und nur chatet: eher nicht.
Warum ist der Mac-Wert (83 tok/s) mit MTP so viel höher als der Spark-Wert? MTP (Multi-Token-Prediction) ist Speculation: mehrere Tokens pro Schritt raten und verifizieren. Die oMLX-Implementierung von weschera nutzt das aggressiv (MTP6). Ohne Speculation liegen Mac M5 Max und DGX Spark gleichauf (~48). Speculation ist ein Software-Feature, kein Hardware-Vorteil.
Ist 2,5 bpw auf der 3090 noch dasselbe Modell? Es ist dasselbe Modell mit messbar mehr Abweichung vom Original. Für Chat ja, für Code-Agenten kritisch — und genau das dokumentieren die KLD-Werte der Rezepte. Wer Code-Agent-qualität will, braucht mindestens die 5090-Klasse (Q4) oder die Spark (NVFP4).
Was bringt die 2×-Spark gegenüber 1×? Mit TP2: volle NVFP4-Qualität (8,49 bpw effektiv), 54,4 tok/s statt 48,7 — und vor allem der doppelte KV-Pool für längere Kontexte und mehr Concurrency. Der Schritt ist Qualitäts- und Kapazitätssprung zugleich, nicht nur Geschwindigkeit.
Stimmt es, dass die PRO 6000 „andere Klasse" ist? Bei Prefill: eindeutig ja — 12.000–14.800 tok/s gegen 664–1.492 auf Consumer/Unified. Das ist der Unterschied zwischen „Dokument hochladen, Kaffee holen" und „Dokument ist schon gelesen". Wer Agent-Workloads mit langen Kontexten fährt, kauft für Prefill, nicht für Decode.
Quellen
- Local AI — Context Studios (Recipe-Datenbank, Qwen3.8-Flash-Next-Rezepte)
- MiaAI-Lab — Qwen3.8-Flash-Next NVFP4 auf 1×/2× DGX Spark (48,7/54,4 tok/s)
- vcruz305 — Qwen3.8-Flash-Next EXL3 3.05bpw auf 1× Spark (53,0 tok/s)
- weschera — Qwen3.8-Flash-Next oMLX MTP6 auf Mac Studio M4 Max
- antirez/ds4 — Qwen3.8-Flash-Next Q2/Q4 auf M5 Max (SSD-Streaming der n-gram-Tabellen)
- jpezzulli — Qwen3.8-Flash-Next NVFP4 SGLang auf 1× RTX PRO 6000 (207 tok/s, Prefill 14.842)
- club3090 — Qwen3.8-Flash-Next CPU-MoE auf 2× RTX 3090 (36,8 tok/s)