---
type: "BlogPosting"
title: "Ein Modell, sechs Hardware-Stufen — was wir gemessen haben"
description: "Qwen3.8-Flash-Next von RTX 3090 bis RTX PRO 6000: alle Messwerte nebeneinander. Warum die Sprünge nicht linear sind und Prefill die heimliche Belohnung ist."
resource: "https://www.contextstudios.ai/de/blog/ein-modell-sechs-hardware-stufen-was-wir-gemessen-haben"
language: "de"
tags: ["Local AI", "Self-Hosting", "LLM", "Benchmark", "Hardware"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-05T08:52:07.417Z"
status: "stable"
---

# Ein Modell, sechs Hardware-Stufen — was wir gemessen haben

Published: 2026-10-01
Tags: Local AI, Self-Hosting, LLM, Benchmark, Hardware

![Ein Modell, sechs Hardware-Stufen — was wir gemessen haben](https://wary-platypus-754.convex.cloud/api/storage/31d535a9-6a00-4957-8178-be171b307101)

Wie schnell wird ein und dasselbe Modell auf unterschiedlicher Hardware? Und was verliert man dabei? Wir haben alle Qwen3.8-Flash-Next-Rezepte aus unserer Datenbank nebeneinandergelegt — von der RTX 3090 bis zum RTX-PRO-6000-Node. Das Ergebnis ist die ehrlichste Antwort auf die Frage „Welche Hardware brauche ich?", die man geben kann: eine Tabelle aus Messungen, keine Marketingfolie.

## Das Modell in 30 Sekunden

Qwen3.8-Flash-Next ist der offene Vorschau-Checkpoint auf Qwen4: 125B Hauptmodell plus 51B n-gram-Embedding-Schicht (die bleibt teils auf der SSD), nur ~6B aktive Parameter pro Token, native Bild- und Video-Eingabe, 262K Kontext (1M per YaRN). Die kleine aktive Parameterzahl macht es zum idealen Testkandidaten für Hardware-Stufen: Es läuft auf fast allem — aber wie schnell, das ist der Unterschied.

## Die Messreihe: sechs Stufen, ein Modell

Alle Werte: beste Single-Stream-Decode-Zahl je Rezept, Prosa-/Real-Workload vorzugsweise, aus der Recipe-Datenbank (Creator-Name dabei):

| Stufe | Setup | Quant | tok/s (typ) | Rezept von |
|---|---|---|---|---|
| RTX 3090 (1×) | EXL3 2.5 bpw | 41,5 GiB | ~38,6* | r0b0tlab |
| RTX 3090 (2×) | GGUF Q4, CPU-MoE | UD-Q4_K_XL | 36,8 | club3090 |
| RTX 5090 (1×) | GGUF Q2, CPU-MoE | UD-Q2_K_XL | ~59,7 | notwitcheer |
| DGX Spark (1×) | NVFP4 + FP8 KV | 6,78 bpw | 48,7 | MiaAI-Lab |
| DGX Spark (2×) | NVFP4 TP2 | 8,49 bpw | 54,4 | MiaAI-Lab |
| Mac Studio M4 Max | oMLX, MTP6 | oQ4e | ~83** | weschera |
| RTX PRO 6000 (1×) | NVFP4, SGLang | ModelOpt | ~207 | jpezzulli |

\* peak-Wert. \** peak mit MTP-Spezulation; der reale Prosa-Wert liegt niedriger.

## Was die Tabelle wirklich sagt

**1. Die Sprünge sind nicht linear.** Von der 3090 (36,8) zur 5090 (~60) ist es Faktor 1,6 — aber von der 5090 zur PRO 6000 (207) Faktor 3,5. Der Grund: Die PRO-6000-Rezepte laufen in nativer NVFP4 mit vollem KV-Throughput, während die Consumer-Karten mit CPU-MoE-Offloading arbeiten (Experten wandern in den RAM). Dieselbe Modellfamilie, grundverschiedene Betriebsmodi.

**2. Unified Memory ist ein eigener Wettbewerb.** Die Mac- und Spark-Werte sind nicht mit den RTX-Werten direkt vergleichbar: MLX mit MTP-Spezulation (weschera, ~83 tok/s peak) gewinnt durch Speculation, nicht durch Bandbreite. Im Nüchtern-Vergleich Prosa ohne Drafter liegen Spark (48,7) und M5 Max (48,4, antirez/ds4) praktisch gleichauf — unterschiedliche Ökosysteme, identische Realität.

**3. Quantisierung entscheidet über die Stufen-Grenze.** Auf der 3090 läuft Flash-Next nur mit 2,5–3 bpw (41,5 GiB in 24 GB VRAM geht nicht anders). Auf der Spark sind es NVFP4/6,78 bpw, auf der PRO 6000 native FP4-Klasse. Derselbe Prüf-Benchmark am BF16-Original zeigt: die höheren bpw-Stufen gewinnen nicht nur Geschwindigkeit, sondern messbar Korrektheit. Mehr VRAM kauft dir bessere Bits.

**4. Prefill ist die heimliche Stufen-Belohnung.** Decode-Tok/s dominieren die Diskussion, aber die Prefill-Werte zeigen die echte Hierarchie: ~664 (3090) → ~900 (5090) → ~1.492 (Spark/M5 Max) → ~12.073–14.842 (PRO 6000). Wer lange Dokumente oder Agent-Kontexte füttert, erlebt die PRO 6000 nicht als „etwas schneller", sondern als andere Klasse.

## Welche Stufe für wen?

- **Gelegenheits-Chat und Experimente:** 1× RTX 3090 — 37–39 tok/s sind fürs Chatten völlig ausreichend, die Karte hast du vielleicht schon.
- **Ernsthafte Einzel-Nutzung:** DGX Spark oder Mac Studio — ~49 tok/s Decode mit vollerer Quantisierung fühlen sich wie „flüssig reden" an.
- **RAG, Agenten, lange Kontexte:** RTX PRO 6000 — das Prefill-Argument entscheidet, nicht der Decode-Wert.
- **Mehrbenutzer:** 2× Spark oder PRO 6000 mit vLLM/SGLang — Concurrency braucht KV-Pool, nicht Einzelspitze.

Jede Zeile dieser Tabelle ist ein echtes, nachmessbares Rezept aus unserer [Local-AI-Datenbank](/de/local-ai) — mit Serve-Flags, Original-Repo und Messmethodik. Wähle deine Stufe, kopiere das Rezept, miss nach.

## Häufige Fragen

**Lohnt sich das Upgrade von 3090 auf 5090 für dieses Modell?**
Für Decode: +60 % (36,8 → ~60 tok/s mit ähnlichem Quant). Fürs Erlebnis: merklich, aber nicht umwerfend. Der große Sprung liegt bei Prefill (664 → 900) und darin, dass die 5090 Q4-Quants komfortabel schafft. Wer schon eine 3090 hat und nur chatet: eher nicht.

**Warum ist der Mac-Wert (83 tok/s) mit MTP so viel höher als der Spark-Wert?**
MTP (Multi-Token-Prediction) ist Speculation: mehrere Tokens pro Schritt raten und verifizieren. Die oMLX-Implementierung von weschera nutzt das aggressiv (MTP6). Ohne Speculation liegen Mac M5 Max und DGX Spark gleichauf (~48). Speculation ist ein Software-Feature, kein Hardware-Vorteil.

**Ist 2,5 bpw auf der 3090 noch dasselbe Modell?**
Es ist dasselbe Modell mit messbar mehr Abweichung vom Original. Für Chat ja, für Code-Agenten kritisch — und genau das dokumentieren die KLD-Werte der Rezepte. Wer Code-Agent-qualität will, braucht mindestens die 5090-Klasse (Q4) oder die Spark (NVFP4).

**Was bringt die 2×-Spark gegenüber 1×?**
Mit TP2: volle NVFP4-Qualität (8,49 bpw effektiv), 54,4 tok/s statt 48,7 — und vor allem der doppelte KV-Pool für längere Kontexte und mehr Concurrency. Der Schritt ist Qualitäts- und Kapazitätssprung zugleich, nicht nur Geschwindigkeit.

**Stimmt es, dass die PRO 6000 „andere Klasse" ist?**
Bei Prefill: eindeutig ja — 12.000–14.800 tok/s gegen 664–1.492 auf Consumer/Unified. Das ist der Unterschied zwischen „Dokument hochladen, Kaffee holen" und „Dokument ist schon gelesen". Wer Agent-Workloads mit langen Kontexten fährt, kauft für Prefill, nicht für Decode.

## Quellen

- [Local AI — Context Studios (Recipe-Datenbank, Qwen3.8-Flash-Next-Rezepte)](https://www.contextstudios.ai/local-ai)
- [MiaAI-Lab — Qwen3.8-Flash-Next NVFP4 auf 1×/2× DGX Spark (48,7/54,4 tok/s)](https://github.com/MiaAI-Lab)
- [vcruz305 — Qwen3.8-Flash-Next EXL3 3.05bpw auf 1× Spark (53,0 tok/s)](https://www.contextstudios.ai/local-ai)
- [weschera — Qwen3.8-Flash-Next oMLX MTP6 auf Mac Studio M4 Max](https://www.contextstudios.ai/local-ai)
- [antirez/ds4 — Qwen3.8-Flash-Next Q2/Q4 auf M5 Max (SSD-Streaming der n-gram-Tabellen)](https://dwarfstar.sh/blog/ds4-september-v41-qwen38-and-a-bigger-runtime)
- [jpezzulli — Qwen3.8-Flash-Next NVFP4 SGLang auf 1× RTX PRO 6000 (207 tok/s, Prefill 14.842)](https://www.contextstudios.ai/local-ai)
- [club3090 — Qwen3.8-Flash-Next CPU-MoE auf 2× RTX 3090 (36,8 tok/s)](https://github.com/noonghunna/club-3090/blob/master/BENCHMARKS.md)


## Related

- [LLM-Entwicklung](https://www.contextstudios.ai/de/llm-entwicklung.md)
- [KI-Entwicklung](https://www.contextstudios.ai/de/ki-entwicklung.md)
- [LLM-Integration](https://www.contextstudios.ai/de/llm-integration.md)
- [KI-Beratung](https://www.contextstudios.ai/de/ki-beratung.md)
