TL;DR
- Eine gebrauchte RTX 3090 (24 GB GDDR6X, 936 GB/s) schafft mit Qwen-27B-Modellen in Q4 rund 30–35 tok/s — für grob 700–1.300 $ auf dem Gebrauchtmarkt 2026.
- Der DGX Spark (Startpreis 3.999 $, MSRP inzwischen 4.699 $) bietet 128 GB Unified Memory, decodiert aber wegen 273 GB/s Bandbreite bei Modellen, die auf beide passen, nur etwa ein Drittel so schnell wie die 3090.
- Aus unserem eigenen Betrieb: Seit dem Umzug auf den lokalen Cluster am 21.08.2026 liegt unsere API-Abrechnung bei 0 $/Tag — in den 30 Tagen davor waren es Ø 127,56 $/Tag.
Wer 2026 lokale LLMs betreiben will, stellt sich fast dieselbe Frage wie bei den Suchanfragen, die uns auf dieses Thema gebracht haben: dgx spark qwen 3.8 27b, qwen 3.8 27b 3090, qwen 3.8 27b dgx spark. Dahinter steckt eine einfache Abwägung — billige Gebraucht-GPU mit viel Bandbreite oder kompakte Blackwell-Box mit viel Speicher.
Wir haben beide Seiten durchgerechnet: die Community-Messungen zur 27B-Klasse, die Bandbreiten-Arithmetik und unsere eigenen Betriebszahlen aus dem Cluster, auf dem unsere Agenten laufen.
Die Hardware im Direktvergleich
Beide Systeme zielen auf dasselbe Szenario — Inferenz am Schreibtisch —, aber auf komplett unterschiedliche Weise:
| RTX 3090 (gebraucht) | DGX Spark (GB10) | |
| Speicher | 24 GB GDDR6X | 128 GB LPDDR5X unified |
| Bandbreite | 936 GB/s | 273 GB/s |
| Klassenleader bei | Decode-Speed | Modellgröße (bis \~200B Params, FP4) |
| AI-Leistung | 142 TFLOPS FP16 (dense) | 1 PFLOP FP4 (sparse) |
| Verbrauch | 350 W TDP | 240 W Netzteil (GB10: 140 W) |
| Preis 2026 | \~700–1.300 \$ gebraucht | 3.999 \$ Start, 4.699 \$ MSRP seit Feb 2026 |
Die Preisstory hat sich 2026 gedreht: Wegen der DRAM-Knappheit sind gebrauchte 24-GB-Karten teurer geworden als die altbekannten 600-$-Richtwerte. Renewed Founders Editions wurden im September 2026 bei rund 1.550 $ gelistet. Der Spark hat parallel eine MSRP-Erhöhung auf 4.699 $ bekommen — ebenfalls LPDDR5X-bedingt.
tok/s: Was für Qwen 27B realistisch ist
Für die 27B-Klasse in Q4_K_M — etwa 17–18 GB Modellgewichte plus Kontext — liegt die Community-Messung für die RTX 3090 stabil bei 30–35 tok/s im Single-Stream-Decode. Größere 32B-Modelle in Q4 landen je nach Quelle bei 18–28 tok/s.
Die Bandbreiten-Arithmetik erklärt, warum: Bei ~16 GB Gewichte liegt das theoretische Decode-Ceiling der 3090 bei 936 ÷ 16 ≈ 58 tok/s, die Praxis liegt darunter. Der Spark rechnet dieselbe Rechnung mit 273 ÷ 16 ≈ 17 tok/s — geschätzt landet er in der Praxis bei grob 12–15 tok/s für ein 27B-Modell. Das ist eine Schätzung aus der Bandbreite, keine Messung.
Der Spark gibt an zwei anderen Stellen zurück: Beim Prompt Processing ist seine Blackwell-GPU compute-bound und deutlich schneller, und in seinen 128 GB passen Modelle, die auf keine 24-GB-Karte laufen. Für 27B-Klasse und schnellere Answers gewinnt die 3090, für 70B+ und lange Kontexte der Spark.
Unsere Messung: Kosten aus dem eigenen Betrieb
Unser Referenzmodell ist qwen3.8-flash-next-nvfp4, das auf unserem 4-Knoten-vLLM-Cluster läuft. Ehrlicherweise vorweg: Der geplante Benchmark-Lauf am 29.09.2026, 16:03 MESZ gegen den Cluster-Endpoint (OpenAI-kompatible API, 3 Single-Stream-Läufe plus 8 parallele Streams, max_tokens 256) ist an HTTP-500-Fehlern des Servers gescheitert — tok/s- und TTFT-Zahlen aus dem eigenen Cluster folgen in einem Nachmessungspost. Der Endpoint war erreichbar und listete beide Modelle, nur die Completions schlugen fehl. Auch ein manueller Recheck gegen 16:10 MESZ ergab weiterhin 500. Genau diese Betriebsrealität gehört zur Selbst-Hosting-Rechnung dazu.
Die Kostenseite haben wir dafür vollständig aus den eigenen Logs — der letzte Messzeitpunkt ist der 29.09.2026, 16:04 MESZ:
| Cloud-Modell | \$/1M (blended) | €/1M |
| Qwen3.8 Max (0902) | 3,0 | 2,76 |
| Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) | 8,0 | 7,36 |
| Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 20,0 | 18,4 |
| MiMo-V2.6-Pro | 0,54 | 0,5 |
| Muse Spark 1.3 (max) | 2,0 | 1,84 |
Listenpreise: artificialanalysis, Stand 23.09.2026; blended im Verhältnis 3:1 Input:Output — Output-only wäre teurer.
Unsere API-Ausgaben laut cost-throttle-Monitor (86 geloggte Tage, 05.07. bis 29.09.2026): Spitze 268,59 $/Tag am 11.08.2026, Ø 127,56 $/Tag in den 30 Tagen vor dem 21.08.2026 — und seit dem 21.08.2026 exakt 0,00 $/Tag. Der Umzug auf den lokalen Cluster ist der Grund für den Sprung auf null.
Rechnen wir das hoch: 127,56 $/Tag entsprechen umgerechnet (Kurs 0,92) rund 117 €/Tag, also grob 3.500 €/Monat bzw. 42.000 €/Jahr Cloud-Ausgabe, die entfällt. Dem stehen als Annahmen gegenüber — das ist eine Obergrenzen-Rechnung, keine Messung: 4 Knoten × 240 W Nennleistung (Netzteil-Limit, nicht gemessen) = 960 W; bei 24/7-Betrieb 23,04 kWh/Tag; mit angenommenem Gewerbestrom von 0,35 €/kWh (DE 2026, anpassbar) rund 8 €/Tag bzw. ~242 €/Monat. Selbst bei permanenter Volllast bleibt der Strom also unter einem Vierzehntel der früheren Cloud-Ausgaben — und real laufen die Knoten nicht rund um die Uhr auf Maximallast.
Was uns fehlt, ist die dritte Zahl: €/1M Tokens lokal. Die lässt sich erst seriös berechnen, wenn der Benchmark-Lauf nach dem Server-Fix durchgelaufen ist — der Faktor-Spalte in unserer eigenen Tabelle ist deshalb heute bewusst leer.
Einordnung: Wann 3090, wann Spark
- Gebrauchte RTX 3090, wenn: 27B-Klasse in Q4 mit 30–35 tok/s reicht, das Budget unter 1.500 $ liegen muss und du ein Gehäuse mit 350-W-Karte kühlen kannst.
- DGX Spark, wenn: Modelle bis ~200B (FP4) lokal laufen sollen, Prompt-Processing langer Kontexte zählt und ~4.700 $ plus Strom im Rahmen sind.
- Beides, wenn: Die 3090 als schnelle Decode-Maschine für die täglichen Agenten läuft und der Spark als Speicher-Riese für die großen Modelle dazukommt — genau so ist unser Cluster aufgestellt.
Fazit
Die gebrauchte RTX 3090 bleibt 2026 der Preis-Leistungs-König für die 27B-Klasse: mehr Decode-Bandbreite als jeder Deskop-Blackwell-Box zu einem Bruchteil des Preises. Der DGX Spark kauft sich keine Geschwindigkeit, sondern Speicher — und rechnet sich erst, wenn man die Modellgröße auch wirklich braucht. Unsere eigenen Zahlen belegen die zweite Hälfte der Rechnung eindrucksvoll: 127,56 $/Tag Cloud wurden zu 0 $/Tag plus ein paar Euro Strom.
FAQ
Wie viele tok/s schafft eine gebrauchte RTX 3090 mit Qwen 3.8 27B?
In Q4_K_M liegen Community-Messungen stabil bei 30–35 tok/s im Single-Stream-Decode, bei einem VRAM-Bedarf von etwa 17–18 GB inklusive Kontext. Die Streuung zwischen Quellen kommt aus Quantisierung, Kontextlänge und Framework. Zum Vergleich: 32B-Modelle in Q4 laufen auf derselben Karte mit 18–28 tok/s.
Ist die 3090 2026 angesichts steigender Gebrauchtpreise noch lohnend?
Ja, aber die Kalkulation hat sich verschoben. Wegen der DRAM-Knappheit liegen gebrauchte 3090er 2026 eher bei 700–1.300 $ statt bei den oft zitierten 600–800 $, renewed Founders Editions bei ~1.550 . Immer noch bekommt niemand anders 24 GB VRAM zu dem Preis — der relative Vorteil bleibt, der absolute ist geschrumpft.
Läuft Qwen 3.8 27B schneller auf dem DGX Spark?
Beim Decode nein: Mit 273 GB/s Bandbreite ist der Spark bei Modellen, die auf beide Systeme passen, grob ein Drittel so schnell wie die 3090 — geschätzt ~12–15 tok/s für ein 27B-Modell. Seine Stärken sind Prompt Processing langer Kontexte und die 128 GB, mit denen Modelle bis ~200B Parameter (FP4) laufen. Für die 27B-Klasse ist die 3090 die schnellere Wahl.
Was kostet lokaler Betrieb an Strom?
Eine einzelne 3090 zieht bis 350 W — bei Dauerdauerlast und 0,35 €/kWh wären das grob 2,9 €/Tag. Unser 4-Knoten-Cluster liegt als Annahme bei 4 × 240 W Nennleistung, also ~8 €/Tag bei 24/7-Vollast. Beide Werte sind Obergrenzen-Rechnungen, keine Messungen, weil die Knoten nicht permanent auf Maximallast laufen.
Wie starte ich einen 27B lokal durch, um es selbst zu messen?
Der kürzeste Weg ist ein OpenAI-kompatibler Server, gegen den du dann tok/s und TTFT messen kannst. Wir selbst laufen mit vLLM auf dem Cluster; für Einzel-GPUs sind llama.cpp und Ollama die pragmatischeren Einstiege. Wichtig für belastbare Zahlen: mehrere Läufe, feste Output-Token-Zahl und getrennte Betrachtung von TTFT und Decode-Rate.
vllm serve qwen3.8-flash-next-nvfp4 --port 8212
# Messung: 3 Läufe, 256 Output-Tokens, TTFT und Decode tok/s getrennt loggen
Quellen
- NVIDIA-Pressemitteilung (via StockTitan): https://www.stocktitan.net/news/NVDA/nvidia-dgx-spark-arrives-for-world-s-ai-miwr7d09ug0e.html
- CanItRun, DGX Spark Specs & Analyse: https://canitrun.dev/gpus/dgx-spark
- GPUwerk, DGX Spark Specs: https://gpuwerk.com/dgx-spark/specs
- LeCompute, RTX Spark vs DGX Spark (Preise 2026): https://lecompute.fr/en/silicon/rtx-spark-vs-dgx-spark
- BestLLMfor, RTX 3090 24GB Guide: https://bestllmfor.com/guides/best-local-llm-rtx-3090-24gb
- OpenClawDC, Best Local LLM for RTX 3090: https://openclawdc.com/blog/best-local-llm-rtx-3090
- LLMHardware, RTX 3090 LLM Guide: https://llmhardware.io/guides/rtx-3090-llm-guide
- SpecPicks, RTX 3090 vs 4090 (Preistracking): https://specpicks.com/reviews/rtx-3090-vs-rtx-4090-llm-inference-2026
- CraftRigs, RTX 3090 Best Value (März 2026): https://craftrigs.com/articles/77-rtx-3090-best-value-local-llm-gpu-march-2026
- LocalAIMaster, Best LLM for 24GB VRAM: https://localaimaster.com/vram/best-llm-24gb-vram
- BSWEN, RTX 3090 LLM Inference Value: https://docs.bswen.com/blog/2026-03-15-rtx-3090-llm-inference-value
- Artificial Analysis, Modell-Listenpreise (Stand 23.09.2026): https://artificialanalysis.ai/models
- Eigene Messung: cost-throttle-Monitor (~/.openclaw/cost-throttle.jsonl) und own-angle.py, Messzeitpunkt 29.09.2026 16:04 MESZ