---
type: "BlogPosting"
title: "Gebrauchte RTX 3090 für lokale LLMs: tok/s und Kosten gegen DGX Spark gerechnet"
description: "Eine gebrauchte RTX 3090 decodiert Qwen-27B in Q4 mit 30–35 tok/s — und unser Cluster-Betrieb senkte die API-Kosten von 127,56 $/Tag auf 0 $/Tag. Alle Zahlen gegen den DGX Spark."
resource: "https://www.contextstudios.ai/de/blog/gebrauchte-rtx-3090-lokale-llms-tok-s-kosten-gegen-dgx-spark"
language: "de"
tags: ["Lokale KI", "Hardware", "LLM", "DGX Spark", "RTX 3090"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-01T23:11:23.374Z"
status: "stable"
---

# Gebrauchte RTX 3090 für lokale LLMs: tok/s und Kosten gegen DGX Spark gerechnet

Published: 2026-09-29
Tags: Lokale KI, Hardware, LLM, DGX Spark, RTX 3090

![Gebrauchte RTX 3090 für lokale LLMs: tok/s und Kosten gegen DGX Spark gerechnet](https://wary-platypus-754.convex.cloud/api/storage/14a7fcb5-a08c-4921-bbbc-ff3ed68904ae)

**TL;DR**
- Eine **gebrauchte RTX 3090** (24 GB GDDR6X, 936 GB/s) schafft mit Qwen-27B-Modellen in Q4 rund **30–35 tok/s** — für grob **700–1.300 \$** auf dem Gebrauchtmarkt 2026.
- Der **DGX Spark** (Startpreis 3.999 \$, MSRP inzwischen 4.699 \$) bietet 128 GB Unified Memory, decodiert aber wegen **273 GB/s** Bandbreite bei Modellen, die auf beide passen, nur etwa ein Drittel so schnell wie die 3090.
- Aus unserem eigenen Betrieb: Seit dem Umzug auf den lokalen Cluster am **21.08.2026** liegt unsere API-Abrechnung bei **0 \$/Tag** — in den 30 Tagen davor waren es Ø **127,56 \$/Tag**.

Wer 2026 lokale LLMs betreiben will, stellt sich fast dieselbe Frage wie bei den Suchanfragen, die uns auf dieses Thema gebracht haben: dgx spark qwen 3.8 27b, qwen 3.8 27b 3090, qwen 3.8 27b dgx spark. Dahinter steckt eine einfache Abwägung — billige Gebraucht-GPU mit viel Bandbreite oder kompakte Blackwell-Box mit viel Speicher.

Wir haben beide Seiten durchgerechnet: die Community-Messungen zur 27B-Klasse, die Bandbreiten-Arithmetik und unsere eigenen Betriebszahlen aus dem Cluster, auf dem unsere Agenten laufen.

## Die Hardware im Direktvergleich

Beide Systeme zielen auf dasselbe Szenario — Inferenz am Schreibtisch —, aber auf komplett unterschiedliche Weise:

<table header-row="true">
<tr>
<td></td>
<td>RTX 3090 (gebraucht)</td>
<td>DGX Spark (GB10)</td>
</tr>
<tr>
<td>Speicher</td>
<td>24 GB GDDR6X</td>
<td>128 GB LPDDR5X unified</td>
</tr>
<tr>
<td>Bandbreite</td>
<td>936 GB/s</td>
<td>273 GB/s</td>
</tr>
<tr>
<td>Klassenleader bei</td>
<td>Decode-Speed</td>
<td>Modellgröße (bis \~200B Params, FP4)</td>
</tr>
<tr>
<td>AI-Leistung</td>
<td>142 TFLOPS FP16 (dense)</td>
<td>1 PFLOP FP4 (sparse)</td>
</tr>
<tr>
<td>Verbrauch</td>
<td>350 W TDP</td>
<td>240 W Netzteil (GB10: 140 W)</td>
</tr>
<tr>
<td>Preis 2026</td>
<td>\~700–1.300 \$ gebraucht</td>
<td>3.999 \$ Start, 4.699 \$ MSRP seit Feb 2026</td>
</tr>
</table>

Die Preisstory hat sich 2026 gedreht: Wegen der DRAM-Knappheit sind gebrauchte 24-GB-Karten teurer geworden als die altbekannten 600-\$-Richtwerte. Renewed Founders Editions wurden im September 2026 bei rund 1.550 \$ gelistet. Der Spark hat parallel eine MSRP-Erhöhung auf 4.699 \$ bekommen — ebenfalls LPDDR5X-bedingt.

## tok/s: Was für Qwen 27B realistisch ist

Für die 27B-Klasse in Q4_K_M — etwa 17–18 GB Modellgewichte plus Kontext — liegt die Community-Messung für die RTX 3090 stabil bei **30–35 tok/s** im Single-Stream-Decode. Größere 32B-Modelle in Q4 landen je nach Quelle bei 18–28 tok/s.

Die Bandbreiten-Arithmetik erklärt, warum: Bei \~16 GB Gewichte liegt das theoretische Decode-Ceiling der 3090 bei 936 ÷ 16 ≈ 58 tok/s, die Praxis liegt darunter. Der Spark rechnet dieselbe Rechnung mit 273 ÷ 16 ≈ 17 tok/s — geschätzt landet er in der Praxis bei grob 12–15 tok/s für ein 27B-Modell. Das ist eine Schätzung aus der Bandbreite, keine Messung.

Der Spark gibt an zwei anderen Stellen zurück: Beim **Prompt Processing** ist seine Blackwell-GPU compute-bound und deutlich schneller, und in seinen 128 GB passen Modelle, die auf keine 24-GB-Karte laufen. Für 27B-Klasse und schnellere Answers gewinnt die 3090, für 70B+ und lange Kontexte der Spark.

## Unsere Messung: Kosten aus dem eigenen Betrieb

Unser Referenzmodell ist **qwen3.8-flash-next-nvfp4**, das auf unserem 4-Knoten-vLLM-Cluster läuft. Ehrlicherweise vorweg: Der geplante Benchmark-Lauf am **29.09.2026, 16:03 MESZ** gegen den Cluster-Endpoint (OpenAI-kompatible API, 3 Single-Stream-Läufe plus 8 parallele Streams, max_tokens 256) ist an HTTP-500-Fehlern des Servers gescheitert — tok/s- und TTFT-Zahlen aus dem eigenen Cluster folgen in einem Nachmessungspost. Der Endpoint war erreichbar und listete beide Modelle, nur die Completions schlugen fehl. Auch ein manueller Recheck gegen 16:10 MESZ ergab weiterhin 500. Genau diese Betriebsrealität gehört zur Selbst-Hosting-Rechnung dazu.

Die Kostenseite haben wir dafür vollständig aus den eigenen Logs — der letzte Messzeitpunkt ist der 29.09.2026, 16:04 MESZ:

<table header-row="true">
<tr>
<td>Cloud-Modell</td>
<td>\$/1M (blended)</td>
<td>€/1M</td>
</tr>
<tr>
<td>Qwen3.8 Max (0902)</td>
<td>3,0</td>
<td>2,76</td>
</tr>
<tr>
<td>Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)</td>
<td>8,0</td>
<td>7,36</td>
</tr>
<tr>
<td>Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)</td>
<td>20,0</td>
<td>18,4</td>
</tr>
<tr>
<td>MiMo-V2.6-Pro</td>
<td>0,54</td>
<td>0,5</td>
</tr>
<tr>
<td>Muse Spark 1.3 (max)</td>
<td>2,0</td>
<td>1,84</td>
</tr>
</table>

Listenpreise: artificialanalysis, Stand 23.09.2026; blended im Verhältnis 3:1 Input:Output — Output-only wäre teurer.

Unsere API-Ausgaben laut cost-throttle-Monitor (86 geloggte Tage, 05.07. bis 29.09.2026): Spitze **268,59 \$/Tag** am 11.08.2026, Ø **127,56 \$/Tag** in den 30 Tagen vor dem 21.08.2026 — und seit dem 21.08.2026 exakt **0,00 \$/Tag**. Der Umzug auf den lokalen Cluster ist der Grund für den Sprung auf null.

Rechnen wir das hoch: 127,56 \$/Tag entsprechen umgerechnet (Kurs 0,92) rund 117 €/Tag, also grob **3.500 €/Monat** bzw. **42.000 €/Jahr** Cloud-Ausgabe, die entfällt. Dem stehen als Annahmen gegenüber — das ist eine Obergrenzen-Rechnung, keine Messung: 4 Knoten × 240 W Nennleistung (Netzteil-Limit, nicht gemessen) = 960 W; bei 24/7-Betrieb 23,04 kWh/Tag; mit angenommenem Gewerbestrom von 0,35 €/kWh (DE 2026, anpassbar) rund **8 €/Tag** bzw. \~242 €/Monat. Selbst bei permanenter Volllast bleibt der Strom also unter einem Vierzehntel der früheren Cloud-Ausgaben — und real laufen die Knoten nicht rund um die Uhr auf Maximallast.

Was uns fehlt, ist die dritte Zahl: €/1M Tokens lokal. Die lässt sich erst seriös berechnen, wenn der Benchmark-Lauf nach dem Server-Fix durchgelaufen ist — der Faktor-Spalte in unserer eigenen Tabelle ist deshalb heute bewusst leer.

## Einordnung: Wann 3090, wann Spark

- **Gebrauchte RTX 3090**, wenn: 27B-Klasse in Q4 mit 30–35 tok/s reicht, das Budget unter 1.500 \$ liegen muss und du ein Gehäuse mit 350-W-Karte kühlen kannst.
- **DGX Spark**, wenn: Modelle bis \~200B (FP4) lokal laufen sollen, Prompt-Processing langer Kontexte zählt und \~4.700 \$ plus Strom im Rahmen sind.
- **Beides**, wenn: Die 3090 als schnelle Decode-Maschine für die täglichen Agenten läuft und der Spark als Speicher-Riese für die großen Modelle dazukommt — genau so ist unser Cluster aufgestellt.

## Fazit

Die gebrauchte RTX 3090 bleibt 2026 der Preis-Leistungs-König für die 27B-Klasse: mehr Decode-Bandbreite als jeder Deskop-Blackwell-Box zu einem Bruchteil des Preises. Der DGX Spark kauft sich keine Geschwindigkeit, sondern Speicher — und rechnet sich erst, wenn man die Modellgröße auch wirklich braucht. Unsere eigenen Zahlen belegen die zweite Hälfte der Rechnung eindrucksvoll: 127,56 \$/Tag Cloud wurden zu 0 \$/Tag plus ein paar Euro Strom.

## FAQ

**Wie viele tok/s schafft eine gebrauchte RTX 3090 mit Qwen 3.8 27B?**

In Q4_K_M liegen Community-Messungen stabil bei 30–35 tok/s im Single-Stream-Decode, bei einem VRAM-Bedarf von etwa 17–18 GB inklusive Kontext. Die Streuung zwischen Quellen kommt aus Quantisierung, Kontextlänge und Framework. Zum Vergleich: 32B-Modelle in Q4 laufen auf derselben Karte mit 18–28 tok/s.

**Ist die 3090 2026 angesichts steigender Gebrauchtpreise noch lohnend?**

Ja, aber die Kalkulation hat sich verschoben. Wegen der DRAM-Knappheit liegen gebrauchte 3090er 2026 eher bei 700–1.300 \$ statt bei den oft zitierten 600–800 \$, renewed Founders Editions bei \~1.550 \. Immer noch bekommt niemand anders 24 GB VRAM zu dem Preis — der relative Vorteil bleibt, der absolute ist geschrumpft.

**Läuft Qwen 3.8 27B schneller auf dem DGX Spark?**

Beim Decode nein: Mit 273 GB/s Bandbreite ist der Spark bei Modellen, die auf beide Systeme passen, grob ein Drittel so schnell wie die 3090 — geschätzt \~12–15 tok/s für ein 27B-Modell. Seine Stärken sind Prompt Processing langer Kontexte und die 128 GB, mit denen Modelle bis \~200B Parameter (FP4) laufen. Für die 27B-Klasse ist die 3090 die schnellere Wahl.

**Was kostet lokaler Betrieb an Strom?**

Eine einzelne 3090 zieht bis 350 W — bei Dauerdauerlast und 0,35 €/kWh wären das grob 2,9 €/Tag. Unser 4-Knoten-Cluster liegt als Annahme bei 4 × 240 W Nennleistung, also \~8 €/Tag bei 24/7-Vollast. Beide Werte sind Obergrenzen-Rechnungen, keine Messungen, weil die Knoten nicht permanent auf Maximallast laufen.

**Wie starte ich einen 27B lokal durch, um es selbst zu messen?**

Der kürzeste Weg ist ein OpenAI-kompatibler Server, gegen den du dann tok/s und TTFT messen kannst. Wir selbst laufen mit vLLM auf dem Cluster; für Einzel-GPUs sind llama.cpp und Ollama die pragmatischeren Einstiege. Wichtig für belastbare Zahlen: mehrere Läufe, feste Output-Token-Zahl und getrennte Betrachtung von TTFT und Decode-Rate.

```bash
vllm serve qwen3.8-flash-next-nvfp4 --port 8212
# Messung: 3 Läufe, 256 Output-Tokens, TTFT und Decode tok/s getrennt loggen
```

## Quellen

- NVIDIA-Pressemitteilung (via StockTitan): [https://www.stocktitan.net/news/NVDA/nvidia-dgx-spark-arrives-for-world-s-ai-miwr7d09ug0e.html](https://www.stocktitan.net/news/NVDA/nvidia-dgx-spark-arrives-for-world-s-ai-miwr7d09ug0e.html)
- CanItRun, DGX Spark Specs & Analyse: [https://canitrun.dev/gpus/dgx-spark](https://canitrun.dev/gpus/dgx-spark)
- GPUwerk, DGX Spark Specs: [https://gpuwerk.com/dgx-spark/specs](https://gpuwerk.com/dgx-spark/specs)
- LeCompute, RTX Spark vs DGX Spark (Preise 2026): [https://lecompute.fr/en/silicon/rtx-spark-vs-dgx-spark](https://lecompute.fr/en/silicon/rtx-spark-vs-dgx-spark)
- BestLLMfor, RTX 3090 24GB Guide: [https://bestllmfor.com/guides/best-local-llm-rtx-3090-24gb](https://bestllmfor.com/guides/best-local-llm-rtx-3090-24gb)
- OpenClawDC, Best Local LLM for RTX 3090: [https://openclawdc.com/blog/best-local-llm-rtx-3090](https://openclawdc.com/blog/best-local-llm-rtx-3090)
- LLMHardware, RTX 3090 LLM Guide: [https://llmhardware.io/guides/rtx-3090-llm-guide](https://llmhardware.io/guides/rtx-3090-llm-guide)
- SpecPicks, RTX 3090 vs 4090 (Preistracking): [https://specpicks.com/reviews/rtx-3090-vs-rtx-4090-llm-inference-2026](https://specpicks.com/reviews/rtx-3090-vs-rtx-4090-llm-inference-2026)
- CraftRigs, RTX 3090 Best Value (März 2026): [https://craftrigs.com/articles/77-rtx-3090-best-value-local-llm-gpu-march-2026](https://craftrigs.com/articles/77-rtx-3090-best-value-local-llm-gpu-march-2026)
- LocalAIMaster, Best LLM for 24GB VRAM: [https://localaimaster.com/vram/best-llm-24gb-vram](https://localaimaster.com/vram/best-llm-24gb-vram)
- BSWEN, RTX 3090 LLM Inference Value: [https://docs.bswen.com/blog/2026-03-15-rtx-3090-llm-inference-value](https://docs.bswen.com/blog/2026-03-15-rtx-3090-llm-inference-value)
- Artificial Analysis, Modell-Listenpreise (Stand 23.09.2026): [https://artificialanalysis.ai/models](https://artificialanalysis.ai/models)
- Eigene Messung: cost-throttle-Monitor (\~/.openclaw/cost-throttle.jsonl) und [own-angle.py](http://own-angle.py), Messzeitpunkt 29.09.2026 16:04 MESZ

## Related

- [LLM-Entwicklung](https://www.contextstudios.ai/de/llm-entwicklung.md)
- [KI-Entwicklung](https://www.contextstudios.ai/de/ki-entwicklung.md)
- [LLM-Integration](https://www.contextstudios.ai/de/llm-integration.md)
- [KI-Beratung](https://www.contextstudios.ai/de/ki-beratung.md)
