Lokale KI

Gebrauchte RTX 3090 für lokale LLMs: tok/s und Kosten gegen DGX Spark gerechnet

Gebrauchte RTX 3090 für lokale LLMs: tok/s und Kosten gegen DGX Spark gerechnet

TL;DR

  • Eine gebrauchte RTX 3090 (24 GB GDDR6X, 936 GB/s) schafft mit Qwen-27B-Modellen in Q4 rund 30–35 tok/s — für grob 700–1.300 $ auf dem Gebrauchtmarkt 2026.
  • Der DGX Spark (Startpreis 3.999 $, MSRP inzwischen 4.699 $) bietet 128 GB Unified Memory, decodiert aber wegen 273 GB/s Bandbreite bei Modellen, die auf beide passen, nur etwa ein Drittel so schnell wie die 3090.
  • Aus unserem eigenen Betrieb: Seit dem Umzug auf den lokalen Cluster am 21.08.2026 liegt unsere API-Abrechnung bei 0 $/Tag — in den 30 Tagen davor waren es Ø 127,56 $/Tag.

Wer 2026 lokale LLMs betreiben will, stellt sich fast dieselbe Frage wie bei den Suchanfragen, die uns auf dieses Thema gebracht haben: dgx spark qwen 3.8 27b, qwen 3.8 27b 3090, qwen 3.8 27b dgx spark. Dahinter steckt eine einfache Abwägung — billige Gebraucht-GPU mit viel Bandbreite oder kompakte Blackwell-Box mit viel Speicher.

Wir haben beide Seiten durchgerechnet: die Community-Messungen zur 27B-Klasse, die Bandbreiten-Arithmetik und unsere eigenen Betriebszahlen aus dem Cluster, auf dem unsere Agenten laufen.

Die Hardware im Direktvergleich

Beide Systeme zielen auf dasselbe Szenario — Inferenz am Schreibtisch —, aber auf komplett unterschiedliche Weise:

RTX 3090 (gebraucht)DGX Spark (GB10)
Speicher24 GB GDDR6X128 GB LPDDR5X unified
Bandbreite936 GB/s273 GB/s
Klassenleader beiDecode-SpeedModellgröße (bis \~200B Params, FP4)
AI-Leistung142 TFLOPS FP16 (dense)1 PFLOP FP4 (sparse)
Verbrauch350 W TDP240 W Netzteil (GB10: 140 W)
Preis 2026\~700–1.300 \$ gebraucht3.999 \$ Start, 4.699 \$ MSRP seit Feb 2026

Die Preisstory hat sich 2026 gedreht: Wegen der DRAM-Knappheit sind gebrauchte 24-GB-Karten teurer geworden als die altbekannten 600-$-Richtwerte. Renewed Founders Editions wurden im September 2026 bei rund 1.550 $ gelistet. Der Spark hat parallel eine MSRP-Erhöhung auf 4.699 $ bekommen — ebenfalls LPDDR5X-bedingt.

tok/s: Was für Qwen 27B realistisch ist

Für die 27B-Klasse in Q4_K_M — etwa 17–18 GB Modellgewichte plus Kontext — liegt die Community-Messung für die RTX 3090 stabil bei 30–35 tok/s im Single-Stream-Decode. Größere 32B-Modelle in Q4 landen je nach Quelle bei 18–28 tok/s.

Die Bandbreiten-Arithmetik erklärt, warum: Bei ~16 GB Gewichte liegt das theoretische Decode-Ceiling der 3090 bei 936 ÷ 16 ≈ 58 tok/s, die Praxis liegt darunter. Der Spark rechnet dieselbe Rechnung mit 273 ÷ 16 ≈ 17 tok/s — geschätzt landet er in der Praxis bei grob 12–15 tok/s für ein 27B-Modell. Das ist eine Schätzung aus der Bandbreite, keine Messung.

Der Spark gibt an zwei anderen Stellen zurück: Beim Prompt Processing ist seine Blackwell-GPU compute-bound und deutlich schneller, und in seinen 128 GB passen Modelle, die auf keine 24-GB-Karte laufen. Für 27B-Klasse und schnellere Answers gewinnt die 3090, für 70B+ und lange Kontexte der Spark.

Unsere Messung: Kosten aus dem eigenen Betrieb

Unser Referenzmodell ist qwen3.8-flash-next-nvfp4, das auf unserem 4-Knoten-vLLM-Cluster läuft. Ehrlicherweise vorweg: Der geplante Benchmark-Lauf am 29.09.2026, 16:03 MESZ gegen den Cluster-Endpoint (OpenAI-kompatible API, 3 Single-Stream-Läufe plus 8 parallele Streams, max_tokens 256) ist an HTTP-500-Fehlern des Servers gescheitert — tok/s- und TTFT-Zahlen aus dem eigenen Cluster folgen in einem Nachmessungspost. Der Endpoint war erreichbar und listete beide Modelle, nur die Completions schlugen fehl. Auch ein manueller Recheck gegen 16:10 MESZ ergab weiterhin 500. Genau diese Betriebsrealität gehört zur Selbst-Hosting-Rechnung dazu.

Die Kostenseite haben wir dafür vollständig aus den eigenen Logs — der letzte Messzeitpunkt ist der 29.09.2026, 16:04 MESZ:

Cloud-Modell\$/1M (blended)€/1M
Qwen3.8 Max (0902)3,02,76
Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)8,07,36
Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)20,018,4
MiMo-V2.6-Pro0,540,5
Muse Spark 1.3 (max)2,01,84

Listenpreise: artificialanalysis, Stand 23.09.2026; blended im Verhältnis 3:1 Input:Output — Output-only wäre teurer.

Unsere API-Ausgaben laut cost-throttle-Monitor (86 geloggte Tage, 05.07. bis 29.09.2026): Spitze 268,59 $/Tag am 11.08.2026, Ø 127,56 $/Tag in den 30 Tagen vor dem 21.08.2026 — und seit dem 21.08.2026 exakt 0,00 $/Tag. Der Umzug auf den lokalen Cluster ist der Grund für den Sprung auf null.

Rechnen wir das hoch: 127,56 $/Tag entsprechen umgerechnet (Kurs 0,92) rund 117 €/Tag, also grob 3.500 €/Monat bzw. 42.000 €/Jahr Cloud-Ausgabe, die entfällt. Dem stehen als Annahmen gegenüber — das ist eine Obergrenzen-Rechnung, keine Messung: 4 Knoten × 240 W Nennleistung (Netzteil-Limit, nicht gemessen) = 960 W; bei 24/7-Betrieb 23,04 kWh/Tag; mit angenommenem Gewerbestrom von 0,35 €/kWh (DE 2026, anpassbar) rund 8 €/Tag bzw. ~242 €/Monat. Selbst bei permanenter Volllast bleibt der Strom also unter einem Vierzehntel der früheren Cloud-Ausgaben — und real laufen die Knoten nicht rund um die Uhr auf Maximallast.

Was uns fehlt, ist die dritte Zahl: €/1M Tokens lokal. Die lässt sich erst seriös berechnen, wenn der Benchmark-Lauf nach dem Server-Fix durchgelaufen ist — der Faktor-Spalte in unserer eigenen Tabelle ist deshalb heute bewusst leer.

Einordnung: Wann 3090, wann Spark

  • Gebrauchte RTX 3090, wenn: 27B-Klasse in Q4 mit 30–35 tok/s reicht, das Budget unter 1.500 $ liegen muss und du ein Gehäuse mit 350-W-Karte kühlen kannst.
  • DGX Spark, wenn: Modelle bis ~200B (FP4) lokal laufen sollen, Prompt-Processing langer Kontexte zählt und ~4.700 $ plus Strom im Rahmen sind.
  • Beides, wenn: Die 3090 als schnelle Decode-Maschine für die täglichen Agenten läuft und der Spark als Speicher-Riese für die großen Modelle dazukommt — genau so ist unser Cluster aufgestellt.

Fazit

Die gebrauchte RTX 3090 bleibt 2026 der Preis-Leistungs-König für die 27B-Klasse: mehr Decode-Bandbreite als jeder Deskop-Blackwell-Box zu einem Bruchteil des Preises. Der DGX Spark kauft sich keine Geschwindigkeit, sondern Speicher — und rechnet sich erst, wenn man die Modellgröße auch wirklich braucht. Unsere eigenen Zahlen belegen die zweite Hälfte der Rechnung eindrucksvoll: 127,56 $/Tag Cloud wurden zu 0 $/Tag plus ein paar Euro Strom.

FAQ

Wie viele tok/s schafft eine gebrauchte RTX 3090 mit Qwen 3.8 27B?

In Q4_K_M liegen Community-Messungen stabil bei 30–35 tok/s im Single-Stream-Decode, bei einem VRAM-Bedarf von etwa 17–18 GB inklusive Kontext. Die Streuung zwischen Quellen kommt aus Quantisierung, Kontextlänge und Framework. Zum Vergleich: 32B-Modelle in Q4 laufen auf derselben Karte mit 18–28 tok/s.

Ist die 3090 2026 angesichts steigender Gebrauchtpreise noch lohnend?

Ja, aber die Kalkulation hat sich verschoben. Wegen der DRAM-Knappheit liegen gebrauchte 3090er 2026 eher bei 700–1.300 $ statt bei den oft zitierten 600–800 $, renewed Founders Editions bei ~1.550 . Immer noch bekommt niemand anders 24 GB VRAM zu dem Preis — der relative Vorteil bleibt, der absolute ist geschrumpft.

Läuft Qwen 3.8 27B schneller auf dem DGX Spark?

Beim Decode nein: Mit 273 GB/s Bandbreite ist der Spark bei Modellen, die auf beide Systeme passen, grob ein Drittel so schnell wie die 3090 — geschätzt ~12–15 tok/s für ein 27B-Modell. Seine Stärken sind Prompt Processing langer Kontexte und die 128 GB, mit denen Modelle bis ~200B Parameter (FP4) laufen. Für die 27B-Klasse ist die 3090 die schnellere Wahl.

Was kostet lokaler Betrieb an Strom?

Eine einzelne 3090 zieht bis 350 W — bei Dauerdauerlast und 0,35 €/kWh wären das grob 2,9 €/Tag. Unser 4-Knoten-Cluster liegt als Annahme bei 4 × 240 W Nennleistung, also ~8 €/Tag bei 24/7-Vollast. Beide Werte sind Obergrenzen-Rechnungen, keine Messungen, weil die Knoten nicht permanent auf Maximallast laufen.

Wie starte ich einen 27B lokal durch, um es selbst zu messen?

Der kürzeste Weg ist ein OpenAI-kompatibler Server, gegen den du dann tok/s und TTFT messen kannst. Wir selbst laufen mit vLLM auf dem Cluster; für Einzel-GPUs sind llama.cpp und Ollama die pragmatischeren Einstiege. Wichtig für belastbare Zahlen: mehrere Läufe, feste Output-Token-Zahl und getrennte Betrachtung von TTFT und Decode-Rate.

bash
vllm serve qwen3.8-flash-next-nvfp4 --port 8212
# Messung: 3 Läufe, 256 Output-Tokens, TTFT und Decode tok/s getrennt loggen

Quellen

Thema für Ihr Team? Sprechen wir 30 Minuten.

Wir ordnen ein, was davon in Ihrem Unternehmen trägt — konkret, ohne Folienschlacht.

Unverbindlich · 30 Minuten · Angebot in 48 h