„Damit spare ich ja die API-Kosten!" — dieser Satz stimmt selten. Wir haben nachgerechnet, mit echten Messwerten aus unserer Recipe-Datenbank und aktuellen Straßenpreisen: Bei den Flash-API-Preisen von 2026 ist Lokal-Rechnen kein Sparprogramm mehr — sondern ein Kontrolle-Programm. Wann sich Hardware trotzdem rechnet, zeigen wir mit Zahlen.
Die Anschaffung: was die vier Stufen 2026 kosten
Die Preise sind 2026 durch die Speicher-Knappheit gestiegen — die alten Blog-Rechnungen stimmen nicht mehr:
- DGX Spark (128 GB unified): ~4.800 € (Straßenpreis DE; MSRP 3.999 € ist Geschichte)
- Mac Studio M4 Max (128 GB): ~4.700 €
- RTX 5090 System (32 GB VRAM): ~4.900 € (Karte ~4.000 € + Rest-PC)
- RTX PRO 6000 System (96 GB VRAM): ~14.500 €
Die Stromrechnung — der unterschätzte Faktor
Mit deutschem Mischpreis (~0,35 €/kWh) und 8 Volllast-Stunden pro Tag:
- Mac Studio M4 Max (~70 W Durchschnitt): ~72 €/Jahr
- DGX Spark (~110 W): ~112 €/Jahr
- RTX 5090 System (~320 W): ~327 €/Jahr
- RTX PRO 6000 System (~380 W): ~388 €/Jahr
Der Mac ist der Strom-Champion, die RTX-Systeme kosten 3–5× so viel — über drei Jahre sind das 750–1.100 € Differenz. Nicht dramatisch, aber wenn jemand „Strom ist egal" sagt, rechnet er nicht mit deutschen Preisen.
Der Durchsatz: was die Maschinen real schaffen
Aus unserer Recipe-Datenbank (beste Single-Stream-Werte, Prosa-Workload):
- DGX Spark: bis ~49–88 tok/s (DeepSeek V4.1 Flash, TP4-Setup: 87,7)
- Mac Studio M4 Max: ~53 tok/s (Qwen3.8-27B)
- RTX 5090: ~250 tok/s (Qwen3.6 35B-A3B, NVFP4)
- RTX PRO 6000: ~207–235 tok/s
Bei 4 decoding-Stunden pro Tag schafft eine RTX 5090 rund 1,3 Milliarden Tokens im Jahr, eine DGX Spark ~256 Millionen.
Die ehrliche Gegenrechnung: API vs. lokal
Aktuelle Flash-API-Preise (September 2026, pro 1M Tokens): Qwen3.8-Flash 0,113 $ in / 0,382 $ out, GLM-5.3-Flash 0,15 $ / 0,50 $, DeepSeek V4.1 Flash 0,15 $ / 0,60 $ (off-peak).
Szenario „Power-User mit Agenten" (88M Input + 22M Output pro Monat, 4:1 typisch für Agent-Workloads): rund 220 €/Jahr bei der günstigsten API. Gegenüber ~1.960 €/Jahr (RTX-5090-System, 3-Jahres-Betrachtung) amortisiert sich die Hardware erst bei grob dem Zehnfachen an Volumen — etwa einer Milliarde Tokens pro Monat.
Was heißt das? Bei reinen Token-Kosten ist die API 2026 ungeschlagen. Die Rechnung dreht sich erst, wenn einer dieser Faktoren dazukommt:
- Datenschutz ist Pflicht: Patientendaten, Kundenverträge, interne Codebasen — in vielen Branchen (Arztpraxis, Anwaltskanzlei, Fertigung mit NDA-Material) ist der Cloud-Rundlauf gar keine Option. Dann ist der Vergleich nicht „Hardware vs. API", sondern „Hardware vs. teures Private-Hosting".
- Experimentierfreude: Wer 500 Testläufe gegen einen Prompt-Iterationsschleifer fährt, macht das lokal kostenlos und die API-Rechnung interessiert es nicht.Wer Feintuning, Eval-Suiten über Nacht und Multi-Modell-Pipelines fährt, verbraucht leicht das Zehnfache des „Power-User"-Szenarios — ohne dass es weh tut.
- Mehrfach-Nutzer: Eine RTX PRO 6000 (96 GB) serviert ein Team von 3–10 Leuten über vLLM. Pro Kopf wird die Rechnung plötzlich sehr schnell positiv.
- Skalierungsspitzen und Rate-Limits: API-Limits treffen Agent-Farmes genau dann, wenn es weh tut. Lokale Hardware skaliert nicht mit der Rechnung, sondern mit dem Stromzähler.
Die Ausnahme, die die Regel bestätigt
Batch-Workloads ohne Interaktivität: Vier Mac mini (M4 Pro, je 48 GB) in einem Cluster kosten ~7.000 €, ziehen zusammen ~200 W und verarbeiten nachts Queue-Jobs. Für „50 Millionen Tokens pro Nacht, Latenz egal" ist das das preislich beste Setup am Markt — die API-Rechnung dafür läge bei mehreren Hundert Euro im Monat.
Unser Fazit
Reine Kostenrechnung: Lokal amortisiert sich bei Flash-API-Preisen nur bei hohem Volumen, Teams oder Batch-Nachtbetrieb. Aber Kosten waren nie der Hauptgrund, lokal zu rechnen — Kontrolle ist es: Daten, die das Haus nicht verlassen; Experimente ohne Zähler; Modelle, die man selbst austauscht. Wer das braucht, für den ist die Hardware kein Kostenposten, sondern Infrastruktur.
Die Messwerte für diese Rechnung stammen aus der öffentlichen Recipe-Datenbank auf unserer Local-AI-Seite — inklusive der Hardware-Matrix, die zeigt, welches Modell auf welcher der vier Stufen real läuft.
Häufige Fragen
Rechnet sich eine DGX Spark gegenüber der API? Bei reinen Token-Kosten und Single-User-Workload: meist nein innerhalb von 3 Jahren — die Flash-APIs sind 2026 zu günstig. Ja, wenn Datenschutz den Cloud-Einsatz ausschließt, du stark experimentierst (Feintuning, Evals, Multi-Modell) oder du das Gerät als CUDA-Entwicklungsbox für Cluster-Setups nutzt. Kauf sie für Kontrolle, nicht für Ersparnis.
Welche Hardware hat die besten Token-Euro? Für Modelle bis 32 GB: die RTX 5090 (höchster Einzeldurchsatz pro Euro). Für big-Memory bei minimalem Strom: Mac Studio. Für Team-Serving: RTX PRO 6000. Für CUDA-Parität und clusterbares Unified Memory: DGX Spark. Die Recipe-Datenbank listet zu jeder Stufe gemessene Rezepte — die Zahlen entscheiden, nicht die Marketing-Folien.
Was kostet lokales Rechnen pro Monat an Strom? Bei täglichem Gebrauch (8 Volllast-Stunden-Äquivalent): Mac Studio ~6 €, DGX Spark ~9 €, RTX-5090-System ~27 €, RTX-PRO-6000-System ~32 €. Im Idle-Modus liegt der Mac bei ~32 W (unter 10 €/Monat), die RTX-Systeme sollten ausgeschaltet werden.
Lohnt sich ein Cluster aus mehreren kleinen Geräten? Für Batch-Workloads ja — vier Mac minis poolen 192 GB für ~7.000 € und verarbeiten nachts Queues bei 200 W Gesamtverbrauch. Für interaktive Arbeit mit großen MoE-Modellen braucht man Tensor Parallel über schnelles Netz (RoCE), was Setup-Aufwand bedeutet. Unsere Recipes dokumentieren beides, von 2× Spark bis 4× Spark mit Messwerten.
Bleiben die API-Preise so niedrig? Die Flash-Preise sind seit Mitte 2026 weiter gefallen (DeepSeek off-peak 0,15 $/0,60 $). Gegenrechnung: Speicher- und GPU-Preise sind im selben Zeitraum gestiegen. Beide Seiten der Rechnung bewegen sich — unsere Empfehlung: Rechne mit deinen realen Volumina, nicht mit Pauschalen, und schau auf die Liste der Recipe-Datenbank, was deine Hardware-Klasse wirklich liefert.
Quellen
- Local AI — Context Studios (Recipe-Datenbank und Hardware-Matrix)
- LLMRequirements — Hardware-Preise und Changelog 2026 (Straßenpreise DGX Spark, RTX PRO 6000, Mac Studio)
- LLMRequirements — Changelog (Preisbewegungen 2026, DRAM-Knappheit)
- AISuffer — Best Hardware to Run Local LLMs 2026 (Stromverbräuche, Kauf-Hub)
- Fernando Nog — API-Pricing-Snapshot DeepSeek V4.1 Flash / GLM-5.3-Flash / Qwen3.8-Flash (September 2026)
- MiaAI-Lab — DeepSeek V4.1 Flash TP4 auf 4× DGX Sparks (87,7 tok/s Messung)