Local AI

Was kostet lokale KI wirklich? Die ehrliche Rechnung 2026

Was kostet lokale KI wirklich? Die ehrliche Rechnung 2026

„Damit spare ich ja die API-Kosten!" — dieser Satz stimmt selten. Wir haben nachgerechnet, mit echten Messwerten aus unserer Recipe-Datenbank und aktuellen Straßenpreisen: Bei den Flash-API-Preisen von 2026 ist Lokal-Rechnen kein Sparprogramm mehr — sondern ein Kontrolle-Programm. Wann sich Hardware trotzdem rechnet, zeigen wir mit Zahlen.

Die Anschaffung: was die vier Stufen 2026 kosten

Die Preise sind 2026 durch die Speicher-Knappheit gestiegen — die alten Blog-Rechnungen stimmen nicht mehr:

  • DGX Spark (128 GB unified): ~4.800 € (Straßenpreis DE; MSRP 3.999 € ist Geschichte)
  • Mac Studio M4 Max (128 GB): ~4.700 €
  • RTX 5090 System (32 GB VRAM): ~4.900 € (Karte ~4.000 € + Rest-PC)
  • RTX PRO 6000 System (96 GB VRAM): ~14.500 €

Die Stromrechnung — der unterschätzte Faktor

Mit deutschem Mischpreis (~0,35 €/kWh) und 8 Volllast-Stunden pro Tag:

  • Mac Studio M4 Max (~70 W Durchschnitt): ~72 €/Jahr
  • DGX Spark (~110 W): ~112 €/Jahr
  • RTX 5090 System (~320 W): ~327 €/Jahr
  • RTX PRO 6000 System (~380 W): ~388 €/Jahr

Der Mac ist der Strom-Champion, die RTX-Systeme kosten 3–5× so viel — über drei Jahre sind das 750–1.100 € Differenz. Nicht dramatisch, aber wenn jemand „Strom ist egal" sagt, rechnet er nicht mit deutschen Preisen.

Der Durchsatz: was die Maschinen real schaffen

Aus unserer Recipe-Datenbank (beste Single-Stream-Werte, Prosa-Workload):

  • DGX Spark: bis ~49–88 tok/s (DeepSeek V4.1 Flash, TP4-Setup: 87,7)
  • Mac Studio M4 Max: ~53 tok/s (Qwen3.8-27B)
  • RTX 5090: ~250 tok/s (Qwen3.6 35B-A3B, NVFP4)
  • RTX PRO 6000: ~207–235 tok/s

Bei 4 decoding-Stunden pro Tag schafft eine RTX 5090 rund 1,3 Milliarden Tokens im Jahr, eine DGX Spark ~256 Millionen.

Die ehrliche Gegenrechnung: API vs. lokal

Aktuelle Flash-API-Preise (September 2026, pro 1M Tokens): Qwen3.8-Flash 0,113 $ in / 0,382 $ out, GLM-5.3-Flash 0,15 $ / 0,50 $, DeepSeek V4.1 Flash 0,15 $ / 0,60 $ (off-peak).

Szenario „Power-User mit Agenten" (88M Input + 22M Output pro Monat, 4:1 typisch für Agent-Workloads): rund 220 €/Jahr bei der günstigsten API. Gegenüber ~1.960 €/Jahr (RTX-5090-System, 3-Jahres-Betrachtung) amortisiert sich die Hardware erst bei grob dem Zehnfachen an Volumen — etwa einer Milliarde Tokens pro Monat.

Was heißt das? Bei reinen Token-Kosten ist die API 2026 ungeschlagen. Die Rechnung dreht sich erst, wenn einer dieser Faktoren dazukommt:

  1. Datenschutz ist Pflicht: Patientendaten, Kundenverträge, interne Codebasen — in vielen Branchen (Arztpraxis, Anwaltskanzlei, Fertigung mit NDA-Material) ist der Cloud-Rundlauf gar keine Option. Dann ist der Vergleich nicht „Hardware vs. API", sondern „Hardware vs. teures Private-Hosting".
  2. Experimentierfreude: Wer 500 Testläufe gegen einen Prompt-Iterationsschleifer fährt, macht das lokal kostenlos und die API-Rechnung interessiert es nicht.Wer Feintuning, Eval-Suiten über Nacht und Multi-Modell-Pipelines fährt, verbraucht leicht das Zehnfache des „Power-User"-Szenarios — ohne dass es weh tut.
  3. Mehrfach-Nutzer: Eine RTX PRO 6000 (96 GB) serviert ein Team von 3–10 Leuten über vLLM. Pro Kopf wird die Rechnung plötzlich sehr schnell positiv.
  4. Skalierungsspitzen und Rate-Limits: API-Limits treffen Agent-Farmes genau dann, wenn es weh tut. Lokale Hardware skaliert nicht mit der Rechnung, sondern mit dem Stromzähler.

Die Ausnahme, die die Regel bestätigt

Batch-Workloads ohne Interaktivität: Vier Mac mini (M4 Pro, je 48 GB) in einem Cluster kosten ~7.000 €, ziehen zusammen ~200 W und verarbeiten nachts Queue-Jobs. Für „50 Millionen Tokens pro Nacht, Latenz egal" ist das das preislich beste Setup am Markt — die API-Rechnung dafür läge bei mehreren Hundert Euro im Monat.

Unser Fazit

Reine Kostenrechnung: Lokal amortisiert sich bei Flash-API-Preisen nur bei hohem Volumen, Teams oder Batch-Nachtbetrieb. Aber Kosten waren nie der Hauptgrund, lokal zu rechnen — Kontrolle ist es: Daten, die das Haus nicht verlassen; Experimente ohne Zähler; Modelle, die man selbst austauscht. Wer das braucht, für den ist die Hardware kein Kostenposten, sondern Infrastruktur.

Die Messwerte für diese Rechnung stammen aus der öffentlichen Recipe-Datenbank auf unserer Local-AI-Seite — inklusive der Hardware-Matrix, die zeigt, welches Modell auf welcher der vier Stufen real läuft.

Häufige Fragen

Rechnet sich eine DGX Spark gegenüber der API? Bei reinen Token-Kosten und Single-User-Workload: meist nein innerhalb von 3 Jahren — die Flash-APIs sind 2026 zu günstig. Ja, wenn Datenschutz den Cloud-Einsatz ausschließt, du stark experimentierst (Feintuning, Evals, Multi-Modell) oder du das Gerät als CUDA-Entwicklungsbox für Cluster-Setups nutzt. Kauf sie für Kontrolle, nicht für Ersparnis.

Welche Hardware hat die besten Token-Euro? Für Modelle bis 32 GB: die RTX 5090 (höchster Einzeldurchsatz pro Euro). Für big-Memory bei minimalem Strom: Mac Studio. Für Team-Serving: RTX PRO 6000. Für CUDA-Parität und clusterbares Unified Memory: DGX Spark. Die Recipe-Datenbank listet zu jeder Stufe gemessene Rezepte — die Zahlen entscheiden, nicht die Marketing-Folien.

Was kostet lokales Rechnen pro Monat an Strom? Bei täglichem Gebrauch (8 Volllast-Stunden-Äquivalent): Mac Studio ~6 €, DGX Spark ~9 €, RTX-5090-System ~27 €, RTX-PRO-6000-System ~32 €. Im Idle-Modus liegt der Mac bei ~32 W (unter 10 €/Monat), die RTX-Systeme sollten ausgeschaltet werden.

Lohnt sich ein Cluster aus mehreren kleinen Geräten? Für Batch-Workloads ja — vier Mac minis poolen 192 GB für ~7.000 € und verarbeiten nachts Queues bei 200 W Gesamtverbrauch. Für interaktive Arbeit mit großen MoE-Modellen braucht man Tensor Parallel über schnelles Netz (RoCE), was Setup-Aufwand bedeutet. Unsere Recipes dokumentieren beides, von 2× Spark bis 4× Spark mit Messwerten.

Bleiben die API-Preise so niedrig? Die Flash-Preise sind seit Mitte 2026 weiter gefallen (DeepSeek off-peak 0,15 $/0,60 $). Gegenrechnung: Speicher- und GPU-Preise sind im selben Zeitraum gestiegen. Beide Seiten der Rechnung bewegen sich — unsere Empfehlung: Rechne mit deinen realen Volumina, nicht mit Pauschalen, und schau auf die Liste der Recipe-Datenbank, was deine Hardware-Klasse wirklich liefert.

Quellen

Thema für Ihr Team? Sprechen wir 30 Minuten.

Wir ordnen ein, was davon in Ihrem Unternehmen trägt — konkret, ohne Folienschlacht.

Unverbindlich · 30 Minuten · Angebot in 48 h