---
type: "BlogPosting"
title: "Lokale KI-Hardware 2026: DGX Spark, Mac Studio M5 Ultra, RTX 5090 und Strix Halo im Vergleich"
description: "Welche Hardware bringt 2026 die meisten Tokens pro Euro? Vergleichstabelle, Tokens/s nach Modell und Hardware, unsere eigene DGX-Spark-Messung und Kosten pro Token gegenüber der Cloud."
resource: "https://www.contextstudios.ai/de/blog/local-ai-hardware-guide-2026"
language: "de"
tags: ["Lokale KI", "Hardware", "LLM", "DGX Spark", "Mac Studio", "Benchmarks"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-02T19:06:31.241Z"
status: "stable"
---

# Lokale KI-Hardware 2026: DGX Spark, Mac Studio M5 Ultra, RTX 5090 und Strix Halo im Vergleich

Published: 2026-09-24
Tags: Lokale KI, Hardware, LLM, DGX Spark, Mac Studio, Benchmarks

![Lokale KI-Hardware 2026: DGX Spark, Mac Studio M5 Ultra, RTX 5090 und Strix Halo im Vergleich](https://wary-platypus-754.convex.cloud/api/storage/71fd5c0a-fafb-4e57-bf67-3edad32a50d9)

> **Update-Log**
> - **24.09.2026:** Erste Fassung. Abgedeckt sind DGX Spark/GB10, AMD Strix Halo, RTX 3090/4090/5090/PRO 6000, MacBook Pro M5 Max und der neue Mac Studio M5 Ultra (Auslieferung seit 22.09.2026). Dazu kommt unser eigener Benchmark vom 24.09.2026 mit GLM-5.3-Flash und Qwen3.8-Flash-Next auf je zwei DGX-Spark-Knoten. Preise: Stand September 2026.
> - **Nächste Aktualisierung:** 01.10.2026. Wir aktualisieren monatlich mit neuen Modellen, neuen Preisen und frischen Messungen.

**Kurz gesagt:** Wie schnell eine einzelne Unterhaltung läuft, bestimmt die Speicherbandbreite. Ob ein Modell überhaupt passt, bestimmt die Speichergröße. Eine gebrauchte RTX 3090 ist im September 2026 immer noch der günstigste Weg zu schnellen Tokens mit einem 27B-Modell. Der Mac Studio M5 Ultra (1,2 TB/s, bis 512 GB) ist die schnellste Einzelplatz-Maschine für große MoE-Modelle. Die DGX Spark gewinnt, wenn ihr CUDA, Clustering und mehrere parallele Anfragen braucht. Strix Halo liefert 128 GB Speicher zum niedrigsten Preis, verarbeitet lange Prompts aber langsam.

Wir betreiben bei Context Studios DGX-Spark-Knoten (ASUS Ascent GX10 mit NVIDIA GB10) mit vLLM im Produktivbetrieb, dazu einen Mac mini als Agent-Host. In diesem Guide stehen unsere eigenen Messungen neben den besten öffentlich dokumentierten Zahlen. Bei jeder Zahl steht, woher sie kommt.

## Die eine Regel hinter allen Benchmarks

Die Decode-Geschwindigkeit, also die Tokens, die ihr lest, ergibt sich grob aus **Speicherbandbreite ÷ gelesene Bytes pro Token**. Prefill, also das Einlesen eures Prompts, hängt an der **Rechenleistung**. Die Speichergröße entscheidet, **ob das Modell überhaupt passt**.

Mixture-of-Experts-Modelle (MoE) wie Qwen3.8-Flash-Next (ca. 6B aktive Parameter) oder GLM-5.3-Flash (320B gesamt, 18B aktiv) lesen pro Token nur einen kleinen Teil ihrer Gewichte. Deshalb laufen sie auf einer 128-GB-Box mit 273 GB/s brauchbar schnell, während ein dichtes 70B-Modell auf derselben Maschine kriecht.

## Vergleichstabelle (September 2026)

| Hardware | Speicher | Bandbreite | Preis (Sep. 2026) | Leistung unter Last | Passender Stack |
|---|---|---|---|---|---|
| NVIDIA DGX Spark / ASUS GX10 (GB10) | 128 GB Unified | 273 GB/s | 4.699 $ Liste (US), ab 5.038 € netto (EU) | ca. 160 W | vLLM, SGLang, EXL3, llama.cpp |
| AMD Ryzen AI Max+ 395 (Framework, EVO-X2) | 128 GB Unified (ca. 96–100 GB für die GPU) | ca. 256 GB/s | 3.449–3.650 $ (128 GB) | ca. 112–120 W | llama.cpp Vulkan/ROCm |
| RTX 3090 (gebraucht) | 24 GB | 936 GB/s | ca. 1.050–1.264 $ | 250–350 W | vLLM, llama.cpp, EXL3 |
| RTX 4090 (gebraucht) | 24 GB | 1.008 GB/s | ca. 2.268–2.362 $ | ca. 450 W | vLLM, llama.cpp |
| RTX 5090 | 32 GB | 1.792 GB/s | 1.999 $ UVP, ca. 4.700 $ im Handel | ca. 575 W | vLLM, llama.cpp, NVFP4 |
| RTX PRO 6000 Blackwell | 96 GB | ca. 1,8 TB/s | 16.000 $ (Sep. 2026) | bis 600 W | vLLM, SGLang, NVFP4 |
| MacBook Pro M5 Max | bis 128 GB | 614 GB/s | nicht verifiziert | Laptop | MLX, mlx-serve, llama.cpp |
| Mac Studio M5 Ultra | 96/256/512 GB | 1,2 TB/s | ab 5.499 $; 512 GB ab Oktober | unter LLM-Last noch nicht gemessen | MLX, LM Studio, llama.cpp |

Die Preise sind 2026 stark gestiegen, weil DRAM und GDDR7 knapp sind. Die RTX PRO 6000 liegt rund 87 % über ihrer Launch-UVP, der GMKtec EVO-X2 mit 128 GB kletterte von 1.999 $ auf 3.499–3.650 $. Euro-Preise für die meisten Grafikkarten und Macs konnten wir noch nicht sauber belegen, deshalb stehen dort US-Preise.

## Welches Modell auf welcher Hardware wie schnell läuft

Werte gelten für einen einzelnen Stream, sofern nicht anders angegeben. **[R]** = Review oder Hersteller, **[C]** = Community-Bericht auf X oder GitHub, **[CS]** = von Context Studios gemessen.

| Modell | Hardware | Decode | Hinweis |
|---|---|---|---|
| Qwen3.8-27B (dense) Q4 | RTX 3090 / 4090 / 5090 | 40 / 46 / 75 t/s | llama.cpp Standard, 4k Kontext [R] |
| Qwen3.8-27B | RTX 5090 + MTP | 77 → 155 t/s | llama.cpp Q4_K_M [C] |
| Qwen3.8-27B | RTX 3090, getuntes vLLM | ca. 114 t/s, ca. 1.000 t/s bei 64 Streams | syv-ai-Rezept [C] |
| Qwen3.8-27B | DGX Spark | 12 t/s Standard → 31–58 t/s getunt | NVFP4 + MTP [R]/[C] |
| Qwen3.8-27B | Strix Halo | 11 → 24–30 t/s | Vulkan + MTP [R]/[C] |
| Qwen3.8-27B | M5 Max 128 GB | 31 → 65–69 t/s | MLX + MTP/DFlash2 [R]/[C] |
| Qwen3.8-Flash-Next (MoE) | Mac Studio M5 Ultra | 100+ t/s kurz, 60–85 t/s bei 64k–256k | MacStories-Test [R] |
| Qwen3.8-Flash-Next | MacBook Pro M5 Max | 56–101 t/s | mlx-serve, MTP [C] |
| Qwen3.8-Flash-Next | 1× DGX Spark | 65–81 t/s | vLLM/EXL3 + MTP [C] |
| Qwen3.8-Flash-Next | 2× DGX Spark, NVFP4 | 32,9 t/s, Prefill 722 t/s (1k-Prompt) | unser Lauf 24.09., ohne Speculative Decoding [CS] |
| Qwen3.8-Flash-Next | Strix Halo | 22–38 t/s | llama.cpp / Halogen [C] |
| Qwen3.8-Flash-Next | RTX PRO 6000 | 227 t/s, Prefill 9.900 t/s | [C] |
| Qwen3.8-Flash-Next | 2× RTX PRO 6000 | 1.610 t/s über 32 Streams | vLLM Standard [C] |
| GLM-5.3-Flash EXL3 4bpw | 2× DGX Spark (TP=2) | 32,9 t/s, 63,7 t/s gesamt bei 4 Streams | unser Lauf 24.09. [CS] |
| GLM-5.3-Flash IQ2 | Strix Halo | 17–18 t/s | [C] |
| GLM-5.2 (großes MoE) | 4× GB10-Cluster | 27 t/s, 76 t/s gesamt bei 6 Streams | vLLM TP4 + MTP, Juli/Aug. [CS] |
| DeepSeek-V4.1-Flash | 2× DGX Spark | 23 → 33 t/s | EXL3, 1M Kontext [C] |
| DeepSeek-V4.1-Flash | 4× RTX PRO 6000 | ca. 120–125 t/s konstant bis 131k | [C] |

**Prefill wird unterschätzt.** Im MacStories-Test las der M5 Ultra einen Prompt mit 15.500 Tokens mit 2.887 t/s ein, der M3 Ultra schaffte 1.143 t/s. Eine RTX 5090 kam bei einem 6k-Prompt auf rund 3.000 t/s. Auf Strix Halo dauerte ein Prompt mit 1 Mio. Tokens 18 Minuten. Agenten schicken in jeder Runde 20.000 bis 60.000 Tokens aus Systemprompt, Tools und Gedächtnis mit. Dann entscheidet oft das Prefill, ob sich eine Maschine schnell anfühlt.

### Community-Messungen von X (September 2026)

Wenn nicht anders angegeben: Decode mit einem Stream. Es handelt sich um Berichte von Entwicklern auf X, nicht um unsere Messungen. Die Setups unterscheiden sich (Quantisierung, spekulatives Decoding, gepatchte Engines). Jede Zeile zeigt also, was mit genau diesem Rezept möglich ist, und ist keine garantierte Basis. Die Lücke zwischen den gemeldeten 62,9 t/s für GLM-5.3-Flash auf zwei Sparks und unseren 32,9 t/s zeigt, wie viel ein optimiertes Rezept ausmacht.

| Hardware | Modell | Setup | Decode | Anmerkung | Quelle |
|---|---|---|---|---|---|
| 1× DGX Spark | Qwen3.8-Flash-Next | NVFP4, vLLM + MTP k=3 | 38 t/s | 53,8 t/s bei Code, 180 t/s aggregiert bei 8 Streams, ~2.000 t/s Prefill | [@jvr0x](https://x.com/jvr0x/status/2101331441980149887) |
| 1× DGX Spark | Qwen3.8-Flash-Next | EXL3 vs. NVFP4, vLLM | 78,3 vs. 31,0 t/s | gleiche Maschine; ~600 vs. ~150 t/s aggregiert bei 8 Anfragen | [@ViC305](https://x.com/ViC305/status/2102228607494201632) |
| 2× DGX Spark (TP=2) | GLM-5.3-Flash | EXL3 4bpw, vllm-exl3 | 62,9 t/s | 146,5 t/s aggregiert bei 4 Streams | [@yume_arasaki](https://x.com/yume_arasaki/status/2102395182184534404) |
| 2× DGX Spark (TP=2) | GLM-5.3-Flash | NVFP4, patched vLLM | 46,3 t/s | ein Stream, Reasoning | [@mr_r0b0t](https://x.com/mr_r0b0t/status/2098096413020410362) |
| 8× DGX Spark | GLM-5.3-Flash | NVFP4, vLLM | 96 t/s | 110 t/s bei 4 Streams | [@hypermac6502](https://x.com/hypermac6502/status/2100862418360615112) |
| 16× DGX Spark | Kimi K3 (2.8T) | vLLM + GB10 patch | 29,8 t/s | 87 t/s aggregiert bei 8 Streams, ~20 t/s bei 300k Kontext | [@ciprianveg](https://x.com/ciprianveg/status/2101774114780590325) |
| RTX PRO 6000 (96 GB) | Qwen3.8-Flash-Next | SGLang, FP8 KV + MTP | 252,9 t/s | 819 t/s bei 8 Streams, 1.190 t/s bei 16 | [@wei_wang](https://x.com/wei_wang/status/2102204481995956450) |
| 4× RTX PRO 6000 | GLM-5.3-Flash | vLLM | 240 t/s | ~12.000 t/s Prefill, 550 t/s aggregiert bei 4 Streams | [@hiheyhowareya](https://x.com/hiheyhowareya/status/2101806099724644788) |
| Strix Halo (Ryzen AI Max+ 395) | Qwen3.8-Flash-Next | Lucebox ROCm | 38 t/s | 41,9 t/s bei 8k Kontext | [@luceboxai](https://x.com/luceboxai/status/2100218346448851435) |
| RTX 4090 (24 GB) | Qwen3.8-27B | Q4_K_M, llama.cpp | 46 t/s | Flash Attention, quantisierter KV-Cache | [@yume_arasaki](https://x.com/yume_arasaki/status/2097356548574179756) |
| RTX 3090 / 4090 (24 GB) | Qwen3.8-27B | EXL3 3.5bpw + DFlash | 94–105 t/s | dauerhaft; 130–150 t/s bei kurzen Antworten | [@yume_arasaki](https://x.com/yume_arasaki/status/2102395182184534404) |
| MacBook Pro M4 Max (128 GB) | Qwen3.8-27B | MLX 4-bit + MTP | 43 t/s | Spanne 42–44 t/s | [@yume_arasaki](https://x.com/yume_arasaki/status/2097356548574179756) |

## Unsere Messung (Context Studios, 24.09.2026)

Wir haben einen kurzen, reproduzierbaren Benchmark gegen die Endpunkte gefahren, die wir täglich nutzen. Beide Modelle laufen auf je zwei ASUS-Ascent-GX10-Knoten (NVIDIA GB10, je 128 GB) mit Tensor Parallel 2 über ein 100G-RoCE-Netz. Den Qwen-Endpunkt erreichen wir über einen LiteLLM-Proxy auf unserem Mac mini, dort steckt also ein zusätzlicher Netzwerk-Hop in den Zahlen.

| Modell | Setup | Decode (1 Stream) | Prefill (ca. 1k Prompt) | 4 parallele Streams |
|---|---|---|---|---|
| GLM-5.3-Flash (320B MoE, 18B aktiv) | EXL3 4bpw, vLLM, 2× GX10 TP=2 | **32,9 t/s** | 1.262 t/s | **63,7 t/s** gesamt (ca. 16,5 t/s pro Stream) |
| Qwen3.8-Flash-Next | NVFP4, vLLM über LiteLLM, 2× GX10 | **32,9 t/s** | 722 t/s | 21,8 t/s gesamt (ein Stream fiel auf 7 t/s) |

**Methode.** Streaming über /v1/chat/completions, Temperatur 0, Thinking aus, fester technischer Prompt. Ein Warm-up-Lauf wird verworfen, danach folgen drei Läufe mit 400 Ausgabe-Tokens; wir berichten den Median. Decode = (Completion-Tokens − 1) ÷ Zeit vom ersten bis zum letzten Token. Prefill schätzen wir als Prompt-Tokens ÷ Zeit bis zum ersten Token bei einem Prompt mit rund 1.040 Tokens. Darin steckt die Netzwerklatenz, der Wert ist also eine Untergrenze. Im Paralleltest schicken wir vier identische Anfragen mit je 400 Tokens gleichzeitig ab und teilen alle erzeugten Tokens durch die Wandzeit. Die Tokenzahlen stammen aus dem usage-Feld des Servers. Unser Cluster bedient gleichzeitig produktive Agenten. Vor allem die Parallelwerte sind deshalb eine Momentaufnahme und kein Laborergebnis.

So könnt ihr den Lauf gegen jeden OpenAI-kompatiblen Endpunkt wiederholen:

```bash
python3 bench_local.py http://EUER-HOST:8000 eure-modell-id 3 4
```

Was wir aus den Zahlen ablesen:
1. **Zwei Sparks bringen ein 320B-Modell auf interaktives Tempo.** 33 t/s in einem Stream fühlen sich im Chat und in Coding-Agenten flüssig an.
2. **Die höheren Qwen-Werte der Community kommen vom Speculative Decoding.** Setups mit MTP melden 65–81 t/s auf einer Spark. Unser NVFP4-Endpunkt läuft ohne MTP und landet bei 33 t/s. Speculative Decoding ist der größte einzelne Hebel: Auf unserem 4-Knoten-Cluster hat es GLM-5.2 ungefähr verdoppelt (14,5 → 26,6 t/s).
3. **Der Parallel-Durchsatz hängt davon ab, was sonst noch auf der Box läuft.** GLM skalierte fast linear auf vier Streams. Das Qwen-Paar war mit Agent-Traffic beschäftigt, ein Stream brach ein.

### Frühere Messung: 4× GB10-Cluster mit GLM-5.2 (Juli/August 2026)

| Was wir gemessen haben | Ergebnis |
|---|---|
| GLM-5.2 Decode bei 1 / 2 / 3 / 4 / 6 parallelen Streams (gesamt) | 27,2 / 42,6 / 52,1 / 62,7 / 75,8 t/s |
| Prefill 8k / 32k Prompt | 853 / 840 t/s |
| MTP-Effekt (ohne Draft → k=2) | 14,5 → 26,6 t/s |
| Korrigierte cudagraph capture sizes | +38 % bei 2 Streams |
| Lange Unterhaltung (22 Runden, 104.846 Tokens) | kein Einbruch |
| Kaltstart / kompletter Cluster-Neustart | 520 s / 13–14 min |

Aus dem Betrieb gelernt: Wenn 2 Streams kaum schneller sind als einer, fehlen die passenden CUDA-Graph-Größen. Eine Konfigurationszeile brachte uns +38 %. Unified Memory braucht Aufmerksamkeit, denn ein OOM-Killer kann die Engine abschießen, und hart entfernte Container haben bis zum Neustart Speicher verloren. Ein Checkpoint wird einmal heruntergeladen und dann über das Netz verteilt: rund 15 Minuten statt ca. 48 Stunden für drei weitere Knoten.

## Kaufentscheidung nach Budget, Einsatz und Modellgröße

| Ihr wollt … | Budget | Kauft | Warum |
|---|---|---|---|
| 27–32B-Modelle (dense) schnell für eine Person | ca. 1.200–1.600 € | Gebrauchte RTX 3090 | Meiste Tokens pro Euro; Qwen3.8-27B Q4 passt in 24 GB |
| Ein kleines Team (5–60 parallele Anfragen) mit einem 27B-Modell | ca. 2.500–3.500 € | 2× RTX 3090 oder eine RTX 5090 | Batch-Durchsatz mit vLLM |
| 100–300B-MoE-Modelle leise am Schreibtisch | ca. 3.500–4.000 € | Strix Halo 128 GB | Am meisten Speicher pro Euro; langsames Prefill in Kauf nehmen |
| Auf CUDA entwickeln, für Rechenzentrums-GPUs prototypen oder clustern | ca. 5.000–6.000 € pro Knoten | DGX Spark / GX10 | NVFP4, vLLM-Rezepte, 200G-Clustering |
| Maximale Einzelplatz-Geschwindigkeit mit großen MoE-Modellen und langem Kontext | ab 5.499 $ | Mac Studio M5 Ultra | 1,2 TB/s und bis 512 GB |
| Local-first unterwegs arbeiten | hoch | MacBook Pro M5 Max 128 GB | 614 GB/s im Laptop |
| Modelle ab 700B mit Produktionstempo | ab 64.000 $ | 4× RTX PRO 6000 | 384 GB VRAM, ca. 120 t/s mit DeepSeek V4.1 Flash |

**Faustregeln nach Modellgröße (4 Bit):**
- **Bis 32B dense:** passt in 24–32 GB VRAM. Eine einzelne RTX-Karte ist die schnellste Option.
- **Rund 70B dense:** braucht ca. 48 GB und läuft auf Unified Memory langsam (4–6 t/s auf Strix Halo).
- **100–320B MoE:** braucht 64–128 GB. Spark, Strix Halo, M5 Max oder Mac Studio. Zwei Sparks fahren GLM-5.3-Flash in 4 bpw mit Luft für langen Kontext.
- **Ab 500B MoE:** braucht einen Spark-Cluster, einen Mac mit 256–512 GB oder mehrere RTX PRO 6000.

## Kosten pro Token: lokal oder Cloud

Annahmen: Strom 0,37 €/kWh (BDEW-Durchschnitt 2026), Abschreibung über 3 Jahre (26.280 Stunden), Betrieb rund um die Uhr unter Volllast. Das ist der beste Fall für lokale Hardware.

| Setup | Durchsatz | Nur Strom | Inkl. Hardware | Cloud-Vergleich |
|---|---|---|---|---|
| 2× GX10, GLM-5.3-Flash, 4 Streams [CS] | 63,7 t/s | ca. 0,52 € / 1 Mio. Tokens | ca. 2,03 € / 1 Mio. Tokens | GLM-5.3-Flash-API: 0,50 $ / 1 Mio. Output |
| 4× GX10, GLM-5.2, 6 Streams [CS] | 75,8 t/s | ca. 0,87 € / 1 Mio. Tokens | ca. 3,41 € / 1 Mio. Tokens | dito |
| Gebrauchte RTX 3090, vLLM im Batch, Qwen3.8-27B [C] | ca. 1.000 t/s | ca. 0,04 € / 1 Mio. Tokens | ca. 0,05 € / 1 Mio. Tokens | Qwen3.8-Flash-API: 0,47 $ / 1 Mio. Output |

So haben wir die 2× GX10-Zeile gerechnet: 2 × ca. 160 W = 0,32 kW, also 0,118 € pro Stunde. Die Hardware (2 × 4.558 €, deutscher Handelspreis vom 28.08.2026) verteilt auf 26.280 Stunden kostet 0,347 € pro Stunde. 63,7 t/s ergeben 229.320 Tokens pro Stunde, 0,465 € pro Stunde entsprechen damit rund 2,03 € pro Million Tokens.

- **Die Cloud ist pro Token etwa 4× günstiger** als unser GLM-Setup mit zwei Knoten, selbst unter Volllast.
- **Eine voll ausgelastete RTX 3090** unterbietet API-Preise für 27B-Modelle, aber nur bei dauerhaftem Batch-Traffic.
- **Ein typischer Einzelnutzer** lastet die Hardware zu weniger als 10 % aus. Das multipliziert die lokalen Kosten mit 10 oder mehr.

Unser Fazit: Beim Preis pro Token gewinnt lokale KI selten. Sie gewinnt bei Datensouveränität, planbaren Fixkosten, fehlenden Rate-Limits und voller Kontrolle über Modelle und Kontext. Wer nur Tokens braucht, fährt mit der API günstiger. Wenn Daten das Haus nicht verlassen dürfen oder Agenten rund um die Uhr ohne Zähler laufen sollen, lohnt sich eigene Hardware.

## Typische Stolpersteine je Plattform

- **DGX Spark:** Die Geschwindigkeit im Einzelstream ist durch die Bandbreite begrenzt; lange kalte Prefills bremsen paralleles Decode; Community-Rezepte ändern sich wöchentlich.
- **Strix Halo:** Der GTT-Kernelparameter ist Pflicht; ROCm- und Kernel-Versionen sind empfindlich; lange Prompts dauern Minuten.
- **RTX-Karten:** Der VRAM ist schnell voll; Auslagern in den Arbeitsspeicher drückt das Tempo in den einstelligen Bereich; hoher Stromverbrauch und Lautstärke; die 5090 kostet im Handel etwa das Doppelte der UVP.
- **Macs:** Beim Prefill liegt NVIDIA weiter vorn; viele MLX-Konvertierungen verlieren Vision oder MTP; die neuesten Modelle brauchen oft Beta-Builds.

## Weiterführende Guides und Vergleiche

- [Qwen 3.8 27B Hardware-Guide: von der RTX 3090 bis zur DGX Spark](/de/blog/qwen-3-8-27b-hardware-guide)
- [Der Mac-Studio-Kaufguide für lokale KI](/de/blog/der-mac-studio-kauf-guide-fuer-lokale-ki-kauf-fuer-deinen-flaschenhals)
- [Was lokale KI auf Apple-Hardware 2026 kostet](/de/blog/was-local-ki-auf-apple-hardware-2026-kostet-die-kaufentscheidung-von)
- [DGX Spark vs. Mac Studio](/de/vergleich/dgx-spark-vs-mac-studio)
- [Lokale vs. Cloud-LLM-Agenten](/de/vergleich/local-vs-cloud-llm-agent)
- [Lokales KI-Coding vs. Cloud-KI-Coding](/de/vergleich/local-ai-coding-vs-cloud-ai-coding)

## FAQ

### Welche Hardware ist 2026 die beste für lokale LLMs?
Das hängt von der Modellgröße und der Zahl der Nutzer ab. Für eine Person mit 27–32B-Modellen bietet eine gebrauchte RTX 3090 im September 2026 das meiste Tempo pro Euro. Für MoE-Modelle ab 100B mit langem Kontext ist der Mac Studio M5 Ultra die schnellste Einzelplatz-Maschine, die DGX Spark ist die bessere Wahl, wenn ihr CUDA, Clustering oder viele parallele Anfragen braucht.

### Lohnt sich die DGX Spark im Vergleich zum Mac Studio M5 Ultra?
Der M5 Ultra hat etwa die 4,4-fache Speicherbandbreite (1,2 TB/s gegenüber 273 GB/s) und erzeugt für einen einzelnen Nutzer deshalb schneller Tokens. Die Stärken der Spark sind CUDA, NVFP4, schnell nachziehende vLLM-Rezepte der Community und günstiges Clustering über 200G-Netzwerk. Wir haben uns für Sparks entschieden, weil wir mehrere Agenten parallel bedienen und uns der Gesamtdurchsatz wichtiger ist als das Tempo eines einzelnen Streams.

### Wie schnell läuft GLM-5.3-Flash auf zwei DGX Sparks?
In unserem Lauf am 24.09.2026 erreichte GLM-5.3-Flash in EXL3 4bpw auf zwei ASUS-GX10-Knoten mit Tensor Parallel 2 genau 32,9 Tokens pro Sekunde in einem Stream. Mit vier parallelen Anfragen lieferte das Paar insgesamt 63,7 Tokens pro Sekunde, also rund 16,5 pro Stream. Das Prefill eines Prompts mit rund 1.000 Tokens lag über 1.200 Tokens pro Sekunde, gemessen inklusive Netzwerklatenz.

### Kann AMD Strix Halo große Modelle wie GLM-5.3-Flash ausführen?
Ja. Mit 128 GB Unified Memory, von denen rund 96–100 GB an die GPU gehen können, laufen 2- bis 4-Bit-Quants von 200–300B-MoE-Modellen mit etwa 13–38 t/s. Der Haken ist die Prompt-Verarbeitung: Lange Kontexte dauern Minuten, ein Prompt mit 1 Mio. Tokens brauchte in einem Bericht 18 Minuten. Strix Halo ist eine starke Kapazitäts-Box für geduldige Einzelnutzer, aber nichts für Agent-Schleifen mit riesigen Prompts.

### Wie viele Tokens pro Sekunde brauchen Coding-Agenten?
Für interaktives Arbeiten fühlen sich rund 30 t/s Decode flüssig an, ab 60 t/s wirkt es schnell. Bei Agenten ist das Prefill genauso wichtig, weil jede Runde Zehntausende Tokens Kontext mitschickt. Eine Maschine mit 50 t/s Decode und 300 t/s Prefill fühlt sich in einem Agent-Harness langsamer an als eine mit 40 t/s Decode und 2.500 t/s Prefill.

### Ist lokale KI günstiger als eine API?
Pro Token meistens nicht. Selbst unter Volllast rund um die Uhr kostet unser GLM-5.3-Flash-Setup mit zwei Knoten inklusive Hardware etwa 2,03 € pro Million Tokens, die GLM-5.3-Flash-API verlangt 0,50 $ pro Million Output-Tokens. Lokal gewinnt bei Datenschutz, planbaren Fixkosten, fehlenden Rate-Limits und voller Kontrolle, und eine voll ausgelastete gebrauchte RTX 3090 kann API-Preise für 27B-Modelle unterbieten.

### Warum sind die Hardwarepreise 2026 so hoch?
Eine weltweite Knappheit bei DRAM und GDDR7 verteuert alles, was viel Speicher hat. NVIDIA hob den Preis der DGX Spark im Februar 2026 von 3.999 $ auf 4.699 $ an, die RTX PRO 6000 steht jetzt bei 16.000 $, und Strix-Halo-Boxen mit 128 GB wurden rund 75 % teurer. Am wenigsten betroffen sind gebrauchte Karten mit älterem GDDR6X-Speicher wie die RTX 3090.

## Quellen

- MacStories – Test des Mac Studio M5 Ultra: https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
- Macworld – Ankündigung Mac Studio M5 Ultra: https://macworld.com/article/3220024/apple-announces-the-m5-ultra-mac-studio-with-up-to-512gb-of-ram.html
- PCMag – Mac Studio (2026) M5 Ultra: https://uk.pcmag.com/desktop-pcs/167419/apple-mac-studio-2026-m5-ultra
- Ars Technica – Test des Mac Studio M5 Ultra: https://arstechnica.com/gadgets/2026/09/review-apples-hyper-pricey-m5-ultra-mac-studio-made-me-into-a-vibe-coder
- Apple – Technische Daten MacBook Pro M5 Pro/Max: https://support.apple.com/en-bn/126319
- pi3g – Preise NVIDIA DGX Spark, September 2026: https://pi3g.com/nvidia-dgx-spark-price/
- Tom's Hardware – DGX Spark: Leistungsaufnahme und Effizienz: https://www.tomshardware.com/pc-components/gpus/nvidia-dgx-spark-review/4
- ComputingForGeeks – Mini-PCs mit Ryzen AI Max+ 395 im Vergleich: https://computingforgeeks.com/ryzen-ai-max-395-mini-pc-comparison
- RunAIHome – RTX 5090 vs. 4090 vs. gebrauchte 3090: https://runaihome.com/blog/rtx-5090-vs-rtx-4090-vs-used-3090-local-ai-2026
- RunAIHome – Preisanstieg bei Unified-Memory-PCs: https://runaihome.com/blog/unified-memory-ai-pc-price-surge-mid-2026-buying-guide
- Thunder Compute – Preise RTX PRO 6000: https://www.thundercompute.com/blog/nvidia-rtx-pro-6000-pricing
- Alibaba Cloud – Qwen3.8-Flash-Next: https://www.alibabacloud.com/blog/qwen3-8-flash-next-a-new-architecture-towards-ultimate-cost-efficiency_603501
- Capital and Compute – Preise GLM-5.3-Flash: https://capitalandcompute.net/blog/glm-5-3-flash-pricing-benchmarks
- Hugging Face – GLM-5.3-Flash EXL3 4bpw (Mia-AiLab): https://huggingface.co/Mia-AiLab/GLM-5.3-Flash-EXL3-TR3-4bpw
- BDEW – Strompreise 2026: https://www.bdew.de/energie/strompreise-dossier
- syv-ai – Qwen3.8-27B auf der RTX 3090: https://github.com/syv-ai/qwen38-27b-rtx3090
- X-Post von @jvr0x (2026-09-19): https://x.com/jvr0x/status/2101331441980149887
- X-Post von @ViC305 (2026-09-22): https://x.com/ViC305/status/2102228607494201632
- X-Post von @yume_arasaki (2026-09-22): https://x.com/yume_arasaki/status/2102395182184534404
- X-Post von @mr_r0b0t (2026-09-10): https://x.com/mr_r0b0t/status/2098096413020410362
- X-Post von @hypermac6502 (2026-09-18): https://x.com/hypermac6502/status/2100862418360615112
- X-Post von @ciprianveg (2026-09-20): https://x.com/ciprianveg/status/2101774114780590325
- X-Post von @wei_wang (2026-09-22): https://x.com/wei_wang/status/2102204481995956450
- X-Post von @hiheyhowareya (2026-09-20): https://x.com/hiheyhowareya/status/2101806099724644788
- X-Post von @luceboxai (2026-09-16): https://x.com/luceboxai/status/2100218346448851435
- X-Post von @yume_arasaki (2026-09-08): https://x.com/yume_arasaki/status/2097356548574179756
- Context Studios – eigene Messungen: 24.09.2026 (bench_local.py, Methode oben) sowie Juli/August 2026 (4× GB10-Cluster, interner Harness)

---

## Lokale KI für euer Team aufsetzen?

Context Studios berät zu Hardware, Setup und Betrieb lokaler KI: von der Wahl zwischen DGX Spark, Mac Studio oder GPU-Server bis zum produktiven Betrieb mit vLLM. Wir betreiben diesen Stack selbst jeden Tag, und aus ihm stammen die Messwerte in diesem Guide.

**[Jetzt Beratung zu lokaler KI anfragen →](https://www.contextstudios.ai/de/kontakt)** · [Unsere Leistungen](https://www.contextstudios.ai/de/leistungen)



## Related

- [LLM-Entwicklung](https://www.contextstudios.ai/de/llm-entwicklung.md)
- [KI-Entwicklung](https://www.contextstudios.ai/de/ki-entwicklung.md)
- [LLM-Integration](https://www.contextstudios.ai/de/llm-integration.md)
- [KI-Beratung](https://www.contextstudios.ai/de/ki-beratung.md)
