---
type: "BlogPosting"
title: "Mac Studio M5 Ultra für lokale KI: Benchmarks, Preise und unser Vergleich mit 4× DGX Spark (2026)"
description: "Der M5 Ultra ist die schnellste leise Einzelplatz-Maschine für große MoE-Modelle. Verifizierte Specs, Preise, Benchmarks, X-Community-Werte und unsere eigenen Messungen auf DGX-Spark-Hardware."
resource: "https://www.contextstudios.ai/de/blog/mac-studio-m5-ultra-lokale-ki-guide"
language: "de"
tags: ["local-ai", "hardware", "apple-silicon", "dgx-spark", "llm"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-06T06:07:56.471Z"
status: "stable"
---

# Mac Studio M5 Ultra für lokale KI: Benchmarks, Preise und unser Vergleich mit 4× DGX Spark (2026)

Published: 2026-09-24
Tags: local-ai, hardware, apple-silicon, dgx-spark, llm

![Mac Studio M5 Ultra für lokale KI: Benchmarks, Preise und unser Vergleich mit 4× DGX Spark (2026)](https://wary-platypus-754.convex.cloud/api/storage/50aacf5d-9582-4c93-9aac-1931409b017b)

> **Stand: 24. September 2026.** Apple hat den Mac Studio mit M5 Ultra am 25. August 2026 vorgestellt. Die 512-GB-Konfiguration folgt laut Apple Store „Ende Oktober“. Wir aktualisieren diesen Guide, sobald neue Messungen vorliegen.

**Kurzantwort:** Der M5 Ultra ist im September 2026 die schnellste leise Einzelplatz-Maschine für große Mixture-of-Experts-Modelle wie Qwen3.8-Flash-Next oder GLM-5.3-Flash. Er liefert 1,2 TB/s Speicherbandbreite und bis zu 256 GB (bald 512 GB) Unified Memory. Bei dichten Modellen, die in 32 GB passen, bleibt eine RTX 5090 schneller. Wer CUDA, Clustering oder viele parallele Nutzer braucht, fährt mit DGX Spark besser. Und wer nur auf den Preis pro Token schaut, landet in der Cloud: Nach unserer Rechnung kostet lokale Inferenz auf dem M5 Ultra rund 1,70–2,70 € pro Million Output-Tokens, die Qwen3.8-Flash-API dagegen 0,47 $.

Wir betreiben bei Context Studios seit Sommer 2026 einen Cluster aus vier ASUS Ascent GX10 (NVIDIA GB10, baugleich zum DGX Spark). Diese Frage haben wir uns deshalb selbst gestellt: Hätten wir statt Sparks lieber Mac Studios kaufen sollen? Dieser Guide ist unsere ehrliche Antwort – mit verifizierten Specs, unabhängigen Reviews, Messwerten aus der X-Community und eigenen Messungen vom 24. September.

## Die verifizierten Specs in 60 Sekunden

| Merkmal | M5 Ultra (Basis) | M5 Ultra (Vollausbau) |
|---|---|---|
| CPU | 30 Kerne (10 Super-, 20 Performance-Kerne) | 36 Kerne |
| GPU | 64 Kerne mit Neural Accelerators | 80 Kerne mit Neural Accelerators |
| Neural Engine | 32 Kerne | 32 Kerne |
| Speicherbandbreite | 1,2 TB/s | 1,2 TB/s |
| Unified Memory | 96 GB | 256 GB oder 512 GB (512 GB ab Ende Oktober, nur mit 80-Kern-GPU) |
| SSD | 1 TB | bis 16 TB |
| Anschlüsse | 4× Thunderbolt 5 (120 Gbit/s), 10-Gbit-Ethernet, HDMI 2.1 | identisch |
| Max. Dauerleistung (Netzteil) | 480 W | 480 W |

Quelle: Apple Tech Specs und Apple Newsroom vom 25.08.2026. Neu ist die Quad-Die-Architektur: Apple verbindet per UltraFusion vier Dies zu einem Chip. Die Bandbreite liegt laut Apple 50 Prozent über dem M3 Ultra (819 GB/s). Genau diese Zahl ist für lokale LLMs entscheidend, denn beim Generieren muss für jedes Token das aktive Modell aus dem Speicher gelesen werden.

## Preise in Deutschland und den USA

Die Preise haben wir am 24.09.2026 direkt im Apple-Store-Konfigurator (DE und US) ausgelesen:

| Konfiguration | Deutschland | USA |
|---|---|---|
| M5 Ultra 30C/64G, 96 GB, 1 TB | **6.599 €** | **$5,499** |
| M5 Ultra 36C/80G, 96 GB, 1 TB | 8.029 € | $6,799 |
| M5 Ultra 30C/64G, 256 GB, 1 TB | 10.999 € | $9,499 |
| M5 Ultra 36C/80G, 256 GB, 1 TB | **12.429 €** | **$10,799** |
| Aufpreis 96 → 256 GB | +4.400 € | +$4,000 |
| M5 Ultra 512 GB | noch kein Preis | noch kein Preis |
| Zum Vergleich: M5 Max (Einstieg) | 2.999 € | $2,499 |

Tom's Hardware nennt für sein Testgerät (80-Kern-GPU, 256 GB, 4 TB, $12,299) Lieferzeiten von 16 bis 18 Wochen. Ars Technica schätzt die 512-GB-Variante auf „20.000 Dollar und mehr“. Das ist eine Schätzung, kein Apple-Preis.

## Benchmarks: was der M5 Ultra wirklich schafft

Wir haben keinen eigenen M5 Ultra im Haus. Alle Mac-Zahlen stammen aus drei unabhängigen Reviews mit offengelegter Methodik und aus Community-Messungen, die wir unten gesondert kennzeichnen. Die Werte hängen stark von Runtime, Quantisierung und Kontextlänge ab und sind nur innerhalb einer Tabelle direkt vergleichbar.

### Qwen3.8-Flash-Next (MoE) mit MLX

MacStories hat den M5 Ultra (256 GB) mit oMLX 0.7.0.dev2 gegen den M3 Ultra (512 GB) getestet:

| Kontextlänge | M3 Ultra Decode | M5 Ultra Decode | M5 Ultra Time-to-First-Token |
|---|---|---|---|
| 4K | 59,0 t/s | **90,7 t/s** | 2,5 s |
| 16K | 53,5 t/s | **87,8 t/s** | 6,2 s |
| 64K | 45,3 t/s | **83,8 t/s** | 23,7 s |
| 128K | 37,0 t/s | **60,6 t/s** | 49,2 s |
| 256K | 38,6 t/s | **74,7 t/s** | 101,5 s |

Beim Prompt Processing (Prefill) liest der M5 Ultra einen 16K-Prompt mit **2.887 t/s** (M3 Ultra: 1.143 t/s), bei 256K sind es immer noch rund 2.550 t/s. Das ist etwa das 2,5-Fache der Vorgängergeneration. Grund sind die neuen Neural Accelerators in jedem GPU-Kern. Im Median über drei Durchläufe erreicht Flash-Next bei kurzen Prompts 108 t/s, also 54 % mehr als der M3 Ultra (70 t/s).

### GLM-5.3-Flash mit MLX

Für GLM-5.3-Flash (MLX, gemischt 4/8 Bit) misst MacStories auf dem M5 Ultra **41 t/s** Decode und **1.107 t/s** Prefill bei einem 16K-Prompt. Der M3 Ultra kommt auf 26 t/s und 428 t/s. Wichtig: GLMs Schreibrate enthält hier die Reasoning-Tokens.

### Qwen 3.8 27B (dicht) mit llama.cpp

Tom's Hardware misst Qwen 3.8 27B Q4_K_M mit llama.cpp ohne Multi-Token-Prediction:

| Kontext | Mac Studio M5 Ultra | Mac Studio M4 Max | DGX Spark |
|---|---|---|---|
| 0 | **46,3 t/s** | 22,7 t/s | 11,8 t/s |
| 16K | **43,4 t/s** | 21,1 t/s | 11,0 t/s |
| 64K | **32,4 t/s** | 14,6 t/s | 9,3 t/s |
| 128K | **30,1 t/s** | 9,0 t/s | 7,7 t/s |

Ars Technica kommt mit LM Studio auf „etwas über 50“ Tokens pro Sekunde für dasselbe Modell in 4 Bit. Das M5-Max-Studio schafft rund 31 t/s, ein Framework Desktop (Strix Halo) und ein M2-Max-Studio jeweils etwa 18 bis 20 t/s.

### Der Vergleich mit der RTX 5090

MacStories hat Qwen 3.8 27B auch gegen einen Gaming-PC mit RTX 5090 (32 GB) antreten lassen. Bei einem Prompt mit 6.091 Tokens liest die 5090 mit **3.031 t/s**, der M5 Ultra mit **1.701 t/s** und der M3 Ultra mit 414 t/s. Beim Schreiben liegt die 5090 bei 59 t/s, der M5 Ultra bei 48 t/s. Solange das Modell in 32 GB VRAM passt, ist die 5090 also rund 25 % schneller im Decode und fast doppelt so schnell im Prefill. Passt es nicht mehr, kippt das Bild: Mit Auslagerung in den System-RAM fiel die 5090 im selben Test auf 4,6 bis 1,5 t/s.

## Was die X-Community misst

Seit der Auslieferung der ersten Geräte tauchen auf X täglich neue M5-Ultra-Werte auf. Wir haben am 24. September per X-Suche die meistgesehenen Messungen gesammelt. Das sind Einzelmessungen mit unterschiedlichen Runtimes und Einstellungen, keine kontrollierten Benchmarks. Sie zeigen aber, wie schnell die MLX-Software nachzieht.

| Wer | Modell / Setup | Messwert | Link |
|---|---|---|---|
| @mweinbach (163.000 Views) | Qwen3.8-Flash-Next, gebatcht | 3.740 t/s Prefill, 149 t/s Decode („fast doppelt so viel wie gestern“) | [Tweet](https://x.com/mweinbach/status/2102224017650594212) |
| @viticci (MacStories) | Flash-Next 4/8 Bit, MLX-Serve v26.9.5 | über 3.500 t/s Prefill, 110 t/s bei kurzer Prosa | [Tweet](https://x.com/viticci/status/2102121905385820413) |
| @wei_wang | Flash-Next, Multi-Turn-Agenten mit Tool Calls | 60–85 t/s, Prefill im Schnitt ~2,5× schneller als M3 Ultra | [Tweet](https://x.com/wei_wang/status/2102054751261131075) |
| @MiaAI_lab (144.000 Views) | GLM-5.3-Flash, M5 Ultra vs. 2× DGX Spark | M5 Ultra: 28 t/s Decode, 1.016 t/s Prefill; 2× Spark: 39 t/s, 1.700 t/s | [Tweet](https://x.com/MiaAI_lab/status/2102098618035356156) |
| @MiaAI_lab | Qwen3.8-Flash auf 2× DGX Spark | 56,8 t/s Einzelstrom, 146 t/s bei 4 Streams, 3.500 t/s Prefill | [Tweet](https://x.com/MiaAI_lab/status/2102507937646235875) |

Zwei Beobachtungen: Erstens verdoppeln sich die Mac-Werte teils innerhalb eines Tages, weil Kernels für die neuen Neural Accelerators gerade erst entstehen. Zweitens sind die Spark-Rezepte der Community gut optimiert. Der Vergleich „M5 Ultra gegen zwei Sparks“ fällt je nach Modell und Tag unterschiedlich aus.

## Unsere eigenen Messungen: 2× GX10 am 24. September

Um die Community-Zahlen einzuordnen, haben wir am 24. September auf zwei Knoten unseres Clusters (ASUS Ascent GX10, Tensor-Parallel über 100G-RoCE) gemessen. Methode: Streaming-Chat-Completions, Temperatur 0, Thinking aus, ein Warm-up, Median aus drei Läufen, 400 Output-Tokens.

| Modell auf 2× GX10 | Quantisierung / Engine | Einzelstrom Decode | 4 parallele Streams (Summe) |
|---|---|---|---|
| GLM-5.3-Flash | EXL3 4 bpw, vLLM | **32,9 t/s** | **63,7 t/s** (je Stream ~16–17 t/s) |
| Qwen3.8-Flash-Next | NVFP4, vLLM hinter LiteLLM-Proxy | **32,9 t/s** | nicht belastbar (ein Stream brach ein) |

Mit einem kurzen Prompt von rund 1.000 Tokens maßen wir für GLM-5.3-Flash 1.262 t/s Prefill inklusive Netzwerk. Das ist eine Untergrenze und kein Langkontext-Wert. Einordnung: Beim Einzelstrom liegt der M5 Ultra bei GLM-5.3-Flash mit 41 t/s (MacStories) vor unseren zwei Knoten. Bei vier parallelen Streams liefern die zwei GX10 aggregiert mehr. Für Qwen3.8-Flash-Next ist unser aktuelles NVFP4-Setup mit 32,9 t/s deutlich langsamer als die 56,8 t/s, die Mia AI Lab auf zwei Sparks zeigt, und klar langsamer als der M5 Ultra. Hier ist unser Setup nicht auf dem Community-Stand, und das sagen wir offen.

Aus dem Sommer haben wir zusätzlich Werte für das größere GLM-5.2 auf allen vier Knoten: 27,2 t/s bei einem Stream, 75,8 t/s bei sechs Streams und ein Prefill von 853 t/s (8K) bzw. 840 t/s (32K).

## Die Prompt-Processing-Frage: aufgeholt, aber nicht überholt

Die bekannteste Schwäche von Apple Silicon war das langsame Einlesen langer Prompts. Für agentische Workflows mit 50.000 Tokens Kontext und mehr ist das entscheidend. Der M5 Ultra macht hier den größten Sprung, schließt die Lücke zu NVIDIA aber nicht ganz:

- Gegen die **RTX 5090** liest er rund halb so schnell (1.701 vs. 3.031 t/s).
- Gegen den **DGX Spark** ist er bei kurzen und mittleren Kontexten schneller. Tom's Hardware misst bis 32K eine kürzere Time-to-First-Token (42,2 s vs. 49,1 s bei 32K). Bei 64K liegen beide gleichauf (rund 104 s), bei 128K ist der Spark vorne (236,8 s vs. 295,8 s).
- Gegen den **M3 Ultra** ist er rund 2,5-mal schneller.

Das deckt sich mit unserer Erfahrung mit dem GB10: Beim Decode bremsen ihn 273 GB/s Bandbreite, beim rechenlastigen Prefill ist er stark.

## Kaufberatung: welches Modell passt in welchen Speicher?

Faustregel: Gewichte in 4 Bit brauchen etwa 0,55–0,6 GB pro Milliarde Parameter. Dazu kommen KV-Cache für den Kontext und rund 15–20 % Reserve für macOS. Bei MoE-Modellen bestimmt die Gesamtzahl der Parameter den Speicherbedarf, die aktiven Parameter bestimmen die Geschwindigkeit.

| Speicherstufe | Passt gut | Wird eng oder passt nicht | Empfehlung |
|---|---|---|---|
| **96 GB** (ab 6.599 €) | Qwen 3.8 27B in 8 Bit oder BF16, gpt-oss-120b, Qwen3.8-Flash-Next in 4 Bit mit moderatem Kontext (ein Community-Report nennt rund 68 GB) | GLM-5.3-Flash, lange 256K-Kontexte bei Flash-Next | Solider Einstieg für ein Modell mit mittlerem Kontext. Ein M5-Max-Studio mit 128 GB ist hier oft die bessere Wahl zum halben Preis. |
| **256 GB** (ab 10.999 €) | Flash-Next oQ4e/oQ5e mit 256K Kontext (Spitzenbedarf 155–179 GB laut MacStories), GLM-5.3-Flash in MLX 4/8 Bit, drei parallele Flash-Next-Sessions | Flash-Next in 6 oder 8 Bit nur mit ausgelagerten Embedding-Tabellen auf der SSD; oMLX gibt maximal rund 200 GB frei | Der Sweet Spot für agentische Arbeit mit großen MoE-Modellen. |
| **512 GB** (ab Ende Oktober, Preis offen) | Kandidaten: DeepSeek-V4.1-Flash, GLM-5.3 in höheren Quantisierungen, mehrere große Modelle gleichzeitig | Noch keine Messungen verfügbar | Nur kaufen, wenn ein konkretes Modell die 256 GB sprengt. |

Ein Detail aus MacStories zeigt, wie hart die Grenze ist: Flash-Next in 6 Bit wurde auf dem 256-GB-Modell bei 176,6 GB von macOS wegen Speicherdrucks beendet. Die 8-Bit-Variante hat oMLX gar nicht erst geladen. Plane also mindestens 20 % Luft über der reinen Modellgröße ein.

## Kosten pro Token: unsere Rechnung

Annahmen (bitte selbst anpassen): Strompreis 0,37 €/kWh (BDEW-Durchschnitt 2026), Abschreibung über drei Jahre bei 24/7-Betrieb, volle Auslastung. Für den M5 Ultra gibt es noch keine Leistungsmessung unter LLM-Last. Ars Technica hat 75 W beim Video-Encoding gemessen, Apple nennt 480 W als maximale Dauerleistung. Wir rechnen mit dieser Spanne. Für einen GX10-Knoten setzen wir 160 W an (Tom's Hardware, DGX Spark unter GPU-Last) und 4.558 € Kaufpreis (DE-Handel, August 2026).

| System | Modell / Last | Durchsatz | Hardware | Kosten pro 1M Output-Tokens |
|---|---|---|---|---|
| Mac Studio M5 Ultra 80C/256 GB | Flash-Next, 3 parallele Anfragen (MacStories) | 81,5 t/s | 12.429 € | **1,71–2,22 €** |
| Mac Studio M5 Ultra 80C/256 GB | Flash-Next, eine Anfrage mit 6,5K-Prompt (MacStories) | 66,2 t/s | 12.429 € | 2,10–2,73 € |
| Mac Studio M5 Ultra 80C/256 GB | GLM-5.3-Flash, eine Anfrage (MacStories) | 41 t/s | 12.429 € | 3,39–4,41 € |
| 2× ASUS GX10 (unsere Messung) | GLM-5.3-Flash, 4 Streams | 63,7 t/s | 9.116 € | ~2,03 € |
| 2× ASUS GX10 (unsere Messung) | GLM-5.3-Flash, ein Stream | 32,9 t/s | 9.116 € | ~3,93 € |
| 4× ASUS GX10 (unser Cluster) | GLM-5.2, 6 Streams | 75,8 t/s | 18.232 € | ~3,41 € |
| Cloud-API | Qwen3.8-Flash (Alibaba Cloud) | – | – | 0,47 $ |
| Cloud-API | GLM-5.3-Flash (Z.ai) | – | – | 0,50 $ |

Die Rechnung ist eindeutig: **Über den Tokenpreis lohnt sich keine dieser Maschinen.** Selbst bei Vollauslastung ist die API um ein Vielfaches günstiger. In der Praxis liegt die Auslastung eines Einzelplatzrechners oft unter 10 %, dann steigen die Kosten pro Token auf das Zehnfache. Lokale Inferenz kauft man für Datenschutz, planbare Fixkosten, Unabhängigkeit von Rate Limits und die freie Modellwahl. Energetisch ist der Mac stark: Selbst bei angenommenen 480 W braucht er für Flash-Next mit drei Anfragen rund 1,6 kWh pro Million Tokens. Unser 4-Knoten-Cluster braucht für GLM-5.2 etwa 2,4 kWh.

## Mac Studio M5 Ultra oder DGX Spark: wann welches?

Wir haben uns im Sommer bewusst für GB10-Hardware entschieden und würden es für unseren Einsatzzweck wieder tun. Die Gründe sind allerdings andere, als die meisten Benchmark-Tabellen vermuten lassen.

**Was für den Spark spricht (aus unserem Betrieb):**

- **CUDA und Community-Rezepte.** Neue Modelle bekommen auf dem Spark oft innerhalb weniger Tage optimierte vLLM- oder SGLang-Rezepte mit NVFP4 und Speculative Decoding.
- **Skalierung über Knoten.** Mit 200G-ConnectX und einem 100G-RoCE-Switch betreiben wir GLM-5.2 per Tensor-Parallelism über vier Knoten. Große Checkpoints laden wir einmal herunter und verteilen sie per RoCE in rund 15 Minuten statt 48 Stunden auf die anderen Knoten.
- **Concurrency.** Unser Cluster skaliert GLM-5.2 von 27,2 t/s bei einem Stream auf 75,8 t/s bei sechs Streams. Zwei Knoten verdoppeln bei GLM-5.3-Flash den Durchsatz von einem auf vier Streams fast (32,9 → 63,7 t/s). Mehrere Agenten und Nutzer teilen sich die Hardware.
- **Einstiegspreis pro Knoten.** Ein GX10 kostete im August in Deutschland 4.558 €. Die Preise sind seitdem deutlich gestiegen (Cyberport: von 4.000 € auf 5.199 € in sechs Wochen).

**Was für den Mac Studio spricht:**

- **Einzelstrom-Geschwindigkeit.** Tom's Hardware misst bei Qwen 3.8 27B fast die vierfache Decode-Rate eines einzelnen Spark (46,3 vs. 11,8 t/s). Mit 1,2 TB/s gegen 273 GB/s ist das physikalisch erklärbar.
- **Ein Gerät, kein Cluster.** 256 GB in einer Box ersetzen zwei Sparks – ohne Netzwerk-Fabric, ohne Tensor-Parallel-Konfiguration und ohne die 13 bis 14 Minuten, die ein Neustart unseres Clusters dauert.
- **Ruhe und Effizienz.** Der Mac ist leise, MacStories beschreibt ihn als deutlich leiser als den eigenen 5090-PC.
- **MLX-Tempo.** Die MLX-Community (oMLX, mlx-lm, MLX-Serve, MTP-Varianten) holt schnell auf, und neue MoE-Modelle erscheinen oft am ersten Tag als MLX-Quantisierung.

**Unsere Entscheidungshilfe:**

| Du willst… | Nimm |
|---|---|
| als Einzelperson ein großes MoE-Modell schnell und leise nutzen | **Mac Studio M5 Ultra, 256 GB** |
| ein Team oder mehrere Agenten parallel bedienen | **DGX Spark / GX10** (ab 2 Knoten) |
| Modelle feintunen oder CUDA-Tools nutzen | **DGX Spark** |
| ein dichtes Modell bis 32 GB so schnell wie möglich laufen lassen | **RTX 5090** |
| 128 GB Unified Memory zum niedrigsten Preis | **AMD Strix Halo** (Prefill ist dort die Schwachstelle) |
| Modelle mit über 400 GB Gewichten lokal testen | **M5 Ultra 512 GB** abwarten oder Spark-Cluster ab 3–4 Knoten |

## Einordnung gegenüber Strix Halo und RTX 5090

| Plattform | Speicher | Bandbreite | Qwen 3.8 27B (Decode) | Stärken | Schwächen |
|---|---|---|---|---|---|
| Mac Studio M5 Ultra | 96–512 GB | 1,2 TB/s | 46–50 t/s | große MoE-Modelle, leise | Preis, Prefill unter NVIDIA |
| DGX Spark / GX10 | 128 GB | 273 GB/s | 11,8 t/s (llama.cpp), 33–35 t/s (SGLang + MTP, Community) | CUDA, Clustering, Concurrency | Einzelstrom-Decode |
| AMD Strix Halo | bis 128 GB | ~256 GB/s | 18–20 t/s (Ars, LM Studio) | Preis pro GB | Prefill, Software-Reife |
| RTX 5090 | 32 GB | 1,79 TB/s | 59 t/s (MacStories), 75 t/s (llama.cpp) | Tempo, Prefill | nur 32 GB, 575 W |

Mehr Details zu Qwen 3.8 27B auf allen Plattformen findest du in unserem [Qwen 3.8 27B Hardware-Guide](/de/blog/qwen-3-8-27b-hardware-guide). Die Kostenrechnung vom Mac mini bis zum M5 Ultra findest du in [Was lokale KI auf Apple-Hardware 2026 kostet](/de/blog/was-local-ki-auf-apple-hardware-2026-kostet-die-kaufentscheidung-von).

## Schnellstart: Flash-Next auf dem Mac Studio

Für einen ersten Test reicht mlx-lm. Die Befehle sind ein Minimalbeispiel. Den genauen Namen der gewünschten Quantisierung prüfst du vorher auf Hugging Face.

```bash
pip install -U mlx-lm
mlx_lm.server --model mlx-community/<Flash-Next-4bit-Repo> --port 8080
```

Danach steht eine OpenAI-kompatible API auf Port 8080 bereit, die du in Hermes Agent, Codex oder Open WebUI eintragen kannst. MacStories nutzt für Multi-Token-Prediction oMLX, das sich allerdings noch in Entwicklung befindet.

## Fazit

Der Mac Studio M5 Ultra ist die beste Einzelplatz-Maschine für große offene Modelle, die man im September 2026 kaufen kann. 1,2 TB/s und 256 GB machen Modelle wie Qwen3.8-Flash-Next erstmals mit 60 bis 90 t/s bei langem Kontext alltagstauglich für agentische Arbeit. Er ist aber kein Allrounder. Beim Prompt Processing bleibt NVIDIA vorne, bei vielen parallelen Nutzern skaliert ein Spark-Cluster besser, und für dichte 27B-Modelle ist eine RTX 5090 schneller und günstiger.

Für uns bei Context Studios bleibt der GB10-Cluster die richtige Wahl, weil wir Agenten parallel bedienen und von den CUDA-Rezepten der Community profitieren. Würden wir heute einen einzelnen, leisen Arbeitsplatzrechner für große Modelle kaufen, wäre es ein M5 Ultra mit 256 GB. Die 512-GB-Variante solltest du erst kaufen, wenn es Preis und Benchmarks gibt.

## FAQ

### Wie schnell ist der Mac Studio M5 Ultra bei lokalen LLMs?

Das hängt stark vom Modell ab. Mit dem MoE-Modell Qwen3.8-Flash-Next erreicht er laut MacStories bei kurzen Prompts rund 108 t/s und bei 64K Kontext noch 83,8 t/s. Beim dichten Qwen 3.8 27B misst Tom's Hardware mit llama.cpp 46,3 t/s ohne Kontext und 30,1 t/s bei 128K. Damit ist er etwa doppelt so schnell wie ein M4 Max und bei Flash-Next je nach Kontext 54 bis 94 % schneller als der M3 Ultra.

### Reichen 96 GB oder brauche ich 256 GB?

96 GB reichen für dichte Modelle bis etwa 70 Milliarden Parameter in 4 Bit und für Qwen3.8-Flash-Next in 4 Bit mit moderatem Kontext. Wer große MoE-Modelle wie GLM-5.3-Flash nutzen oder Flash-Next mit 256K Kontext betreiben will, braucht 256 GB. Beachte, dass macOS und die Runtime nicht den gesamten Speicher freigeben. oMLX erlaubt auf dem 256-GB-Modell nur rund 200 GB für ein Modell.

### Ist der Mac Studio M5 Ultra besser als ein DGX Spark?

Für einen einzelnen Nutzer ist der M5 Ultra deutlich schneller als ein einzelner Spark. Tom's Hardware misst bei Qwen 3.8 27B fast die vierfache Decode-Rate. Der DGX Spark punktet mit CUDA, schnellen Community-Rezepten, Clustering über ConnectX und besserer Skalierung bei vielen parallelen Anfragen. Gegen zwei Sparks ist das Rennen offen: Je nach Modell und Software-Stand liegt mal der Mac, mal das Spark-Paar vorne.

### Was kostet der Mac Studio M5 Ultra in Deutschland?

Die Basis mit 30-Kern-CPU, 64-Kern-GPU, 96 GB und 1 TB kostet 6.599 €. Die 80-Kern-GPU kostet 1.430 € Aufpreis, das Upgrade von 96 auf 256 GB 4.400 €. Die voll ausgestattete 256-GB-Variante mit 1 TB SSD liegt damit bei 12.429 €, für die 512-GB-Version gibt es noch keinen Preis.

### Lohnt sich lokale KI auf dem M5 Ultra finanziell?

Rein über den Preis pro Token nicht. Unsere Rechnung ergibt bei Vollauslastung rund 1,70 bis 2,70 € pro Million Output-Tokens für Flash-Next, während vergleichbare Cloud-APIs bei etwa 0,50 $ liegen. Lokale Inferenz lohnt sich über Datenschutz, planbare Kosten, Unabhängigkeit von Anbietern und Rate Limits sowie die freie Modellwahl. Wer sensible Daten verarbeitet oder Agenten rund um die Uhr laufen lässt, bekommt dafür einen echten Gegenwert.

### Wie viel Strom verbraucht der Mac Studio M5 Ultra?

Apple nennt eine maximale Dauerleistung von 480 W. Das ist die Grenze des Netzteils und kein typischer Wert. Ars Technica hat beim Video-Encoding rund 75 W gemessen, eine unabhängige Messung unter LLM-Last liegt uns noch nicht vor. Zum Vergleich: Ein DGX Spark zieht unter GPU-Last rund 160 W an der Steckdose, eine RTX 5090 allein bis zu 575 W.

---

**Lokale KI für euer Team aufsetzen?** Context Studios berät zu Hardware, Setup und Betrieb – vom einzelnen Mac Studio bis zum Multi-Node-Cluster. [Jetzt Kontakt aufnehmen](/de/kontakt)

## Quellen

- Apple – Mac Studio Technische Daten: https://www.apple.com/de/mac-studio/specs/
- Apple Newsroom – M6 und M5 Ultra (25.08.2026): https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute/
- Apple Store Deutschland – Mac Studio konfigurieren (Preise vom 24.09.2026): https://www.apple.com/de/shop/buy-mac/mac-studio
- Apple Store USA – Mac Studio (Preise vom 24.09.2026): https://www.apple.com/shop/buy-mac/mac-studio
- MacStories – M5 Ultra Mac Studio Review: https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
- Tom's Hardware – Apple Mac Studio (M5 Ultra) Review: https://www.tomshardware.com/desktops/mini-pcs/apple-mac-studio-m5-ultra-review
- Ars Technica – M5 Ultra Mac Studio Review: https://arstechnica.com/gadgets/2026/09/review-apples-hyper-pricey-m5-ultra-mac-studio-made-me-into-a-vibe-coder/
- Tom's Hardware – DGX Spark Review (Leistungsaufnahme): https://www.tomshardware.com/pc-components/gpus/nvidia-dgx-spark-review/4
- Alibaba Cloud – Qwen3.8-Flash-Next (API-Preise): https://www.alibabacloud.com/blog/qwen3-8-flash-next-a-new-architecture-towards-ultimate-cost-efficiency_603501
- Capital and Compute – GLM-5.3-Flash Preise: https://capitalandcompute.net/blog/glm-5-3-flash-pricing-benchmarks
- BDEW – Strompreisanalyse: https://www.bdew.de/energie/strompreise-dossier
- X: @mweinbach https://x.com/mweinbach/status/2102224017650594212 · @viticci https://x.com/viticci/status/2102121905385820413 · @wei_wang https://x.com/wei_wang/status/2102054751261131075 · @MiaAI_lab https://x.com/MiaAI_lab/status/2102098618035356156 und https://x.com/MiaAI_lab/status/2102507937646235875
- Context Studios – eigene Messungen auf 2× ASUS Ascent GX10 (GLM-5.3-Flash EXL3, Qwen3.8-Flash-Next NVFP4, vLLM, 24.09.2026) und auf 4× GX10 (GLM-5.2, vLLM, TP4, Juli/August 2026)


## Related

- [LLM-Entwicklung](https://www.contextstudios.ai/de/llm-entwicklung.md)
- [KI-Entwicklung](https://www.contextstudios.ai/de/ki-entwicklung.md)
- [LLM-Integration](https://www.contextstudios.ai/de/llm-integration.md)
- [KI-Beratung](https://www.contextstudios.ai/de/ki-beratung.md)
