Die Zahlen sind brutal: 224 GB KI-Speicher für rund 8.700 € auf der einen Seite, 512 GB für geschätzte 15.500 € auf der anderen — und dazwischen eine ganze Welle neuer AMD-Systeme, die alle das Gleiche versprechen: große Sprachmodelle lokal laufen lassen, ohne NVIDIA-Server-Budget. Während Apples Mac Studio M5 Ultra mit 512 GB noch auf seinen Launch wartet („Ende Oktober"), ist die AMD-Front bereits da: Lucebox schickt Hybrid-Workstations mit dedizierter Radeon in Serie, ACEMAGIC verkauft 192-GB-Strix-Halo-Minis (im EU-Shop ab deutschem Lager), und Minisforum liefert mit dem MS-S1 Max plus eGPU-Docks den Baukasten für alle, die es selbst zusammenschrauben wollen. Wir haben die gesamte Welle auseinandergenommen — Architektur, Bandbreiten, Preise pro Gigabyte, die Software-Falle, über die kaum jemand spricht — und gegen unsere eigene Rezept-Datenbank mit 428 gemessenen Community-Konfigurationen gerechnet: Welche der 65 erfassten Modell-Familien läuft auf welchem System tatsächlich?
Das Muster dahinter: drei Wege zu flüssigem Speicher
Wer große Modelle inferiert, kämpft nicht um FLOPS, sondern um Speicher: Kapazität (passt das Modell rein?) und Bandbreite (wie schnell kommen die Gewichte pro Token aus dem Speicher?). 2026 gibt es darauf genau drei Antworten:
Weg 1 — Unified Memory Only. AMDs Strix-Halo-APUs (Ryzen AI Max 385/390, Max+ 395, Max+ PRO 495) verlöten LPDDR5X direkt an den Chip: bis 192 GB, die CPU und die integrierte Radeon teilen sich. Bandbreite: ~256–273 GB/s. Kein VRAM-Flaschenhals, aber auch keine schnellere Abkürzung — jedes Token liest aus dem selben Pool.
Weg 2 — Hybrid-Split. Hier kommt eine dedizierte Grafikkarte (AMD Radeon AI PRO R9700, 32 GB GDDR6 bei 640 GB/s) in dieselbe Maschine, und eine spezialisierte Software teilt das Modell auf: die „heißen" Teile — Dense-Layer, der Drafter für spekulatives Decoding, häufig geroutete Mixture-of-Experts — laufen im schnellen VRAM, der „Long Tail" der Experten im großen Unified Memory. Genau das macht Lucebox mit seiner Engine; das Prinzip funktioniert auch mit Standard-Tools, braucht aber Handarbeit.
Weg 3 — Apples Monolith. Das Mac Studio M5 Ultra mit 512 GB Unified Memory und ~1,2 TB/s Bandbreite (laut Apple +50 % gegenüber dem M3 Ultra) kombiniert Kapazität und Tempo in einem System — ohne Split-Logik, dafür zum Premium-Preis.
Die spannende Frage ist nicht, welcher Weg „richtig" ist, sondern was jeder Weg pro Euro kostet — und welches Modell überhaupt hineinpasst. Da sehen die Rechnungen überraschend aus.
Die Spieler im Detail
Lucebox Zero 495 — der Hybrid-Pionier aus Mailand
Lucebox (gegründet 2025, ca. 2–10 Mitarbeiter, offizielle AMD-Kooperation) verpaart den Ryzen AI MAX+ PRO 495 mit bis zu 192 GB LPDDR5X-8533 (273 GB/s) mit einer Radeon AI PRO R9700 (32 GB GDDR6, 640 GB/s) in einem 11,97-Liter-Aluminium-Gehäuse mit 1.000-W-Platinum-Netzteil. Ubuntu Server vorinstalliert, Lucebox Engine und Modelle eingerichtet, OpenAI-/Anthropic-kompatible API ab dem ersten Start.
Die Preise zur Einführung (erste 200 Einheiten, 1.000 € unter Listenpreis): 6.499 € für die Developer-Konfiguration mit 128 GB + 2 TB, die 192-GB-Stufe kostet 2.199 € Aufpreis — also rund 8.700 € für die volle 224-GB-Gesamtspeicher-Ausbaustufe. Ein optionales 100-GbE-Cluster-Kit (Intel E810, werkseitig installiert) kostet 869 € pro Maschine. Eigener Angaben zufolge läuft DeepSeek V4 Flash (284B) mit 86 tok/s Decode über beide Chips — eine Firmenangabe, die wir bis zu einem unabhängigen Repro nicht als Messwert behandeln würden.
Zwei Dinge sind für die Kaufentscheidung kritisch: Batch 3 ist ausverkauft, Batch 4 liefert laut Firma im November 2026 — und Co-Founder Alessandro Puppo hat auf X bereits eine Preiserhöhung angekündigt. Für die 495-Modelle nennt die Firma Januar 2027 als Auslieferungsfenster. Wer hier kauft, kauft also bei einem jungen Startup auf Vorkasse-Äquivalent — mit EU-Käuferschutz (Versand aus Italien) aber ohne den Rückhalt eines Konzern-Servicenetzwerks.
ACEMAGIC F9A — 192 GB Strix Halo im 2-Liter-Gehäuse
ACEMAGIC verkauft den Ryzen AI Max+ PRO 495 mit vollen 192 GB LPDDR5X-8533 und integrierter Radeon 8065S (40 CUs) für 6.399 € (192 GB + 2 TB) — kein dedizierter VRAM, reines Unified-Memory-Design. Dafür: 2-Liter-Gehäuse, 120 W TDP, 2 Jahre Garantie — und im EU-Shop (acemagic.eu) Versand ab deutschem Lager; andere regionale Shops versenden von ihren eigenen Standorten. Der Haken steht klein auf der Produktseite: „Pre-sale: Late October" — die Box ist also gerade genauso wenig lieferbar wie Apples 512-GB-Studio. Als Referenz: Ohne diskrete GPU bleibt Decode an die ~256–273 GB/s der APU gebunden; die F9A ist ein sauberes, im EU-Shop europäisch unterstütztes Strix-Halo-System, kein Wundermittel.
MSI PRO MAX EDGE AI+ — das „virtuelle VRAM"-Konzept
Der MSI-Konkurrent (Ryzen AI Max+ 395, 128 GB, Radeon 8060S) macht auf den ersten Blick mit „bis zu 96 GB VRAM" Werbung. Realistisch: Das ist keine eigene Grafikkarte, sondern eine BIOS-Zuweisung — bis zu 96 GB der 128 GB Unified Memory werden exklusiv der iGPU zugeschlagen, dem System bleiben dann 32 GB für OS und Applikationen. Bandbreite bleibt ~256 GB/s (LPDDR5X-8000). Die Preisangabe von ~4.500 € haben wir nicht selbst verifiziert; das Architektur-Prinzip ist aber der wichtigste Punkt, weil es oft missverstanden wird: Es gibt hier keinen zweiten, schnelleren Speicherpool — nur eine Aufteilung desselben Pools.
Minisforum — der Baukasten-Anbieter: MS-S1 Max, DEG1/DEG2 und der DIY-Weg
Minisforum deckt als einziger Anbieter das komplette Spektrum ab — vom fertigen Strix-Halo-Workstation bis zum freien Dock:
MS-S1 Max (Ryzen AI Max+ 395, 128 GB LPDDR5X-8000, Radeon 8060S, 130 W TDP, Dual-10-GbE, USB4 v2 mit 80 Gbps): Der Review-Standard lag bei ~2.639 $ (128 GB + 2 TB), die „Max AI Compute Edition" im Store bei 3.639–3.799 $. Das Alleinstellungsmerkmal gegenüber allen anderen Strix-Halo-Minis: ein interner PCIe-x16-Slot — elektrisch allerdings nur als 4.0 x4 ausgeführt, also die gleiche Bandbreite wie ein OCuLink-Link (~8 GB/s in beide Richtungen). Damit ist er faktisch eine eingebaute Version des eGPU-Docks.
DEG1 und DEG2 eGPU-Docks: Das DEG1 ist ein OCuLink-Dock (PCIe 4.0 x4, 64 GT/s) mit x16-Slot und ATX-Netteil-Eingang für 109–139 $ — offiziell bis RTX 4090 freigegeben. Das DEG2 erweitert um Dual-OCuLink plus Thunderbolt 5 (bis 80 Gbps) und einen eingebauten M.2-SSD-Slot. Zusammen mit einer Radeon AI PRO R9700 (Einzelhandelspreis laut Marktübersichten ~1.750–1.850 €) und einem SFX-Netteil entsteht so der „Poor Man's Lucebox".
Und es funktioniert — mit dokumentierten Reibungsverlusten. Ein ausführlich dokumentierter Community-Build (Mini-PC + DEG1 + R9700 via M.2-Adapter) erreicht mit Qwen 3.8 27B (Q4) auf der R9700 etwa 50–80 tok/s — deutlich über dem, was die APU allein schafft. Die Modelle bis ~160 GB (3-Bit-Quantisierung großer MoE) passen mit 32 GB VRAM plus 128/192 GB Unified Memory überhaupt erst in die Maschine. Aber: Der M.2-zu-OCuLink-Adapter erwies sich bei Gen4-Geschwindigkeit als unzuverlässig (Abstürze, PCIe-Dropouts) — die Dock-Route ist der Adapter-Route klar vorzuziehen. Das ist die ehrliche Lage des DIY-Wegs: technisch funktionierend, aber Bastelqualität statt Serienqualität.
RTX 3090 — der Gebraucht-Klassiker mit dem besten Bandbreiten-Deal
Die RTX 3090 (Ampere, 2020) ist vom Neuwagen-Markt verschwunden, aber auf dem Gebrauchtmarkt überall — und sie hat ein Ass im Ärmel: 24 GB GDDR6X mit 936 GB/s, schneller als jede diskrete Karte in diesem Vergleich (die R9700 schafft 640). Gebraucht kostet sie grob 700–900 € — die beste Bandbreite pro Euro, die es für eine einzelne Karte gibt. Die Haken: 24 GB pro Karte (für große Modelle braucht es Cluster), 350 W Verbrauch je Karte, keine Neukauf-Garantie — und Ampere bekommt die neuesten Quantisierungs- und Inferenz-Features (NVFP4-Infrastruktur, moderne FP8-Pfade) nur eingeschränkt.
Unsere Rezept-Datenbank hat 65 Konfigurationen auf der 3090 — von einzelnen Karten bis 4er-Clustern. Die Highlights: Ein 4×3090-Cluster decodiert Qwen3.8-27B mit DFlash2 bis zu 244,8 tok/s — die schnellste 27B-Messung der gesamten Datenbank, schneller als alles, was Spark oder Strix Halo erreichen. Und der CPU-MoE-Trick (Experten im System-RAM, heiße Layer auf den 3090ern) bringt die 305B-Klasse (DeepSeek-V4-Flash, GLM-5.3-Flash, Qwen3.8-Flash-Next) auf 2×3090 — der DIY-Bruder des Lucebox-Konzepts, allerdings mit 18–37 tok/s statt der prophezeiten Hybrid-Geschwindigkeit. Wer einen bestehenden PC hat, bekommt mit einer einzigen gebrauchten 3090 die schnellste Upgrade-Option überhaupt.
Die Referenzsysteme: Mac Studio M5 Ultra und NVIDIA DGX Spark
Zum Einordnen die beiden Systeme, die unsere Recipe-Datenbank am besten kennt: Das Mac Studio M5 Ultra mit 512 GB (36/80) kombiniert die größte Kapazität des Feldes mit ~1,2 TB/s Bandbreite — EDU-Preis geschätzt ~15.400–15.500 € (abgeleitet aus der 96-GB-Differenz von 3.960 €; die offizielle 512er-Preisangabe steht noch aus, Verfügbarkeit „Ende Oktober"). Der NVIDIA DGX Spark (GB10, 128 GB, ~273 GB/s, CUDA-Ökosystem) bleibt der komfortabelste Einstieg in die NVIDIA-Welt, ist aber pro Gigabyte mit ~45 €/GB die teuerste Rechnung dieser Übersicht.
Welche Modelle passen wirklich? Die Rechnung gegen 65 Modell-Familien
Spec-Sheets sagen nichts über Modelle. Deshalb haben wir die Rechenprobe gegen unsere Rezept-Datenbank gemacht — 428 gemessene Community-Konfigurationen, 65 Modell-Familien von 3B bis 763B Parameter. Faustregel: Speicherbedarf ≈ Parameter × Bits/Gewicht ÷ 8, plus ~6 % Overhead. Nutzbare Kapazität: Gesamt-RAM minus ~10 % für OS und KV-Cache-Puffer.
Die Kernaussagen dieser Rechnung:
- Die 128-GB-Klasse (DGX Spark, MS-S1 Max, MSI) endet bei ~180B Parametern in 4-bit (Qwen3.8-Flash-Next 180B-A4B passt, DeepSeek-V4-Flash 305B nicht mehr). In 8-bit sind 99B das Limit (Qwen3.5-122B-A10B passt knapp nicht). Die Stars dieser Klasse: Qwen3.8-Flash-Next, gpt-oss-120B, Nemotron-3-Super-120B — und die 35B-A3B-Familie (Qwen3.6, Agents-A1) in nahezu voller Präzision.
- Die 192-GB-Klasse (ACEMAGIC F9A) schafft DeepSeek-V4-Flash (305B) komplett in 4-bit und MiniMax-M3 (428B), Qwen3.5 (397B) in 3-bit. 8-bit läuft bis ~124B (Ling-3.0-flash, gpt-oss-120B).
- Lucebox 224 GB (192+32 Hybrid) addiert beide Welten: 4-bit bis 305B wie die F9A, aber die heißen Layer zusätzlich auf 640 GB/s — und in 3-bit bis GLM-5.1 (478B). Das ist der einzige Weg, an 500B+-Modellen (Kimi-K2.6 519B) in 2-bit vorbei zu kommen.
- RTX-3090-Cluster (48/96 GB VRAM) erreichen nativ die gleiche 180B-Grenze in 4-bit wie die 128-GB-UMA-Klasse — aber mit 3,4× der Bandbreite je Karte (936 GB/s). Die 305B-Klasse geht nur über den CPU-MoE-Trick (18–37 tok/s dokumentiert). Dafür steht in der Datenbank die schnellste 27B-Messung überhaupt: 244,8 tok/s auf 4×3090. Wer nur die schnellste einzelne Karte will, kauft eine gebrauchte 3090: 24 GB bei 936 GB/s für unter 1.000 €.
- Das Mac Studio 512 GB nimmt alles: alle 65 Familien der Datenbank — bis hinauf zu DeepSeek-V4.1-Flash (763B), GLM-5.2 (753B) und GLM-5.3 (743B) — in 4-bit. Sogar Kimi-K2.6 (519B) in 8-bit. In 2-bit passen 519B+ locker bei riesigem KV-Cache-Rest. Wer die aktuellen 300–760B-Flash-Generationen (GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.8-Flash-Next) unquantisiert oder 8-bit fahren will, braucht die 512-GB-Klasse — Punkt.
Ein zweiter Blick dahinter: Diese Rechnung sagt nur „passt rein". Ob es schnell ist, entscheidet die Bandbreite — und da gewinnt der 512er-Mac zusätzlich, weil 1,2 TB/s jeden 4-bit-Decode der 273-GB/s-Klasse um das 4-Fache überholen. Die Hybrid-Systeme kaufen sich ihre Geschwindigkeit im VRAM, aber nur für den Modell-Teil, der dort liegt.
Die ehrliche Gesamtrechnung: Euro pro Gigabyte KI-Speicher
| System | KI-Speicher gesamt | Bandbreite-Realität | Preis (ca.) | €/GB |
|---|---|---|---|---|
| Minisforum MS-S1 Max | 128 GB (UMA) | ~256 GB/s | ~3.600–3.800 $ (128 GB) | ~29 $ |
| MSI PRO MAX EDGE AI+ | 128 GB (UMA, davon bis 96 GB iGPU) | ~256 GB/s | ~4.500 € (nicht verifiziert) | ~35 € |
| ACEMAGIC F9A | 192 GB (UMA) | 256–273 GB/s | 6.399 € | ~33 € |
| Lucebox Zero 495 (192) | 224 GB (192 UMA + 32 VRAM) | 640 GB/s (VRAM) + 273 GB/s (UMA) | ~8.700 € | ~39 € |
| RTX 3090 (gebraucht, 1×) | 24 GB (VRAM) | 936 GB/s | ~800 € (nur Karte) | ~33 € (nur Karte) |
| RTX 3090 Cluster (2× / 4×, gebraucht) | 48 / 96 GB (VRAM) | 936 GB/s je Karte | ~3.100 / ~5.700 € (komplett) | ~65 / ~59 € (komplett) |
| NVIDIA DGX Spark | 128 GB (UMA, CUDA) | ~273 GB/s | ~4.000–5.000 $ Einstieg | ~45 $ |
| Mac Studio M5 Ultra 512 | 512 GB (UMA) | ~1.200 GB/s | ~15.400–15.500 € EDU (geschätzt) | ~30 € |
Drei Lesarten dieser Tabelle: Erstens — die Hybrid-Konzepte bezahlen ihre diskrete 640-GB/s-Karte mit dem schlechtesten €/GB-Wert, bekommen dafür aber die einzige Möglichkeit, beide Speicherarten parallel zu nutzen. Zweitens — Apples 512-GB-Studio ist auf den Euro gerechnet günstiger als jede AMD-Box mit weniger Speicher, obwohl es das teuerste Gesamtsystem ist; die Bandbreite macht den Abstand noch größer. Drittens — Minisforum ist die Preis-Leistungs-Krone in der Strix-Halo-Klasse, aber eben ohne diskreten VRAM und (beim x16-Slot) ohne mehr als x4-Anbindung.
Die Software-Falle, über die alle hinwegsehen
Hardware ist der halbe Weg. Standard-Software — llama.cpp, PyTorch, klassisches ROCm — sieht in einem Hybrid-System zwei getrennte Speicherpools und weiß von sich aus nichts mit ihnen anzufangen. Lucebox löst das mit einer proprietären Engine, deren handgetunte Kernel exakt auf die eigene Hardware kalibriert sind (das Core-Repository ist auf GitHub einsehbar, die Feinabstimmung nicht). Im DIY-Weg muss man die Aufteilung selbst konfigurieren — die Community-Doku zeigt, dass es geht, aber es ist Engineering, kein Plug-and-Play.
Auf Apple-Seite ist der Stack reifer: MLX und TensorFold liefern byte-genaues, optimiertes Inferencing auf Unified Memory ohne Zutun des Nutzers — unser eigener Härtetest des MiaAI-TensorFold-Rezepts auf 2× DGX Spark bestätigte die Rezept-Zahlen innerhalb ±5 % (und die Rezept-Datenbank führt die frischen Zahlen: GSM8K 98,8 %, HumanEval 95,7 % auf der aktuellen v1.5-Engine). ROCm auf RDNA4 und Strix Halo ist 2026 deutlich besser als noch 2025, bleibt aber das jüngste Ökosystem im Feld.
Risiko- und Kauf-Ehrlichkeit
- Startup-Risiko ist real: Lucebox ist jung (Batch 3 ausverkauft, Batch 4 erst November, Preiserhöhung angekündigt, 495er-Lieferung Januar 2027). Wer es testet, sollte die „Test-Box"-Strategie fahren: eine Maschine, warten, dann skalieren — und per Kreditkarte mit Chargeback-Schutz zahlen.
- Pre-Sale heißt Pre-Sale: Die ACEMAGIC F9A ist „Late October" — exakt das gleiche Wartefenster wie Apples 512-GB-Studio. Keine dieser Boxen steht morgen im Regal.
- Die April-Episode ist die Warnung: Apple hat die 512-GB-Option des Vorgänger-Studios im April 2026 komplett vom Markt genommen (Speicherknappheit) und im September mit „Monate knapper Lieferung" nachgelegt. Für die neue 512er-Konfiguration heißt das: Wer sie will, muss beim Freischalten schnell sein. Wir lassen dafür ein vierkanaliges Überwachungssystem mit Alarm in ≤5 Minuten laufen — der Launch ist ein „jetzt"-Signal, kein „dieses Quartal"-Signal.
- AGB und Grenzen: Alles hier ist Lesen, Vergleichen und selbst Kaufen. Kein Auto-Checkout, kein Bot — dafür reicht die Alarmkette aus Telegram-, ntfy- und E-Mail-Push mit Tap-to-Order-Link.
Für wen ist was?
- Maximal ein Modell, maximal offline, Apple-Ökosystem — oder die 300B+-Flash-Generation komplett: Mac Studio M5 Ultra 512. Kein anderes System liefert 512 GB bei 1,2 TB/s; pro Gigabyte ist es sogar die günstigste Option der Tabelle, und es ist das einzige, das jede Modell-Familie der Datenbank in 4-bit schluckt.
- x86/ROCm-Recipes, Linux, Cluster-Kit, DeepSeek-V4-Flash in 4-bit: Lucebox Zero 495 (192-GB-Stufe) — der einzige Serien-Hybrid mit dediziertem VRAM. Aber erst als Einzel-Testbox nach unabhängigen Reviews, nicht als Cluster-Vorkasse.
- Bestes €/GB in Strix Halo, europäischer Support, 305B/4-bit reicht: ACEMAGIC F9A — wenn man mit 273 GB/s und ohne diskreten VRAM auskommt.
- Bestehender PC + maximale Bandbreite für unter 1.000 €: eine gebrauchte RTX 3090 (24 GB, 936 GB/s) — und wer Cluster will, bekommt in unserer Datenbank die schnellste 27B-Messung überhaupt (244,8 tok/s auf 4×3090). Preis dafür: Strom (350 W/Karte), Lautstärke und Gebrauchtmarkt-Risiko.
- Selbst bauen, experimentieren, Budget-Strix-Halo: Minisforum MS-S1 Max (fertig) oder MS-S1/DEG1/DEG2 + R9700 (DIY) — der Weg mit dem meisten Lerneffekt und dem zweitschlechtesten Komfort.
- CUDA-Ökosystem, Agent-Stack, Rezept-Vielfalt: DGX Spark — unser tägliches Fahrzeug; die Software-Reife schlägt die schlechte €/GB-Rechnung.
FAQ
Welche Modelle laufen denn jetzt konkret auf der 128-GB-Klasse (DGX Spark, MS-S1 Max)? Nach der Kapazitätsrechnung: In 4-bit (EXL3/NVFP4/MLX) alles bis Qwen3.8-Flash-Next (180B-A4B) — also die komplette 35B-A3B-Familie (Qwen3.6, Agents-A1, Qwen-AgentWorld), Gemma 4 (26B/31B), Qwen3.8-27B, gpt-oss-120B, Nemotron-3-Super-120B-A12B und Qwen3.5-122B-A10B. Die 305B-Klasse (DeepSeek-V4-Flash, GLM-5.3-Flash, MiMo-V2.6) läuft nur noch in 2-bit-Quantisierungen mit deutlichem Qualitätsverlust. In 8-bit endet es bei Qwen3.5-122B-A10B (99B) — knapp davor. Das deckt sich mit unserer Rezept-Datenbank: 45 von 65 Familien haben auf dieser Klasse dokumentierte 4-bit-Rezepte.
Ist die Lucebox-Zahl (86 tok/s auf DeepSeek V4 Flash 284B) glaubwürdig? Die Zahl stammt vom Hersteller, ist technisch plausibel — ein 284B-MoE hat einen kleinen aktiven Kern, der gut auf die 640-GB/s-Karte passt — aber bis dato nicht unabhängig reproduziert. Die Architektur-Rechnung (heiße Layer im schnellen VRAM, Long Tail im Unified Memory) stimmt in sich, und ein Community-Build derselben Kombination erreicht auf einem 27B-Dense-Modell 50–80 tok/s. Wir behandeln die 86 tok/s bis zum ersten unabhängigen Test als Herstellerangabe, nicht als Messwert.
Warum kann ich nicht einfach eine Strix-Halo-APU mit einer normalen Grafikkarte auf ein Standard-Mainboard bauen? Weil der entscheidende Teil des Strix-Halo-Konzepts der verlötete LPDDR5X-Speicher ist: Die APU hat keinen AM5-Sockel, und die volle Bandbreite entsteht nur, wenn die Speicherchips millimeternah am Die sitzen. Steckbare DDR5-Riegel erreichen einen Bruchteil davon. Die einzigen realen Wege sind fertige Systeme (Lucebox, ACEMAGIC, MSI, Minisforum MS-S1 Max mit x4-Slot) oder die Dock-Bauweise (Minisforum DEG1/DEG2 mit separatem Netzteil) — ein klassisches DIY-Mainboard mit beidem existiert nicht.
Reicht Apples „Benachrichtige mich"-Funktion, um die 512-GB-Version zu bekommen? Nein, nicht für dieses Szenario. Die Apple-Watcher arbeiten auf Produktkategorie-Ebene und zeitverzögert; wer eine konkrete Konfiguration will, die bei Launch knapp ist — und bei der Apple im April 2026 gezeigt hat, dass sie sie auch komplett vom Markt nehmen kann — braucht einen Alarm auf URL- und Konfigurator-Ebene. Ein selbstgebauter Watcher (Cron-Job, der alle paar Minuten die Bestell-URLs prüft, plus Konfigurator-JSON-Auswertung) schlägt jedes Standard-Tool, weil er genau eine SKU überwacht statt einen Katalog.
Was bedeutet der interne PCIe-x16-Slot im Minisforum MS-S1 Max real? Physisch x16, elektrisch PCIe 4.0 x4 — also die gleiche Bandbreite wie ein OCuLink-Dock. Für Inferenz ist das verkraftbar: Gewichte wandern einmalig in den VRAM, danach läuft Decode aus dem lokalen Speicher der Karte; nur der Modell-Ladeprozess und die Split-Synchronisation nutzen den Link. Für Gaming mit 200-W-Karten ist die Anbindung ebenfalls nutzbar, aber der Slot ist räumlich und thermisch auf kompakte Karten ausgelegt — die Grenzen stehen in den Tests.
Die RTX 3090 hat „nur" 24 GB — warum steht sie trotzdem im Vergleich? Weil sie pro Euro die schnellste Karte des Feldes ist: 936 GB/s Bandbreite — mehr als die R9700 (640) und mehr als das Dreifache der Strix-Halo-APUs — auf dem Gebrauchtmarkt für grob 700–900 €. Für alle, die schon einen PC haben, ist sie das schnellste Upgrade überhaupt; in Clustern (2×/4×) steht in unserer Datenbank die schnellste 27B-Messung (244,8 tok/s auf 4×3090). Die Grenzen sind ehrlich benannt: 24 GB pro Karte, 350 W Verbrauch, Gebrauchtmarkt ohne Gewährleistung, und für die 305B-Klasse braucht es den CPU-MoE-Trick (18–37 tok/s) statt nativer Kapazität.
Welche der Systeme ist denn jetzt das beste für lokale KI? Es gibt kein „beste", nur ein „passendste": Kapazität und Tempo zusammen kaufen nur die Mac-Studio-512-GB-Leute; die AMD-Hybride kaufen sich Flexibilität (x86, ROCm, Linux) mit dem Preis von Software-Arbeit und Startup-Risiko; Minisforum ist die Budget- und Bastel-Ecke; der DGX Spark bleibt der CUDA-Komfortweg. Die Entscheidung sollte auf getesteten tok/s je nach eigenem Modell-Spektrum fallen, nicht auf der Werbetabelle — unsere Recipe-Datenbank liefert solche Messwerte bereits für Apple- und NVIDIA-Systeme, die AMD-Neuheiten dieses Artikels sind dort noch offen.
Sources
- Lucebox Zero 495 — Hardware-Spezifikationen: https://www.lucebox.com/hardware
- Lucebox Shop — Preise/Konfigurationen (128/192 GB, Cluster-Kit): https://shop.lucebox.com
- Lucebox — FAQ/Preise in EUR/USD/GBP inkl. Batch-Hinweise: https://www.lucebox.com/
- Notebookcheck, „Lucebox AI workstation … can now be ordered directly" (22.09.2026, Preis- und Batch-Fakten, Puppo-Zitat): https://www.notebookcheck.net/Lucebox-AI-workstation-with-AMD-Strix-Halo-and-Radeon-R9700-can-now-be-ordered-directly.1405786.0.html
- GSM Go Tech, „Lucebox Opens Direct Orders … Price Hike Is Coming" (86-tok/s-Angabe): https://www.gsmgotech.com/2026/09/lucebox-opens-direct-orders-for-its-amd.html
- ACEMAGIC F9A — Produktseite (192 GB, 6.399 €, Pre-Sale Late October, deutsche Lieferung): https://acemagic.eu/products/f9a-495-ai-workstation
- Minisforum MS-S1 MAX — Store-Spezifikation (128 GB, 130 W, PCIe-x16-Slot): https://store.minisforum.com/products/minisforum-ms-s1-max-mini-pc
- NASCompares, „Minisforum MS-S1 Max Review" (2.639-$-Review-Config, Slot-Details): https://nascompares.com/2026/01/23/minsforum-ms-s1-max-review-who-is-this-for/
- Minisforum DEG1 eGPU Dock — Store (OCuLink 4.0 x4, 109–139 $): https://store.minisforum.com/products/minisforum-deg1-egpu-dock
- Minisforum DEG2 OCulink eGPU Dock — EU-Store (Dual-OCuLink, TBT5): https://minisforumpc.eu/products/minisforum-deg2-oculink-egpu-dock
- xct's Blog, „Local AI with Strix Halo & R9700" (DIY-Build, 50–80 tok/s, Adapter-Probleme): https://vuln.dev/local-ai-rig/
- Apple Newsroom, „The new Mac mini and Mac Studio are available today" (512 GB „late October"): https://www.apple.com/newsroom/2026/09/the-new-mac-mini-and-mac-studio-are-available-today/
- MacRumors, „Apple Stops Accepting Orders for Some Mac Mini and Mac Studio Models" (April 2026, 512-GB-Option gestrichen): https://www.macrumors.com/2026/04/11/some-mac-mini-mac-studio-currently-unavailable/
- MiaAI-Lab TensorFold-Rezept (aktuelle Messwerte/Qualität, Stand 04.10.2026): https://github.com/MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks-TensorFold
- Eigenmessung, 2× GB10 (ASUS GX10) via CRS504-Switch, sparkDash 1.8.9, 01.10.2026 (Repro des MiaAI-TensorFold-Rezepts v1.3.1); Rezept-Datenbank mit 428 Konfigurationen: https://www.contextstudios.ai/local-ai