Qwen3.8-Flash-Next EXL3 3.05 bpw mit ExLlamaV3 auf 1× DGX Spark
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
Gute Qualität bei flüssigem Tempo für den Alltag.
Rezept öffnenIhr Ziel
Sichtbar werden, wo KI antwortet
Prozesse automatisieren
Ein Produkt bauen
KI-Agenten einsetzen
Systeme verbinden und modernisieren
Wissen, wo wir stehen
Use Cases
CRMKundenbeziehungen stärkenBeliebtE-CommerceOnline-Umsatz steigernBuchungssystem24/7 Termine annehmenProjektmanagementTeams koordinierenRechnungswesenSchneller bezahlt werdenAnalyticsDatenbasiert entscheidenRessourcen · Lokale KI
Welche offenen Modelle laufen auf DGX Spark, Mac, Strix Halo oder RTX, wie schnell und wie klug? Rezepte der Kreatoren, jede Zahl mit Bedingung und Quelle, jedes Gewicht verlinkt.
Schnellwahl für Ihre Hardware
Plattform und Anzahl wählen: Hier erscheinen die drei Empfehlungen für Ihre Hardware.
282 Rezepte24 Kreatoren6 Plattformen217 mit IntelligenzwertStand 26. Sept. 2026
Plattform und Anzahl wählen. Empfehlungen und Rezeptliste folgen der Auswahl.
Speicherklassen (Faustregel)
Faustregel von Context Studios, keine Messung. Was tatsächlich passt, zeigt das jeweilige Rezept.
Ohne Auswahl: die ausgewogene Empfehlung je Plattform für die kleinste Ausbaustufe.
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
Gute Qualität bei flüssigem Tempo für den Alltag.
Rezept öffnen1 Anfrage, Prosa-Prompt, kurzer Prompt, mit MTP (DSpark built-in) (laut Rezept) Quelle
Gute Qualität bei flüssigem Tempo für den Alltag.
Rezept öffnen1 Anfrage, gemischtes Prompt-Set, mit ndt=3 Quelle
Gute Qualität bei flüssigem Tempo für den Alltag.
Rezept öffnen1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
Gute Qualität bei flüssigem Tempo für den Alltag.
Rezept öffnen1 Anfrage, gemischtes Prompt-Set, mit MTP Quelle
Gute Qualität bei flüssigem Tempo für den Alltag.
Rezept öffnen1 Anfrage, gemischtes Prompt-Set, mit FR-Spec + NEXTN (laut Rezept) Quelle
Gute Qualität bei flüssigem Tempo für den Alltag.
Rezept öffnenJeder Punkt ist ein Rezept: rechts schneller, oben klüger. Die Form zeigt, wie das Tempo gemessen wurde.
209 von 282 Rezepten dargestellt, nur Rezepte mit Tempo- und Intelligenzwert.
Die Tempo-Kategorien sind nicht direkt vergleichbar: „Spitze“ ist ein Bestwert, meist bei Code oder mit Spekulation gemessen, „Alltag“ eine einzelne Anfrage mit Prosa-Prompt.
Intelligenz = Originalmodell laut Artificial Analysis Intelligence Index v4.3.2, Stand 26. Sept. 2026. Quantisierung und Engine können den Wert im Rezept verändern. Quelle: Artificial Analysis
Tippen zeigt Details, zweites Tippen öffnet das Rezept.
Filtern nach Hardware, Engine, Quantisierung, Modellfamilie und Kreator. Karten oder Tabelle, gleiche Daten.
1 Anfrage, Prosa-Prompt, ohne Spekulation Quelle
1 Anfrage, Prosa-Prompt, ohne Spekulation Quelle
1 Anfrage, Prosa-Prompt, Kontext 19, mit DSpark (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, ohne Spekulation Quelle
1 Anfrage, Prosa-Prompt, Prompt 450 Token, ohne Spekulation Quelle
1 Anfrage, Prosa-Prompt, ohne Spekulation Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit MTP Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, ohne Spekulation Quelle
1 Anfrage, Prosa-Prompt, ohne Spekulation Quelle
1 Anfrage, Prosa-Prompt, mit DFlash (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, ohne Spekulation Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit Draft Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit DFlash2 (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit MTP (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit DSpark (laut Rezept) Quelle
1 Anfrage, Prosa-Prompt, mit DFlash2 (laut Rezept) Quelle
Für Strix Halo zeigen wir Qualität statt Tempo: gelöste Agenten-Aufgaben im Terminal-Bench-Mini (19 Aufgaben im Terminal). Dazu einige ausgewählte Tempowerte mit Quellenangabe; die vollständigen Messreihen liegen beim Autor.
| Modell | Quant | Aufbau | Engine | Gelöst | Im 1. Versuch | Lauf |
|---|---|---|---|---|---|---|
| DeepSeek-V4.1-Flash | Q2 | 2× Strix Halo | DwarfStar pr-16-09-2026 / rocm 10.0 | 18/19 | Lauf ↗ | |
| Qwen3.8-Flash-Next | W4B | 1× Strix Halo | halogen-flash-server / unknown | 18/19 | Lauf ↗ | |
| DeepSeek-V4-Flash-0731 | MXFP4 | 2× Strix Halo | DwarfStar / rocm 7.14 | 15/19 | Lauf ↗ | |
| DeepSeek-V4-Flash-0731 | UD-IQ2_XXS | 1× Strix Halo | llama.cpp vulkan-performance / vulkan | 18/19 | Lauf ↗ | |
| DeepSeek-V4-Flash-0731 | IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8 | 1× Strix Halo | DwarfStar / rocm 10.0 | 18/19 | Lauf ↗ | |
| DeepSeek-V4-Flash-0731 | IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ8 | 1× Strix Halo | DwarfStar / rocm 10.0 | 17/19 | Lauf ↗ | |
| DeepSeek-V4.1-Flash | Q2 | 2× Strix Halo | DwarfStar pr-22-09-2026 / rocm 10.0 | 16/19 | Lauf ↗ | |
| Qwen3.8-27B | UD-Q4_K_XL | 1× Strix Halo | llama.cpp / rocm 7.14 | 15/19 | Lauf ↗ | |
| DeepSeek-V4-Flash-0731 | UD-IQ3_XXS | 1× Strix Halo | llama.cpp / vulkan | 17/19 | Lauf ↗ | |
| Qwen3.8-27B | Q4_0_ROCMI4 | 1× Strix Halo | llama.cpp rocmfpx / rocm 7.14 | 16/19 | Lauf ↗ | |
| Qwen3.8-Flash-Next | UD-IQ4_XS | 1× Strix Halo | EngramHalo / rocm 10.0 | 16/19 | Lauf ↗ | |
| Qwen3.8-27B | Q4_0_ROCMFP4_STRIX | 1× Strix Halo | llama.cpp rocmfpx / rocm 7.14 | 15/19 | Lauf ↗ | |
| GLM 5.3 Flash · Lauf unvollständig | Q2 | 1× Strix Halo | DwarfStar / rocm 10.0 | 14/19 | Lauf ↗ | |
| Qwen3.6-27B | UD-Q8_K_XL | 1× Strix Halo | llama.cpp / rocm 7.14 | 12/19 | Lauf ↗ | |
| Muse-Glimmer-30B | UD-Q4_K_XL | 1× Strix Halo | llama.cpp / rocm 7.14 | 11/19 | Lauf ↗ | |
| Qwen3.6-35B-A3B · Lauf unvollständig | UD-Q4_K_XL | 1× Strix Halo | llama.cpp / rocm 7.14 | 11/19 | Lauf ↗ |
Ergebnisse aus Terminal-Bench-Mini von kyuz0, Apache-2.0 (basiert auf Terminal-Bench 2.1, Apache-2.0). Terminal-Bench-Mini (core19) · kyuz0 · Apache-2.0
Zusammengefasst aus den Videos von Donato Capitella und den Toolbox-READMEs von kyuz0. Stand der Quellen steht jeweils dabei.
linux-firmware 20251125 meiden; der Fix kam ab 20260110.1 Die Firmware-Doku von kyuz0 (08.01.2026) nennt als Notlösung den Downgrade auf 20251111.2 Kernel 6.18.4 oder neuer nur mit passendem ROCm (7.2+ oder Nightly); ältere ROCm-Images laufen auf neuen Kerneln nicht stabil.3 kyuz0 testet derzeit mit Kernel 6.18.9.4
Im BIOS die feste VRAM-Reservierung klein lassen und per Kernel-Parameter rund 124 GB freigeben: amd_iommu=off amdgpu.gttsize=126976 ttm.pages_limit=32505856. Auf der Ryzen AI Halo übernimmt das amd-ttm --set 124. Etwa 4 GB bleiben fürs System.4
Ohne Desktop, mit tuned im Profil accelerator-performance und ohne IOMMU. Die oft genannten „10–15 % schneller“ betreffen vor allem den Prefill (+14 bis +18 %); beim Decode sind es +3 bis +7 %. Ohne IOMMU sind NPU und DMA-Schutz aus.5
Die Toolboxes von kyuz0 bündeln Engine und Treiber. Am stabilsten ist vulkan-radv, empfohlen für alle Modelle. MTP steckt inzwischen im normalen llama.cpp; die alten -mtp-Toolboxes sind abgekündigt.6
MTP bringt beim Decode für MoE-Modelle +22 bis +47 %, für dichte 27B-Modelle +72 bis +93 %. Der Prefill wird dabei um 1 bis 27 % langsamer.7,8 Für Qwen3.8-Flash-Next empfiehlt Donato derzeit Halogen vor EngramHalo, mit dem Hinweis, dass sich das ändern kann; EngramHalo braucht -lm mmap --lazy-mode on.9,6
Ein Modell mit wenig aktiven Parametern ist auf Strix Halo schnell, und der Software-Weg entscheidet mit: Beim Decode liegt Vulkan meist vor ROCm (in allen Paaren nur mit dem experimentellen RADV-Performance-Fork), MTP legt beim Decode deutlich zu, langer Kontext davor kostet spürbar Tempo. Große MoE-Modelle laufen in niedriger Quantisierung, aber deutlich langsamer.
Decode in tok/s, eine Anfrage, 2.048 Token Prompt + 128 Token Ausgabe
Messungen: Donato Capitella · local-llm-benchmarks.dev · abgerufen 26. Sept. 2026. Ausgewählte Werte zitiert mit Quellenangabe; vollständige Messreihen bei local-llm-benchmarks.dev.
1 Anfrage, Prosa-Prompt, ohne Spekulation Quelle
1 Anfrage, gemischtes Prompt-Set, mit ndt=3 Quelle
1 Anfrage, synthetischer Prompt Quelle
1 Anfrage, synthetischer Prompt Quelle
1 Anfrage, Code-Prompt Quelle
Datenblatt laut Hersteller, Preise aus deutschen Shops mit Händler und Abrufdatum. Drittanbieterpreise, keine Leistung von Context Studios.
| Plattform | Speicher | Bandbreite | Leistung | FP4 nativ | FP8 nativ | Preis DE |
|---|---|---|---|---|---|---|
| NVIDIA DGX Spark (GB10)Grace Blackwell GB10nvidia.com ↗ developer.nvidia.com ↗ | 128 GBLPDDR5x unified (coherent) | 273 GB/s | k. A. | ja | k. A. | ab 4.800 €NVIDIA Marketplace DE ↗ · Stand 25. Sept. 2026NVIDIA DGX Spark Founders Edition, 128 GB, 4 TB SSDAlle 13 Angebote
|
| Mac / Apple SiliconUnified Memory; Chip/Speicher/Bandbreite je Rezept verschieden | k. A.LPDDR (unified)M2 Max, M2 Ultra, M3 Ultra, M4 Max, M5 Max | k. A. | k. A. | k. A. | k. A. | ab 5.859 €Apple Store DE ↗ · Stand 25. Sept. 2026Apple Mac Studio (M5 Max), M5 Max 18-Core CPU / 40-Core GPU, 128 GB, 512 GB SSDAlle 4 Angebote
|
| AMD Strix Halo16× Zen 5 + Radeon 8060S (40 CU, RDNA 3.5, gfx1151)amd.com ↗ | 128 GBLPDDR5x-8000 (unified, max. 128 GB) | 256 GB/s | 55 (cTDP 45–120) W | nein | nein | ab 3.799 €galaxus (via geizhals.de) ↗ · Stand 25. Sept. 2026GMKtec EVO-X2, Ryzen AI Max+ 395, 128 GB, 2 TB SSDAlle 3 Angebote
|
| NVIDIA RTX 3090Ampere (GA102)images.nvidia.com ↗ nvidia.com ↗ | 24 GBGDDR6X | 936 GB/s | 350 W | nein | nein | ab 2.290 €BC GmbH (via geizhals.de) ↗ · Stand 25. Sept. 2026NVIDIA GeForce RTX 3090 24 GB, neu – EVGA FTW3 Ultra Gaminggebraucht: 999 €–1.500 € · kleinanzeigen.de ↗ |
| NVIDIA RTX 5090Blackwell consumer (GB202)images.nvidia.com ↗ nvidia.com ↗ | 32 GBGDDR7 | 1792 GB/s | 575 W | ja | ja | ab 5.555 €Future-X.de (via geizhals.de) ↗ · Stand 25. Sept. 2026NVIDIA GeForce RTX 5090 32 GB, Zotac Gaming AMP Extreme INFINITY |
| NVIDIA RTX PRO 6000 BlackwellBlackwell (GB202, 188 SM)nvidia.com ↗ nvidia.com ↗ | 96 GBGDDR7 ECC | 1792 GB/s | maxq: 300 W · server: bis 600 (konfigurierbar) W · workstation: 600 W | ja | ja | ab 16.399 €computeruniverse.net (via geizhals.de) ↗ · Stand 25. Sept. 2026NVIDIA RTX PRO 6000 Blackwell 96 GB, Max-Q Workstation Edition (PNY, Smallbox VCNRTXPRO6000MQ-SB)Alle 2 Angebote
|
Preise in EUR inkl. MwSt., Händler und Abrufdatum je Eintrag. je Gerät.
Was mehr Sparks bringen, warum die Box trotz knapper Bandbreite taugt und worauf es beim Kauf ankommt. Jede Zahl mit Quelle.
Ein Spark hat 128 GB Unified Memory,1 nutzbar sind laut Rezept-Autor rund 121 GiB.2 Das reicht für mittelgroße MoE-Modelle: Qwen3.6-35B schafft im Rezept von MiaAI Lab 95,1 tok/s bei einer Anfrage und 317 tok/s gesamt bei acht.3
Zwei Sparks verbindet ein einzelnes QSFP-Kabel.4 Drei schließt man ohne Switch zum Ring mit drei Kabeln.5 Für vier sieht NVIDIA einen Switch mit mindestens vier Ports zu 200 Gbit/s vor.6 Community-Projekte wie SparkRing betreiben vier Geräte auch als Ring ohne Switch; das ist kein von NVIDIA dokumentierter Weg.7
Mehr Geräte bringen vor allem Speicher. DeepSeek-V4.1-Flash belegt 476 GiB auf der Platte und passt erst ab drei Sparks; auf vier erreicht es laut Rezept 87,7 tok/s bei einer Prosa-Anfrage.8
Beim Tempo skaliert Tensor-Parallelität gut, aber nicht linear: In NVIDIAs Test (Llama 3.3 70B, 32K Eingabe) ist Decode mit zwei Sparks 2,0-mal und mit vier 3,7-mal so schnell wie mit einem.9
273 GB/s Speicherbandbreite sind wenig für ein Gerät dieser Klasse.1 Beim Schreiben (Decode) liest das Modell für jedes Token seine Gewichte neu. Drei Techniken gleichen das aus.
MoE-Modelle aktivieren pro Token nur einen Bruchteil ihrer Parameter. Spekulatives Decoding (MTP, DSpark, DFlash) lässt ein kleines Hilfsmodell mehrere Token vorschlagen, die das große Modell in einem Schritt prüft. Tensor-Parallelität verteilt jede Gewichtsmatrix auf mehrere Sparks: Bei NVIDIA sinkt die Zeit pro Ausgabetoken von 269 ms (ein Spark) auf 133 ms (zwei) und 72 ms (vier).9
Beim Lesen langer Prompts (Prefill) ist der Gewinn kleiner: 1,6-mal bzw. 2,1-mal bei 32K Token (aus NVIDIAs TTFT-Werten berechnet). NVIDIA schreibt selbst, dass Inferenz unterlinear skaliert, wenn die Knoten oft synchronisieren müssen.9
Die Partnergeräte nutzen denselben GB10-Chip (Compute Capability 12.1) wie NVIDIAs Founders Edition, die Rezepte sind daher nicht an ein Modell gebunden.10 Welches Gerät der Autor genutzt hat, steht in der Hardware-Notiz des Rezepts.
Die Founders Edition hat 4 TB NVMe.1 Das ist schnell voll: Qwen3.8-Flash-Next braucht allein rund 130 GiB.2
Zum Koppeln gibt NVIDIA die Kabel Amphenol NJAAKK-N911 (0,4 m) bzw. NJAAKK0006 (0,5 m) und Luxshare LMTQF022-SD-R frei. Schnellere Kabel bringen nichts, weil jeder Port bei 200 Gbit/s endet.11
GB10-Geräte verhalten sich nicht gleich: Ein Software-Update senkte den Leerlaufverbrauch der Founders Edition deutlich, ein Dell Pro Max GB10 blieb bei 35–37 W.12
Im Leerlauf braucht ein Spark nach aktuellem Software-Stand 22–25 W.12 Bei LLM-Inferenz sind es meist 60–90 W, unter Volllast knapp 200 W; ohne Stresstest blieb er unter 40 dBA.13
Beim deutschen Haushaltsstrompreis von durchschnittlich 37,0 ct/kWh kostet ein Spark im Dauerbetrieb grob 16–24 € im Monat bei typischer Inferenzlast und etwa 6 € im Leerlauf (eigene Rechnung, 720 Stunden).14
Weiterlesen: „DGX Spark: from one box to a cluster“ ↗ · 0xSero für EXO Labs, 25.09.2026. Einige Zahlen im Artikel sind inzwischen veraltet; oben stehen die geprüften Stände.
Wir kuratieren und verlinken. Die Arbeit gehört den Menschen, die sie veröffentlicht haben.
Titelzahlen in Repos sind oft Bestwerte. Wir trennen drei Kategorien und zeigen je Karte die beste verfügbare.
Decode bei einer Anfrage mit normalem Text. Das Tempo, das Sie im Chat spüren. Hat Vorrang als Hauptzahl.
Gemischtes Prompt-Set, oft mit spekulativem Decoding. Liegt zwischen Alltag und Spitze.
Bester belegter Wert, meist Code oder JSON mit spekulativem Decoding. Realistisch für Coding-Agenten, nicht für Prosa.
Rang: erst Kategorie (Alltag vor Gemischt vor Spitze), dann Tempo. Rezepte ohne belegte Hauptzahl stehen am Ende.
Tempowerte von local-llm-benchmarks.dev und den Strix-Halo-Toolboxes veröffentlichen wir nicht als Zahl, solange die Lizenz ungeklärt ist. Wir verlinken sie.
Intelligence Index v4.3.2 von Artificial Analysis für das Originalmodell, abgerufen am 26. Sept. 2026 über die offizielle API. Die angezeigte Stufe ist die AA-Standardstufe, klein daneben der Wert ohne Reasoning. Abgeleitete Modelle (REAP, Pruning) erhalten keinen Wert.
Ergebnisse aus Terminal-Bench-Mini von kyuz0, Apache-2.0 (basiert auf Terminal-Bench 2.1, Apache-2.0).
Bei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.
Hardwarepreise aus deutschen Shops in EUR inkl. MwSt., Stand 25. Sept. 2026. Händler und Abrufdatum stehen je Angebot.
Alle Rezepte, Empfehlungen und Messwerte sind öffentlich über den MCP-Server von Context Studios abrufbar, ohne Schlüssel.
Öffentlicher Endpoint
https://mcp.contextstudios.ai/api/public/mcp
Tools · Öffentlich · ohne Key
Beispiel
claude mcp add contextstudios \
--transport http https://mcp.contextstudios.ai/api/public/mcp
find_local_ai_recipes({
platform: "dgx-spark",
count: 2,
goal: "balance"
})Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.