Ressourcen · Lokale KI

Lokale KI auf Ihrer Hardware.

Welche offenen Modelle laufen auf DGX Spark, Mac, Strix Halo oder RTX, wie schnell und wie klug? Rezepte der Kreatoren, jede Zahl mit Bedingung und Quelle, jedes Gewicht verlinkt.

Schnellwahl für Ihre Hardware

Plattform und Anzahl wählen: Hier erscheinen die drei Empfehlungen für Ihre Hardware.

282 Rezepte24 Kreatoren6 Plattformen217 mit IntelligenzwertStand 26. Sept. 2026

(01)

Was steht bei Ihnen?

Plattform und Anzahl wählen. Empfehlungen und Rezeptliste folgen der Auswahl.

Plattform
Speicher gesamt—
Speicherklasse—
Rezept282 Rezepte

Speicherklassen (Faustregel)

  1. S24–32 GB1× 3090, 1× 509027B dicht, 35B-A3B
  2. M48–96 GB2–4× 3090, 2× 5090dieselben mit viel Kontext
  3. L96–128 GB1× Spark, 1× PRO 6000, Strix Halo, Mac 128 GBFlash-Klasse, teils nur 2-Bit
  4. XL192–256 GB2× Spark, 2× PRO 6000DeepSeek-V4-Flash, MiMo, GLM-5.3-Flash 4-Bit
  5. XXL384 GB+3–4× Spark, 4–8× PRO 6000, Mac 512 GBDeepSeek-V4.1-Flash, GLM-5.3, MiniMax-M3

Faustregel von Context Studios, keine Messung. Was tatsächlich passt, zeigt das jeweilige Rezept.

(02)

Unsere Empfehlungen.

Ohne Auswahl: die ausgewogene Empfehlung je Plattform für die kleinste Ausbaustufe.

(03)

Schnell ist nicht klug.

Jeder Punkt ist ein Rezept: rechts schneller, oben klüger. Die Form zeigt, wie das Tempo gemessen wurde.

01020304050251020501002005001.000schnell und klug ↗Tempo, Hauptzahl in tok/s (logarithmisch) →↑ Intelligenz (Originalmodell)
  • Tempo gemessen als
  • Alltag
  • Gemischt
  • Spitze
  • Gestrichelter Kreis: stark komprimiert (unter 2,5 Bit je Gewicht), Intelligenz gilt fürs Originalmodell

209 von 282 Rezepten dargestellt, nur Rezepte mit Tempo- und Intelligenzwert.

Die Tempo-Kategorien sind nicht direkt vergleichbar: „Spitze“ ist ein Bestwert, meist bei Code oder mit Spekulation gemessen, „Alltag“ eine einzelne Anfrage mit Prosa-Prompt.

Intelligenz = Originalmodell laut Artificial Analysis Intelligence Index v4.3.2, Stand 26. Sept. 2026. Quantisierung und Engine können den Wert im Rezept verändern. Quelle: Artificial Analysis 

Tippen zeigt Details, zweites Tippen öffnet das Rezept.

(04)

Alle Rezepte.

Filtern nach Hardware, Engine, Quantisierung, Modellfamilie und Kreator. Karten oder Tabelle, gleiche Daten.

24 von 282 Rezepten

(05)

AMD Strix Halo: Kann das Modell die Arbeit?

Für Strix Halo zeigen wir Qualität statt Tempo: gelöste Agenten-Aufgaben im Terminal-Bench-Mini (19 Aufgaben im Terminal). Dazu einige ausgewählte Tempowerte mit Quellenangabe; die vollständigen Messreihen liegen beim Autor.

Terminal-Bench-Mini (core19), sortiert nach gelösten Aufgaben
ModellQuantAufbauEngineGelöstIm 1. VersuchLauf
DeepSeek-V4.1-FlashQ22× Strix HaloDwarfStar pr-16-09-2026 / rocm 10.019/1918/19Lauf ↗
Qwen3.8-Flash-NextW4B1× Strix Halohalogen-flash-server / unknown19/1918/19Lauf ↗
DeepSeek-V4-Flash-0731MXFP42× Strix HaloDwarfStar / rocm 7.1419/1915/19Lauf ↗
DeepSeek-V4-Flash-0731UD-IQ2_XXS1× Strix Halollama.cpp vulkan-performance / vulkan18/1918/19Lauf ↗
DeepSeek-V4-Flash-0731IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ81× Strix HaloDwarfStar / rocm 10.018/1918/19Lauf ↗
DeepSeek-V4-Flash-0731IQ2XXS-w2Q2K-AProjQ8-SExpQ8-OutQ81× Strix HaloDwarfStar / rocm 10.018/1917/19Lauf ↗
DeepSeek-V4.1-FlashQ22× Strix HaloDwarfStar pr-22-09-2026 / rocm 10.018/1916/19Lauf ↗
Qwen3.8-27BUD-Q4_K_XL1× Strix Halollama.cpp / rocm 7.1418/1915/19Lauf ↗
DeepSeek-V4-Flash-0731UD-IQ3_XXS1× Strix Halollama.cpp / vulkan17/1917/19Lauf ↗
Qwen3.8-27BQ4_0_ROCMI41× Strix Halollama.cpp rocmfpx / rocm 7.1417/1916/19Lauf ↗
Qwen3.8-Flash-NextUD-IQ4_XS1× Strix HaloEngramHalo / rocm 10.016/1916/19Lauf ↗
Qwen3.8-27BQ4_0_ROCMFP4_STRIX1× Strix Halollama.cpp rocmfpx / rocm 7.1416/1915/19Lauf ↗
GLM 5.3 Flash · Lauf unvollständigQ21× Strix HaloDwarfStar / rocm 10.014/1914/19Lauf ↗
Qwen3.6-27BUD-Q8_K_XL1× Strix Halollama.cpp / rocm 7.1414/1912/19Lauf ↗
Muse-Glimmer-30BUD-Q4_K_XL1× Strix Halollama.cpp / rocm 7.1414/1911/19Lauf ↗
Qwen3.6-35B-A3B · Lauf unvollständigUD-Q4_K_XL1× Strix Halollama.cpp / rocm 7.1411/1911/19Lauf ↗

Ergebnisse aus Terminal-Bench-Mini von kyuz0, Apache-2.0 (basiert auf Terminal-Bench 2.1, Apache-2.0). Terminal-Bench-Mini (core19) · kyuz0 · Apache-2.0

Strix Halo einrichten: in 5 Schritten

Zusammengefasst aus den Videos von Donato Capitella und den Toolbox-READMEs von kyuz0. Stand der Quellen steht jeweils dabei.

  1. Aktuellen Linux-Stack nehmen und nicht mischen

    linux-firmware 20251125 meiden; der Fix kam ab 20260110.1 Die Firmware-Doku von kyuz0 (08.01.2026) nennt als Notlösung den Downgrade auf 20251111.2 Kernel 6.18.4 oder neuer nur mit passendem ROCm (7.2+ oder Nightly); ältere ROCm-Images laufen auf neuen Kerneln nicht stabil.3 kyuz0 testet derzeit mit Kernel 6.18.9.4

  2. Den Speicher der GPU geben

    Im BIOS die feste VRAM-Reservierung klein lassen und per Kernel-Parameter rund 124 GB freigeben: amd_iommu=off amdgpu.gttsize=126976 ttm.pages_limit=32505856. Auf der Ryzen AI Halo übernimmt das amd-ttm --set 124. Etwa 4 GB bleiben fürs System.4

  3. Als Server betreiben

    Ohne Desktop, mit tuned im Profil accelerator-performance und ohne IOMMU. Die oft genannten „10–15 % schneller“ betreffen vor allem den Prefill (+14 bis +18 %); beim Decode sind es +3 bis +7 %. Ohne IOMMU sind NPU und DMA-Schutz aus.5

  4. Fertige Container statt Eigenbau

    Die Toolboxes von kyuz0 bündeln Engine und Treiber. Am stabilsten ist vulkan-radv, empfohlen für alle Modelle. MTP steckt inzwischen im normalen llama.cpp; die alten -mtp-Toolboxes sind abgekündigt.6

  5. MoE-Modelle mit MTP wählen

    MTP bringt beim Decode für MoE-Modelle +22 bis +47 %, für dichte 27B-Modelle +72 bis +93 %. Der Prefill wird dabei um 1 bis 27 % langsamer.7,8 Für Qwen3.8-Flash-Next empfiehlt Donato derzeit Halogen vor EngramHalo, mit dem Hinweis, dass sich das ändern kann; EngramHalo braucht -lm mmap --lazy-mode on.9,6

Zum Anschauen

Tempo auf Strix Halo: 7 zitierte Messwerte

Ein Modell mit wenig aktiven Parametern ist auf Strix Halo schnell, und der Software-Weg entscheidet mit: Beim Decode liegt Vulkan meist vor ROCm (in allen Paaren nur mit dem experimentellen RADV-Performance-Fork), MTP legt beim Decode deutlich zu, langer Kontext davor kostet spürbar Tempo. Große MoE-Modelle laufen in niedriger Quantisierung, aber deutlich langsamer.

Decode in tok/s, eine Anfrage, 2.048 Token Prompt + 128 Token Ausgabe

  • Qwen3.6-35B-A3BSchnellste Messung, mit MTP89,1 tok/sllama.cpp · Vulkan (RADV) · UD-Q4_K_XL · MTP 3 · ohne Kontext davor · eine Anfrage · Lauf  · results.json 
  • Qwen3.6-35B-A3BGleiches Modell ohne MTP60,7 tok/sllama.cpp · Vulkan (RADV) · UD-Q4_K_XL · ohne Spec · ohne Kontext davor · eine Anfrage · Lauf  · results.json 
  • Qwen3.6-35B-A3BOhne MTP, ROCm statt Vulkan51,3 tok/sllama.cpp · ROCm 10.0 · UD-Q4_K_XL · ohne Spec · ohne Kontext davor · eine Anfrage · Lauf  · results.json 
  • Qwen3.6-35B-A3BOhne MTP, 32K Kontext davor50 tok/sllama.cpp · Vulkan (RADV) · UD-Q4_K_XL · ohne Spec · 32K Kontext davor · eine Anfrage · Lauf  · results.json 
  • DeepSeek-V4-Flash-0731Großes MoE-Modell, ohne Spec (Q8-KV)19,2 tok/sllama.cpp performance fork · Vulkan (RADV) · UD-IQ2_XXS · ohne Spec · KV q8_0 · ohne Kontext davor · eine Anfrage · Lauf  · results.json 
  • DeepSeek-V4-Flash-0731Gleiches Modell mit DSpark29,6 tok/sllama.cpp performance fork · Vulkan (RADV) · UD-IQ2_XXS · DSpark · KV q8_0 · ohne Kontext davor · eine Anfrage · Lauf  · results.json 
  • Qwen3.8-Flash-NextWeiteres großes Modell, ohne Spec26,4 tok/sllama.cpp performance fork · Vulkan (RADV) · UD-IQ4_XS · ohne Spec · ohne Kontext davor · eine Anfrage · Lauf  · results.json 

Messungen: Donato Capitella · local-llm-benchmarks.dev · abgerufen 26. Sept. 2026. Ausgewählte Werte zitiert mit Quellenangabe; vollständige Messreihen bei local-llm-benchmarks.dev.

Rezepte mit freien Tempowerten

(06)

Hardware im Vergleich.

Datenblatt laut Hersteller, Preise aus deutschen Shops mit Händler und Abrufdatum. Drittanbieterpreise, keine Leistung von Context Studios.

PlattformSpeicherBandbreiteLeistungFP4 nativFP8 nativPreis DE
NVIDIA DGX Spark (GB10)Grace Blackwell GB10nvidia.com ↗ developer.nvidia.com ↗ 128 GBLPDDR5x unified (coherent)273 GB/sk. A.jak. A.ab 4.800 €NVIDIA Marketplace DE ↗ · Stand 25. Sept. 2026NVIDIA DGX Spark Founders Edition, 128 GB, 4 TB SSD
Alle 13 Angebote
Mac / Apple SiliconUnified Memory; Chip/Speicher/Bandbreite je Rezept verschiedenk. A.LPDDR (unified)M2 Max, M2 Ultra, M3 Ultra, M4 Max, M5 Maxk. A.k. A.k. A.k. A.ab 5.859 €Apple Store DE ↗ · Stand 25. Sept. 2026Apple Mac Studio (M5 Max), M5 Max 18-Core CPU / 40-Core GPU, 128 GB, 512 GB SSD
Alle 4 Angebote
  • 5.859 € · Apple Mac Studio (M5 Max), M5 Max 18-Core CPU / 40-Core GPU, 128 GB, 512 GB SSD · Apple Store DE ↗ · 25. Sept. 2026
  • 7.659 € · Apple MacBook Pro 14" (M5 Max), M5 Max 18-Core CPU / 40-Core GPU, 128 GB, 2 TB SSD · Apple Store DE ↗ · 25. Sept. 2026
  • 7.899 € · Apple MacBook Pro 16" (M5 Max), M5 Max 18-Core CPU / 40-Core GPU, 128 GB, 2 TB SSD · Apple Store DE ↗ · 25. Sept. 2026
  • 10.999 € · Apple Mac Studio (M5 Ultra), M5 Ultra 30-Core CPU / 64-Core GPU, 256 GB, 1 TB SSD · Apple Store DE ↗ · 25. Sept. 2026
AMD Strix Halo16× Zen 5 + Radeon 8060S (40 CU, RDNA 3.5, gfx1151)amd.com ↗ 128 GBLPDDR5x-8000 (unified, max. 128 GB)256 GB/s55 (cTDP 45–120) Wneinneinab 3.799 €galaxus (via geizhals.de) ↗ · Stand 25. Sept. 2026GMKtec EVO-X2, Ryzen AI Max+ 395, 128 GB, 2 TB SSD
Alle 3 Angebote
NVIDIA RTX 3090Ampere (GA102)images.nvidia.com ↗ nvidia.com ↗ 24 GBGDDR6X936 GB/s350 Wneinneinab 2.290 €BC GmbH (via geizhals.de) ↗ · Stand 25. Sept. 2026NVIDIA GeForce RTX 3090 24 GB, neu – EVGA FTW3 Ultra Gaminggebraucht: 999 €–1.500 € · kleinanzeigen.de ↗
NVIDIA RTX 5090Blackwell consumer (GB202)images.nvidia.com ↗ nvidia.com ↗ 32 GBGDDR71792 GB/s575 Wjajaab 5.555 €Future-X.de (via geizhals.de) ↗ · Stand 25. Sept. 2026NVIDIA GeForce RTX 5090 32 GB, Zotac Gaming AMP Extreme INFINITY
NVIDIA RTX PRO 6000 BlackwellBlackwell (GB202, 188 SM)nvidia.com ↗ nvidia.com ↗ 96 GBGDDR7 ECC1792 GB/smaxq: 300 W · server: bis 600 (konfigurierbar) W · workstation: 600 Wjajaab 16.399 €computeruniverse.net (via geizhals.de) ↗ · Stand 25. Sept. 2026NVIDIA RTX PRO 6000 Blackwell 96 GB, Max-Q Workstation Edition (PNY, Smallbox VCNRTXPRO6000MQ-SB)
Alle 2 Angebote

Preise in EUR inkl. MwSt., Händler und Abrufdatum je Eintrag. je Gerät.

DGX Spark: vom ersten Gerät zum Cluster

Was mehr Sparks bringen, warum die Box trotz knapper Bandbreite taugt und worauf es beim Kauf ankommt. Jede Zahl mit Quelle.

Vom ersten Spark zum Cluster

Ein Spark hat 128 GB Unified Memory,1 nutzbar sind laut Rezept-Autor rund 121 GiB.2 Das reicht für mittelgroße MoE-Modelle: Qwen3.6-35B schafft im Rezept von MiaAI Lab 95,1 tok/s bei einer Anfrage und 317 tok/s gesamt bei acht.3

Zwei Sparks verbindet ein einzelnes QSFP-Kabel.4 Drei schließt man ohne Switch zum Ring mit drei Kabeln.5 Für vier sieht NVIDIA einen Switch mit mindestens vier Ports zu 200 Gbit/s vor.6 Community-Projekte wie SparkRing betreiben vier Geräte auch als Ring ohne Switch; das ist kein von NVIDIA dokumentierter Weg.7

Mehr Geräte bringen vor allem Speicher. DeepSeek-V4.1-Flash belegt 476 GiB auf der Platte und passt erst ab drei Sparks; auf vier erreicht es laut Rezept 87,7 tok/s bei einer Prosa-Anfrage.8

Beim Tempo skaliert Tensor-Parallelität gut, aber nicht linear: In NVIDIAs Test (Llama 3.3 70B, 32K Eingabe) ist Decode mit zwei Sparks 2,0-mal und mit vier 3,7-mal so schnell wie mit einem.9

Warum der Spark trotz 273 GB/s funktioniert

273 GB/s Speicherbandbreite sind wenig für ein Gerät dieser Klasse.1 Beim Schreiben (Decode) liest das Modell für jedes Token seine Gewichte neu. Drei Techniken gleichen das aus.

MoE-Modelle aktivieren pro Token nur einen Bruchteil ihrer Parameter. Spekulatives Decoding (MTP, DSpark, DFlash) lässt ein kleines Hilfsmodell mehrere Token vorschlagen, die das große Modell in einem Schritt prüft. Tensor-Parallelität verteilt jede Gewichtsmatrix auf mehrere Sparks: Bei NVIDIA sinkt die Zeit pro Ausgabetoken von 269 ms (ein Spark) auf 133 ms (zwei) und 72 ms (vier).9

Beim Lesen langer Prompts (Prefill) ist der Gewinn kleiner: 1,6-mal bzw. 2,1-mal bei 32K Token (aus NVIDIAs TTFT-Werten berechnet). NVIDIA schreibt selbst, dass Inferenz unterlinear skaliert, wenn die Knoten oft synchronisieren müssen.9

Worauf beim Kauf achten

Die Partnergeräte nutzen denselben GB10-Chip (Compute Capability 12.1) wie NVIDIAs Founders Edition, die Rezepte sind daher nicht an ein Modell gebunden.10 Welches Gerät der Autor genutzt hat, steht in der Hardware-Notiz des Rezepts.

Die Founders Edition hat 4 TB NVMe.1 Das ist schnell voll: Qwen3.8-Flash-Next braucht allein rund 130 GiB.2

Zum Koppeln gibt NVIDIA die Kabel Amphenol NJAAKK-N911 (0,4 m) bzw. NJAAKK0006 (0,5 m) und Luxshare LMTQF022-SD-R frei. Schnellere Kabel bringen nichts, weil jeder Port bei 200 Gbit/s endet.11

GB10-Geräte verhalten sich nicht gleich: Ein Software-Update senkte den Leerlaufverbrauch der Founders Edition deutlich, ein Dell Pro Max GB10 blieb bei 35–37 W.12

Strom und Lautstärke

Im Leerlauf braucht ein Spark nach aktuellem Software-Stand 22–25 W.12 Bei LLM-Inferenz sind es meist 60–90 W, unter Volllast knapp 200 W; ohne Stresstest blieb er unter 40 dBA.13

Beim deutschen Haushaltsstrompreis von durchschnittlich 37,0 ct/kWh kostet ein Spark im Dauerbetrieb grob 16–24 € im Monat bei typischer Inferenzlast und etwa 6 € im Leerlauf (eigene Rechnung, 720 Stunden).14

Weiterlesen: „DGX Spark: from one box to a cluster“ ↗ · 0xSero für EXO Labs, 25.09.2026. Einige Zahlen im Artikel sind inzwischen veraltet; oben stehen die geprüften Stände.

(08)

So lesen Sie die Zahlen.

Titelzahlen in Repos sind oft Bestwerte. Wir trennen drei Kategorien und zeigen je Karte die beste verfügbare.

(01)

Alltag

Decode bei einer Anfrage mit normalem Text. Das Tempo, das Sie im Chat spüren. Hat Vorrang als Hauptzahl.

(02)

Gemischt

Gemischtes Prompt-Set, oft mit spekulativem Decoding. Liegt zwischen Alltag und Spitze.

(03)

Spitze

Bester belegter Wert, meist Code oder JSON mit spekulativem Decoding. Realistisch für Coding-Agenten, nicht für Prosa.

Rang

Rang: erst Kategorie (Alltag vor Gemischt vor Spitze), dann Tempo. Rezepte ohne belegte Hauptzahl stehen am Ende.

Werte beim Autor

Tempowerte von local-llm-benchmarks.dev und den Strix-Halo-Toolboxes veröffentlichen wir nicht als Zahl, solange die Lizenz ungeklärt ist. Wir verlinken sie.

Intelligenz: Artificial Analysis

Intelligence Index v4.3.2 von Artificial Analysis für das Originalmodell, abgerufen am 26. Sept. 2026 über die offizielle API. Die angezeigte Stufe ist die AA-Standardstufe, klein daneben der Wert ohne Reasoning. Abgeleitete Modelle (REAP, Pruning) erhalten keinen Wert.

Artificial Analysis, https://artificialanalysis.ai/ ↗

Qualität: Terminal-Bench-Mini

Ergebnisse aus Terminal-Bench-Mini von kyuz0, Apache-2.0 (basiert auf Terminal-Bench 2.1, Apache-2.0).

Terminal-Bench-Mini (core19) · Apache-2.0 ↗

Starke Quantisierung

Bei 3 bit und weniger kann das Modell spürbar schlechter antworten als das Original. Die Intelligenz-Zahl gilt für das Original.

Preise

Hardwarepreise aus deutschen Shops in EUR inkl. MwSt., Stand 25. Sept. 2026. Händler und Abrufdatum stehen je Angebot.

Häufige Fragen.

(01)Was bedeuten Alltag, Gemischt und Spitze?
Alltag ist das Tempo bei einer Anfrage mit normalem Text. Gemischt stammt aus einem gemischten Prompt-Set. Spitze ist der beste belegte Wert, meist Code oder JSON mit spekulativem Decoding. Jede Karte zeigt die beste verfügbare Kategorie und nennt sie.
(02)Warum weichen die Zahlen von der Überschrift im Repo ab?
Überschriften nennen oft den Bestwert. Wir übernehmen die Zahl samt Bedingung aus der verlinkten Quelle und ordnen sie einer Kategorie zu. Die Quelle steht an jeder Zahl.
(03)Woher kommt die Intelligenz-Zahl?
Aus dem Intelligence Index von Artificial Analysis, abgerufen über die offizielle API. Sie gilt für das Originalmodell, nicht für die quantisierte Variante. Ist keine eindeutige Zuordnung möglich, steht dort „kein unabhängiger Wert“.
(04)Warum zeigt Strix Halo keine Tempo-Zahlen aus den großen Benchmarks?
Die Lizenz dieser Daten ist ungeklärt. Wir zeigen stattdessen die Qualitätsrangliste aus Terminal-Bench-Mini (Apache-2.0) und verlinken die Tempowerte beim Autor.
(05)Wie aktuell sind die Preise?
Jeder Preis trägt Händler, Link und Abrufdatum. Hardwarepreise schwanken stark. Prüfen Sie den Preis vor dem Kauf beim Händler.
(06)Kann mein Coding-Agent die Rezepte direkt abfragen?
Ja. Der öffentliche MCP-Server von Context Studios liefert Rezepte, Empfehlungen, Hardware und Methodik ohne Schlüssel. Endpoint und Toolnamen stehen unten auf dieser Seite.
(09)

Für Ihren Agenten. Per MCP.

Alle Rezepte, Empfehlungen und Messwerte sind öffentlich über den MCP-Server von Context Studios abrufbar, ohne Schlüssel.

Öffentlicher Endpoint

https://mcp.contextstudios.ai/api/public/mcp

Tools · Öffentlich · ohne Key

  • find_local_ai_recipes
  • list_local_ai_recipes
  • get_local_ai_recipe
  • list_local_ai_creators
  • get_local_ai_creator
  • get_local_ai_quality
  • list_local_ai_hardware
  • get_local_ai_methodology

Beispiel

claude mcp add contextstudios \
  --transport http https://mcp.contextstudios.ai/api/public/mcp

find_local_ai_recipes({
  platform: "dgx-spark",
  count: 2,
  goal: "balance"
})

Lokale KI im eigenen Unternehmen?

Im Workshop klären wir, welche Modelle und welche Hardware zu Ihren Aufgaben passen, und bauen den ersten Agenten auf Ihrer Infrastruktur.