Lokale KI

Lokale KI-Hardware 2026: DGX Spark, Mac Studio M5 Ultra, RTX 5090 und Strix Halo im Vergleich

Lokale KI-Hardware 2026: DGX Spark, Mac Studio M5 Ultra, RTX 5090 und Strix Halo im Vergleich

Update-Log

  • 24.09.2026: Erste Fassung. Abgedeckt sind DGX Spark/GB10, AMD Strix Halo, RTX 3090/4090/5090/PRO 6000, MacBook Pro M5 Max und der neue Mac Studio M5 Ultra (Auslieferung seit 22.09.2026). Dazu kommt unser eigener Benchmark vom 24.09.2026 mit GLM-5.3-Flash und Qwen3.8-Flash-Next auf je zwei DGX-Spark-Knoten. Preise: Stand September 2026.
  • Nächste Aktualisierung: 01.10.2026. Wir aktualisieren monatlich mit neuen Modellen, neuen Preisen und frischen Messungen.

Kurz gesagt: Wie schnell eine einzelne Unterhaltung läuft, bestimmt die Speicherbandbreite. Ob ein Modell überhaupt passt, bestimmt die Speichergröße. Eine gebrauchte RTX 3090 ist im September 2026 immer noch der günstigste Weg zu schnellen Tokens mit einem 27B-Modell. Der Mac Studio M5 Ultra (1,2 TB/s, bis 512 GB) ist die schnellste Einzelplatz-Maschine für große MoE-Modelle. Die DGX Spark gewinnt, wenn ihr CUDA, Clustering und mehrere parallele Anfragen braucht. Strix Halo liefert 128 GB Speicher zum niedrigsten Preis, verarbeitet lange Prompts aber langsam.

Wir betreiben bei Context Studios DGX-Spark-Knoten (ASUS Ascent GX10 mit NVIDIA GB10) mit vLLM im Produktivbetrieb, dazu einen Mac mini als Agent-Host. In diesem Guide stehen unsere eigenen Messungen neben den besten öffentlich dokumentierten Zahlen. Bei jeder Zahl steht, woher sie kommt.

Die eine Regel hinter allen Benchmarks

Die Decode-Geschwindigkeit, also die Tokens, die ihr lest, ergibt sich grob aus Speicherbandbreite ÷ gelesene Bytes pro Token. Prefill, also das Einlesen eures Prompts, hängt an der Rechenleistung. Die Speichergröße entscheidet, ob das Modell überhaupt passt.

Mixture-of-Experts-Modelle (MoE) wie Qwen3.8-Flash-Next (ca. 6B aktive Parameter) oder GLM-5.3-Flash (320B gesamt, 18B aktiv) lesen pro Token nur einen kleinen Teil ihrer Gewichte. Deshalb laufen sie auf einer 128-GB-Box mit 273 GB/s brauchbar schnell, während ein dichtes 70B-Modell auf derselben Maschine kriecht.

Vergleichstabelle (September 2026)

HardwareSpeicherBandbreitePreis (Sep. 2026)Leistung unter LastPassender Stack
NVIDIA DGX Spark / ASUS GX10 (GB10)128 GB Unified273 GB/s4.699 $ Liste (US), ab 5.038 € netto (EU)ca. 160 WvLLM, SGLang, EXL3, llama.cpp
AMD Ryzen AI Max+ 395 (Framework, EVO-X2)128 GB Unified (ca. 96–100 GB für die GPU)ca. 256 GB/s3.449–3.650 $ (128 GB)ca. 112–120 Wllama.cpp Vulkan/ROCm
RTX 3090 (gebraucht)24 GB936 GB/sca. 1.050–1.264 $250–350 WvLLM, llama.cpp, EXL3
RTX 4090 (gebraucht)24 GB1.008 GB/sca. 2.268–2.362 $ca. 450 WvLLM, llama.cpp
RTX 509032 GB1.792 GB/s1.999 $ UVP, ca. 4.700 $ im Handelca. 575 WvLLM, llama.cpp, NVFP4
RTX PRO 6000 Blackwell96 GBca. 1,8 TB/s16.000 $ (Sep. 2026)bis 600 WvLLM, SGLang, NVFP4
MacBook Pro M5 Maxbis 128 GB614 GB/snicht verifiziertLaptopMLX, mlx-serve, llama.cpp
Mac Studio M5 Ultra96/256/512 GB1,2 TB/sab 5.499 $; 512 GB ab Oktoberunter LLM-Last noch nicht gemessenMLX, LM Studio, llama.cpp

Die Preise sind 2026 stark gestiegen, weil DRAM und GDDR7 knapp sind. Die RTX PRO 6000 liegt rund 87 % über ihrer Launch-UVP, der GMKtec EVO-X2 mit 128 GB kletterte von 1.999 $ auf 3.499–3.650 $. Euro-Preise für die meisten Grafikkarten und Macs konnten wir noch nicht sauber belegen, deshalb stehen dort US-Preise.

Welches Modell auf welcher Hardware wie schnell läuft

Werte gelten für einen einzelnen Stream, sofern nicht anders angegeben. [R] = Review oder Hersteller, [C] = Community-Bericht auf X oder GitHub, [CS] = von Context Studios gemessen.

ModellHardwareDecodeHinweis
Qwen3.8-27B (dense) Q4RTX 3090 / 4090 / 509040 / 46 / 75 t/sllama.cpp Standard, 4k Kontext [R]
Qwen3.8-27BRTX 5090 + MTP77 → 155 t/sllama.cpp Q4_K_M [C]
Qwen3.8-27BRTX 3090, getuntes vLLMca. 114 t/s, ca. 1.000 t/s bei 64 Streamssyv-ai-Rezept [C]
Qwen3.8-27BDGX Spark12 t/s Standard → 31–58 t/s getuntNVFP4 + MTP [R]/[C]
Qwen3.8-27BStrix Halo11 → 24–30 t/sVulkan + MTP [R]/[C]
Qwen3.8-27BM5 Max 128 GB31 → 65–69 t/sMLX + MTP/DFlash2 [R]/[C]
Qwen3.8-Flash-Next (MoE)Mac Studio M5 Ultra100+ t/s kurz, 60–85 t/s bei 64k–256kMacStories-Test [R]
Qwen3.8-Flash-NextMacBook Pro M5 Max56–101 t/smlx-serve, MTP [C]
Qwen3.8-Flash-Next1× DGX Spark65–81 t/svLLM/EXL3 + MTP [C]
Qwen3.8-Flash-Next2× DGX Spark, NVFP432,9 t/s, Prefill 722 t/s (1k-Prompt)unser Lauf 24.09., ohne Speculative Decoding [CS]
Qwen3.8-Flash-NextStrix Halo22–38 t/sllama.cpp / Halogen [C]
Qwen3.8-Flash-NextRTX PRO 6000227 t/s, Prefill 9.900 t/s[C]
Qwen3.8-Flash-Next2× RTX PRO 60001.610 t/s über 32 StreamsvLLM Standard [C]
GLM-5.3-Flash EXL3 4bpw2× DGX Spark (TP=2)32,9 t/s, 63,7 t/s gesamt bei 4 Streamsunser Lauf 24.09. [CS]
GLM-5.3-Flash IQ2Strix Halo17–18 t/s[C]
GLM-5.2 (großes MoE)4× GB10-Cluster27 t/s, 76 t/s gesamt bei 6 StreamsvLLM TP4 + MTP, Juli/Aug. [CS]
DeepSeek-V4.1-Flash2× DGX Spark23 → 33 t/sEXL3, 1M Kontext [C]
DeepSeek-V4.1-Flash4× RTX PRO 6000ca. 120–125 t/s konstant bis 131k[C]

Prefill wird unterschätzt. Im MacStories-Test las der M5 Ultra einen Prompt mit 15.500 Tokens mit 2.887 t/s ein, der M3 Ultra schaffte 1.143 t/s. Eine RTX 5090 kam bei einem 6k-Prompt auf rund 3.000 t/s. Auf Strix Halo dauerte ein Prompt mit 1 Mio. Tokens 18 Minuten. Agenten schicken in jeder Runde 20.000 bis 60.000 Tokens aus Systemprompt, Tools und Gedächtnis mit. Dann entscheidet oft das Prefill, ob sich eine Maschine schnell anfühlt.

Community-Messungen von X (September 2026)

Wenn nicht anders angegeben: Decode mit einem Stream. Es handelt sich um Berichte von Entwicklern auf X, nicht um unsere Messungen. Die Setups unterscheiden sich (Quantisierung, spekulatives Decoding, gepatchte Engines). Jede Zeile zeigt also, was mit genau diesem Rezept möglich ist, und ist keine garantierte Basis. Die Lücke zwischen den gemeldeten 62,9 t/s für GLM-5.3-Flash auf zwei Sparks und unseren 32,9 t/s zeigt, wie viel ein optimiertes Rezept ausmacht.

HardwareModellSetupDecodeAnmerkungQuelle
1× DGX SparkQwen3.8-Flash-NextNVFP4, vLLM + MTP k=338 t/s53,8 t/s bei Code, 180 t/s aggregiert bei 8 Streams, ~2.000 t/s Prefill@jvr0x
1× DGX SparkQwen3.8-Flash-NextEXL3 vs. NVFP4, vLLM78,3 vs. 31,0 t/sgleiche Maschine; ~600 vs. ~150 t/s aggregiert bei 8 Anfragen@ViC305
2× DGX Spark (TP=2)GLM-5.3-FlashEXL3 4bpw, vllm-exl362,9 t/s146,5 t/s aggregiert bei 4 Streams@yume_arasaki
2× DGX Spark (TP=2)GLM-5.3-FlashNVFP4, patched vLLM46,3 t/sein Stream, Reasoning@mr_r0b0t
8× DGX SparkGLM-5.3-FlashNVFP4, vLLM96 t/s110 t/s bei 4 Streams@hypermac6502
16× DGX SparkKimi K3 (2.8T)vLLM + GB10 patch29,8 t/s87 t/s aggregiert bei 8 Streams, ~20 t/s bei 300k Kontext@ciprianveg
RTX PRO 6000 (96 GB)Qwen3.8-Flash-NextSGLang, FP8 KV + MTP252,9 t/s819 t/s bei 8 Streams, 1.190 t/s bei 16@wei_wang
4× RTX PRO 6000GLM-5.3-FlashvLLM240 t/s~12.000 t/s Prefill, 550 t/s aggregiert bei 4 Streams@hiheyhowareya
Strix Halo (Ryzen AI Max+ 395)Qwen3.8-Flash-NextLucebox ROCm38 t/s41,9 t/s bei 8k Kontext@luceboxai
RTX 4090 (24 GB)Qwen3.8-27BQ4_K_M, llama.cpp46 t/sFlash Attention, quantisierter KV-Cache@yume_arasaki
RTX 3090 / 4090 (24 GB)Qwen3.8-27BEXL3 3.5bpw + DFlash94–105 t/sdauerhaft; 130–150 t/s bei kurzen Antworten@yume_arasaki
MacBook Pro M4 Max (128 GB)Qwen3.8-27BMLX 4-bit + MTP43 t/sSpanne 42–44 t/s@yume_arasaki

Unsere Messung (Context Studios, 24.09.2026)

Wir haben einen kurzen, reproduzierbaren Benchmark gegen die Endpunkte gefahren, die wir täglich nutzen. Beide Modelle laufen auf je zwei ASUS-Ascent-GX10-Knoten (NVIDIA GB10, je 128 GB) mit Tensor Parallel 2 über ein 100G-RoCE-Netz. Den Qwen-Endpunkt erreichen wir über einen LiteLLM-Proxy auf unserem Mac mini, dort steckt also ein zusätzlicher Netzwerk-Hop in den Zahlen.

ModellSetupDecode (1 Stream)Prefill (ca. 1k Prompt)4 parallele Streams
GLM-5.3-Flash (320B MoE, 18B aktiv)EXL3 4bpw, vLLM, 2× GX10 TP=232,9 t/s1.262 t/s63,7 t/s gesamt (ca. 16,5 t/s pro Stream)
Qwen3.8-Flash-NextNVFP4, vLLM über LiteLLM, 2× GX1032,9 t/s722 t/s21,8 t/s gesamt (ein Stream fiel auf 7 t/s)

Methode. Streaming über /v1/chat/completions, Temperatur 0, Thinking aus, fester technischer Prompt. Ein Warm-up-Lauf wird verworfen, danach folgen drei Läufe mit 400 Ausgabe-Tokens; wir berichten den Median. Decode = (Completion-Tokens − 1) ÷ Zeit vom ersten bis zum letzten Token. Prefill schätzen wir als Prompt-Tokens ÷ Zeit bis zum ersten Token bei einem Prompt mit rund 1.040 Tokens. Darin steckt die Netzwerklatenz, der Wert ist also eine Untergrenze. Im Paralleltest schicken wir vier identische Anfragen mit je 400 Tokens gleichzeitig ab und teilen alle erzeugten Tokens durch die Wandzeit. Die Tokenzahlen stammen aus dem usage-Feld des Servers. Unser Cluster bedient gleichzeitig produktive Agenten. Vor allem die Parallelwerte sind deshalb eine Momentaufnahme und kein Laborergebnis.

So könnt ihr den Lauf gegen jeden OpenAI-kompatiblen Endpunkt wiederholen:

bash
python3 bench_local.py http://EUER-HOST:8000 eure-modell-id 3 4

Was wir aus den Zahlen ablesen:

  1. Zwei Sparks bringen ein 320B-Modell auf interaktives Tempo. 33 t/s in einem Stream fühlen sich im Chat und in Coding-Agenten flüssig an.
  2. Die höheren Qwen-Werte der Community kommen vom Speculative Decoding. Setups mit MTP melden 65–81 t/s auf einer Spark. Unser NVFP4-Endpunkt läuft ohne MTP und landet bei 33 t/s. Speculative Decoding ist der größte einzelne Hebel: Auf unserem 4-Knoten-Cluster hat es GLM-5.2 ungefähr verdoppelt (14,5 → 26,6 t/s).
  3. Der Parallel-Durchsatz hängt davon ab, was sonst noch auf der Box läuft. GLM skalierte fast linear auf vier Streams. Das Qwen-Paar war mit Agent-Traffic beschäftigt, ein Stream brach ein.

Frühere Messung: 4× GB10-Cluster mit GLM-5.2 (Juli/August 2026)

Was wir gemessen habenErgebnis
GLM-5.2 Decode bei 1 / 2 / 3 / 4 / 6 parallelen Streams (gesamt)27,2 / 42,6 / 52,1 / 62,7 / 75,8 t/s
Prefill 8k / 32k Prompt853 / 840 t/s
MTP-Effekt (ohne Draft → k=2)14,5 → 26,6 t/s
Korrigierte cudagraph capture sizes+38 % bei 2 Streams
Lange Unterhaltung (22 Runden, 104.846 Tokens)kein Einbruch
Kaltstart / kompletter Cluster-Neustart520 s / 13–14 min

Aus dem Betrieb gelernt: Wenn 2 Streams kaum schneller sind als einer, fehlen die passenden CUDA-Graph-Größen. Eine Konfigurationszeile brachte uns +38 %. Unified Memory braucht Aufmerksamkeit, denn ein OOM-Killer kann die Engine abschießen, und hart entfernte Container haben bis zum Neustart Speicher verloren. Ein Checkpoint wird einmal heruntergeladen und dann über das Netz verteilt: rund 15 Minuten statt ca. 48 Stunden für drei weitere Knoten.

Kaufentscheidung nach Budget, Einsatz und Modellgröße

Ihr wollt …BudgetKauftWarum
27–32B-Modelle (dense) schnell für eine Personca. 1.200–1.600 €Gebrauchte RTX 3090Meiste Tokens pro Euro; Qwen3.8-27B Q4 passt in 24 GB
Ein kleines Team (5–60 parallele Anfragen) mit einem 27B-Modellca. 2.500–3.500 €2× RTX 3090 oder eine RTX 5090Batch-Durchsatz mit vLLM
100–300B-MoE-Modelle leise am Schreibtischca. 3.500–4.000 €Strix Halo 128 GBAm meisten Speicher pro Euro; langsames Prefill in Kauf nehmen
Auf CUDA entwickeln, für Rechenzentrums-GPUs prototypen oder clusternca. 5.000–6.000 € pro KnotenDGX Spark / GX10NVFP4, vLLM-Rezepte, 200G-Clustering
Maximale Einzelplatz-Geschwindigkeit mit großen MoE-Modellen und langem Kontextab 5.499 $Mac Studio M5 Ultra1,2 TB/s und bis 512 GB
Local-first unterwegs arbeitenhochMacBook Pro M5 Max 128 GB614 GB/s im Laptop
Modelle ab 700B mit Produktionstempoab 64.000 $4× RTX PRO 6000384 GB VRAM, ca. 120 t/s mit DeepSeek V4.1 Flash

Faustregeln nach Modellgröße (4 Bit):

  • Bis 32B dense: passt in 24–32 GB VRAM. Eine einzelne RTX-Karte ist die schnellste Option.
  • Rund 70B dense: braucht ca. 48 GB und läuft auf Unified Memory langsam (4–6 t/s auf Strix Halo).
  • 100–320B MoE: braucht 64–128 GB. Spark, Strix Halo, M5 Max oder Mac Studio. Zwei Sparks fahren GLM-5.3-Flash in 4 bpw mit Luft für langen Kontext.
  • Ab 500B MoE: braucht einen Spark-Cluster, einen Mac mit 256–512 GB oder mehrere RTX PRO 6000.

Kosten pro Token: lokal oder Cloud

Annahmen: Strom 0,37 €/kWh (BDEW-Durchschnitt 2026), Abschreibung über 3 Jahre (26.280 Stunden), Betrieb rund um die Uhr unter Volllast. Das ist der beste Fall für lokale Hardware.

SetupDurchsatzNur StromInkl. HardwareCloud-Vergleich
2× GX10, GLM-5.3-Flash, 4 Streams [CS]63,7 t/sca. 0,52 € / 1 Mio. Tokensca. 2,03 € / 1 Mio. TokensGLM-5.3-Flash-API: 0,50 $ / 1 Mio. Output
4× GX10, GLM-5.2, 6 Streams [CS]75,8 t/sca. 0,87 € / 1 Mio. Tokensca. 3,41 € / 1 Mio. Tokensdito
Gebrauchte RTX 3090, vLLM im Batch, Qwen3.8-27B [C]ca. 1.000 t/sca. 0,04 € / 1 Mio. Tokensca. 0,05 € / 1 Mio. TokensQwen3.8-Flash-API: 0,47 $ / 1 Mio. Output

So haben wir die 2× GX10-Zeile gerechnet: 2 × ca. 160 W = 0,32 kW, also 0,118 € pro Stunde. Die Hardware (2 × 4.558 €, deutscher Handelspreis vom 28.08.2026) verteilt auf 26.280 Stunden kostet 0,347 € pro Stunde. 63,7 t/s ergeben 229.320 Tokens pro Stunde, 0,465 € pro Stunde entsprechen damit rund 2,03 € pro Million Tokens.

  • Die Cloud ist pro Token etwa 4× günstiger als unser GLM-Setup mit zwei Knoten, selbst unter Volllast.
  • Eine voll ausgelastete RTX 3090 unterbietet API-Preise für 27B-Modelle, aber nur bei dauerhaftem Batch-Traffic.
  • Ein typischer Einzelnutzer lastet die Hardware zu weniger als 10 % aus. Das multipliziert die lokalen Kosten mit 10 oder mehr.

Unser Fazit: Beim Preis pro Token gewinnt lokale KI selten. Sie gewinnt bei Datensouveränität, planbaren Fixkosten, fehlenden Rate-Limits und voller Kontrolle über Modelle und Kontext. Wer nur Tokens braucht, fährt mit der API günstiger. Wenn Daten das Haus nicht verlassen dürfen oder Agenten rund um die Uhr ohne Zähler laufen sollen, lohnt sich eigene Hardware.

Typische Stolpersteine je Plattform

  • DGX Spark: Die Geschwindigkeit im Einzelstream ist durch die Bandbreite begrenzt; lange kalte Prefills bremsen paralleles Decode; Community-Rezepte ändern sich wöchentlich.
  • Strix Halo: Der GTT-Kernelparameter ist Pflicht; ROCm- und Kernel-Versionen sind empfindlich; lange Prompts dauern Minuten.
  • RTX-Karten: Der VRAM ist schnell voll; Auslagern in den Arbeitsspeicher drückt das Tempo in den einstelligen Bereich; hoher Stromverbrauch und Lautstärke; die 5090 kostet im Handel etwa das Doppelte der UVP.
  • Macs: Beim Prefill liegt NVIDIA weiter vorn; viele MLX-Konvertierungen verlieren Vision oder MTP; die neuesten Modelle brauchen oft Beta-Builds.

Weiterführende Guides und Vergleiche

FAQ

Welche Hardware ist 2026 die beste für lokale LLMs?

Das hängt von der Modellgröße und der Zahl der Nutzer ab. Für eine Person mit 27–32B-Modellen bietet eine gebrauchte RTX 3090 im September 2026 das meiste Tempo pro Euro. Für MoE-Modelle ab 100B mit langem Kontext ist der Mac Studio M5 Ultra die schnellste Einzelplatz-Maschine, die DGX Spark ist die bessere Wahl, wenn ihr CUDA, Clustering oder viele parallele Anfragen braucht.

Lohnt sich die DGX Spark im Vergleich zum Mac Studio M5 Ultra?

Der M5 Ultra hat etwa die 4,4-fache Speicherbandbreite (1,2 TB/s gegenüber 273 GB/s) und erzeugt für einen einzelnen Nutzer deshalb schneller Tokens. Die Stärken der Spark sind CUDA, NVFP4, schnell nachziehende vLLM-Rezepte der Community und günstiges Clustering über 200G-Netzwerk. Wir haben uns für Sparks entschieden, weil wir mehrere Agenten parallel bedienen und uns der Gesamtdurchsatz wichtiger ist als das Tempo eines einzelnen Streams.

Wie schnell läuft GLM-5.3-Flash auf zwei DGX Sparks?

In unserem Lauf am 24.09.2026 erreichte GLM-5.3-Flash in EXL3 4bpw auf zwei ASUS-GX10-Knoten mit Tensor Parallel 2 genau 32,9 Tokens pro Sekunde in einem Stream. Mit vier parallelen Anfragen lieferte das Paar insgesamt 63,7 Tokens pro Sekunde, also rund 16,5 pro Stream. Das Prefill eines Prompts mit rund 1.000 Tokens lag über 1.200 Tokens pro Sekunde, gemessen inklusive Netzwerklatenz.

Kann AMD Strix Halo große Modelle wie GLM-5.3-Flash ausführen?

Ja. Mit 128 GB Unified Memory, von denen rund 96–100 GB an die GPU gehen können, laufen 2- bis 4-Bit-Quants von 200–300B-MoE-Modellen mit etwa 13–38 t/s. Der Haken ist die Prompt-Verarbeitung: Lange Kontexte dauern Minuten, ein Prompt mit 1 Mio. Tokens brauchte in einem Bericht 18 Minuten. Strix Halo ist eine starke Kapazitäts-Box für geduldige Einzelnutzer, aber nichts für Agent-Schleifen mit riesigen Prompts.

Wie viele Tokens pro Sekunde brauchen Coding-Agenten?

Für interaktives Arbeiten fühlen sich rund 30 t/s Decode flüssig an, ab 60 t/s wirkt es schnell. Bei Agenten ist das Prefill genauso wichtig, weil jede Runde Zehntausende Tokens Kontext mitschickt. Eine Maschine mit 50 t/s Decode und 300 t/s Prefill fühlt sich in einem Agent-Harness langsamer an als eine mit 40 t/s Decode und 2.500 t/s Prefill.

Ist lokale KI günstiger als eine API?

Pro Token meistens nicht. Selbst unter Volllast rund um die Uhr kostet unser GLM-5.3-Flash-Setup mit zwei Knoten inklusive Hardware etwa 2,03 € pro Million Tokens, die GLM-5.3-Flash-API verlangt 0,50 $ pro Million Output-Tokens. Lokal gewinnt bei Datenschutz, planbaren Fixkosten, fehlenden Rate-Limits und voller Kontrolle, und eine voll ausgelastete gebrauchte RTX 3090 kann API-Preise für 27B-Modelle unterbieten.

Warum sind die Hardwarepreise 2026 so hoch?

Eine weltweite Knappheit bei DRAM und GDDR7 verteuert alles, was viel Speicher hat. NVIDIA hob den Preis der DGX Spark im Februar 2026 von 3.999 $ auf 4.699 $ an, die RTX PRO 6000 steht jetzt bei 16.000 $, und Strix-Halo-Boxen mit 128 GB wurden rund 75 % teurer. Am wenigsten betroffen sind gebrauchte Karten mit älterem GDDR6X-Speicher wie die RTX 3090.

Quellen


Lokale KI für euer Team aufsetzen?

Context Studios berät zu Hardware, Setup und Betrieb lokaler KI: von der Wahl zwischen DGX Spark, Mac Studio oder GPU-Server bis zum produktiven Betrieb mit vLLM. Wir betreiben diesen Stack selbst jeden Tag, und aus ihm stammen die Messwerte in diesem Guide.

Jetzt Beratung zu lokaler KI anfragen → · Unsere Leistungen

Thema für Ihr Team? Sprechen wir 30 Minuten.

Wir ordnen ein, was davon in Ihrem Unternehmen trägt — konkret, ohne Folienschlacht.

Unverbindlich · 30 Minuten · Angebot in 48 h