IA locale

Hardware per l'IA locale 2026: DGX Spark, Mac Studio M5 Ultra, RTX 5090 e Strix Halo a confronto

Hardware per l'IA locale 2026: DGX Spark, Mac Studio M5 Ultra, RTX 5090 e Strix Halo a confronto

Registro aggiornamenti

  • 24 settembre 2026: prima versione. Copre DGX Spark/GB10, AMD Strix Halo, RTX 3090/4090/5090/PRO 6000, MacBook Pro M5 Max e il nuovo Mac Studio M5 Ultra, in consegna dal 22 settembre 2026. Include il nostro benchmark del 24 settembre 2026 con GLM-5.3-Flash e Qwen3.8-Flash-Next, ciascuno su una coppia di nodi DGX Spark. Prezzi aggiornati a settembre 2026.
  • Prossimo aggiornamento: 1° ottobre 2026. Aggiorniamo la guida ogni mese con nuovi modelli, nuovi prezzi e nuove misurazioni.

In breve: la larghezza di banda della memoria decide quanto velocemente scorre una singola conversazione; la quantità di memoria decide se il modello ci sta. A settembre 2026 una RTX 3090 usata resta il modo più economico per ottenere token veloci da un modello da 27B. Il Mac Studio M5 Ultra (1,2 TB/s, fino a 512 GB) è la macchina più veloce per un singolo utente con grandi modelli MoE. La DGX Spark è la scelta giusta se servono CUDA, clustering e più richieste in parallelo. Strix Halo offre 128 GB al prezzo più basso, ma elabora lentamente i prompt lunghi.

In Context Studios usiamo in produzione nodi di classe DGX Spark (ASUS Ascent GX10 con NVIDIA GB10) con vLLM e un Mac mini come host per gli agenti. In questa guida mettiamo le nostre misurazioni accanto ai migliori dati pubblici, e per ogni numero indichiamo la fonte.

L'unica regola che spiega tutti i benchmark

La velocità di decode, cioè i token che leggete a schermo, è circa banda di memoria ÷ byte letti per token. Il prefill, cioè la lettura del prompt, dipende dalla potenza di calcolo. La quantità di memoria decide se il modello entra o no.

I modelli Mixture-of-Experts (MoE) come Qwen3.8-Flash-Next (circa 6B parametri attivi) o GLM-5.3-Flash (320B totali, 18B attivi) leggono solo una piccola parte dei pesi per ogni token. Per questo girano a una velocità utilizzabile su una macchina da 128 GB e 273 GB/s, dove un modello denso da 70B procede a passo d'uomo.

Tabella comparativa (settembre 2026)

HardwareMemoriaBandaPrezzo (set. 2026)Consumo sotto caricoStack consigliato
NVIDIA DGX Spark / ASUS GX10 (GB10)128 GB unificata273 GB/s4.699 $ listino (USA), da 5.038 € netti (UE)circa 160 WvLLM, SGLang, EXL3, llama.cpp
AMD Ryzen AI Max+ 395 (Framework, EVO-X2)128 GB unificata (circa 96–100 GB alla GPU)circa 256 GB/s3.449–3.650 $ (128 GB)circa 112–120 Wllama.cpp Vulkan/ROCm
RTX 3090 (usata)24 GB936 GB/scirca 1.050–1.264 $250–350 WvLLM, llama.cpp, EXL3
RTX 4090 (usata)24 GB1.008 GB/scirca 2.268–2.362 $circa 450 WvLLM, llama.cpp
RTX 509032 GB1.792 GB/s1.999 $ di listino, circa 4.700 $ nei negozicirca 575 WvLLM, llama.cpp, NVFP4
RTX PRO 6000 Blackwell96 GBcirca 1,8 TB/s16.000 $ (set. 2026)fino a 600 WvLLM, SGLang, NVFP4
MacBook Pro M5 Maxfino a 128 GB614 GB/snon verificatoportatileMLX, mlx-serve, llama.cpp
Mac Studio M5 Ultra96/256/512 GB1,2 TB/sda 5.499 $; 512 GB da ottobrenon ancora misurato con carichi LLMMLX, LM Studio, llama.cpp

Nel 2026 i prezzi sono saliti molto per la carenza di DRAM e GDDR7. La RTX PRO 6000 costa circa l'87 % in più del prezzo di lancio, e il GMKtec EVO-X2 da 128 GB è passato da 1.999 $ a 3.499–3.650 $. Per la maggior parte di schede grafiche e Mac non abbiamo ancora prezzi in euro verificati, quindi riportiamo i prezzi USA.

Modello × hardware × token al secondo

Valori per un singolo flusso, salvo diversa indicazione. [R] = recensione o produttore, [C] = segnalazione della community su X o GitHub, [CS] = misurato da Context Studios.

ModelloHardwareDecodeNote
Qwen3.8-27B (denso) Q4RTX 3090 / 4090 / 509040 / 46 / 75 t/sllama.cpp standard, contesto 4k [R]
Qwen3.8-27BRTX 5090 + MTP77 → 155 t/sllama.cpp Q4_K_M [C]
Qwen3.8-27BRTX 3090, vLLM ottimizzatocirca 114 t/s, circa 1.000 t/s con 64 flussiricetta syv-ai [C]
Qwen3.8-27BDGX Spark12 t/s standard → 31–58 t/s ottimizzatoNVFP4 + MTP [R]/[C]
Qwen3.8-27BStrix Halo11 → 24–30 t/sVulkan + MTP [R]/[C]
Qwen3.8-27BM5 Max 128 GB31 → 65–69 t/sMLX + MTP/DFlash2 [R]/[C]
Qwen3.8-Flash-Next (MoE)Mac Studio M5 Ultraoltre 100 t/s su prompt brevi, 60–85 t/s a 64k–256ktest MacStories [R]
Qwen3.8-Flash-NextMacBook Pro M5 Max56–101 t/smlx-serve, MTP [C]
Qwen3.8-Flash-Next1× DGX Spark65–81 t/svLLM/EXL3 + MTP [C]
Qwen3.8-Flash-Next2× DGX Spark, NVFP432,9 t/s, prefill 722 t/s (prompt da 1k)nostra misura del 24/9, senza speculative decoding [CS]
Qwen3.8-Flash-NextStrix Halo22–38 t/sllama.cpp / Halogen [C]
Qwen3.8-Flash-NextRTX PRO 6000227 t/s, prefill 9.900 t/s[C]
Qwen3.8-Flash-Next2× RTX PRO 60001.610 t/s su 32 flussivLLM standard [C]
GLM-5.3-Flash EXL3 4bpw2× DGX Spark (TP=2)32,9 t/s, 63,7 t/s aggregati con 4 flussinostra misura del 24/9 [CS]
GLM-5.3-Flash IQ2Strix Halo17–18 t/s[C]
GLM-5.2 (grande MoE)cluster 4× GB1027 t/s, 76 t/s aggregati con 6 flussivLLM TP4 + MTP, luglio/agosto [CS]
DeepSeek-V4.1-Flash2× DGX Spark23 → 33 t/sEXL3, contesto 1M [C]
DeepSeek-V4.1-Flash4× RTX PRO 6000circa 120–125 t/s costanti fino a 131k[C]

Il prefill conta più di quanto si pensi. Nel test di MacStories l'M5 Ultra ha letto un prompt da 15.500 token a 2.887 t/s, contro i 1.143 t/s dell'M3 Ultra. Una RTX 5090 ha raggiunto circa 3.000 t/s su un prompt da 6k. Su Strix Halo un prompt da 1 milione di token ha richiesto 18 minuti. Un agente invia a ogni turno 20.000–60.000 token tra system prompt, strumenti e memoria: spesso è il prefill a decidere se una macchina sembra veloce.

Misure della community su X (settembre 2026)

Salvo indicazione diversa: decode con un solo stream. Sono misure pubblicate da sviluppatori su X, non nostre. Le configurazioni cambiano (quantizzazione, decodifica speculativa, engine con patch), quindi ogni riga indica cosa si ottiene con quella ricetta precisa e non una base garantita. La distanza tra i 62,9 t/s riportati per GLM-5.3-Flash su due Spark e i nostri 32,9 t/s mostra quanto conti una ricetta ottimizzata.

HardwareModelloConfigurazioneDecodeNoteFonte
1× DGX SparkQwen3.8-Flash-NextNVFP4, vLLM + MTP k=338 t/s53,8 t/s sul codice, 180 t/s aggregati con 8 stream, ~2.000 t/s di prefill@jvr0x
1× DGX SparkQwen3.8-Flash-NextEXL3 vs. NVFP4, vLLM78,3 vs. 31,0 t/sstessa macchina; ~600 contro ~150 t/s aggregati con 8 richieste@ViC305
2× DGX Spark (TP=2)GLM-5.3-FlashEXL3 4bpw, vllm-exl362,9 t/s146,5 t/s aggregati con 4 stream@yume_arasaki
2× DGX Spark (TP=2)GLM-5.3-FlashNVFP4, patched vLLM46,3 t/ssingolo stream, reasoning@mr_r0b0t
8× DGX SparkGLM-5.3-FlashNVFP4, vLLM96 t/s110 t/s con 4 stream@hypermac6502
16× DGX SparkKimi K3 (2.8T)vLLM + GB10 patch29,8 t/s87 t/s aggregati con 8 stream, ~20 t/s a 300k di contesto@ciprianveg
RTX PRO 6000 (96 GB)Qwen3.8-Flash-NextSGLang, FP8 KV + MTP252,9 t/s819 t/s con 8 stream, 1.190 t/s con 16@wei_wang
4× RTX PRO 6000GLM-5.3-FlashvLLM240 t/s~12.000 t/s di prefill, 550 t/s aggregati con 4 stream@hiheyhowareya
Strix Halo (Ryzen AI Max+ 395)Qwen3.8-Flash-NextLucebox ROCm38 t/s41,9 t/s a 8k di contesto@luceboxai
RTX 4090 (24 GB)Qwen3.8-27BQ4_K_M, llama.cpp46 t/sflash attention, KV cache quantizzata@yume_arasaki
RTX 3090 / 4090 (24 GB)Qwen3.8-27BEXL3 3.5bpw + DFlash94–105 t/ssostenuti; 130–150 t/s su risposte brevi@yume_arasaki
MacBook Pro M4 Max (128 GB)Qwen3.8-27BMLX 4-bit + MTP43 t/sintervallo 42–44 t/s@yume_arasaki

La nostra misurazione (Context Studios, 24 settembre 2026)

Abbiamo eseguito un benchmark breve e ripetibile sugli endpoint che usiamo ogni giorno. Entrambi i modelli girano su coppie di nodi ASUS Ascent GX10 (NVIDIA GB10, 128 GB ciascuno) con tensor parallel 2 su una rete 100G RoCE. All'endpoint Qwen arriviamo tramite un proxy LiteLLM sul nostro Mac mini, quindi i suoi numeri includono un passaggio di rete in più.

ModelloConfigurazioneDecode (1 flusso)Prefill (prompt da ~1k)4 flussi in parallelo
GLM-5.3-Flash (MoE 320B, 18B attivi)EXL3 4bpw, vLLM, 2× GX10 TP=232,9 t/s1.262 t/s63,7 t/s aggregati (circa 16,5 t/s per flusso)
Qwen3.8-Flash-NextNVFP4, vLLM via LiteLLM, 2× GX1032,9 t/s722 t/s21,8 t/s aggregati (un flusso è sceso a 7 t/s)

Metodo. Streaming su /v1/chat/completions, temperatura 0, thinking disattivato, prompt tecnico fisso. Scartiamo una prima esecuzione di riscaldamento, poi facciamo tre esecuzioni da 400 token di output e riportiamo la mediana. Decode = (token generati − 1) ÷ tempo tra il primo e l'ultimo token. Il prefill è stimato come token del prompt ÷ tempo al primo token con un prompt di circa 1.040 token: include la latenza di rete ed è quindi un limite inferiore. Il test in parallelo invia quattro richieste identiche da 400 token contemporaneamente e divide tutti i token generati per il tempo reale trascorso. I conteggi dei token arrivano dal campo usage del server. Il nostro cluster serve allo stesso tempo agenti in produzione, quindi i valori in parallelo sono un'istantanea e non un risultato di laboratorio.

Potete ripetere la misura su qualsiasi endpoint compatibile con OpenAI:

bash
python3 bench_local.py http://VOSTRO-HOST:8000 id-del-modello 3 4

Cosa ci dicono questi numeri:

  1. Due Spark portano un modello da 320B a una velocità interattiva. 33 t/s su un singolo flusso sono fluidi in chat e negli agenti di coding.
  2. I valori Qwen più alti della community arrivano dallo speculative decoding. Le configurazioni con MTP riportano 65–81 t/s su una sola Spark; il nostro endpoint NVFP4 non usa MTP e si ferma a 33 t/s. Lo speculative decoding è la leva singola più forte: sul nostro cluster a 4 nodi ha quasi raddoppiato GLM-5.2 (da 14,5 a 26,6 t/s).
  3. Il throughput in parallelo dipende da cos'altro gira sulla macchina. GLM è cresciuto in modo quasi lineare fino a quattro flussi; la coppia Qwen era occupata dal traffico degli agenti e un flusso ha rallentato molto.

Misura precedente: cluster 4× GB10 con GLM-5.2 (luglio/agosto 2026)

Cosa abbiamo misuratoRisultato
Decode GLM-5.2 con 1 / 2 / 3 / 4 / 6 flussi paralleli (aggregato)27,2 / 42,6 / 52,1 / 62,7 / 75,8 t/s
Prefill prompt da 8k / 32k853 / 840 t/s
Effetto MTP (senza draft → k=2)14,5 → 26,6 t/s
Correzione delle cudagraph capture sizes+38 % con 2 flussi
Conversazione lunga (22 turni, 104.846 token)nessun calo
Avvio a freddo / riavvio completo del cluster520 s / 13–14 min

Cosa abbiamo imparato: se due flussi vanno quasi come uno, mancano le dimensioni corrette dei CUDA graph, e una sola riga di configurazione ci ha dato il 38 % in più. La memoria unificata va tenuta d'occhio: l'OOM killer può fermare il motore, e i container rimossi con la forza hanno trattenuto memoria fino al riavvio. Conviene scaricare un checkpoint una volta e copiarlo in rete: circa 15 minuti invece di circa 48 ore per altri tre nodi.

Cosa comprare in base a budget, uso e dimensione del modello

ObiettivoBudgetCosa comprarePerché
Modelli densi da 27–32B, veloci, per una personacirca 1.200–1.600 €RTX 3090 usataPiù token per euro; Qwen3.8-27B Q4 entra in 24 GB
Un piccolo team (5–60 richieste parallele) con un modello da 27Bcirca 2.500–3.500 €2× RTX 3090 o una RTX 5090Throughput in batch con vLLM
Modelli MoE da 100–300B, in silenzio sulla scrivaniacirca 3.500–4.000 €Strix Halo 128 GBPiù memoria per euro; prefill lento da mettere in conto
Sviluppare su CUDA, prototipare per GPU da data center o fare clustercirca 5.000–6.000 € a nodoDGX Spark / GX10NVFP4, ricette vLLM, clustering a 200G
Massima velocità per un utente con grandi MoE e contesto lungoda 5.499 $Mac Studio M5 Ultra1,2 TB/s e fino a 512 GB
Lavorare in locale anche in viaggioaltoMacBook Pro M5 Max 128 GB614 GB/s in un portatile
Servire modelli da 700B in su a velocità di produzioneda 64.000 $4× RTX PRO 6000384 GB di VRAM, circa 120 t/s con DeepSeek V4.1 Flash

Regole pratiche per dimensione del modello (4 bit):

  • Fino a 32B densi: stanno in 24–32 GB di VRAM. Una singola scheda RTX è l'opzione più veloce.
  • Circa 70B densi: servono circa 48 GB e sulla memoria unificata girano piano (4–6 t/s su Strix Halo).
  • MoE da 100–320B: servono 64–128 GB. Spark, Strix Halo, M5 Max o Mac Studio. Due Spark fanno girare GLM-5.3-Flash a 4 bpw con margine per contesti lunghi.
  • MoE da 500B in su: serve un cluster di Spark, un Mac da 256–512 GB o più RTX PRO 6000.

Costo per token: locale o cloud

Ipotesi: elettricità a 0,37 €/kWh (media tedesca BDEW 2026), ammortamento in 3 anni (26.280 ore), funzionamento 24 ore su 24 a pieno carico. È lo scenario più favorevole per l'hardware locale.

ConfigurazioneThroughputSolo elettricitàHardware inclusoRiferimento cloud
2× GX10, GLM-5.3-Flash, 4 flussi [CS]63,7 t/scirca 0,52 € / 1M tokencirca 2,03 € / 1M tokenAPI GLM-5.3-Flash: 0,50 $ / 1M in output
4× GX10, GLM-5.2, 6 flussi [CS]75,8 t/scirca 0,87 € / 1M tokencirca 3,41 € / 1M tokenidem
RTX 3090 usata, vLLM in batch, Qwen3.8-27B [C]circa 1.000 t/scirca 0,04 € / 1M tokencirca 0,05 € / 1M tokenAPI Qwen3.8-Flash: 0,47 $ / 1M in output

Il calcolo della riga 2× GX10: 2 × circa 160 W = 0,32 kW, cioè 0,118 € l'ora. L'hardware (2 × 4.558 €, prezzo al dettaglio in Germania del 28 agosto 2026) diviso su 26.280 ore vale 0,347 € l'ora. 63,7 t/s fanno 229.320 token l'ora, quindi 0,465 € l'ora corrispondono a circa 2,03 € per milione di token.

  • Il cloud costa circa 4 volte meno per token rispetto al nostro setup GLM a due nodi, anche a pieno carico.
  • Una RTX 3090 sfruttata al massimo batte i prezzi delle API per i modelli da 27B, ma solo con traffico in batch continuo.
  • Un singolo utente tipico usa l'hardware per meno del 10 % del tempo, e così il costo locale si moltiplica per 10 o più.

La nostra conclusione: sul prezzo per token l'IA locale vince di rado. Vince su sovranità dei dati, costi fissi prevedibili, assenza di rate limit e pieno controllo su modelli e contesto. Se vi servono solo token, l'API costa meno. Se i dati non possono uscire dall'azienda o volete agenti attivi 24 ore su 24 senza un contatore che gira, conviene avere hardware proprio.

Problemi tipici per piattaforma

  • DGX Spark: la velocità su un singolo flusso è limitata dalla banda; i prefill lunghi a freddo rallentano il decode parallelo; le ricette della community cambiano ogni settimana.
  • Strix Halo: il parametro kernel GTT è obbligatorio; le versioni di ROCm e del kernel sono delicate; i prompt lunghi richiedono minuti.
  • Schede RTX: la VRAM finisce presto; spostare i pesi nella RAM di sistema fa scendere la velocità a una cifra; consumi e rumore elevati; nei negozi la 5090 costa circa il doppio del listino.
  • Mac: nel prefill NVIDIA resta avanti; molte conversioni MLX perdono la visione o l'MTP; i modelli più recenti richiedono spesso build beta.

Guide e confronti correlati

Domande frequenti

Qual è il miglior hardware per gli LLM locali nel 2026?

Dipende dalla dimensione del modello e dal numero di utenti. Per una persona che usa modelli da 27–32B, a settembre 2026 una RTX 3090 usata offre la velocità migliore per euro speso. Per i modelli MoE da oltre 100B con contesti lunghi il Mac Studio M5 Ultra è la macchina singola più veloce, mentre la DGX Spark è preferibile se servono CUDA, clustering o molte richieste in parallelo.

Conviene la DGX Spark rispetto al Mac Studio M5 Ultra?

L'M5 Ultra ha circa 4,4 volte la banda di memoria della Spark (1,2 TB/s contro 273 GB/s), quindi genera token più in fretta per un singolo utente. I punti forti della Spark sono CUDA, NVFP4, le ricette vLLM della community che arrivano in pochi giorni e un clustering economico su rete a 200G. Noi abbiamo scelto le Spark perché serviamo più agenti in parallelo, e per noi conta più il throughput complessivo della velocità del singolo flusso.

Quanto va veloce GLM-5.3-Flash su due DGX Spark?

Nella nostra misura del 24 settembre 2026, GLM-5.3-Flash in EXL3 4bpw su due nodi ASUS GX10 con tensor parallel 2 ha raggiunto 32,9 token al secondo su un singolo flusso. Con quattro richieste parallele la coppia ha prodotto in totale 63,7 token al secondo, cioè circa 16,5 per flusso. Il prefill di un prompt da circa 1.000 token ha superato i 1.200 token al secondo, latenza di rete compresa.

AMD Strix Halo può far girare modelli grandi come GLM-5.3-Flash?

Sì. Con 128 GB di memoria unificata, di cui circa 96–100 GB assegnabili alla GPU, fa girare quantizzazioni da 2 a 4 bit di modelli MoE da 200–300B a circa 13–38 t/s. Il limite è l'elaborazione del prompt: i contesti lunghi richiedono minuti, e in una prova un prompt da 1 milione di token ha impiegato 18 minuti. È una buona macchina per chi ha bisogno di tanta memoria e lavora da solo, meno adatta ai cicli degli agenti con prompt enormi.

Quanti token al secondo servono per gli agenti di coding?

Per il lavoro interattivo circa 30 t/s di decode risultano fluidi, e oltre 60 t/s la sensazione è di velocità. Con gli agenti il prefill conta altrettanto, perché ogni turno invia decine di migliaia di token di contesto. Una macchina con 50 t/s di decode ma 300 t/s di prefill sembra più lenta, dentro un agente, di una con 40 t/s di decode e 2.500 t/s di prefill.

L'IA locale costa meno di un'API?

Per token di solito no. Anche a pieno carico 24 ore su 24, il nostro setup GLM-5.3-Flash su due nodi costa circa 2,03 € per milione di token hardware incluso, mentre l'API di GLM-5.3-Flash chiede 0,50 $ per milione di token in output. Il locale vince su privacy, costi fissi prevedibili, assenza di rate limit e pieno controllo, e una RTX 3090 usata sfruttata al massimo può battere i prezzi API per i modelli da 27B.

Perché nel 2026 l'hardware costa così tanto?

Una carenza globale di DRAM e GDDR7 ha fatto salire il prezzo di tutto ciò che ha molta memoria. NVIDIA ha alzato la DGX Spark da 3.999 $ a 4.699 $ a febbraio 2026, la RTX PRO 6000 ora costa 16.000 $ e i mini PC Strix Halo da 128 GB sono rincarati di circa il 75 %. Le schede usate con memoria GDDR6X più vecchia, come la RTX 3090, ne risentono meno.

Fonti


Volete portare l'IA locale nel vostro team?

Context Studios offre consulenza su hardware, configurazione e gestione dell'IA locale: dalla scelta tra DGX Spark, Mac Studio o server GPU fino all'inferenza in produzione con vLLM. Usiamo questo stack ogni giorno, e le misure di questa guida vengono proprio da lì.

Parliamo del vostro setup di IA locale → · I nostri servizi

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h