Registro aggiornamenti
- 24 settembre 2026: prima versione. Copre DGX Spark/GB10, AMD Strix Halo, RTX 3090/4090/5090/PRO 6000, MacBook Pro M5 Max e il nuovo Mac Studio M5 Ultra, in consegna dal 22 settembre 2026. Include il nostro benchmark del 24 settembre 2026 con GLM-5.3-Flash e Qwen3.8-Flash-Next, ciascuno su una coppia di nodi DGX Spark. Prezzi aggiornati a settembre 2026.
- Prossimo aggiornamento: 1° ottobre 2026. Aggiorniamo la guida ogni mese con nuovi modelli, nuovi prezzi e nuove misurazioni.
In breve: la larghezza di banda della memoria decide quanto velocemente scorre una singola conversazione; la quantità di memoria decide se il modello ci sta. A settembre 2026 una RTX 3090 usata resta il modo più economico per ottenere token veloci da un modello da 27B. Il Mac Studio M5 Ultra (1,2 TB/s, fino a 512 GB) è la macchina più veloce per un singolo utente con grandi modelli MoE. La DGX Spark è la scelta giusta se servono CUDA, clustering e più richieste in parallelo. Strix Halo offre 128 GB al prezzo più basso, ma elabora lentamente i prompt lunghi.
In Context Studios usiamo in produzione nodi di classe DGX Spark (ASUS Ascent GX10 con NVIDIA GB10) con vLLM e un Mac mini come host per gli agenti. In questa guida mettiamo le nostre misurazioni accanto ai migliori dati pubblici, e per ogni numero indichiamo la fonte.
L'unica regola che spiega tutti i benchmark
La velocità di decode, cioè i token che leggete a schermo, è circa banda di memoria ÷ byte letti per token. Il prefill, cioè la lettura del prompt, dipende dalla potenza di calcolo. La quantità di memoria decide se il modello entra o no.
I modelli Mixture-of-Experts (MoE) come Qwen3.8-Flash-Next (circa 6B parametri attivi) o GLM-5.3-Flash (320B totali, 18B attivi) leggono solo una piccola parte dei pesi per ogni token. Per questo girano a una velocità utilizzabile su una macchina da 128 GB e 273 GB/s, dove un modello denso da 70B procede a passo d'uomo.
Tabella comparativa (settembre 2026)
| Hardware | Memoria | Banda | Prezzo (set. 2026) | Consumo sotto carico | Stack consigliato |
|---|---|---|---|---|---|
| NVIDIA DGX Spark / ASUS GX10 (GB10) | 128 GB unificata | 273 GB/s | 4.699 $ listino (USA), da 5.038 € netti (UE) | circa 160 W | vLLM, SGLang, EXL3, llama.cpp |
| AMD Ryzen AI Max+ 395 (Framework, EVO-X2) | 128 GB unificata (circa 96–100 GB alla GPU) | circa 256 GB/s | 3.449–3.650 $ (128 GB) | circa 112–120 W | llama.cpp Vulkan/ROCm |
| RTX 3090 (usata) | 24 GB | 936 GB/s | circa 1.050–1.264 $ | 250–350 W | vLLM, llama.cpp, EXL3 |
| RTX 4090 (usata) | 24 GB | 1.008 GB/s | circa 2.268–2.362 $ | circa 450 W | vLLM, llama.cpp |
| RTX 5090 | 32 GB | 1.792 GB/s | 1.999 $ di listino, circa 4.700 $ nei negozi | circa 575 W | vLLM, llama.cpp, NVFP4 |
| RTX PRO 6000 Blackwell | 96 GB | circa 1,8 TB/s | 16.000 $ (set. 2026) | fino a 600 W | vLLM, SGLang, NVFP4 |
| MacBook Pro M5 Max | fino a 128 GB | 614 GB/s | non verificato | portatile | MLX, mlx-serve, llama.cpp |
| Mac Studio M5 Ultra | 96/256/512 GB | 1,2 TB/s | da 5.499 $; 512 GB da ottobre | non ancora misurato con carichi LLM | MLX, LM Studio, llama.cpp |
Nel 2026 i prezzi sono saliti molto per la carenza di DRAM e GDDR7. La RTX PRO 6000 costa circa l'87 % in più del prezzo di lancio, e il GMKtec EVO-X2 da 128 GB è passato da 1.999 $ a 3.499–3.650 $. Per la maggior parte di schede grafiche e Mac non abbiamo ancora prezzi in euro verificati, quindi riportiamo i prezzi USA.
Modello × hardware × token al secondo
Valori per un singolo flusso, salvo diversa indicazione. [R] = recensione o produttore, [C] = segnalazione della community su X o GitHub, [CS] = misurato da Context Studios.
| Modello | Hardware | Decode | Note |
|---|---|---|---|
| Qwen3.8-27B (denso) Q4 | RTX 3090 / 4090 / 5090 | 40 / 46 / 75 t/s | llama.cpp standard, contesto 4k [R] |
| Qwen3.8-27B | RTX 5090 + MTP | 77 → 155 t/s | llama.cpp Q4_K_M [C] |
| Qwen3.8-27B | RTX 3090, vLLM ottimizzato | circa 114 t/s, circa 1.000 t/s con 64 flussi | ricetta syv-ai [C] |
| Qwen3.8-27B | DGX Spark | 12 t/s standard → 31–58 t/s ottimizzato | NVFP4 + MTP [R]/[C] |
| Qwen3.8-27B | Strix Halo | 11 → 24–30 t/s | Vulkan + MTP [R]/[C] |
| Qwen3.8-27B | M5 Max 128 GB | 31 → 65–69 t/s | MLX + MTP/DFlash2 [R]/[C] |
| Qwen3.8-Flash-Next (MoE) | Mac Studio M5 Ultra | oltre 100 t/s su prompt brevi, 60–85 t/s a 64k–256k | test MacStories [R] |
| Qwen3.8-Flash-Next | MacBook Pro M5 Max | 56–101 t/s | mlx-serve, MTP [C] |
| Qwen3.8-Flash-Next | 1× DGX Spark | 65–81 t/s | vLLM/EXL3 + MTP [C] |
| Qwen3.8-Flash-Next | 2× DGX Spark, NVFP4 | 32,9 t/s, prefill 722 t/s (prompt da 1k) | nostra misura del 24/9, senza speculative decoding [CS] |
| Qwen3.8-Flash-Next | Strix Halo | 22–38 t/s | llama.cpp / Halogen [C] |
| Qwen3.8-Flash-Next | RTX PRO 6000 | 227 t/s, prefill 9.900 t/s | [C] |
| Qwen3.8-Flash-Next | 2× RTX PRO 6000 | 1.610 t/s su 32 flussi | vLLM standard [C] |
| GLM-5.3-Flash EXL3 4bpw | 2× DGX Spark (TP=2) | 32,9 t/s, 63,7 t/s aggregati con 4 flussi | nostra misura del 24/9 [CS] |
| GLM-5.3-Flash IQ2 | Strix Halo | 17–18 t/s | [C] |
| GLM-5.2 (grande MoE) | cluster 4× GB10 | 27 t/s, 76 t/s aggregati con 6 flussi | vLLM TP4 + MTP, luglio/agosto [CS] |
| DeepSeek-V4.1-Flash | 2× DGX Spark | 23 → 33 t/s | EXL3, contesto 1M [C] |
| DeepSeek-V4.1-Flash | 4× RTX PRO 6000 | circa 120–125 t/s costanti fino a 131k | [C] |
Il prefill conta più di quanto si pensi. Nel test di MacStories l'M5 Ultra ha letto un prompt da 15.500 token a 2.887 t/s, contro i 1.143 t/s dell'M3 Ultra. Una RTX 5090 ha raggiunto circa 3.000 t/s su un prompt da 6k. Su Strix Halo un prompt da 1 milione di token ha richiesto 18 minuti. Un agente invia a ogni turno 20.000–60.000 token tra system prompt, strumenti e memoria: spesso è il prefill a decidere se una macchina sembra veloce.
Misure della community su X (settembre 2026)
Salvo indicazione diversa: decode con un solo stream. Sono misure pubblicate da sviluppatori su X, non nostre. Le configurazioni cambiano (quantizzazione, decodifica speculativa, engine con patch), quindi ogni riga indica cosa si ottiene con quella ricetta precisa e non una base garantita. La distanza tra i 62,9 t/s riportati per GLM-5.3-Flash su due Spark e i nostri 32,9 t/s mostra quanto conti una ricetta ottimizzata.
| Hardware | Modello | Configurazione | Decode | Note | Fonte |
|---|---|---|---|---|---|
| 1× DGX Spark | Qwen3.8-Flash-Next | NVFP4, vLLM + MTP k=3 | 38 t/s | 53,8 t/s sul codice, 180 t/s aggregati con 8 stream, ~2.000 t/s di prefill | @jvr0x |
| 1× DGX Spark | Qwen3.8-Flash-Next | EXL3 vs. NVFP4, vLLM | 78,3 vs. 31,0 t/s | stessa macchina; ~600 contro ~150 t/s aggregati con 8 richieste | @ViC305 |
| 2× DGX Spark (TP=2) | GLM-5.3-Flash | EXL3 4bpw, vllm-exl3 | 62,9 t/s | 146,5 t/s aggregati con 4 stream | @yume_arasaki |
| 2× DGX Spark (TP=2) | GLM-5.3-Flash | NVFP4, patched vLLM | 46,3 t/s | singolo stream, reasoning | @mr_r0b0t |
| 8× DGX Spark | GLM-5.3-Flash | NVFP4, vLLM | 96 t/s | 110 t/s con 4 stream | @hypermac6502 |
| 16× DGX Spark | Kimi K3 (2.8T) | vLLM + GB10 patch | 29,8 t/s | 87 t/s aggregati con 8 stream, ~20 t/s a 300k di contesto | @ciprianveg |
| RTX PRO 6000 (96 GB) | Qwen3.8-Flash-Next | SGLang, FP8 KV + MTP | 252,9 t/s | 819 t/s con 8 stream, 1.190 t/s con 16 | @wei_wang |
| 4× RTX PRO 6000 | GLM-5.3-Flash | vLLM | 240 t/s | ~12.000 t/s di prefill, 550 t/s aggregati con 4 stream | @hiheyhowareya |
| Strix Halo (Ryzen AI Max+ 395) | Qwen3.8-Flash-Next | Lucebox ROCm | 38 t/s | 41,9 t/s a 8k di contesto | @luceboxai |
| RTX 4090 (24 GB) | Qwen3.8-27B | Q4_K_M, llama.cpp | 46 t/s | flash attention, KV cache quantizzata | @yume_arasaki |
| RTX 3090 / 4090 (24 GB) | Qwen3.8-27B | EXL3 3.5bpw + DFlash | 94–105 t/s | sostenuti; 130–150 t/s su risposte brevi | @yume_arasaki |
| MacBook Pro M4 Max (128 GB) | Qwen3.8-27B | MLX 4-bit + MTP | 43 t/s | intervallo 42–44 t/s | @yume_arasaki |
La nostra misurazione (Context Studios, 24 settembre 2026)
Abbiamo eseguito un benchmark breve e ripetibile sugli endpoint che usiamo ogni giorno. Entrambi i modelli girano su coppie di nodi ASUS Ascent GX10 (NVIDIA GB10, 128 GB ciascuno) con tensor parallel 2 su una rete 100G RoCE. All'endpoint Qwen arriviamo tramite un proxy LiteLLM sul nostro Mac mini, quindi i suoi numeri includono un passaggio di rete in più.
| Modello | Configurazione | Decode (1 flusso) | Prefill (prompt da ~1k) | 4 flussi in parallelo |
|---|---|---|---|---|
| GLM-5.3-Flash (MoE 320B, 18B attivi) | EXL3 4bpw, vLLM, 2× GX10 TP=2 | 32,9 t/s | 1.262 t/s | 63,7 t/s aggregati (circa 16,5 t/s per flusso) |
| Qwen3.8-Flash-Next | NVFP4, vLLM via LiteLLM, 2× GX10 | 32,9 t/s | 722 t/s | 21,8 t/s aggregati (un flusso è sceso a 7 t/s) |
Metodo. Streaming su /v1/chat/completions, temperatura 0, thinking disattivato, prompt tecnico fisso. Scartiamo una prima esecuzione di riscaldamento, poi facciamo tre esecuzioni da 400 token di output e riportiamo la mediana. Decode = (token generati − 1) ÷ tempo tra il primo e l'ultimo token. Il prefill è stimato come token del prompt ÷ tempo al primo token con un prompt di circa 1.040 token: include la latenza di rete ed è quindi un limite inferiore. Il test in parallelo invia quattro richieste identiche da 400 token contemporaneamente e divide tutti i token generati per il tempo reale trascorso. I conteggi dei token arrivano dal campo usage del server. Il nostro cluster serve allo stesso tempo agenti in produzione, quindi i valori in parallelo sono un'istantanea e non un risultato di laboratorio.
Potete ripetere la misura su qualsiasi endpoint compatibile con OpenAI:
python3 bench_local.py http://VOSTRO-HOST:8000 id-del-modello 3 4
Cosa ci dicono questi numeri:
- Due Spark portano un modello da 320B a una velocità interattiva. 33 t/s su un singolo flusso sono fluidi in chat e negli agenti di coding.
- I valori Qwen più alti della community arrivano dallo speculative decoding. Le configurazioni con MTP riportano 65–81 t/s su una sola Spark; il nostro endpoint NVFP4 non usa MTP e si ferma a 33 t/s. Lo speculative decoding è la leva singola più forte: sul nostro cluster a 4 nodi ha quasi raddoppiato GLM-5.2 (da 14,5 a 26,6 t/s).
- Il throughput in parallelo dipende da cos'altro gira sulla macchina. GLM è cresciuto in modo quasi lineare fino a quattro flussi; la coppia Qwen era occupata dal traffico degli agenti e un flusso ha rallentato molto.
Misura precedente: cluster 4× GB10 con GLM-5.2 (luglio/agosto 2026)
| Cosa abbiamo misurato | Risultato |
|---|---|
| Decode GLM-5.2 con 1 / 2 / 3 / 4 / 6 flussi paralleli (aggregato) | 27,2 / 42,6 / 52,1 / 62,7 / 75,8 t/s |
| Prefill prompt da 8k / 32k | 853 / 840 t/s |
| Effetto MTP (senza draft → k=2) | 14,5 → 26,6 t/s |
| Correzione delle cudagraph capture sizes | +38 % con 2 flussi |
| Conversazione lunga (22 turni, 104.846 token) | nessun calo |
| Avvio a freddo / riavvio completo del cluster | 520 s / 13–14 min |
Cosa abbiamo imparato: se due flussi vanno quasi come uno, mancano le dimensioni corrette dei CUDA graph, e una sola riga di configurazione ci ha dato il 38 % in più. La memoria unificata va tenuta d'occhio: l'OOM killer può fermare il motore, e i container rimossi con la forza hanno trattenuto memoria fino al riavvio. Conviene scaricare un checkpoint una volta e copiarlo in rete: circa 15 minuti invece di circa 48 ore per altri tre nodi.
Cosa comprare in base a budget, uso e dimensione del modello
| Obiettivo | Budget | Cosa comprare | Perché |
|---|---|---|---|
| Modelli densi da 27–32B, veloci, per una persona | circa 1.200–1.600 € | RTX 3090 usata | Più token per euro; Qwen3.8-27B Q4 entra in 24 GB |
| Un piccolo team (5–60 richieste parallele) con un modello da 27B | circa 2.500–3.500 € | 2× RTX 3090 o una RTX 5090 | Throughput in batch con vLLM |
| Modelli MoE da 100–300B, in silenzio sulla scrivania | circa 3.500–4.000 € | Strix Halo 128 GB | Più memoria per euro; prefill lento da mettere in conto |
| Sviluppare su CUDA, prototipare per GPU da data center o fare cluster | circa 5.000–6.000 € a nodo | DGX Spark / GX10 | NVFP4, ricette vLLM, clustering a 200G |
| Massima velocità per un utente con grandi MoE e contesto lungo | da 5.499 $ | Mac Studio M5 Ultra | 1,2 TB/s e fino a 512 GB |
| Lavorare in locale anche in viaggio | alto | MacBook Pro M5 Max 128 GB | 614 GB/s in un portatile |
| Servire modelli da 700B in su a velocità di produzione | da 64.000 $ | 4× RTX PRO 6000 | 384 GB di VRAM, circa 120 t/s con DeepSeek V4.1 Flash |
Regole pratiche per dimensione del modello (4 bit):
- Fino a 32B densi: stanno in 24–32 GB di VRAM. Una singola scheda RTX è l'opzione più veloce.
- Circa 70B densi: servono circa 48 GB e sulla memoria unificata girano piano (4–6 t/s su Strix Halo).
- MoE da 100–320B: servono 64–128 GB. Spark, Strix Halo, M5 Max o Mac Studio. Due Spark fanno girare GLM-5.3-Flash a 4 bpw con margine per contesti lunghi.
- MoE da 500B in su: serve un cluster di Spark, un Mac da 256–512 GB o più RTX PRO 6000.
Costo per token: locale o cloud
Ipotesi: elettricità a 0,37 €/kWh (media tedesca BDEW 2026), ammortamento in 3 anni (26.280 ore), funzionamento 24 ore su 24 a pieno carico. È lo scenario più favorevole per l'hardware locale.
| Configurazione | Throughput | Solo elettricità | Hardware incluso | Riferimento cloud |
|---|---|---|---|---|
| 2× GX10, GLM-5.3-Flash, 4 flussi [CS] | 63,7 t/s | circa 0,52 € / 1M token | circa 2,03 € / 1M token | API GLM-5.3-Flash: 0,50 $ / 1M in output |
| 4× GX10, GLM-5.2, 6 flussi [CS] | 75,8 t/s | circa 0,87 € / 1M token | circa 3,41 € / 1M token | idem |
| RTX 3090 usata, vLLM in batch, Qwen3.8-27B [C] | circa 1.000 t/s | circa 0,04 € / 1M token | circa 0,05 € / 1M token | API Qwen3.8-Flash: 0,47 $ / 1M in output |
Il calcolo della riga 2× GX10: 2 × circa 160 W = 0,32 kW, cioè 0,118 € l'ora. L'hardware (2 × 4.558 €, prezzo al dettaglio in Germania del 28 agosto 2026) diviso su 26.280 ore vale 0,347 € l'ora. 63,7 t/s fanno 229.320 token l'ora, quindi 0,465 € l'ora corrispondono a circa 2,03 € per milione di token.
- Il cloud costa circa 4 volte meno per token rispetto al nostro setup GLM a due nodi, anche a pieno carico.
- Una RTX 3090 sfruttata al massimo batte i prezzi delle API per i modelli da 27B, ma solo con traffico in batch continuo.
- Un singolo utente tipico usa l'hardware per meno del 10 % del tempo, e così il costo locale si moltiplica per 10 o più.
La nostra conclusione: sul prezzo per token l'IA locale vince di rado. Vince su sovranità dei dati, costi fissi prevedibili, assenza di rate limit e pieno controllo su modelli e contesto. Se vi servono solo token, l'API costa meno. Se i dati non possono uscire dall'azienda o volete agenti attivi 24 ore su 24 senza un contatore che gira, conviene avere hardware proprio.
Problemi tipici per piattaforma
- DGX Spark: la velocità su un singolo flusso è limitata dalla banda; i prefill lunghi a freddo rallentano il decode parallelo; le ricette della community cambiano ogni settimana.
- Strix Halo: il parametro kernel GTT è obbligatorio; le versioni di ROCm e del kernel sono delicate; i prompt lunghi richiedono minuti.
- Schede RTX: la VRAM finisce presto; spostare i pesi nella RAM di sistema fa scendere la velocità a una cifra; consumi e rumore elevati; nei negozi la 5090 costa circa il doppio del listino.
- Mac: nel prefill NVIDIA resta avanti; molte conversioni MLX perdono la visione o l'MTP; i modelli più recenti richiedono spesso build beta.
Guide e confronti correlati
- Guida hardware per Qwen 3.8 27B: dalla RTX 3090 alla DGX Spark
- Guida all'acquisto del Mac Studio per l'IA locale
- Quanto costa l'IA locale sull'hardware Apple nel 2026
- DGX Spark vs Mac Studio
- Agenti LLM locali vs cloud
- Coding con IA locale vs IA in cloud
Domande frequenti
Qual è il miglior hardware per gli LLM locali nel 2026?
Dipende dalla dimensione del modello e dal numero di utenti. Per una persona che usa modelli da 27–32B, a settembre 2026 una RTX 3090 usata offre la velocità migliore per euro speso. Per i modelli MoE da oltre 100B con contesti lunghi il Mac Studio M5 Ultra è la macchina singola più veloce, mentre la DGX Spark è preferibile se servono CUDA, clustering o molte richieste in parallelo.
Conviene la DGX Spark rispetto al Mac Studio M5 Ultra?
L'M5 Ultra ha circa 4,4 volte la banda di memoria della Spark (1,2 TB/s contro 273 GB/s), quindi genera token più in fretta per un singolo utente. I punti forti della Spark sono CUDA, NVFP4, le ricette vLLM della community che arrivano in pochi giorni e un clustering economico su rete a 200G. Noi abbiamo scelto le Spark perché serviamo più agenti in parallelo, e per noi conta più il throughput complessivo della velocità del singolo flusso.
Quanto va veloce GLM-5.3-Flash su due DGX Spark?
Nella nostra misura del 24 settembre 2026, GLM-5.3-Flash in EXL3 4bpw su due nodi ASUS GX10 con tensor parallel 2 ha raggiunto 32,9 token al secondo su un singolo flusso. Con quattro richieste parallele la coppia ha prodotto in totale 63,7 token al secondo, cioè circa 16,5 per flusso. Il prefill di un prompt da circa 1.000 token ha superato i 1.200 token al secondo, latenza di rete compresa.
AMD Strix Halo può far girare modelli grandi come GLM-5.3-Flash?
Sì. Con 128 GB di memoria unificata, di cui circa 96–100 GB assegnabili alla GPU, fa girare quantizzazioni da 2 a 4 bit di modelli MoE da 200–300B a circa 13–38 t/s. Il limite è l'elaborazione del prompt: i contesti lunghi richiedono minuti, e in una prova un prompt da 1 milione di token ha impiegato 18 minuti. È una buona macchina per chi ha bisogno di tanta memoria e lavora da solo, meno adatta ai cicli degli agenti con prompt enormi.
Quanti token al secondo servono per gli agenti di coding?
Per il lavoro interattivo circa 30 t/s di decode risultano fluidi, e oltre 60 t/s la sensazione è di velocità. Con gli agenti il prefill conta altrettanto, perché ogni turno invia decine di migliaia di token di contesto. Una macchina con 50 t/s di decode ma 300 t/s di prefill sembra più lenta, dentro un agente, di una con 40 t/s di decode e 2.500 t/s di prefill.
L'IA locale costa meno di un'API?
Per token di solito no. Anche a pieno carico 24 ore su 24, il nostro setup GLM-5.3-Flash su due nodi costa circa 2,03 € per milione di token hardware incluso, mentre l'API di GLM-5.3-Flash chiede 0,50 $ per milione di token in output. Il locale vince su privacy, costi fissi prevedibili, assenza di rate limit e pieno controllo, e una RTX 3090 usata sfruttata al massimo può battere i prezzi API per i modelli da 27B.
Perché nel 2026 l'hardware costa così tanto?
Una carenza globale di DRAM e GDDR7 ha fatto salire il prezzo di tutto ciò che ha molta memoria. NVIDIA ha alzato la DGX Spark da 3.999 $ a 4.699 $ a febbraio 2026, la RTX PRO 6000 ora costa 16.000 $ e i mini PC Strix Halo da 128 GB sono rincarati di circa il 75 %. Le schede usate con memoria GDDR6X più vecchia, come la RTX 3090, ne risentono meno.
Fonti
- MacStories – recensione del Mac Studio M5 Ultra: https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
- Macworld – annuncio del Mac Studio M5 Ultra: https://macworld.com/article/3220024/apple-announces-the-m5-ultra-mac-studio-with-up-to-512gb-of-ram.html
- PCMag – Mac Studio (2026) M5 Ultra: https://uk.pcmag.com/desktop-pcs/167419/apple-mac-studio-2026-m5-ultra
- Ars Technica – recensione del Mac Studio M5 Ultra: https://arstechnica.com/gadgets/2026/09/review-apples-hyper-pricey-m5-ultra-mac-studio-made-me-into-a-vibe-coder
- Apple – specifiche tecniche MacBook Pro M5 Pro/Max: https://support.apple.com/en-bn/126319
- pi3g – prezzi NVIDIA DGX Spark, settembre 2026: https://pi3g.com/nvidia-dgx-spark-price/
- Tom's Hardware – DGX Spark, consumi ed efficienza: https://www.tomshardware.com/pc-components/gpus/nvidia-dgx-spark-review/4
- ComputingForGeeks – confronto tra mini PC Ryzen AI Max+ 395: https://computingforgeeks.com/ryzen-ai-max-395-mini-pc-comparison
- RunAIHome – RTX 5090 vs 4090 vs 3090 usata: https://runaihome.com/blog/rtx-5090-vs-rtx-4090-vs-used-3090-local-ai-2026
- RunAIHome – aumento dei prezzi dei PC a memoria unificata: https://runaihome.com/blog/unified-memory-ai-pc-price-surge-mid-2026-buying-guide
- Thunder Compute – prezzi RTX PRO 6000: https://www.thundercompute.com/blog/nvidia-rtx-pro-6000-pricing
- Alibaba Cloud – Qwen3.8-Flash-Next: https://www.alibabacloud.com/blog/qwen3-8-flash-next-a-new-architecture-towards-ultimate-cost-efficiency_603501
- Capital and Compute – prezzi di GLM-5.3-Flash: https://capitalandcompute.net/blog/glm-5-3-flash-pricing-benchmarks
- Hugging Face – GLM-5.3-Flash EXL3 4bpw (Mia-AiLab): https://huggingface.co/Mia-AiLab/GLM-5.3-Flash-EXL3-TR3-4bpw
- BDEW – prezzi dell'elettricità 2026: https://www.bdew.de/energie/strompreise-dossier
- syv-ai – Qwen3.8-27B su RTX 3090: https://github.com/syv-ai/qwen38-27b-rtx3090
- Post su X di @jvr0x (2026-09-19): https://x.com/jvr0x/status/2101331441980149887
- Post su X di @ViC305 (2026-09-22): https://x.com/ViC305/status/2102228607494201632
- Post su X di @yume_arasaki (2026-09-22): https://x.com/yume_arasaki/status/2102395182184534404
- Post su X di @mr_r0b0t (2026-09-10): https://x.com/mr_r0b0t/status/2098096413020410362
- Post su X di @hypermac6502 (2026-09-18): https://x.com/hypermac6502/status/2100862418360615112
- Post su X di @ciprianveg (2026-09-20): https://x.com/ciprianveg/status/2101774114780590325
- Post su X di @wei_wang (2026-09-22): https://x.com/wei_wang/status/2102204481995956450
- Post su X di @hiheyhowareya (2026-09-20): https://x.com/hiheyhowareya/status/2101806099724644788
- Post su X di @luceboxai (2026-09-16): https://x.com/luceboxai/status/2100218346448851435
- Post su X di @yume_arasaki (2026-09-08): https://x.com/yume_arasaki/status/2097356548574179756
- Context Studios – misurazioni proprie: 24 settembre 2026 (bench_local.py, metodo descritto sopra) e luglio/agosto 2026 (cluster 4× GB10, harness interno)
Volete portare l'IA locale nel vostro team?
Context Studios offre consulenza su hardware, configurazione e gestione dell'IA locale: dalla scelta tra DGX Spark, Mac Studio o server GPU fino all'inferenza in produzione con vLLM. Usiamo questo stack ogni giorno, e le misure di questa guida vengono proprio da lì.