Aggiornato al 24 settembre 2026. Apple ha presentato il Mac Studio con M5 Ultra il 25 agosto 2026. Secondo l'Apple Store, la configurazione da 512 GB arriverà "a fine ottobre". Aggiorneremo questa guida non appena saranno disponibili nuove misurazioni.
In breve: a settembre 2026 l'M5 Ultra è la macchina singola e silenziosa più veloce per i grandi modelli mixture-of-experts come Qwen3.8-Flash-Next o GLM-5.3-Flash. Offre 1,2 TB/s di banda di memoria e fino a 256 GB (presto 512 GB) di memoria unificata. Per i modelli densi che stanno in 32 GB, una RTX 5090 resta più veloce. Se servono CUDA, clustering o molti utenti in parallelo, DGX Spark è la scelta migliore. E se conta solo il costo per token, vince il cloud: secondo i nostri calcoli l'inferenza locale sull'M5 Ultra costa circa 1,70–2,70 € per milione di token di output, mentre l'API di Qwen3.8-Flash costa 0,47 $.
In Context Studios gestiamo dall'estate 2026 un cluster di quattro ASUS Ascent GX10 (NVIDIA GB10, lo stesso hardware del DGX Spark). La domanda quindi ce la siamo posta anche noi: avremmo fatto meglio a comprare dei Mac Studio invece degli Spark? Questa guida è la nostra risposta onesta, basata su specifiche verificate, recensioni indipendenti, valori raccolti dalla community su X e misurazioni nostre del 24 settembre.
Le specifiche verificate in 60 secondi
| Caratteristica | M5 Ultra (base) | M5 Ultra (top) |
|---|---|---|
| CPU | 30 core (10 super core, 20 performance core) | 36 core |
| GPU | 64 core con Neural Accelerator | 80 core con Neural Accelerator |
| Neural Engine | 32 core | 32 core |
| Banda di memoria | 1,2 TB/s | 1,2 TB/s |
| Memoria unificata | 96 GB | 256 GB o 512 GB (512 GB da fine ottobre, solo con GPU a 80 core) |
| SSD | 1 TB | fino a 16 TB |
| Porte | 4× Thunderbolt 5 (120 Gbit/s), Ethernet 10 Gbit, HDMI 2.1 | identiche |
| Potenza continua massima (alimentatore) | 480 W | 480 W |
Fonte: specifiche tecniche Apple e Apple Newsroom del 25/08/2026. La novità è l'architettura a quattro die: con UltraFusion Apple unisce quattro die in un unico chip. Secondo Apple la banda è superiore del 50% rispetto all'M3 Ultra (819 GB/s). È proprio questo il dato decisivo per gli LLM locali, perché per generare ogni token bisogna leggere dalla memoria i pesi attivi del modello.
Prezzi in Italia, Germania e Stati Uniti
Abbiamo rilevato i prezzi direttamente dal configuratore dell'Apple Store (Germania e USA) il 24 settembre 2026. I prezzi italiani possono variare leggermente per via dell'IVA diversa: verificali sull'Apple Store italiano prima dell'acquisto.
| Configurazione | Germania | USA |
|---|---|---|
| M5 Ultra 30C/64G, 96 GB, 1 TB | 6.599 € | 5.499 $ |
| M5 Ultra 36C/80G, 96 GB, 1 TB | 8.029 € | 6.799 $ |
| M5 Ultra 30C/64G, 256 GB, 1 TB | 10.999 € | 9.499 $ |
| M5 Ultra 36C/80G, 256 GB, 1 TB | 12.429 € | 10.799 $ |
| Sovrapprezzo 96 → 256 GB | +4.400 € | +4.000 $ |
| M5 Ultra 512 GB | prezzo non ancora disponibile | prezzo non ancora disponibile |
| Per confronto: M5 Max (base) | 2.999 € | 2.499 $ |
Tom's Hardware riporta tempi di consegna di 16–18 settimane per la sua unità di prova (GPU a 80 core, 256 GB, 4 TB, 12.299 $). Ars Technica stima che la versione da 512 GB costerà "20.000 dollari e oltre". È una stima, non un prezzo Apple.
Benchmark: cosa fa davvero l'M5 Ultra
Non abbiamo un M5 Ultra in casa. Tutti i numeri sul Mac provengono da tre recensioni indipendenti con metodologia pubblicata e da misurazioni della community, che indichiamo separatamente più sotto. I risultati dipendono molto da runtime, quantizzazione e lunghezza del contesto: confronta i valori solo all'interno della stessa tabella.
Qwen3.8-Flash-Next (MoE) con MLX
MacStories ha messo a confronto l'M5 Ultra (256 GB) con l'M3 Ultra (512 GB) usando oMLX 0.7.0.dev2:
| Lunghezza del contesto | Decode M3 Ultra | Decode M5 Ultra | Time to first token M5 Ultra |
|---|---|---|---|
| 4K | 59,0 t/s | 90,7 t/s | 2,5 s |
| 16K | 53,5 t/s | 87,8 t/s | 6,2 s |
| 64K | 45,3 t/s | 83,8 t/s | 23,7 s |
| 128K | 37,0 t/s | 60,6 t/s | 49,2 s |
| 256K | 38,6 t/s | 74,7 t/s | 101,5 s |
Nel prompt processing (prefill) l'M5 Ultra legge un prompt da 16K a 2.887 t/s (M3 Ultra: 1.143 t/s) e a 256K arriva ancora a circa 2.550 t/s. È circa 2,5 volte la generazione precedente, grazie ai nuovi Neural Accelerator presenti in ogni core GPU. Con prompt brevi Flash-Next raggiunge una mediana di 108 t/s su tre esecuzioni, il 54% in più dell'M3 Ultra (70 t/s).
GLM-5.3-Flash con MLX
Per GLM-5.3-Flash (MLX, misto 4/8 bit) MacStories misura sull'M5 Ultra 41 t/s in decode e 1.107 t/s di prefill con un prompt da 16K. L'M3 Ultra si ferma a 26 t/s e 428 t/s. Attenzione: la velocità di scrittura di GLM include qui i token di ragionamento.
Qwen 3.8 27B (denso) con llama.cpp
Tom's Hardware misura Qwen 3.8 27B Q4_K_M con llama.cpp, senza multi-token prediction:
| Contesto | Mac Studio M5 Ultra | Mac Studio M4 Max | DGX Spark |
|---|---|---|---|
| 0 | 46,3 t/s | 22,7 t/s | 11,8 t/s |
| 16K | 43,4 t/s | 21,1 t/s | 11,0 t/s |
| 64K | 32,4 t/s | 14,6 t/s | 9,3 t/s |
| 128K | 30,1 t/s | 9,0 t/s | 7,7 t/s |
Con LM Studio, Ars Technica ottiene "poco più di 50" token al secondo per lo stesso modello a 4 bit. Il Mac Studio M5 Max arriva a circa 31 t/s, mentre un Framework Desktop (Strix Halo) e un Mac Studio M2 Max si fermano entrambi a circa 18–20 t/s.
Il confronto con la RTX 5090
MacStories ha messo Qwen 3.8 27B sul Mac anche contro un PC da gaming con RTX 5090 (32 GB). Con un prompt da 6.091 token la 5090 legge a 3.031 t/s, l'M5 Ultra a 1.701 t/s e l'M3 Ultra a 414 t/s. In scrittura la 5090 arriva a 59 t/s, l'M5 Ultra a 48 t/s. Finché il modello sta in 32 GB di VRAM, la 5090 è quindi circa il 25% più veloce in decode e quasi il doppio in prefill. Quando non ci sta più, il quadro si ribalta: spostando parte del lavoro nella RAM di sistema, nello stesso test la 5090 è scesa a 4,6–1,5 t/s.
Cosa misura la community su X
Da quando sono arrivate le prime unità, su X compaiono ogni giorno nuovi valori per l'M5 Ultra. Il 24 settembre abbiamo raccolto con la ricerca di X le misurazioni più viste. Sono prove singole con runtime e impostazioni diverse, non benchmark controllati. Mostrano però quanto velocemente il software MLX stia recuperando.
| Chi | Modello / setup | Valore | Link |
|---|---|---|---|
| @mweinbach (163.000 visualizzazioni) | Qwen3.8-Flash-Next, in batch | 3.740 t/s di prefill, 149 t/s di decode ("quasi il doppio di ieri") | Post |
| @viticci (MacStories) | Flash-Next 4/8 bit, MLX-Serve v26.9.5 | oltre 3.500 t/s di prefill, 110 t/s su prosa breve | Post |
| @wei_wang | Flash-Next, agenti multi-turno con tool call | 60–85 t/s, prefill in media ~2,5× più veloce dell'M3 Ultra | Post |
| @MiaAI_lab (144.000 visualizzazioni) | GLM-5.3-Flash, M5 Ultra vs 2× DGX Spark | M5 Ultra: 28 t/s decode, 1.016 t/s prefill; 2× Spark: 39 t/s, 1.700 t/s | Post |
| @MiaAI_lab | Qwen3.8-Flash su 2× DGX Spark | 56,8 t/s su singolo stream, 146 t/s con 4 stream, 3.500 t/s di prefill | Post |
Due osservazioni. Primo: i valori del Mac a volte raddoppiano nel giro di un giorno, perché i kernel per i nuovi Neural Accelerator vengono scritti proprio adesso. Secondo: le ricette della community per lo Spark sono ben ottimizzate. Il confronto "M5 Ultra contro due Spark" cambia a seconda del modello e del giorno.
Le nostre misurazioni: 2× GX10 il 24 settembre
Per dare un contesto ai numeri della community, il 24 settembre abbiamo misurato su due nodi del nostro cluster (ASUS Ascent GX10, tensor parallel su RoCE a 100G). Metodo: chat completion in streaming, temperatura 0, thinking disattivato, un warm-up, mediana di tre esecuzioni, 400 token di output.
| Modello su 2× GX10 | Quantizzazione / engine | Decode singolo stream | 4 stream in parallelo (totale) |
|---|---|---|---|
| GLM-5.3-Flash | EXL3 4 bpw, vLLM | 32,9 t/s | 63,7 t/s (circa 16–17 t/s per stream) |
| Qwen3.8-Flash-Next | NVFP4, vLLM dietro un proxy LiteLLM | 32,9 t/s | non affidabile (uno stream si è bloccato) |
Con un prompt breve di circa 1.000 token abbiamo misurato per GLM-5.3-Flash 1.262 t/s di prefill, rete inclusa. È un limite inferiore, non un valore per contesti lunghi. Come si confronta: su singolo stream, con GLM-5.3-Flash l'M5 Ultra (41 t/s secondo MacStories) è davanti ai nostri due nodi. Con quattro stream in parallelo, i due GX10 producono di più in totale. Per Qwen3.8-Flash-Next il nostro attuale setup NVFP4, con 32,9 t/s, è ben al di sotto dei 56,8 t/s che Mia AI Lab mostra su due Spark ed è nettamente dietro l'M5 Ultra. Qui il nostro setup non è al livello della community, e preferiamo dirlo apertamente.
Dall'estate abbiamo anche i valori del più grande GLM-5.2 su tutti e quattro i nodi: 27,2 t/s con uno stream, 75,8 t/s con sei stream e un prefill di 853 t/s (8K) e 840 t/s (32K).
La questione del prompt processing: recuperato, non superato
La debolezza più nota di Apple Silicon era la lentezza nella lettura dei prompt lunghi. Per i workflow agentici con 50.000 token di contesto o più è un aspetto decisivo. L'M5 Ultra fa qui il salto più grande, ma non chiude del tutto il divario con NVIDIA:
- Rispetto alla RTX 5090 legge a circa metà velocità (1.701 vs 3.031 t/s).
- Rispetto al DGX Spark è più veloce con contesti brevi e medi. Tom's Hardware misura un time to first token più basso fino a 32K (42,2 s contro 49,1 s a 32K). A 64K i due sono alla pari (circa 104 s), a 128K è davanti lo Spark (236,8 s contro 295,8 s).
- Rispetto all'M3 Ultra è circa 2,5 volte più veloce.
Questo coincide con la nostra esperienza con il GB10: in decode lo frenano i 273 GB/s di banda, mentre nel prefill, che richiede molto calcolo, è forte.
Consigli d'acquisto: quale modello entra in quale memoria?
Regola pratica: i pesi a 4 bit richiedono circa 0,55–0,6 GB per miliardo di parametri. A questi si aggiungono la KV cache per il contesto e un margine del 15–20% per macOS. Nei modelli MoE è il numero totale di parametri a determinare la memoria necessaria, mentre i parametri attivi determinano la velocità.
| Taglio di memoria | Ci sta bene | Stretto o non ci sta | Consiglio |
|---|---|---|---|
| 96 GB (da 6.599 €) | Qwen 3.8 27B a 8 bit o BF16, gpt-oss-120b, Qwen3.8-Flash-Next a 4 bit con contesto moderato (un report della community parla di circa 68 GB) | GLM-5.3-Flash, contesti lunghi da 256K con Flash-Next | Un buon punto di partenza per un modello con contesto medio. Qui un Mac Studio M5 Max da 128 GB è spesso la scelta migliore a metà prezzo. |
| 256 GB (da 10.999 €) | Flash-Next oQ4e/oQ5e con contesto da 256K (picco di 155–179 GB secondo MacStories), GLM-5.3-Flash in MLX 4/8 bit, tre sessioni Flash-Next in parallelo | Flash-Next a 6 o 8 bit solo con le tabelle di embedding spostate su SSD; oMLX concede al massimo circa 200 GB | Il punto ideale per il lavoro agentico con grandi modelli MoE. |
| 512 GB (da fine ottobre, prezzo da definire) | Candidati: DeepSeek-V4.1-Flash, GLM-5.3 con quantizzazioni più alte, più modelli grandi insieme | Nessuna misurazione disponibile | Compralo solo se un modello specifico supera i 256 GB. |
Un dettaglio di MacStories mostra quanto sia rigido questo limite: sul modello da 256 GB, macOS ha chiuso Flash-Next a 6 bit per pressione sulla memoria a 176,6 GB. La variante a 8 bit oMLX non l'ha nemmeno caricata. Prevedi almeno il 20% di margine oltre la dimensione pura del modello.
Costo per token: i nostri calcoli
Ipotesi (adattale alla tua situazione): elettricità a 0,37 €/kWh (media BDEW per la Germania nel 2026), ammortamento su tre anni con funzionamento 24/7, piena utilizzazione. Per l'M5 Ultra non esiste ancora una misura dei consumi sotto carico LLM. Ars Technica ha misurato 75 W durante la codifica video e Apple indica 480 W come potenza continua massima: usiamo questo intervallo. Per un nodo GX10 consideriamo 160 W (Tom's Hardware, DGX Spark sotto carico GPU) e un prezzo di acquisto di 4.558 € (retail tedesco, agosto 2026).
| Sistema | Modello / carico | Throughput | Hardware | Costo per 1M token di output |
|---|---|---|---|---|
| Mac Studio M5 Ultra 80C/256 GB | Flash-Next, 3 richieste in parallelo (MacStories) | 81,5 t/s | 12.429 € | 1,71–2,22 € |
| Mac Studio M5 Ultra 80C/256 GB | Flash-Next, una richiesta con prompt da 6,5K (MacStories) | 66,2 t/s | 12.429 € | 2,10–2,73 € |
| Mac Studio M5 Ultra 80C/256 GB | GLM-5.3-Flash, una richiesta (MacStories) | 41 t/s | 12.429 € | 3,39–4,41 € |
| 2× ASUS GX10 (nostra misura) | GLM-5.3-Flash, 4 stream | 63,7 t/s | 9.116 € | ~2,03 € |
| 2× ASUS GX10 (nostra misura) | GLM-5.3-Flash, uno stream | 32,9 t/s | 9.116 € | ~3,93 € |
| 4× ASUS GX10 (il nostro cluster) | GLM-5.2, 6 stream | 75,8 t/s | 18.232 € | ~3,41 € |
| API cloud | Qwen3.8-Flash (Alibaba Cloud) | – | – | 0,47 $ |
| API cloud | GLM-5.3-Flash (Z.ai) | – | – | 0,50 $ |
Il verdetto è chiaro: nessuna di queste macchine conviene sul prezzo per token. Anche a pieno carico l'API costa molte volte meno. Nella pratica una singola workstation lavora spesso sotto il 10% di utilizzo, e allora il costo per token si moltiplica per dieci. L'inferenza locale si compra per la privacy dei dati, costi fissi prevedibili, indipendenza dai rate limit e libertà nella scelta dei modelli. Sul fronte energetico il Mac è forte: anche ipotizzando 480 W, con Flash-Next e tre richieste consuma circa 1,6 kWh per milione di token. Il nostro cluster a quattro nodi ne consuma circa 2,4 per GLM-5.2.
Mac Studio M5 Ultra o DGX Spark: quando scegliere cosa?
In estate abbiamo scelto consapevolmente l'hardware GB10 e, per il nostro caso d'uso, lo rifaremmo. I motivi però non sono quelli che suggerisce la maggior parte delle tabelle di benchmark.
A favore dello Spark (dalla nostra esperienza operativa):
- CUDA e ricette della community. I nuovi modelli ricevono spesso nel giro di pochi giorni ricette vLLM o SGLang ottimizzate per lo Spark, con NVFP4 e speculative decoding.
- Scalabilità su più nodi. Con ConnectX a 200G e uno switch RoCE a 100G eseguiamo GLM-5.2 in tensor parallel su quattro nodi. I checkpoint grandi li scarichiamo una volta sola e li distribuiamo agli altri nodi via RoCE in circa 15 minuti invece di 48 ore.
- Concorrenza. Il nostro cluster porta GLM-5.2 da 27,2 t/s con uno stream a 75,8 t/s con sei. Due nodi quasi raddoppiano il throughput di GLM-5.3-Flash passando da uno a quattro stream (32,9 → 63,7 t/s). Più agenti e utenti condividono lo stesso hardware.
- Prezzo d'ingresso per nodo. Ad agosto un GX10 costava in Germania 4.558 €. Da allora i prezzi sono saliti parecchio (Cyberport: da 4.000 € a 5.199 € in sei settimane).
A favore del Mac Studio:
- Velocità su singolo stream. Con Qwen 3.8 27B, Tom's Hardware misura quasi quattro volte la velocità di decode di un singolo Spark (46,3 contro 11,8 t/s). Con 1,2 TB/s contro 273 GB/s è pura fisica.
- Una macchina, non un cluster. 256 GB in un solo box sostituiscono due Spark, senza rete dedicata, senza configurazione tensor parallel e senza i 13–14 minuti che richiede un riavvio del nostro cluster.
- Silenzio ed efficienza. Il Mac è silenzioso: MacStories lo descrive come nettamente più silenzioso del proprio PC con 5090.
- Lo slancio di MLX. La community MLX (oMLX, mlx-lm, MLX-Serve, varianti MTP) recupera in fretta, e i nuovi modelli MoE compaiono spesso come quantizzazioni MLX già dal primo giorno.
La nostra guida alla scelta:
| Vuoi… | Scegli |
|---|---|
| usare da solo un grande modello MoE in modo veloce e silenzioso | Mac Studio M5 Ultra, 256 GB |
| servire un team o più agenti in parallelo | DGX Spark / GX10 (da 2 nodi) |
| fare fine-tuning o usare strumenti CUDA | DGX Spark |
| far girare il più velocemente possibile un modello denso fino a 32 GB | RTX 5090 |
| 128 GB di memoria unificata al prezzo più basso | AMD Strix Halo (il prefill è il suo punto debole) |
| provare in locale modelli con oltre 400 GB di pesi | aspettare l'M5 Ultra da 512 GB o un cluster Spark da 3–4 nodi |
Il confronto con Strix Halo e RTX 5090
| Piattaforma | Memoria | Banda | Qwen 3.8 27B (decode) | Punti di forza | Punti deboli |
|---|---|---|---|---|---|
| Mac Studio M5 Ultra | 96–512 GB | 1,2 TB/s | 46–50 t/s | grandi modelli MoE, silenzioso | prezzo, prefill sotto NVIDIA |
| DGX Spark / GX10 | 128 GB | 273 GB/s | 11,8 t/s (llama.cpp), 33–35 t/s (SGLang + MTP, community) | CUDA, clustering, concorrenza | decode su singolo stream |
| AMD Strix Halo | fino a 128 GB | ~256 GB/s | 18–20 t/s (Ars, LM Studio) | prezzo per GB | prefill, maturità del software |
| RTX 5090 | 32 GB | 1,79 TB/s | 59 t/s (MacStories), 75 t/s (llama.cpp) | velocità, prefill | solo 32 GB, 575 W |
Per maggiori dettagli su Qwen 3.8 27B su tutte le piattaforme trovi la nostra guida hardware a Qwen 3.8 27B. Il quadro dei costi dal Mac mini all'M5 Ultra lo trovi in Quanto costa l'IA locale sull'hardware Apple nel 2026.
Avvio rapido: Flash-Next sul Mac Studio
Per un primo test basta mlx-lm. I comandi qui sotto sono un esempio minimo. Verifica prima su Hugging Face il nome esatto della quantizzazione che ti interessa.
pip install -U mlx-lm
mlx_lm.server --model mlx-community/<repo-flash-next-4bit> --port 8080
In questo modo hai un'API compatibile con OpenAI sulla porta 8080, da collegare a Hermes Agent, Codex o Open WebUI. Per la multi-token prediction MacStories usa oMLX, che però è ancora in fase di sviluppo.
Conclusioni
Il Mac Studio M5 Ultra è la migliore macchina singola per grandi modelli aperti che si possa comprare a settembre 2026. Con 1,2 TB/s e 256 GB, modelli come Qwen3.8-Flash-Next diventano per la prima volta adatti al lavoro agentico quotidiano, a 60–90 t/s anche con contesti lunghi. Non è però un tuttofare. Nel prompt processing NVIDIA resta avanti, con molti utenti in parallelo un cluster Spark scala meglio e per i modelli densi da 27B una RTX 5090 è più veloce ed economica.
Per noi in Context Studios il cluster GB10 resta la scelta giusta, perché serviamo agenti in parallelo e sfruttiamo le ricette CUDA della community. Se oggi dovessimo comprare una singola workstation silenziosa per grandi modelli, sarebbe un M5 Ultra da 256 GB. Per la versione da 512 GB conviene aspettare prezzo e benchmark.
FAQ
Quanto è veloce il Mac Studio M5 Ultra con gli LLM locali?
Dipende molto dal modello. Con il modello MoE Qwen3.8-Flash-Next, MacStories misura circa 108 t/s con prompt brevi e ancora 83,8 t/s con 64K di contesto. Con il modello denso Qwen 3.8 27B, Tom's Hardware misura con llama.cpp 46,3 t/s senza contesto e 30,1 t/s a 128K. È quindi circa due volte più veloce di un M4 Max e, con Flash-Next, dal 54 al 94% più veloce dell'M3 Ultra a seconda del contesto.
Bastano 96 GB o servono 256 GB?
96 GB bastano per modelli densi fino a circa 70 miliardi di parametri a 4 bit e per Qwen3.8-Flash-Next a 4 bit con contesto moderato. Se vuoi usare grandi modelli MoE come GLM-5.3-Flash o Flash-Next con 256K di contesto, servono 256 GB. Tieni conto che macOS e il runtime non liberano tutta la memoria. Sul modello da 256 GB, oMLX concede a un singolo modello solo circa 200 GB.
Il Mac Studio M5 Ultra è meglio di un DGX Spark?
Per un singolo utente l'M5 Ultra è molto più veloce di un singolo Spark. Con Qwen 3.8 27B, Tom's Hardware misura quasi quattro volte la velocità di decode. Il DGX Spark vince su CUDA, ricette rapide della community, clustering via ConnectX e scalabilità con molte richieste in parallelo. Contro due Spark la partita è aperta: a seconda del modello e dello stato del software, a volte è davanti il Mac, a volte la coppia di Spark.
Quanto costa il Mac Studio M5 Ultra?
In Germania la versione base con CPU a 30 core, GPU a 64 core, 96 GB e 1 TB costa 6.599 €, negli Stati Uniti 5.499 $. La GPU a 80 core costa 1.430 € in più e il passaggio da 96 a 256 GB altri 4.400 €. La versione da 256 GB completamente equipaggiata con SSD da 1 TB arriva così a 12.429 €, mentre per la versione da 512 GB non c'è ancora un prezzo. Il prezzo italiano può differire leggermente per via dell'IVA.
L'IA locale sull'M5 Ultra conviene economicamente?
Solo sul prezzo per token, no. I nostri calcoli danno circa 1,70–2,70 € per milione di token di output con Flash-Next a pieno carico, mentre API cloud comparabili costano circa 0,50 $. L'inferenza locale conviene per la privacy dei dati, i costi prevedibili, l'indipendenza da fornitori e rate limit e la libertà nella scelta dei modelli. Chi elabora dati sensibili o fa girare agenti 24 ore su 24 ottiene in cambio un valore concreto.
Quanta energia consuma il Mac Studio M5 Ultra?
Apple indica una potenza continua massima di 480 W. È il limite dell'alimentatore, non un valore tipico. Ars Technica ha misurato circa 75 W durante la codifica video, mentre una misura indipendente sotto carico LLM per ora non c'è. Per confronto, un DGX Spark assorbe circa 160 W dalla presa sotto carico GPU e una RTX 5090 da sola può arrivare a 575 W.
Volete configurare l'IA locale per il vostro team? Context Studios offre consulenza su hardware, setup e gestione, da un singolo Mac Studio fino a un cluster multi-nodo. Contattaci
Fonti
- Apple – Specifiche tecniche Mac Studio: https://www.apple.com/it/mac-studio/specs/
- Apple Newsroom – M6 e M5 Ultra (25/08/2026): https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute/
- Apple Store Germania – Configura Mac Studio (prezzi al 24/09/2026): https://www.apple.com/de/shop/buy-mac/mac-studio
- Apple Store USA – Mac Studio (prezzi al 24/09/2026): https://www.apple.com/shop/buy-mac/mac-studio
- MacStories – Recensione M5 Ultra Mac Studio: https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
- Tom's Hardware – Recensione Apple Mac Studio (M5 Ultra): https://www.tomshardware.com/desktops/mini-pcs/apple-mac-studio-m5-ultra-review
- Ars Technica – Recensione M5 Ultra Mac Studio: https://arstechnica.com/gadgets/2026/09/review-apples-hyper-pricey-m5-ultra-mac-studio-made-me-into-a-vibe-coder/
- Tom's Hardware – Recensione DGX Spark (consumi): https://www.tomshardware.com/pc-components/gpus/nvidia-dgx-spark-review/4
- Alibaba Cloud – Qwen3.8-Flash-Next (prezzi API): https://www.alibabacloud.com/blog/qwen3-8-flash-next-a-new-architecture-towards-ultimate-cost-efficiency_603501
- Capital and Compute – Prezzi GLM-5.3-Flash: https://capitalandcompute.net/blog/glm-5-3-flash-pricing-benchmarks
- BDEW – Analisi dei prezzi dell'elettricità in Germania: https://www.bdew.de/energie/strompreise-dossier
- X: @mweinbach https://x.com/mweinbach/status/2102224017650594212 · @viticci https://x.com/viticci/status/2102121905385820413 · @wei_wang https://x.com/wei_wang/status/2102054751261131075 · @MiaAI_lab https://x.com/MiaAI_lab/status/2102098618035356156 e https://x.com/MiaAI_lab/status/2102507937646235875
- Context Studios – misurazioni proprie su 2× ASUS Ascent GX10 (GLM-5.3-Flash EXL3, Qwen3.8-Flash-Next NVFP4, vLLM, 24/09/2026) e su 4× GX10 (GLM-5.2, vLLM, TP4, luglio/agosto 2026)