La guida all'acquisto del Mac Studio per l'IA locale: compra per il tuo collo di bottiglia
La generazione M5 è la macchina IA più aperta che Apple abbia mai costruito. Ma paragonare 1 PFLOPs di FP4 a 1,2 TB/s significa mettere sulla bilancia due colli di bottiglia completamente diversi. Questa guida ti mostra come prendere la decisione giusta — non per nome del chip, ma per l'unica domanda che conta: Quale modello vuoi davvero tenere, e quale strozzatura definisce poi il tuo quotidiano?
Indice
- La meccanica di fondo: perché la cifra 4× dice meno di quanto sembri
- La scala della banda: dove si trova il vero salto di classe
- La scala delle capacità: quale classe di modello può tenere la tua memoria
- La trappola dei 50 dollari: 2×128 GB ≠ 1×256 GB
- La matrice decisionale
- TCO: quanto costa davvero la gestione
- Il prompt decisionale
1. La meccanica di fondo: perché la cifra 4× dice meno di quanto sembri
Il team di ricerca ML di Apple ha misurato cosa fanno gli acceleratori neurali dell'M5 (machinelearning.apple.com, «Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU»):
| Operazione | Accelerazione M5 | Scala con |
|---|---|---|
| Tempo al primo token (elaborazione del prompt) | fino a 4,06× (3,33–4,06×) | Potenza di calcolo |
| Generazione (produzione di token) | solo 1,19–1,27× (+19–27%) | Banda di memoria |
Apple Newsroom (25.08.2026) conferma la pagina prodotto alla lettera: «up to 4.3x faster AI performance» sull'M5 Ultra rispetto all'M3 Ultra — con la precisazione «speeding up prompt processing». La cifra 4× è una cifra di prefill. Misura il momento prima del primo token, non l'esperienza di scrittura successiva.
L'elaborazione del prompt scala con il calcolo. La generazione scala con la banda.
Una volta assimilata questa meccanica, capisci perché i numeri di marketing mancano il collo di bottiglia.
2. La scala della banda: dove si trova il vero salto di classe
La velocità di generazione — ciò che senti davvero mentre scrivi — dipende dalla banda di memoria. Ed è qui che accade davvero qualcosa di concreto:
| Chip | Banda | Classe |
|---|---|---|
| Mac mini M6 (base) | 170 GB/s | Entry level — il 27B Q4 gira, ma con fatica |
| M5 Pro | 307 GB/s | Macchina 27B/32B solida |
| M5 Max | 614 GB/s | Prima classe «vicino alla frontiera» |
| M3 Ultra | 819 GB/s | Riferimento precedente |
| M5 Ultra | 1.200 GB/s | L'unico salto di classe della generazione |
Solo il passaggio all'Ultra «cambia classe»: da 614 a 1.200 GB/s, è +95%. Da 546 (M4 Max) a 614 (M5 Max), è +12% — in mezzo, stai ricomprando la stessa classe in un nuovo involucro.
La memoria unificata è al contempo una funzionalità e una tassa. macOS riserva 8–12 GB prima ancora che il modello si carichi. Ogni scheda del browser, ogni strumento dello spazio utente attinge dallo stesso pool. Quando leggi «64 GB», dovresti leggere «~54 GB per il modello».
3. La scala delle capacità: quale classe di modello può tenere la tua memoria
| RAM | Classe di modello realistica |
|---|---|
| 128 GB | Classe da 120–170 miliardi di parametri |
| 256 GB | Classe 300B |
| 512 GB | Classe 700B |
Riferimento concreto: Kimi K3 (2.800 miliardi di parametri, ~1,4 TB) non ci sta in 512 GB. Il tetto è reale — ed è esattamente per questo che la dimensione della memoria decide cosa puoi far girare.
4. La trappola dei 50 dollari: 2×128 GB ≠ 1×256 GB
È qui che il calcolo va in collisione: un M5 Ultra con 256 GB/1 TB costa 9.499 $. Due bundle DGX Spark (128 GB ciascuno) insieme costano 9.449 $ — una differenza di 50 dollari.
Ma due macchine da 128 GB suddividono il lavoro. Un singolo token 70B richiede 269 ms attraverso il ponte di rete; con due nodi Spark scende a 133 ms — in cambio di due sistemi operativi, due interfacce di rete e la latenza dell'interconnessione. Un Mac da 256 GB tiene il modello in un unico pool di memoria. Non è un pareggio tecnico: sono due architetture diverse alla stessa posizione di cartellino.
Meta-regola: 2×128 ≠ 1×256 — a meno che il tuo workflow non sia per natura suddivisibile (cluster CUDA, più lavori simultanei).
5. La matrice decisionale
| Il tuo collo di bottiglia | La tua macchina | Perché |
|---|---|---|
| Prompt di contesto molto lunga (dominata dal prefill) | M5 Ultra | 4,06× TTFT — è esattamente qui che risparmi più tempo |
| Scrittura fluida, tok/s elevato (dominata dal decode) | M5 Ultra (banda!) | 1.200 GB/s è l'unico vero salto di classe |
| Modelli 70B-Q4 fluidi a budget abbordabile | M5 Max 128 GB | 614 GB/s + capacità adeguata |
| Carichi CUDA suddivisibili, più lavori paralleli | 2× DGX Spark | 2×128 GB a prezzo stracciato, se la suddivisione è accettabile |
| Classe 700B, esperimenti di frontiera | M5 Ultra 512 GB (fine ottobre) | L'unico cammino verso quella classe su una sola macchina |
6. TCO: quanto costa davvero la gestione
| Voce | DGX Spark | M5 Ultra |
|---|---|---|
| Consumo sotto carico | 125–160 W (picco 217 W) | ~35 W in idle, range di carico paragonabile |
| Costo elettrico (0,1816 €/kWh) | 100–120 $/anno (8 h/giorno) · ~200 $/anno (24/7) | Paragonabile |
| Rumore | 29 dBA dichiarati / 32 dBA sotto carico | Design silenzioso |
| Filosofia di storage | 4 TB | 1 TB + backend TB5 |
| Rivendita/garanzia | Garanzia del produttore | AppleCare 3 anni, trasferibile · M2 Ultra >75% di valore |
7. Il prompt decisionale
Prima di comprare, fatti tre domande:
- Quale modello voglio tenere? (la scala delle capacità — non il numero più alto che posso permettermi)
- Leggo di più o scrivo di più? (prefill = dominato dal calcolo → serve l'Ultra; decode = dominato dalla banda → conta la banda)
- Posso suddividere il mio carico di lavoro? (Se sì, 2× Spark può essere il calcolo più sensato — se no, vince il pool di memoria)
Compra per il tuo collo di bottiglia, non per il numero di marketing.
FAQ
Come capisco quale strozzatura è dominante nel mio caso? Osserva cosa ti fa aspettare: se la maggior parte del tempo passa prima che la risposta inizi (lunga attesa dopo il prompt), il tuo collo di bottiglia è il prefill — dominato dal calcolo. Se la risposta parte veloce ma poi scorre faticosamente parola per parola, il tuo collo di bottiglia è il decode — dominato dalla banda. Il primo caso richiede potenza di calcolo (M5 Ultra per il TTFT 4,06×), il secondo banda di memoria (M5 Ultra per i 1.200 GB/s). Non è quasi mai entrambi contemporaneamente.
Perché la sola dimensione della memoria non basta? Perché la banda determina la velocità con cui puoi leggere quella memoria — e le due cose sono indipendenti. Una macchina con tanta RAM ma poca banda carica modelli grandi ma scrive lentamente. La scala delle capacità ti dice quale classe puoi tenere; la scala della banda ti dice se quella classe gira in modo fluido o con fatica. Per un acquisto devi confrontare entrambe le scale con il tuo collo di bottiglia, non limitarti al numero di RAM.
L'M5 Ultra è davvero l'unica macchina che compie il salto di classe? Sì, all'interno della generazione M5 l'Ultra è l'unico vero salto di classe in termini di banda (614 → 1.200 GB/s, +95%). Tutti gli altri salti dai chip M4 agli M5 vanno da una sola cifra a ~12% — stessa lega, nuovo involucro. Quindi se vuoi uscire dalla classe «vicino alla frontiera», l'Ultra è l'unica strada. Per tutto ciò che sta sotto, l'M5 Max 128 GB è la scelta più sensata.
Quando devo aspettare la versione da 512 GB? Quando vuoi far girare la classe 700B (ad esempio grandi modelli MoE). La configurazione da 512 GB arriva solo a fine ottobre; Apple non ha ancora annunciato il prezzo, ma ci si aspetta «ben oltre i 10.000 $». Per la classe 300B basta la versione da 256 GB, disponibile subito. Se il tuo collo di bottiglia è sotto i 700B, non aspettare — la crisi della DRAM rende la memoria più cara nel tempo, non meno cara.
È sempre peggio 2× DGX Spark rispetto a 1× M5 Ultra? No — è diverso, non peggiore. Con ~50 dollari di differenza è una questione di architettura. Due nodi Spark offrono il doppio della memoria (2×128 GB) e sono pensati per carichi CUDA suddivisibili; un token 70B richiede 269 ms attraverso il ponte di rete invece di 133 ms con la suddivisione. L'M5 Ultra, al contrario, tiene lo stesso modello in un unico pool di memoria senza latenza di interconnessione. Se il tuo carico si suddivide su più lavori paralleli, vince il cluster; se vuoi un unico grande modello, vince il Mac.
Fonti
- Apple ML Research: «Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU» (machinelearning.apple.com)
- Apple Newsroom, 25.08.2026: annuncio M5 Max/M5 Ultra
- Specifiche prodotto Apple (bande, memoria unificata)
- Previsione Gartner DRAM/NAND 2026 · esaurimento HBM di Micron · dichiarazioni di Tim Cook sulla memoria (luglio 2026)
- Ars Technica / Tom's Hardware (marzo 2026: opzione da 512 GB rimossa)
- wccftech / OnMSFT / Macfax / MacRumors (mercato della rivendita)
- ComputerBase (misurazioni indipendenti DGX Spark) · forum NVIDIA / heise / overclock3d (prezzi GB10)
- Yume_X (29.08.2026) · verifica propria 31.08.2026