IA locale

Quanto costa l'IA locale sull'hardware Apple nel 2026: guida all'acquisto dal Mac mini all'M5 Ultra 512 GB

Quanto costa l'IA locale sull'hardware Apple nel 2026: guida all'acquisto dal Mac mini all'M5 Ultra 512 GB

Quanto costa l'IA locale sull'hardware Apple nel 2026: guida all'acquisto dal Mac mini all'M5 Ultra 512 GB

TL;DR: I tre modelli flash a pesi aperti (open-weight) di agosto 2026 — Qwen 3.8 Flash Next, GLM 5.3 Flash e DeepSeek V4 Flash — stravolgono la classica logica dei 27B. Il punto di ingresso ideale è di 96 GB, il cavallo di battaglia è la configurazione da 256 GB a partire da 10.999 euro, e i 512 GB arriveranno solo a fine ottobre. Chi elabora meno di 1 milione di token al giorno, spende quasi sempre meno utilizzando l'API rispetto all'acquisto dell'hardware.

L'asse hardware: prezzi per configurazione

Il divario di prezzo nel 2026 è più marcato rispetto alle generazioni precedenti. I valori base sono forniti da idealo, le configurazioni Ultra da ComputerBase e MacTechNews:

DispositivoRAMPrezzo (Mercato/Listino)Fonte
Mac mini M616 GBda 1.019 €idealo
Mac mini M624 GB1.449 €idealo
Mac Studio M5 Max32/36 GB2.869–2.949 €idealo, Mactrade
Mac Studio M5 Max128 GB5.809–5.859 €idealo
Mac Studio M5 Ultra (30C/64C)96 GBda 6.599 €ComputerBase
Mac Studio M5 Ultra (30C/64C)256 GBda 10.999 €ComputerBase
Mac Studio M5 Ultra (36C/80C)256 GB12.429 €ComputerBase
Mac Studio M5 Ultra512 GBFine ottobre 2026, prezzo da definireMacTechNews

Il salto da 96 a 256 GB costa 4.400 € in più: questo è il singolo dato più importante per la decisione d'acquisto. La memoria RAM è saldata su tutte le macchine e non può essere espansa in un secondo momento.

L'asse dei modelli: tre modelli Flash, tre footprint

La vecchia regola "un 27B-Q4 sta in 24 GB" non vale più per questi modelli. Tutti e tre sono Mixture-of-Experts con un'attivazione per token molto bassa, ma con un footprint (impronta di memoria) totale enorme:

  • Qwen 3.8 Flash Next: 125B totali più 51B di tabella N-Gram (Engram), 6B di parametri attivi. Footprint GGUF secondo Unsloth: 1-bit 75 GB, 3-bit 90 GB, 4-bit 96–114 GB, 8-bit 200 GB, BF16 355 GB.
  • GLM 5.3 Flash: 320B totali, 18B attivi, nativamente multimodale. L'FP8 occupa circa 328 GB su disco, il 4-bit circa 164 GB.
  • DeepSeek V4 Flash (inclusa la variante Vision-Exp del 21 agosto): 284B totali, 13B attivi, circa 160 GB su disco.

Corrispondenza RAM-Modello

RAMQwen 3.8 FNGLM 5.3 FDeepSeek V4 F
24 GBnessuno completo, solo classe 27B-dense——
96 GB1-bit (75 GB)——
128 GB3-bit (90 GB) + contesto——
256 GB4-bit (96–114 GB)4-bit (~164 GB)~160 GB
512 GB8-bit (200 GB)FP8 (328 GB)contesto ampio

Non dimenticate la tassa del contesto: i prompt lunghi e le sessioni estese aggiungono diversi GB di cache KV. Regola generale: calcolare un 10-15% di memoria come margine di sicurezza (buffer), altrimenti il sistema sarà costretto a fare paging (swap) sull'SSD.

Analisi dei costi: hardware o API?

GLM 5.3 Flash costa su Z.ai 0,15 $ per 1M di token in input e 0,50 $ per 1M di token in output. Ecco i calcoli per verificare:

bash
# Ipotesi: 10 mln di token/giorno, Rapporto 6M In / 4M Out
# 6 * 0.15 + 4 * 0.50 = 2.90 USD/Giorno
# 2.90 * 365 = 1058.5 USD/Anno (~1.000 EUR)
10999 / 1000   # => ~11 anni per l'ammortamento (Ultra 256 GB)

# Con solo 1 mln di token/giorno:
# 0.29 USD/Giorno * 365 = ~106 USD/Anno
10999 / 106    # => ~104 anni -> L'API vince a mani basse

Il verdetto: Sotto i 5 milioni di token al giorno circa, l'API è più economica di qualsiasi configurazione Studio. L'hardware conviene quando la privacy (nessun dato esce dai server aziendali), la capacità di funzionare offline o i carichi di lavoro aggregati fanno pendere l'ago della bilancia, non per il singolo centesimo risparmiato.

Guida all'acquisto

  • Mac mini 24 GB (1.449 €): è al limite per i tre modelli Flash, adatto solo alla classe 27B-dense. Valido come dispositivo secondario o per piccoli agenti stabili.
  • 96/128 GB (6.599 € / 5.809 €): il livello più sensato. Qwen 3.8 Flash Next gira a 1 o 3-bit a velocità accettabili — su un notebook da 64 GB si sono registrati 36 token/s; con più RAM aumenta il buffer per il contesto.
  • 256 GB (10.999–12.429 €): il cavallo di battaglia, la scelta d'elezione se GLM 5.3 Flash o DeepSeek V4 in 4-bit devono fare da spina dorsale.
  • 512 GB (Fine ottobre): solo per la capacità massima in FP8 e lunghe sessioni multimodali. Il prezzo non è ancora noto: si sconsiglia di preordinare alla cieca prima del lancio.

FAQ

Perché un modello con solo 6B di parametri attivi richiede 96 GB di RAM? Nei modelli Mixture-of-Experts, per ogni token viene caricata solo una parte dei parametri, ma tutti i pesi devono risiedere in memoria. Qwen 3.8 Flash Next ha 125B di parametri principali più 51B di embedding N-Gram. A questo si aggiungono la cache KV per il contesto e l'MTP-Head. Per questo motivo il numero di parametri attivi non è il valore limite per la memoria.

La variante da 512 GB vale i soldi che costa? La configurazione da 512 GB sarà disponibile a fine ottobre 2026, il prezzo non era ancora stato definito al momento della stesura di questo articolo. Conviene se si vogliono utilizzare i pesi in FP8 (GLM 5.3 Flash: ~328 GB) o Qwen a 8-bit (200 GB) senza perdite di quantizzazione. Per l'utilizzo a 4-bit è sufficiente il pacchetto da 256 GB con un 10-15% di buffer.

Posso espandere la RAM in seguito? No, in tutti i sistemi M5 la memoria unificata è saldata e fissa. La decisione di acquisto è quindi definitiva: meglio dimensionare correttamente l'hardware una volta che comprare due volte. Chi è insicuro dovrebbe optare per il taglio superiore, poiché il paging su SSD rallenta notevolmente le prestazioni.

DeepSeek V4 Flash Vision Exp ha lo stesso footprint? Sì, la variante Vision-Exp del 21 agosto si basa sull'architettura 284B/13B del V4 Flash ed è listata con condizioni API identiche. L'input di immagini e video aumenta il carico sulla cache KV, pertanto ai 160 GB di peso del modello occorre aggiungere un buffer di contesto di 10-20 GB.

Quando l'inferenza locale è più veloce dell'API? Con batch size ridotti e un frequente riutilizzo (repeat-usage) sullo stesso prefisso, un Mac Studio da 256 GB con larghezza di banda di 1,2 TB/s può massimizzare i token al secondo. Tuttavia, anche la classe Flash in hosting è molto veloce e non ha tempi di caricamento tra le sessioni: per la maggior parte dei developer, l'API rimane l'approccio più pragmatico.

Fonti

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h