AI locale

L'ondata ibrida di AMD: Lucebox, ACEMAGIC e Minisforum a confronto con Mac Studio e DGX Spark

L'ondata ibrida di AMD: Lucebox, ACEMAGIC e Minisforum a confronto con Mac Studio e DGX Spark

I numeri sono brutali: 224 GB di memoria AI per circa 8.700 € da una parte, 512 GB per circa 15.500 € stimati dall'altra — e in mezzo un'intera ondata di nuovi sistemi AMD che promettono tutti la stessa cosa: far girare grandi modelli linguistici in locale senza un budget da server NVIDIA. Mentre il Mac Studio M5 Ultra di Apple con 512 GB attende ancora il suo lancio («fine ottobre»), il fronte AMD è già qui: Lucebox spedisce in serie workstation ibride con Radeon dedicata, ACEMAGIC vende mini Strix Halo da 192 GB (shop UE con spedizione da magazzino tedesco), e Minisforum fornisce con l'MS-S1 Max più i dock eGPU il kit da montare da soli. Abbiamo smontato l'intera ondata — architettura, bandwidth, prezzo al gigabyte, la trappola software di cui quasi nessuno parla — e rifatto i conti contro il nostro database di ricette con 428 configurazioni della community misurate: quali delle 65 famiglie di modelli catalogate girano davvero su quale sistema?

Lo schema dietro tutto: tre strade verso la memoria fluida

Chi inferisce grandi modelli non combatte per i FLOPS, ma per la memoria: capacità (il modello ci sta?) e bandwidth (quanto velocemente arrivano i pesi per token?). Nel 2026 ci sono esattamente tre risposte:

Strada 1 — solo memoria unificata. Le APU Strix Halo di AMD (Ryzen AI Max 385/390, Max+ 395, Max+ PRO 495) saldano la LPDDR5X direttamente sul chip: fino a 192 GB condivisi tra CPU e Radeon integrata. Bandwidth: ~256–273 GB/s. Nessun collo di bottiglia da VRAM, ma nemmeno una scorciatoia più veloce — ogni token legge dallo stesso pool.

Strada 2 — split ibrido. Qui una scheda grafica dedicata (AMD Radeon AI PRO R9700, 32 GB GDDR6 a 640 GB/s) entra nella stessa macchina, e un software specializzato divide il modello: le parti «calde» — layer densi, il drafter del decoding speculativo, gli expert di mixture-of-experts instradati di frequente — girano nella VRAM veloce, la «lunga coda» degli expert nella grande memoria unificata. È esattamente ciò che fa Lucebox con la sua engine; il principio funziona anche con strumenti standard, ma richiede lavoro manuale.

Strada 3 — il monolite di Apple. Il Mac Studio M5 Ultra con 512 GB di memoria unificata e ~1,2 TB/s di bandwidth (secondo Apple, +50% rispetto all'M3 Ultra) combina capacità e velocità in un solo sistema — senza logica di split, ma a un prezzo premium.

La domanda interessante non è quale strada sia «giusta», ma quanto costa ogni strada per euro — e quale modello ci sta davvero. E lì i conti sono sorprendenti.

I protagonisti nel dettaglio

Lucebox Zero 495 — il pioniere ibrido di Milano

Lucebox (fondata nel 2025, circa 2–10 persone, partnership AMD ufficiale) abbina il Ryzen AI MAX+ PRO 495 con fino a 192 GB di LPDDR5X-8533 (273 GB/s) a una Radeon AI PRO R9700 (32 GB GDDR6, 640 GB/s) in un case in alluminio da 11,97 litri con alimentatore Platinum da 1.000 W. Ubuntu Server preinstallato, Lucebox Engine e modelli configurati, API compatibile OpenAI/Anthropic dal primo avvio.

I prezzi di lancio (prime 200 unità, 1.000 € sotto il prezzo di listino): 6.499 € per la configurazione Developer con 128 GB + 2 TB; il livello 192 GB costa 2.199 € in più — quindi circa 8.700 € per la configurazione completa a 224 GB di memoria totale. Un kit cluster opzionale da 100 GbE (Intel E810, installato in fabbrica) costa 869 € per macchina. Secondo le sue stesse dichiarazioni, DeepSeek V4 Flash (284B) decodifica a 86 tok/s su entrambi i chip — un'affermazione del produttore che non tratteremo come misura finché non esiste una riproduzione indipendente.

Due punti sono critici per la decisione d'acquisto: il Batch 3 è esaurito, il Batch 4 spedisce a novembre 2026 secondo l'azienda — e il co-fondatore Alessandro Puppo ha già annunciato su X un aumento di prezzo. Per i modelli 495 l'azienda indica gennaio 2027 come finestra di consegna. Chi compra qui compra da una startup giovane a equivalente di pagamento anticipato — con la protezione consumatori UE (spedizione dall'Italia) ma senza la copertura di una rete assistenza di gruppo.

ACEMAGIC F9A — 192 GB di Strix Halo in un case da 2 litri

ACEMAGIC vende il Ryzen AI Max+ PRO 495 con i pieni 192 GB di LPDDR5X-8533 e la Radeon 8065S integrata (40 CUs) per 6.399 € (192 GB + 2 TB) — nessuna VRAM dedicata, design puramente a memoria unificata. In cambio: case da 2 litri, TDP di 120 W, 2 anni di garanzia — e nello shop UE (acemagic.eu) spedizione da magazzino tedesco; gli altri shop regionali spediscono dalle proprie sedi. L'inciampo è scritto in piccolo sulla pagina prodotto: «Pre-sale: fine ottobre» — quindi la scatola è esattamente quanto indisponibile come il Studio 512 GB di Apple in questo momento. Come riferimento: senza GPU dedicata il decode resta vincolato ai ~256–273 GB/s dell'APU; la F9A è un sistema Strix Halo pulito con supporto europeo via shop UE, non una macchina miracolosa.

MSI PRO MAX EDGE AI+ — il concetto di «VRAM virtuale»

Il concorrente MSI (Ryzen AI Max+ 395, 128 GB, Radeon 8060S) fa pubblicità con «fino a 96 GB di VRAM» a primo sguardo. Realisticamente: non è una scheda grafica separata, è un'assegnazione da BIOS — fino a 96 GB dei 128 GB di memoria unificata sono assegnati esclusivamente all'iGPU, lasciando 32 GB a sistema e applicazioni. La bandwidth resta ~256 GB/s (LPDDR5X-8000). Il prezzo di ~4.500 € non l'abbiamo verificato noi; il principio architetturale è il punto importante, perché spesso frainteso: qui non c'è un secondo pool di memoria più veloce — solo una partizione dello stesso pool.

Minisforum — il fornitore in kit: MS-S1 Max, DEG1/DEG2 e la strada DIY

Minisforum è l'unico a coprire l'intero spettro — dalla workstation Strix Halo chiavi in mano ai dock liberi:

MS-S1 Max (Ryzen AI Max+ 395, 128 GB LPDDR5X-8000, Radeon 8060S, TDP 130 W, doppio 10 GbE, USB4 v2 a 80 Gbps): lo standard dei test era ~2.639 $ (128 GB + 2 TB), la «Max AI Compute Edition» in store a 3.639–3.799 $ equivalenti. Il suo tratto distintivo rispetto a tutti gli altri mini Strix Halo: uno slot PCIe x16 interno — elettricamente però solo 4.0 x4, la stessa bandwidth di un link OCuLink. È di fatto una versione integrata del dock eGPU.

Dock eGPU DEG1 e DEG2: il DEG1 è un dock OCuLink (PCIe 4.0 x4, 64 GT/s) con slot x16 e ingresso alimentatore ATX per 109–139 $ — omologato ufficialmente fino alla RTX 4090. Il DEG2 aggiunge doppio OCuLink più Thunderbolt 5 (fino a 80 Gbps) e uno slot M.2 integrato. Con una Radeon AI PRO R9700 (prezzo retail secondo le sintesi di mercato ~1.750–1.850 €) e un alimentatore SFX nasce la «Lucebox dei poveri».

E funziona — con attriti documentati. Un build della community accuratamente documentato (mini PC + DEG1 + R9700 via adattatore M.2) raggiunge circa 50–80 tok/s con Qwen 3.8 27B (Q4) sulla R9700 — ben oltre ciò che l'APU da sola fa. I modelli fino a ~160 GB (quantizzazione 3-bit dei grandi MoE) stanno nella macchina solo con 32 GB di VRAM più 128/192 GB di memoria unificata. Ma: l'adattatore M.2 a OCuLink si è rivelato inaffidabile a velocità Gen4 (crash, dropout PCIe) — la strada dock è chiaramente preferibile alla strada adattatore. Questo è lo stato onesto della strada DIY: tecnicamente funzionante, ma di qualità da smanettoni piuttosto che da serie.

RTX 3090 — il classico dell'usato con il miglior affare bandwidth

La RTX 3090 (Ampere, 2020) è sparita dal mercato nuovo, ma sull'usato è ovunque — e ha un asso nella manica: 24 GB di GDDR6X a 936 GB/s, più veloce di qualsiasi scheda discreta in questo confronto (la R9700 si ferma a 640). Usata costa circa 700–900 € — la miglior bandwidth per euro che una singola scheda possa offrire. Gli svantaggi: 24 GB per scheda (i grandi modelli richiedono cluster), 350 W per scheda, nessuna garanzia del nuovo — e Ampere riceve solo parzialmente le ultime funzionalità di quantizzazione e inferenza (infrastruttura NVFP4, percorsi FP8 moderni).

Il nostro database di ricette conta 65 configurazioni sulla 3090 — da schede singole a cluster da 4. I punti culminanti: un cluster 4×3090 decodifica Qwen3.8-27B con DFlash2 fino a 244,8 tok/s — la misura 27B più veloce dell'intero database, più veloce di tutto ciò che Spark o Strix Halo raggiungono. E il trucco CPU-MoE (expert nella RAM di sistema, layer caldi sulle 3090) porta la classe 305B (DeepSeek-V4-Flash, GLM-5.3-Flash, Qwen3.8-Flash-Next) su 2×3090 — il fratello DIY del concetto Lucebox, però a 18–37 tok/s invece della velocità ibrida promessa. Chi possiede già un PC ottiene con una singola 3090 usata l'upgrade più veloce in assoluto.

I sistemi di riferimento: Mac Studio M5 Ultra e NVIDIA DGX Spark

Per contestualizzare, i due sistemi che il nostro database di ricette conosce meglio: il Mac Studio M5 Ultra con 512 GB (36/80) combina la più grande capacità del campo con ~1,2 TB/s di bandwidth — prezzo EDU stimato ~15.400–15.500 € (dedotto dal delta di 96 GB di 3.960 €; il prezzo ufficiale del 512 GB non è ancora pubblicato, disponibilità «fine ottobre»). Il NVIDIA DGX Spark (GB10, 128 GB, ~273 GB/s, ecosistema CUDA) resta l'ingresso più comodo nel mondo NVIDIA, ma a ~45 €/GB è il conto più caro di questa panoramica.

Quali modelli ci stanno davvero? Il calcolo contro 65 famiglie di modelli

I fogli tecnici non dicono nulla sui modelli. Abbiamo quindi rifatto i conti contro il nostro database di ricette — 428 configurazioni della community misurate, 65 famiglie di modelli da 3B a 763B di parametri. Regola pratica: fabbisogno di memoria ≈ parametri × bit/peso ÷ 8, più ~6% di overhead. Capacità utilizzabile: RAM totale meno ~10% per OS e margine KV-cache.

Gli insegnamenti chiave di questo calcolo:

  • La classe 128 GB (DGX Spark, MS-S1 Max, MSI) si ferma a ~180B di parametri in 4-bit (Qwen3.8-Flash-Next 180B-A4B ci sta; DeepSeek-V4-Flash 305B no). In 8-bit il limite è a 99B (Qwen3.5-122B-A10B appena fuori). Le stelle di questa classe: Qwen3.8-Flash-Next, gpt-oss-120B, Nemotron-3-Super-120B — e la famiglia 35B-A3B (Qwen3.6, Agents-A1) a quasi piena precisione.
  • La classe 192 GB (ACEMAGIC F9A) fa stare DeepSeek-V4-Flash (305B) interamente in 4-bit, e MiniMax-M3 (428B), Qwen3.5 (397B) in 3-bit. L'8-bit sale fino a ~124B (Ling-3.0-flash, gpt-oss-120B).
  • Lucebox 224 GB (192+32 ibrido) somma i due mondi: 4-bit fino a 305B come la F9A, ma con i layer caldi in più a 640 GB/s — e in 3-bit fino al GLM-5.1 (478B). È l'unica strada per superare i modelli da 500B+ (Kimi-K2.6 519B) che non sia il 2-bit.
  • I cluster RTX 3090 (48/96 GB di VRAM) raggiungono nativamente lo stesso limite di 180B in 4-bit della classe 128 GB UMA — ma con 3,4× la bandwidth per scheda (936 GB/s). La classe 305B passa solo con il trucco CPU-MoE (18–37 tok/s documentati). In cambio, il database detiene la misura 27B più veloce in assoluto: 244,8 tok/s su 4×3090. Chi vuole solo la scheda più veloce compra una 3090 usata: 24 GB a 936 GB/s per meno di 1.000 €.
  • Il Mac Studio 512 GB prende tutto: tutte le 65 famiglie del database — fino a DeepSeek-V4.1-Flash (763B), GLM-5.2 (753B) e GLM-5.3 (743B) — in 4-bit. Perfino Kimi-K2.6 (519B) in 8-bit. In 2-bit 519B+ sta con un resto enorme per il KV-cache. Chi vuole far girare le generazioni flash attuali da 300–760B (GLM-5.3-Flash, DeepSeek-V4-Flash, Qwen3.8-Flash-Next) senza quantizzazione o in 8-bit ha bisogno della classe 512 GB — punto.

Un secondo sguardo dietro: questo calcolo dice solo «ci sta». Se sia veloce lo decide la bandwidth — e lì il Mac 512 GB vince ancora, perché 1,2 TB/s supera di quattro volte ogni decode 4-bit della classe 273 GB/s. I sistemi ibridi si comprano la velocità nella VRAM, ma solo per la parte del modello che lì risiede.

Il conto onesto: euro per gigabyte di memoria AI

SistemaMemoria AI totaleBandwidth realePrezzo (circa)€/GB
Minisforum MS-S1 Max128 GB (UMA)~256 GB/s~3.600–3.800 $ (128 GB)~29 $
MSI PRO MAX EDGE AI+128 GB (UMA, fino a 96 GB all'iGPU)~256 GB/s~4.500 € (non verificato)~35 €
ACEMAGIC F9A192 GB (UMA)256–273 GB/s6.399 €~33 €
Lucebox Zero 495 (192)224 GB (192 UMA + 32 VRAM)640 GB/s (VRAM) + 273 GB/s (UMA)~8.700 €~39 €
RTX 3090 (usata, 1×)24 GB (VRAM)936 GB/s~800 € (solo scheda)~33 € (solo scheda)
Cluster RTX 3090 (2× / 4×, usate)48 / 96 GB (VRAM)936 GB/s per scheda~3.100 / ~5.700 € (completo)~65 / ~59 € (completo)
NVIDIA DGX Spark128 GB (UMA, CUDA)~273 GB/s~4.000–5.000 $ ingresso~45 $
Mac Studio M5 Ultra 512512 GB (UMA)~1.200 GB/s~15.400–15.500 € EDU (stimato)~30 €

Tre letture di questa tabella. Primo — i concetti ibridi pagano la loro scheda discreta a 640 GB/s con il peggior valore €/GB, ma ottengono l'unica possibilità di usare entrambi i tipi di memoria in parallelo. Secondo — il Studio 512 GB di Apple è, al gigabyte, più economico di qualsiasi box AMD con meno memoria, pur essendo il sistema complessivamente più costoso; la bandwidth allarga ulteriormente il divario. Terzo — Minisforum è la corona qualità-prezzo della classe Strix Halo, ma senza VRAM dedicata e (sullo slot x16) senza più di x4.

La trappola software che quasi tutti ignorano

L'hardware è metà della strada. Il software standard — llama.cpp, PyTorch, ROCm classico — vede due pool di memoria separati in un sistema ibrido e non sa cosa farci. Lucebox lo risolve con una engine proprietaria i cui kernel tarati a mano sono calibrati esattamente sul proprio hardware (il repository core è visibile su GitHub, non la taratura fine). Sulla strada DIY bisogna configurare lo split da soli — la documentazione della community mostra che è possibile, ma è ingegneria, non plug-and-play.

Sul lato Apple lo stack è più maturo: MLX e TensorFold consegnano inferenza ottimizzata e identica al byte su memoria unificata senza alcun intervento dell'utente — il nostro stesso stress test della ricetta MiaAI TensorFold su 2× DGX Spark ha riprodotto i numeri della ricetta entro ±5% (e il database di ricette porta i numeri freschi: GSM8K 98,8%, HumanEval 95,7% sull'engine v1.5 attuale). ROCm su RDNA4 e Strix Halo è molto meglio nel 2026 che nel 2025, ma resta l'ecosistema più giovane del campo.

Onestà su rischi e acquisto

  • Il rischio startup è reale: Lucebox è giovane (Batch 3 esaurito, Batch 4 solo a novembre, aumento di prezzo annunciato, consegna 495 a gennaio 2027). Chi vuole testarlo dovrebbe seguire la strategia «box di test»: una macchina, aspettare, poi scalare — e pagare con una carta di credito con protezione chargeback.
  • Pre-sale significa pre-sale: la ACEMAGIC F9A è «fine ottobre» — esattamente la stessa finestra d'attesa del Studio 512 GB di Apple. Nessuna di queste box sarà domani su uno scaffale.
  • L'episodio di aprile è l'avvertimento: Apple ha ritirato completamente dal mercato l'opzione 512 GB dello Studio precedente ad aprile 2026 (penuria di memoria) e a settembre ha replicato con «mesi di fornitura ristretta». Per la nuova configurazione 512 GB significa: chi la vuole deve essere veloce allo sblocco. Per questo facciamo girare un sistema di sorveglianza a quattro canali con allarme in ≤5 minuti — il lancio è un segnale «adesso», non «questo trimestre».
  • ToS e limiti: tutto qui è leggere, confrontare e comprare da soli. Niente auto-checkout, niente bot — la catena di allarme con push Telegram, ntfy ed e-mail con link tap-to-order basta.

Per chi è cosa?

  • Un solo modello, massimo offline, ecosistema Apple — o l'intera generazione flash 300B+: Mac Studio M5 Ultra 512. Nessun altro sistema consegna 512 GB a 1,2 TB/s; al gigabyte è perfino l'opzione più economica della tabella, ed è l'unico che ingoia ogni famiglia di modelli del database in 4-bit.
  • Ricette x86/ROCm, Linux, kit cluster, DeepSeek-V4-Flash in 4-bit: Lucebox Zero 495 (livello 192 GB) — l'unico ibrido di serie con VRAM dedicata. Ma prima come box di test dopo recensioni indipendenti, non come prepagamento cluster.
  • Miglior €/GB in Strix Halo, supporto europeo, 305B/4-bit basta: ACEMAGIC F9A — se si può vivere con 273 GB/s e senza VRAM dedicata.
  • PC esistente + bandwidth massima per meno di 1.000 €: una RTX 3090 usata (24 GB, 936 GB/s) — e chi vuole un cluster trova nel nostro database la misura 27B più veloce in assoluto (244,8 tok/s su 4×3090). Il prezzo: corrente (350 W/scheda), rumore e rischio del mercato dell'usato.
  • Montarsi da soli, sperimentare, Strix Halo budget: Minisforum MS-S1 Max (chiavi in mano) o MS-S1/DEG1/DEG2 + R9700 (DIY) — la strada con il massimo effetto di apprendimento e il secondo peggior comfort.
  • Ecosistema CUDA, stack agent, varietà di ricette: DGX Spark — il nostro veicolo quotidiano; la maturità software batte il brutto conto €/GB.

FAQ

Quali modelli girano concretamente sulla classe 128 GB (DGX Spark, MS-S1 Max)? Secondo il calcolo di capacità: in 4-bit (EXL3/NVFP4/MLX) tutto fino a Qwen3.8-Flash-Next (180B-A4B) — cioè l'intera famiglia 35B-A3B (Qwen3.6, Agents-A1, Qwen-AgentWorld), Gemma 4 (26B/31B), Qwen3.8-27B, gpt-oss-120B, Nemotron-3-Super-120B-A12B e Qwen3.5-122B-A10B. La classe 305B (DeepSeek-V4-Flash, GLM-5.3-Flash, MiMo-V2.6) gira solo in quantizzazioni 2-bit con una perdita di qualità netta. In 8-bit si ferma a Qwen3.5-122B-A10B (99B) — appena prima. Questo corrisponde al nostro database di ricette: 45 famiglie su 65 hanno ricette 4-bit documentate su questa classe.

Il numero Lucebox (86 tok/s su DeepSeek V4 Flash 284B) è credibile? Il numero viene dal produttore ed è tecnicamente plausibile — un MoE da 284B ha un piccolo nucleo attivo che sta bene sulla carta a 640 GB/s — ma non è ancora riprodotto indipendentemente. Il calcolo architetturale (layer caldi in VRAM veloce, lunga coda in memoria unificata) è coerente, e un build della community della stessa combinazione raggiunge 50–80 tok/s su un modello denso da 27B. Trattiamo gli 86 tok/s come affermazione del produttore, non come misura, fino al primo test indipendente.

Perché non posso semplicemente montare un'APU Strix Halo con una scheda grafica normale su una scheda madre standard? Perché la parte decisiva del concetto Strix Halo è la LPDDR5X saldata: l'APU non ha socket AM5, e la piena bandwidth nasce solo quando i chip di memoria stanno a millimetri dal Die. Le barrette DDR5 infilabili ne raggiungono una frazione. Le uniche vie reali sono i sistemi chiavi in mano (Lucebox, ACEMAGIC, MSI, Minisforum MS-S1 Max con slot x4) o la costruzione a dock (Minisforum DEG1/DEG2 con alimentatore separato) — una scheda madre DIY classica con entrambi i mondi non esiste.

La funzione «Avvisami» di Apple basta per ottenere la versione 512 GB? No, non per questo scenario. I watcher di Apple lavorano a livello di categoria prodotto e con ritardo; chi vuole una configurazione precisa che sarà scarsa al lancio — e per la quale Apple ha mostrato ad aprile 2026 che può ritirarla interamente dal mercato — ha bisogno di un allarme a livello URL e configuratore. Un watcher costruito in casa (un cron job che controlla gli URL d'ordine ogni pochi minuti, più l'analisi del JSON del configuratore) batte ogni strumento standard perché sorveglia esattamente una SKU invece di un catalogo.

Cosa significa realmente lo slot PCIe x16 interno del Minisforum MS-S1 Max? Fisicamente x16, elettricamente PCIe 4.0 x4 — la stessa bandwidth di un dock OCuLink. Per l'inferenza è accettabile: i pesi migrano una volta nella VRAM, poi il decode gira dalla memoria locale della carta; solo il caricamento del modello e la sincronizzazione dello split usano il link. Per il gaming con carte da 200 W è comunque utilizzabile, ma lo slot è dimensionato spazialmente e termicamente per carte compatte — i limiti stanno nei test.

La RTX 3090 ha «solo» 24 GB — perché sta comunque nel confronto? Perché per euro è la scheda più veloce del campo: 936 GB/s di bandwidth — più della R9700 (640) e più del triplo delle APU Strix Halo — sull'usato a circa 700–900 €. Per chi ha già un PC è l'upgrade più veloce in assoluto; in cluster (2×/4×) il database detiene la misura 27B più veloce (244,8 tok/s su 4×3090). I limiti sono dichiarati onestamente: 24 GB per scheda, 350 W di consumo, mercato dell'usato senza garanzia, e la classe 305B richiede il trucco CPU-MoE (18–37 tok/s) invece della capacità nativa.

Quale sistema è quindi il migliore per l'AI locale? Non esiste un «migliore», solo un «più adatto»: capacità e velocità insieme solo per la gente del Mac Studio 512 GB; gli ibridi AMD comprano flessibilità (x86, ROCm, Linux) al prezzo del lavoro software e del rischio startup; Minisforum è l'angolo budget e smanettoni; il DGX Spark resta la strada comfort CUDA. La decisione dovrebbe basarsi su tok/s misurati per il proprio spettro di modelli, non sulla tabella di marketing — il nostro database di ricette già consegna tali misure per i sistemi Apple e NVIDIA; le novità AMD di questo articolo sono lì ancora aperte.

Sources

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h