Local AI

LLM open-weight attuali e l'hardware su cui girano (settembre 2026)

LLM open-weight attuali e l'hardware su cui girano (settembre 2026)

A luglio, la nostra guida Best Open-Weight LLMs 2026 presentava i migliori modelli aperti del momento: Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4 e Mistral. Da allora è successo tanto. Tre nuovi modelli Flash hanno stravolto il panorama dell'auto-hosting, e un modello da 2,5 miliardi di parametri oggi batte concorrenti quattro volte più grandi. Questo articolo fa il punto a settembre 2026 — e risponde alla domanda che la guida lasciava volutamente aperta: su quale hardware gira davvero?

I tre modelli Flash di settembre 2026

ModelloArchitetturaAttivi per tokenContestoLicenzaRilascio
GLM-5.3-Flash (Z.ai)320B MoE, attenzione ibrida lineare+sparse~18B1MMIT26.08.2026
DeepSeek V4.1 Flash552B MoE + Engram n-gram~14B1MMIT10.09.2026
Qwen3.8-Flash-Next (Alibaba)125B MoE + 51B n-gram, Gated DeltaNet~6B262K nativo, 1M con YaRNQwen Community28.08.2026

Tutti e tre sono modelli mixture-of-experts che attivano solo una frazione dei loro parametri per token — è l'unica ragione per cui girano su hardware consumer. Le differenze stanno nel dettaglio.

GLM-5.3-Flash è il miglior programmatore open-weight della classe Flash: Terminal-Bench 2.1 a 84,3, DeepSWE v1.1 a 63,4. Z.ai ha pubblicato i pesi MIT il 26 agosto — lo stesso giorno in cui il modello fin allora anonimo «Ox Alpha» è stato identificato. Il neo per l'auto-hosting: i pesi FP8 nativi pesano circa 306 GiB, una macchina da 128 GB non basta.

DeepSeek V4.1 Flash (aperto dal 10 settembre) non è un'iterazione di V4 Flash ma una ricostruzione: tokenizer proprio, grafo di inferenza proprio, 189 GiB di tabelle Engram che nel pacchetto Q2 restano su SSD mentre 152 GiB di pesi principali girano in memoria. Sul prezzo è la occasione: 0,15 $ di input / 0,60 $ di output per milione di token (fuori picco).

Qwen3.8-Flash-Next è il checkpoint di anteprima dell'architettura Qwen4: un modello principale da 125B più uno strato di embedding n-gram da 51B, solo ~6B di parametri attivi, con input immagine e video nativi. 262K di contesto nativo, estendibile a 1M con YaRN — ma quella configurazione YaRN diventa poi un problema di deployment tuo, non del fornitore.

La matrice hardware: cosa entra davvero dove

La risposta onesta a «quale hardware?» dipende dalla quantizzazione. I quant della community di settembre 2026 disegnano un quadro chiaro:

Laptop e desktop (16–64 GB): qui regna Qwen3.8-27B (Apache 2.0, ~19 GB a 4-bit, input immagine e video nativi), numero uno di diverse classifiche di settembre. MiniCPM5-2B (Apache 2.0, ~2,4 GB in GGUF Q4) è la sorpresa: 131K di contesto, 69,1 su LiveCodeBench v6 — con 2,52B di parametri batte Qwen3.5-4B di quasi 13 punti. Per lavoro agentico con tool-calling a basso costo è la strada locale conveniente.

128 GB (Mac Studio, workstation): Qwen3.8-Flash-Next in conversione MLX 4-bit (112 GB) è il nuovo favorito — circa 49 tok/s stimati su un M5 Max, perché scorrono solo 6B di parametri per token. GLM-5.3-Flash entra per un pelo come quant 3-bit (120 GB). DeepSeek V4.1 Flash passa di qui con streaming SSD: il pacchetto ds4 (Metal) tiene 152 GiB di pesi principali residenti e legge le tabelle Engram da SSD.

DGX Spark (1× 128 GB unified): tre quant della community portano GLM-5.3-Flash su una singola Spark — la ricetta più completa (EXL3 2,05 bpw + drafter DFlash2) decodifica output strutturato a 64,1 tok/s (mediana su 5 run), la prosa a ~30 tok/s. DeepSeek V4.1 Flash in EXL3 1,59 bpw gira anch'esso su una Spark: 15–17 tok/s a freddo, fino a ~25 tok/s con cache di prefisso. Una Spark basta per entrambi — con perdite di qualità documentate nei rispettivi receipt di fedeltà KLD-vs-BF16.

2–4× DGX Spark: il punto dolce per il serio. GLM-5.3-Flash in EXL3 4 bpw su 2× Spark (TP2): 48–52 tok/s sul codice, 19 tok/s sulla prosa, contesto 1M. DeepSeek V4.1 Flash su 4× Spark (TP4): 40,5 tok/s in flusso singolo con il checkpoint ufficiale da 510 GB, e i quant della community (EXL3 3,5 bpw) spingono a ~61 tok/s con un pool KV da 3,4M token a 1M di contesto.

Nodo multi-GPU (8× H200 ecc.): da qui in su tutti e tre girano in qualità FP8/BF16 nativa. GLM-5.3-Flash richiede in pratica un nodo da 8 GPU come minimo; DeepSeek V4.1 Flash vuole almeno 2× H200; Qwen3.8-Flash-Next resta il più flessibile con la sua impronta più piccola.

Cosa è cambiato da luglio — in tre frasi

Primo: la classe Flash (18B attivi e meno) ha raggiunto la soglia di qualità in cui l'auto-hosting diventa serio per i workload agentici — GLM-5.3-Flash si colloca nel coding agentico davanti a buona parte di ciò che prima sapevano fare solo i modelli via API. Secondo: le tabelle Engram n-gram (DeepSeek, Qwen) hanno stabilito il nuovo schema di progetto — enormi tabelle di lookup restano su SSD, solo i pesi caldi sono residenti. Terzo: le licenze sono divergenti — MIT (GLM-5.3-Flash, DeepSeek), Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss), Qwen Community (Flash-Next) e una licenza personalizzata sul flagship GLM-5.3. Da verificare prima di qualsiasi deployment commerciale.

Domande frequenti

Quale modello è il miglior punto di ingresso nell'hosting locale di LLM a settembre 2026? Per la maggior parte delle persone: Qwen3.8-27B. Apache 2.0, ~19 GB a 4-bit, gira su Ollama, LM Studio, llama.cpp e vLLM, input immagine e video nativi, e domina le classifiche open-source della sua categoria. Non c'è alcun buon motivo per iniziare in modo più costoso o scomodo.

Servono davvero 8 GPU per GLM-5.3-Flash? No — ma per la piena qualità, sì. I pesi FP8 nativi (~306 GiB) richiedono in pratica un nodo da 8 GPU. Su un Mac da 128 GB o una DGX Spark girano quant della community (3-bit o EXL3 2,05 bpw) con misurazioni di fedeltà documentate rispetto al BF16. La perdita di qualità è misurabile ma accettabile per chat e workload agentici.

Qual è la differenza tra Qwen3.8-Flash (API) e Qwen3.8-Flash-Next? qwen3.8-flash è il servizio API su QwenCloud con 1M di contesto di serie. Qwen3.8-Flash-Next è il checkpoint aperto alle sue spalle — con 262K di contesto nativo. Se vuoi YaRN a 1M lo configuri tu; se vuoi la semplicità, usa l'API.

DeepSeek V4.1 Flash gira su un singolo dispositivo da 128 GB? Sì, con compromessi. Su Mac via ds4 con streaming SSD delle tabelle Engram (Q2: 152 GiB residenti). Su DGX Spark in EXL3 1,59 bpw a 15–25 tok/s. Nulla di paragonabile a un setup 4× Spark (TP4, 40–61 tok/s) — ma gira.

Quale licenza è la più semplice per l'uso commerciale? Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss) e MIT (GLM-5.3-Flash, DeepSeek V4.1 Flash) sono praticamente senza restrizioni commerciali. La licenza Qwen Community del checkpoint Flash-Next e la licenza personalizzata del flagship GLM-5.3 hanno condizioni — da leggere prima di un deployment in produzione.

La guida di luglio resta valida? Sì, come quadro delle famiglie consolidate (Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4). Questo articolo aggiunge la generazione Flash di agosto/settembre 2026. Per il nostro approccio all'IA locale in produzione, vedere Context Studios Local AI.

Sources

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h