A luglio, la nostra guida Best Open-Weight LLMs 2026 presentava i migliori modelli aperti del momento: Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4 e Mistral. Da allora è successo tanto. Tre nuovi modelli Flash hanno stravolto il panorama dell'auto-hosting, e un modello da 2,5 miliardi di parametri oggi batte concorrenti quattro volte più grandi. Questo articolo fa il punto a settembre 2026 — e risponde alla domanda che la guida lasciava volutamente aperta: su quale hardware gira davvero?
I tre modelli Flash di settembre 2026
| Modello | Architettura | Attivi per token | Contesto | Licenza | Rilascio |
|---|---|---|---|---|---|
| GLM-5.3-Flash (Z.ai) | 320B MoE, attenzione ibrida lineare+sparse | ~18B | 1M | MIT | 26.08.2026 |
| DeepSeek V4.1 Flash | 552B MoE + Engram n-gram | ~14B | 1M | MIT | 10.09.2026 |
| Qwen3.8-Flash-Next (Alibaba) | 125B MoE + 51B n-gram, Gated DeltaNet | ~6B | 262K nativo, 1M con YaRN | Qwen Community | 28.08.2026 |
Tutti e tre sono modelli mixture-of-experts che attivano solo una frazione dei loro parametri per token — è l'unica ragione per cui girano su hardware consumer. Le differenze stanno nel dettaglio.
GLM-5.3-Flash è il miglior programmatore open-weight della classe Flash: Terminal-Bench 2.1 a 84,3, DeepSWE v1.1 a 63,4. Z.ai ha pubblicato i pesi MIT il 26 agosto — lo stesso giorno in cui il modello fin allora anonimo «Ox Alpha» è stato identificato. Il neo per l'auto-hosting: i pesi FP8 nativi pesano circa 306 GiB, una macchina da 128 GB non basta.
DeepSeek V4.1 Flash (aperto dal 10 settembre) non è un'iterazione di V4 Flash ma una ricostruzione: tokenizer proprio, grafo di inferenza proprio, 189 GiB di tabelle Engram che nel pacchetto Q2 restano su SSD mentre 152 GiB di pesi principali girano in memoria. Sul prezzo è la occasione: 0,15 $ di input / 0,60 $ di output per milione di token (fuori picco).
Qwen3.8-Flash-Next è il checkpoint di anteprima dell'architettura Qwen4: un modello principale da 125B più uno strato di embedding n-gram da 51B, solo ~6B di parametri attivi, con input immagine e video nativi. 262K di contesto nativo, estendibile a 1M con YaRN — ma quella configurazione YaRN diventa poi un problema di deployment tuo, non del fornitore.
La matrice hardware: cosa entra davvero dove
La risposta onesta a «quale hardware?» dipende dalla quantizzazione. I quant della community di settembre 2026 disegnano un quadro chiaro:
Laptop e desktop (16–64 GB): qui regna Qwen3.8-27B (Apache 2.0, ~19 GB a 4-bit, input immagine e video nativi), numero uno di diverse classifiche di settembre. MiniCPM5-2B (Apache 2.0, ~2,4 GB in GGUF Q4) è la sorpresa: 131K di contesto, 69,1 su LiveCodeBench v6 — con 2,52B di parametri batte Qwen3.5-4B di quasi 13 punti. Per lavoro agentico con tool-calling a basso costo è la strada locale conveniente.
128 GB (Mac Studio, workstation): Qwen3.8-Flash-Next in conversione MLX 4-bit (112 GB) è il nuovo favorito — circa 49 tok/s stimati su un M5 Max, perché scorrono solo 6B di parametri per token. GLM-5.3-Flash entra per un pelo come quant 3-bit (120 GB). DeepSeek V4.1 Flash passa di qui con streaming SSD: il pacchetto ds4 (Metal) tiene 152 GiB di pesi principali residenti e legge le tabelle Engram da SSD.
DGX Spark (1× 128 GB unified): tre quant della community portano GLM-5.3-Flash su una singola Spark — la ricetta più completa (EXL3 2,05 bpw + drafter DFlash2) decodifica output strutturato a 64,1 tok/s (mediana su 5 run), la prosa a ~30 tok/s. DeepSeek V4.1 Flash in EXL3 1,59 bpw gira anch'esso su una Spark: 15–17 tok/s a freddo, fino a ~25 tok/s con cache di prefisso. Una Spark basta per entrambi — con perdite di qualità documentate nei rispettivi receipt di fedeltà KLD-vs-BF16.
2–4× DGX Spark: il punto dolce per il serio. GLM-5.3-Flash in EXL3 4 bpw su 2× Spark (TP2): 48–52 tok/s sul codice, 19 tok/s sulla prosa, contesto 1M. DeepSeek V4.1 Flash su 4× Spark (TP4): 40,5 tok/s in flusso singolo con il checkpoint ufficiale da 510 GB, e i quant della community (EXL3 3,5 bpw) spingono a ~61 tok/s con un pool KV da 3,4M token a 1M di contesto.
Nodo multi-GPU (8× H200 ecc.): da qui in su tutti e tre girano in qualità FP8/BF16 nativa. GLM-5.3-Flash richiede in pratica un nodo da 8 GPU come minimo; DeepSeek V4.1 Flash vuole almeno 2× H200; Qwen3.8-Flash-Next resta il più flessibile con la sua impronta più piccola.
Cosa è cambiato da luglio — in tre frasi
Primo: la classe Flash (18B attivi e meno) ha raggiunto la soglia di qualità in cui l'auto-hosting diventa serio per i workload agentici — GLM-5.3-Flash si colloca nel coding agentico davanti a buona parte di ciò che prima sapevano fare solo i modelli via API. Secondo: le tabelle Engram n-gram (DeepSeek, Qwen) hanno stabilito il nuovo schema di progetto — enormi tabelle di lookup restano su SSD, solo i pesi caldi sono residenti. Terzo: le licenze sono divergenti — MIT (GLM-5.3-Flash, DeepSeek), Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss), Qwen Community (Flash-Next) e una licenza personalizzata sul flagship GLM-5.3. Da verificare prima di qualsiasi deployment commerciale.
Domande frequenti
Quale modello è il miglior punto di ingresso nell'hosting locale di LLM a settembre 2026? Per la maggior parte delle persone: Qwen3.8-27B. Apache 2.0, ~19 GB a 4-bit, gira su Ollama, LM Studio, llama.cpp e vLLM, input immagine e video nativi, e domina le classifiche open-source della sua categoria. Non c'è alcun buon motivo per iniziare in modo più costoso o scomodo.
Servono davvero 8 GPU per GLM-5.3-Flash? No — ma per la piena qualità, sì. I pesi FP8 nativi (~306 GiB) richiedono in pratica un nodo da 8 GPU. Su un Mac da 128 GB o una DGX Spark girano quant della community (3-bit o EXL3 2,05 bpw) con misurazioni di fedeltà documentate rispetto al BF16. La perdita di qualità è misurabile ma accettabile per chat e workload agentici.
Qual è la differenza tra Qwen3.8-Flash (API) e Qwen3.8-Flash-Next? qwen3.8-flash è il servizio API su QwenCloud con 1M di contesto di serie. Qwen3.8-Flash-Next è il checkpoint aperto alle sue spalle — con 262K di contesto nativo. Se vuoi YaRN a 1M lo configuri tu; se vuoi la semplicità, usa l'API.
DeepSeek V4.1 Flash gira su un singolo dispositivo da 128 GB? Sì, con compromessi. Su Mac via ds4 con streaming SSD delle tabelle Engram (Q2: 152 GiB residenti). Su DGX Spark in EXL3 1,59 bpw a 15–25 tok/s. Nulla di paragonabile a un setup 4× Spark (TP4, 40–61 tok/s) — ma gira.
Quale licenza è la più semplice per l'uso commerciale? Apache 2.0 (Qwen3.8-27B, MiniCPM5-2B, gpt-oss) e MIT (GLM-5.3-Flash, DeepSeek V4.1 Flash) sono praticamente senza restrizioni commerciali. La licenza Qwen Community del checkpoint Flash-Next e la licenza personalizzata del flagship GLM-5.3 hanno condizioni — da leggere prima di un deployment in produzione.
La guida di luglio resta valida? Sì, come quadro delle famiglie consolidate (Qwen3.5, GLM-5.2, gpt-oss, DeepSeek-V4, Gemma 4). Questo articolo aggiunge la generazione Flash di agosto/settembre 2026. Per il nostro approccio all'IA locale in produzione, vedere Context Studios Local AI.
Sources
- Yotta Labs: DeepSeek V4 Flash vs GLM 5.3 Flash vs Qwen Flash-Next (2026)
- Regolo: DeepSeek V4 Flash vs Qwen3.8-Flash-Next vs GLM-5.3-Flash — quality-to-price 2026
- LLMCheck: State of Open-Source Local LLMs, September 2026
- vcruz305: GLM-5.3-Flash-EXL3-K2 (Hugging Face, misurazioni single-Spark)
- Market Intelligence Research: GLM-5.3-Flash on a single DGX Spark — three community quantizations
- NVIDIA Developer Forums: DeepSeek-V4.1-Flash EXL3 2.9 bpw on 2× DGX Sparks
- NVIDIA Developer Forums: DeepSeek-V4.1-Flash is now open-sourced (TP4 measurements)
- vcruz305: DeepSeek-V4.1-Flash-EXL3-DGX-Spark-recipe (single Spark)
- bot-lab-21: DeepSeek-V4.1-Flash-EXL3-3.5bpw-Pollard (4× Spark TP4)
- dwarfstar.sh: ds4 September 2026 — DeepSeek V4.1 and Qwen3.8 Flash Next on Metal
- Dev.to: GLM-5.3-Flash vs Qwen3.8-Flash-Next vs DeepSeek V4 Flash — benchmark tier
- Fernando Nog: DeepSeek-V4.1-Flash vs GLM-5.3-Flash vs Qwen3.8-Flash — API pricing snapshot
- CourionAI: MiniCPM5-2B — a 2.5B model beats bigger rivals
- Local Inference Lab: RTX 6000 Pro daily summaries — DSV4.1 EXL3, Qwen 3.8 Flash Next vLLM configs