---
type: "BlogPosting"
title: "Un modello, sei livelli di hardware — cosa abbiamo misurato"
description: "Qwen3.8-Flash-Next dalla RTX 3090 alla RTX PRO 6000: tutte le misurazioni fianco a fianco. Perché i salti non sono lineari e il prefill la ricompensa segreta."
resource: "https://www.contextstudios.ai/it/blog/un-modello-sei-livelli-di-hardware-cosa-abbiamo-misurato"
language: "it"
tags: ["Local AI", "Self-Hosting", "LLM", "Benchmark", "Hardware"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-05T10:19:02.240Z"
status: "stable"
---

# Un modello, sei livelli di hardware — cosa abbiamo misurato

Published: 2026-10-01
Tags: Local AI, Self-Hosting, LLM, Benchmark, Hardware

![Un modello, sei livelli di hardware — cosa abbiamo misurato](https://wary-platypus-754.convex.cloud/api/storage/fd44c980-03b7-4339-9a17-396604db19c0)

Quanto è veloce uno stesso modello su hardware diverso? E cosa si perde lungo la strada? Abbiamo messo fianco a fianco tutte le ricette Qwen3.8-Flash-Next del nostro database — dalla RTX 3090 al nodo RTX PRO 6000. Il risultato è la risposta più onesta possibile alla domanda «quale hardware mi serve?» — una tabella di misurazioni, non una slide di marketing.

## Il modello in 30 secondi

Qwen3.8-Flash-Next è il checkpoint di anteprima aperto verso Qwen4: un modello principale da 125B più uno strato di embedding n-gram da 51B (in parte tenuto su SSD), solo ~6B di parametri attivi per token, input immagine e video nativi, 262K di contesto (1M via YaRN). Il basso numero di parametri attivi lo rende il candidato di prova ideale per i livelli di hardware: gira su quasi tutto — ma a che velocità, questa è la differenza.

## La serie di misurazioni: sei livelli, un modello

Tutti i valori: migliore decode in stream singolo per ricetta, carico prosa in preferenza, dal database di ricette (creatore citato):

| Livello | Setup | Quant | tok/s (typ) | Ricetta di |
|---|---|---|---|---|
| RTX 3090 (1×) | EXL3 2,5 bpw | 41,5 GiB | ~38,6* | r0b0tlab |
| RTX 3090 (2×) | GGUF Q4, CPU-MoE | UD-Q4_K_XL | 36,8 | club3090 |
| RTX 5090 (1×) | GGUF Q2, CPU-MoE | UD-Q2_K_XL | ~59,7 | notwitcheer |
| DGX Spark (1×) | NVFP4 + KV FP8 | 6,78 bpw | 48,7 | MiaAI-Lab |
| DGX Spark (2×) | NVFP4 TP2 | 8,49 bpw | 54,4 | MiaAI-Lab |
| Mac Studio M4 Max | oMLX, MTP6 | oQ4e | ~83** | weschera |
| RTX PRO 6000 (1×) | NVFP4, SGLang | ModelOpt | ~207 | jpezzulli |

\* valore di picco. \** picco con speculazione MTP; il valore prosa reale è più basso.

## Cosa dice davvero la tabella

**1. I salti non sono lineari.** Dalla 3090 (36,8) alla 5090 (~60) è un fattore 1,6 — ma dalla 5090 alla PRO 6000 (207) è 3,5. Il motivo: le ricette PRO 6000 girano in NVFP4 nativo con throughput KV completo, mentre le schede consumer lavorano con offloading CPU-MoE (gli esperti migrano in RAM). Stessa famiglia di modelli, modalità operative fondamentalmente diverse.

**2. La memoria unificata è una competizione a sé.** I valori Mac e Spark non sono paragonabili direttamente ai valori RTX: MLX con la speculazione MTP (weschera, ~83 tok/s di picco) vince grazie alla speculazione, non alla banda. Nel confronto sobrio, prosa senza drafter, la Spark (48,7) e il M5 Max (48,4, antirez/ds4) sono praticamente in parità — ecosistemi diversi, realtà identica.

**3. La quantizzazione decide il confine tra i livelli.** Sulla 3090, Flash-Next gira solo a 2,5–3 bpw (41,5 GiB in 24 GB di VRAM non lasciano alternative). Sulla Spark è NVFP4/6,78 bpw, sulla PRO 6000 classe FP4 nativa. Lo stesso benchmark di verifica contro l'originale BF16 mostra: i livelli a bpw più alti guadagnano non solo velocità ma misurabilmente correttezza. Più VRAM ti compra bit migliori.

**4. Il prefill è la ricompensa segreta dei livelli.** I tok/s di decode dominano la discussione, ma i valori di prefill rivelano la vera gerarchia: ~664 (3090) → ~900 (5090) → ~1.492 (Spark/M5 Max) → ~12.073–14.842 (PRO 6000). Chi alimenta documenti lunghi o contesti di agenti non vive la PRO 6000 come «un po' più veloce» ma come un'altra classe.

## Quale livello per chi?

- **Chat occasionale e esperimenti:** 1× RTX 3090 — 37–39 tok/s bastano largamente per chattare, e magari la scheda ce l'hai già.
- **Uso serio mono-utente:** DGX Spark o Mac Studio — ~49 tok/s di decode con una quantizzazione più ricca danno la sensazione di «parlare fluido».
- **RAG, agenti, contesti lunghi:** RTX PRO 6000 — a decidere è l'argomento prefill, non il valore di decode.
- **Multi-utente:** 2× Spark o PRO 6000 con vLLM/SGLang — la concorrenza richiede un pool KV, non un picco in stream singolo.

Ogni riga di questa tabella è una ricetta reale e riproducibile dal nostro [database Local AI](/it/local-ai) — con flag di serve, repository originale e metodologia di misura. Scegli il tuo livello, copia la ricetta, verifica misurando.

## Domande frequenti

**Il passaggio dalla 3090 alla 5090 vale per questo modello?**
Per il decode: +60% (36,8 → ~60 tok/s con un quant simile). Per l'esperienza: percettibile, ma non sconvolgente. Il grande salto è nel prefill (664 → 900) e nel fatto che la 5090 gestisce comodamente i quant Q4. Chi ha già una 3090 e fa solo chat: probabilmente no.

**Perché il valore Mac (83 tok/s) con MTP è così più alto di quello della Spark?**
L'MTP (multi-token prediction) è speculazione: indovinare e verificare più token per passo. L'implementazione oMLX di weschera la usa in modo aggressivo (MTP6). Senza speculazione, Mac M5 Max e DGX Spark sono in parità (~48). La speculazione è una caratteristica software, non un vantaggio hardware.

**2,5 bpw sulla 3090 è ancora lo stesso modello?**
È lo stesso modello con uno scostamento misurabilmente maggiore dall'originale. Accettabile per la chat, critico per gli agenti di codice — ed è esattamente ciò che documentano i valori KLD delle ricette. Chi vuole qualità da agente di codice serve almeno la classe 5090 (Q4) o la Spark (NVFP4).

**Cosa compra la 2× Spark rispetto alla 1×?**
Con TP2: piena qualità NVFP4 (8,49 bpw effettivi), 54,4 tok/s invece di 48,7 — e soprattutto il doppio del pool KV per contesti più lunghi e più concorrenza. Il salto è qualità e capacità insieme, non solo velocità.

**È vero che la PRO 6000 è «di un'altra classe»?**
Per il prefill: inequivocabilmente sì — 12.000–14.800 tok/s contro 664–1.492 su consumer/unificata. È la differenza tra «carico il documento, vado a prendere un caffè» e «il documento è già letto». Chi gestisce workload di agenti con contesti lunghi compra per il prefill, non per il decode.

## Fonti

- [Local AI — Context Studios (database di ricette, ricette Qwen3.8-Flash-Next)](https://www.contextstudios.ai/it/local-ai)
- [MiaAI-Lab — Qwen3.8-Flash-Next NVFP4 su 1×/2× DGX Spark (48,7/54,4 tok/s)](https://github.com/MiaAI-Lab)
- [vcruz305 — Qwen3.8-Flash-Next EXL3 3.05bpw su 1× Spark (53,0 tok/s)](https://www.contextstudios.ai/local-ai)
- [weschera — Qwen3.8-Flash-Next oMLX MTP6 su Mac Studio M4 Max](https://www.contextstudios.ai/local-ai)
- [antirez/ds4 — Qwen3.8-Flash-Next Q2/Q4 su M5 Max (streaming SSD delle tabelle n-gram)](https://dwarfstar.sh/blog/ds4-september-v41-qwen38-and-a-bigger-runtime)
- [jpezzulli — Qwen3.8-Flash-Next NVFP4 SGLang su 1× RTX PRO 6000 (207 tok/s, prefill 14.842)](https://www.contextstudios.ai/local-ai)
- [club3090 — Qwen3.8-Flash-Next CPU-MoE su 2× RTX 3090 (36,8 tok/s)](https://github.com/noonghunna/club-3090/blob/master/BENCHMARKS.md)


## Related

- [Sviluppo LLM](https://www.contextstudios.ai/it/sviluppo-llm.md)
- [Sviluppo AI](https://www.contextstudios.ai/it/sviluppo-ia.md)
- [Integrazione LLM](https://www.contextstudios.ai/it/integrazione-llm.md)
- [Consulenza AI](https://www.contextstudios.ai/it/consulenza-ia.md)
