Quanto è veloce uno stesso modello su hardware diverso? E cosa si perde lungo la strada? Abbiamo messo fianco a fianco tutte le ricette Qwen3.8-Flash-Next del nostro database — dalla RTX 3090 al nodo RTX PRO 6000. Il risultato è la risposta più onesta possibile alla domanda «quale hardware mi serve?» — una tabella di misurazioni, non una slide di marketing.
Il modello in 30 secondi
Qwen3.8-Flash-Next è il checkpoint di anteprima aperto verso Qwen4: un modello principale da 125B più uno strato di embedding n-gram da 51B (in parte tenuto su SSD), solo ~6B di parametri attivi per token, input immagine e video nativi, 262K di contesto (1M via YaRN). Il basso numero di parametri attivi lo rende il candidato di prova ideale per i livelli di hardware: gira su quasi tutto — ma a che velocità, questa è la differenza.
La serie di misurazioni: sei livelli, un modello
Tutti i valori: migliore decode in stream singolo per ricetta, carico prosa in preferenza, dal database di ricette (creatore citato):
| Livello | Setup | Quant | tok/s (typ) | Ricetta di |
|---|---|---|---|---|
| RTX 3090 (1×) | EXL3 2,5 bpw | 41,5 GiB | ~38,6* | r0b0tlab |
| RTX 3090 (2×) | GGUF Q4, CPU-MoE | UD-Q4_K_XL | 36,8 | club3090 |
| RTX 5090 (1×) | GGUF Q2, CPU-MoE | UD-Q2_K_XL | ~59,7 | notwitcheer |
| DGX Spark (1×) | NVFP4 + KV FP8 | 6,78 bpw | 48,7 | MiaAI-Lab |
| DGX Spark (2×) | NVFP4 TP2 | 8,49 bpw | 54,4 | MiaAI-Lab |
| Mac Studio M4 Max | oMLX, MTP6 | oQ4e | ~83** | weschera |
| RTX PRO 6000 (1×) | NVFP4, SGLang | ModelOpt | ~207 | jpezzulli |
* valore di picco. ** picco con speculazione MTP; il valore prosa reale è più basso.
Cosa dice davvero la tabella
1. I salti non sono lineari. Dalla 3090 (36,8) alla 5090 (~60) è un fattore 1,6 — ma dalla 5090 alla PRO 6000 (207) è 3,5. Il motivo: le ricette PRO 6000 girano in NVFP4 nativo con throughput KV completo, mentre le schede consumer lavorano con offloading CPU-MoE (gli esperti migrano in RAM). Stessa famiglia di modelli, modalità operative fondamentalmente diverse.
2. La memoria unificata è una competizione a sé. I valori Mac e Spark non sono paragonabili direttamente ai valori RTX: MLX con la speculazione MTP (weschera, ~83 tok/s di picco) vince grazie alla speculazione, non alla banda. Nel confronto sobrio, prosa senza drafter, la Spark (48,7) e il M5 Max (48,4, antirez/ds4) sono praticamente in parità — ecosistemi diversi, realtà identica.
3. La quantizzazione decide il confine tra i livelli. Sulla 3090, Flash-Next gira solo a 2,5–3 bpw (41,5 GiB in 24 GB di VRAM non lasciano alternative). Sulla Spark è NVFP4/6,78 bpw, sulla PRO 6000 classe FP4 nativa. Lo stesso benchmark di verifica contro l'originale BF16 mostra: i livelli a bpw più alti guadagnano non solo velocità ma misurabilmente correttezza. Più VRAM ti compra bit migliori.
4. Il prefill è la ricompensa segreta dei livelli. I tok/s di decode dominano la discussione, ma i valori di prefill rivelano la vera gerarchia: ~664 (3090) → ~900 (5090) → ~1.492 (Spark/M5 Max) → ~12.073–14.842 (PRO 6000). Chi alimenta documenti lunghi o contesti di agenti non vive la PRO 6000 come «un po' più veloce» ma come un'altra classe.
Quale livello per chi?
- Chat occasionale e esperimenti: 1× RTX 3090 — 37–39 tok/s bastano largamente per chattare, e magari la scheda ce l'hai già.
- Uso serio mono-utente: DGX Spark o Mac Studio — ~49 tok/s di decode con una quantizzazione più ricca danno la sensazione di «parlare fluido».
- RAG, agenti, contesti lunghi: RTX PRO 6000 — a decidere è l'argomento prefill, non il valore di decode.
- Multi-utente: 2× Spark o PRO 6000 con vLLM/SGLang — la concorrenza richiede un pool KV, non un picco in stream singolo.
Ogni riga di questa tabella è una ricetta reale e riproducibile dal nostro database Local AI — con flag di serve, repository originale e metodologia di misura. Scegli il tuo livello, copia la ricetta, verifica misurando.
Domande frequenti
Il passaggio dalla 3090 alla 5090 vale per questo modello? Per il decode: +60% (36,8 → ~60 tok/s con un quant simile). Per l'esperienza: percettibile, ma non sconvolgente. Il grande salto è nel prefill (664 → 900) e nel fatto che la 5090 gestisce comodamente i quant Q4. Chi ha già una 3090 e fa solo chat: probabilmente no.
Perché il valore Mac (83 tok/s) con MTP è così più alto di quello della Spark? L'MTP (multi-token prediction) è speculazione: indovinare e verificare più token per passo. L'implementazione oMLX di weschera la usa in modo aggressivo (MTP6). Senza speculazione, Mac M5 Max e DGX Spark sono in parità (~48). La speculazione è una caratteristica software, non un vantaggio hardware.
2,5 bpw sulla 3090 è ancora lo stesso modello? È lo stesso modello con uno scostamento misurabilmente maggiore dall'originale. Accettabile per la chat, critico per gli agenti di codice — ed è esattamente ciò che documentano i valori KLD delle ricette. Chi vuole qualità da agente di codice serve almeno la classe 5090 (Q4) o la Spark (NVFP4).
Cosa compra la 2× Spark rispetto alla 1×? Con TP2: piena qualità NVFP4 (8,49 bpw effettivi), 54,4 tok/s invece di 48,7 — e soprattutto il doppio del pool KV per contesti più lunghi e più concorrenza. Il salto è qualità e capacità insieme, non solo velocità.
È vero che la PRO 6000 è «di un'altra classe»? Per il prefill: inequivocabilmente sì — 12.000–14.800 tok/s contro 664–1.492 su consumer/unificata. È la differenza tra «carico il documento, vado a prendere un caffè» e «il documento è già letto». Chi gestisce workload di agenti con contesti lunghi compra per il prefill, non per il decode.
Fonti
- Local AI — Context Studios (database di ricette, ricette Qwen3.8-Flash-Next)
- MiaAI-Lab — Qwen3.8-Flash-Next NVFP4 su 1×/2× DGX Spark (48,7/54,4 tok/s)
- vcruz305 — Qwen3.8-Flash-Next EXL3 3.05bpw su 1× Spark (53,0 tok/s)
- weschera — Qwen3.8-Flash-Next oMLX MTP6 su Mac Studio M4 Max
- antirez/ds4 — Qwen3.8-Flash-Next Q2/Q4 su M5 Max (streaming SSD delle tabelle n-gram)
- jpezzulli — Qwen3.8-Flash-Next NVFP4 SGLang su 1× RTX PRO 6000 (207 tok/s, prefill 14.842)
- club3090 — Qwen3.8-Flash-Next CPU-MoE su 2× RTX 3090 (36,8 tok/s)