Local AI

Un modello, sei livelli di hardware — cosa abbiamo misurato

Un modello, sei livelli di hardware — cosa abbiamo misurato

Quanto è veloce uno stesso modello su hardware diverso? E cosa si perde lungo la strada? Abbiamo messo fianco a fianco tutte le ricette Qwen3.8-Flash-Next del nostro database — dalla RTX 3090 al nodo RTX PRO 6000. Il risultato è la risposta più onesta possibile alla domanda «quale hardware mi serve?» — una tabella di misurazioni, non una slide di marketing.

Il modello in 30 secondi

Qwen3.8-Flash-Next è il checkpoint di anteprima aperto verso Qwen4: un modello principale da 125B più uno strato di embedding n-gram da 51B (in parte tenuto su SSD), solo ~6B di parametri attivi per token, input immagine e video nativi, 262K di contesto (1M via YaRN). Il basso numero di parametri attivi lo rende il candidato di prova ideale per i livelli di hardware: gira su quasi tutto — ma a che velocità, questa è la differenza.

La serie di misurazioni: sei livelli, un modello

Tutti i valori: migliore decode in stream singolo per ricetta, carico prosa in preferenza, dal database di ricette (creatore citato):

LivelloSetupQuanttok/s (typ)Ricetta di
RTX 3090 (1×)EXL3 2,5 bpw41,5 GiB~38,6*r0b0tlab
RTX 3090 (2×)GGUF Q4, CPU-MoEUD-Q4_K_XL36,8club3090
RTX 5090 (1×)GGUF Q2, CPU-MoEUD-Q2_K_XL~59,7notwitcheer
DGX Spark (1×)NVFP4 + KV FP86,78 bpw48,7MiaAI-Lab
DGX Spark (2×)NVFP4 TP28,49 bpw54,4MiaAI-Lab
Mac Studio M4 MaxoMLX, MTP6oQ4e~83**weschera
RTX PRO 6000 (1×)NVFP4, SGLangModelOpt~207jpezzulli

* valore di picco. ** picco con speculazione MTP; il valore prosa reale è più basso.

Cosa dice davvero la tabella

1. I salti non sono lineari. Dalla 3090 (36,8) alla 5090 (~60) è un fattore 1,6 — ma dalla 5090 alla PRO 6000 (207) è 3,5. Il motivo: le ricette PRO 6000 girano in NVFP4 nativo con throughput KV completo, mentre le schede consumer lavorano con offloading CPU-MoE (gli esperti migrano in RAM). Stessa famiglia di modelli, modalità operative fondamentalmente diverse.

2. La memoria unificata è una competizione a sé. I valori Mac e Spark non sono paragonabili direttamente ai valori RTX: MLX con la speculazione MTP (weschera, ~83 tok/s di picco) vince grazie alla speculazione, non alla banda. Nel confronto sobrio, prosa senza drafter, la Spark (48,7) e il M5 Max (48,4, antirez/ds4) sono praticamente in parità — ecosistemi diversi, realtà identica.

3. La quantizzazione decide il confine tra i livelli. Sulla 3090, Flash-Next gira solo a 2,5–3 bpw (41,5 GiB in 24 GB di VRAM non lasciano alternative). Sulla Spark è NVFP4/6,78 bpw, sulla PRO 6000 classe FP4 nativa. Lo stesso benchmark di verifica contro l'originale BF16 mostra: i livelli a bpw più alti guadagnano non solo velocità ma misurabilmente correttezza. Più VRAM ti compra bit migliori.

4. Il prefill è la ricompensa segreta dei livelli. I tok/s di decode dominano la discussione, ma i valori di prefill rivelano la vera gerarchia: ~664 (3090) → ~900 (5090) → ~1.492 (Spark/M5 Max) → ~12.073–14.842 (PRO 6000). Chi alimenta documenti lunghi o contesti di agenti non vive la PRO 6000 come «un po' più veloce» ma come un'altra classe.

Quale livello per chi?

  • Chat occasionale e esperimenti: 1× RTX 3090 — 37–39 tok/s bastano largamente per chattare, e magari la scheda ce l'hai già.
  • Uso serio mono-utente: DGX Spark o Mac Studio — ~49 tok/s di decode con una quantizzazione più ricca danno la sensazione di «parlare fluido».
  • RAG, agenti, contesti lunghi: RTX PRO 6000 — a decidere è l'argomento prefill, non il valore di decode.
  • Multi-utente: 2× Spark o PRO 6000 con vLLM/SGLang — la concorrenza richiede un pool KV, non un picco in stream singolo.

Ogni riga di questa tabella è una ricetta reale e riproducibile dal nostro database Local AI — con flag di serve, repository originale e metodologia di misura. Scegli il tuo livello, copia la ricetta, verifica misurando.

Domande frequenti

Il passaggio dalla 3090 alla 5090 vale per questo modello? Per il decode: +60% (36,8 → ~60 tok/s con un quant simile). Per l'esperienza: percettibile, ma non sconvolgente. Il grande salto è nel prefill (664 → 900) e nel fatto che la 5090 gestisce comodamente i quant Q4. Chi ha già una 3090 e fa solo chat: probabilmente no.

Perché il valore Mac (83 tok/s) con MTP è così più alto di quello della Spark? L'MTP (multi-token prediction) è speculazione: indovinare e verificare più token per passo. L'implementazione oMLX di weschera la usa in modo aggressivo (MTP6). Senza speculazione, Mac M5 Max e DGX Spark sono in parità (~48). La speculazione è una caratteristica software, non un vantaggio hardware.

2,5 bpw sulla 3090 è ancora lo stesso modello? È lo stesso modello con uno scostamento misurabilmente maggiore dall'originale. Accettabile per la chat, critico per gli agenti di codice — ed è esattamente ciò che documentano i valori KLD delle ricette. Chi vuole qualità da agente di codice serve almeno la classe 5090 (Q4) o la Spark (NVFP4).

Cosa compra la 2× Spark rispetto alla 1×? Con TP2: piena qualità NVFP4 (8,49 bpw effettivi), 54,4 tok/s invece di 48,7 — e soprattutto il doppio del pool KV per contesti più lunghi e più concorrenza. Il salto è qualità e capacità insieme, non solo velocità.

È vero che la PRO 6000 è «di un'altra classe»? Per il prefill: inequivocabilmente sì — 12.000–14.800 tok/s contro 664–1.492 su consumer/unificata. È la differenza tra «carico il documento, vado a prendere un caffè» e «il documento è già letto». Chi gestisce workload di agenti con contesti lunghi compra per il prefill, non per il decode.

Fonti

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h