Local AI

Un modèle, six paliers matériels — ce que nous avons mesuré

Un modèle, six paliers matériels — ce que nous avons mesuré

À quelle vitesse tourne un même modèle sur du matériel différent ? Et que perd-on en chemin ? Nous avons mis côte à côte toutes les recettes Qwen3.8-Flash-Next de notre base — de la RTX 3090 au nœud RTX PRO 6000. Le résultat est la réponse la plus honnête possible à la question « quel matériel me faut-il ? » : un tableau de mesures, pas une slide marketing.

Le modèle en 30 secondes

Qwen3.8-Flash-Next est le checkpoint d'aperçu ouvert vers Qwen4 : un modèle principal de 125B plus une couche d'embedding n-gram de 51B (en partie conservée sur SSD), seulement ~6B de paramètres actifs par token, entrée image et vidéo natives, 262K de contexte (1M via YaRN). Ce faible nombre de paramètres actifs en fait le candidat de test idéal des paliers matériels : il tourne sur presque tout — mais à quelle vitesse, voilà la différence.

La série de mesures : six paliers, un modèle

Tous les chiffres : meilleure valeur de decode en flux simple par recette, charge prose privilégiée, issue de la base de recettes (créateur nommé) :

PalierSetupQuanttok/s (typ)Recette de
RTX 3090 (1×)EXL3 2,5 bpw41,5 GiB~38,6*r0b0tlab
RTX 3090 (2×)GGUF Q4, CPU-MoEUD-Q4_K_XL36,8club3090
RTX 5090 (1×)GGUF Q2, CPU-MoEUD-Q2_K_XL~59,7notwitcheer
DGX Spark (1×)NVFP4 + KV FP86,78 bpw48,7MiaAI-Lab
DGX Spark (2×)NVFP4 TP28,49 bpw54,4MiaAI-Lab
Mac Studio M4 MaxoMLX, MTP6oQ4e~83**weschera
RTX PRO 6000 (1×)NVFP4, SGLangModelOpt~207jpezzulli

* valeur de pic. ** pic avec spéculation MTP ; la valeur prose réelle est plus basse.

Ce que le tableau dit vraiment

1. Les sauts ne sont pas linéaires. De la 3090 (36,8) à la 5090 (~60), c'est un facteur 1,6 — mais de la 5090 à la PRO 6000 (207), c'est 3,5. La raison : les recettes PRO 6000 tournent en NVFP4 natif avec le débit KV complet, tandis que les cartes grand public travaillent avec du déchargement CPU-MoE (les experts migrent en RAM). Même famille de modèles, modes de fonctionnement fondamentalement différents.

2. La mémoire unifiée est une compétition à part. Les chiffres Mac et Spark ne sont pas directement comparables aux chiffres RTX : MLX avec la spéculation MTP (weschera, ~83 tok/s en pic) gagne par la spéculation, pas par la bande passante. En comparaison sobre, prose sans drafter, la Spark (48,7) et le M5 Max (48,4, antirez/ds4) sont à égalité pratique — écosystèmes différents, réalité identique.

3. La quantification décide de la frontière entre paliers. Sur la 3090, Flash-Next ne tourne qu'à 2,5–3 bpw (41,5 GiB en 24 Go de VRAM ne laisse pas d'alternative). Sur la Spark, c'est du NVFP4/6,78 bpw, sur la PRO 6000 de la classe FP4 native. Le même benchmark de vérification contre l'original BF16 montre : les paliers à bpw plus élevés gagnent non seulement de la vitesse mais mesurablement de l'exactitude. Plus de VRAM vous achète de meilleurs bits.

4. Le prefill est la récompense secrète des paliers. Les tok/s de decode dominent la discussion, mais les valeurs de prefill révèlent la vraie hiérarchie : ~664 (3090) → ~900 (5090) → ~1 492 (Spark/M5 Max) → ~12 073–14 842 (PRO 6000). Qui nourrit de longs documents ou des contextes d'agents ne vit pas la PRO 6000 comme « un peu plus rapide » mais comme une autre classe.

Quel palier pour qui ?

  • Chat occasionnel et expériences : 1× RTX 3090 — 37–39 tok/s suffisent largement pour discuter, et vous possédez peut-être déjà la carte.
  • Usage sérieux mono-utilisateur : DGX Spark ou Mac Studio — ~49 tok/s de decode avec une quantification plus riche donne l'impression de « parler fluidement ».
  • RAG, agents, longs contextes : RTX PRO 6000 — c'est l'argument du prefill qui décide, pas la valeur de decode.
  • Multi-utilisateurs : 2× Spark ou PRO 6000 avec vLLM/SGLang — la concurrence exige un pool KV, pas une pointe en flux simple.

Chaque ligne de ce tableau est une recette réelle et reproductible de notre base Local AI — avec les flags de service, le dépôt d'origine et la méthodologie de mesure. Choisissez votre palier, copiez la recette, vérifiez en mesurant.

Questions fréquentes

Le passage de la 3090 à la 5090 vaut-il le coup pour ce modèle ? Pour le decode : +60 % (36,8 → ~60 tok/s avec un quant similaire). Pour l'expérience : perceptible, mais pas renversant. Le grand saut est dans le prefill (664 → 900) et dans le fait que la 5090 gère confortablement les quants Q4. Qui a déjà une 3090 et ne fait que discuter : probablement pas.

Pourquoi la valeur Mac (83 tok/s) avec MTP est-elle si supérieure à celle de la Spark ? Le MTP (multi-token prediction) est de la spéculation : deviner et vérifier plusieurs tokens par pas. L'implémentation oMLX de weschera l'utilise agressivement (MTP6). Sans spéculation, Mac M5 Max et DGX Spark sont à égalité (~48). La spéculation est une fonction logicielle, pas un avantage matériel.

2,5 bpw sur la 3090, est-ce encore le même modèle ? C'est le même modèle avec un écart mesurable plus grand par rapport à l'original. Acceptable pour le chat, critique pour les agents de code — et c'est précisément ce que documentent les valeurs KLD des recettes. Qui veut de la qualité d'agent de code a besoin au minimum de la classe 5090 (Q4) ou de la Spark (NVFP4).

Qu'apporte la 2× Spark par rapport à la 1× ? Avec TP2 : la pleine qualité NVFP4 (8,49 bpw effectifs), 54,4 tok/s au lieu de 48,7 — et surtout le double de pool KV pour des contextes plus longs et plus de concurrence. Ce saut est qualité et capacité à la fois, pas seulement de la vitesse.

Est-il vrai que la PRO 6000 est « d'une autre classe » ? Pour le prefill : sans ambiguïté oui — 12 000–14 800 tok/s contre 664–1 492 en grand public/unifié. C'est la différence entre « téléverser le document, aller chercher un café » et « le document est déjà lu ». Qui mène des workloads d'agents avec de longs contextes achète pour le prefill, pas pour le decode.

Sources

Un sujet pour votre équipe ? Parlons-en 30 minutes.

Nous identifions ce qui fonctionne vraiment dans votre entreprise — concret, sans avalanche de slides.

Sans engagement · 30 minutes · Devis sous 48 h