IA locale

Matériel pour l'IA locale en 2026 : DGX Spark, Mac Studio M5 Ultra, RTX 5090 et Strix Halo comparés

Matériel pour l'IA locale en 2026 : DGX Spark, Mac Studio M5 Ultra, RTX 5090 et Strix Halo comparés

Journal des mises à jour

  • 24 septembre 2026 : première version. Elle couvre DGX Spark/GB10, AMD Strix Halo, RTX 3090/4090/5090/PRO 6000, MacBook Pro M5 Max et le nouveau Mac Studio M5 Ultra, livré depuis le 22 septembre 2026. Elle inclut notre benchmark du 24 septembre 2026 avec GLM-5.3-Flash et Qwen3.8-Flash-Next, chacun sur une paire de nœuds DGX Spark. Prix de septembre 2026.
  • Prochaine mise à jour : 1er octobre 2026. Nous actualisons ce guide chaque mois avec de nouveaux modèles, de nouveaux prix et de nouvelles mesures.

En bref : la bande passante mémoire détermine la vitesse d'une conversation, la taille de la mémoire détermine si le modèle tient. En septembre 2026, une RTX 3090 d'occasion reste la façon la moins chère d'obtenir des tokens rapides avec un modèle de 27B. Le Mac Studio M5 Ultra (1,2 To/s, jusqu'à 512 Go) est la machine la plus rapide pour un utilisateur seul avec de grands modèles MoE. Le DGX Spark s'impose si vous avez besoin de CUDA, de clustering et de plusieurs requêtes en parallèle. Strix Halo offre 128 Go au prix le plus bas, mais traite lentement les longs prompts.

Chez Context Studios, nous faisons tourner en production des nœuds de type DGX Spark (ASUS Ascent GX10 avec NVIDIA GB10) sous vLLM, avec un Mac mini comme hôte pour nos agents. Ce guide place nos propres mesures à côté des meilleurs chiffres publics, et chaque valeur indique sa source.

La règle qui explique tous les benchmarks

La vitesse de décodage, c'est-à-dire les tokens que vous lisez, vaut à peu près bande passante mémoire ÷ octets lus par token. Le prefill, la lecture de votre prompt, dépend de la puissance de calcul. La taille de la mémoire décide si le modèle tient ou non.

Les modèles Mixture-of-Experts (MoE) comme Qwen3.8-Flash-Next (environ 6B de paramètres actifs) ou GLM-5.3-Flash (320B au total, 18B actifs) ne lisent qu'une petite partie de leurs poids à chaque token. C'est pourquoi ils tournent à une vitesse utilisable sur une machine de 128 Go à 273 Go/s, alors qu'un modèle dense de 70B y avance au ralenti.

Tableau comparatif (septembre 2026)

MatérielMémoireBande passantePrix (sept. 2026)Consommation en chargeStack adaptée
NVIDIA DGX Spark / ASUS GX10 (GB10)128 Go unifiée273 Go/s4 699 $ catalogue (US), dès 5 038 € HT (UE)env. 160 WvLLM, SGLang, EXL3, llama.cpp
AMD Ryzen AI Max+ 395 (Framework, EVO-X2)128 Go unifiée (env. 96–100 Go pour le GPU)env. 256 Go/s3 449–3 650 $ (128 Go)env. 112–120 Wllama.cpp Vulkan/ROCm
RTX 3090 (occasion)24 Go936 Go/senv. 1 050–1 264 $250–350 WvLLM, llama.cpp, EXL3
RTX 4090 (occasion)24 Go1 008 Go/senv. 2 268–2 362 $env. 450 WvLLM, llama.cpp
RTX 509032 Go1 792 Go/s1 999 $ prix conseillé, env. 4 700 $ en boutiqueenv. 575 WvLLM, llama.cpp, NVFP4
RTX PRO 6000 Blackwell96 Goenv. 1,8 To/s16 000 $ (sept. 2026)jusqu'à 600 WvLLM, SGLang, NVFP4
MacBook Pro M5 Maxjusqu'à 128 Go614 Go/snon vérifiéportableMLX, mlx-serve, llama.cpp
Mac Studio M5 Ultra96/256/512 Go1,2 To/sdès 5 499 $ ; 512 Go à partir d'octobrepas encore mesuré sous charge LLMMLX, LM Studio, llama.cpp

Les prix ont fortement augmenté en 2026 à cause de la pénurie de DRAM et de GDDR7. La RTX PRO 6000 coûte environ 87 % de plus que son prix de lancement, et le GMKtec EVO-X2 128 Go est passé de 1 999 $ à 3 499–3 650 $. Nous n'avons pas encore de prix en euros vérifiés pour la plupart des cartes graphiques et des Mac, d'où les prix américains.

Modèle × matériel × tokens par seconde

Valeurs pour un seul flux, sauf mention contraire. [R] = test ou constructeur, [C] = rapport de la communauté sur X ou GitHub, [CS] = mesuré par Context Studios.

ModèleMatérielDécodageRemarque
Qwen3.8-27B (dense) Q4RTX 3090 / 4090 / 509040 / 46 / 75 t/sllama.cpp standard, contexte 4k [R]
Qwen3.8-27BRTX 5090 + MTP77 → 155 t/sllama.cpp Q4_K_M [C]
Qwen3.8-27BRTX 3090, vLLM optimiséenv. 114 t/s, env. 1 000 t/s sur 64 fluxrecette syv-ai [C]
Qwen3.8-27BDGX Spark12 t/s standard → 31–58 t/s optimiséNVFP4 + MTP [R]/[C]
Qwen3.8-27BStrix Halo11 → 24–30 t/sVulkan + MTP [R]/[C]
Qwen3.8-27BM5 Max 128 Go31 → 65–69 t/sMLX + MTP/DFlash2 [R]/[C]
Qwen3.8-Flash-Next (MoE)Mac Studio M5 Ultraplus de 100 t/s sur prompt court, 60–85 t/s à 64k–256ktest MacStories [R]
Qwen3.8-Flash-NextMacBook Pro M5 Max56–101 t/smlx-serve, MTP [C]
Qwen3.8-Flash-Next1× DGX Spark65–81 t/svLLM/EXL3 + MTP [C]
Qwen3.8-Flash-Next2× DGX Spark, NVFP432,9 t/s, prefill 722 t/s (prompt de 1k)notre mesure du 24/09, sans speculative decoding [CS]
Qwen3.8-Flash-NextStrix Halo22–38 t/sllama.cpp / Halogen [C]
Qwen3.8-Flash-NextRTX PRO 6000227 t/s, prefill 9 900 t/s[C]
Qwen3.8-Flash-Next2× RTX PRO 60001 610 t/s sur 32 fluxvLLM standard [C]
GLM-5.3-Flash EXL3 4bpw2× DGX Spark (TP=2)32,9 t/s, 63,7 t/s cumulés sur 4 fluxnotre mesure du 24/09 [CS]
GLM-5.3-Flash IQ2Strix Halo17–18 t/s[C]
GLM-5.2 (grand MoE)cluster 4× GB1027 t/s, 76 t/s cumulés sur 6 fluxvLLM TP4 + MTP, juillet/août [CS]
DeepSeek-V4.1-Flash2× DGX Spark23 → 33 t/sEXL3, contexte 1M [C]
DeepSeek-V4.1-Flash4× RTX PRO 6000env. 120–125 t/s stables jusqu'à 131k[C]

Le prefill compte plus qu'on ne le croit. Dans le test de MacStories, le M5 Ultra a lu un prompt de 15 500 tokens à 2 887 t/s, contre 1 143 t/s pour le M3 Ultra. Une RTX 5090 a atteint environ 3 000 t/s sur un prompt de 6k. Sur Strix Halo, un prompt d'un million de tokens a demandé 18 minutes. Un agent envoie à chaque tour 20 000 à 60 000 tokens de prompt système, d'outils et de mémoire : c'est souvent le prefill qui décide si une machine paraît rapide.

Mesures de la communauté sur X (septembre 2026)

Sauf mention contraire : décodage sur un seul flux. Ce sont des mesures publiées par des développeurs sur X, pas les nôtres. Les configurations varient (quantification, décodage spéculatif, moteurs patchés) : chaque ligne montre ce qu'une recette précise permet, pas une base garantie. L'écart entre les 62,9 t/s annoncés pour GLM-5.3-Flash sur deux Spark et nos 32,9 t/s montre à quel point une recette optimisée compte.

MatérielModèleConfigurationDécodageRemarquesSource
1× DGX SparkQwen3.8-Flash-NextNVFP4, vLLM + MTP k=338 t/s53,8 t/s sur du code, 180 t/s cumulés sur 8 flux, ~2 000 t/s de prefill@jvr0x
1× DGX SparkQwen3.8-Flash-NextEXL3 vs. NVFP4, vLLM78,3 vs. 31,0 t/smême machine ; ~600 contre ~150 t/s cumulés sur 8 requêtes@ViC305
2× DGX Spark (TP=2)GLM-5.3-FlashEXL3 4bpw, vllm-exl362,9 t/s146,5 t/s cumulés sur 4 flux@yume_arasaki
2× DGX Spark (TP=2)GLM-5.3-FlashNVFP4, patched vLLM46,3 t/sun flux, raisonnement@mr_r0b0t
8× DGX SparkGLM-5.3-FlashNVFP4, vLLM96 t/s110 t/s sur 4 flux@hypermac6502
16× DGX SparkKimi K3 (2.8T)vLLM + GB10 patch29,8 t/s87 t/s cumulés sur 8 flux, ~20 t/s à 300k de contexte@ciprianveg
RTX PRO 6000 (96 GB)Qwen3.8-Flash-NextSGLang, FP8 KV + MTP252,9 t/s819 t/s sur 8 flux, 1 190 t/s sur 16@wei_wang
4× RTX PRO 6000GLM-5.3-FlashvLLM240 t/s~12 000 t/s de prefill, 550 t/s cumulés sur 4 flux@hiheyhowareya
Strix Halo (Ryzen AI Max+ 395)Qwen3.8-Flash-NextLucebox ROCm38 t/s41,9 t/s à 8k de contexte@luceboxai
RTX 4090 (24 GB)Qwen3.8-27BQ4_K_M, llama.cpp46 t/sflash attention, cache KV quantifié@yume_arasaki
RTX 3090 / 4090 (24 GB)Qwen3.8-27BEXL3 3.5bpw + DFlash94–105 t/sen continu ; 130–150 t/s sur réponses courtes@yume_arasaki
MacBook Pro M4 Max (128 GB)Qwen3.8-27BMLX 4-bit + MTP43 t/splage 42–44 t/s@yume_arasaki

Notre mesure (Context Studios, 24 septembre 2026)

Nous avons lancé un benchmark court et reproductible sur les endpoints que nous utilisons tous les jours. Les deux modèles tournent sur des paires de nœuds ASUS Ascent GX10 (NVIDIA GB10, 128 Go chacun) en tensor parallel 2 sur un réseau 100G RoCE. L'endpoint Qwen passe par un proxy LiteLLM sur notre Mac mini, ses chiffres incluent donc un saut réseau de plus.

ModèleConfigurationDécodage (1 flux)Prefill (prompt d'env. 1k)4 flux en parallèle
GLM-5.3-Flash (MoE 320B, 18B actifs)EXL3 4bpw, vLLM, 2× GX10 TP=232,9 t/s1 262 t/s63,7 t/s cumulés (env. 16,5 t/s par flux)
Qwen3.8-Flash-NextNVFP4, vLLM via LiteLLM, 2× GX1032,9 t/s722 t/s21,8 t/s cumulés (un flux est tombé à 7 t/s)

Méthode. Streaming sur /v1/chat/completions, température 0, thinking désactivé, prompt technique fixe. Une exécution de chauffe est écartée, puis trois exécutions de 400 tokens de sortie ; nous retenons la médiane. Décodage = (tokens générés − 1) ÷ temps entre le premier et le dernier token. Le prefill est estimé par tokens du prompt ÷ temps jusqu'au premier token, avec un prompt d'environ 1 040 tokens. Il inclut la latence réseau et constitue donc une borne basse. Le test parallèle envoie quatre requêtes identiques de 400 tokens en même temps et divise le total des tokens générés par le temps réel écoulé. Les comptes de tokens proviennent du champ usage du serveur. Notre cluster sert des agents en production pendant ce temps : les valeurs parallèles sont un instantané, pas un résultat de laboratoire.

Vous pouvez refaire la mesure sur n'importe quel endpoint compatible OpenAI :

bash
python3 bench_local.py http://VOTRE-HOTE:8000 id-du-modele 3 4

Ce que nous retenons de ces chiffres :

  1. Deux Spark suffisent pour un modèle de 320B à vitesse interactive. 33 t/s sur un flux, c'est fluide en chat comme dans les agents de code.
  2. Les chiffres Qwen plus élevés de la communauté viennent du speculative decoding. Les configurations avec MTP annoncent 65–81 t/s sur un seul Spark ; notre endpoint NVFP4 tourne sans MTP et atteint 33 t/s. Le speculative decoding est le levier le plus puissant : sur notre cluster de 4 nœuds, il a presque doublé GLM-5.2 (de 14,5 à 26,6 t/s).
  3. Le débit en parallèle dépend de tout ce qui tourne à côté. GLM a progressé de façon presque linéaire jusqu'à quatre flux ; la paire Qwen était occupée par le trafic des agents et un flux a décroché.

Mesure précédente : cluster 4× GB10 avec GLM-5.2 (juillet/août 2026)

Ce que nous avons mesuréRésultat
Décodage GLM-5.2 sur 1 / 2 / 3 / 4 / 6 flux parallèles (cumulé)27,2 / 42,6 / 52,1 / 62,7 / 75,8 t/s
Prefill prompt de 8k / 32k853 / 840 t/s
Effet du MTP (sans draft → k=2)14,5 → 26,6 t/s
Correction des cudagraph capture sizes+38 % sur 2 flux
Longue conversation (22 tours, 104 846 tokens)aucune dégradation
Démarrage à froid / redémarrage complet du cluster520 s / 13–14 min

Ce que l'exploitation nous a appris : si deux flux vont à peine plus vite qu'un seul, les tailles de CUDA graph ne sont pas configurées, et une seule ligne de configuration nous a apporté 38 % de plus. La mémoire unifiée demande de la vigilance : l'OOM killer peut arrêter le moteur, et des conteneurs supprimés de force ont gardé de la mémoire jusqu'au redémarrage. Téléchargez un checkpoint une fois, puis copiez-le par le réseau : environ 15 minutes au lieu d'environ 48 heures pour trois nœuds de plus.

Que choisir selon le budget, l'usage et la taille du modèle

Vous voulez…BudgetAchetezPourquoi
Des modèles denses de 27–32B, rapides, pour une personneenv. 1 200–1 600 €RTX 3090 d'occasionLe plus de tokens par euro ; Qwen3.8-27B Q4 tient dans 24 Go
Servir une petite équipe (5 à 60 requêtes parallèles) avec un modèle de 27Benv. 2 500–3 500 €2× RTX 3090 ou une RTX 5090Débit en batch avec vLLM
Des modèles MoE de 100–300B, en silence sur le bureauenv. 3 500–4 000 €Strix Halo 128 GoLe plus de mémoire par euro ; prefill lent à accepter
Développer sur CUDA, prototyper pour des GPU de datacenter ou monter un clusterenv. 5 000–6 000 € par nœudDGX Spark / GX10NVFP4, recettes vLLM, clustering 200G
La vitesse maximale pour un utilisateur avec de grands MoE et un long contextedès 5 499 $Mac Studio M5 Ultra1,2 To/s et jusqu'à 512 Go
Travailler en local en déplacementélevéMacBook Pro M5 Max 128 Go614 Go/s dans un portable
Servir des modèles de 700B et plus en productiondès 64 000 $4× RTX PRO 6000384 Go de VRAM, env. 120 t/s avec DeepSeek V4.1 Flash

Repères selon la taille du modèle (4 bits) :

  • Jusqu'à 32B dense : tient dans 24–32 Go de VRAM. Une seule carte RTX est l'option la plus rapide.
  • Environ 70B dense : demande environ 48 Go et tourne lentement en mémoire unifiée (4–6 t/s sur Strix Halo).
  • MoE de 100–320B : demande 64–128 Go. Spark, Strix Halo, M5 Max ou Mac Studio. Deux Spark font tourner GLM-5.3-Flash en 4 bpw avec de la marge pour un long contexte.
  • MoE de 500B et plus : il faut un cluster de Spark, un Mac de 256–512 Go ou plusieurs RTX PRO 6000.

Coût par token : local ou cloud

Hypothèses : électricité à 0,37 €/kWh (moyenne allemande BDEW 2026), amortissement sur 3 ans (26 280 heures), fonctionnement 24 h/24 à pleine charge. C'est le meilleur scénario possible pour le matériel local.

ConfigurationDébitÉlectricité seuleMatériel inclusRéférence cloud
2× GX10, GLM-5.3-Flash, 4 flux [CS]63,7 t/senv. 0,52 € / 1M tokensenv. 2,03 € / 1M tokensAPI GLM-5.3-Flash : 0,50 $ / 1M en sortie
4× GX10, GLM-5.2, 6 flux [CS]75,8 t/senv. 0,87 € / 1M tokensenv. 3,41 € / 1M tokensidem
RTX 3090 d'occasion, vLLM en batch, Qwen3.8-27B [C]env. 1 000 t/senv. 0,04 € / 1M tokensenv. 0,05 € / 1M tokensAPI Qwen3.8-Flash : 0,47 $ / 1M en sortie

Le calcul de la ligne 2× GX10 : 2 × environ 160 W = 0,32 kW, soit 0,118 € de l'heure. Le matériel (2 × 4 558 €, prix de détail allemand du 28 août 2026) réparti sur 26 280 heures représente 0,347 € de l'heure. 63,7 t/s donnent 229 320 tokens par heure, donc 0,465 € de l'heure correspondent à environ 2,03 € par million de tokens.

  • Le cloud est environ 4 fois moins cher par token que notre configuration GLM sur deux nœuds, même à pleine charge.
  • Une RTX 3090 exploitée à fond passe sous les prix des API pour les modèles de 27B, mais seulement avec un trafic en batch continu.
  • Un utilisateur seul typique utilise le matériel moins de 10 % du temps, ce qui multiplie le coût local par 10 ou plus.

Notre conclusion : sur le prix par token, l'IA locale gagne rarement. Elle gagne sur la souveraineté des données, des coûts fixes prévisibles, l'absence de limites de débit et le contrôle total des modèles et du contexte. Si vous n'avez besoin que de tokens, l'API coûte moins cher. Si les données ne doivent pas quitter l'entreprise ou si vos agents doivent tourner 24 h/24 sans compteur, le matériel en propre se justifie.

Pièges fréquents selon la plateforme

  • DGX Spark : la vitesse sur un flux est limitée par la bande passante ; les longs prefills à froid freinent le décodage parallèle ; les recettes de la communauté changent chaque semaine.
  • Strix Halo : le paramètre noyau GTT est obligatoire ; les versions de ROCm et du noyau sont fragiles ; les longs prompts prennent plusieurs minutes.
  • Cartes RTX : la VRAM se remplit vite ; déporter les poids vers la RAM système fait tomber la vitesse à un chiffre ; consommation et bruit élevés ; la 5090 coûte en boutique environ le double de son prix conseillé.
  • Mac : NVIDIA garde l'avantage sur le prefill ; beaucoup de conversions MLX perdent la vision ou le MTP ; les modèles les plus récents demandent souvent des versions bêta.

Guides et comparatifs associés

Questions fréquentes

Quel est le meilleur matériel pour les LLM locaux en 2026 ?

Tout dépend de la taille du modèle et du nombre d'utilisateurs. Pour une personne qui utilise des modèles de 27–32B, une RTX 3090 d'occasion offre en septembre 2026 la meilleure vitesse par euro. Pour les modèles MoE de plus de 100B avec un long contexte, le Mac Studio M5 Ultra est la machine individuelle la plus rapide, tandis que le DGX Spark est préférable si vous avez besoin de CUDA, de clustering ou de nombreuses requêtes en parallèle.

Le DGX Spark vaut-il le coup face au Mac Studio M5 Ultra ?

Le M5 Ultra dispose d'environ 4,4 fois plus de bande passante mémoire (1,2 To/s contre 273 Go/s), il génère donc les tokens plus vite pour un utilisateur seul. Les atouts du Spark sont CUDA, le NVFP4, les recettes vLLM de la communauté qui arrivent en quelques jours et un clustering peu coûteux sur réseau 200G. Nous avons choisi des Spark parce que nous servons plusieurs agents en parallèle, et le débit total compte davantage pour nous que la vitesse d'un seul flux.

Quelle vitesse atteint GLM-5.3-Flash sur deux DGX Spark ?

Lors de notre mesure du 24 septembre 2026, GLM-5.3-Flash en EXL3 4bpw sur deux nœuds ASUS GX10 en tensor parallel 2 a atteint 32,9 tokens par seconde sur un flux. Avec quatre requêtes en parallèle, la paire a produit 63,7 tokens par seconde au total, soit environ 16,5 par flux. Le prefill d'un prompt d'environ 1 000 tokens a dépassé 1 200 tokens par seconde, latence réseau comprise.

AMD Strix Halo peut-il faire tourner de grands modèles comme GLM-5.3-Flash ?

Oui. Avec 128 Go de mémoire unifiée, dont environ 96–100 Go attribuables au GPU, il fait tourner des quantifications de 2 à 4 bits de modèles MoE de 200–300B à environ 13–38 t/s. La limite est le traitement du prompt : les longs contextes prennent plusieurs minutes, et un prompt d'un million de tokens a demandé 18 minutes dans un test. C'est une bonne machine de capacité pour un utilisateur patient, moins adaptée aux boucles d'agents avec d'énormes prompts.

Combien de tokens par seconde faut-il pour les agents de code ?

Pour le travail interactif, environ 30 t/s de décodage paraissent fluides et plus de 60 t/s donnent une impression de vitesse. Pour les agents, le prefill compte tout autant, car chaque tour envoie des dizaines de milliers de tokens de contexte. Une machine à 50 t/s de décodage mais 300 t/s de prefill paraîtra plus lente dans un agent qu'une machine à 40 t/s de décodage et 2 500 t/s de prefill.

L'IA locale revient-elle moins cher qu'une API ?

Par token, en général non. Même à pleine charge 24 h/24, notre configuration GLM-5.3-Flash sur deux nœuds coûte environ 2,03 € par million de tokens matériel inclus, alors que l'API GLM-5.3-Flash facture 0,50 $ par million de tokens en sortie. Le local l'emporte sur la confidentialité, des coûts fixes prévisibles, l'absence de limites de débit et le contrôle total, et une RTX 3090 d'occasion exploitée à fond peut battre les prix API pour les modèles de 27B.

Pourquoi le matériel coûte-t-il si cher en 2026 ?

Une pénurie mondiale de DRAM et de GDDR7 fait grimper le prix de tout ce qui embarque beaucoup de mémoire. NVIDIA a relevé le DGX Spark de 3 999 $ à 4 699 $ en février 2026, la RTX PRO 6000 coûte désormais 16 000 $ et les mini-PC Strix Halo de 128 Go ont pris environ 75 %. Les cartes d'occasion à mémoire GDDR6X plus ancienne, comme la RTX 3090, sont les moins touchées.

Sources


Déployer l'IA locale dans votre équipe ?

Context Studios vous conseille sur le matériel, l'installation et l'exploitation de l'IA locale : du choix entre DGX Spark, Mac Studio ou serveur GPU jusqu'à l'inférence en production avec vLLM. Nous faisons tourner cette pile chaque jour, et les mesures de ce guide en sont issues.

Parlons de votre projet d'IA locale → · Nos services

Un sujet pour votre équipe ? Parlons-en 30 minutes.

Nous identifions ce qui fonctionne vraiment dans votre entreprise — concret, sans avalanche de slides.

Sans engagement · 30 minutes · Devis sous 48 h