Journal des mises à jour
- 24 septembre 2026 : première version. Elle couvre DGX Spark/GB10, AMD Strix Halo, RTX 3090/4090/5090/PRO 6000, MacBook Pro M5 Max et le nouveau Mac Studio M5 Ultra, livré depuis le 22 septembre 2026. Elle inclut notre benchmark du 24 septembre 2026 avec GLM-5.3-Flash et Qwen3.8-Flash-Next, chacun sur une paire de nœuds DGX Spark. Prix de septembre 2026.
- Prochaine mise à jour : 1er octobre 2026. Nous actualisons ce guide chaque mois avec de nouveaux modèles, de nouveaux prix et de nouvelles mesures.
En bref : la bande passante mémoire détermine la vitesse d'une conversation, la taille de la mémoire détermine si le modèle tient. En septembre 2026, une RTX 3090 d'occasion reste la façon la moins chère d'obtenir des tokens rapides avec un modèle de 27B. Le Mac Studio M5 Ultra (1,2 To/s, jusqu'à 512 Go) est la machine la plus rapide pour un utilisateur seul avec de grands modèles MoE. Le DGX Spark s'impose si vous avez besoin de CUDA, de clustering et de plusieurs requêtes en parallèle. Strix Halo offre 128 Go au prix le plus bas, mais traite lentement les longs prompts.
Chez Context Studios, nous faisons tourner en production des nœuds de type DGX Spark (ASUS Ascent GX10 avec NVIDIA GB10) sous vLLM, avec un Mac mini comme hôte pour nos agents. Ce guide place nos propres mesures à côté des meilleurs chiffres publics, et chaque valeur indique sa source.
La règle qui explique tous les benchmarks
La vitesse de décodage, c'est-à-dire les tokens que vous lisez, vaut à peu près bande passante mémoire ÷ octets lus par token. Le prefill, la lecture de votre prompt, dépend de la puissance de calcul. La taille de la mémoire décide si le modèle tient ou non.
Les modèles Mixture-of-Experts (MoE) comme Qwen3.8-Flash-Next (environ 6B de paramètres actifs) ou GLM-5.3-Flash (320B au total, 18B actifs) ne lisent qu'une petite partie de leurs poids à chaque token. C'est pourquoi ils tournent à une vitesse utilisable sur une machine de 128 Go à 273 Go/s, alors qu'un modèle dense de 70B y avance au ralenti.
Tableau comparatif (septembre 2026)
| Matériel | Mémoire | Bande passante | Prix (sept. 2026) | Consommation en charge | Stack adaptée |
|---|---|---|---|---|---|
| NVIDIA DGX Spark / ASUS GX10 (GB10) | 128 Go unifiée | 273 Go/s | 4 699 $ catalogue (US), dès 5 038 € HT (UE) | env. 160 W | vLLM, SGLang, EXL3, llama.cpp |
| AMD Ryzen AI Max+ 395 (Framework, EVO-X2) | 128 Go unifiée (env. 96–100 Go pour le GPU) | env. 256 Go/s | 3 449–3 650 $ (128 Go) | env. 112–120 W | llama.cpp Vulkan/ROCm |
| RTX 3090 (occasion) | 24 Go | 936 Go/s | env. 1 050–1 264 $ | 250–350 W | vLLM, llama.cpp, EXL3 |
| RTX 4090 (occasion) | 24 Go | 1 008 Go/s | env. 2 268–2 362 $ | env. 450 W | vLLM, llama.cpp |
| RTX 5090 | 32 Go | 1 792 Go/s | 1 999 $ prix conseillé, env. 4 700 $ en boutique | env. 575 W | vLLM, llama.cpp, NVFP4 |
| RTX PRO 6000 Blackwell | 96 Go | env. 1,8 To/s | 16 000 $ (sept. 2026) | jusqu'à 600 W | vLLM, SGLang, NVFP4 |
| MacBook Pro M5 Max | jusqu'à 128 Go | 614 Go/s | non vérifié | portable | MLX, mlx-serve, llama.cpp |
| Mac Studio M5 Ultra | 96/256/512 Go | 1,2 To/s | dès 5 499 $ ; 512 Go à partir d'octobre | pas encore mesuré sous charge LLM | MLX, LM Studio, llama.cpp |
Les prix ont fortement augmenté en 2026 à cause de la pénurie de DRAM et de GDDR7. La RTX PRO 6000 coûte environ 87 % de plus que son prix de lancement, et le GMKtec EVO-X2 128 Go est passé de 1 999 $ à 3 499–3 650 $. Nous n'avons pas encore de prix en euros vérifiés pour la plupart des cartes graphiques et des Mac, d'où les prix américains.
Modèle × matériel × tokens par seconde
Valeurs pour un seul flux, sauf mention contraire. [R] = test ou constructeur, [C] = rapport de la communauté sur X ou GitHub, [CS] = mesuré par Context Studios.
| Modèle | Matériel | Décodage | Remarque |
|---|---|---|---|
| Qwen3.8-27B (dense) Q4 | RTX 3090 / 4090 / 5090 | 40 / 46 / 75 t/s | llama.cpp standard, contexte 4k [R] |
| Qwen3.8-27B | RTX 5090 + MTP | 77 → 155 t/s | llama.cpp Q4_K_M [C] |
| Qwen3.8-27B | RTX 3090, vLLM optimisé | env. 114 t/s, env. 1 000 t/s sur 64 flux | recette syv-ai [C] |
| Qwen3.8-27B | DGX Spark | 12 t/s standard → 31–58 t/s optimisé | NVFP4 + MTP [R]/[C] |
| Qwen3.8-27B | Strix Halo | 11 → 24–30 t/s | Vulkan + MTP [R]/[C] |
| Qwen3.8-27B | M5 Max 128 Go | 31 → 65–69 t/s | MLX + MTP/DFlash2 [R]/[C] |
| Qwen3.8-Flash-Next (MoE) | Mac Studio M5 Ultra | plus de 100 t/s sur prompt court, 60–85 t/s à 64k–256k | test MacStories [R] |
| Qwen3.8-Flash-Next | MacBook Pro M5 Max | 56–101 t/s | mlx-serve, MTP [C] |
| Qwen3.8-Flash-Next | 1× DGX Spark | 65–81 t/s | vLLM/EXL3 + MTP [C] |
| Qwen3.8-Flash-Next | 2× DGX Spark, NVFP4 | 32,9 t/s, prefill 722 t/s (prompt de 1k) | notre mesure du 24/09, sans speculative decoding [CS] |
| Qwen3.8-Flash-Next | Strix Halo | 22–38 t/s | llama.cpp / Halogen [C] |
| Qwen3.8-Flash-Next | RTX PRO 6000 | 227 t/s, prefill 9 900 t/s | [C] |
| Qwen3.8-Flash-Next | 2× RTX PRO 6000 | 1 610 t/s sur 32 flux | vLLM standard [C] |
| GLM-5.3-Flash EXL3 4bpw | 2× DGX Spark (TP=2) | 32,9 t/s, 63,7 t/s cumulés sur 4 flux | notre mesure du 24/09 [CS] |
| GLM-5.3-Flash IQ2 | Strix Halo | 17–18 t/s | [C] |
| GLM-5.2 (grand MoE) | cluster 4× GB10 | 27 t/s, 76 t/s cumulés sur 6 flux | vLLM TP4 + MTP, juillet/août [CS] |
| DeepSeek-V4.1-Flash | 2× DGX Spark | 23 → 33 t/s | EXL3, contexte 1M [C] |
| DeepSeek-V4.1-Flash | 4× RTX PRO 6000 | env. 120–125 t/s stables jusqu'à 131k | [C] |
Le prefill compte plus qu'on ne le croit. Dans le test de MacStories, le M5 Ultra a lu un prompt de 15 500 tokens à 2 887 t/s, contre 1 143 t/s pour le M3 Ultra. Une RTX 5090 a atteint environ 3 000 t/s sur un prompt de 6k. Sur Strix Halo, un prompt d'un million de tokens a demandé 18 minutes. Un agent envoie à chaque tour 20 000 à 60 000 tokens de prompt système, d'outils et de mémoire : c'est souvent le prefill qui décide si une machine paraît rapide.
Mesures de la communauté sur X (septembre 2026)
Sauf mention contraire : décodage sur un seul flux. Ce sont des mesures publiées par des développeurs sur X, pas les nôtres. Les configurations varient (quantification, décodage spéculatif, moteurs patchés) : chaque ligne montre ce qu'une recette précise permet, pas une base garantie. L'écart entre les 62,9 t/s annoncés pour GLM-5.3-Flash sur deux Spark et nos 32,9 t/s montre à quel point une recette optimisée compte.
| Matériel | Modèle | Configuration | Décodage | Remarques | Source |
|---|---|---|---|---|---|
| 1× DGX Spark | Qwen3.8-Flash-Next | NVFP4, vLLM + MTP k=3 | 38 t/s | 53,8 t/s sur du code, 180 t/s cumulés sur 8 flux, ~2 000 t/s de prefill | @jvr0x |
| 1× DGX Spark | Qwen3.8-Flash-Next | EXL3 vs. NVFP4, vLLM | 78,3 vs. 31,0 t/s | même machine ; ~600 contre ~150 t/s cumulés sur 8 requêtes | @ViC305 |
| 2× DGX Spark (TP=2) | GLM-5.3-Flash | EXL3 4bpw, vllm-exl3 | 62,9 t/s | 146,5 t/s cumulés sur 4 flux | @yume_arasaki |
| 2× DGX Spark (TP=2) | GLM-5.3-Flash | NVFP4, patched vLLM | 46,3 t/s | un flux, raisonnement | @mr_r0b0t |
| 8× DGX Spark | GLM-5.3-Flash | NVFP4, vLLM | 96 t/s | 110 t/s sur 4 flux | @hypermac6502 |
| 16× DGX Spark | Kimi K3 (2.8T) | vLLM + GB10 patch | 29,8 t/s | 87 t/s cumulés sur 8 flux, ~20 t/s à 300k de contexte | @ciprianveg |
| RTX PRO 6000 (96 GB) | Qwen3.8-Flash-Next | SGLang, FP8 KV + MTP | 252,9 t/s | 819 t/s sur 8 flux, 1 190 t/s sur 16 | @wei_wang |
| 4× RTX PRO 6000 | GLM-5.3-Flash | vLLM | 240 t/s | ~12 000 t/s de prefill, 550 t/s cumulés sur 4 flux | @hiheyhowareya |
| Strix Halo (Ryzen AI Max+ 395) | Qwen3.8-Flash-Next | Lucebox ROCm | 38 t/s | 41,9 t/s à 8k de contexte | @luceboxai |
| RTX 4090 (24 GB) | Qwen3.8-27B | Q4_K_M, llama.cpp | 46 t/s | flash attention, cache KV quantifié | @yume_arasaki |
| RTX 3090 / 4090 (24 GB) | Qwen3.8-27B | EXL3 3.5bpw + DFlash | 94–105 t/s | en continu ; 130–150 t/s sur réponses courtes | @yume_arasaki |
| MacBook Pro M4 Max (128 GB) | Qwen3.8-27B | MLX 4-bit + MTP | 43 t/s | plage 42–44 t/s | @yume_arasaki |
Notre mesure (Context Studios, 24 septembre 2026)
Nous avons lancé un benchmark court et reproductible sur les endpoints que nous utilisons tous les jours. Les deux modèles tournent sur des paires de nœuds ASUS Ascent GX10 (NVIDIA GB10, 128 Go chacun) en tensor parallel 2 sur un réseau 100G RoCE. L'endpoint Qwen passe par un proxy LiteLLM sur notre Mac mini, ses chiffres incluent donc un saut réseau de plus.
| Modèle | Configuration | Décodage (1 flux) | Prefill (prompt d'env. 1k) | 4 flux en parallèle |
|---|---|---|---|---|
| GLM-5.3-Flash (MoE 320B, 18B actifs) | EXL3 4bpw, vLLM, 2× GX10 TP=2 | 32,9 t/s | 1 262 t/s | 63,7 t/s cumulés (env. 16,5 t/s par flux) |
| Qwen3.8-Flash-Next | NVFP4, vLLM via LiteLLM, 2× GX10 | 32,9 t/s | 722 t/s | 21,8 t/s cumulés (un flux est tombé à 7 t/s) |
Méthode. Streaming sur /v1/chat/completions, température 0, thinking désactivé, prompt technique fixe. Une exécution de chauffe est écartée, puis trois exécutions de 400 tokens de sortie ; nous retenons la médiane. Décodage = (tokens générés − 1) ÷ temps entre le premier et le dernier token. Le prefill est estimé par tokens du prompt ÷ temps jusqu'au premier token, avec un prompt d'environ 1 040 tokens. Il inclut la latence réseau et constitue donc une borne basse. Le test parallèle envoie quatre requêtes identiques de 400 tokens en même temps et divise le total des tokens générés par le temps réel écoulé. Les comptes de tokens proviennent du champ usage du serveur. Notre cluster sert des agents en production pendant ce temps : les valeurs parallèles sont un instantané, pas un résultat de laboratoire.
Vous pouvez refaire la mesure sur n'importe quel endpoint compatible OpenAI :
python3 bench_local.py http://VOTRE-HOTE:8000 id-du-modele 3 4
Ce que nous retenons de ces chiffres :
- Deux Spark suffisent pour un modèle de 320B à vitesse interactive. 33 t/s sur un flux, c'est fluide en chat comme dans les agents de code.
- Les chiffres Qwen plus élevés de la communauté viennent du speculative decoding. Les configurations avec MTP annoncent 65–81 t/s sur un seul Spark ; notre endpoint NVFP4 tourne sans MTP et atteint 33 t/s. Le speculative decoding est le levier le plus puissant : sur notre cluster de 4 nœuds, il a presque doublé GLM-5.2 (de 14,5 à 26,6 t/s).
- Le débit en parallèle dépend de tout ce qui tourne à côté. GLM a progressé de façon presque linéaire jusqu'à quatre flux ; la paire Qwen était occupée par le trafic des agents et un flux a décroché.
Mesure précédente : cluster 4× GB10 avec GLM-5.2 (juillet/août 2026)
| Ce que nous avons mesuré | Résultat |
|---|---|
| Décodage GLM-5.2 sur 1 / 2 / 3 / 4 / 6 flux parallèles (cumulé) | 27,2 / 42,6 / 52,1 / 62,7 / 75,8 t/s |
| Prefill prompt de 8k / 32k | 853 / 840 t/s |
| Effet du MTP (sans draft → k=2) | 14,5 → 26,6 t/s |
| Correction des cudagraph capture sizes | +38 % sur 2 flux |
| Longue conversation (22 tours, 104 846 tokens) | aucune dégradation |
| Démarrage à froid / redémarrage complet du cluster | 520 s / 13–14 min |
Ce que l'exploitation nous a appris : si deux flux vont à peine plus vite qu'un seul, les tailles de CUDA graph ne sont pas configurées, et une seule ligne de configuration nous a apporté 38 % de plus. La mémoire unifiée demande de la vigilance : l'OOM killer peut arrêter le moteur, et des conteneurs supprimés de force ont gardé de la mémoire jusqu'au redémarrage. Téléchargez un checkpoint une fois, puis copiez-le par le réseau : environ 15 minutes au lieu d'environ 48 heures pour trois nœuds de plus.
Que choisir selon le budget, l'usage et la taille du modèle
| Vous voulez… | Budget | Achetez | Pourquoi |
|---|---|---|---|
| Des modèles denses de 27–32B, rapides, pour une personne | env. 1 200–1 600 € | RTX 3090 d'occasion | Le plus de tokens par euro ; Qwen3.8-27B Q4 tient dans 24 Go |
| Servir une petite équipe (5 à 60 requêtes parallèles) avec un modèle de 27B | env. 2 500–3 500 € | 2× RTX 3090 ou une RTX 5090 | Débit en batch avec vLLM |
| Des modèles MoE de 100–300B, en silence sur le bureau | env. 3 500–4 000 € | Strix Halo 128 Go | Le plus de mémoire par euro ; prefill lent à accepter |
| Développer sur CUDA, prototyper pour des GPU de datacenter ou monter un cluster | env. 5 000–6 000 € par nœud | DGX Spark / GX10 | NVFP4, recettes vLLM, clustering 200G |
| La vitesse maximale pour un utilisateur avec de grands MoE et un long contexte | dès 5 499 $ | Mac Studio M5 Ultra | 1,2 To/s et jusqu'à 512 Go |
| Travailler en local en déplacement | élevé | MacBook Pro M5 Max 128 Go | 614 Go/s dans un portable |
| Servir des modèles de 700B et plus en production | dès 64 000 $ | 4× RTX PRO 6000 | 384 Go de VRAM, env. 120 t/s avec DeepSeek V4.1 Flash |
Repères selon la taille du modèle (4 bits) :
- Jusqu'à 32B dense : tient dans 24–32 Go de VRAM. Une seule carte RTX est l'option la plus rapide.
- Environ 70B dense : demande environ 48 Go et tourne lentement en mémoire unifiée (4–6 t/s sur Strix Halo).
- MoE de 100–320B : demande 64–128 Go. Spark, Strix Halo, M5 Max ou Mac Studio. Deux Spark font tourner GLM-5.3-Flash en 4 bpw avec de la marge pour un long contexte.
- MoE de 500B et plus : il faut un cluster de Spark, un Mac de 256–512 Go ou plusieurs RTX PRO 6000.
Coût par token : local ou cloud
Hypothèses : électricité à 0,37 €/kWh (moyenne allemande BDEW 2026), amortissement sur 3 ans (26 280 heures), fonctionnement 24 h/24 à pleine charge. C'est le meilleur scénario possible pour le matériel local.
| Configuration | Débit | Électricité seule | Matériel inclus | Référence cloud |
|---|---|---|---|---|
| 2× GX10, GLM-5.3-Flash, 4 flux [CS] | 63,7 t/s | env. 0,52 € / 1M tokens | env. 2,03 € / 1M tokens | API GLM-5.3-Flash : 0,50 $ / 1M en sortie |
| 4× GX10, GLM-5.2, 6 flux [CS] | 75,8 t/s | env. 0,87 € / 1M tokens | env. 3,41 € / 1M tokens | idem |
| RTX 3090 d'occasion, vLLM en batch, Qwen3.8-27B [C] | env. 1 000 t/s | env. 0,04 € / 1M tokens | env. 0,05 € / 1M tokens | API Qwen3.8-Flash : 0,47 $ / 1M en sortie |
Le calcul de la ligne 2× GX10 : 2 × environ 160 W = 0,32 kW, soit 0,118 € de l'heure. Le matériel (2 × 4 558 €, prix de détail allemand du 28 août 2026) réparti sur 26 280 heures représente 0,347 € de l'heure. 63,7 t/s donnent 229 320 tokens par heure, donc 0,465 € de l'heure correspondent à environ 2,03 € par million de tokens.
- Le cloud est environ 4 fois moins cher par token que notre configuration GLM sur deux nœuds, même à pleine charge.
- Une RTX 3090 exploitée à fond passe sous les prix des API pour les modèles de 27B, mais seulement avec un trafic en batch continu.
- Un utilisateur seul typique utilise le matériel moins de 10 % du temps, ce qui multiplie le coût local par 10 ou plus.
Notre conclusion : sur le prix par token, l'IA locale gagne rarement. Elle gagne sur la souveraineté des données, des coûts fixes prévisibles, l'absence de limites de débit et le contrôle total des modèles et du contexte. Si vous n'avez besoin que de tokens, l'API coûte moins cher. Si les données ne doivent pas quitter l'entreprise ou si vos agents doivent tourner 24 h/24 sans compteur, le matériel en propre se justifie.
Pièges fréquents selon la plateforme
- DGX Spark : la vitesse sur un flux est limitée par la bande passante ; les longs prefills à froid freinent le décodage parallèle ; les recettes de la communauté changent chaque semaine.
- Strix Halo : le paramètre noyau GTT est obligatoire ; les versions de ROCm et du noyau sont fragiles ; les longs prompts prennent plusieurs minutes.
- Cartes RTX : la VRAM se remplit vite ; déporter les poids vers la RAM système fait tomber la vitesse à un chiffre ; consommation et bruit élevés ; la 5090 coûte en boutique environ le double de son prix conseillé.
- Mac : NVIDIA garde l'avantage sur le prefill ; beaucoup de conversions MLX perdent la vision ou le MTP ; les modèles les plus récents demandent souvent des versions bêta.
Guides et comparatifs associés
- Guide matériel Qwen 3.8 27B : de la RTX 3090 au DGX Spark
- Le guide d'achat du Mac Studio pour l'IA locale
- Le coût de l'IA locale sur matériel Apple en 2026
- DGX Spark vs Mac Studio
- Agents LLM locaux vs cloud
- Code avec IA locale vs IA dans le cloud
Questions fréquentes
Quel est le meilleur matériel pour les LLM locaux en 2026 ?
Tout dépend de la taille du modèle et du nombre d'utilisateurs. Pour une personne qui utilise des modèles de 27–32B, une RTX 3090 d'occasion offre en septembre 2026 la meilleure vitesse par euro. Pour les modèles MoE de plus de 100B avec un long contexte, le Mac Studio M5 Ultra est la machine individuelle la plus rapide, tandis que le DGX Spark est préférable si vous avez besoin de CUDA, de clustering ou de nombreuses requêtes en parallèle.
Le DGX Spark vaut-il le coup face au Mac Studio M5 Ultra ?
Le M5 Ultra dispose d'environ 4,4 fois plus de bande passante mémoire (1,2 To/s contre 273 Go/s), il génère donc les tokens plus vite pour un utilisateur seul. Les atouts du Spark sont CUDA, le NVFP4, les recettes vLLM de la communauté qui arrivent en quelques jours et un clustering peu coûteux sur réseau 200G. Nous avons choisi des Spark parce que nous servons plusieurs agents en parallèle, et le débit total compte davantage pour nous que la vitesse d'un seul flux.
Quelle vitesse atteint GLM-5.3-Flash sur deux DGX Spark ?
Lors de notre mesure du 24 septembre 2026, GLM-5.3-Flash en EXL3 4bpw sur deux nœuds ASUS GX10 en tensor parallel 2 a atteint 32,9 tokens par seconde sur un flux. Avec quatre requêtes en parallèle, la paire a produit 63,7 tokens par seconde au total, soit environ 16,5 par flux. Le prefill d'un prompt d'environ 1 000 tokens a dépassé 1 200 tokens par seconde, latence réseau comprise.
AMD Strix Halo peut-il faire tourner de grands modèles comme GLM-5.3-Flash ?
Oui. Avec 128 Go de mémoire unifiée, dont environ 96–100 Go attribuables au GPU, il fait tourner des quantifications de 2 à 4 bits de modèles MoE de 200–300B à environ 13–38 t/s. La limite est le traitement du prompt : les longs contextes prennent plusieurs minutes, et un prompt d'un million de tokens a demandé 18 minutes dans un test. C'est une bonne machine de capacité pour un utilisateur patient, moins adaptée aux boucles d'agents avec d'énormes prompts.
Combien de tokens par seconde faut-il pour les agents de code ?
Pour le travail interactif, environ 30 t/s de décodage paraissent fluides et plus de 60 t/s donnent une impression de vitesse. Pour les agents, le prefill compte tout autant, car chaque tour envoie des dizaines de milliers de tokens de contexte. Une machine à 50 t/s de décodage mais 300 t/s de prefill paraîtra plus lente dans un agent qu'une machine à 40 t/s de décodage et 2 500 t/s de prefill.
L'IA locale revient-elle moins cher qu'une API ?
Par token, en général non. Même à pleine charge 24 h/24, notre configuration GLM-5.3-Flash sur deux nœuds coûte environ 2,03 € par million de tokens matériel inclus, alors que l'API GLM-5.3-Flash facture 0,50 $ par million de tokens en sortie. Le local l'emporte sur la confidentialité, des coûts fixes prévisibles, l'absence de limites de débit et le contrôle total, et une RTX 3090 d'occasion exploitée à fond peut battre les prix API pour les modèles de 27B.
Pourquoi le matériel coûte-t-il si cher en 2026 ?
Une pénurie mondiale de DRAM et de GDDR7 fait grimper le prix de tout ce qui embarque beaucoup de mémoire. NVIDIA a relevé le DGX Spark de 3 999 $ à 4 699 $ en février 2026, la RTX PRO 6000 coûte désormais 16 000 $ et les mini-PC Strix Halo de 128 Go ont pris environ 75 %. Les cartes d'occasion à mémoire GDDR6X plus ancienne, comme la RTX 3090, sont les moins touchées.
Sources
- MacStories – test du Mac Studio M5 Ultra : https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
- Macworld – annonce du Mac Studio M5 Ultra : https://macworld.com/article/3220024/apple-announces-the-m5-ultra-mac-studio-with-up-to-512gb-of-ram.html
- PCMag – Mac Studio (2026) M5 Ultra : https://uk.pcmag.com/desktop-pcs/167419/apple-mac-studio-2026-m5-ultra
- Ars Technica – test du Mac Studio M5 Ultra : https://arstechnica.com/gadgets/2026/09/review-apples-hyper-pricey-m5-ultra-mac-studio-made-me-into-a-vibe-coder
- Apple – caractéristiques du MacBook Pro M5 Pro/Max : https://support.apple.com/en-bn/126319
- pi3g – prix du NVIDIA DGX Spark, septembre 2026 : https://pi3g.com/nvidia-dgx-spark-price/
- Tom's Hardware – DGX Spark, consommation et efficacité : https://www.tomshardware.com/pc-components/gpus/nvidia-dgx-spark-review/4
- ComputingForGeeks – comparatif des mini-PC Ryzen AI Max+ 395 : https://computingforgeeks.com/ryzen-ai-max-395-mini-pc-comparison
- RunAIHome – RTX 5090 vs 4090 vs 3090 d'occasion : https://runaihome.com/blog/rtx-5090-vs-rtx-4090-vs-used-3090-local-ai-2026
- RunAIHome – hausse des prix des PC à mémoire unifiée : https://runaihome.com/blog/unified-memory-ai-pc-price-surge-mid-2026-buying-guide
- Thunder Compute – prix de la RTX PRO 6000 : https://www.thundercompute.com/blog/nvidia-rtx-pro-6000-pricing
- Alibaba Cloud – Qwen3.8-Flash-Next : https://www.alibabacloud.com/blog/qwen3-8-flash-next-a-new-architecture-towards-ultimate-cost-efficiency_603501
- Capital and Compute – prix de GLM-5.3-Flash : https://capitalandcompute.net/blog/glm-5-3-flash-pricing-benchmarks
- Hugging Face – GLM-5.3-Flash EXL3 4bpw (Mia-AiLab) : https://huggingface.co/Mia-AiLab/GLM-5.3-Flash-EXL3-TR3-4bpw
- BDEW – prix de l'électricité 2026 : https://www.bdew.de/energie/strompreise-dossier
- syv-ai – Qwen3.8-27B sur RTX 3090 : https://github.com/syv-ai/qwen38-27b-rtx3090
- Post X de @jvr0x (2026-09-19): https://x.com/jvr0x/status/2101331441980149887
- Post X de @ViC305 (2026-09-22): https://x.com/ViC305/status/2102228607494201632
- Post X de @yume_arasaki (2026-09-22): https://x.com/yume_arasaki/status/2102395182184534404
- Post X de @mr_r0b0t (2026-09-10): https://x.com/mr_r0b0t/status/2098096413020410362
- Post X de @hypermac6502 (2026-09-18): https://x.com/hypermac6502/status/2100862418360615112
- Post X de @ciprianveg (2026-09-20): https://x.com/ciprianveg/status/2101774114780590325
- Post X de @wei_wang (2026-09-22): https://x.com/wei_wang/status/2102204481995956450
- Post X de @hiheyhowareya (2026-09-20): https://x.com/hiheyhowareya/status/2101806099724644788
- Post X de @luceboxai (2026-09-16): https://x.com/luceboxai/status/2100218346448851435
- Post X de @yume_arasaki (2026-09-08): https://x.com/yume_arasaki/status/2097356548574179756
- Context Studios – mesures internes : 24 septembre 2026 (bench_local.py, méthode ci-dessus) et juillet/août 2026 (cluster 4× GB10, harnais interne)
Déployer l'IA locale dans votre équipe ?
Context Studios vous conseille sur le matériel, l'installation et l'exploitation de l'IA locale : du choix entre DGX Spark, Mac Studio ou serveur GPU jusqu'à l'inférence en production avec vLLM. Nous faisons tourner cette pile chaque jour, et les mesures de ce guide en sont issues.