Mis à jour le 24 septembre 2026. Apple a présenté le Mac Studio avec M5 Ultra le 25 août 2026. D'après l'Apple Store, la configuration 512 Go arrivera « fin octobre ». Nous mettrons ce guide à jour dès que de nouvelles mesures seront disponibles.
En bref : en septembre 2026, le M5 Ultra est la machine unique et silencieuse la plus rapide pour les grands modèles mixture-of-experts comme Qwen3.8-Flash-Next ou GLM-5.3-Flash. Il offre 1,2 To/s de bande passante mémoire et jusqu'à 256 Go (bientôt 512 Go) de mémoire unifiée. Pour les modèles denses qui tiennent dans 32 Go, une RTX 5090 reste plus rapide. Si vous avez besoin de CUDA, de clustering ou de nombreux utilisateurs simultanés, le DGX Spark est le meilleur choix. Et si seul le coût par token compte, le cloud l'emporte : selon nos calculs, l'inférence locale sur le M5 Ultra coûte environ 1,70 à 2,70 € par million de tokens de sortie, contre 0,47 $ pour l'API Qwen3.8-Flash.
Chez Context Studios, nous exploitons depuis l'été 2026 un cluster de quatre ASUS Ascent GX10 (NVIDIA GB10, le même matériel que le DGX Spark). Nous nous sommes donc posé la question nous-mêmes : aurions-nous dû acheter des Mac Studio plutôt que des Spark ? Ce guide est notre réponse honnête, fondée sur des caractéristiques vérifiées, des tests indépendants, des mesures de la communauté X et nos propres mesures du 24 septembre.
Les caractéristiques vérifiées en 60 secondes
| Caractéristique | M5 Ultra (base) | M5 Ultra (haut de gamme) |
|---|---|---|
| CPU | 30 cœurs (10 super-cœurs, 20 cœurs performance) | 36 cœurs |
| GPU | 64 cœurs avec Neural Accelerators | 80 cœurs avec Neural Accelerators |
| Neural Engine | 32 cœurs | 32 cœurs |
| Bande passante mémoire | 1,2 To/s | 1,2 To/s |
| Mémoire unifiée | 96 Go | 256 Go ou 512 Go (512 Go à partir de fin octobre, uniquement avec le GPU 80 cœurs) |
| SSD | 1 To | jusqu'à 16 To |
| Connectique | 4× Thunderbolt 5 (120 Gbit/s), Ethernet 10 Gbit, HDMI 2.1 | identique |
| Puissance continue maximale (alimentation) | 480 W | 480 W |
Source : fiche technique Apple et Apple Newsroom du 25/08/2026. La nouveauté est l'architecture à quatre dies : grâce à UltraFusion, Apple assemble quatre dies en une seule puce. D'après Apple, la bande passante est supérieure de 50 % à celle du M3 Ultra (819 Go/s). C'est précisément ce chiffre qui compte pour les LLM locaux, car générer chaque token oblige à lire en mémoire les poids actifs du modèle.
Prix en France, en Allemagne et aux États-Unis
Nous avons relevé ces prix directement dans le configurateur de l'Apple Store (Allemagne et États-Unis) le 24 septembre 2026. Les prix français peuvent différer légèrement en raison de la TVA : vérifiez-les sur l'Apple Store France avant d'acheter.
| Configuration | Allemagne | États-Unis |
|---|---|---|
| M5 Ultra 30C/64G, 96 Go, 1 To | 6 599 € | 5 499 $ |
| M5 Ultra 36C/80G, 96 Go, 1 To | 8 029 € | 6 799 $ |
| M5 Ultra 30C/64G, 256 Go, 1 To | 10 999 € | 9 499 $ |
| M5 Ultra 36C/80G, 256 Go, 1 To | 12 429 € | 10 799 $ |
| Supplément 96 → 256 Go | +4 400 € | +4 000 $ |
| M5 Ultra 512 Go | pas encore de prix | pas encore de prix |
| À titre de comparaison : M5 Max (entrée de gamme) | 2 999 € | 2 499 $ |
Tom's Hardware fait état de délais de livraison de 16 à 18 semaines pour son unité de test (GPU 80 cœurs, 256 Go, 4 To, 12 299 $). Ars Technica estime que la version 512 Go coûtera « 20 000 dollars et plus ». Il s'agit d'une estimation, pas d'un prix Apple.
Benchmarks : ce que le M5 Ultra fait vraiment
Nous n'avons pas de M5 Ultra en interne. Tous les chiffres concernant le Mac proviennent de trois tests indépendants à la méthodologie publiée, ainsi que de mesures de la communauté que nous signalons séparément plus bas. Les résultats dépendent fortement du runtime, de la quantification et de la longueur du contexte : ne comparez les valeurs qu'au sein d'un même tableau.
Qwen3.8-Flash-Next (MoE) avec MLX
MacStories a comparé le M5 Ultra (256 Go) au M3 Ultra (512 Go) avec oMLX 0.7.0.dev2 :
| Longueur du contexte | Décodage M3 Ultra | Décodage M5 Ultra | Time to first token M5 Ultra |
|---|---|---|---|
| 4K | 59,0 t/s | 90,7 t/s | 2,5 s |
| 16K | 53,5 t/s | 87,8 t/s | 6,2 s |
| 64K | 45,3 t/s | 83,8 t/s | 23,7 s |
| 128K | 37,0 t/s | 60,6 t/s | 49,2 s |
| 256K | 38,6 t/s | 74,7 t/s | 101,5 s |
En traitement du prompt (prefill), le M5 Ultra lit un prompt de 16K à 2 887 t/s (M3 Ultra : 1 143 t/s) et atteint encore environ 2 550 t/s à 256K. C'est environ 2,5 fois la génération précédente, grâce aux nouveaux Neural Accelerators intégrés à chaque cœur GPU. Sur des prompts courts, Flash-Next atteint une médiane de 108 t/s sur trois passes, soit 54 % de plus que le M3 Ultra (70 t/s).
GLM-5.3-Flash avec MLX
Pour GLM-5.3-Flash (MLX, mixte 4/8 bits), MacStories mesure sur le M5 Ultra 41 t/s en décodage et 1 107 t/s en prefill sur un prompt de 16K. Le M3 Ultra plafonne à 26 t/s et 428 t/s. À noter : la vitesse d'écriture de GLM inclut ici les tokens de raisonnement.
Qwen 3.8 27B (dense) avec llama.cpp
Tom's Hardware mesure Qwen 3.8 27B Q4_K_M avec llama.cpp, sans multi-token prediction :
| Contexte | Mac Studio M5 Ultra | Mac Studio M4 Max | DGX Spark |
|---|---|---|---|
| 0 | 46,3 t/s | 22,7 t/s | 11,8 t/s |
| 16K | 43,4 t/s | 21,1 t/s | 11,0 t/s |
| 64K | 32,4 t/s | 14,6 t/s | 9,3 t/s |
| 128K | 30,1 t/s | 9,0 t/s | 7,7 t/s |
Avec LM Studio, Ars Technica obtient « un peu plus de 50 » tokens par seconde pour le même modèle en 4 bits. Le Mac Studio M5 Max atteint environ 31 t/s, tandis qu'un Framework Desktop (Strix Halo) et un Mac Studio M2 Max tournent chacun autour de 18 à 20 t/s.
Face à la RTX 5090
MacStories a également opposé Qwen 3.8 27B sur le Mac à un PC gaming équipé d'une RTX 5090 (32 Go). Sur un prompt de 6 091 tokens, la 5090 lit à 3 031 t/s, le M5 Ultra à 1 701 t/s et le M3 Ultra à 414 t/s. En écriture, la 5090 atteint 59 t/s et le M5 Ultra 48 t/s. Tant que le modèle tient dans 32 Go de VRAM, la 5090 est donc environ 25 % plus rapide en décodage et presque deux fois plus rapide en prefill. Dès qu'il ne tient plus, la situation s'inverse : en débordant sur la RAM système, la 5090 est tombée à 4,6 à 1,5 t/s dans le même test.
Ce que mesure la communauté sur X
Depuis la livraison des premières machines, de nouveaux chiffres sur le M5 Ultra apparaissent chaque jour sur X. Le 24 septembre, nous avons rassemblé via la recherche X les mesures les plus vues. Ce sont des essais ponctuels avec des runtimes et des réglages différents, pas des benchmarks contrôlés. Ils montrent toutefois à quelle vitesse le logiciel MLX rattrape son retard.
| Qui | Modèle / configuration | Résultat | Lien |
|---|---|---|---|
| @mweinbach (163 000 vues) | Qwen3.8-Flash-Next, en batch | 3 740 t/s de prefill, 149 t/s de décodage (« presque le double d'hier ») | Post |
| @viticci (MacStories) | Flash-Next 4/8 bits, MLX-Serve v26.9.5 | plus de 3 500 t/s de prefill, 110 t/s sur de la prose courte | Post |
| @wei_wang | Flash-Next, agents multi-tours avec appels d'outils | 60–85 t/s, prefill en moyenne ~2,5× plus rapide que le M3 Ultra | Post |
| @MiaAI_lab (144 000 vues) | GLM-5.3-Flash, M5 Ultra vs 2× DGX Spark | M5 Ultra : 28 t/s en décodage, 1 016 t/s en prefill ; 2× Spark : 39 t/s, 1 700 t/s | Post |
| @MiaAI_lab | Qwen3.8-Flash sur 2× DGX Spark | 56,8 t/s en flux unique, 146 t/s sur 4 flux, 3 500 t/s de prefill | Post |
Deux constats. D'abord, les chiffres du Mac doublent parfois en une journée, car les kernels pour les nouveaux Neural Accelerators sont en cours d'écriture. Ensuite, les recettes de la communauté pour le Spark sont bien optimisées. Le duel « M5 Ultra contre deux Spark » tourne à l'avantage de l'un ou de l'autre selon le modèle et le jour.
Nos propres mesures : 2× GX10 le 24 septembre
Pour mettre en perspective les chiffres de la communauté, nous avons effectué des mesures le 24 septembre sur deux nœuds de notre cluster (ASUS Ascent GX10, tensor parallel via RoCE 100G). Méthode : chat completions en streaming, température 0, thinking désactivé, un warm-up, médiane de trois passes, 400 tokens de sortie.
| Modèle sur 2× GX10 | Quantification / moteur | Décodage flux unique | 4 flux simultanés (total) |
|---|---|---|---|
| GLM-5.3-Flash | EXL3 4 bpw, vLLM | 32,9 t/s | 63,7 t/s (environ 16–17 t/s par flux) |
| Qwen3.8-Flash-Next | NVFP4, vLLM derrière un proxy LiteLLM | 32,9 t/s | non fiable (un flux s'est effondré) |
Avec un prompt court d'environ 1 000 tokens, nous avons mesuré 1 262 t/s de prefill pour GLM-5.3-Flash, réseau compris. C'est une borne basse, pas une valeur en contexte long. Mise en perspective : en flux unique sur GLM-5.3-Flash, le M5 Ultra devance nos deux nœuds avec 41 t/s (MacStories). Sur quatre flux simultanés, les deux GX10 produisent davantage au total. Pour Qwen3.8-Flash-Next, notre configuration NVFP4 actuelle, à 32,9 t/s, reste nettement en dessous des 56,8 t/s que Mia AI Lab obtient sur deux Spark, et clairement derrière le M5 Ultra. Sur ce point, notre configuration n'est pas au niveau de la communauté, et nous préférons le dire.
Nous disposons aussi de valeurs de l'été pour le plus grand GLM-5.2 sur les quatre nœuds : 27,2 t/s sur un flux, 75,8 t/s sur six flux, et un prefill de 853 t/s (8K) et 840 t/s (32K).
La question du prompt processing : rattrapé, pas dépassé
La faiblesse la plus connue d'Apple Silicon était la lenteur de lecture des longs prompts. Pour les workflows agentiques avec 50 000 tokens de contexte ou plus, c'est déterminant. Le M5 Ultra fait ici son plus grand bond, sans toutefois combler totalement l'écart avec NVIDIA :
- Face à la RTX 5090, il lit environ deux fois moins vite (1 701 contre 3 031 t/s).
- Face au DGX Spark, il est plus rapide en contexte court et moyen. Tom's Hardware mesure un time to first token plus court jusqu'à 32K (42,2 s contre 49,1 s à 32K). À 64K, les deux sont à égalité (environ 104 s), et à 128K le Spark prend l'avantage (236,8 s contre 295,8 s).
- Face au M3 Ultra, il est environ 2,5 fois plus rapide.
Cela rejoint notre expérience avec le GB10 : ses 273 Go/s de bande passante le freinent en décodage, mais il est performant en prefill, très gourmand en calcul.
Conseils d'achat : quel modèle pour quelle mémoire ?
Règle empirique : des poids en 4 bits demandent environ 0,55 à 0,6 Go par milliard de paramètres. Il faut y ajouter le cache KV pour le contexte et une marge d'environ 15 à 20 % pour macOS. Pour les modèles MoE, c'est le nombre total de paramètres qui détermine la mémoire nécessaire, et le nombre de paramètres actifs qui détermine la vitesse.
| Palier de mémoire | Tient bien | Juste ou ne tient pas | Recommandation |
|---|---|---|---|
| 96 Go (dès 6 599 €) | Qwen 3.8 27B en 8 bits ou BF16, gpt-oss-120b, Qwen3.8-Flash-Next en 4 bits avec un contexte modéré (un retour de la communauté indique environ 68 Go) | GLM-5.3-Flash, longs contextes de 256K avec Flash-Next | Un bon point de départ pour un modèle avec un contexte moyen. Un Mac Studio M5 Max de 128 Go est souvent le meilleur choix ici, pour moitié prix. |
| 256 Go (dès 10 999 €) | Flash-Next oQ4e/oQ5e avec un contexte de 256K (pic de 155 à 179 Go selon MacStories), GLM-5.3-Flash en MLX 4/8 bits, trois sessions Flash-Next en parallèle | Flash-Next en 6 ou 8 bits uniquement avec les tables d'embedding déportées sur SSD ; oMLX alloue au maximum environ 200 Go | Le meilleur compromis pour le travail agentique avec de grands modèles MoE. |
| 512 Go (fin octobre, prix non communiqué) | Candidats : DeepSeek-V4.1-Flash, GLM-5.3 en quantification plus élevée, plusieurs grands modèles simultanément | Aucune mesure disponible | À n'acheter que si un modèle précis dépasse 256 Go. |
Un détail relevé par MacStories montre à quel point cette limite est stricte : sur la machine de 256 Go, macOS a arrêté Flash-Next en 6 bits pour pression mémoire à 176,6 Go. oMLX a même refusé de charger la version 8 bits. Prévoyez au moins 20 % de marge au-delà de la taille brute du modèle.
Coût par token : nos calculs
Hypothèses (à adapter à votre situation) : électricité à 0,37 €/kWh (moyenne BDEW pour l'Allemagne en 2026), amortissement sur trois ans en fonctionnement 24/7, pleine utilisation. Il n'existe pas encore de mesure de consommation du M5 Ultra sous charge LLM. Ars Technica a mesuré 75 W en encodage vidéo et Apple indique 480 W de puissance continue maximale : nous calculons sur cette fourchette. Pour un nœud GX10, nous retenons 160 W (Tom's Hardware, DGX Spark sous charge GPU) et un prix d'achat de 4 558 € (commerce allemand, août 2026).
| Système | Modèle / charge | Débit | Matériel | Coût par million de tokens de sortie |
|---|---|---|---|---|
| Mac Studio M5 Ultra 80C/256 Go | Flash-Next, 3 requêtes simultanées (MacStories) | 81,5 t/s | 12 429 € | 1,71–2,22 € |
| Mac Studio M5 Ultra 80C/256 Go | Flash-Next, une requête avec un prompt de 6,5K (MacStories) | 66,2 t/s | 12 429 € | 2,10–2,73 € |
| Mac Studio M5 Ultra 80C/256 Go | GLM-5.3-Flash, une requête (MacStories) | 41 t/s | 12 429 € | 3,39–4,41 € |
| 2× ASUS GX10 (notre mesure) | GLM-5.3-Flash, 4 flux | 63,7 t/s | 9 116 € | ~2,03 € |
| 2× ASUS GX10 (notre mesure) | GLM-5.3-Flash, un flux | 32,9 t/s | 9 116 € | ~3,93 € |
| 4× ASUS GX10 (notre cluster) | GLM-5.2, 6 flux | 75,8 t/s | 18 232 € | ~3,41 € |
| API cloud | Qwen3.8-Flash (Alibaba Cloud) | – | – | 0,47 $ |
| API cloud | GLM-5.3-Flash (Z.ai) | – | – | 0,50 $ |
Le verdict est clair : aucune de ces machines n'est rentable sur le seul prix par token. Même à pleine charge, l'API coûte plusieurs fois moins cher. En pratique, un poste de travail unique tourne souvent à moins de 10 % d'utilisation, ce qui multiplie le coût par token par dix. On achète l'inférence locale pour la confidentialité des données, des coûts fixes prévisibles, l'indépendance vis-à-vis des rate limits et la liberté de choisir ses modèles. Côté énergie, le Mac est performant : même avec 480 W supposés, il consomme environ 1,6 kWh par million de tokens pour Flash-Next avec trois requêtes. Notre cluster de quatre nœuds consomme environ 2,4 kWh pour GLM-5.2.
Mac Studio M5 Ultra ou DGX Spark : lequel choisir ?
Nous avons délibérément choisi du matériel GB10 cet été et, pour notre usage, nous referions le même choix. Les raisons ne sont toutefois pas celles que suggèrent la plupart des tableaux de benchmarks.
Ce qui plaide pour le Spark (d'après notre exploitation) :
- CUDA et recettes de la communauté. Les nouveaux modèles reçoivent souvent en quelques jours des recettes vLLM ou SGLang optimisées pour le Spark, avec NVFP4 et speculative decoding.
- Passage à l'échelle sur plusieurs nœuds. Avec du ConnectX 200G et un switch RoCE 100G, nous faisons tourner GLM-5.2 en tensor parallel sur quatre nœuds. Nous téléchargeons une seule fois les gros checkpoints et les répartissons sur les autres nœuds via RoCE en environ 15 minutes au lieu de 48 heures.
- Concurrence. Notre cluster fait passer GLM-5.2 de 27,2 t/s sur un flux à 75,8 t/s sur six. Deux nœuds doublent presque le débit de GLM-5.3-Flash entre un et quatre flux (32,9 → 63,7 t/s). Plusieurs agents et utilisateurs partagent le matériel.
- Prix d'entrée par nœud. En août, un GX10 coûtait 4 558 € en Allemagne. Les prix ont nettement augmenté depuis (Cyberport : de 4 000 € à 5 199 € en six semaines).
Ce qui plaide pour le Mac Studio :
- Vitesse en flux unique. Sur Qwen 3.8 27B, Tom's Hardware mesure près de quatre fois la vitesse de décodage d'un Spark seul (46,3 contre 11,8 t/s). Avec 1,2 To/s contre 273 Go/s, c'est de la physique pure.
- Une machine, pas un cluster. 256 Go dans un seul boîtier remplacent deux Spark, sans réseau dédié, sans configuration tensor parallel et sans les 13 à 14 minutes que prend un redémarrage de notre cluster.
- Silence et efficacité. Le Mac est silencieux : MacStories le décrit comme nettement plus discret que son propre PC équipé d'une 5090.
- La dynamique MLX. La communauté MLX (oMLX, mlx-lm, MLX-Serve, variantes MTP) progresse vite, et les nouveaux modèles MoE sont souvent disponibles en quantification MLX dès le premier jour.
Notre guide de décision :
| Vous voulez… | Choisissez |
|---|---|
| utiliser seul un grand modèle MoE, vite et en silence | Mac Studio M5 Ultra, 256 Go |
| servir une équipe ou plusieurs agents en parallèle | DGX Spark / GX10 (à partir de 2 nœuds) |
| faire du fine-tuning ou utiliser des outils CUDA | DGX Spark |
| faire tourner le plus vite possible un modèle dense jusqu'à 32 Go | RTX 5090 |
| 128 Go de mémoire unifiée au prix le plus bas | AMD Strix Halo (le prefill est son point faible) |
| tester en local des modèles de plus de 400 Go de poids | attendre le M5 Ultra 512 Go ou un cluster Spark de 3 à 4 nœuds |
Face à Strix Halo et à la RTX 5090
| Plateforme | Mémoire | Bande passante | Qwen 3.8 27B (décodage) | Points forts | Points faibles |
|---|---|---|---|---|---|
| Mac Studio M5 Ultra | 96–512 Go | 1,2 To/s | 46–50 t/s | grands modèles MoE, silencieux | prix, prefill inférieur à NVIDIA |
| DGX Spark / GX10 | 128 Go | 273 Go/s | 11,8 t/s (llama.cpp), 33–35 t/s (SGLang + MTP, communauté) | CUDA, clustering, concurrence | décodage en flux unique |
| AMD Strix Halo | jusqu'à 128 Go | ~256 Go/s | 18–20 t/s (Ars, LM Studio) | prix par Go | prefill, maturité logicielle |
| RTX 5090 | 32 Go | 1,79 To/s | 59 t/s (MacStories), 75 t/s (llama.cpp) | vitesse, prefill | seulement 32 Go, 575 W |
Pour en savoir plus sur Qwen 3.8 27B sur toutes les plateformes, consultez notre guide matériel Qwen 3.8 27B. Le calcul des coûts du Mac mini au M5 Ultra se trouve dans Le coût de l'IA locale sur matériel Apple en 2026.
Démarrage rapide : Flash-Next sur le Mac Studio
Pour un premier test, mlx-lm suffit. Les commandes ci-dessous sont un exemple minimal. Vérifiez d'abord sur Hugging Face le nom exact de la quantification souhaitée.
pip install -U mlx-lm
mlx_lm.server --model mlx-community/<depot-flash-next-4bit> --port 8080
Vous disposez alors d'une API compatible OpenAI sur le port 8080, à brancher dans Hermes Agent, Codex ou Open WebUI. Pour la multi-token prediction, MacStories utilise oMLX, qui est encore en développement.
Conclusion
Le Mac Studio M5 Ultra est la meilleure machine unique pour les grands modèles ouverts que l'on puisse acheter en septembre 2026. Avec 1,2 To/s et 256 Go, des modèles comme Qwen3.8-Flash-Next deviennent pour la première fois exploitables au quotidien pour le travail agentique, à 60–90 t/s même avec un long contexte. Ce n'est pas pour autant une machine à tout faire. NVIDIA reste devant en traitement du prompt, un cluster Spark monte mieux en charge avec de nombreux utilisateurs simultanés, et pour les modèles denses de 27B une RTX 5090 est plus rapide et moins chère.
Chez Context Studios, le cluster GB10 reste le bon choix, car nous servons des agents en parallèle et profitons des recettes CUDA de la communauté. Si nous devions acheter aujourd'hui un poste de travail unique et silencieux pour de grands modèles, ce serait un M5 Ultra de 256 Go. Pour la version 512 Go, mieux vaut attendre le prix et les benchmarks.
FAQ
Quelle est la vitesse du Mac Studio M5 Ultra avec des LLM locaux ?
Cela dépend fortement du modèle. Avec le modèle MoE Qwen3.8-Flash-Next, MacStories mesure environ 108 t/s sur des prompts courts et encore 83,8 t/s avec 64K de contexte. Avec le modèle dense Qwen 3.8 27B, Tom's Hardware mesure avec llama.cpp 46,3 t/s sans contexte et 30,1 t/s à 128K. Il est donc environ deux fois plus rapide qu'un M4 Max et, sur Flash-Next, de 54 à 94 % plus rapide que le M3 Ultra selon le contexte.
96 Go suffisent-ils, ou faut-il 256 Go ?
96 Go suffisent pour des modèles denses jusqu'à environ 70 milliards de paramètres en 4 bits, ainsi que pour Qwen3.8-Flash-Next en 4 bits avec un contexte modéré. Pour utiliser de grands modèles MoE comme GLM-5.3-Flash ou Flash-Next avec 256K de contexte, il faut 256 Go. Gardez en tête que macOS et le runtime ne libèrent pas toute la mémoire. Sur la version 256 Go, oMLX n'alloue qu'environ 200 Go à un seul modèle.
Le Mac Studio M5 Ultra est-il meilleur qu'un DGX Spark ?
Pour un utilisateur seul, le M5 Ultra est bien plus rapide qu'un Spark isolé. Sur Qwen 3.8 27B, Tom's Hardware mesure près de quatre fois la vitesse de décodage. Le DGX Spark l'emporte sur CUDA, les recettes rapides de la communauté, le clustering via ConnectX et la montée en charge avec de nombreuses requêtes simultanées. Face à deux Spark, la course est ouverte : selon le modèle et l'état du logiciel, c'est tantôt le Mac, tantôt la paire de Spark qui mène.
Combien coûte le Mac Studio M5 Ultra ?
En Allemagne, la version de base avec CPU 30 cœurs, GPU 64 cœurs, 96 Go et 1 To coûte 6 599 €, contre 5 499 $ aux États-Unis. Le GPU 80 cœurs ajoute 1 430 € et le passage de 96 à 256 Go 4 400 € de plus. La version 256 Go entièrement équipée avec un SSD de 1 To revient ainsi à 12 429 €, et la version 512 Go n'a pas encore de prix. Le prix en France peut légèrement différer en raison de la TVA.
L'IA locale sur le M5 Ultra est-elle rentable ?
Pas sur le seul prix par token. Nos calculs donnent environ 1,70 à 2,70 € par million de tokens de sortie pour Flash-Next à pleine charge, alors que des API cloud comparables tournent autour de 0,50 $. L'inférence locale se justifie par la confidentialité des données, des coûts prévisibles, l'indépendance vis-à-vis des fournisseurs et des rate limits, ainsi que la liberté de choix des modèles. Si vous traitez des données sensibles ou faites tourner des agents en continu, vous obtenez en retour une vraie valeur.
Quelle est la consommation électrique du Mac Studio M5 Ultra ?
Apple indique une puissance continue maximale de 480 W. C'est la limite de l'alimentation, pas une valeur typique. Ars Technica a mesuré environ 75 W en encodage vidéo, et nous n'avons pas encore vu de mesure indépendante sous charge LLM. À titre de comparaison, un DGX Spark consomme environ 160 W à la prise sous charge GPU, et une RTX 5090 seule peut monter jusqu'à 575 W.
Vous voulez déployer l'IA locale pour votre équipe ? Context Studios vous conseille sur le matériel, la mise en place et l'exploitation, d'un seul Mac Studio jusqu'à un cluster multi-nœuds. Nous contacter
Sources
- Apple – Caractéristiques techniques du Mac Studio : https://www.apple.com/fr/mac-studio/specs/
- Apple Newsroom – M6 et M5 Ultra (25/08/2026) : https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute/
- Apple Store Allemagne – Configurer le Mac Studio (prix au 24/09/2026) : https://www.apple.com/de/shop/buy-mac/mac-studio
- Apple Store États-Unis – Mac Studio (prix au 24/09/2026) : https://www.apple.com/shop/buy-mac/mac-studio
- MacStories – Test du Mac Studio M5 Ultra : https://www.macstories.net/stories/m5-ultra-mac-studio-review-the-dream-mac-for-local-ai-agents/
- Tom's Hardware – Test de l'Apple Mac Studio (M5 Ultra) : https://www.tomshardware.com/desktops/mini-pcs/apple-mac-studio-m5-ultra-review
- Ars Technica – Test du Mac Studio M5 Ultra : https://arstechnica.com/gadgets/2026/09/review-apples-hyper-pricey-m5-ultra-mac-studio-made-me-into-a-vibe-coder/
- Tom's Hardware – Test du DGX Spark (consommation) : https://www.tomshardware.com/pc-components/gpus/nvidia-dgx-spark-review/4
- Alibaba Cloud – Qwen3.8-Flash-Next (tarifs API) : https://www.alibabacloud.com/blog/qwen3-8-flash-next-a-new-architecture-towards-ultimate-cost-efficiency_603501
- Capital and Compute – Tarifs GLM-5.3-Flash : https://capitalandcompute.net/blog/glm-5-3-flash-pricing-benchmarks
- BDEW – Analyse des prix de l'électricité en Allemagne : https://www.bdew.de/energie/strompreise-dossier
- X : @mweinbach https://x.com/mweinbach/status/2102224017650594212 · @viticci https://x.com/viticci/status/2102121905385820413 · @wei_wang https://x.com/wei_wang/status/2102054751261131075 · @MiaAI_lab https://x.com/MiaAI_lab/status/2102098618035356156 et https://x.com/MiaAI_lab/status/2102507937646235875
- Context Studios – mesures internes sur 2× ASUS Ascent GX10 (GLM-5.3-Flash EXL3, Qwen3.8-Flash-Next NVFP4, vLLM, 24/09/2026) et sur 4× GX10 (GLM-5.2, vLLM, TP4, juillet/août 2026)