Le guide d'achat du Mac Studio pour l'IA locale : achetez pour votre goulot d'étranglement
La génération M5 est la machine IA la plus ouverte qu'Apple ait jamais construite. Mais comparer 1 PFLOPs en FP4 à 1,2 To/s, c'est mettre dans la balance deux goulots d'étranglement totalement différents. Ce guide vous montre comment prendre la bonne décision — pas par le nom de la puce, mais par la seule question qui compte : Quel modèle voulez-vous vraiment tenir, et quel point de blocage définit alors votre quotidien ?
Sommaire
- La mécanique de fond : pourquoi le chiffre 4× en dit moins qu'il n'y paraît
- L'échelle de bande passante : où se situe le vrai saut de classe
- L'échelle de capacité : quelle classe de modèle votre mémoire peut-elle tenir
- Le piège à 50 dollars : 2×128 Go ≠ 1×256 Go
- La matrice de décision
- TCO : ce que l'exploitation coûte vraiment
- Le prompt de décision
1. La mécanique de fond : pourquoi le chiffre 4× en dit moins qu'il n'y paraît
L'équipe de recherche ML d'Apple a mesuré ce que font les accélérateurs neuronaux du M5 (machinelearning.apple.com, « Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU ») :
| Opération | Accélération M5 | Évolue avec |
|---|---|---|
| Délai avant le premier token (traitement du prompt) | jusqu'à 4,06× (3,33–4,06×) | Puissance de calcul |
| Génération (production de tokens) | seulement 1,19–1,27× (+19–27 %) | Bande passante mémoire |
Apple Newsroom (25.08.2026) confirme la page produit à la lettre : « up to 4.3x faster AI performance » sur le M5 Ultra par rapport au M3 Ultra — avec la précision « speeding up prompt processing ». Le chiffre 4× est un chiffre de prefill. Il mesure le moment précédant le premier token, pas l'expérience d'écriture qui suit.
Le traitement du prompt évolue avec le calcul. La génération évolue avec la bande passante.
Une fois cette mécanique assimilée, vous comprenez pourquoi les chiffres marketing passent à côté du point de blocage.
2. L'échelle de bande passante : où se situe le vrai saut de classe
La vitesse de génération — ce que vous ressentez réellement en écrivant — dépend de la bande passante mémoire. Et c'est ici que quelque chose de réel se produit vraiment :
| Puce | Bande passante | Classe |
|---|---|---|
| Mac mini M6 (base) | 170 Go/s | Entrée de gamme — le 27B Q4 tourne, mais laborieusement |
| M5 Pro | 307 Go/s | Machine 27B/32B solide |
| M5 Max | 614 Go/s | Première classe « proche de la frontière » |
| M3 Ultra | 819 Go/s | Référence précédente |
| M5 Ultra | 1 200 Go/s | Le seul saut de classe de la génération |
Seul le passage à l'Ultra « change de classe » : de 614 à 1 200 Go/s, c'est +95 %. De 546 (M4 Max) à 614 (M5 Max), c'est +12 % — entre les deux, vous rachetez la même classe sous un nouvel emballage.
La mémoire unifiée est à la fois une fonctionnalité et un impôt. macOS réserve 8 à 12 Go avant même que votre modèle ne se charge. Chaque onglet de navigateur, chaque outil de l'espace utilisateur puise dans le même pool. Quand vous lisez « 64 Go », lisez plutôt « ~54 Go pour le modèle ».
3. L'échelle de capacité : quelle classe de modèle votre mémoire peut-elle tenir
| RAM | Classe de modèle réaliste |
|---|---|
| 128 Go | Classe de 120–170 milliards de paramètres |
| 256 Go | Classe 300B |
| 512 Go | Classe 700B |
Référence concrète : Kimi K3 (2 800 milliards de paramètres, ~1,4 To) ne tient pas dans 512 Go. La limite est réelle — et c'est précisément pour cela que la taille de la mémoire décide de ce que vous pouvez faire tourner.
4. Le piège à 50 dollars : 2×128 Go ≠ 1×256 Go
C'est ici que le calcul entre en collision : un M5 Ultra avec 256 Go/1 To coûte 9 499 $. Deux bundles DGX Spark (128 Go chacun) coûtent ensemble 9 449 $ — une différence de 50 dollars.
Mais deux machines de 128 Go répartissent le travail. Un seul token 70B prend 269 ms à travers le pont réseau ; avec deux nœuds Spark, cela tombe à 133 ms — en échange de deux systèmes d'exploitation, deux interfaces réseau et la latence d'interconnexion. Un Mac de 256 Go tient le modèle dans un seul pool mémoire. Ce n'est pas une égalité technique : ce sont deux architectures différentes à la même position d'étiquette de prix.
Règle méta : 2×128 ≠ 1×256 — sauf si votre workflow est par nature répartissable (clusters CUDA, plusieurs travaux simultanés).
5. La matrice de décision
| Votre goulot d'étranglement | Votre machine | Pourquoi |
|---|---|---|
| Prompts à très long contexte (dominés par le prefill) | M5 Ultra | 4,06× TTFT — c'est exactement là que vous gagnez le plus de temps |
| Écriture fluide, tok/s élevé (dominé par le decode) | M5 Ultra (bande passante !) | 1 200 Go/s est le seul vrai saut de classe |
| Modèles 70B-Q4 fluides avec un budget abordable | M5 Max 128 Go | 614 Go/s + capacité adaptée |
| Charges CUDA répartissables, plusieurs travaux parallèles | 2× DGX Spark | 2×128 Go à prix cassé, si la répartition est acceptable |
| Classe 700B, expériences de pointe | M5 Ultra 512 Go (fin octobre) | Le seul chemin vers cette classe sur une seule machine |
6. TCO : ce que l'exploitation coûte vraiment
| Poste | DGX Spark | M5 Ultra |
|---|---|---|
| Consommation en charge | 125–160 W (pic 217 W) | ~35 W en veille, plage comparable en charge |
| Coût électrique (0,1816 €/kWh) | 100–120 $/an (8 h/jour) · ~200 $/an (24/7) | Comparable |
| Bruit | 29 dBA annoncé / 32 dBA en charge | Conception silencieuse |
| Philosophie de stockage | 4 To | 1 To + backend TB5 |
| Revente/garantie | Garantie constructeur | AppleCare 3 ans, transférable · M2 Ultra >75 % de valeur |
7. Le prompt de décision
Avant d'acheter, posez-vous trois questions :
- Quel modèle veux-je tenir ? (l'échelle de capacité — pas le plus gros chiffre que je peux me permettre)
- Est-ce que je lis plus ou est-ce que j'écris plus ? (prefill = dominé par le calcul → Ultra nécessaire ; decode = dominé par la bande passante → la bande compte)
- Puis-je répartir ma charge de travail ? (Si oui, 2× Spark peut être le calcul le plus pertinent — si non, le pool mémoire l'emporte)
Achetez pour votre goulot d'étranglement, pas pour le chiffre marketing.
FAQ
Comment savoir quel point de blocage est dominant chez moi ? Observez ce qui vous fait attendre : si la majeure partie du temps s'écoule avant que la réponse ne commence (longue attente après le prompt), votre goulot est le prefill — dominé par le calcul. Si la réponse démarre vite mais s'égrène ensuite mot après mot, votre goulot est le decode — dominé par la bande passante. Le premier cas exige de la puissance de calcul (M5 Ultra pour le TTFT de 4,06×), le second de la bande passante mémoire (M5 Ultra pour les 1 200 Go/s). Ce n'est presque jamais les deux à la fois.
Pourquoi la seule taille de la mémoire ne suffit-elle pas ? Parce que la bande passante détermine la vitesse à laquelle vous pouvez lire cette mémoire — et les deux sont indépendantes. Une machine avec beaucoup de RAM mais une faible bande passante charge de gros modèles mais écrit lentement. L'échelle de capacité vous dit quelle classe vous pouvez tenir ; l'échelle de bande passante vous dit si cette classe tourne de façon fluide ou laborieuse. Pour un achat, vous devez confronter les deux échelles à votre goulot d'étranglement, pas seulement regarder le chiffre de la RAM.
Le M5 Ultra est-il vraiment la seule machine à réaliser le saut de classe ? Oui, au sein de la génération M5, l'Ultra est le seul vrai saut de classe en bande passante (614 → 1 200 Go/s, +95 %). Tous les autres sauts des puces M4 aux M5 sont d'un chiffre à ~12 % — même ligue, nouvel emballage. Si vous voulez donc quitter la classe « proche de la frontière », l'Ultra est le seul chemin. Pour tout ce qui est en dessous, le M5 Max 128 Go est le choix le plus raisonnable.
Quand dois-je attendre la version 512 Go ? Quand vous voulez faire tourner la classe 700B (par exemple de gros modèles MoE). La configuration 512 Go n'arrive que fin octobre ; Apple n'a pas encore annoncé le prix, mais on s'attend à « bien au-dessus de 10 000 $ ». Pour la classe 300B, la version 256 Go suffit et est disponible immédiatement. Si votre goulot est en dessous de 700B, n'attendez pas — la crise de la DRAM rend la mémoire plus chère avec le temps, pas moins chère.
Est-ce que 2× DGX Spark est toujours pire qu'1× M5 Ultra ? Non — c'est différent, pas pire. Avec ~50 dollars d'écart, c'est une question d'architecture. Deux nœuds Spark offrent le double de mémoire (2×128 Go) et sont conçus pour des charges CUDA répartissables ; un token 70B prend 269 ms à travers le pont réseau au lieu de 133 ms avec la répartition. Le M5 Ultra, lui, tient le même modèle dans un seul pool mémoire sans latence d'interconnexion. Si votre charge répartit plusieurs travaux parallèles, le cluster l'emporte ; si vous voulez un seul gros modèle, le Mac l'emporte.
Sources
- Apple ML Research : « Exploring LLMs with MLX and the Neural Accelerators in the M5 GPU » (machinelearning.apple.com)
- Apple Newsroom, 25.08.2026 : annonce du M5 Max/M5 Ultra
- Spécifications produit Apple (bandes passantes, mémoire unifiée)
- Prévision Gartner DRAM/NAND 2026 · épuisement HBM de Micron · déclarations de Tim Cook sur la mémoire (juillet 2026)
- Ars Technica / Tom's Hardware (mars 2026 : option 512 Go retirée)
- wccftech / OnMSFT / Macfax / MacRumors (marché de la revente)
- ComputerBase (mesures indépendantes DGX Spark) · forum NVIDIA / heise / overclock3d (prix GB10)
- Yume_X (29.08.2026) · vérification propre 31.08.2026