IA locale

Le coût de l'IA locale sur matériel Apple en 2026 : du Mac mini au M5 Ultra 512 Go

Le coût de l'IA locale sur matériel Apple en 2026 : du Mac mini au M5 Ultra 512 Go

Le coût de l'IA locale sur matériel Apple en 2026 : du Mac mini au M5 Ultra 512 Go

TL;DR : Les trois modèles Flash open-weight d'août 2026 — Qwen 3.8 Flash Next, GLM 5.3 Flash et DeepSeek V4 Flash — font voler en éclats la logique classique des 27B. Le point d'entrée raisonnable se situe à 96 Go, le cheval de bataille est la configuration à 256 Go à partir de 10 999 euros, et la version 512 Go n'arrivera qu'à la fin octobre. Pour ceux qui traitent moins d'un million de tokens par jour, l'API est presque toujours plus rentable que le matériel.

L'axe matériel : les prix selon la configuration

La grille tarifaire de 2026 est plus abrupte que celle des générations précédentes. Les prix de base s'appuient sur idealo, les configurations Ultra sur ComputerBase et MacTechNews :

AppareilRAMPrix (Marché/PPC)Source
Mac mini M616 Godès 1 019 €idealo
Mac mini M624 Go1 449 €idealo
Mac Studio M5 Max32/36 Go2 869–2 949 €idealo, Mactrade
Mac Studio M5 Max128 Go5 809–5 859 €idealo
Mac Studio M5 Ultra (30C/64C)96 Godès 6 599 €ComputerBase
Mac Studio M5 Ultra (30C/64C)256 Godès 10 999 €ComputerBase
Mac Studio M5 Ultra (36C/80C)256 Go12 429 €ComputerBase
Mac Studio M5 Ultra512 GoFin octobre 2026, prix inconnuMacTechNews

Le passage de 96 à 256 Go coûte 4 400 € supplémentaires — c'est la donnée la plus importante pour la décision d'achat. La mémoire vive est soudée sur tous les modèles et ne peut pas être étendue par la suite.

L'axe des modèles : trois modèles Flash, trois empreintes mémoire

L'ancienne règle « 27B-Q4 tient sur 24 Go » ne s'applique plus à ces modèles. Tous les trois utilisent une architecture Mixture-of-Experts (MoE) avec une très faible activation par token, mais une empreinte globale massive :

  • Qwen 3.8 Flash Next : 125B au total plus 51B pour la table N-Gram (Engram), 6B de paramètres actifs. Empreintes GGUF selon Unsloth : 1-bit 75 Go, 3-bit 90 Go, 4-bit 96–114 Go, 8-bit 200 Go, BF16 355 Go.
  • GLM 5.3 Flash : 320B au total, 18B actifs, nativement multimodal. Le FP8 occupe environ 328 Go sur le disque, et le 4-bit environ 164 Go.
  • DeepSeek V4 Flash (y compris la variante Vision-Exp du 21 août) : 284B au total, 13B actifs, environ 160 Go sur le disque.

Adéquation RAM/Modèle

RAMQwen 3.8 FNGLM 5.3 FDeepSeek V4 F
24 Goaucun complet, uniquement classe 27B dense——
96 Go1-bit (75 Go)——
128 Go3-bit (90 Go) + contexte——
256 Go4-bit (96–114 Go)4-bit (~164 Go)~160 Go
512 Go8-bit (200 Go)FP8 (328 Go)grand contexte

N'oubliez pas la « taxe de contexte » : les prompts longs et les sessions prolongées ajoutent plusieurs gigaoctets de cache KV. Règle d'or : prévoyez 10 à 15 % de mémoire en tant que marge de sécurité, sous peine de forcer le paging (swap) sur le SSD.

L'analyse des coûts : Matériel ou API ?

GLM 5.3 Flash coûte chez Z.ai 0,15 $ par million de tokens en entrée et 0,50 $ par million de tokens en sortie. Le calcul est le suivant :

bash
# Hypothèse : 10 millions de tokens/jour, répartition 6M In / 4M Out
# 6 * 0.15 + 4 * 0.50 = 2.90 USD/jour
# 2.90 * 365 = 1058.5 USD/an (~1 000 EUR)
10999 / 1000   # => ~11 ans d'amortissement (Ultra 256 Go)

# Avec seulement 1 million de tokens/jour :
# 0.29 USD/jour * 365 = ~106 USD/an
10999 / 106    # => ~104 ans -> l'API est largement gagnante

Le constat : En dessous d'environ 5 millions de tokens par jour, l'API est moins chère que n'importe quelle configuration Studio. Le matériel vaut le coup si la confidentialité des données (aucune donnée ne sort de l'entreprise), la capacité hors ligne ou des charges de travail regroupées sont des critères déterminants — et non pas si l'on compte à un centime près.

Guide d'achat

  • Mac mini 24 Go (1 449 €) : très limite pour ces trois modèles Flash, ne convient qu'à la classe 27B dense. Solide comme appareil secondaire ou pour de petits agents stables.
  • 96/128 Go (6 599 € / 5 809 €) : le palier le plus raisonnable. Qwen 3.8 Flash Next tourne en 1-bit ou 3-bit à une vitesse correcte — sur un ordinateur portable de 64 Go, on a mesuré 36 tokens/s ; avec plus de RAM, la marge pour le contexte augmente.
  • 256 Go (10 999–12 429 €) : le cheval de bataille si GLM 5.3 Flash ou DeepSeek V4 en 4-bit doivent constituer l'épine dorsale de votre système.
  • 512 Go (fin octobre) : uniquement pour une exploitation totale en FP8 et de longues sessions multimodales. Le prix est inconnu — ne précommandez pas à l'aveugle avant le lancement.

FAQ

Pourquoi un modèle avec seulement 6B de paramètres actifs a-t-il besoin de 96 Go de RAM ? Avec l'architecture Mixture-of-Experts, seule une partie des paramètres est chargée par token, mais tous les poids doivent résider en mémoire. Qwen 3.8 Flash Next possède 125B de paramètres principaux plus 51B pour les embeddings N-Gram. À cela s'ajoutent le cache KV pour le contexte et la tête MTP. C'est pourquoi le nombre de paramètres actifs n'est pas la métrique qui limite la mémoire.

La variante 512 Go vaut-elle son prix ? La configuration 512 Go sera disponible fin octobre 2026 ; son prix n'était pas encore fixé au moment de la rédaction. Elle est rentable si l'on souhaite exécuter des poids FP8 (GLM 5.3 Flash : ~328 Go) ou du Qwen en 8-bit (200 Go) sans perte due à la quantification. Pour un fonctionnement en 4-bit, le pack de 256 Go avec 10 à 15 % de marge suffit amplement.

Puis-je augmenter la RAM plus tard ? Non, sur tous les systèmes M5, la mémoire unifiée (unified memory) est soudée et fixe. La décision d'achat est donc définitive : mieux vaut dimensionner correctement une fois que d'acheter deux fois. En cas de doute, prenez le palier supérieur, car le paging sur le SSD ralentit considérablement les performances.

DeepSeek V4 Flash Vision Exp tourne-t-il sur la même empreinte mémoire ? Oui, la variante Vision-Exp du 21 août est basée sur l'architecture 284B/13B de V4 Flash et est proposée aux mêmes conditions d'API. L'entrée d'images et de vidéos augmente la charge du cache KV. Il faut donc ajouter une marge de contexte de 10 à 20 Go aux 160 Go du poids du modèle.

Quand l'inférence locale est-elle plus rapide que l'API ? Avec de petites tailles de lots (batches) et une utilisation répétée sur un même préfixe, un Mac Studio 256 Go avec une bande passante de 1,2 To/s peut exploiter à fond les tokens par seconde. Cependant, la classe Flash hébergée est également très rapide et ne présente pas de temps de chargement entre les sessions — pour la plupart des développeurs, l'API reste le choix le plus pragmatique.

Sources

Un sujet pour votre équipe ? Parlons-en 30 minutes.

Nous identifions ce qui fonctionne vraiment dans votre entreprise — concret, sans avalanche de slides.

Sans engagement · 30 minutes · Devis sous 48 h