Local AI

Combien coûte l'IA locale vraiment ? Le calcul honnête 2026

Combien coûte l'IA locale vraiment ? Le calcul honnête 2026

« Je vais économiser les coûts d'API avec ça ! » — cette phrase est rarement vraie. Nous avons fait le calcul avec des mesures réelles de notre base de recettes et les prix actuels du marché : aux tarifs des API Flash de 2026, le calcul local n'est plus un programme d'économies — c'est un programme de contrôle. Quand le matériel se rentabilise quand même, nous le montrons avec des chiffres.

L'achat : ce que coûtent les quatre paliers en 2026

Les prix ont augmenté en 2026 à cause de la pénurie de mémoire — les vieux calculs de blogs ne tiennent plus :

  • DGX Spark (128 Go unifiée) : ~4 800 € (prix marché allemand ; les 3 999 € du MSRP appartiennent à l'histoire)
  • Mac Studio M4 Max (128 Go) : ~4 700 €
  • Système RTX 5090 (32 Go de VRAM) : ~4 900 € (carte ~4 000 € + reste du PC)
  • Système RTX PRO 6000 (96 Go de VRAM) : ~14 500 €

La facture d'électricité — le facteur sous-estimé

Avec un prix mixte allemand (~0,35 €/kWh) et 8 heures de pleine charge par jour :

  • Mac Studio M4 Max (~70 W en moyenne) : ~72 €/an
  • DGX Spark (~110 W) : ~112 €/an
  • Système RTX 5090 (~320 W) : ~327 €/an
  • Système RTX PRO 6000 (~380 W) : ~388 €/an

Le Mac est le champion de l'électricité ; les systèmes RTX coûtent 3 à 5 fois plus — sur trois ans, cela fait 750 à 1 100 € d'écart. Pas dramatique, mais celui qui dit « l'électricité, c'est négligeable » ne calcule pas avec des prix allemands.

Le débit : ce que les machines délivrent vraiment

De notre base de recettes (meilleurs chiffres en flux simple, charge prose) :

  • DGX Spark : jusqu'à ~49–88 tok/s (DeepSeek V4.1 Flash, setup TP4 : 87,7)
  • Mac Studio M4 Max : ~53 tok/s (Qwen3.8-27B)
  • RTX 5090 : ~250 tok/s (Qwen3.6 35B-A3B, NVFP4)
  • RTX PRO 6000 : ~207–235 tok/s

À 4 heures de décodage par jour, une RTX 5090 traite environ 1,3 milliard de tokens par an, une DGX Spark ~256 millions.

La comparaison honnête : API vs. local

Tarifs actuels des API Flash (septembre 2026, par million de tokens) : Qwen3.8-Flash 0,113 $ en entrée / 0,382 $ en sortie, GLM-5.3-Flash 0,15 $ / 0,50 $, DeepSeek V4.1 Flash 0,15 $ / 0,60 $ (hors pic).

Scénario « power user avec agents » (88M d'entrée + 22M de sortie par mois, le ratio 4:1 typique des workloads agents) : environ 220 €/an avec l'API la moins chère. Face à ~1 960 €/an (système RTX 5090, vue sur 3 ans), le matériel ne s'amortit qu'à environ dix fois ce volume — près d'un milliard de tokens par mois.

Qu'est-ce que cela signifie ? Au coût pur des tokens, l'API reste imbattable en 2026. Le calcul ne bascule que lorsqu'un de ces facteurs entre en jeu :

  1. La confidentialité est obligatoire : dossiers patients, contrats clients, bases de code internes — dans beaucoup de secteurs (cabinets médicaux, études d'avocats, industrie sous NDA), l'aller-retour cloud n'est même pas une option. La comparaison n'est alors pas « matériel vs. API » mais « matériel vs. hébergement privé coûteux ».
  2. Le plaisir d'expérimenter : qui lance 500 essais dans une boucle d'itération de prompt le fait localement gratuitement, et la facture API s'en moque. Fine-tuning, suites d'evals nocturnes, pipelines multi-modèles — on consomme facilement dix fois le scénario « power user » sans que cela fasse mal.
  3. Plusieurs utilisateurs : une RTX PRO 6000 (96 Go) sert une équipe de 3 à 10 personnes via vLLM. Par tête, le calcul devient très vite positif.
  4. Pics de charge et rate limits : les limites API frappent les fermes d'agents exactement quand cela fait mal. Le matériel local ne passe pas à l'échelle avec la facture mais avec le compteur électrique.

L'exception qui confirme la règle

Les workloads batch sans interactivité : quatre Mac mini (M4 Pro, 48 Go chacun) en cluster coûtent ~7 000 €, tirent ~200 W ensemble et traitent les files de jobs nocturnes. Pour « 50 millions de tokens par nuit, latence indifférente », c'est le meilleur rapport prix/configuration du marché — la facture API correspondante se monterait à plusieurs centaines d'euros par mois.

Notre conclusion

Calcul pur : localement, le matériel ne s'amortit aux tarifs des API Flash qu'avec un volume élevé, des équipes ou du batch nocturne. Mais le coût n'a jamais été la principale raison de calculer en local — c'est le contrôle : des données qui ne quittent pas la maison ; des expériences sans compteur ; des modèles qu'on échange soi-même. Qui a besoin de cela ne compte pas le matériel comme un poste de coût mais comme une infrastructure.

Les mesures de ce calcul proviennent de la base de recettes publique de notre page Local AI — y compris la matrice matérielle qui montre quel modèle tourne réellement sur lequel des quatre paliers.

Questions fréquentes

Une DGX Spark se rentabilise-t-elle face à l'API ? Au coût pur des tokens et en usage mono-utilisateur : généralement non en 3 ans — les API Flash sont trop bon marché en 2026. Oui, si la confidentialité exclut le cloud, si vous expérimentez beaucoup (fine-tuning, evals, multi-modèles) ou si vous utilisez la machine comme boîte de développement CUDA pour des clusters. Achetez-la pour le contrôle, pas pour l'économie.

Quel matériel offre le meilleur rapport tokens-euro ? Pour les modèles jusqu'à 32 Go : la RTX 5090 (plus haut débit unitaire par euro). Pour la grosse mémoire à consommation minimale : Mac Studio. Pour servir une équipe : RTX PRO 6000. Pour la parité CUDA et la mémoire unifiable en cluster : DGX Spark. La base de recettes liste des recettes mesurées pour chaque palier — les chiffres décident, pas les slides marketing.

Combien coûte le calcul local par mois en électricité ? Avec un usage quotidien (équivalent 8 heures de pleine charge) : Mac Studio ~6 €, DGX Spark ~9 €, système RTX 5090 ~27 €, système RTX PRO 6000 ~32 €. Au repos, le Mac est à ~32 W (moins de 10 €/mois) ; les systèmes RTX devraient être éteints.

Un cluster de plusieurs petites machines vaut-il le coup ? Pour les workloads batch, oui — quatre Mac mini mettent en commun 192 Go pour ~7 000 € et traitent les files nocturnes à 200 W au total. Pour le travail interactif avec de gros modèles MoE, il faut du tensor parallel sur un réseau rapide (RoCE), ce qui implique un effort de configuration. Nos recettes documentent les deux, de 2× Spark à 4× Spark avec mesures.

Les prix des API resteront-ils si bas ? Les tarifs Flash ont continué de baisser jusqu'à mi-2026 (DeepSeek hors pic 0,15 $/0,60 $). Contrepartie : les prix de la mémoire et des GPU ont augmenté sur la même période. Les deux côtés de l'équation bougent — notre recommandation : calculez avec vos volumes réels, pas avec des forfaits, et regardez dans la base de recettes ce que votre classe de matériel délivre vraiment.

Sources

Un sujet pour votre équipe ? Parlons-en 30 minutes.

Nous identifions ce qui fonctionne vraiment dans votre entreprise — concret, sans avalanche de slides.

Sans engagement · 30 minutes · Devis sous 48 h