Quel modèle IA local pour votre matériel ? Le guide de recettes Mia-Lab (8 Go à 512 Go de VRAM)
La première question que l'on se pose en auto-hébergeant des LLM est toujours : Quel modèle puis-je réellement faire tourner sur mon matériel — et à quel point m'approche-t-il de la frontière ? Il est rare d'obtenir une réponse objective, car la performance n'a de sens que dans le contexte de votre propre machine. Ce guide adopte précisément ce point de vue et s'appuie exclusivement sur les recettes et dépôts de Mia's AI Lab (MiaAI-Lab) — une source qui non seulement évalue les modèles, mais les livre et les déploie pour des configurations matérielles concrètes (d'un seul GPU jusqu'à 2× DGX Spark, avec des stacks NVFP4, EXL3 et vLLM).
Important avant tout : les recommandations de modèles proviennent d'un environnement éprouvé ; les recettes Mia-Lab liées ici sont les recettes de production sur lesquelles ces modèles tournent réellement sur ce matériel. Là où il n'existe pas (encore) de recette Mia dédiée, je le dis honnêtement et je pointe vers la référence la plus proche — aucune recette n'est inventée pour plaire.
8 Go de VRAM — petit, mais étonnamment capable
À 8 Go, chaque niveau de quantification compte. La règle : des modèles fins, riches en contexte et orientés agentique plutôt qu'un nombre de paramètres brut.
Spark-X2.5-4B
Un modèle qui, d'après les benchmarks, s'approche de la classe des 9B tout en étant taillé pour les performances en code et en agentique — et qui offre une fenêtre de contexte de 1M de tokens. C'est exactement cette combinaison (beaucoup de contexte, très peu de VRAM) qui fait la différence sur les petites machines.
Angle Mia-Lab : Pas de recette de déploiement dédiée ici (pour l'instant). La référence mesurable est le tool-eval-bench de Mia — un benchmark d'appel d'outils pour les stacks de serving, qui permet de comparer la pertinence agentique et la qualité des petits modèles avant de vous engager.
Bonsai-27B (Prism ML, Ternary)
Le cran suivant : c'est le plus proche d'un modèle frontalier que l'on puisse atteindre à 8 Go. La technique derrière : un modèle Qwen3.6-27B est quantifié en Q2, ce qui réduit massivement les poids — en contrepartie, vous obtenez une fenêtre de contexte de 262K tokens plus la vision.
Angle Mia-Lab : Mia a mesuré ce modèle sur son propre benchmark : Ternary-Bonsai-27B-tool-eval-bench-results — des résultats tool-eval-bench pour le Prism-ML Ternary-Bonsai-27B (Q2_0) avec 8 exécutions et un score. Cela permet de démontrer le classement qualité plutôt que de simplement l'affirmer.
16 Go de VRAM
Gemma-4-12B
Si vous avez besoin de capacités de vision, c'est le choix de tête ici. Les utilisateurs rapportent un énorme savoir sur le monde, une grande capacité à repérer des choses dans les images et les vidéos, et une cohérence maintenue sur de longs contextes. Réserve honnête : ce n'est pas le meilleur agent — mais il tient remarquablement la route à ce niveau.
Angle Mia-Lab : Mia exploite les modèles Gemma dans des recettes NVFP4. La référence la plus proche est Gemma-4-31B-IT-NVFP4-Recipe (vLLM avec décodage spéculatif MTP, appel d'outils) — le modèle d'exécution de la famille Gemma dans l'environnement Mia.
24 Go de VRAM — choix de tête
Qwen3.8-27B (variante Mia-EXL3-3.5bpw)
Mon favori dans cette catégorie. Si vous voulez précisément le modèle avec la quantification adéquate, prenez la variante EXL3-3.5bpw de Mia's AI Lab. Le cœur de l'usage : Qwen3.8-27B a servi au code, au game dev, à l'édition média, à la gestion de configuration vLLM/SGLang et à la gestion de flotte — et la performance pourrait vous surprendre. À savoir : il raisonne moins et possède MTP, ce qui permet de le faire tourner à des vitesses raisonnables. Réaliste de viser un niveau Sonnet/Luna.
Angle Mia-Lab : La recette de déploiement adaptée est Qwen3.8-27B-DFlash2-EXL3-5.0bpw — un kit qui sert exactement la cible EXL3-3.5bpw (plus un draft spéculatif DFlash2-EXL3-5.0bpw). Si vous préférez SGLang : Qwen3.8-27B-SGLang-DGX-Spark.
32–64 Go de VRAM — choix de tête
Nex-N2.5-Mini
Nex post-entraîne des modèles solides (comme Qwen3.6-35B) sur des tâches agentiques, de code et de média — avec pour objectif de raccourcir les longueurs de raisonnement tout en gagnant quelques points de QI. Ce modèle est particulièrement intéressant pour les Mac et les GPU plus lents, car c'est un MoE et seule une petite partie du modèle est activée à chaque token généré. Résultat : encore un niveau Sonnet/Luna.
Angle Mia-Lab : Pour la classe MoE/faible activation, Mia propose la recette apparentée Qwen3.6-35B-A3B-NVFP4-vLLM ainsi que la référence de benchmark Best-Local-Model_Agentic-Workflows_2026 (comparaison en tête-à-tête de LLM locaux pour les workflows agentiques avec Hermes Agent + tool-eval-bench).
96–128 Go de VRAM — ici commence la frontière
Qwen3.8-Flash-Next
58,7 % sur Deepswe, prise en charge de la vision, extrêmement rapide, énorme savoir sur le monde — et face à Terra/Opus-4.6, la différence est à peine perceptible. Le revers : 55B de paramètres, qui peuvent être déportés sur des supports mémoire ou NVMe moins chers (avec une perte de vitesse minime). Pour cela, il faut du matériel de cette échelle — par ex. AMD Strix Halo, un DGX Spark, 4× 3090, une RTX Pro 6000 ou un Mac M5 Ultra/Max.
Angle Mia-Lab : Il existe exactement deux recettes Mia pour cela : Qwen3.8-Flash-Next-Dual-DGX-Sparks (MoE NVFP4 sur 2× DGX Spark, TP2, ConnectX-7/RoCEv2) et, pour les systèmes mono, Qwen3.8-Flash-Next-Single-DGX-Spark.
GLM-5.3-Flash-EXL3-2BPW
Une recette conçue précisément pour 1× DGX Spark ou tout système à 128 Go. Elle est forte en reverse engineering et devrait préserver environ 86 % de l'intelligence BF16. Verdict : encore expérimental — si vous trouvez des bugs, signalez-les.
Angle Mia-Lab : GLM-5.3-Flash-EXL3-2x-DGX-Sparks est le déploiement de référence pour la famille GLM-5.3-Flash-EXL3 ; si vous préférez la variante NVFP4, il y a GLM-5.3-Flash-NVFP4-Dual-DGX-Spark.
196–256 Go — frontière
GLM-5.3-Flash-EXL3-4BPW
91,7 % de correspondance top-token à 0,065 KLD — actuellement le meilleur modèle de cette classe de taille, point. Il demande un peu de réglage pour tourner proprement, mais subjectivement il se situe au niveau Opus/Sol : « Je lui ai tout envoyé, il n'a jamais atteint de limite. »
Angle Mia-Lab : Encore la recette GLM-5.3-Flash-EXL3-2x-DGX-Sparks comme base.
DeepSeek-V4-Flash-Vision
DeepSeek est meilleur pour la conversation : plus personnel, plus de savoir sur le monde, un excellent agent. Il n'y a pas grand-chose de plus à dire — cela suffit comme déclaration de qualité.
Angle Mia-Lab : Cela tient sur 2× DGX Spark avec un contexte de 1M : DeepSeek-v4-Flash-DSpark-2x-DGX-Spark. Si vous n'avez qu'un seul système, utilisez DeepSeek-v4-Flash-One-DGX-Spark.
GLM-5.3-EXL3-3bpw-REAP
Le modèle le plus intelligent pour 2× DGX Spark / Mac M5 Ultra 256 Go en code, agentique et reverse engineering. Il sera lent — mais pendant la nuit, vous pouvez l'utiliser pour faire du RE/hacking, construire des composants complexes et bien plus. Réserve claire : hors code/agentique/anglais, vous verrez des pertes nettes — ce n'est pas sa vocation.
Angle Mia-Lab : La référence EXL3-GLM est encore la famille GLM-5.3-Flash-EXL3-2x-DGX-Sparks.
Nex-N2.5-Pro
Un modèle impressionnant, surtout pour l'édition média. Essayez-le.
Angle Mia-Lab : Pas de recette dédiée ; la collection de benchmarks agentiques sert d'étalon de qualité (voir Best-Local-Model_Agentic-Workflows_2026 ci-dessus).
384–512 Go — haut de gamme
GLM-5.3
Pour cette classe, je recommande EXL3-3bpw à EXL3-4bpw. La capacité sur les tâches de développement et d'agentique est remarquable et tend vers Fable / GPT-5.6-Sol.
Angle Mia-Lab : Pour la grande échelle, Mia propose glm-5.3-flash-4x-dgx-spark-switchless (GLM-5.3-Flash NVFP4 avec TP4 sur 4× DGX Spark, anneau RoCE switchless + DFlash2). Alternative : le GLM-5.3-Flash-NVFP4-Dual-DGX-Spark mentionné plus haut.
Pourquoi uniquement des recettes Mia-Lab ?
Parce que les fiches modèles classiques indiquent les paramètres et la quantification, mais presque jamais si et comment le modèle tourne sur votre matériel. Mia's AI Lab publie pour beaucoup de ces modèles des recettes de production démarrables (stacks NVFP4/EXL3, configuration vLLM/SGLang, configurations dual/single-DGX) ainsi que des benchmarks mesurants (tool-eval-bench) — voilà la base honnête d'une recommandation matérielle, pas une rumeur autour d'un nombre de paramètres.
Appliquer une recette est volontairement simple — en gros ainsi :
# Exemple : cloner et démarrer une recette Mia-Lab (ici GLM-5.3-Flash sur 2x DGX Spark)
git clone https://github.com/MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks.git
cd GLM-5.3-Flash-EXL3-2x-DGX-Sparks
cp .env.example .env # définir MASTER_ADDR, WORKER_HOST, les chemins
./start.sh # démarrer le serveur, interroger l'endpoint API
Sources
- Mia's AI Lab sur GitHub : https://github.com/MiaAI-Lab — 87 dépôts publics, recettes de modèles, benchmarks et outils.
- tool-eval-bench — benchmark d'appel d'outils pour les stacks de serving LLM.
- Best-Local-Model_Agentic-Workflows_2026 — comparaison en tête-à-tête de LLM locaux pour les workflows agentiques.
- Ternary-Bonsai-27B-tool-eval-bench-results
- Qwen3.8-27B-DFlash2-EXL3-5.0bpw
- Qwen3.8-27B-SGLang-DGX-Spark
- Qwen3.8-Flash-Next-Dual-DGX-Sparks
- Qwen3.8-Flash-Next-Single-DGX-Spark
- GLM-5.3-Flash-EXL3-2x-DGX-Sparks
- GLM-5.3-Flash-NVFP4-Dual-DGX-Spark
- glm-5.3-flash-4x-dgx-spark-switchless
- DeepSeek-v4-Flash-DSpark-2x-DGX-Spark
- DeepSeek-v4-Flash-One-DGX-Spark
- Gemma-4-31B-IT-NVFP4-Recipe
- Qwen3.6-35B-A3B-NVFP4-vLLM
FAQ
Pourquoi utiliser une recette Mia-Lab pour auto-héberger ?
Parce qu'une fiche modèle ne dit que ce qu'est un modèle — pas s'il tourne sur votre matériel. Une recette de Mia's AI Lab est une configuration testée et démarrable (niveau de quantification, moteur de serving, réglages batch/contexte, variantes dual- et mono-nœud). Vous économisez les heures passées à régler tensor-parallel, le cache KV ou les options mémoire, et vous obtenez un démarrage reproductible. Là où il n'y a pas de recette, je le dis explicitement dans l'article plutôt que d'en inventer une.
Que signifient « EXL3 » ou « 3.5bpw » dans les recommandations Qwen et GLM ? EXL3 est un moteur de quantification (ExLlama) qui combine une compression de poids de haute qualité avec une faible perte de qualité ; « bpw » signifie « bits per weight » — plus c'est bas, plus le modèle est petit, plus il tourne vite sur du matériel limité, mais plus il peut perdre en qualité. Les paliers 3.5–4bpw sont, pour de nombreuses applications, le point d'équilibre entre taille et intelligence. Les recettes de Mia livrent exactement ces configurations sous forme de stacks démarrables, avec des drafts de décodage spéculatif qui augmentent nettement la vitesse sur les petits matériels.
Puis-je faire tourner ces modèles sans matériel NVIDIA (Mac/AMD uniquement) ? Oui, avec des limites. Pour les modèles MoE comme Nex-N2.5-Mini ou Qwen3.6-35B-A3B, la faible activation est un gros avantage sur Mac et GPU plus faibles, car seule une petite partie du modèle est activée par token. De nombreuses recettes Mia sont explicitement conçues pour la classe GB10/DGX-Spark et Mac-m5 (ARM/aarch64). Avec les modèles denses classiques 27B+, c'est la mémoire unifiée ou VRAM disponible qui décide de la faisabilité — sur un Mac M5 Ultra (ou équivalent), beaucoup de ces stacks peuvent aussi tourner.
Comment savoir quel modèle est le meilleur pour mon cas d'usage précis ? Prenez d'abord la classe VRAM/mémoire de ce guide, puis vérifiez la pertinence via un benchmark plutôt que par des promesses marketing. Le tool-eval-bench de Mia et les comparaisons en tête-à-tête de Best-Local-Model_Agentic-Workflows_2026 aident à comparer objectivement la qualité agentique et d'appel d'outils avant de monter un stack. Pour un usage à dominante agentique, code et reverse engineering, suivez les recommandations ci-dessus ; pour le savoir sur le monde et la conversation, DeepSeek ou Gemma conviennent mieux.
Pourquoi « raccourcir le raisonnement » est-il bon pour ces modèles ? Beaucoup de modèles capables de la frontière produisent de longues chaînes de pensée avant de répondre. Quand un post-entraîneur (par ex. chez Nex) réduit la longueur de raisonnement, la latence par requête chute considérablement — particulièrement important sur du matériel limité (Mac, GPU plus anciens). C'est l'une des raisons pour lesquelles des modèles comme Qwen3.8-27B ou Nex-N2.5 tournent à des vitesses raisonnables alors qu'ils appartiennent sinon à des classes supérieures. Un modèle à « moins de raisonnement » n'est donc pas plus faible — il est optimisé pour être rapide.
Que signifient les niveaux de qualité « niveau Sonnet/Luna » ou « niveau Opus/Sol » ? Ce sont des équivalences informelles avec des modèles commerciaux, destinées à donner un ordre de grandeur de la performance attendue. « Niveau Sonnet/Luna » signifie qu'un modèle local s'approche de ces modèles commerciaux sur de nombreuses tâches ; « niveau Opus/Sol » désigne le haut de gamme. À noter : ces classements reposent sur l'expérience pratique et des benchmarks, pas sur une métrique standardisée — ce sont des heuristiques utiles pour s'orienter, pas un résultat de laboratoire.