Paramètres actifs (MoE)
Dans les modèles Mixture-of-Experts (MoE), les paramètres actifs sont les paramètres du modèle réellement calculés lors du traitement d'un seul token. Un modèle MoE se compose de plusieurs blocs d'experts spécialisés ; par token, un routeur n'en active qu'une petite partie. L'indicateur pertinent est donc la paire taille totale / taille active — environ 125B au total / 6B actifs pour Qwen 3.8 Flash Next, 770B / 49B pour Tencent Hy-4 Preview, environ 18B actifs pour GLM 5.3 Flash, et 2B pour le compact Mini CPM5. La différence avec un modèle dense classique : là, le nombre de paramètres calculés par token égale le nombre total. Dans un modèle MoE, le calcul par token évolue avec le nombre actif, tandis que le besoin mémoire est fixé par le nombre total — les deux valeurs décrivent des goulots d'étranglement différents. Pourquoi le nombre actif détermine la pratique : il pilote directement le débit de tokens (plus de paramètres actifs = plus d'opérations par token) et le coût d'inférence par million de tokens, donc le prix de l'API, tandis que le nombre total définit le besoin de VRAM. Un modèle de 125B au total avec 6B paramètres actifs calcule par token comme un petit modèle 6B mais offre la largeur de connaissances d'un modèle bien plus grand — la frontière d'efficacité de la ligne open-weight actuelle. Pour lire les fiches de modèles : le nombre actif n'est pas un artifice marketing mais le second indicateur clé, tout aussi important. Des spécifications comme 125B/6B ou 770B/49B montrent que largeur de connaissances et vitesse sont devenues accessibles en découplant taille totale et taille active — des paires de paramètres honnêtes plutôt que des chiffres uniques en billions.
En détail: Paramètres actifs (MoE)
Dans les modèles Mixture-of-Experts (MoE), les paramètres actifs sont les paramètres du modèle réellement calculés lors du traitement d'un seul token. Un modèle MoE se compose de plusieurs blocs d'experts spécialisés ; par token, un routeur n'en active qu'une petite partie. L'indicateur pertinent est donc la paire taille totale / taille active — environ 125B au total / 6B actifs pour Qwen 3.8 Flash Next, 770B / 49B pour Tencent Hy-4 Preview, environ 18B actifs pour GLM 5.3 Flash, et 2B pour le compact Mini CPM5. La différence avec un modèle dense classique : là, le nombre de paramètres calculés par token égale le nombre total. Dans un modèle MoE, le calcul par token évolue avec le nombre actif, tandis que le besoin mémoire est fixé par le nombre total — les deux valeurs décrivent des goulots d'étranglement différents. Pourquoi le nombre actif détermine la pratique : il pilote directement le débit de tokens (plus de paramètres actifs = plus d'opérations par token) et le coût d'inférence par million de tokens, donc le prix de l'API, tandis que le nombre total définit le besoin de VRAM. Un modèle de 125B au total avec 6B paramètres actifs calcule par token comme un petit modèle 6B mais offre la largeur de connaissances d'un modèle bien plus grand — la frontière d'efficacité de la ligne open-weight actuelle. Pour lire les fiches de modèles : le nombre actif n'est pas un artifice marketing mais le second indicateur clé, tout aussi important. Des spécifications comme 125B/6B ou 770B/49B montrent que largeur de connaissances et vitesse sont devenues accessibles en découplant taille totale et taille active — des paires de paramètres honnêtes plutôt que des chiffres uniques en billions.
Détails d'implémentation
- Stack technique
- Garde-fous prêts pour la production