LLM

Tencent Hy-4 Preview : Un MoE Open-Weight de 770B à moins d'un dollar par million de tokens — ce que l'entraînement auto-optimisé signifie pour les stacks de développeurs

Tencent Hy-4 Preview : Un MoE Open-Weight de 770B à moins d'un dollar par million de tokens — ce que l'entraînement auto-optimisé signifie pour les stacks de développeurs

Tencent Hy-4 Preview : Un MoE Open-Weight de 770B à moins d'un dollar par million de tokens

TL;DR

Hy-4 Preview est le nouveau flagship open-weight de Tencent : 770 milliards de paramètres au total, mais seulement 49 milliards de paramètres actifs par token, contexte de 1M de tokens, Apache 2.0. À 0,834 dollar par million de tokens en entrée et 2,501 dollars en sortie, son prix est inférieur à celui de la plupart des modèles "frontier" occidentaux. Lors d'une évaluation interne à l'aveugle, il a légèrement devancé Kimi K3 et GLM-5.3. Pour les stacks de développement, cela signifie : la classe Flash pour le volume, Hy-4 pour le milieu de gamme, Astra pour les tâches de précision.

Le profil en chiffres

CaractéristiqueHy-4 Preview
Date de sortie28 août 2026
ArchitectureMixture-of-Experts, 78 couches (1 dense, 77 MoE avec 256 experts routés + 1 partagé)
Paramètres770B au total / 49B actifs par token
Contexte1M de tokens, jusqu'à 64K tokens de complétion
LicenceApache 2.0, poids sur Hugging Face et ModelScope
AttentionGated DeepSeek Sparse Attention avec IndexCache, variante FP8 disponible

Les scores de référence rapportés : GPQA Diamond 92,3 et SWE-bench Pro 65,7, plus Terminal-Bench 85,4. Ces chiffres proviennent des documents de publication de Tencent et d'évaluations tierces — ils doivent être considérés comme "rapportés" et non comme des valeurs recalculées de manière indépendante.

Le calcul du prix par million de tokens

Les trois modèles de la gamme de prix actuelle mis directement en concurrence (Entrée/Sortie par million de tokens, tarifs standards) :

ModèleEntréeSortieLecture CacheContexte
GLM-5.3 Flash$0,15$0,50$0,015~1M
Hy-4 Preview$0,834$2,501$0,0421M
GPT-6 Astra$10,00$50,00$1,00~1M

Hy-4 se situe exactement dans cet intervalle : environ cinq fois le prix de la classe Flash, mais entre un douzième et un vingtième du tarif d'Astra. Les prix de sortie constituent le levier principal, car les boucles d'agents écrivent plus de sorties qu'elles ne lisent d'entrées.

Un exemple de calcul concret — une boucle d'agent avec 40 appels, chacun avec ~8 000 tokens en entrée et 600 en sortie :

code
320K Entrée + 24K Sortie, par boucle :
GLM-5.3 Flash : 0,32 × 0,15 + 0,024 × 0,50 = $0,06
Hy-4 Preview  : 0,32 × 0,834 + 0,024 × 2,501 = $0,33
GPT-6 Astra   : 0,32 × 10,00  + 0,024 × 50,00  = $4,40

Pour 1 000 boucles par jour, cela donne 60 contre 330 contre 4 400 dollars — le même rapport, simplement mis à l'échelle.

Ce que signifie ici "l'entraînement auto-optimisé"

Tencent rapporte que le modèle a co-optimisé son propre pipeline d'entraînement, avec un débit en hausse de +31,8 % par rapport au cycle initial. Nous connaissons ce schéma depuis l'article de recherche d'OpenAI du 6 septembre : le modèle n'est pas seulement entraîné par le pipeline, il suggère lui-même des modifications de ce dernier.

Pour les développeurs, la valeur pratique est faible mais réelle : pour un même matériel, on obtient plus de volume d'entraînement et d'inférence par dollar. Quiconque compare les prix par million de tokens ne doit donc pas seulement regarder le prix catalogue, mais la combinaison du prix, des paramètres actifs et de la longueur du contexte — le nombre de paramètres actifs (49B) explique pourquoi Hy-4 peut être moins cher par token que des modèles denses d'une taille globale similaire.

Quel flagship pour quel usage

La règle de décision pour la gamme de prix des modèles, conçue comme une échelle du moins cher au plus cher :

  1. Tâches de volume (Classification, extraction, premier tri) : GLM-5.3 Flash — multimodal, licence MIT, 18B de paramètres actifs, ancre de prix de la limite basse.
  2. Milieu de gamme avec contexte long (Synthèse de documents, longs dépôts de code, bureautique) : Hy-4 Preview — Contexte 1M, 49B de paramètres actifs, Apache 2.0.
  3. Tâches de précision (Chaînes de raisonnement complexes, tests d'acceptation) : GPT-6 Astra — uniquement si la différence de mesure apparaît réellement dans vos propres cycles d'évaluation.

Échelle d'escalade : toujours commencer par le modèle le moins cher et ne monter en gamme que si une perte de qualité est avérée. Ainsi, la facture reste vérifiable — les trois chiffres ci-dessus figurent dans la grille tarifaire de chaque fournisseur.

Local ou API ?

Les poids sont ouverts : 770B en BF16 occupent environ 1,8 To, la variante FP8 environ 900 Go (selon Tencent). C'est inférieur à ce que peuvent gérer les configurations à quatre SSD avec streaming de couches (Layer-Streaming, voir la gamme Deltafin/K3), mais cela n'est judicieux qu'avec une quantité de RAM très élevée.

Évaluation pratique : Pour la plupart des développeurs européens, l'approche par API via Tencent Cloud TokenHub ou OpenRouter est la plus appropriée pour commencer — 0,834/2,501 par million est une petite dépense, même en production de série. L'hébergement local vaut le coup si vous disposez déjà d'une configuration de 96 à 128 Go (Mac Studio M5 Max ou équivalent) et que vous gérez un volume constant ; le calcul d'amortissement est détaillé dans un article séparé sur le matériel Apple.

FAQ

Pourquoi le modèle porte-t-il la mention "Preview" ? Tencent positionne Hy-4 Preview comme une version préliminaire et la considère en interne comme le plus grand saut générationnel qu'ils aient mesuré. Avec les versions "Preview", il faut s'attendre à des ajustements de tarifs et de performances. Par conséquent : vérifiez les prix sur la grille tarifaire du fournisseur, ne vous basez pas uniquement sur cet article pour élaborer vos budgets. Pour les prototypes, ce n'est pas un problème ; pour les SLA contractuels fixés, il vaut mieux attendre la version finale.

Hy-4 vaut-il le coup par rapport à GLM-5.3 Flash ou Flash est-il simplement moins cher ? Les deux sont vrais, tout dépend de la tâche. Flash est le prix plancher pour les tâches de volume avec 18B de paramètres actifs et des entrées multimodales. Hy-4 coûte environ cinq fois plus cher par token, mais offre une meilleure qualité unitaire par token et, selon Tencent, de meilleurs résultats sur les tâches d'ingénierie longues — c'est donc le bon choix pour le milieu de gamme entre Flash et Astra.

Que signifie concrètement Apache 2.0 pour un usage commercial ? Apache 2.0 autorise l'utilisation, la modification et la distribution dans des produits fermés sans royalties, avec une clause de protection sur les brevets. Pour les développeurs, cela signifie : le modèle peut être intégré dans des produits SaaS sans craindre des chaînes de licences complexes. Il en va de même pour le fine-tuning et les variantes personnalisées — les poids sont disponibles sur Hugging Face et ModelScope.

Comment interpréter les chiffres des benchmarks ? GPQA Diamond 92,3 et SWE-bench Pro 65,7 proviennent des propres documents de Tencent, Terminal-Bench 85,4 et DeepSWE 64,3 d'évaluations tierces. L'évaluation interne à l'aveugle contre Kimi K3 et GLM-5.3 n'a été publiée que par Tencent — c'est une indication, pas une preuve indépendante. Les chiffres les plus faciles à vérifier sont les prix par token, car ils sont affichés publiquement sur les sites des fournisseurs.

Quel est l'impact de l'entraînement auto-optimisé sur l'utilisateur final ? L'avantage direct est un prix par token plus bas : un meilleur débit lors de l'entraînement à matériel constant réduit la base de calcul des coûts. Le deuxième effet est la qualité du modèle par paramètre actif, car 49B de paramètres actifs sur un total de 770B maintiennent les coûts d'inférence par token à un niveau bas. Ces deux effets s'additionnent dans la liste des prix — c'est pourquoi Hy-4 se situe entre Flash et Astra dans ce calcul.

Sources

Un sujet pour votre équipe ? Parlons-en 30 minutes.

Nous identifions ce qui fonctionne vraiment dans votre entreprise — concret, sans avalanche de slides.

Sans engagement · 30 minutes · Devis sous 48 h