LLM

Tencent Hy-4 Preview: 770B MoE Open-Weight a meno di 1 dollaro per milione di token — cosa significa il training auto-ottimizzato per gli stack di sviluppo

Tencent Hy-4 Preview: 770B MoE Open-Weight a meno di 1 dollaro per milione di token — cosa significa il training auto-ottimizzato per gli stack di sviluppo

Tencent Hy-4 Preview: 770B MoE Open-Weight a meno di 1 dollaro per milione di token

TL;DR

Hy-4 Preview è il nuovo modello di punta open-weight di Tencent: 770 miliardi di parametri in totale, ma solo 49 miliardi attivi per token, contesto di 1 milione di token, licenza Apache 2.0. Con 0,834 dollari per milione di token di input e 2,501 dollari per milione di token di output, il prezzo è inferiore a quello della maggior parte dei modelli di frontiera occidentali. In una valutazione interna alla cieca, ha superato leggermente Kimi K3 e GLM-5.3. Per gli stack di sviluppo, questo si traduce in una chiara gerarchia: classe Flash per i volumi, Hy-4 per la fascia media, Astra per i lavori di estrema precisione.

La scheda tecnica in numeri

VoceHy-4 Preview
Rilascio28 agosto 2026
ArchitetturaMixture-of-Experts, 78 layer (1 denso, 77 MoE con 256 esperti instradati + 1 condiviso)
Parametri770B totali / 49B attivi per token
Contesto1M di token, fino a 64K token di completamento
LicenzaApache 2.0, pesi su Hugging Face e ModelScope
AttentionGated DeepSeek Sparse Attention con IndexCache, variante FP8 rilasciata

I valori di benchmark riportati: GPQA Diamond 92,3 e SWE-bench Pro 65,7, oltre a Terminal-Bench 85,4. Questi numeri provengono dal materiale di rilascio di Tencent e da valutazioni di terze parti — vanno intesi come "riportati", non come valori calcolati e verificati in modo indipendente.

La stima dei prezzi per milione di token

I tre modelli dell'attuale linea di prezzo messi a confronto diretto (Input/Output per milione di token, tariffe standard):

ModelloInputOutputLettura CacheContesto
GLM-5.3 Flash$0,15$0,50$0,015~1M
Hy-4 Preview$0,834$2,501$0,0421M
GPT-6 Astra$10,00$50,00$1,00~1M

Hy-4 si colloca esattamente in questo divario: costa circa il quintuplo della classe Flash, ma da un dodicesimo a un ventesimo rispetto alla tariffa di Astra. I prezzi di output sono la vera leva economica, dato che i loop degli agenti scrivono più output che input.

Un esempio di calcolo concreto — un loop di agenti con 40 chiamate, ciascuna da ~8.000 token di input e 600 di output:

code
320K Input + 24K Output, per loop:
GLM-5.3 Flash: 0,32 × 0,15 + 0,024 × 0,50 = $0,06
Hy-4 Preview : 0,32 × 0,834 + 0,024 × 2,501 = $0,33
GPT-6 Astra  : 0,32 × 10,00  + 0,024 × 50,00  = $4,40

Con 1.000 loop al giorno parliamo di 60 contro 330 contro 4.400 dollari — le stesse proporzioni, solo scalate sui volumi.

Cosa significa qui "training auto-ottimizzato"

Tencent riporta che il modello ha co-ottimizzato la propria pipeline di addestramento, ottenendo un +31,8% di throughput rispetto all'esecuzione iniziale. Conosciamo questo pattern dal post di ricerca di OpenAI del 6 settembre: il modello non viene solo addestrato attraverso la pipeline, ma suggerisce esso stesso modifiche all'infrastruttura di training.

Per i builder, il valore pratico è ridotto ma reale: a parità di hardware, si ottiene un volume maggiore di training e inferenza per dollaro. Chi confronta i prezzi per milione di token non dovrebbe quindi fermarsi al solo prezzo di listino, ma analizzare la combinazione di costo, parametri attivi e lunghezza del contesto — il numero ridotto di parametri attivi (49B) spiega il motivo per cui Hy-4 riesce ad essere più economico per token rispetto a modelli con architettura densa di dimensioni complessive simili.

Quale modello di punta occupa quale slot

La regola decisionale per la strutturazione dei prezzi, vista come una scala dal più economico al più costoso:

  1. Lavori di volume (Classificazione, estrazione dati, prima scrematura): GLM-5.3 Flash — multimodale, licenza MIT, 18B parametri attivi, il punto di riferimento economico per la fascia bassa.
  2. Fascia media con contesto lungo (Sintesi di documenti, repository di codice estesi, lavoro d'ufficio): Hy-4 Preview — contesto da 1M, 49B parametri attivi, licenza Apache 2.0.
  3. Lavori di precisione (Catene di ragionamento complesse, test di accettazione critici): GPT-6 Astra — da usare solo quando la differenza di qualità emerge in modo tangibile nei propri test di valutazione.

La scala di escalation è semplice: iniziate sempre con il modello più economico e passate al livello superiore solo in caso di perdita di qualità documentata. In questo modo i costi rimangono sotto controllo e giustificabili — i tre valori sopracitati sono verificabili nel listino prezzi di qualsiasi provider.

Locale o API?

I pesi sono aperti: il modello da 770B in formato BF16 occupa circa 1,8 TB, mentre la variante FP8 circa 900 GB (secondo le stime di Tencent). Si tratta di dimensioni al di sotto di ciò che i setup a quattro SSD con layer-streaming (vedi la linea Deltafin/K3) riescono a gestire, ma ha senso solo se si dispone di un'enorme quantità di RAM.

Inquadramento pratico: per la maggior parte dei builder italiani ed europei, l'approccio via API tramite Tencent Cloud TokenHub o OpenRouter è la prima scelta sensata — 0,834/2,501 dollari per milione di token è una spesa contenuta anche per la produzione in serie. L'esecuzione in locale conviene solo se si possiede già un setup hardware da 96–128 GB (come un Mac Studio M5 Max o configurazioni analoghe) e si elaborano volumi costanti; il calcolo dell'ammortamento è trattato in un nostro articolo separato sull'hardware Apple.

FAQ

Perché il modello porta l'etichetta "Preview"? Tencent gestisce Hy-4 Preview come una release iniziale e internamente lo definisce il più grande salto generazionale che abbiano mai misurato. Con le versioni Preview, bisogna mettere in conto possibili modifiche future a tariffe e prestazioni, pertanto: verificate sempre i prezzi dai listini ufficiali dei provider e non basatevi esclusivamente sui numeri di questo articolo. Per la prototipazione non è un problema, ma per gli SLA contrattualizzati vi consigliamo di attendere la versione finale.

Hy-4 conviene rispetto a GLM-5.3 Flash o Flash è semplicemente più economico? Entrambe le affermazioni sono corrette, dipende dal task. Flash è la base economica per i lavori di volume, grazie ai suoi 18B di parametri attivi e agli input multimodali. Hy-4 costa circa cinque volte di più per token, ma garantisce una qualità superiore per singolo token e, secondo Tencent, risultati migliori sui task di ingegnerizzazione lunghi — si conferma quindi la scelta perfetta per la fascia media tra Flash e Astra.

Cosa comporta concretamente la licenza Apache 2.0 per l'uso commerciale? La licenza Apache 2.0 consente l'utilizzo, la modifica e la distribuzione all'interno di prodotti closed-source senza dover pagare royalty, includendo anche una clausola di protezione sui brevetti. Per gli sviluppatori, questo significa che il modello può essere integrato in prodotti SaaS senza la paura di incorrere in vincoli di licenza a catena. Lo stesso principio si applica al fine-tuning e alle varianti personalizzate — i pesi sono liberamente scaricabili su Hugging Face e ModelScope.

Come vanno interpretati i numeri dei benchmark? Valori come GPQA Diamond 92,3 e SWE-bench Pro 65,7 derivano dal materiale interno di Tencent, mentre Terminal-Bench 85,4 e DeepSWE 64,3 provengono da valutazioni di terze parti. I risultati della valutazione interna alla cieca contro Kimi K3 e GLM-5.3 sono stati diffusi unicamente da Tencent stessa — vanno presi come un'indicazione e non come una prova indipendente. I numeri più facili da calcolare rimangono i prezzi per token, che sono pubblici e trasparenti sui siti web dei provider.

Che impatto ha la pipeline di training auto-ottimizzata sull'utente finale? Il beneficio diretto è il costo inferiore per token: un throughput maggiore in fase di addestramento, a parità di hardware, abbassa la base di calcolo dei costi. Il secondo vantaggio risiede nella qualità del modello per singolo parametro attivo; utilizzare solo 49B di parametri attivi su un totale di 770B mantiene bassi i costi di inferenza per token. Entrambi gli effetti si riflettono sul listino prezzi — ecco perché, a conti fatti, Hy-4 si posiziona proprio a metà strada tra Flash e Astra.

Fonti

Un tema per il Suo team? Parliamone 30 minuti.

Valutiamo cosa funziona davvero nella Sua azienda — in concreto, senza valanghe di slide.

Senza impegno · 30 minuti · Offerta entro 48 h