LLM

Tencent Hy-4 Preview: 770B-MoE-Open-Weight unter 1 Dollar pro Million Tokens — was das selbst-optimierte Training für Builder-Stacks heißt

Tencent Hy-4 Preview: 770B-MoE-Open-Weight unter 1 Dollar pro Million Tokens — was das selbst-optimierte Training für Builder-Stacks heißt

Tencent Hy-4 Preview: 770B-MoE-Open-Weight unter 1 Dollar pro Million Tokens

TL;DR

Hy-4 Preview ist Tencents neues Open-Weight-Flagship: 770 Milliarden Parameter gesamt, aber nur 49 Milliarden aktive Parameter pro Token, 1M-Token-Kontext, Apache 2.0. Mit 0,834 Dollar pro Million Input-Tokens und 2,501 Dollar pro Million Output-Tokens liegt es preislich unter den meisten westlichen Frontier-Modellen. In einer blinden internen Evaluation lag es leicht vor Kimi K3 und GLM-5.3. Für Builder-Stacks heißt das: Flash-Klasse für Volumen, Hy-4 für die Mittelstufe, Astra für Präzisions-Jobs.

Der Steckbrief in Zahlen

FeldHy-4 Preview
Release28. August 2026
ArchitekturMixture-of-Experts, 78 Layer (1 dicht, 77 MoE mit 256 gerouteten + 1 geteiltem Experten)
Parameter770B gesamt / 49B aktiv pro Token
Kontext1M Tokens, bis zu 64K Completion-Tokens
LizenzApache 2.0, Gewichte auf Hugging Face und ModelScope
AufmerksamkeitenGated DeepSeek Sparse Attention mit IndexCache, FP8-Variante shipped

Die berichteten Benchmark-Werte: GPQA Diamond 92,3 und SWE-bench Pro 65,7, dazu Terminal-Bench 85,4. Diese Zahlen stammen aus Tencents Release-Material und Dritt-Auswertungen — sie sind als „berichtet" zu lesen, nicht als unabhängig nachgerechnete Werte.

Die Preisrechnung pro Million Tokens

Die drei Modelle der laufenden Preis-Linie direkt gegenübergestellt (Input/Output pro Million Tokens, Standardtarife):

ModellInputOutputCache-ReadKontext
GLM-5.3 Flash$0,15$0,50$0,015~1M
Hy-4 Preview$0,834$2,501$0,0421M
GPT-6 Astra$10,00$50,00$1,00~1M

Hy-4 sitzt damit exakt in der Lücke: rund das Fünffache der Flash-Klasse, aber ein Zwölftel bis ein Zwanzigstel des Astra-Tarifs. Die Output-Preise sind der Hebel, denn Agent-Loops schreiben mehr Output als Input.

Ein konkretes Rechenbeispiel — ein Agent-Loop mit 40 Calls, je ~8.000 Input- und 600 Output-Tokens:

code
320K Input + 24K Output, pro Loop:
GLM-5.3 Flash: 0,32 × 0,15 + 0,024 × 0,50 = $0,06
Hy-4 Preview : 0,32 × 0,834 + 0,024 × 2,501 = $0,33
GPT-6 Astra  : 0,32 × 10,00  + 0,024 × 50,00  = $4,40

Bei 1.000 Loops täglich macht das 60 vs. 330 vs. 4.400 Dollar — dieselbe Ordnung, nur skaliert.

Was „selbstoptimiertes Training" hier heißt

Tencent berichtet, dass das Modell seine eigene Trainings-Pipeline mitoptimiert hat, mit +31,8 Prozent Durchsatz gegenüber dem Ausgangslauf. Das Muster kennen wir aus dem OpenAI-Research-Post vom 6. September: Das Modell wird nicht nur durch die Pipeline trainiert, es schlägt selbst Änderungen an der Pipeline vor.

Für Builder ist der praktische Wert klein, aber real: Bei gleicher Hardware läuft mehr Trainings- und Inferenz-Volumen pro Dollar. Wer Preise pro Million Tokens vergleicht, sollte deshalb nicht nur auf den Listenpreis schauen, sondern auf die Kombination aus Preis, aktiven Parametern und Kontextlänge — die aktive Parameterzahl (49B) erklärt, warum Hy-4 pro Token günstiger sein kann als dicht gebaute Modelle ähnlicher Gesamtgröße.

Welches Flagship welchen Slot bekommt

Die Entscheidungsregel der Modellpreis-Linie, als Leiter von billig nach teuer:

  1. Volumen-Jobs (Klassifikation, Extraktion, erste Sicht): GLM-5.3 Flash — multimodal, MIT-Lizenz, 18B aktive Parameter, Preis-Anker der unteren Kante.
  2. Mittelstufe mit Langkontext (Dokumenten-Synthese, lange Repos, Office-Work): Hy-4 Preview — 1M Kontext, 49B aktive Parameter, Apache 2.0.
  3. Präzisions-Jobs (schwierige Reasoning-Ketten, Abnahme-Tests): GPT-6 Astra — nur dann, wenn der Messunterschied in deinen eigenen Evaluationsläufen wirklich auftritt.

Eskalations-Leiter: immer mit dem günstigen Modell starten und nur bei belegtem Qualitätsverlust nach oben wechseln. So bleibt die Rechnung überprüfbar — die drei Zahlen oben stehen in jedem Provider-Preisblatt.

Lokal oder API?

Die Gewichte sind offen: 770B in BF16 belegen rund 1,8 TB, die FP8-Variante etwa 900 GB (nach Tencents Angaben). Das ist unterhalb dessen, was Vier-SSD-Setups mit Layer-Streaming (siehe Deltafin/K3-Linie) bewältigen, aber nur mit hoher RAM-Klasse sinnvoll.

Praktische Einordnung: Für die meisten DACH-Builder ist der API-Weg über Tencent Cloud TokenHub oder OpenRouter zuerst richtig — 0,834/2,501 pro Million ist auch in Serienproduktion ein kleiner Posten. Lokal lohnt sich, wenn du ein 96–128-GB-Setup (Mac Studio M5 Max oder Vergleichbares) bereits stellst und konstantes Volumen fährst; die Amortisationsrechnung steht im separaten Apple-Hardware-Artikel.

FAQ

Warum trägt das Modell den Zusatz „Preview"? Tencent führt Hy-4 Preview als frühe Version und nennt es intern den größten Generationensprung, den sie gemessen haben. Bei Preview-Releases ist mit Tarif- und Leistungsumstellungen zu rechnen, daher: Preise pro Provider-Preisblatt prüfen, nicht aus diesem Artikel nachbauen. Für Prototypen ist das unproblematisch, für vertraglich fixierte SLAs solltest du die finale Version abwarten.

Lohnt sich Hy-4 gegenüber GLM-5.3 Flash oder ist Flash einfach nur billiger? Beides ist richtig, es kommt auf den Job an. Flash ist der Preis-Boden für Volumen-Tasks mit 18B aktiven Parametern und multimodalem Input. Hy-4 kostet etwa das Fünffache pro Token, bietet dafür aber die höhere Einzel-Token-Qualität und laut Tencent den besseren Stand auf langen Engineering-Tasks — die richtige Wahl also für die Mittelstufe zwischen Flash und Astra.

Was bedeutet Apache 2.0 konkret für kommerzielle Nutzung? Apache 2.0 erlaubt Nutzung, Modifikation und Weitergabe in geschlossenen Produkten ohne Royalties, mit einer patentrechtlichen Schutzklausel. Für Builder heißt das: Das Modell lässt sich in SaaS-Produkte einbetten, ohne Lizenzketten zu fürchten. Für Feintuning und eigene Varianten gilt dasselbe — die Gewichte liegen auf Hugging Face und ModelScope aus.

Wie sind die Benchmark-Zahlen einzuordnen? GPQA Diamond 92,3 und SWE-bench Pro 65,7 stammen aus Tencents eigenem Material, Terminal-Bench 85,4 und DeepSWE 64,3 aus Dritt-Auswertungen. Die blinde interne Evaluation gegen Kimi K3 und GLM-5.3 hat nur Tencent selbst veröffentlicht — das ist ein Hinweis, kein unabhängiger Beleg. Am schnellsten nachrechenbar sind die Preis-pro-Token-Zahlen, weil die offen auf den Provider-Seiten stehen.

Welchen Einfluss hat die selbstoptimierte Trainings-Pipeline auf den Endnutzer? Der direkte Nutzen ist der günstigere Token-Preis: Mehr Durchsatz im Training bei gleicher Hardware senkt die Kalkulationsbasis. Der zweite Effekt ist die Modellqualität pro aktivem Parameter, denn 49B aktive Parameter bei 770B gesamt halten die Inferenz-Kosten pro Token niedrig. Beide Effekte summieren sich in der Preisliste — deshalb steht Hy-4 in dieser Rechnung zwischen Flash und Astra.

Quellen

Thema für Ihr Team? Sprechen wir 30 Minuten.

Wir ordnen ein, was davon in Ihrem Unternehmen trägt — konkret, ohne Folienschlacht.

Unverbindlich · 30 Minuten · Angebot in 48 h