---
type: "BlogPosting"
title: "Tencent Hy-4 Preview: 770B-MoE-Open-Weight unter 1 Dollar pro Million Tokens — was das selbst-optimierte Training für Builder-Stacks heißt"
description: "Tencents Hy-4 Preview bringt ein 770B-MoE-Flagship (49B aktive Parameter, 1M Kontext, Apache 2.0) für 0,834/2,501 Dollar pro Million Tokens. Die Preisrechnung gegen GLM-5.3 Flash und GPT-6 Astra — und die Entscheidungsregel, welches Open-Weight-Modikell welchen Slot im Agent-Stack bekommt."
resource: "https://www.contextstudios.ai/de/blog/tencent-hy-4-preview-770b-moe-open-weight-unter-1-dollar-pro-million"
language: "de"
tags: ["LLM", "Open-Weight", "Modell-Evaluation", "KI-Agenten", "Daily Intel"]
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-02T21:59:51.782Z"
status: "stable"
---

# Tencent Hy-4 Preview: 770B-MoE-Open-Weight unter 1 Dollar pro Million Tokens — was das selbst-optimierte Training für Builder-Stacks heißt

Published: 2026-09-21
Tags: LLM, Open-Weight, Modell-Evaluation, KI-Agenten, Daily Intel

![Tencent Hy-4 Preview: 770B-MoE-Open-Weight unter 1 Dollar pro Million Tokens — was das selbst-optimierte Training für Builder-Stacks heißt](https://wary-platypus-754.convex.cloud/api/storage/f4c55b33-3aac-49bb-b3af-068fbe0c35b4)

# Tencent Hy-4 Preview: 770B-MoE-Open-Weight unter 1 Dollar pro Million Tokens

## TL;DR
Hy-4 Preview ist Tencents neues Open-Weight-Flagship: 770 Milliarden Parameter gesamt, aber nur 49 Milliarden aktive Parameter pro Token, 1M-Token-Kontext, Apache 2.0. Mit 0,834 Dollar pro Million Input-Tokens und 2,501 Dollar pro Million Output-Tokens liegt es preislich unter den meisten westlichen Frontier-Modellen. In einer blinden internen Evaluation lag es leicht vor Kimi K3 und GLM-5.3. Für Builder-Stacks heißt das: Flash-Klasse für Volumen, Hy-4 für die Mittelstufe, Astra für Präzisions-Jobs.

## Der Steckbrief in Zahlen

| Feld | Hy-4 Preview |
| --- | --- |
| Release | 28. August 2026 |
| Architektur | Mixture-of-Experts, 78 Layer (1 dicht, 77 MoE mit 256 gerouteten + 1 geteiltem Experten) |
| Parameter | 770B gesamt / 49B aktiv pro Token |
| Kontext | 1M Tokens, bis zu 64K Completion-Tokens |
| Lizenz | Apache 2.0, Gewichte auf Hugging Face und ModelScope |
| Aufmerksamkeiten | Gated DeepSeek Sparse Attention mit IndexCache, FP8-Variante shipped |

Die berichteten Benchmark-Werte: GPQA Diamond 92,3 und SWE-bench Pro 65,7, dazu Terminal-Bench 85,4. Diese Zahlen stammen aus Tencents Release-Material und Dritt-Auswertungen — sie sind als „berichtet" zu lesen, nicht als unabhängig nachgerechnete Werte.

## Die Preisrechnung pro Million Tokens

Die drei Modelle der laufenden Preis-Linie direkt gegenübergestellt (Input/Output pro Million Tokens, Standardtarife):

| Modell | Input | Output | Cache-Read | Kontext |
| --- | --- | --- | --- | --- |
| GLM-5.3 Flash | $0,15 | $0,50 | $0,015 | ~1M |
| Hy-4 Preview | $0,834 | $2,501 | $0,042 | 1M |
| GPT-6 Astra | $10,00 | $50,00 | $1,00 | ~1M |

Hy-4 sitzt damit exakt in der Lücke: rund das Fünffache der Flash-Klasse, aber ein Zwölftel bis ein Zwanzigstel des Astra-Tarifs. Die Output-Preise sind der Hebel, denn Agent-Loops schreiben mehr Output als Input.

Ein konkretes Rechenbeispiel — ein Agent-Loop mit 40 Calls, je ~8.000 Input- und 600 Output-Tokens:

```
320K Input + 24K Output, pro Loop:
GLM-5.3 Flash: 0,32 × 0,15 + 0,024 × 0,50 = $0,06
Hy-4 Preview : 0,32 × 0,834 + 0,024 × 2,501 = $0,33
GPT-6 Astra  : 0,32 × 10,00  + 0,024 × 50,00  = $4,40
```

Bei 1.000 Loops täglich macht das 60 vs. 330 vs. 4.400 Dollar — dieselbe Ordnung, nur skaliert.

## Was „selbstoptimiertes Training" hier heißt

Tencent berichtet, dass das Modell seine eigene Trainings-Pipeline mitoptimiert hat, mit +31,8 Prozent Durchsatz gegenüber dem Ausgangslauf. Das Muster kennen wir aus dem OpenAI-Research-Post vom 6. September: Das Modell wird nicht nur durch die Pipeline trainiert, es schlägt selbst Änderungen an der Pipeline vor.

Für Builder ist der praktische Wert klein, aber real: Bei gleicher Hardware läuft mehr Trainings- und Inferenz-Volumen pro Dollar. Wer Preise pro Million Tokens vergleicht, sollte deshalb nicht nur auf den Listenpreis schauen, sondern auf die Kombination aus Preis, aktiven Parametern und Kontextlänge — die aktive Parameterzahl (49B) erklärt, warum Hy-4 pro Token günstiger sein kann als dicht gebaute Modelle ähnlicher Gesamtgröße.

## Welches Flagship welchen Slot bekommt

Die Entscheidungsregel der Modellpreis-Linie, als Leiter von billig nach teuer:

1. **Volumen-Jobs** (Klassifikation, Extraktion, erste Sicht): GLM-5.3 Flash — multimodal, MIT-Lizenz, 18B aktive Parameter, Preis-Anker der unteren Kante.
2. **Mittelstufe mit Langkontext** (Dokumenten-Synthese, lange Repos, Office-Work): Hy-4 Preview — 1M Kontext, 49B aktive Parameter, Apache 2.0.
3. **Präzisions-Jobs** (schwierige Reasoning-Ketten, Abnahme-Tests): GPT-6 Astra — nur dann, wenn der Messunterschied in deinen eigenen Evaluationsläufen wirklich auftritt.

Eskalations-Leiter: immer mit dem günstigen Modell starten und nur bei belegtem Qualitätsverlust nach oben wechseln. So bleibt die Rechnung überprüfbar — die drei Zahlen oben stehen in jedem Provider-Preisblatt.

## Lokal oder API?

Die Gewichte sind offen: 770B in BF16 belegen rund 1,8 TB, die FP8-Variante etwa 900 GB (nach Tencents Angaben). Das ist unterhalb dessen, was Vier-SSD-Setups mit Layer-Streaming (siehe Deltafin/K3-Linie) bewältigen, aber nur mit hoher RAM-Klasse sinnvoll.

Praktische Einordnung: Für die meisten DACH-Builder ist der API-Weg über Tencent Cloud TokenHub oder OpenRouter zuerst richtig — 0,834/2,501 pro Million ist auch in Serienproduktion ein kleiner Posten. Lokal lohnt sich, wenn du ein 96–128-GB-Setup (Mac Studio M5 Max oder Vergleichbares) bereits stellst und konstantes Volumen fährst; die Amortisationsrechnung steht im separaten Apple-Hardware-Artikel.

## FAQ

**Warum trägt das Modell den Zusatz „Preview"?**
Tencent führt Hy-4 Preview als frühe Version und nennt es intern den größten Generationensprung, den sie gemessen haben. Bei Preview-Releases ist mit Tarif- und Leistungsumstellungen zu rechnen, daher: Preise pro Provider-Preisblatt prüfen, nicht aus diesem Artikel nachbauen. Für Prototypen ist das unproblematisch, für vertraglich fixierte SLAs solltest du die finale Version abwarten.

**Lohnt sich Hy-4 gegenüber GLM-5.3 Flash oder ist Flash einfach nur billiger?**
Beides ist richtig, es kommt auf den Job an. Flash ist der Preis-Boden für Volumen-Tasks mit 18B aktiven Parametern und multimodalem Input. Hy-4 kostet etwa das Fünffache pro Token, bietet dafür aber die höhere Einzel-Token-Qualität und laut Tencent den besseren Stand auf langen Engineering-Tasks — die richtige Wahl also für die Mittelstufe zwischen Flash und Astra.

**Was bedeutet Apache 2.0 konkret für kommerzielle Nutzung?**
Apache 2.0 erlaubt Nutzung, Modifikation und Weitergabe in geschlossenen Produkten ohne Royalties, mit einer patentrechtlichen Schutzklausel. Für Builder heißt das: Das Modell lässt sich in SaaS-Produkte einbetten, ohne Lizenzketten zu fürchten. Für Feintuning und eigene Varianten gilt dasselbe — die Gewichte liegen auf Hugging Face und ModelScope aus.

**Wie sind die Benchmark-Zahlen einzuordnen?**
GPQA Diamond 92,3 und SWE-bench Pro 65,7 stammen aus Tencents eigenem Material, Terminal-Bench 85,4 und DeepSWE 64,3 aus Dritt-Auswertungen. Die blinde interne Evaluation gegen Kimi K3 und GLM-5.3 hat nur Tencent selbst veröffentlicht — das ist ein Hinweis, kein unabhängiger Beleg. Am schnellsten nachrechenbar sind die Preis-pro-Token-Zahlen, weil die offen auf den Provider-Seiten stehen.

**Welchen Einfluss hat die selbstoptimierte Trainings-Pipeline auf den Endnutzer?**
Der direkte Nutzen ist der günstigere Token-Preis: Mehr Durchsatz im Training bei gleicher Hardware senkt die Kalkulationsbasis. Der zweite Effekt ist die Modellqualität pro aktivem Parameter, denn 49B aktive Parameter bei 770B gesamt halten die Inferenz-Kosten pro Token niedrig. Beide Effekte summieren sich in der Preisliste — deshalb steht Hy-4 in dieser Rechnung zwischen Flash und Astra.

## Quellen
- [developersdigest.tech — Hy-4 Preview: 770B Open MoE, Preise und Benchmarks](https://www.developersdigest.tech/blog/tencent-hy4-preview-770b-open-moe-2026)
- [progressiverobot.com — Release-Einordnung und Preistabelle](https://www.progressiverobot.com/2026-08-28/hy4-preview-tencent-open-moe-1m-context)
- [aiweekly.co — Architektur-Details (Layer, Experten), GPQA/SWE-Werte](https://aiweekly.co/alerts/tencent-open-sources-hy4-preview-a-770b-moe-with-1m-token-context)
- [mindstudio.ai — Blinde Evaluation, Gated DSA/iHC, FP8](https://www.mindstudio.ai/blog/tencent-hy4-preview-open-weight-model)
- [testingcatalog.com — Preisliste, Zugangsweg (TokenHub, OpenRouter)](https://www.testingcatalog.com/tencent-released-open-source-hy4-preview-model)
- [openrouter.ai — GLM-5.3 Flash Preise und Kontext](https://openrouter.ai/z-ai/glm-5.3-flash)
- [openrouter.ai — GPT-6 Astra Preise](https://openrouter.ai/openai/gpt-6-astra)
- [finout.io — Astra Cache-Tarife im Vergleich](https://www.finout.io/blog/gpt-astra-pricing)
- [startupfortune.com — Markteinordnung](https://startupfortune.com/tencent-open-sources-a-770-billion-parameter-model-that-claims-to-outmanage-codex)
- [huggingface.co/Tencent-Hunyuan — offizielle Gewichte und Model-Cards](https://huggingface.co/Tencent-Hunyuan)

## Related

- [KI-Agent-Entwicklung](https://www.contextstudios.ai/de/ki-agent-entwicklung.md)
- [LLM-Entwicklung](https://www.contextstudios.ai/de/llm-entwicklung.md)
- [KI-Entwicklung](https://www.contextstudios.ai/de/ki-entwicklung.md)
- [Multi-Agent-Systeme](https://www.contextstudios.ai/de/multi-agent-systeme.md)
