Aktive Parameter (MoE)
Aktive Parameter bezeichnen bei Mixture-of-Experts-Modellen (MoE) die Zahl der Modellparameter, die bei der Verarbeitung eines einzelnen Tokens tatsächlich berechnet werden. Ein MoE-Modell besteht aus mehreren spezialisierten Expert-Blöcken; pro Token aktiviert ein Router nur einen kleinen Teil davon. Die aussagekräftige Kennzahl ist deshalb das Paar aus Gesamtgröße und aktiver Größe — etwa 125B gesamt / 6B aktiv bei Qwen 3.8 Flash Next, 770B / 49B beim Tencent Hy-4 Preview, rund 18B aktiv bei GLM 5.3 Flash, 2B beim kompakten Mini CPM5. Der Unterschied zum klassischen dichten Modell: Dort entspricht die pro Token rechnende Parameterzahl der Gesamtzahl. Bei MoE-Modellen skaliert der Rechenaufwand pro Token mit der aktiven Zahl, während der Speicherbedarf von der Gesamtzahl bestimmt wird — beide Werte beschreiben unterschiedliche Engpässe. Warum die aktive Zahl die Praxis bestimmt: Sie steuert direkt den Token-Durchsatz (mehr aktive Parameter = mehr Rechenoperationen pro Token), die Inferenzkosten pro Million Tokens und damit den API-Preis, während die Gesamtzahl den VRAM-Bedarf vorgibt. Ein Modell mit 125B gesamt und 6B aktiven Parametern rechnet pro Token wie ein kleines 6B-Modell, bietet aber die Wissensbreite eines deutlich größeren Modells — das ist die Effizienz-Frontier der aktuellen Open-Weight-Linie. Für die Einordnung von Modellangaben gilt: Die aktive Zahl ist keine Marketing-Kosmetik, sondern die zweite gleichwertige Kernmetrik. Angaben wie 125B/6B oder 770B/49B zeigen, dass Wissensbreite und Geschwindigkeit über die Entkopplung von Gesamt- und Aktivgröße erreichbar wurden — ehrliche Parameter-Paare statt einzelner Billionen-Ziffern.
Im Detail: Aktive Parameter (MoE)
Aktive Parameter bezeichnen bei Mixture-of-Experts-Modellen (MoE) die Zahl der Modellparameter, die bei der Verarbeitung eines einzelnen Tokens tatsächlich berechnet werden. Ein MoE-Modell besteht aus mehreren spezialisierten Expert-Blöcken; pro Token aktiviert ein Router nur einen kleinen Teil davon. Die aussagekräftige Kennzahl ist deshalb das Paar aus Gesamtgröße und aktiver Größe — etwa 125B gesamt / 6B aktiv bei Qwen 3.8 Flash Next, 770B / 49B beim Tencent Hy-4 Preview, rund 18B aktiv bei GLM 5.3 Flash, 2B beim kompakten Mini CPM5. Der Unterschied zum klassischen dichten Modell: Dort entspricht die pro Token rechnende Parameterzahl der Gesamtzahl. Bei MoE-Modellen skaliert der Rechenaufwand pro Token mit der aktiven Zahl, während der Speicherbedarf von der Gesamtzahl bestimmt wird — beide Werte beschreiben unterschiedliche Engpässe. Warum die aktive Zahl die Praxis bestimmt: Sie steuert direkt den Token-Durchsatz (mehr aktive Parameter = mehr Rechenoperationen pro Token), die Inferenzkosten pro Million Tokens und damit den API-Preis, während die Gesamtzahl den VRAM-Bedarf vorgibt. Ein Modell mit 125B gesamt und 6B aktiven Parametern rechnet pro Token wie ein kleines 6B-Modell, bietet aber die Wissensbreite eines deutlich größeren Modells — das ist die Effizienz-Frontier der aktuellen Open-Weight-Linie. Für die Einordnung von Modellangaben gilt: Die aktive Zahl ist keine Marketing-Kosmetik, sondern die zweite gleichwertige Kernmetrik. Angaben wie 125B/6B oder 770B/49B zeigen, dass Wissensbreite und Geschwindigkeit über die Entkopplung von Gesamt- und Aktivgröße erreichbar wurden — ehrliche Parameter-Paare statt einzelner Billionen-Ziffern.
Implementierungsdetails
- Tech-Stack
- Produktionsreife Leitplanken