Kimi K3 vs Claude Opus 5 (2026): Die Gewichte sind da — jetzt zählen Lizenz und VRAM-Rechnung
Kimi K3 hat seine Gewichte am 27. Juli 2026 veröffentlicht. Entscheidend sind jetzt Lizenzschwellen, 1,5 TB VRAM, Preis und Reproduzierbarkeit.
Die Prämisse, auf der diese Seite aufgebaut war, ist hinfällig — und es lohnt sich, genau zu sagen, warum. Die Gewichte von Kimi K3 waren für den 27. Juli 2026 angekündigt und erschienen am 27. Juli 2026, um 16:29 UTC. Unsere Prüfung lief am selben Morgen um 03:50 UTC und fand nichts, was in diesem Moment zutraf und am Nachmittag in die Irre führte. Nehmen Sie das als die Lehre, die darin steckt: Eine Aussage darüber, ob etwas schon existiert, hat eine Halbwertszeit von Stunden — und sie altert nicht in einen Stale-Filter hinein, sie wird einfach still und leise falsch. Nach dieser Korrektur steht Kimi K3 besser da als zuvor, aber auf anderem Boden. Die Gewichte sind real, werden breit genutzt und wurden von Red Hat und Unsloth bereits requantisiert. Der Preisvorteil bleibt bei 3 / 15 USD gegenüber 5 / 25 USD. Beim Kontextfenster liegt mit je rund einer Million Token echter Gleichstand vor. Und K3 leistet etwas, das Opus nicht leistet: Es veröffentlicht seine Eval-Ergebnisse als maschinenlesbares YAML direkt neben herunterladbaren Gewichten und macht Herstellerangaben damit widerlegbar. Nachgerechnet hat das bisher niemand öffentlich, deshalb werten wir es als Gleichstand und nicht als Sieg. Was die offenen Gewichte nicht leisten: Self-Hosting zu einer normalen Entscheidung machen. Mit 2,8 Billionen Parametern braucht K3 über 1,5 TB VRAM vor jedem KV-Cache und passt nicht auf einen Knoten mit acht B200. Praktisch sind acht Karten mit 288 GB — und die interessanteste Zahl dieses Laufs ist, dass die günstigere Karte gewinnt: 8x AMD MI355X lieferten 48 Token pro Sekunde je Dollar GPU-Stunde gegenüber 33 auf einer B300, die pro GPU rund 2,4-mal mehr kostet. Wer Self-Hosting bisher zu NVIDIA-Preisen kalkuliert hat, hat hier eine echte Lücke im Modell. Also: Kimi K3, wenn Ihre Nutzung intern ist, die Token-Kosten binden und Hardware der 288-GB-Klasse vorhanden oder mietbar ist. Claude Opus 5, wenn Sie EU-Datenkontrolle mit Compliance-API brauchen, keinen eigenen Serving-Stack betreiben wollen oder als Model-as-a-Service-Anbieter auf 20 Mio. USD Umsatz zulaufen — denn an dieser Grenze hört die Kimi K3 Licence auf, großzügig zu sein, und wird zur Verhandlung. Die offenen Gewichte beenden die Entscheidung nicht. Sie verschieben sie von der Verfügbarkeit hin zu Wirtschaftlichkeit und Rechtslage, wo sie von Anfang an hingehört hätte.
Detaillierter Vergleich
Eine Gegenüberstellung der wichtigsten Faktoren für Ihre Entscheidung.
| Faktor | Kimi K3Empfohlen | Claude Opus 5 | Gewinner |
|---|---|---|---|
| Offene Gewichte & Self-Hosting | Ausgeliefert: moonshotai/Kimi-K3 am 27.07.2026 um 16:29 UTC veröffentlicht — 96 safetensors-Shards, 837.000 Downloads und 9.600 Likes in sechs Tagen | Geschlossen und bewusst nur per API; auf keiner Stufe werden Gewichte angeboten | |
| Kommerzielle Lizenzbedingungen | Kimi K3 Licence, nicht MIT: interne Nutzung uneingeschränkt, aber ein Model-as-a-Service-Geschäft mit mehr als 20 Mio. USD Umsatz in zwölf Monaten braucht eine gesonderte Vereinbarung mit Moonshot | Übliche kommerzielle API-Bedingungen: keine Umsatzschwelle, keine Nennungspflicht, keine Vereinbarung zu verhandeln | |
| Einhaltung des Release-Termins | Termin gehalten — die Gewichte erschienen am 27. Juli 2026, dem angekündigten Tag | Veröffentlicht grundsätzlich keine Gewichte, es gibt also keine Zusage, die gehalten oder gebrochen werden könnte | |
| Preis je 1 Mio. Token | 3 USD ein / 15 USD aus (OpenRouter, 03.08.2026) — rund 40 % unter der Opus-Stufe | 5 USD ein / 25 USD aus (OpenRouter, 03.08.2026), unverändert gegenüber Opus 4.8 | |
| Tatsächliche Kosten des Self-Hostings | 2,8 Billionen Parameter brauchen über 1,5 TB VRAM noch ohne KV-Cache — auf einen Knoten mit 8x B200 passt das nicht; nötig sind 8x MI355X oder B300 (je 288 GB) oder 16 B200 über zwei Knoten | Gar keine Infrastruktur: keine GPU-Beschaffung, kein Serving-Stack, kein Kernel-Debugging | |
| Unabhängige Benchmark-Prüfung | Liefert die Eval-Ergebnisse als YAML im Repository mit (GPQA-Diamond 93,5, HLE 56, DeepSWE 67,5, APEX-Agents 41) — weiterhin Herstellerwerte, aber durch die offenen Gewichte reproduzierbar | Vom Hersteller erhobene Tabellen ohne Gewichte, an denen sie sich nachrechnen ließen | |
| EU-Datenkontrolle | In China gehostete API — oder Self-Hosting in Ihrer eigenen Region, wenn Sie die Hardware finanzieren | EU-Regionen über Bedrock und Vertex plus Compliance-API — der kürzere Weg zu einem unterzeichneten AV-Vertrag | |
| Kontextfenster | 1.048.576 Token (OpenRouter, geprüft am 03.08.2026) | 1.000.000 Token (OpenRouter, geprüft am 03.08.2026) | |
| Native Multimodalität | Vision ist eingebaut, nicht angeflanscht — das Repository liefert einen Vision-Prozessor und registriert das Modell als image-text-to-text | Multimodale Eingaben werden auf der Claude-Plattform unterstützt | |
| Gesamtpunktzahl | 3/ 9 | 2/ 9 | 4 unentschieden |
Wichtige Statistiken
Echte Daten aus verifizierten Branchenquellen zur Unterstützung Ihrer Entscheidung.
Hugging Face API (erneut geprüft am 3. August 2026)
Kimi K3 Licence (Primärquelle, im Repository)
Kimi K3 Model Card und .eval_results im Repository
OpenRouter Models API (geprüft am 3. August 2026)
Wafer, Ian Ye (31. Juli 2026)
Kimi K3 Model Card
Alle Statistiken stammen aus verifizierten Drittquellen. Quelle, Jahr und Original-Link werden direkt bei jeder Kennzahl angezeigt.
Wann Sie welche Option wählen sollten
Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.
Wählen Sie Kimi K3, wenn...
- Sie wollen Gewichte, die Sie tatsächlich herunterladen, prüfen und festschreiben können — es gibt sie, und über 800.000 Downloads belegen eine funktionierende Lieferkette
- Ihre Nutzung ist intern, womit Sie außerhalb beider Lizenzschwellen liegen
- Die API-Kosten sind der begrenzende Faktor, und rund 40 % je Token geben den Ausschlag
- Sie betreiben bereits Beschleuniger der 288-GB-Klasse, oder Ihr Anbieter tut es — dann ist eine 1,5-TB-Installation eine Beschaffungsfrage und keine Illusion
Wählen Sie Claude Opus 5, wenn...
- Das Modell soll funktionieren, ohne dass Sie einen Serving-Stack besitzen, mieten oder debuggen
- Sie unterliegen EU- oder Konzern-Datenschutzvorgaben und wollen EU-Regionen samt Compliance-API statt eines in China gehosteten Endpunkts
- Sie sind ein Model-as-a-Service-Anbieter nahe der 20-Mio.-USD-Grenze und wollen keine Lizenzverhandlung auf dem kritischen Pfad
- Sie wollen Benchmark-Aussagen von einem Anbieter mit vertraglichem Support und sind nicht in der Lage, Evals selbst nachzurechnen
Unsere Empfehlung
Die Prämisse, auf der diese Seite aufgebaut war, ist hinfällig — und es lohnt sich, genau zu sagen, warum. Die Gewichte von Kimi K3 waren für den 27. Juli 2026 angekündigt und erschienen am 27. Juli 2026, um 16:29 UTC. Unsere Prüfung lief am selben Morgen um 03:50 UTC und fand nichts, was in diesem Moment zutraf und am Nachmittag in die Irre führte. Nehmen Sie das als die Lehre, die darin steckt: Eine Aussage darüber, ob etwas schon existiert, hat eine Halbwertszeit von Stunden — und sie altert nicht in einen Stale-Filter hinein, sie wird einfach still und leise falsch. Nach dieser Korrektur steht Kimi K3 besser da als zuvor, aber auf anderem Boden. Die Gewichte sind real, werden breit genutzt und wurden von Red Hat und Unsloth bereits requantisiert. Der Preisvorteil bleibt bei 3 / 15 USD gegenüber 5 / 25 USD. Beim Kontextfenster liegt mit je rund einer Million Token echter Gleichstand vor. Und K3 leistet etwas, das Opus nicht leistet: Es veröffentlicht seine Eval-Ergebnisse als maschinenlesbares YAML direkt neben herunterladbaren Gewichten und macht Herstellerangaben damit widerlegbar. Nachgerechnet hat das bisher niemand öffentlich, deshalb werten wir es als Gleichstand und nicht als Sieg. Was die offenen Gewichte nicht leisten: Self-Hosting zu einer normalen Entscheidung machen. Mit 2,8 Billionen Parametern braucht K3 über 1,5 TB VRAM vor jedem KV-Cache und passt nicht auf einen Knoten mit acht B200. Praktisch sind acht Karten mit 288 GB — und die interessanteste Zahl dieses Laufs ist, dass die günstigere Karte gewinnt: 8x AMD MI355X lieferten 48 Token pro Sekunde je Dollar GPU-Stunde gegenüber 33 auf einer B300, die pro GPU rund 2,4-mal mehr kostet. Wer Self-Hosting bisher zu NVIDIA-Preisen kalkuliert hat, hat hier eine echte Lücke im Modell. Also: Kimi K3, wenn Ihre Nutzung intern ist, die Token-Kosten binden und Hardware der 288-GB-Klasse vorhanden oder mietbar ist. Claude Opus 5, wenn Sie EU-Datenkontrolle mit Compliance-API brauchen, keinen eigenen Serving-Stack betreiben wollen oder als Model-as-a-Service-Anbieter auf 20 Mio. USD Umsatz zulaufen — denn an dieser Grenze hört die Kimi K3 Licence auf, großzügig zu sein, und wird zur Verhandlung. Die offenen Gewichte beenden die Entscheidung nicht. Sie verschieben sie von der Verfügbarkeit hin zu Wirtschaftlichkeit und Rechtslage, wo sie von Anfang an hingehört hätte.
Häufig gestellte Fragen
Häufige Fragen zu diesem Vergleich beantwortet.
Brauchen Sie Hilfe bei der Entscheidung?
Buchen Sie ein kostenloses 30-minütiges Beratungsgespräch und wir helfen Ihnen, den besten Ansatz für Ihr Projekt zu bestimmen.