Wann Sie welche Option wählen sollten
Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.
Unsere Empfehlung
Es gibt weiterhin keinen Einzelsieger, doch das Gleichgewicht hat sich seit der ersten Fassung dieser Seite verschoben — und zwar auf beiden Seiten gleichzeitig. DeepSeek ist inzwischen der stärkere Standard für nahezu jede kostensensible Produktionsentscheidung. Nach aktuellen OpenRouter-Preisen kostet deepseek-v4-flash-0731 0,14 $/M Input und 0,28 $/M Output gegenüber 0,67 $/3,40 $ für kimi-k2.7-code, also rund 12-mal weniger beim Output, und stellt ein Kontextfenster von 1.310.720 Tokens bereit gegenüber 262.144 bei K2.7 — das zuvor hier vermerkte Unentschieden beim Kontext war schlicht falsch. Der 0731-Build ist zudem das neueste offene Gewicht im Vergleich (304B, 167 GB, Karte aktualisiert am 01.08.2026) und erscheint unter schlichter MIT-Lizenz, während die Karte von Kimi K3 license: other mit license_name: kimi-k3 nennt. Wer selbst hostet, feintunt oder weitergibt, trifft allein an dieser Lizenzzeile eine Entscheidung. Zugunsten von Moonshot hat sich die Validierungslage verändert — allerdings nicht für das Modell, das diese Seite benennt. ARC Prize verifizierte Kimi K3 am 31. Juli 2026 mit 94,5 % auf ARC-AGI-1 Semi-Private und 60,4 % auf ARC-AGI-2 — die höchsten je dort erfassten Open-Weight-Werte. Die Coding-Kennzahlen von Kimi K2.7 Code stammen dagegen weiterhin aus Moonshots eigenem Kimi Code Bench v2. Die ehrliche Lesart lautet also: Die Kimi-Reihe hat sich unabhängige Glaubwürdigkeit erarbeitet, und man holt sie ab, indem man auf K3 wechselt, nicht indem man auf K2.7 bleibt. K2.7 Code hält weiterhin genau dort einen echten Vorsprung, wo diese Seite es immer gesagt hat: bei der MCP-Tool-Nutzung (76,0 MCP Atlas, 81,1 MCP Mark Verified), beim Durchsatz (180-260 Tokens/Sek. in der HighSpeed-Variante) und bei rund 30 % geringerem Reasoning-Token-Verbrauch gegenüber K2.6. Die nützlichste Erkenntnis für alle, die tatsächlich Traffic routen: Die Wahl zwischen diesen beiden Familien ist nicht der größte Hebel. Die Zahlen von ARC Prize zeigen Kimi K3 auf ARC-AGI-2 von 60,4 % auf 12,4 % fallen, nur weil der Reasoning-Aufwand von max auf low sinkt, und Simon Willison berichtet auf der Gegenseite dasselbe Muster: V4-Flash-0731 lieferte beim Standard-Reasoning ein enttäuschendes und bei reasoning_effort high ein deutlich besseres Ergebnis. Ein fünffacher Genauigkeitsunterschied innerhalb eines Modells ist größer als der Abstand zwischen den beiden Modellen. Testen Sie einen Kandidaten auf der Aufwandsstufe, die Sie später auch bezahlen — sonst ist der Schlagzeilenpreis Fiktion. Das Muster von Context Studios bleibt in der Form gleich und wird im Detail schärfer: Hochvolumige, klar begrenzte Coding-Last standardmäßig auf DeepSeek V4-Flash-0731 für Kosten und Kontext, die härtesten Reasoning-Fälle auf V4-Pro eskalieren und MCP-orchestrierungslastige Agent-Schleifen auf die Kimi-Reihe routen — dabei jedoch mit Kimi K3 statt K2.7 kalkulieren, da K3 das verifizierte Ende dieses Pfades ist, und die Reasoning-Aufwandsstufe in derselben Konfiguration festschreiben wie das Modell. Zusätzlich hat DeepSeek am 21.08.2026 DeepSeek-V4-Flash-Vision-Exp veröffentlicht — ein experimentelles multimodales API-Modell (Text + Bild) mit V4-Flash-naher Textleistung, auf OpenRouter für 0,22 $/M Input und 0,66 $/M Output mit 1-M-Kontext gelistet. Damit erweitert V4 Flash seine Produktions-Fälle um visuelle Agenten-Aufgaben (Screenshots, UIs, Diagramme) zu einem Bruchteil der Kosten von Frontier-Multimodal-Modellen. Seit dem Snapshot vom 10.09.2026 hat die DeepSeek-Seite erneut bewegt: V4-Flash-0731 halbiert auf 0,065/0,18 $ pro Million Tokens, die Ausgabe-Lücke zu kimi-k2.7-code (~0,71/3,50 $) wächst auf ~19x; ein V4.1-Flash-Test-Build (natives Multimodal, ~400 tok/s, Cut-off 10.09.) ist gemeldet, aber noch nicht bei OpenRouter. Die Routing-Formel bleibt: V4-Flash für die Masse, V4-Pro für das härteste Reasoning, die Kimi-Linie für MCP-lastige Schleifen — mit K3 als verifiziertem Ende. Seit dem 10.09.2026 ist der V4.1-Flash-Preview bestätigt (552B-MoE, 8B/16B aktiv, 1M Kontext, 0,30/1,20 $) — und mit dem 14.09.-Redirect bündelt DeepSeek seine Linie in einem Flash-Rückgrat, das auch die alte v4-pro-ID bedient, während Kimi die stabilere ID-Semantik hält. Auf der Effizienz-Achse wird V4.1s KV-Cache mit 890 Bytes pro Token angegeben (ca. 510 GB Dateien für lokale Läufe) — Kompression und Lookup-Tabellen zählen inzwischen so viel wie die reine Parameterzahl.
- Wählen Sie Kimi K2.7 Code, wenn...
- Ihre Last ist MCP-lastig und die Treffsicherheit der Tool-Aufrufe ist der eigentliche Engpass
- Sie sind bereits auf der Kimi-K2.x-Reihe und wollen einen Upgrade-Pfad, der beim ARC-verifizierten K3 endet
- Durchsatz zählt für Sie mehr als Tokenpreis, und die 180-260 Tokens/Sek. der HighSpeed-Variante rechnen sich
- Sie können mit hohem oder maximalem Reasoning-Aufwand fahren und kaufen Spitzenleistung statt Kosten pro Aufgabe
- Wählen Sie DeepSeek V4, wenn...
- Kosten pro Token sind Ihre Hauptrestriktion — Output-Tokens sind bei V4-Flash-0731 rund 19-mal günstiger
- Sie brauchen ein Kontextfenster im Millionenbereich; K2.7 Code endet bei 262.144 Tokens
- Sie hosten, feintunen oder verteilen Gewichte selbst und wollen eine schlichte MIT-Lizenz ohne Rechtsprüfung
- Sie wollen die neuesten Gewichte auf beiden Seiten, aufgefrischt am 31.07.2026, auf bereits breiter Anbieterbasis
- Sie wollen eine Familie mit günstiger Flash-Stufe und Frontier-Pro-Stufe für das Routing
- Sie die dokumentiert größte Preislead wollen: V4-Flash-0731 halbierte im Snapshot vom 10.09.2026 auf 0,065/0,18 $ pro Million Tokens
- Sie wollen die Konsolidierung vom September 2026: eine 1M-Kontext-, vision-fähige Flash-Linie (8B/16B aktiv, 1/4 KV-Cache), die am 14.09. auch den v4-pro-Endpunkt aufnimmt.