Quand Choisir Chaque Option
Un guide clair basé sur votre situation spécifique et vos besoins.
Notre Recommandation
Il n'y a toujours pas de vainqueur unique, mais l'équilibre s'est déplacé depuis la première version de cette page — et il s'est déplacé des deux côtés en même temps. DeepSeek est désormais le meilleur choix par défaut pour presque toute décision de production sensible au coût. Aux tarifs OpenRouter actuels, deepseek-v4-flash-0731 coûte 0,14 $/M en entrée et 0,28 $/M en sortie contre 0,67 $/3,40 $ pour kimi-k2.7-code, soit environ 12 fois moins en sortie, et expose une fenêtre de 1 310 720 tokens contre 262 144 pour K2.7 — l'égalité que cette page enregistrait sur le contexte était tout simplement fausse. Le build 0731 constitue en outre les poids ouverts les plus récents de la comparaison (304B, 167 Go, fiche mise à jour le 01/08/2026) et paraît sous licence MIT simple, là où la fiche de Kimi K3 indique license: other avec license_name: kimi-k3. Si vous hébergez, affinez ou redistribuez, cette seule ligne de licence constitue une décision. Ce qui a changé en faveur de Moonshot, c'est la validation — mais pas pour le modèle que cette page nomme. ARC Prize a vérifié Kimi K3 le 31 juillet 2026 à 94,5 % sur ARC-AGI-1 Semi-Private et 60,4 % sur ARC-AGI-2, les meilleurs scores open-weight jamais enregistrés chez eux. Les gains de codage de Kimi K2.7 Code restent, eux, auto-déclarés sur le Kimi Code Bench v2 de Moonshot. La lecture honnête est donc la suivante : la lignée Kimi a gagné une crédibilité indépendante, et on la récupère en passant à K3, pas en restant sur K2.7. K2.7 Code conserve une avance réelle exactement là où cette page l'a toujours située : usage MCP des outils (76,0 MCP Atlas, 81,1 MCP Mark Verified), débit (180-260 tokens/s sur la variante HighSpeed) et consommation de tokens de raisonnement inférieure d'environ 30 % à celle de K2.6. Le constat le plus utile pour qui route réellement du trafic : le choix entre ces deux familles n'est pas le principal levier. Les chiffres d'ARC Prize montrent Kimi K3 passer de 60,4 % à 12,4 % sur ARC-AGI-2 uniquement parce que l'effort de raisonnement descend de max à low, et Simon Willison rapporte la même forme de l'autre côté : V4-Flash-0731 lui a donné un résultat décevant au niveau par défaut et bien meilleur avec reasoning_effort high. Un écart de précision d'un facteur cinq à l'intérieur d'un modèle dépasse l'écart entre les deux modèles. Évaluez un candidat au niveau d'effort que vous paierez vraiment, sinon le prix affiché est une fiction. Le schéma retenu par Context Studios reste le même dans sa forme et gagne en précision : router par défaut le codage borné à fort volume vers DeepSeek V4-Flash-0731 pour le coût et le contexte, escalader les cas de raisonnement les plus durs vers V4-Pro, et diriger les boucles d'agents fortement orientées orchestration MCP vers la lignée Kimi — en budgétant toutefois Kimi K3 plutôt que K2.7, puisque K3 est l'aboutissement vérifié de ce chemin, et en figeant le niveau d'effort de raisonnement dans la même configuration que le modèle. En plus, le 21/08/2026 DeepSeek a publié DeepSeek-V4-Flash-Vision-Exp — un modèle API multimodal expérimental (texte + image) avec des performances de texte proches de V4 Flash, listé sur OpenRouter à 0,22 $/M en entrée et 0,66 $/M en sortie avec 1M de contexte. Cela étend les cas de production de V4 Flash au travail agentique visuel (captures d'écran, interfaces, schémas) pour une fraction du coût des modèles multimodaux de pointe. Depuis le snapshot du 10.09.2026, le côté DeepSeek a bougé : V4-Flash-0731 passe à 0,065/0,18 $ par million de jetons, l'écart de sortie avec kimi-k2.7-code (~0,71/3,50 $) monte à ~19x ; un build V4.1 Flash (multimodal natif, ~400 jetons/s, fin 10.09) est signalé mais pas encore sur OpenRouter. La formule de routage reste : V4-Flash pour le volume, V4-Pro pour le raisonnement difficile, la lignée Kimi pour les boucles MCP, K3 comme extrémité vérifiée. Depuis le 10/09/2026, l'aperçu V4.1-Flash est confirmé (MoE 552 B, 8B/16B actifs, contexte 1M, 0,30/1,20 $) — et avec la redirection du 14/09, DeepSeek réunit sa gamme en un seul Flash qui sert aussi l'ancien identifiant v4-pro, tandis que Kimi garde une sémantique d'identifiants plus stable. Sur l'axe efficacité, le cache KV de V4.1 est annoncé à 890 octets par jeton (environ 510 Go de fichiers pour des runs locaux) — compression et tables de lookup comptent désormais autant que le nombre brut de paramètres.
- Choisissez Kimi K2.7 Code quand...
- Votre charge est fortement orientée MCP et la justesse des appels d'outils est le vrai goulot d'étranglement
- Vous êtes déjà sur la lignée Kimi K2.x et voulez un chemin de mise à niveau qui aboutit au K3 vérifié par ARC
- Le débit compte plus que le prix du token, et les 180-260 tokens/s de la variante HighSpeed sont rentables
- Vous pouvez tourner à un effort de raisonnement élevé ou maximal et achetez de la capacité de pointe plutôt qu'un coût par tâche
- Choisissez DeepSeek V4 quand...
- Le coût par token est votre contrainte principale — les tokens de sortie coûtent environ 19 fois moins avec V4-Flash-0731
- Vous avez besoin d'une fenêtre de contexte d'un million de tokens ; K2.7 Code plafonne à 262 144
- Vous hébergez, affinez ou redistribuez les poids et voulez une licence MIT simple, sans revue juridique
- Vous voulez les poids les plus récents des deux côtés, rafraîchis le 31/07/2026, sur une base de fournisseurs déjà large
- Vous voulez une famille couvrant une strate Flash économique et une strate Pro de pointe pour le routage
- Vous visez la plus grande avance de prix documentée : V4-Flash-0731 est passé à 0,065/0,18 $ par million de jetons au snapshot du 10.09.2026
- Vous voulez la consolidation de septembre 2026 : une ligne Flash unique (contexte 1M, vision, 8B/16B actifs, cache KV au quart) qui absorbe aussi le point v4-pro le 14/09.