DeepSeek V4.1 Flash : deuxième Flash d'affilée — 400 tok/s, multimodalité native et la baisse de prix du 10.09 comme artefact de coûts
L'essentiel : DeepSeek a publié le 10 septembre 2026 V4.1 Flash, le deuxième modèle Flash en une semaine — encore un build temporaire avec un successeur stable. Pour les builders, ce n'est pas une question de classement mais de calcul : les prix par million de tokens ont nettement baissé, l'ancien tarif Pro est redirigé vers le tarif Flash dès le 14 septembre, et toute charge misée en profite. Si vous épinglez des IDs de modèle fixes, surveillez désormais la date du prochain identifiant stable.
L'essentiel en un coup d'œil
| DeepSeek-V4.1-Flash | DeepSeek-V4-Flash (ancien) | |
|---|---|---|
| Prix par million de tokens | $0.003 (cache-hit) / $0.15 (cache-miss) / $0.60 (sortie) | $0.007 / $0.22 / $0.66 |
| En vigueur depuis | 10.09.2026, 04:00 UTC | 21.08.2026 |
| Statut du build | stable, nom API officiel | temporaire, remplacé par V4.1 |
| Multimodal | oui — compréhension native des images | oui |
DeepSeek-V4.1-Flash est le successeur dans la stack Flash : même modèle, plus de tokens par dollar, et le tarif Pro obtient le même prix via la redirection. Celui qui épingle deepseek-flash capte automatiquement les économies.
Les deux grilles tarifaires en détail
Le tarif heure creuse est exactement la moitié du tarif heure de pointe. DeepSeek définit la pointe comme 01:00–04:00 UTC et 06:00–10:00 UTC, du lundi au vendredi. En chiffres :
| Pointe | Creuse | |
|---|---|---|
| Entrée (cache-hit) | $0.006 | $0.003 |
| Entrée (cache-miss) | $0.30 | $0.15 |
| Sortie | $1.20 | $0.60 |
Pour un simple cache-miss de 10K tokens plus 2K de sortie : environ $0.03 en pointe, $0.015 en creuse. L'ancien tableau V4 (août 2026) était encore à $0.22/$0.44 pour les cache-miss et $0.66/$1.32 pour la sortie. Les économies s'appliquent donc aussi aux charges existantes misées en cache.
La mécanique de redirection dès le 14 septembre
Le levier décisif n'est pas seulement la nouvelle grille mais ce qu'elle fait au tarif Pro. À partir du 14 septembre 2026, 04:00 UTC (12:00 Pékin), DeepSeek route automatiquement chaque requête deepseek-v4-pro vers V4.1-Flash. Le tarif Pro disparaît pratiquement derrière le prix Flash :
- Entrée cache-miss : de $0.66 à $0.15 — environ 77 % moins cher.
- Sortie : de $1.98 à $0.60 — environ 70 % moins cher.
Les modèles deepseek-v4-flash et deepseek-v4-flash-vision-exp sont retirés et redirigent vers deepseek-flash. Un builder avec des IDs fixes voit donc quatre noms de modèle changer derrière lui sans toucher au code.
Coût par tâche : l'artefact numérique
Le chemin le plus simple pour voir l'effet est un petit calcul. Exemple : une tâche support avec 10 000 tokens d'entrée cache-miss et 2 000 tokens de sortie.
| Paramètre de tâche | Ancien (août 2026) | Nouveau (dès le 10.09.) |
|---|---|---|
| Coût en pointe | ~$0.0106 | ~$0.0030 |
| Coût en creuse | ~$0.0053 | ~$0.0015 |
Avec deux batches d'un million de tokens — un en pointe, un en creuse — les économies atteignent environ 17 dollars par million. C'est le chiffre qui appartient au tableau de décision.
Ce que cela signifie pour votre stack
Les notes de version décrivent V4.1-Flash comme un petit modèle de la nouvelle famille d'architectures avec une unité native de compréhension visuelle ; les tableaux officiels DeepSeek indiquent 221–235 tok/s, des runs indépendants comme WorldofAI rapportent jusqu'à 400 tok/s selon le matériel. Le contexte de 1M tokens est conservé, la sortie max est de 384K.
La règle de décision pour cette semaine :
- Vous épinglez deepseek-v4-pro ? Dès le 14 septembre vous obtenez automatiquement le tarif Flash. À vérifier : d'anciennes hypothèses de coût Pro traînent-elles encore dans le code ?
- Vous épinglez deepseek-flash ? Vous économisez immédiatement. À vérifier : le ratio de cache-hit est-il assez élevé pour que le tarif cache-hit s'applique ?
- Vous comparez les deux modèles : calculez les grilles séparément — 01:00–04:00 et 06:00–10:00 UTC sont chers, tout le reste coûte la moitié.
Setups multi-modèles : deepseek-v4-flash et deepseek-v4-flash-vision-exp n'existent plus comme IDs propres — les deux noms redirigent vers deepseek-flash. Une liste de modèles codée en dur affichera une ligne de moins que prévu.
Modèles locaux : la famille V4.1 est un MoE 552B avec 8B de paramètres actifs en entrée et 16B en sortie, MXFP4, environ 510 Go d'empreinte disque pour le stack complet, sous licence MIT. L'option d'inférence locale reste ; la question est votre slot GPU.
FAQ
Quand exactement le nouveau prix Flash est-il entré en vigueur ? Les prix sont actifs depuis la publication de V4.1-Flash le 10 septembre 2026, 04:00 UTC. Depuis, deepseek-flash est le nom de modèle dans l'API. Les anciens noms fonctionnent comme des redirections vers le nouveau build.
Que devient le tarif Pro après le 14 septembre ? Le tarif Pro est automatiquement redirigé vers V4.1-Flash et facturé aux prix Flash : concrètement 77 % de coût en moins pour l'entrée cache-miss et environ 70 % pour la sortie. Une nouvelle génération Pro n'arrive qu'avec la publication de V4.1 Pro.
Comment la pointe et la creuse sont-elles définies ? Les heures de pointe sont 01:00–04:00 et 06:00–10:00 UTC les jours ouvrés. Toutes les autres heures sont creuses, à exactement la moitié du prix. Un levier simple : déplacer le batch en heures creuses et ne laisser en pointe que les requêtes critiques en latence.
Pourquoi deux chiffres de débit différents ? Les tableaux officiels DeepSeek indiquent 221–235 tok/s pour V4.1-Flash. Des runs tiers comme le test WorldofAI rapportent jusqu'à 400 tok/s selon le matériel et la taille du prompt. Pour le calcul des coûts, retenez la fourchette officielle ; les 400 sont le meilleur cas d'un test unique.
Quel rapport avec les setups GGUF locaux ? La variante GGUF de Qwen3.8-27B à 11,8 Go reste un point séparé dans le même paysage de prix : les stacks locaux sont limités au slot 16 Go, et les prix API sont désormais l'ancre. Si vous combinez les deux, écrivez la règle heure creuse directement dans la table de scheduling des runs API.
Sources
- Docs et changelog DeepSeek : https://api.deepseek.com/docs
- Apidog, tableau des prix (pointe/creuse) : https://apidog.com/blog/deepseek-v4-1-flash-pricing
- Coursiv — indicateurs V4.1 Flash et redirection : https://coursiv.io/blog/deepseek-v4-1-flash
- CodingFleet — architecture, contexte, sortie max : https://codingfleet.com/blog/deepseek-v4-1-flash-vs-claude-opus-5
- Eesel — résumé de la release : https://www.eesel.ai/blog/deepseek-v4-1-flash
- Journal de test WorldofAI : https://www.youtube.com/watch?v=T2dnchLabZQ