DeepSeek V4.1 Flash: zweites Flash in Folge — 400 tok/s, native Multimodalität und die Preissenkung vom 10.09. als Kosten-Artefakt
TL;DR: DeepSeek hat am 10. September 2026 mit V4.1 Flash das zweite Flash-Modell in einer Woche veröffentlicht — wieder ein temporärer Build mit stabilem Nachfolger. Für Builder ist das kein Ranking-Thema, sondern eine Rechnung: Die Preise pro Million Token sind deutlich gefallen, der alte Pro-Tarif wird ab 14. September auf den Flash-Tarif umgeleitet, und damit steigt jede cached Last. Wer mit festen Modell-IDs arbeitet, sollte ab sofort auf das Datum der nächsten Stable-Kennung achten.
Das Wichtigste in Kürze
| DeepSeek-V4.1-Flash | DeepSeek-V4-Flash (alt) | |
|---|---|---|
| Preis pro Million Token | $0.003 (cache-hit) / $0.15 (cache-miss) / $0.60 (output) | $0.007 / $0.22 / $0.66 |
| Effektiv ab | 10.09.2026, 04:00 UTC | 21.08.2026 |
| Build-Status | stabil, offizieller API-Name | temporär, ersetzt durch V4.1 |
| Multimodal | ja — natives Bild-Verständnis | ja |
DeepSeek-V4.1-Flash ist der Nachfolger im Flash-Stack: gleiches Modell, mehr Token pro Dollar, und der Pro-Tarif bekommt über die Umleitung denselben Preis. Wer seine Calls auf deepseek-flash pinned, hat die Ersparnis automatisch.
Die zwei Preisstaffeln im Detail
Der Off-Peak-Tarif ist exakt halb so teuer wie der Peak-Tarif. DeepSeek definiert Peak als 01:00–04:00 UTC und 06:00–10:00 UTC, Montag bis Freitag. In Zahlen:
| Peak | Off-Peak | |
|---|---|---|
| Eingabe (cache-hit) | $0.006 | $0.003 |
| Eingabe (cache-miss) | $0.30 | $0.15 |
| Ausgabe | $1.20 | $0.60 |
Das heißt für einen einfachen 10K-Token-Cache-Miss + 2K-Output: rund 0,03 Dollar zur Peak-Zeit, 0,015 Dollar Off-Peak. Die alte V4-Tabelle (August 2026) lag noch bei 0,22 / 0,44 Dollar für Cache-Miss und 0,66 / 1,32 Dollar für Output. Die Ersparnis trifft also nicht nur neue, sondern auch bestehende Cached-Workloads.
Die Redirect-Mechanik ab 14. September
Der entscheidende Hebel ist nicht nur die neue Preisliste, sondern was sie mit dem Pro-Tarif macht. Ab dem 14. September 2026, 04:00 UTC (12:00 Peking), routet DeepSeek jede Anfrage an deepseek-v4-pro automatisch auf V4.1-Flash. Der Pro-Tarif verschwindet damit praktisch hinter dem Flash-Preis:
- Cache-Miss-Eingabe: von $0.66 auf $0.15 — rund 77 % günstiger.
- Output: von $1.98 auf $0.60 — rund 70 % günstiger.
Die Modelle deepseek-v4-flash und deepseek-v4-flash-vision-exp sind retired und leiten auf deepseek-flash um. Ein Builder mit festen IDs sieht also vier Modell-Namen, die sich hinter ihm ändern, ohne dass er den Code anfasst.
Cost-per-Task: das Zahlen-Artefakt
Der einfachste Weg, den Effekt zu sehen, ist eine kleine Rechnung. Beispiel: ein Support-Task mit 10.000 Token Cache-Miss-Eingabe und 2.000 Token Ausgabe.
| Task-Parameter | Alt (August 2026) | Neu (ab 10.09.) |
|---|---|---|
| Kosten Peak | ~0,0106 $ | ~0,0030 $ |
| Kosten Off-Peak | ~0,0053 $ | ~0,0015 $ |
Bei zwei 1-Million-Token-Batches — je eines zur Peak- und zur Off-Peak-Zeit — addieren sich die Einsparungen auf rund 17 Dollar pro Million. Das ist die Zahl, die in die Entscheidungs-Tabelle gehört.
Was das für den eigenen Stack bedeutet
Die Release-Notes beschreiben V4.1-Flash als kleines Modell der neuen Architektur-Familie mit nativer visueller Verständniseinheit; offizielle DeepSeek-Tabellen nennen 221–235 tok/s, unabhängige Runs wie WorldofAI berichten bis 400 tok/s je nach Hardware. Die 1M-Token-Kontext bleibt erhalten, das Max-Output liegt bei 384K.
Die Entscheidungsregel für diese Woche:
- Wer deepseek-v4-pro pinned, bekommt ab 14. September automatisch den Flash-Tarif. Prüfen: stehen im Code noch alte Pro-Kostenannahmen?
- Wer auf deepseek-flash pinned, spart sofort. Prüfen: ist die Cache-Hit-Ratio hoch genug, damit der cache-hit-Tarif greift?
- Wer beide Modelle vergleicht, sollte die Staffeln getrennt rechnen: 01:00–04:00 und 06:00–10:00 UTC sind teuer, alles andere halb so teuer.
Multi-Modell-Setups: deepseek-v4-flash und deepseek-v4-flash-vision-exp existieren nicht mehr als eigene Nummern — beide Namen leiten auf deepseek-flash. Wer seine Modell-Liste hartcodiert hat, sieht eine Zeile weniger als erwartet.
Lokale Modelle: Die V4.1-Familie ist ein 552B-MoE mit 8B aktiven Parametern auf Input und 16B auf Output, MXFP4, rund 510 GB Disk-Footprint im vollen Stack, lizenziert unter MIT. Die lokale Inferenz-Option bleibt; die Frage ist der eigene GPU-Slot.
FAQ
Wann genau trat der neue Flash-Preis in Kraft? Die Preise wurden mit der V4.1-Flash-Veröffentlichung am 10. September 2026, 04:00 UTC aktiv. Ab diesem Zeitpunkt gilt deepseek-flash als Modell-Name in der API. Die alten Namen laufen seitdem als Redirects auf den neuen Build.
Was passiert mit dem Pro-Tarif nach dem 14. September? Der Pro-Tarif wird automatisch auf V4.1-Flash umgeleitet und zu Flash-Preisen abgerechnet. Das bedeutet konkret 77 % weniger Kosten für Cache-Miss-Input und rund 70 % für Output. Eine neue Pro-Generation kommt erst, wenn V4.1 Pro veröffentlicht wird.
Wie ist die Aufteilung zwischen Peak und Off-Peak definiert? Peak-Zeiten sind 01:00–04:00 und 06:00–10:00 UTC an Werktagen. Alle anderen Stunden sind Off-Peak, und die Preise dort betragen genau die Hälfte. Ein einfacher Hebel ist, Batch-Verarbeitung in die Off-Peak-Fenster zu legen und nur latenzkritische Anfragen zur Peak-Zeit laufen zu lassen.
Warum gibt es zwei unterschiedliche Durchsatz-Angaben? Die offiziellen DeepSeek-Tabellen nennen für V4.1-Flash 221–235 tok/s. Third-Party-Runs wie der WorldofAI-Test berichten bis 400 tok/s, abhängig von Hardware und Prompt-Größe. Für die Kostenrechnung zählt der offizielle Bereich; die 400-Zahl ist der beste Fall eines einzelnen Testlaufs.
Wie verhält sich das Modell zu lokalen GGUF-Setups? Die GGUF-Variante von Qwen3.8-27B mit 11,8 GB bleibt ein separater Punkt im selben Preisgefüge: lokale Stacks sind auf den 16-GB-Slot begrenzt, die API-Preise sind jetzt der Anker. Wer beide kombiniert, sollte die Off-Peak-Regel direkt in die Scheduling-Tabelle für die API-Läufe schreiben.
Quellen
- DeepSeek Doku und Changelog: https://api.deepseek.com/docs
- Apidog-Preisübersicht (Peak/Off-Peak-Tabellen): https://apidog.com/blog/deepseek-v4-1-flash-pricing
- Coursiv — V4.1 Flash Kennzahlen und Redirect: https://coursiv.io/blog/deepseek-v4-1-flash
- CodingFleet — Architektur, Kontext, Max-Output: https://codingfleet.com/blog/deepseek-v4-1-flash-vs-claude-opus-5
- Eesel — Release-Zusammenfassung: https://www.eesel.ai/blog/deepseek-v4-1-flash
- WorldofAI-Prüfprotokoll: https://www.youtube.com/watch?v=T2dnchLabZQ