Zurück zum BlogVon Michael Kerkhoff, Founder & CEO

DeepSeek V4.1 Flash: zweites Flash in Folge — 400 tok/s, native Multimodalität und die Preissenkung vom 10.09. als Kosten-Artefakt

DeepSeek V4.1 Flash: das zweite Flash-Modell in einer Woche — mit neuer Preisstaffel (Peak/Off-Peak), nativer Multimodalität und der Umleitung des Pro-Tarifs auf den Flash-Preis ab dem 14. September.

DeepSeek V4.1 Flash: zweites Flash in Folge — 400 tok/s, native Multimodalität und die Preissenkung vom 10.09. als Kosten-Artefakt

DeepSeek V4.1 Flash: zweites Flash in Folge — 400 tok/s, native Multimodalität und die Preissenkung vom 10.09. als Kosten-Artefakt

TL;DR: DeepSeek hat am 10. September 2026 mit V4.1 Flash das zweite Flash-Modell in einer Woche veröffentlicht — wieder ein temporärer Build mit stabilem Nachfolger. Für Builder ist das kein Ranking-Thema, sondern eine Rechnung: Die Preise pro Million Token sind deutlich gefallen, der alte Pro-Tarif wird ab 14. September auf den Flash-Tarif umgeleitet, und damit steigt jede cached Last. Wer mit festen Modell-IDs arbeitet, sollte ab sofort auf das Datum der nächsten Stable-Kennung achten.

Das Wichtigste in Kürze

DeepSeek-V4.1-FlashDeepSeek-V4-Flash (alt)
Preis pro Million Token$0.003 (cache-hit) / $0.15 (cache-miss) / $0.60 (output)$0.007 / $0.22 / $0.66
Effektiv ab10.09.2026, 04:00 UTC21.08.2026
Build-Statusstabil, offizieller API-Nametemporär, ersetzt durch V4.1
Multimodalja — natives Bild-Verständnisja

DeepSeek-V4.1-Flash ist der Nachfolger im Flash-Stack: gleiches Modell, mehr Token pro Dollar, und der Pro-Tarif bekommt über die Umleitung denselben Preis. Wer seine Calls auf deepseek-flash pinned, hat die Ersparnis automatisch.

Die zwei Preisstaffeln im Detail

Der Off-Peak-Tarif ist exakt halb so teuer wie der Peak-Tarif. DeepSeek definiert Peak als 01:00–04:00 UTC und 06:00–10:00 UTC, Montag bis Freitag. In Zahlen:

PeakOff-Peak
Eingabe (cache-hit)$0.006$0.003
Eingabe (cache-miss)$0.30$0.15
Ausgabe$1.20$0.60

Das heißt für einen einfachen 10K-Token-Cache-Miss + 2K-Output: rund 0,03 Dollar zur Peak-Zeit, 0,015 Dollar Off-Peak. Die alte V4-Tabelle (August 2026) lag noch bei 0,22 / 0,44 Dollar für Cache-Miss und 0,66 / 1,32 Dollar für Output. Die Ersparnis trifft also nicht nur neue, sondern auch bestehende Cached-Workloads.

Die Redirect-Mechanik ab 14. September

Der entscheidende Hebel ist nicht nur die neue Preisliste, sondern was sie mit dem Pro-Tarif macht. Ab dem 14. September 2026, 04:00 UTC (12:00 Peking), routet DeepSeek jede Anfrage an deepseek-v4-pro automatisch auf V4.1-Flash. Der Pro-Tarif verschwindet damit praktisch hinter dem Flash-Preis:

  • Cache-Miss-Eingabe: von $0.66 auf $0.15 — rund 77 % günstiger.
  • Output: von $1.98 auf $0.60 — rund 70 % günstiger.

Die Modelle deepseek-v4-flash und deepseek-v4-flash-vision-exp sind retired und leiten auf deepseek-flash um. Ein Builder mit festen IDs sieht also vier Modell-Namen, die sich hinter ihm ändern, ohne dass er den Code anfasst.

Cost-per-Task: das Zahlen-Artefakt

Der einfachste Weg, den Effekt zu sehen, ist eine kleine Rechnung. Beispiel: ein Support-Task mit 10.000 Token Cache-Miss-Eingabe und 2.000 Token Ausgabe.

Task-ParameterAlt (August 2026)Neu (ab 10.09.)
Kosten Peak~0,0106 $~0,0030 $
Kosten Off-Peak~0,0053 $~0,0015 $

Bei zwei 1-Million-Token-Batches — je eines zur Peak- und zur Off-Peak-Zeit — addieren sich die Einsparungen auf rund 17 Dollar pro Million. Das ist die Zahl, die in die Entscheidungs-Tabelle gehört.

Was das für den eigenen Stack bedeutet

Die Release-Notes beschreiben V4.1-Flash als kleines Modell der neuen Architektur-Familie mit nativer visueller Verständniseinheit; offizielle DeepSeek-Tabellen nennen 221–235 tok/s, unabhängige Runs wie WorldofAI berichten bis 400 tok/s je nach Hardware. Die 1M-Token-Kontext bleibt erhalten, das Max-Output liegt bei 384K.

Die Entscheidungsregel für diese Woche:

  • Wer deepseek-v4-pro pinned, bekommt ab 14. September automatisch den Flash-Tarif. Prüfen: stehen im Code noch alte Pro-Kostenannahmen?
  • Wer auf deepseek-flash pinned, spart sofort. Prüfen: ist die Cache-Hit-Ratio hoch genug, damit der cache-hit-Tarif greift?
  • Wer beide Modelle vergleicht, sollte die Staffeln getrennt rechnen: 01:00–04:00 und 06:00–10:00 UTC sind teuer, alles andere halb so teuer.

Multi-Modell-Setups: deepseek-v4-flash und deepseek-v4-flash-vision-exp existieren nicht mehr als eigene Nummern — beide Namen leiten auf deepseek-flash. Wer seine Modell-Liste hartcodiert hat, sieht eine Zeile weniger als erwartet.

Lokale Modelle: Die V4.1-Familie ist ein 552B-MoE mit 8B aktiven Parametern auf Input und 16B auf Output, MXFP4, rund 510 GB Disk-Footprint im vollen Stack, lizenziert unter MIT. Die lokale Inferenz-Option bleibt; die Frage ist der eigene GPU-Slot.

FAQ

Wann genau trat der neue Flash-Preis in Kraft? Die Preise wurden mit der V4.1-Flash-Veröffentlichung am 10. September 2026, 04:00 UTC aktiv. Ab diesem Zeitpunkt gilt deepseek-flash als Modell-Name in der API. Die alten Namen laufen seitdem als Redirects auf den neuen Build.

Was passiert mit dem Pro-Tarif nach dem 14. September? Der Pro-Tarif wird automatisch auf V4.1-Flash umgeleitet und zu Flash-Preisen abgerechnet. Das bedeutet konkret 77 % weniger Kosten für Cache-Miss-Input und rund 70 % für Output. Eine neue Pro-Generation kommt erst, wenn V4.1 Pro veröffentlicht wird.

Wie ist die Aufteilung zwischen Peak und Off-Peak definiert? Peak-Zeiten sind 01:00–04:00 und 06:00–10:00 UTC an Werktagen. Alle anderen Stunden sind Off-Peak, und die Preise dort betragen genau die Hälfte. Ein einfacher Hebel ist, Batch-Verarbeitung in die Off-Peak-Fenster zu legen und nur latenzkritische Anfragen zur Peak-Zeit laufen zu lassen.

Warum gibt es zwei unterschiedliche Durchsatz-Angaben? Die offiziellen DeepSeek-Tabellen nennen für V4.1-Flash 221–235 tok/s. Third-Party-Runs wie der WorldofAI-Test berichten bis 400 tok/s, abhängig von Hardware und Prompt-Größe. Für die Kostenrechnung zählt der offizielle Bereich; die 400-Zahl ist der beste Fall eines einzelnen Testlaufs.

Wie verhält sich das Modell zu lokalen GGUF-Setups? Die GGUF-Variante von Qwen3.8-27B mit 11,8 GB bleibt ein separater Punkt im selben Preisgefüge: lokale Stacks sind auf den 16-GB-Slot begrenzt, die API-Preise sind jetzt der Anker. Wer beide kombiniert, sollte die Off-Peak-Regel direkt in die Scheduling-Tabelle für die API-Läufe schreiben.

Quellen

Artikel teilen

Share: