Technologie

DeepSeek V4.1 Flash vs V4 Flash (2026): Eine Woche Abstand, ein komplettes Preisblatt Abstand

DeepSeek V4.1 Flash vs V4 Flash 2026: Preisblätter, natives Vision, Pro-Redirect und was sich für Cache-Workloads ändert — mit klarer Entscheidungsregel.

5
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
vs
0
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
Schnellurteil

V4.1 Flash ist die einzige aktuelle Eintrag der Flash-Linie: gleiches Context, etwa ein Drittel des Preises, natives Vision in einer ID, stabiler Name. V4 Flash bleibt als August-Preisblatt hinter dem Redirect und als historischer Snapshot für reproduzierbare Evaluationen bestehen. Entscheidungsregel: Stufen getrennt rechnen (Peak 01:00–04:00 und 06:00–10:00 UTC, sonst halber Preis), das deepseek-flash-Pinning für sich arbeiten lassen und auf dem neuen Preisblatt budgetieren — die alten Pro-Annahmen gelten seit dem 14.09.2026 nicht mehr.

Detaillierter Vergleich

Eine Gegenüberstellung der wichtigsten Faktoren für Ihre Entscheidung.

Faktor
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres PreisblattEmpfohlen
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash umGewinner
Input Preis
Cache-Hit 0,003 $, Cache-Miss 0,15 $ off-peak (Peak doppelt)
Cache-Hit 0,007 $, Cache-Miss 0,22 $ off-peak (Peak doppelt)
Output Preis
0,60 $ pro 1M Tokens off-peak, 1,20 $ Peak
0,66 $ off-peak, 1,32 $ Peak
Multimodalitaet
Natives Bildverständnis in der einen ID deepseek-flash
Bild nur über separate ID deepseek-v4-flash-vision-exp (stillgelegt)
Context Fenster
1M-Token-Context, 384K max. Output
1M-Token-Context, 384K max. Output
Api Namens Stabilitaet
Stabiler, offizieller API-Name im aktuellen Preisblatt
Temporärer Build, ersetzt am 10.09.2026 — Name löst nicht mehr eigenständig auf
Pro Plan Effekt
Seit 14.09.2026 läuft jeder deepseek-v4-pro-Request über das V4.1-Flash-Preisblatt (ca. 77 % günstiger Cache-Miss, ca. 70 % günstiger Output)
Kein eigener Effekt — das alte Pro-Preisblatt ist vollständig abgelöst
Peak Offpeak System
Off-Peak exakt die Hälfte; Peak = Mo–Fr 01:00–04:00 und 06:00–10:00 UTC
Dieselbe Zwei-Stufen-Logik, nur auf dem höheren August-Niveau
Lokaler Betrieb
Offene MIT-Weights, 552B MoE mit 8B aktiven Params in / 16B out, MXFP4, ca. 510 GB voller Stack
Dieselbe Architektur-Familie und Lizenz; kleinerer Weight-Snapshot auf der Platte
Gesamtpunktzahl5/ 80/ 83 unentschieden
Input Preis
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
Cache-Hit 0,003 $, Cache-Miss 0,15 $ off-peak (Peak doppelt)
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
Cache-Hit 0,007 $, Cache-Miss 0,22 $ off-peak (Peak doppelt)
Output Preis
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
0,60 $ pro 1M Tokens off-peak, 1,20 $ Peak
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
0,66 $ off-peak, 1,32 $ Peak
Multimodalitaet
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
Natives Bildverständnis in der einen ID deepseek-flash
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
Bild nur über separate ID deepseek-v4-flash-vision-exp (stillgelegt)
Context Fenster
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
1M-Token-Context, 384K max. Output
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
1M-Token-Context, 384K max. Output
Api Namens Stabilitaet
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
Stabiler, offizieller API-Name im aktuellen Preisblatt
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
Temporärer Build, ersetzt am 10.09.2026 — Name löst nicht mehr eigenständig auf
Pro Plan Effekt
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
Seit 14.09.2026 läuft jeder deepseek-v4-pro-Request über das V4.1-Flash-Preisblatt (ca. 77 % günstiger Cache-Miss, ca. 70 % günstiger Output)
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
Kein eigener Effekt — das alte Pro-Preisblatt ist vollständig abgelöst
Peak Offpeak System
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
Off-Peak exakt die Hälfte; Peak = Mo–Fr 01:00–04:00 und 06:00–10:00 UTC
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
Dieselbe Zwei-Stufen-Logik, nur auf dem höheren August-Niveau
Lokaler Betrieb
V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt
Offene MIT-Weights, 552B MoE mit 8B aktiven Params in / 16B out, MXFP4, ca. 510 GB voller Stack
V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um
Dieselbe Architektur-Familie und Lizenz; kleinerer Weight-Snapshot auf der Platte

Wichtige Statistiken

Echte Daten aus verifizierten Branchenquellen zur Unterstützung Ihrer Entscheidung.

Cache-Miss-Input nach Pro-Redirect: 0,66 $ → 0,15 $ pro 1M Tokens (ca. 77 % günstiger)

DeepSeek-Changelog

Output-Preis nach Pro-Redirect: 1,98 $ → 0,60 $ pro 1M Tokens (ca. 70 % günstiger)

DeepSeek-Changelog

Beispielaufgabe (10K Cache-Miss + 2K Output) im Peak: ca. 0,0106 $ (August) → ca. 0,0030 $ (ab 10.09.)

Apidog-Preisübersicht

Ersparnis über je einen Peak- und Off-Peak-1M-Batch: ca. 17 $ pro Million Tokens

Apidog-Preisübersicht

Durchsatz: 221–235 tok/s offiziell, bis 400 tok/s in Dritt-Runs

Coursiv / WorldofAI

Stichtage: neue Preise 10.09.2026 04:00 UTC; Pro-Redirect 14.09.2026 04:00 UTC

DeepSeek-Changelog

Alle Statistiken stammen aus verifizierten Drittquellen. Quelle, Jahr und Original-Link werden direkt bei jeder Kennzahl angezeigt.

Wann Sie welche Option wählen sollten

Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.

Wählen Sie V4.1 Flash — aktueller stabiler API-Name, native Multimodalität, günstigeres Preisblatt, wenn...

  • Produktions-Agenten auf der bezahlten API mit minütlicher Kostenplanung.
  • Bildverständnis und Text in einer einzigen, stabilen Modell-ID gefragt sind.
  • Caching-Workloads laufen — der Cache-Hit gilt jetzt bei 0,003 $ pro 1M.
  • Der Pro-Redirect vom 14.09. ohne Code-Änderung wirken soll.

Wählen Sie V4 Flash — temporärer August-Build, stillgelegt, leitet auf deepseek-flash um, wenn...

  • Eine August-Evaluation 2026 mit dem alten Preis-Snapshot reproduziert wird.
  • Der ältere lokale Weight-Snapshot mit geringerem Platzbedarf läuft.
  • Die Preisgeschichte der Flash-Linie als eigener Schritt dokumentiert wird.
  • Die stillgelegten IDs noch aufgelöst werden und das Redirect-Verhalten verifiziert sein soll.

Unsere Empfehlung

V4.1 Flash ist die einzige aktuelle Eintrag der Flash-Linie: gleiches Context, etwa ein Drittel des Preises, natives Vision in einer ID, stabiler Name. V4 Flash bleibt als August-Preisblatt hinter dem Redirect und als historischer Snapshot für reproduzierbare Evaluationen bestehen. Entscheidungsregel: Stufen getrennt rechnen (Peak 01:00–04:00 und 06:00–10:00 UTC, sonst halber Preis), das deepseek-flash-Pinning für sich arbeiten lassen und auf dem neuen Preisblatt budgetieren — die alten Pro-Annahmen gelten seit dem 14.09.2026 nicht mehr.

Häufig gestellte Fragen

Häufige Fragen zu diesem Vergleich beantwortet.

Gleiche Context-Größe (1M Tokens, 384K max. Output), aber V4.1 Flash bringt das günstigere Preisblatt (Cache-Miss 0,15 $, Output 0,60 $ off-peak), natives Bildverständnis in einer ID und den Status eines stabilen, offiziellen Modellnamens. V4 Flash war der temporäre August-Build und läuft heute nur noch als Redirect.
Mit dem Release von V4.1 Flash am 10.09.2026, 04:00 UTC, wurde deepseek-flash der Modellname in der API. Seit dem 14.09.2026 (04:00 UTC) läuft jeder Request auf deepseek-v4-pro automatisch über das V4.1-Flash-Preisblatt.
Peak ist Montag bis Freitag, 01:00–04:00 und 06:00–10:00 UTC. Alle anderen Stunden sind Off-Peak und kosten exakt die Hälfte. Der einfache Hebel: Batch-Jobs in die Off-Peak-Fenster schieben, nur latenzkritische Calls im Peak lassen.
Meist nicht. Ein Pinned deepseek-flash erfasst die Ersparnis automatisch. Zwei Checks lohnen: ob alte Pro-Kostenannahmen noch hartcodiert sind, und ob die Modellliste noch deepseek-v4-flash oder deepseek-v4-flash-vision-exp nennt — beide IDs leiten auf deepseek-flash um, die Liste zeigt also eine Zeile weniger.

Brauchen Sie Hilfe bei der Entscheidung?

Buchen Sie ein kostenloses 30-minütiges Beratungsgespräch und wir helfen Ihnen, den besten Ansatz für Ihr Projekt zu bestimmen.

Kostenlose Beratung
Unverbindlich
Antwort innerhalb von 24h